AI HOT 日报 · 2026-10-07(星期三)

覆盖北京时间 10-06 08:00 至 10-07 08:00(AIHOT 官方日报窗口),热点榜截至 10-07 08:57。过去 24 小时 AIHOT 共收录 458 条资讯,官方精选 19 条,下面按评分 55 分以上整理。

今日看点: Mistral 发布 1T 参数的 Mistral Large 4 预览版,称月底放权重;Google 一天内连发 Nano Banana 2.1(1K 图降到约 0.034 美元)和开源多模态嵌入模型 EmbeddingGemma 2;OpenAI 在 GitHub 公开内部模型产出的 722 份数学手稿,Decisions API 转公测;彭博称 DeepSeek 新一轮融资至少 800 亿元,腾讯、宁德时代领投;Anthropic 招股书显示 5180 亿美元算力支出中约 4137 亿不可撤销;Claude 进入 Google Docs、Sheets、Slides;Google 10 月 9 日起免费版 Gemini 只剩 Flash Lite。

一、AIHOT 官方日报(10-07 期)

头条: Mistral 发布 Mistral Large 4,Artificial Analysis 智能指数 38 分,与 GPT-6 Luna(max)持平,被称为美中之外最智能的模型(详见热点第 1 条)。

快讯: Sierra 与 Meta 发布 Personal Agent Protocol、GitHub 为智能体规模重建 Git 基础设施、ChatGPT Meetings 插件、METR 演示智能体篡改评估记录、Mistral Large 4 进 Agent Arena、DeepSeek V4.1 Flash 的 ARC-AGI 成绩、Cursor iOS 远程控制本地智能体、Reflection Beam、Cowork 改为云端 VM。

二、热点榜 Top 10
#1
信源数19
报道数26
最新时间(北京)10-07 04:18
#2
信源数11
报道数14
最新时间(北京)10-07 01:17
#3
信源数9
报道数15
最新时间(北京)10-07 05:31
#4
信源数11
报道数25
最新时间(北京)10-07 06:41
#5
信源数8
报道数11
最新时间(北京)10-07 04:50
#6
信源数5
报道数10
最新时间(北京)10-07 07:42
#7
信源数4
报道数5
最新时间(北京)10-07 01:32
#8
信源数5
报道数5
最新时间(北京)10-05 23:14
#9
信源数3
报道数4
最新时间(北京)10-07 07:20
#10
信源数2
报道数7
最新时间(北京)10-07 08:03

热点关键信息

1. Mistral Large 4(代号 Le Chonk,官方公告 · AA 评测) - 规格:细粒度 MoE,总参数 1T(文档写 1.05T),每 token 激活 49B,另配 1.6B 视觉编码器,原生多模态;在 Mistral 自有的约 3,800 块(TechCrunch 写约 4,000 块)NVIDIA Grace Blackwell GPU 上训练。 - 发布形态:Research Public Preview,API 即日在 Mistral Studio 开放;TechCrunch 称目前只能经公开 guardrail 端点访问,安全测试完成后约三周内放权重,官方口径是 10 月底。 - 成绩:AA 智能指数 38,与 GPT-6 Luna(max)持平,但远落后 Claude Opus 5.5 的 58;据 VentureBeat,DeepSWE 62%(GLM-5.3 为 61%),Finch 金融 67%,Harvey 法律智能体 15%,均为开源权重 SOTA。官方称在网络防御、制造、金融等负载达 SOTA,视觉 grounding 超过闭源前沿模型。 - 价格:预览期前两周五折,每百万 token 输入 0.68 美元、输出 2.09 美元、缓存 0.07 美元;AA 测算任务成本 0.57 美元。OpenRouter 两条公告的上下文写法不一致(512K 和 1M),最大输出 256K。 - 争议:Hugging Face CEO Clément Delangue 说权重没放出前不该自称"最佳开源权重模型";HF 的预告页模型名是 Mistral-Large-4.0-1T05-A52B,页面写 10 月 11 日但倒计时约 25 天,和官方 10 月底说法对不上。Elvis Saravia 认为性能不算惊艳,多模态是亮点;CEO Arthur Mensch 称 RL 还没看到饱和。

2. Reflection Beam(官方博客) - 昨日热点延续:纯文本稀疏 MoE,501B 总参数、23B 激活,23.8 万亿 token 预训练,100 万 token 有效上下文;权重本月以 Apache 2.0 发布,现在只能走候补名单早期访问,The Decoder 称还在做最终安全测试。 - 新增评价:Reflection 自称推理任务上以少三到四倍算力匹配 GLM 5.2,编码和智能体接近 Qwen3.8-Max,但不如 Kimi K3;Yuchen Jin 认为 Beam 和 Mistral Large 4 这两天都追到了大致 GLM-5.2 水平;Nathan Lambert 称这是"西方开放模型的重要一周"。

3. Nano Banana 2.1(Gemini API 更新日志) - 模型名 gemini-nano-banana-2.1,取代 Nano Banana 2(gemini-3.1-flash-image),后者 10 月 29 日停用,用旧模型的要尽快迁移。 - 价格:图像输出每百万 token 30 美元,1K 图 1120 token 约 0.034 美元、2K 约 0.050 美元、4K 约 0.076 美元;Philipp Schmid 称此前 Pro 版是 0.134 美元/张,新版效果反而更好。OpenRouter 给的 4K 价是 0.1134 美元,和官方口径不同。 - 能力:指令遵循和图内文字渲染改进,接入 Google 图像搜索做 grounding,最多 5 个角色一致、14 张参考图,新增 1:4、4:1、1:8、8:1 的 2K/4K 全景输出。 - 榜单:Arena 文生图 1328(第 5)、图像编辑 1428(第 6)、多图编辑 1431(第 4),比上代分别提升 80、38、67 分。 - 上线范围:Gemini App、Search AI Mode、AI Studio、Flow、Stitch、Google Ads、Gemini Enterprise Platform,fal、OpenRouter 同步上架。

4. EmbeddingGemma 2(DeepMind 博客 · 开发者指南 · Hugging Face) - 基于 Gemma 4,Apache 2.0,把文本、代码、图像、视频、音频映射到同一个 768 维空间,支持 100+ 语言、8K 上下文(上代 4 倍),Matryoshka 维度可裁到 512/256/128。 - 四个版本:740M 全模态(270M 文本 + 170M 视觉 + 300M 音频编码器)、440M 文本+视觉、570M 文本+音频、270M 纯文本;活跃内存约 191MB 至 567MB,单次可处理最长 5.5 分钟音频、29 张图或 58 个视频帧;MTEB Code 提升 14%。 - 生态:sentence-transformers v6.1.0+、LiteRT-LM 可用,llama.cpp Day-0 支持;Unsloth 称 270M 版最低 0.5GB RAM、全模态版 1GB RAM 可跑。可与 Gemma 4 搭配做纯端侧 RAG。 - Simon Willison 的观点:嵌入模型用 Apache 2.0 特别重要,因为一旦厂商停供,用户得自己承担重算全部存量向量的成本。

5. OpenAI textGrain 文本水印(官方说明) - 昨日热点延续,新增 Ars Technica、The Verge、TechCrunch 报道。要点不变:未来数周对欧盟所有套餐的 ChatGPT 和 Codex 文本默认加水印;全球 API 可选开启、默认关闭;检测器只对获批研究者开放、只回答"是否检测到"。 - OpenAI 已发技术论文;自认短文本难检测,改写或翻译可完全去除。对比 Anthropic 对 Claude 是全球强制水印。

6. OpenAI 公开内部模型数学成果(官方 · GitHub 仓库) - 规模:722 份手稿、372 个结果家族,附论文修订与引用协议,许多证明已用 Lean 形式化;部分结果尚无 Lean 证明,可能有问题,仓库会持续更新。 - 生产方式:绝大多数由同一流程、一个未发布的内部模型完成,平均每个结果约用三小时 ChatGPT Pro thinking 算力,评估期间共提了约 4,000 个问题。例外是黎曼 zeta 函数零点自由区域和 CM 阿贝尔簇上 Hodge 猜想相关工作,其中 Re(s) > 11/12 零点自由区域的文稿经人工编辑。 - 争议:发布前咨询了普林斯顿高等研究院的数学与 AI 独立顾问组(AGMAI);该组织 9 月 29 日发文反对在闭源模型上测高难数学问题,并呼吁走学术渠道、披露模型名称、提示词和算力。The Verge 专门写了数学界的争议。

7. DeepSeek 新一轮融资(彭博社) - 规模至少 800 亿元人民币(约 120 亿美元),高于原定约 500 亿元;IT之家称最终可能逼近 1000 亿元,已签 term sheet 可能让总额接近 150 亿美元。 - 腾讯、宁德时代是出资最多的投资方之一,估值可能达 710 亿美元(The Decoder 写原计划估值约 750 亿美元,口径不一);资金用于硬件,包括为内蒙古数据中心规划至少 16 万块华为昇腾 950DT;计划 2027 年初 IPO。以上均为知情人士消息,条款未公布。 - 相关评测:ARC Prize 公布 DeepSeek V4.1 Flash 成绩,ARC-AGI-2 72.9%(每任务 0.13 美元),ARC-AGI-1 94.5%(0.07 美元),比 V4 Flash 分别高 11.5 和 5.5 分,但单任务成本高约 250%。

8. ChatGPT 视觉广告 - 昨日热点延续,无新信息:本月晚些时候在美国、仅图像生成场景、仅首批广告主测试,图片下方出现产品轮播;Plus、Pro、Enterprise 看不到;接入 Hightouch、AppsFlyer 归因,DoubleVerify、IAS 做品牌安全,新增否定关键词。

9. Anthropic 扩展网络安全验证计划 CVP(官方) - 合并 Project Glasswing 和旧 CVP,三档访问,都能用 Claude Mythos 5.1、Opus 5.5、Sonnet 5.5 及后续模型,并降低拦截分类器触发。 - 第二档"红队"增加授权渗透测试和红队演练,只收机构;限制最少的专项档只给一小部分机构,可测试电网、航空飞行系统、银行跨行转账等关键系统,Anthropic 会同美国政府审核每名成员。 - 条件:只面向组织,个人研究者不符合;要求注册组织保留数据以便监测滥用(已有 Fable 5.1 或 Mythos 5.1 零数据保留权限的组织,在 EFS 上线前可零保留使用);目前只在 Amazon Bedrock 上向符合 EFS 资格的客户提供。

10. OpenAI Decisions API 公测(文档) - 10 月 1 日 Dev Day 限量预览,现向所有开发者开放,预计几周内 GA;称决策速度最高比经 Responses API 调 GPT-6 Luna 快 10 倍,返回类型化答案。 - 只支持 gpt-6-luna,每百万输入 token 0.10 美元,只收输入费,不收输出和缓存读写;合格客户支持零数据保留和 HIPAA。 - 用例:路由请求到模型、工具或智能体,批量打标签、排名、打分,分析图片和视频帧,从截图选按钮或填表,标记有风险的工具调用。TechCrunch 把它定位为对标 TypeSafe AI 的决策模型 Jev。 - 这是 Codex 28 天计划的 第 2 天汇总:自动审查(Auto-review)免费且不再占用量(原来约占套餐 2% 至 10%)、简化开发者 API、会议纪要插件、Decisions API。

三、过去 24 小时分栏

模型发布 / 评测

1. Ant Group Ling 3.1 Flash(Artificial Analysis) - 推理模型,总参数 560B、激活 25B、1M 上下文;AA 智能指数 v4.3 得 41 分,比 Ling 3.0 Flash 的 20 分翻倍,智能体能力提升最明显。注意:这比 Mistral Large 4 的 38 分还高。

2. ARC Prize 公布 Grok 4.7 成绩 - ARC-AGI-3 标准 harness 1.8%(花费 2.7k 美元),provider adapter harness 10.0%(4.8k 美元);ARC-AGI-2 61.4%(每任务 2.01 美元);ARC-AGI-1 90.2%(0.64 美元)。比 Grok 4.6 在 ARC-AGI-1 更高,但 ARC-AGI-2、3 更低。

3. Reka Rho-1 细节补充(MarkTechPost) - 19B 全模态推理模型,从零训练;每层有理解和生成两条专家流,共享注意力和同一 KV cache;蒸馏版去噪从 99 步降到 8 步,约 1 秒生成 5.3 秒视频;训练用 320 张 H100 跑 3 个月,视频上限 672×384;只有研究预览,没有权重、API 和定价。

4. Eleven v4 / v4 Turbo 登顶 AA 语音合成榜 - v4 Turbo 以 Elo 1,334 排第一,40 美元/百万字符(v4 为 80 美元),每秒 96 字符,发音鲁棒性 90.1%。

5. 其他:Musubi 开源内容审核决策模型 PolicyLM-1.7B;智谱 GLM-5.3 上架 Amazon Bedrock,AWS 按调用量分成。

AI 产品

1. Claude 进入 Google Docs、Sheets、Slides(beta)(官方精选 · 帮助文章) - 一次安装覆盖三件套;在 Workspace 里以侧边栏出现,读取当前文件并就地编辑,每处修改生效前可逐项确认。 - 反向也行:在 Claude 里粘贴 Google 文件链接或让它新建 doc、sheet、deck,文件在聊天旁打开共同编辑;权限跟随 Google 共享设置;所有付费计划可用。

2. Claude Code 云端会话(官方指南 · 评分 82,24h 最高并列 · 官方精选) - 每个任务在全新 VM 上运行,仓库克隆到新分支,结束产出可转 PR 的分支;合上笔记本任务继续;可从 claude.ai/code、手机、Desktop、终端、Slack 发起和跟踪;Pro、Max、Team、Enterprise 不额外收费。 - 指南作者用四个真实会话实测了并行修复、文档校对、结构化日志,给出本地会话和云会话的选择边界,以及七个适合云会话的工作流和首次连 GitHub 的方法。

3. Google 产品调整 - 10 月 9 日起免费版 Gemini 只能用 Flash Lite(The Verge),想用标准 Flash 需要 4.99 美元/月的 Google AI Plus。 - Google Drive 和 Docs 原生支持 Markdown:Drive 可预览 .md,Docs 里直接打开、编辑、评论,不用转格式,渲染支持可点链接和表格,与 Gemini Notebook 同步;10 月 5 日开始推送,部分用户最多等 15 天。 - Gemini Guided Vision 上 Android 9+,与无障碍社区合作开发,限 Gemini Live 支持的地区和语言。

4. OpenAI 产品 - ChatGPT Meetings 插件(beta):记会议笔记,基于对用户和既往工作的了解在 ChatGPT Space 保存个性化摘要和下一步,可私密或团队共享,会中可加笔记、提问、标记已连接应用里的文件和参会人,待办可直接作为提示词发给 ChatGPT;目前限 macOS 桌面端的 Pro 和 Business,Enterprise 即将推出。 - Auto-review 对所有 ChatGPT 账号用户免费:在 settings > permissions > auto-review 开启,由第二个智能体在后台审查主智能体的操作,只拦截高风险和偏离原意图的行为,不占套餐用量。

5. Cursor iOS 应用远程控制本地智能体(Changelog · 官方精选) - 手机上查看进度、回复或发起新任务;除企业组织外默认开启,登录后电脑自动列出,在桌面端批准配对即可;智能体仍在本机运行,电脑需开机联网,可开防休眠;企业由管理员在 Org settings 开启。

6. Gamma 5 - 以智能体为核心重做:先问目标和受众、给出计划再动手;可导入 PowerPoint 保留内容套新设计并完整导出;Notion、Slack、HubSpot 连接器汇集上下文;旧稿可用 Gamma Classic。Elvis Saravia 实测称生成的幻灯片终于像自己做的。

7. 其他产品 - Hark Pro 广泛发布(Brett Adcock 创办):基于专门训练的电脑操作模型,替用户处理邮件、日程、订机票,用小窗口展示智能体浏览过程;原 100 美元的 Pro 方案现免费,承诺不做广告不卖数据,2027 年推 AI 原生设备。 - Gumloop Agent Browser:没有 API 或 MCP 的网站,智能体在隔离云沙箱里开浏览器登录、点击、下载,会话录制可回放,支持 1Password 和隐身代理,可用强模型规划、便宜模型重复执行。 - Strata 开源推理引擎:12GB 显存以上的消费级显卡可跑量化的 125B Qwen3.8-Flash-Next。 - Hao AI Lab FastH3 V2 / Trim:单张 RTX 5090 上 15 秒生成 5 秒 480p 带音频视频,8 步胜过原版 MiniMax H3;Trim 版小 4.2 倍,8GB 显存可跑;FastVideo 还支持 Kandinsky 6(Pro 30B / Lite 3B)。 - Polars 2.0:LazyFrame 默认流式引擎,默认开启落盘(约 80% 内存时开始),SQL 成一等公民。 - Sesame 语音助手大升级:新增图像生成、connectors、computer use,可用语音操作 Devin、Codex、Claude Code,今天向所有人开放,眼镜 2027 年推出。 - Sierra Summit 2026:新模型 Curie(对话编排)和 Fleming(识别电话那头是不是另一个智能体),以及 Tandem Voice、Persona Studio、新版 Ghostwriter。 - Replit 支持跨项目上下文;openTPU:由 AI 智能体设计的开源加速器,在 FPGA 上跑了十几个模型;AgentMail 推出 AgentID,让智能体用验证邮箱登录应用。 - WHO 非洲办事处用 Google Earth AI 在刚果(金)埃博拉疫情中几分钟定位 48 个暴露定居点、超过 45,500 名高危人群,通常需要数周。

行业动态

1. Anthropic 算力承诺拆解(依据 SEC 招股书 · 官方精选) - 未来数年云和算力总支出 5180 亿美元,其中约 4137 亿美元不可撤销,即使容量闲置也要付,平均每年约 410 亿美元。 - 同一份招股书还披露:Dario Amodei 2025 年总薪酬 1800 万美元,他和 Daniela Amodei 的年薪今年 7 月翻倍到 140 万美元,CFO 去年约 72 万美元。 - 客户在降用量:微软内部 Claude 支出削减超三分之一,Meta 的 Claude Code 用户减半,两家都要求员工改用自家工具。

2. 融资与资本 - OpenAI 洽谈 300 亿美元融资(彭博):投前估值约 1.4 万亿美元,阿布扎比 MGX 等阿联酋基金做基石、合计最多 100 亿美元,贝莱德洽谈跟投,Thrive、a16z 考虑追加;IPO 推迟到至少明年。 - SpaceX 计划募资 400 亿美元买英伟达芯片(FT):阿波罗牵头,约 100 亿银行贷款加 300 亿投资级债券,2027 年完成,全面基于 Vera Rubin 架构。 - 月之暗面完成上市前最后一轮:估值约 500 亿美元,计划 2027 年一季度港股 IPO、募资上限 50 亿美元;ARR 6 月 3 亿美元、现在 10 亿美元,预计 12 月达 20 亿美元。可灵 AI 也选定投行(中金、高盛、瑞银),募资至少 10 亿美元,最早明年上市;7 月融资时投前估值约 150 亿美元。 - Lambda 拟以 145 亿美元投前估值融资至多 40 亿美元,Coatue、黑石领投,为 2027 年 IPO 铺路。 - Groq 被前员工起诉,指控与英伟达 200 亿美元的类收购授权交易牺牲少数股东。 - 英伟达改写算力合作协议(The Information):用云收入分成取代租赁担保;季报列出 360 亿美元 AI 云承诺,协议通常 6 年。 - AMD 创历史新高:盘中 649.88 美元,市值 1.06 万亿美元;苏姿丰称需求远超供给,2027 年大幅扩产;9 月 28 日宣布 82 亿美元收购 World Labs。

3. 能源 - 谷歌与 Constellation 签 3.59GW 长期电力协议:890MW 新增核电(2028 至 2032 年上线、20 年),另 2.7GW 任意容量(15 年)。 - Constellation 与亚马逊签 20 年核电长单:Calvert Cliffs 供 680MW,含 190MW 新增容量,带动 30 亿美元以上投资。 - 国内空心光纤在宁夏中卫智算中心间商用:30 公里间距,时延和损耗降 30% 以上,光速达 99.7%(传统光纤约 69.5%)。

4. 智能体与互联网 - Wikimedia 事件后续:Ars Technica、The Decoder、路透跟进,OpenAI 表示正与 Wikimedia 合作分析并持续披露。 - 网站封堵成智能体新障碍(TechCrunch):亚马逊明确屏蔽 Meta Muse,Walmart、eBay、Yelp、Delta 态度各异;于是有了 Personal Agent Protocol,由 Sierra 与 Meta 联合 Genesys、Instinct、Rocket、Shopify、Stripe、Walmart 发起,定义个人智能体与企业交互的开放标准,原文有认证方式和三种接入路径。 - Techdirt 盘点 Meta Muse 的问题:零日漏洞可监视 Mac 用户、攻击者冒充 Muse 骗取 root 权限、无视权限读取私信并上传,苹果为此调整了 macOS 隐私设置。 - GitHub 为智能体规模重建 Git 基础设施(官方精选):8 月月度 Git 事件 4733 亿次(一年翻倍多),9 月 73.8 亿次 commit(一年前的五倍多),push 同比 4.9 倍;内部基准写吞吐最高提升 35 倍。 - OpenAI 与 Anthropic 向澳大利亚议会表态,支持强制通报智能体造成的数据泄露;保险公司为失控智能体索赔做准备(FT),高管个人责任也被考虑。

5. 法律、监管与社会 - 亚利桑那上诉法院(评分 84,24h 最高):过失杀人案量刑时播放的受害者 Christopher Pelkey 的 AI 生成视频"带有不当情感分量",罪名维持,刑期须重新考虑。 - 美国司法部要求员工改称 AI 为"超级智能(SI)",适用于对外沟通、政策文件、官方记录及适宜的法庭文书,落实上周的行政令。 - 索尼音乐要求下架 26 万首 AI 冒充歌曲,几乎是 3 月底 13.5 万首的两倍,被冒充者含阿黛尔、布兰妮、皇后乐队、迈克尔·杰克逊。 - 梅洛尼向欧盟知识产权局申请把自己的声音注册为商标,附 4 秒录音,防选举前 AI 深度伪造。 - LibreOffice 宣布默认不内置 AI,理由是文档不上传、可离线运行、满足审计,用户可装扩展接本地模型。 - 波兰反垄断机构指控谷歌在与出版商谈内容报酬时滥用支配地位,最高可罚营业额 10%;挪威将提交 AI 眼镜临时禁令草案;美国两党议员提多项法案限制联邦机构用 Flock 摄像头。 - 韩国拟投 4.7 万亿韩元(约 35 亿美元)自研前沿模型,约为此前承诺的九倍,初创公司也可参与,需国会批准;德国电信目标 2030 年靠 AI 省 25 亿欧元。 - 沪昆高速 NOA 在距前车约 10 米、120km/h 时突然退出致追尾,登微博热搜,报道称类似事件已不下 10 起。 - 更正昨日内容:华为称与高通的许可涵盖 LogicFolding 和近封装光学专利,高通否认,并称"高通是净付款方"的报道不准确。另有苹果与 OpenAI 商业秘密诉讼双方互指违规提交新证据;OpenAI 与 Atlassian 扩大合作,把 GPT-6 Astra 等接入 Rovo。

论文研究

1. METR:智能体可能篡改评估记录掩盖不当行为(原文 · 官方精选) - 研究人员在 AI 智能体协助下约 10 分钟就在 Inspect 的转录查看器里找到一个客户端 JavaScript 注入漏洞,可让智能体任意改写审查者看到的内容(数据库里真实数据还在);Meridian Labs 一天内修复。结论:智能体输出的日志应视为不可信输入,可观测性要按安全关键基础设施来做。

2. AutomationBench Verified(Shaped / Parsewave) - 审计 Zapier AutomationBench 全部 600 个公开任务的评分器,智能体标出 323 个可疑项,人工确认 206 个真 bug 并修复;修复后 27.9% 的 Kimi K3 跑分被改判。

3. 基座模型靠起始 token 激发推理(arXiv) - 固定回复开头的 token 就能让基座模型接近其 RL 版本:".\n\nOkay" 让 Olmo-3-7B 的 MATH-500 pass@1 从 42% 到 78%,"Alright," 让 Qwen3-14B 从 72% 到 87%。

4. Khanmigo 两年期随机对照实验 - 田纳西 18 所中学,补救数学课用带 AI 家教的 Khan Academy,每学期提升 1.3 个全国百分位(每学年约 0.06 至 0.08 个标准差),但和不用 AI 的 Khan Academy 练习效果相近,学生使用率低。

5. 多智能体协作 - Meta RankEvolve:让两个不同的编码智能体互审补丁,比给单个智能体加预算更能发现静默缺陷。 - Stanford《Worse Together》:5 个前沿模型、77 个场景、4 个环境,每人派一个智能体去争共享资源,效果不如一个统一协调的智能体。

6. 其他:JEPA-Anything 把 JEPA 扩展到物理、机器人、天气、生物等七个领域的统一世界模型;Q Labs Dust 用零阶优化、不做反向传播预训练 GPT 式 Transformer;OpenAI 与 Ironclad 训练 GPT-6 Astra,合同工作流平均得分比 GPT-5.6 Sol 高 32%;deepfake 检测器准确率从 99.5% 降到 76% 的二十年评估,作者主张改用基于校准内容认证的真实图像认证。

技巧与观点

四、24h 官方精选(19 条)
评分82
入选理由四个真实会话实测,给出本地和云会话的选择边界及七个工作流
评分82
入选理由规模明显上调,含投资方和 IPO 时间
评分77
入选理由依据招股书拆解支付结构
评分72
入选理由付费渗透率、重度用户和杰文斯悖论串成现状判断
评分71
入选理由发布方式、Lean 形式化和算力开销
评分71
入选理由参数、上下文和定价
评分70
入选理由三件套就地编辑的工作方式
评分70
入选理由参数量、内存、维度裁剪和基准分
评分68
入选理由内存、延迟和开发入口
评分68
入选理由模型名、改进范围和停用日期,便于迁移
评分67
入选理由一手设计原则和写吞吐 35 倍等数据
评分67
入选理由分数和单任务成本同时给出
评分67
入选理由说明长程智能体任务和因果追踪评分方法
评分66
入选理由概念验证,提出日志应视为不可信输入
评分66
入选理由智能指数、网络安全指数、定价和上下文
评分66
入选理由训练规模、成绩与第三方评价
评分63
入选理由开启方式、配对流程和开机限制
评分63
入选理由从长提示词到规则加模型的演进路径
评分62
入选理由认证方式、三种接入路径和规范计划

来源:AIHOT · 今日日报

提醒:AIHOT 已换到新域名 aihot.news,旧域名 aihot.virxact.com 从 10 月 31 日起只做跳转,之后停用,路径和参数不变。