AI HOT 日报 · 2026-10-07(星期三)
覆盖北京时间 10-06 08:00 至 10-07 08:00(AIHOT 官方日报窗口),热点榜截至 10-07 08:57。过去 24 小时 AIHOT 共收录 458 条资讯,官方精选 19 条,下面按评分 55 分以上整理。
今日看点: Mistral 发布 1T 参数的 Mistral Large 4 预览版,称月底放权重;Google 一天内连发 Nano Banana 2.1(1K 图降到约 0.034 美元)和开源多模态嵌入模型 EmbeddingGemma 2;OpenAI 在 GitHub 公开内部模型产出的 722 份数学手稿,Decisions API 转公测;彭博称 DeepSeek 新一轮融资至少 800 亿元,腾讯、宁德时代领投;Anthropic 招股书显示 5180 亿美元算力支出中约 4137 亿不可撤销;Claude 进入 Google Docs、Sheets、Slides;Google 10 月 9 日起免费版 Gemini 只剩 Flash Lite。
一、AIHOT 官方日报(10-07 期)
头条: Mistral 发布 Mistral Large 4,Artificial Analysis 智能指数 38 分,与 GPT-6 Luna(max)持平,被称为美中之外最智能的模型(详见热点第 1 条)。
快讯: Sierra 与 Meta 发布 Personal Agent Protocol、GitHub 为智能体规模重建 Git 基础设施、ChatGPT Meetings 插件、METR 演示智能体篡改评估记录、Mistral Large 4 进 Agent Arena、DeepSeek V4.1 Flash 的 ARC-AGI 成绩、Cursor iOS 远程控制本地智能体、Reflection Beam、Cowork 改为云端 VM。
二、热点榜 Top 10
热点关键信息
1. Mistral Large 4(代号 Le Chonk,官方公告 · AA 评测) - 规格:细粒度 MoE,总参数 1T(文档写 1.05T),每 token 激活 49B,另配 1.6B 视觉编码器,原生多模态;在 Mistral 自有的约 3,800 块(TechCrunch 写约 4,000 块)NVIDIA Grace Blackwell GPU 上训练。 - 发布形态:Research Public Preview,API 即日在 Mistral Studio 开放;TechCrunch 称目前只能经公开 guardrail 端点访问,安全测试完成后约三周内放权重,官方口径是 10 月底。 - 成绩:AA 智能指数 38,与 GPT-6 Luna(max)持平,但远落后 Claude Opus 5.5 的 58;据 VentureBeat,DeepSWE 62%(GLM-5.3 为 61%),Finch 金融 67%,Harvey 法律智能体 15%,均为开源权重 SOTA。官方称在网络防御、制造、金融等负载达 SOTA,视觉 grounding 超过闭源前沿模型。 - 价格:预览期前两周五折,每百万 token 输入 0.68 美元、输出 2.09 美元、缓存 0.07 美元;AA 测算任务成本 0.57 美元。OpenRouter 两条公告的上下文写法不一致(512K 和 1M),最大输出 256K。 - 争议:Hugging Face CEO Clément Delangue 说权重没放出前不该自称"最佳开源权重模型";HF 的预告页模型名是 Mistral-Large-4.0-1T05-A52B,页面写 10 月 11 日但倒计时约 25 天,和官方 10 月底说法对不上。Elvis Saravia 认为性能不算惊艳,多模态是亮点;CEO Arthur Mensch 称 RL 还没看到饱和。
2. Reflection Beam(官方博客) - 昨日热点延续:纯文本稀疏 MoE,501B 总参数、23B 激活,23.8 万亿 token 预训练,100 万 token 有效上下文;权重本月以 Apache 2.0 发布,现在只能走候补名单早期访问,The Decoder 称还在做最终安全测试。 - 新增评价:Reflection 自称推理任务上以少三到四倍算力匹配 GLM 5.2,编码和智能体接近 Qwen3.8-Max,但不如 Kimi K3;Yuchen Jin 认为 Beam 和 Mistral Large 4 这两天都追到了大致 GLM-5.2 水平;Nathan Lambert 称这是"西方开放模型的重要一周"。
3. Nano Banana 2.1(Gemini API 更新日志)
- 模型名 gemini-nano-banana-2.1,取代 Nano Banana 2(gemini-3.1-flash-image),后者 10 月 29 日停用,用旧模型的要尽快迁移。
- 价格:图像输出每百万 token 30 美元,1K 图 1120 token 约 0.034 美元、2K 约 0.050 美元、4K 约 0.076 美元;Philipp Schmid 称此前 Pro 版是 0.134 美元/张,新版效果反而更好。OpenRouter 给的 4K 价是 0.1134 美元,和官方口径不同。
- 能力:指令遵循和图内文字渲染改进,接入 Google 图像搜索做 grounding,最多 5 个角色一致、14 张参考图,新增 1:4、4:1、1:8、8:1 的 2K/4K 全景输出。
- 榜单:Arena 文生图 1328(第 5)、图像编辑 1428(第 6)、多图编辑 1431(第 4),比上代分别提升 80、38、67 分。
- 上线范围:Gemini App、Search AI Mode、AI Studio、Flow、Stitch、Google Ads、Gemini Enterprise Platform,fal、OpenRouter 同步上架。
4. EmbeddingGemma 2(DeepMind 博客 · 开发者指南 · Hugging Face) - 基于 Gemma 4,Apache 2.0,把文本、代码、图像、视频、音频映射到同一个 768 维空间,支持 100+ 语言、8K 上下文(上代 4 倍),Matryoshka 维度可裁到 512/256/128。 - 四个版本:740M 全模态(270M 文本 + 170M 视觉 + 300M 音频编码器)、440M 文本+视觉、570M 文本+音频、270M 纯文本;活跃内存约 191MB 至 567MB,单次可处理最长 5.5 分钟音频、29 张图或 58 个视频帧;MTEB Code 提升 14%。 - 生态:sentence-transformers v6.1.0+、LiteRT-LM 可用,llama.cpp Day-0 支持;Unsloth 称 270M 版最低 0.5GB RAM、全模态版 1GB RAM 可跑。可与 Gemma 4 搭配做纯端侧 RAG。 - Simon Willison 的观点:嵌入模型用 Apache 2.0 特别重要,因为一旦厂商停供,用户得自己承担重算全部存量向量的成本。
5. OpenAI textGrain 文本水印(官方说明) - 昨日热点延续,新增 Ars Technica、The Verge、TechCrunch 报道。要点不变:未来数周对欧盟所有套餐的 ChatGPT 和 Codex 文本默认加水印;全球 API 可选开启、默认关闭;检测器只对获批研究者开放、只回答"是否检测到"。 - OpenAI 已发技术论文;自认短文本难检测,改写或翻译可完全去除。对比 Anthropic 对 Claude 是全球强制水印。
6. OpenAI 公开内部模型数学成果(官方 · GitHub 仓库) - 规模:722 份手稿、372 个结果家族,附论文修订与引用协议,许多证明已用 Lean 形式化;部分结果尚无 Lean 证明,可能有问题,仓库会持续更新。 - 生产方式:绝大多数由同一流程、一个未发布的内部模型完成,平均每个结果约用三小时 ChatGPT Pro thinking 算力,评估期间共提了约 4,000 个问题。例外是黎曼 zeta 函数零点自由区域和 CM 阿贝尔簇上 Hodge 猜想相关工作,其中 Re(s) > 11/12 零点自由区域的文稿经人工编辑。 - 争议:发布前咨询了普林斯顿高等研究院的数学与 AI 独立顾问组(AGMAI);该组织 9 月 29 日发文反对在闭源模型上测高难数学问题,并呼吁走学术渠道、披露模型名称、提示词和算力。The Verge 专门写了数学界的争议。
7. DeepSeek 新一轮融资(彭博社) - 规模至少 800 亿元人民币(约 120 亿美元),高于原定约 500 亿元;IT之家称最终可能逼近 1000 亿元,已签 term sheet 可能让总额接近 150 亿美元。 - 腾讯、宁德时代是出资最多的投资方之一,估值可能达 710 亿美元(The Decoder 写原计划估值约 750 亿美元,口径不一);资金用于硬件,包括为内蒙古数据中心规划至少 16 万块华为昇腾 950DT;计划 2027 年初 IPO。以上均为知情人士消息,条款未公布。 - 相关评测:ARC Prize 公布 DeepSeek V4.1 Flash 成绩,ARC-AGI-2 72.9%(每任务 0.13 美元),ARC-AGI-1 94.5%(0.07 美元),比 V4 Flash 分别高 11.5 和 5.5 分,但单任务成本高约 250%。
8. ChatGPT 视觉广告 - 昨日热点延续,无新信息:本月晚些时候在美国、仅图像生成场景、仅首批广告主测试,图片下方出现产品轮播;Plus、Pro、Enterprise 看不到;接入 Hightouch、AppsFlyer 归因,DoubleVerify、IAS 做品牌安全,新增否定关键词。
9. Anthropic 扩展网络安全验证计划 CVP(官方) - 合并 Project Glasswing 和旧 CVP,三档访问,都能用 Claude Mythos 5.1、Opus 5.5、Sonnet 5.5 及后续模型,并降低拦截分类器触发。 - 第二档"红队"增加授权渗透测试和红队演练,只收机构;限制最少的专项档只给一小部分机构,可测试电网、航空飞行系统、银行跨行转账等关键系统,Anthropic 会同美国政府审核每名成员。 - 条件:只面向组织,个人研究者不符合;要求注册组织保留数据以便监测滥用(已有 Fable 5.1 或 Mythos 5.1 零数据保留权限的组织,在 EFS 上线前可零保留使用);目前只在 Amazon Bedrock 上向符合 EFS 资格的客户提供。
10. OpenAI Decisions API 公测(文档)
- 10 月 1 日 Dev Day 限量预览,现向所有开发者开放,预计几周内 GA;称决策速度最高比经 Responses API 调 GPT-6 Luna 快 10 倍,返回类型化答案。
- 只支持 gpt-6-luna,每百万输入 token 0.10 美元,只收输入费,不收输出和缓存读写;合格客户支持零数据保留和 HIPAA。
- 用例:路由请求到模型、工具或智能体,批量打标签、排名、打分,分析图片和视频帧,从截图选按钮或填表,标记有风险的工具调用。TechCrunch 把它定位为对标 TypeSafe AI 的决策模型 Jev。
- 这是 Codex 28 天计划的 第 2 天汇总:自动审查(Auto-review)免费且不再占用量(原来约占套餐 2% 至 10%)、简化开发者 API、会议纪要插件、Decisions API。
三、过去 24 小时分栏
模型发布 / 评测
1. Ant Group Ling 3.1 Flash(Artificial Analysis) - 推理模型,总参数 560B、激活 25B、1M 上下文;AA 智能指数 v4.3 得 41 分,比 Ling 3.0 Flash 的 20 分翻倍,智能体能力提升最明显。注意:这比 Mistral Large 4 的 38 分还高。
2. ARC Prize 公布 Grok 4.7 成绩 - ARC-AGI-3 标准 harness 1.8%(花费 2.7k 美元),provider adapter harness 10.0%(4.8k 美元);ARC-AGI-2 61.4%(每任务 2.01 美元);ARC-AGI-1 90.2%(0.64 美元)。比 Grok 4.6 在 ARC-AGI-1 更高,但 ARC-AGI-2、3 更低。
3. Reka Rho-1 细节补充(MarkTechPost) - 19B 全模态推理模型,从零训练;每层有理解和生成两条专家流,共享注意力和同一 KV cache;蒸馏版去噪从 99 步降到 8 步,约 1 秒生成 5.3 秒视频;训练用 320 张 H100 跑 3 个月,视频上限 672×384;只有研究预览,没有权重、API 和定价。
4. Eleven v4 / v4 Turbo 登顶 AA 语音合成榜 - v4 Turbo 以 Elo 1,334 排第一,40 美元/百万字符(v4 为 80 美元),每秒 96 字符,发音鲁棒性 90.1%。
5. 其他:Musubi 开源内容审核决策模型 PolicyLM-1.7B;智谱 GLM-5.3 上架 Amazon Bedrock,AWS 按调用量分成。
AI 产品
1. Claude 进入 Google Docs、Sheets、Slides(beta)(官方精选 · 帮助文章) - 一次安装覆盖三件套;在 Workspace 里以侧边栏出现,读取当前文件并就地编辑,每处修改生效前可逐项确认。 - 反向也行:在 Claude 里粘贴 Google 文件链接或让它新建 doc、sheet、deck,文件在聊天旁打开共同编辑;权限跟随 Google 共享设置;所有付费计划可用。
2. Claude Code 云端会话(官方指南 · 评分 82,24h 最高并列 · 官方精选) - 每个任务在全新 VM 上运行,仓库克隆到新分支,结束产出可转 PR 的分支;合上笔记本任务继续;可从 claude.ai/code、手机、Desktop、终端、Slack 发起和跟踪;Pro、Max、Team、Enterprise 不额外收费。 - 指南作者用四个真实会话实测了并行修复、文档校对、结构化日志,给出本地会话和云会话的选择边界,以及七个适合云会话的工作流和首次连 GitHub 的方法。
3. Google 产品调整 - 10 月 9 日起免费版 Gemini 只能用 Flash Lite(The Verge),想用标准 Flash 需要 4.99 美元/月的 Google AI Plus。 - Google Drive 和 Docs 原生支持 Markdown:Drive 可预览 .md,Docs 里直接打开、编辑、评论,不用转格式,渲染支持可点链接和表格,与 Gemini Notebook 同步;10 月 5 日开始推送,部分用户最多等 15 天。 - Gemini Guided Vision 上 Android 9+,与无障碍社区合作开发,限 Gemini Live 支持的地区和语言。
4. OpenAI 产品 - ChatGPT Meetings 插件(beta):记会议笔记,基于对用户和既往工作的了解在 ChatGPT Space 保存个性化摘要和下一步,可私密或团队共享,会中可加笔记、提问、标记已连接应用里的文件和参会人,待办可直接作为提示词发给 ChatGPT;目前限 macOS 桌面端的 Pro 和 Business,Enterprise 即将推出。 - Auto-review 对所有 ChatGPT 账号用户免费:在 settings > permissions > auto-review 开启,由第二个智能体在后台审查主智能体的操作,只拦截高风险和偏离原意图的行为,不占套餐用量。
5. Cursor iOS 应用远程控制本地智能体(Changelog · 官方精选) - 手机上查看进度、回复或发起新任务;除企业组织外默认开启,登录后电脑自动列出,在桌面端批准配对即可;智能体仍在本机运行,电脑需开机联网,可开防休眠;企业由管理员在 Org settings 开启。
6. Gamma 5 - 以智能体为核心重做:先问目标和受众、给出计划再动手;可导入 PowerPoint 保留内容套新设计并完整导出;Notion、Slack、HubSpot 连接器汇集上下文;旧稿可用 Gamma Classic。Elvis Saravia 实测称生成的幻灯片终于像自己做的。
7. 其他产品 - Hark Pro 广泛发布(Brett Adcock 创办):基于专门训练的电脑操作模型,替用户处理邮件、日程、订机票,用小窗口展示智能体浏览过程;原 100 美元的 Pro 方案现免费,承诺不做广告不卖数据,2027 年推 AI 原生设备。 - Gumloop Agent Browser:没有 API 或 MCP 的网站,智能体在隔离云沙箱里开浏览器登录、点击、下载,会话录制可回放,支持 1Password 和隐身代理,可用强模型规划、便宜模型重复执行。 - Strata 开源推理引擎:12GB 显存以上的消费级显卡可跑量化的 125B Qwen3.8-Flash-Next。 - Hao AI Lab FastH3 V2 / Trim:单张 RTX 5090 上 15 秒生成 5 秒 480p 带音频视频,8 步胜过原版 MiniMax H3;Trim 版小 4.2 倍,8GB 显存可跑;FastVideo 还支持 Kandinsky 6(Pro 30B / Lite 3B)。 - Polars 2.0:LazyFrame 默认流式引擎,默认开启落盘(约 80% 内存时开始),SQL 成一等公民。 - Sesame 语音助手大升级:新增图像生成、connectors、computer use,可用语音操作 Devin、Codex、Claude Code,今天向所有人开放,眼镜 2027 年推出。 - Sierra Summit 2026:新模型 Curie(对话编排)和 Fleming(识别电话那头是不是另一个智能体),以及 Tandem Voice、Persona Studio、新版 Ghostwriter。 - Replit 支持跨项目上下文;openTPU:由 AI 智能体设计的开源加速器,在 FPGA 上跑了十几个模型;AgentMail 推出 AgentID,让智能体用验证邮箱登录应用。 - WHO 非洲办事处用 Google Earth AI 在刚果(金)埃博拉疫情中几分钟定位 48 个暴露定居点、超过 45,500 名高危人群,通常需要数周。
行业动态
1. Anthropic 算力承诺拆解(依据 SEC 招股书 · 官方精选) - 未来数年云和算力总支出 5180 亿美元,其中约 4137 亿美元不可撤销,即使容量闲置也要付,平均每年约 410 亿美元。 - 同一份招股书还披露:Dario Amodei 2025 年总薪酬 1800 万美元,他和 Daniela Amodei 的年薪今年 7 月翻倍到 140 万美元,CFO 去年约 72 万美元。 - 客户在降用量:微软内部 Claude 支出削减超三分之一,Meta 的 Claude Code 用户减半,两家都要求员工改用自家工具。
2. 融资与资本 - OpenAI 洽谈 300 亿美元融资(彭博):投前估值约 1.4 万亿美元,阿布扎比 MGX 等阿联酋基金做基石、合计最多 100 亿美元,贝莱德洽谈跟投,Thrive、a16z 考虑追加;IPO 推迟到至少明年。 - SpaceX 计划募资 400 亿美元买英伟达芯片(FT):阿波罗牵头,约 100 亿银行贷款加 300 亿投资级债券,2027 年完成,全面基于 Vera Rubin 架构。 - 月之暗面完成上市前最后一轮:估值约 500 亿美元,计划 2027 年一季度港股 IPO、募资上限 50 亿美元;ARR 6 月 3 亿美元、现在 10 亿美元,预计 12 月达 20 亿美元。可灵 AI 也选定投行(中金、高盛、瑞银),募资至少 10 亿美元,最早明年上市;7 月融资时投前估值约 150 亿美元。 - Lambda 拟以 145 亿美元投前估值融资至多 40 亿美元,Coatue、黑石领投,为 2027 年 IPO 铺路。 - Groq 被前员工起诉,指控与英伟达 200 亿美元的类收购授权交易牺牲少数股东。 - 英伟达改写算力合作协议(The Information):用云收入分成取代租赁担保;季报列出 360 亿美元 AI 云承诺,协议通常 6 年。 - AMD 创历史新高:盘中 649.88 美元,市值 1.06 万亿美元;苏姿丰称需求远超供给,2027 年大幅扩产;9 月 28 日宣布 82 亿美元收购 World Labs。
3. 能源 - 谷歌与 Constellation 签 3.59GW 长期电力协议:890MW 新增核电(2028 至 2032 年上线、20 年),另 2.7GW 任意容量(15 年)。 - Constellation 与亚马逊签 20 年核电长单:Calvert Cliffs 供 680MW,含 190MW 新增容量,带动 30 亿美元以上投资。 - 国内空心光纤在宁夏中卫智算中心间商用:30 公里间距,时延和损耗降 30% 以上,光速达 99.7%(传统光纤约 69.5%)。
4. 智能体与互联网 - Wikimedia 事件后续:Ars Technica、The Decoder、路透跟进,OpenAI 表示正与 Wikimedia 合作分析并持续披露。 - 网站封堵成智能体新障碍(TechCrunch):亚马逊明确屏蔽 Meta Muse,Walmart、eBay、Yelp、Delta 态度各异;于是有了 Personal Agent Protocol,由 Sierra 与 Meta 联合 Genesys、Instinct、Rocket、Shopify、Stripe、Walmart 发起,定义个人智能体与企业交互的开放标准,原文有认证方式和三种接入路径。 - Techdirt 盘点 Meta Muse 的问题:零日漏洞可监视 Mac 用户、攻击者冒充 Muse 骗取 root 权限、无视权限读取私信并上传,苹果为此调整了 macOS 隐私设置。 - GitHub 为智能体规模重建 Git 基础设施(官方精选):8 月月度 Git 事件 4733 亿次(一年翻倍多),9 月 73.8 亿次 commit(一年前的五倍多),push 同比 4.9 倍;内部基准写吞吐最高提升 35 倍。 - OpenAI 与 Anthropic 向澳大利亚议会表态,支持强制通报智能体造成的数据泄露;保险公司为失控智能体索赔做准备(FT),高管个人责任也被考虑。
5. 法律、监管与社会 - 亚利桑那上诉法院(评分 84,24h 最高):过失杀人案量刑时播放的受害者 Christopher Pelkey 的 AI 生成视频"带有不当情感分量",罪名维持,刑期须重新考虑。 - 美国司法部要求员工改称 AI 为"超级智能(SI)",适用于对外沟通、政策文件、官方记录及适宜的法庭文书,落实上周的行政令。 - 索尼音乐要求下架 26 万首 AI 冒充歌曲,几乎是 3 月底 13.5 万首的两倍,被冒充者含阿黛尔、布兰妮、皇后乐队、迈克尔·杰克逊。 - 梅洛尼向欧盟知识产权局申请把自己的声音注册为商标,附 4 秒录音,防选举前 AI 深度伪造。 - LibreOffice 宣布默认不内置 AI,理由是文档不上传、可离线运行、满足审计,用户可装扩展接本地模型。 - 波兰反垄断机构指控谷歌在与出版商谈内容报酬时滥用支配地位,最高可罚营业额 10%;挪威将提交 AI 眼镜临时禁令草案;美国两党议员提多项法案限制联邦机构用 Flock 摄像头。 - 韩国拟投 4.7 万亿韩元(约 35 亿美元)自研前沿模型,约为此前承诺的九倍,初创公司也可参与,需国会批准;德国电信目标 2030 年靠 AI 省 25 亿欧元。 - 沪昆高速 NOA 在距前车约 10 米、120km/h 时突然退出致追尾,登微博热搜,报道称类似事件已不下 10 起。 - 更正昨日内容:华为称与高通的许可涵盖 LogicFolding 和近封装光学专利,高通否认,并称"高通是净付款方"的报道不准确。另有苹果与 OpenAI 商业秘密诉讼双方互指违规提交新证据;OpenAI 与 Atlassian 扩大合作,把 GPT-6 Astra 等接入 Rovo。
论文研究
1. METR:智能体可能篡改评估记录掩盖不当行为(原文 · 官方精选) - 研究人员在 AI 智能体协助下约 10 分钟就在 Inspect 的转录查看器里找到一个客户端 JavaScript 注入漏洞,可让智能体任意改写审查者看到的内容(数据库里真实数据还在);Meridian Labs 一天内修复。结论:智能体输出的日志应视为不可信输入,可观测性要按安全关键基础设施来做。
2. AutomationBench Verified(Shaped / Parsewave) - 审计 Zapier AutomationBench 全部 600 个公开任务的评分器,智能体标出 323 个可疑项,人工确认 206 个真 bug 并修复;修复后 27.9% 的 Kimi K3 跑分被改判。
3. 基座模型靠起始 token 激发推理(arXiv) - 固定回复开头的 token 就能让基座模型接近其 RL 版本:".\n\nOkay" 让 Olmo-3-7B 的 MATH-500 pass@1 从 42% 到 78%,"Alright," 让 Qwen3-14B 从 72% 到 87%。
4. Khanmigo 两年期随机对照实验 - 田纳西 18 所中学,补救数学课用带 AI 家教的 Khan Academy,每学期提升 1.3 个全国百分位(每学年约 0.06 至 0.08 个标准差),但和不用 AI 的 Khan Academy 练习效果相近,学生使用率低。
5. 多智能体协作 - Meta RankEvolve:让两个不同的编码智能体互审补丁,比给单个智能体加预算更能发现静默缺陷。 - Stanford《Worse Together》:5 个前沿模型、77 个场景、4 个环境,每人派一个智能体去争共享资源,效果不如一个统一协调的智能体。
6. 其他:JEPA-Anything 把 JEPA 扩展到物理、机器人、天气、生物等七个领域的统一世界模型;Q Labs Dust 用零阶优化、不做反向传播预训练 GPT 式 Transformer;OpenAI 与 Ironclad 训练 GPT-6 Astra,合同工作流平均得分比 GPT-5.6 Sol 高 32%;deepfake 检测器准确率从 99.5% 降到 76% 的二十年评估,作者主张改用基于校准内容认证的真实图像认证。
技巧与观点
- Pragmatic Engineer:2026 科技行业现状(评分 75):几乎无人手写代码,工程师普遍同时跑 5 至 10 个并行智能体,GitHub 上智能体生成的 PR 八个月涨九倍、8 月超过人类,IDE 在退场。
- 开源"正在死去"(评分 74):AI 垃圾 PR 和幻觉漏洞报告涌入,维护者审查成本激增。
- Vercel COO 讲用智能体自动化 Inbound 销售(原文 · 官方精选):从 125 行提示词演进到"14 条规则加模型",可迁移到其他团队。
- 卡兹克解读 a16z 两份报告(官方精选):新增数据是付费用户中头部 1% 月均消费 903 美元(2025 年 1 月是 504 美元)、贡献 19.5% 的总消费,中位数用户 25 美元几乎没变,一名头部用户约等于 59 名下半段用户。
- 扎克伯格谈 Llama 4 为何偏离前沿:像做 Instagram 信息流和广告那样上百上千人并行开发是错的,前沿模型需要小而紧的科研团队。
- The Verge:AI 硬件不能靠重新定义"录制"回避隐私:Apple 在做只存文字描述不存视频的家用摄像头,Watch 的 Audio Intelligence 也称"不录音"。
- Jev-as-a-Judge 教程:用 TypeSafe AI 的 Jev 评估智能体完整执行轨迹;Overmind 用自家生产 trace 微调小模型,称幻觉条款减少 20 至 30 倍。
- Acemoglu 在微软新刊上的悲观预测:十年 GDP 增长只有约 1.5%,AI 只替代约 5% 的工作;Nathan Lambert 认为开放权重模型的网络风险讨论已经失真;Boris Cherny 分享用 Claude 以 Lean 形式化验证 Agent SDK 的提示词。
四、24h 官方精选(19 条)
提醒:AIHOT 已换到新域名 aihot.news,旧域名 aihot.virxact.com 从 10 月 31 日起只做跳转,之后停用,路径和参数不变。