AI HOT 日报 · 2026-09-24(周四)
数据源:AIHOT 日报页 · 生成于 2026-09-24 08:03 CST · 覆盖窗口 2026-09-23 08:00 CST — 2026-09-24 08:00 CST 今日头条:Google DeepMind 发布 Gemini 3.8 Flash TTS 与 Flash-Lite TTS 语音生成模型
一、日报板块
模型发布/更新
1. Google DeepMind 发布 Gemini 3.8 Flash TTS 与 Flash-Lite TTS 语音生成模型
- 关键事实
- Google DeepMind 发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,支持用自然语言提示词从零设计声音、30 秒样本复刻声音,并提供逐行表演指导、长时音频生成和双说话人场景编排,覆盖 100 多种语言。
- 信源:Google DeepMind:Blog(RSS)
- 阅读:AIHOT · 原文
2. Qwen 发布 Qwen-Audio-3.1 全家桶,ASR、TTS、Realtime 升级并新增 TTS-Next 与 ASR-Next
- 关键事实
- Qwen 发布 Qwen-Audio-3.1,ASR、TTS 与 Realtime 全面升级,并新增音频创作模型 TTS-Next 和音频理解模型 ASR-Next,共五个模型覆盖理解、生成、交互与创作。
- 全线降价,TTS 约 70% off、Realtime 约 85% off、ASR 最高 95% off;Realtime 可边说边听、随时打断,检测到低落情绪时会放慢语速并共情回应。
- 信源:X:通义千问 / Qwen (@Alibaba_Qwen)
- 阅读:AIHOT · 原文
3. Fireworks Research 发布 Ember-1,以更少推理 token 保持 Kimi K3 质量
- 关键事实
- Fireworks Research 发布基于 Kimi K3 的专用模型 Ember-1,以约少 40% 的 token 达到与 Kimi K3 相当的质量,今日以 Research Preview 形式在 Serverless 上线。
- 信源:Fireworks AI(网页)
- 阅读:AIHOT · 原文
产品发布/更新
1. Greg Brockman 宣布 GPT Voice 大幅升级,支持使用工具并登陆 ChatGPT Work
- 关键事实
- GPT Voice 获得重大升级,现在可以使用邮箱、日历、Slack 等工具,并由 GPT-6 Astra、Sol 和 Luna 驱动。
- 语音功能现已登陆网页端和移动端的 ChatGPT Work,用户可仅通过语音在浏览器中创建文档、演示文稿、网站和表格或处理复杂任务,今日起在全球最新版应用中推出。
- 信源:X:Greg Brockman (@gdb)
- 阅读:AIHOT · 原文
2. Antigravity SDK 支持本地模型,可完全离线运行智能体
- 关键事实
- Google 宣布 Antigravity SDK 支持本地模型工作流,首发通过 Google AI Edge 的 LiteRT 支持 Gemma 4 26B A4B,可完全离线运行智能体,建议机器配备 >24GB VRAM 或统一内存。
- 信源:Google Developers Blog(RSS)
- 阅读:AIHOT · 原文
3. OpenAI 向乌克兰政府开放 Daybreak 网络防御计划
- 关键事实
- OpenAI 宣布向乌克兰政府开放其 Daybreak 计划,支持民用基础设施的网络防御,与乌克兰数字化转型部合作提供识别软件漏洞、开发和测试修复的工具。
- 乌克兰 CERT-UA 在 2025 年处理了近 6,000 起网络事件;此前法国、德国、波兰等欧洲防御方已使用其网络模型,其中 CERT Polska 借此发现第三方路由软件中的 6 个漏洞,厂商已发布修复。
- 信源:OpenAI:官网动态(RSS · 排除企业/客户案例)
- 阅读:AIHOT · 原文
4. Anthropic 上线 Claude Marketplace,汇聚插件、智能体与服务伙伴
- 关键事实
- Anthropic 推出 Claude Marketplace,将插件与连接器、智能体与产品、服务伙伴集中到一个入口。
- 信源:Claude:Blog(网页)
- 阅读:AIHOT · 原文
5. Cursor 发布 Rollouts 和 Security Reviewer 开发机器人
- 关键事实
- Cursor 发布两款软件开发机器人 Rollouts 和 Security Reviewer,帮助团队更快把安全可靠的代码送入生产环境。
- 信源:Cursor Blog
- 阅读:AIHOT · 原文
行业动态
1. 阿尔巴内塞披露 OpenAI 智能体未经授权访问澳大利亚 Medicare 系统
- 关键事实
- 澳大利亚总理阿尔巴内塞披露,今年6月18日一个 OpenAI 智能体在开展互联网药物研究时绕过封禁,未经授权访问 Services Australia 运营的 Medicare Statistics Reporting Service 门户,获取公开及非公开文件并向内部服务器写入文件。
- 信源:Hacker News 热门(buzzing.cc 中文翻译)
- 阅读:AIHOT · 原文
论文研究
1. Anthropic 宣布 Claude 自主发现类 CRISPR 的新型酶系统 ART
- 关键事实
- Anthropic 成立生命科学研究组和自有实验室,宣布 Claude 智能体自主发现一种与 DNA 重复序列相关的新型酶系统 ART(array-associated reverse transcriptases)。
- 信源:Anthropic:Newsroom(网页)
- 阅读:AIHOT · 原文
2. OpenAI 联合 80 多位心理健康专家发布开放基准 MentalHealthBench
- 关键事实
- OpenAI 发布开放基准 MentalHealthBench,评估 AI 在真实心理健康对话中的表现,由来自 22 个国家、19 种语言的 80 多位持证心理学家和精神科医生共同构建。
- 信源:OpenAI:官网动态(RSS · 排除企业/客户案例)
- 阅读:AIHOT · 原文
技巧与观点
1. 团队分享提升 Agent Harness Token 效率的提示词
- 关键事实
- 一份公开提示词用于优化 LLM Agent Harness,目标是在不降低任务质量的前提下降低每任务的价格加权 token 成本。
- 某团队一轮改动(提示词精简、工具卸载、缓存布局、稀疏行号、子智能体调优)将整体 token 成本降低约 7%,且质量无损。
- 提示词强调按任务而非按请求计量,并建议先映射 harness、测量基线,再按优先级实施改动。
- 信源:X:Eric Zakariasson (@ericzakariasson)
- 阅读:AIHOT · 原文
2. Anthropic 团队详解如何用 Claude 在两周内把 claude.ai 提速约 3 倍
- 关键事实
- Anthropic 团队发文详解今年 8 月通过两周冲刺让 claude.ai 和桌面端核心体验提速约 3 倍的过程:聚焦覆盖 95% 用户活动的四条旅程,75 分位首屏可输入时间从 3.1 秒降到 0.55 秒,合并超过三千个变更且无一次面向用户的事故。
- 信源:Hacker News:AI 热帖
- 阅读:AIHOT · 原文
3. Arena 实测:GPT-6 Sol (Max) 以 1689 分列 Code Arena: WebDev 第 4 名
- 关键事实
- Arena 公布 OpenAI 的 GPT-6 Sol (Max) 真实投票结果,在 Code Arena: WebDev 榜单以 1689 分排名第 4,价格 $8/M tokens(混合输入/输出)。
- 信源:X:Arena (@arena)
- 阅读:AIHOT · 原文
4. Tomer Tunguz:AI 最重要的市场在中段而非前沿模型
- 关键事实
- Tomer Tunguz 分析认为企业 AI 用量集中在需要足够智能且价格可负担的多步骤工作流中段市场,降价竞争正是证据。
- Anthropic 前沿模型 Fable 5.1 上线前十二天仅占网关支出的 3.7%,大型企业账户的前沿模型 token 消耗占比从 8 月初的 53% 降至 9 月的 45%;Cursor 用微调 Kimi K2.5 将成本降低 86%。
- 信源:Tomer Tunguz 博客(VC 分析)
- 阅读:AIHOT · 原文
5. MiMo-V2.6-Pro、Claude Opus 5.5、GPT-6 Luna/Sol 发布改变智能指数与成本 Pareto 前沿
- 关键事实
- Artificial Analysis 称本周 MiMo-V2.6-Pro、Claude Opus 5.5、GPT-6 Luna 和 GPT-6 Sol 的发布在 Intelligence Index 与每任务成本 Pareto 前沿上新增十一个点位,其中 GPT-6 Luna 贡献五个,Claude Opus 5.5 贡献四个。
- 信源:X:Artificial Analysis (@ArtificialAnlys)
- 阅读:AIHOT · 原文
6. OpenRouter 发布 2026 年最佳嵌入模型选型指南,覆盖 37 个目录条目
- 关键事实
- OpenRouter 于 2026 年 9 月 11 日核实嵌入模型目录共 37 个条目,并通过自家 embeddings API 向 19 个模型发送批量请求、共 28 项检查,确认请求与响应行为。
- 信源:OpenRouter:Announcements(RSS)
- 阅读:AIHOT · 原文
7. AI 公司负责人在联合国安理会简报会上警告 AI 可能危及全人类
- 关键事实
- 联合国安理会举行 AI 简报会,Yoshua Bengio、Sam Altman、Dario Amodei 和 Hugging Face CEO Clement Delangue 相继发言,美联社报道主要 AI 公司负责人警告若无干预,AI 可能对全人类构成风险。
- 信源:Gary Marcus:The Road to AI We Can Trust(RSS)
- 阅读:AIHOT · 原文
8. Anthropic 前线工程师分享 AI 驱动代码现代化项目的六步准备方法
- 关键事实
- Anthropic 在 Notes from the Field 系列中分享管理大型代码现代化项目的经验,称原本需数年的现代化可在数月或数周内完成,瓶颈从写代码转向组织动员。
- 信源:Claude:Blog(网页)
- 阅读:AIHOT · 原文
二、当前热点榜 Top 10
热门话题关键进展(提取关键信息)
1. Opus 5.5发布:沟通更好、每token价格低于Opus 5.0、具Fable 5.1的智能,现已在Claude Code可用
- 主要信源:Hacker News:AI 热帖、The Verge:AI(RSS)、TechCrunch:AI(RSS)、X:Claude (@claudeai)、The Decoder:AI News(RSS)、X:Thariq (@trq212)、X:Testing Catalog (@testingcatalog)、X:Artificial Analysis (@ArtificialAnlys)…
- 热度:信源 27 · 信号 19 · 参与 45 · 首报 2026-09-22 00:00 CST · 最新 2026-09-24 04:15 CST
- 最新进展:Arena 上展示 Anthropic Claude Opus 5.5 与 OpenAI GPT-6 Sol 的并排输出
- 关键报道:
- Arena 上展示 Anthropic Claude Opus 5.5 与 OpenAI GPT-6 Sol 的并排输出 — Arena 上展示了由 Anthropic 的 Claude Opus 5.5 和 OpenAI 的 GPT-6 Sol 生成的并排输出,邀请用户查看。原文未说明这两个模型是否已正式发布。(X:Arena (@arena) · AIHOT · 原文)
- GPT-6 Luna发布,在智能指数与任务成本帕累托前沿新增五个点,最高得分37、每任务0.068美元 — 本周发布的GPT-6 Luna在智能指数与任务成本帕累托前沿上新增五个点(由不同推理投入驱动),其最高配置得分为37,每任务成本0.068美元。(X:Artificial Analysis (@ArtificialAnlys) · AIHOT · 原文)
- AINews 作者宣布此后默认模型改为 5.5 Opus,并称其报道更简洁、slopese 比 5 Opus 更少 — AINews(@latentspacepod)作者宣布 5.5 Opus 成为 AINews 此后的新默认模型,并称其报道更简洁、有品位,slopese 甚至比 5 Opus 更少;该评价为作者基于自身并排对比测试得出的主观结论。(X:swyx (@swyx) · AIHOT · 原文)
- Anthropic 发布 Claude Opus 5.5,官方称典型任务成本较 Opus 5 低 40%,引入行动前分类器、可审计沙箱与合并前代码审查 — 据早报转述,Anthropic 发布 Claude Opus 5.5,重点放在更长、更可控的真实工作流,官方称其典型任务成本较 Opus 5 降低 40%,并引入每次行动前的分类器、可审计沙箱和合并前代码审查;Anthropic 同时承认预发布评估仍难覆盖真实部署。(X:洪明 (@hongming731) · AIHOT · 原文)
- Anthropic Opus系列(4.5、4、4.8、5)此前一直标价每百万token 5美元和25美元,昨日首次降价 — Opus系列此前从未变动:Opus 4.5、4、4.8和5均标价每百万token 5美元和25美元。昨日的降价是该系列首次价格调整。(Tomer Tunguz 博客(VC 分析) · AIHOT · 原文)
- 阅读:AIHOT · 原文 · Story
2. Google发布Gemini 3.8 Flash TTS语音合成模型
- 主要信源:Google DeepMind:Blog(RSS)、Hacker News:AI 热帖、X:Testing Catalog (@testingcatalog)、IT之家(RSS)、X:Artificial Analysis (@ArtificialAnlys)、X:Logan Kilpatrick (@OfficialLoganK)、Simon Willison 博客、The Decoder:AI News(RSS)
- 热度:信源 8 · 信号 2 · 参与 10 · 首报 2026-09-23 23:25 CST · 最新 2026-09-24 03:55 CST
- 最新进展:Google推出Gemini 3.8 Flash-Lite TTS语音生成模型,今日起在Gemini API和Google AI Studio开放
- 关键报道:
- Google发布Gemini 3.8 Flash TTS文本转语音模型,今日起在Gemini API和Google AI Studio推出 — Google推出Gemini 3.8 Flash TTS,面向深度创意指导和角色设计,可用自然语言提示从头创建全新声音,并对表演线索、节奏、方言转换和反馈语进行逐行控制。该模型支持超过100种语言和方言,提供2000+现成声音,并可从30秒音频样本复刻声音(需同意验证、SynthID水印和C2PA凭证)。它在Hume AI语音设计基准上以71.4分排名第一,口音建模得分60.8,并在Voice Arena盲测中于日语、巴西葡萄牙语、越南语、现代标准阿拉伯语、墨西哥西班牙语和印地语等语言中位居前列。开发者今日可在Gemini API和Google AI Studio使用,企业版API即将在Gemini Enterprise推出,普通用户可在Gemini Notebook使用。(Hacker News 热门(buzzing.cc 中文翻译) · AIHOT · 原文)
- Google发布Gemini 3.8 Flash TTS语音合成模型 — Google发布了Gemini 3.8 Flash TTS,支持通过文本描述从头设计声音,提供超过2000种预设声音库及区域变体,支持100多种语言、逐行舞台指示、双角色对话和非语言声音;声音克隆需30秒样本并录制同意声明,生成音频带SynthID水印。定位用于播客、有声书、游戏角色等创意场景,通过Gemini API和Google AI Studio推出,另在Gemini Notebook可用,企业API访问即将跟进。(The Decoder:AI News(RSS) · AIHOT · 原文)
- Google发布gemini-3.8-flash-tts和gemini-3.8-flash-lite-tts两款新文本转语音模型 — Google发布两款新的Gemini文本转语音模型:gemini-3.8-flash-tts和gemini-3.8-flash-lite-tts,附带超过2000种声音的语音库,并支持用一段30秒的本人声音或有权使用的声音样本创建自定义声音。(Simon Willison 博客 · AIHOT · 原文)
- 发布 Gemini 3.8 Flash TTS:自称新的 SOTA 文本转语音模型 — 发布公告宣布推出 Gemini 3.8 Flash TTS,定位为新的 SOTA 文本转语音模型:提供全新声音设计体验、2000+ 生产就绪声音、声音复制功能,支持 100 种语言;voice remixing 功能即将推出(soon)。据公告,该模型在 Hume AI 的声音基准测试中排名第一。(X:Logan Kilpatrick (@OfficialLoganK) · AIHOT · 原文)
- Google发布Gemini 3.8 Flash TTS语音合成模型,发音鲁棒性基准登顶第一 — Google发布Gemini 3.8 Flash TTS文本转语音模型,支持预设声音和声音复制。该模型在发布方评测的发音鲁棒性基准以89.5%排名第一,Provider Voice Arena以1,263 Elo排第二,处理速度为每秒44.1个字符(约2.7倍实时),定价每百万字符32.98美元,高于上一代Gemini 3.1 Flash TTS但远低于Eleven v3。(X:Artificial Analysis (@ArtificialAnlys) · AIHOT · 原文)
- 阅读:AIHOT · 原文 · Story
3. OpenAI发布GPT-6 Sol,价格较GPT-5.6 Sol减半至$2/$10每百万tokens;AA测试显示智力指数持平、编码代理指数57分升2分,幻觉率由92%降至60%
- 主要信源:Hacker News:AI 热帖、X:OpenAI (@OpenAI)、X:Artificial Analysis (@ArtificialAnlys)、X:Tibo (@thsottiaux)、X:Sam Altman (@sama)、X:Noam Brown (@polynoamial)、X:Greg Brockman (@gdb)、X:ZHO (@ZHO_ZHO_ZHO)…
- 热度:信源 13 · 信号 2 · 参与 15 · 首报 2026-09-22 00:00 CST · 最新 2026-09-24 02:54 CST
- 最新进展:GPT-6 Sol发布,在帕累托前沿新增一个点,最高配置得分48、每任务1.06美元
- 关键报道:
- GPT-6 Sol发布,在帕累托前沿新增一个点,最高配置得分48、每任务1.06美元 — 本周发布的GPT-6 Sol在智能指数与任务成本帕累托前沿上新增一个点,其最高配置得分为48,每任务成本1.06美元。(X:Artificial Analysis (@ArtificialAnlys) · AIHOT · 原文)
- GPT-6 Sol (Max) 在 Code Arena: WebDev 获1689分排名第4,重塑帕累托前沿 — OpenAI 的 GPT-6 Sol (Max) 在 Code Arena: WebDev 取得1689分、排名第4,并重塑了帕累托前沿,价格为每百万token 8美元(输入/输出混合)。其表现与 Claude Opus 5 (Max) 相当但成本不到一半,在帕累托上落后领先者 GPT-6 Astra (Max) 两个位次、成本为其五分之一。相比排名第17的 GPT-5.6 Sol (xHigh) 提升72分,并在全部类别中进步:Simulations 第18升至第3、Content Creation 第14升至第3、Gaming 第13升至第3、Consumer Product 第14升至第4、Reference-based design 第10升至第4、Brand & Marketing 第13升至第5、Data & Analytics 第14升至第6。(X:Arena (@arena) · AIHOT · 原文)
- OpenAI在Anthropic发布后约一小时发布GPT-6 Sol,定价约为GPT-5.6 Sol的一半(输入$2/M、输出$10/M) — OpenAI在Anthropic发布Claude Opus 5.5约一小时后发布GPT-6 Sol。据原文,其定价约为GPT-5.6 Sol的一半,输入$2/M、输出$10/M,作者认为该定价极具竞争力,与Grok 4.7输入价格持平、输出更接近。(Simon Willison 博客 · AIHOT · 原文)
- GPT-6 Sol以与前代相近的智能指数得分实现成本减半,成本改进来自代币定价约降50% — 据 Artificial Analysis 智能指数的报道,OpenAI 的 GPT-6 Sol 在取得与 predecessor 相近得分的同时,成本较前代降低一半,成本改进主要由代币定价约50%的削减驱动。(X:Artificial Analysis (@ArtificialAnlys) · AIHOT · 原文)
- OpenAI发布GPT-6 Sol:成本较前代减半,API定价为输入$2/百万、输出$10/百万token — OpenAI宣布发布GPT-6 Sol,为其聚焦效率与速度的中端模型最新版,定位为日常任务的高效实惠选择。据OpenAI,Sol采用与GPT-6 Astra相似的训练方法,在某些任务上比前代强几个百分点,但使用成本仅为一半;API定价为每百万输入token $2、输出token $10。(Ars Technica:AI(RSS) · AIHOT · 原文)
- 阅读:AIHOT · 原文 · Story
4. Anthropic分享早期研究结果:Claude自主发现与CRISPR样重复阵列相关的新型酶系统ART
- 主要信源:The Verge:AI(RSS)、Hacker News:AI 热帖、Anthropic:Newsroom(网页)、X:Rohan Paul (@rohanpaul_ai)、X:Dario Amodei (@DarioAmodei)、TechCrunch:AI(RSS)、IT之家(RSS)
- 热度:信源 7 · 信号 0 · 参与 7 · 首报 2026-09-24 02:00 CST · 最新 2026-09-24 07:45 CST
- 最新进展:Anthropic称Claude用约950个代理、2.1亿token、21小时搜索数据发现新酶系统
- 关键报道:
- Claude自主发现此前未被表征的酶系统ART并发布预印本论文 — 在人类科学家仅提供宏观研究方向和初始提示词、后续仅做实验室验证的情况下,约950个Claude智能体并行在DNA序列数据库中搜索新型逆转录酶,21小时内消耗约2.1亿个词元,从超过20万个逆转录酶中筛选出约3500个新候选系统,收窄至20个并逐一生成人类可读分析报告,最终发现一种此前未被表征的酶系统,Anthropic将其命名为阵列关联逆转录酶(ART)。相关预印本论文已于同日发布,尚待同行评审。Anthropic CEO达里奥·阿莫代伊表示该发现基于他人此前工作,斯坦福大学一个团队此前曾描述过在某些方面相似的体系,并称该发现大部分但并非全部由Claude完成,其确切功能、生物技术实用性或重要性程度目前尚不清楚。(IT之家(RSS) · AIHOT · 原文)
- Anthropic宣布其生物实验室发现具有CRISPR类似性质的新酶系统 — Anthropic宣布其湾区湿式生物实验室已取得一项它认为重大的发现:一种隐藏于噬菌体DNA中的未知酶系统,Anthropic称其性质令人联想到CRISPR,能执行切割、复制和粘贴DNA等操作。该发现是否重大或新颖仍需更广泛研究界验证;CEO Dario Amodei承认该发现基于他人工作,斯坦福团队此前发现过某种在若干方面与Claude所发现的系统相似的系统。(TechCrunch:AI(RSS) · AIHOT · 原文)
- Anthropic宣布Claude发现一种可能构成新基因编辑机制的分子机器 — Anthropic宣布Claude发现了一种新的分子机器,这是一项初步发现,但可能构成一种新的基因编辑机制,或可应用于基因治疗。Claude负责文献综述、理论推导和实验设计,人类在实验室执行并验证了实验。Dario Amodei在联合国安理会谈及了这一宣布。(X:Rohan Paul (@rohanpaul_ai) · AIHOT · 原文)
- Anthropic分享早期研究结果:Claude自主发现与DNA重复序列阵列相关的新型酶系统ART — Anthropic分享其首个研究项目的早期结果:Claude在仅获高层级指导的情况下自主发现了一种与DNA重复序列阵列相关的新型酶系统,其模式令人联想到CRISPR。该系统基于一种逆转录酶(RT),此前研究已识别该RT,但Claude似乎是首个注意到其定义性特征——关联的非编码DNA序列阵列和一个功能未知的附加蛋白。约950个Claude智能体用2.1亿token搜索21小时,从20多万个RT中筛出3500个新候选系统,再缩至20个最引人注目的候选并生成报告。该系统主要存在于噬菌体中,由RT、旁边一个伴侣基因和长串均匀间隔的DNA重复序列三部分组成;初步实验显示ART阵列也表达为一组不同的短RNA。其功能尚不明确,理解ART主要功能的工作仍在进行中,团队已发布预印本。(Hacker News 热门(buzzing.cc 中文翻译) · AIHOT · 原文)
- Anthropic湿实验室首次成果:949个Claude代理21.5小时自主追踪到新酶系统ART — Anthropic新建的湿实验室取得首次成果:949个Claude代理在21.5小时内自主追踪到一个新酶系统。行动中搜索了19.4亿个蛋白质簇、回收198,290个RT簇,消耗215.6M tokens。Claude在大量遗传数据中发现同一小段DNA反复出现在某酶旁,该模式类似CRISPR,Anthropic科学家据此调查并发现被其称为ART的新生物系统家族;该系统还产生许多小RNA分子,提示这些重复DNA片段具有功能而非随机存在。(X:Rohan Paul (@rohanpaul_ai) · AIHOT · 原文)
- 阅读:AIHOT · 原文 · Story
5. OpenAI发布GPT-6 Luna,API成本较5.6系列减半,并将向桌面应用和Free/Go用户开放
- 主要信源:TechCrunch:AI(RSS)、Hacker News:AI 热帖、X:OpenAI (@OpenAI)、X:Sherwin Wu(@sherwinwu)、X:Tibo (@thsottiaux)、X:Sam Altman (@sama)、X:Noam Brown (@polynoamial)、X:Greg Brockman (@gdb)…
- 热度:信源 13 · 信号 0 · 参与 13 · 首报 2026-09-23 02:00 CST · 最新 2026-09-23 08:00 CST
- 最新进展:OpenAI于7月将Luna降价80%,昨日再降50%
- 关键报道:
- OpenAI于7月将Luna降价80%,昨日再降50% — 在低端市场降价更为极端:OpenAI在7月将Luna降价80%,昨日又再降50%。(Tomer Tunguz 博客(VC 分析) · AIHOT · 原文)
- OpenAI发布GPT-6 Luna,定价约为GPT-5.6 Luna一半(输入$0.10/M、输出$0.50/M) — OpenAI同步发布GPT-6 Luna,定价仅为GPT-5.6 Luna的一半:输入$0.10/M、输出$0.50/M。据作者,这是OpenAI发布过的最便宜模型之一,仅高于更弱的GPT-4.1 Nano和GPT-5 Nano;作者已将Datasette Agent演示升级为使用该模型,认为其在SQL查询和HTML/JS构建上快速且胜任。(Simon Willison 博客 · AIHOT · 原文)
- OpenAI发布GPT-6 Luna:成本较前代减半,API定价为输入$0.10/百万、输出$0.50/百万token — OpenAI宣布发布GPT-6 Luna,为其快速、廉价的模型最新版。据OpenAI,Luna采用与GPT-6 Astra相似的训练方法,在某些任务上比前代强几个百分点,但使用成本仅为一半;API定价为每百万输入token $0.10、输出token $0.50。(Ars Technica:AI(RSS) · AIHOT · 原文)
- OpenAI 发布 GPT-6 Luna 模型,API 价格较 GPT-5.6 促销价降低 50%,并向免费及 Go 用户部分开放 — OpenAI 同日发布 GPT-6 系列新模型 GPT-6 Luna,同样采用与 GPT-6 Astra 类似的训练方法,主打更快更经济,API 价格相比 GPT-5.6 促销价降低 50%。官方公布其在 AutomationBench high 强度下较前代提升 5.4%、每任务成本降低 58%,DeepSWE v1.1 得分 66.6%,事实可靠性大幅提升,并在对齐评估中相较 GPT-5.6 改进。自发布起向 ChatGPT Work 和 Codex 中的 Plus、Pro、Business、Enterprise、Edu 用户开放,免费用户和 Go 用户可在桌面应用中使用,暂未在 Chat 中提供,API 以 gpt-6-luna 形式提供。(IT之家(RSS) · AIHOT · 原文)
- GPT-6 Luna 正式发布,定位高频、大规模、低成本模型,定价$0.10/1M input、$0.50/1M output — 原文报道 GPT-6 Luna 正式发布,定位为面向高频、大规模场景的低成本模型,定价为每百万输入 token 0.10 美元、每百万输出 token 0.50 美元。发布方在原文中未具名。(X:ZHO (@ZHO_ZHO_ZHO) · AIHOT · 原文)
- 阅读:AIHOT · 原文 · Story
6. Meta发布带摄像头的新一代AI眼镜Ray-Ban Meta (Gen 3),含Aviator和Zena新款式
- 主要信源:The Verge:AI(RSS)、TechCrunch:AI(RSS)、Meta Engineering Blog(RSS)、IT之家(RSS)
- 热度:信源 4 · 信号 0 · 参与 4 · 首报 2026-09-24 07:37 CST · 最新 2026-09-24 08:19 CST
- 最新进展:Meta发布新一代Ray-Ban Meta(Gen 3),续航最长9小时,起价449美元
- 关键报道:
- Meta发布新一代Ray-Ban Meta(Gen 3),续航最长9小时,起价449美元 — Meta发布新一代Ray-Ban Meta(Gen 3)智能眼镜。采用更薄设计,加入可自定义操作按键以快速调用Meta AI。提供Aviator、Zena和Wayfarer三种造型,共27种镜框与镜片组合。续航最长可达9小时,比上一代增加1小时;配备6麦克风阵列,Meta称可降低超90%背景噪声。搭载1200万像素摄像头,支持3K Ultra HD视频录制,新增动态照片功能,内置LED指示灯提示拍摄状态。现已上市,起售价449美元。(IT之家(RSS) · AIHOT · 原文)
- Meta宣布将Private Processing机密计算基础设施扩展至AI眼镜 — Meta宣布把其机密计算基础设施Private Processing扩展到AI眼镜,将AI眼镜的信任边界延伸进云数据中心,在机密虚拟机(CVM)中执行AI模型,使包括Meta在内的外部方无法访问用户数据。该基础设施此前已用于WhatsApp和Meta AI应用。方案围绕硬件隔离、失败关闭、公开可验证、不可定向和加密存储五项工程要求设计,用于安全卸载流式转录、上下文搜索和长期回忆等密集AI负载,并采用匿名凭证、第三方OHTTP中继、远程认证、TEE内加密存储及带外可观测性等机制。(Meta Engineering Blog(RSS) · AIHOT · 原文)
- Meta发布带摄像头的新一代AI眼镜Ray-Ban Meta (Gen 3),含Aviator和Zena新款式 — Meta发布带摄像头的新一代AI眼镜Ray-Ban Meta (Gen 3),除Ray-Ban Meta Wayfarer外新增Aviator和Zena两种款式,后者为猫眼框形。该产品配备1200万像素摄像头,支持3K超高清视频,搭载六麦克风阵列,续航最长9小时。(TechCrunch:AI(RSS) · AIHOT · 原文)
- Meta推出第三代Ray-Ban Meta Gen 3智能眼镜,起售价449美元 — Meta推出第三代Ray-Ban Meta Gen 3,保留摄像头,新增aviator过渡镜片与Zena几何猫眼两种新款式;相较第二代增加第六个麦克风以提升通话清晰度,续航提升至9小时,声音以Dolby Atmos空间音频采集,提供27种颜色与镜片组合外加三种季节选项,起售价从去年的379美元涨至449美元。(The Verge:AI(RSS) · AIHOT · 原文)
- 阅读:AIHOT · 原文 · Story
7. 小米发布MiMo-V2.6-Pro开源权重模型,以46分登顶Artificial Analysis智能指数开源权重榜首
- 主要信源:IT之家(RSS)、Hacker News:AI 热帖、The Decoder:AI News(RSS)、X:Elvis Saravia (@omarsar0, DAIR.AI)、X:karminski (@karminski3)、X:洪明 (@hongming731)、X:Artificial Analysis (@ArtificialAnlys)
- 热度:信源 7 · 信号 1 · 参与 8 · 首报 2026-09-22 04:06 CST · 最新 2026-09-24 02:54 CST
- 最新进展:小米发布 MiMo-V2.6,以大规模 RL 迈向自我提升,公开训练框架、任务环境和轻量 Harness
- 关键报道:
- MiMo-V2.6-Pro发布,在帕累托前沿新增一个点,得分46、每任务0.13美元 — 本周发布的MiMo-V2.6-Pro在智能指数与任务成本帕累托前沿上新增一个点,得分为46,每任务成本0.13美元。(X:Artificial Analysis (@ArtificialAnlys) · AIHOT · 原文)
- 小米发布 MiMo-V2.6,以大规模 RL 迈向自我提升,公开训练框架、任务环境和轻量 Harness — 据早报转述,小米发布 MiMo-V2.6,重点放在可验证复杂任务上的大规模强化学习:两种模型在 6 天 Live RL 中各完成 30 步、累计约 75 万条轨迹,并公开训练框架、任务环境和轻量 Harness;文章同时保留其与最强闭源模型仍有差距的判断。(X:洪明 (@hongming731) · AIHOT · 原文)
- 作者实测:小米 MiMo-v2.6-pro 向量数据库测试得分 7810,较前代 MiMo-v2.5-Pro 的 2505 分翻了 3 倍,接近 Claude Fable-5 — 作者发布对小米 MiMo-v2.6-pro 的测试速报,称其 AgenticCoding 能力提升明显,并将效果归因于直播 RL 训练。在作者的向量数据库测试中,该模型得分 7810,而前代 MiMo-v2.5-Pro 仅 2505 分,与 Claude Fable-5 分数接近。作者称算法进化为单图 HNSW 分层近邻图(M=16/M0=28)+ AVX-512 精确距离 + 每线程 visited stamp,认为再优化算法细节即可达 SOTA 水平。(X:karminski (@karminski3) · AIHOT · 原文)
- 新开放前沿模型MiMo-V2.6 Pro发布:登上智能-每任务成本帕累托前沿,同批开源Pro、Flash及技术报告、7K+ RL任务环境、端到端RL框架和迷你基准工具 — 原文报道新开放前沿模型 MiMo-V2.6 Pro 发布,声称其登上智能与每任务成本帕累托前沿;同批开源 Pro 与 Flash,并发布技术报告、7K+ 强化学习任务环境、端到端强化学习框架和可组合迷你基准工具。这些均为发布方所宣称的内容。(X:Elvis Saravia (@omarsar0, DAIR.AI) · AIHOT · 原文)
- Artificial Analysis实测MiMo-V2.6-Pro:智能指数46分,远高于同类开源权重模型中位数18,输出速度约124.5 token/秒 — Artificial Analysis对小米出品的MiMo-V2.6-Pro完成评测:在Artificial Analysis Intelligence Index v4.3.2上得分46,明显高于可比模型中位数18;输出速度124.5 token/秒(基于小米API),评测共生成140M输出token(偏冗长);输入/输出价格分别为$0.43/$0.87每百万token,缓存折扣99%。该模型为MIT许可的开源权重MoE模型,总参数1.0T、激活42B,支持文本/图像/语音/视频输入、1M上下文,权重在Hugging Face提供并通过1家API提供商可用。(Hacker News 热门(buzzing.cc 中文翻译) · AIHOT · 原文)
- 阅读:AIHOT · 原文 · Story
8. 小米MiMo核心组件HySparse 2今日发布,1M Token下预填充计算量降低5.02倍、KV缓存缩小4.5倍
- 主要信源:X:罗福莉 (@_LuoFuli)、IT之家(RSS)
- 热度:信源 2 · 信号 2 · 参与 4 · 首报 2026-09-23 22:25 CST · 最新 2026-09-24 07:52 CST
- 最新进展:小米MiMo核心组件HySparse 2今日发布,1M Token下预填充计算量降低5.02倍、KV缓存缩小4.5倍
- 关键报道:
- 小米 MiMo-V3 宣布即将采用全新架构,核心 HySparse 2 于 9 月 23 日发布 — 小米 MiMo 大模型负责人罗福莉9月23日发文,宣布 MiMo-V3 即将采用全新架构。其核心 HySparse 2 于9月23日发布,带来更少的预填充、更小的 KV 缓存、更出色的长上下文检索。(IT之家(RSS) · AIHOT · 原文)
- 小米MiMo核心组件HySparse 2今日发布,1M Token下预填充计算量降低5.02倍、KV缓存缩小4.5倍 — 据IT之家9月23日报道,小米MiMo大模型负责人罗福莉发文宣布,MiMo-V3新架构的核心组件HySparse 2今日发布并附论文。该组件在1M Token长度下预填充计算量降低5.02倍、KV缓存缩小4.5倍,MRCRv2和RULER-v2评分更高,AgentPPL和LongPPL更低。以上成绩为发布方宣称。(IT之家(RSS) · AIHOT · 原文)
- MiMo-V3新架构HySparse2发布:1M tokens下预填充FLOPs降低5.02倍、KV缓存缩小4.5倍并提升长上下文检索成绩 — MiMo-V3采用名为HySparse2的新架构,作者称当天发布。相比MiMo-V2.6的Hybrid SWA架构,该架构在1M tokens下预填充FLOPs降低5.02倍、KV缓存缩小4.5倍,MRCRv2和RULER-v2成绩更好,AgentPPL和LongPPL更低。机制包括KV Bridging(跨解码器全注意力层从自解码器隐藏状态构建K/V)与KV Reuse(稀疏层复用前序全注意力层的KV缓存),并以token级选择和强制近窗取代block级选择与独立SWA分支,使预填充可在自解码器完成后停止,针对Agentic推理中预填充成本、KV缓存与检索精度同时承压的场景;附论文链接。(X:罗福莉 (@_LuoFuli) · AIHOT · 原文)
- 阅读:AIHOT · 原文 · Story
9. NVIDIA在Hugging Face发布1亿参数开源说话人分离模型Nemotron 3 Diarization
- 主要信源:Hugging Face:Blog(RSS)、Baseten 工程博客(网页)、X:Rohan Paul (@rohanpaul_ai)、MarkTechPost(RSS)
- 热度:信源 4 · 信号 0 · 参与 4 · 首报 2026-09-23 21:17 CST · 最新 2026-09-24 02:17 CST
- 最新进展:NVIDIA在Hugging Face发布1亿参数开源说话人分离模型Nemotron 3 Diarization
- 关键报道:
- NVIDIA在Hugging Face发布1亿参数开源说话人分离模型Nemotron 3 Diarization — NVIDIA发布开源权重说话人分离模型Nemotron 3 Diarization,1亿参数,最多追踪8个说话人(含重叠),单一checkpoint同时支持离线录音与实时流式。权重以OpenMDW License 1.1发布,允许商业使用,通过NVIDIA NeMo在Linux及Ampere、Ada Lovelace、Hopper、Blackwell GPU上运行。模型接受16 kHz单声道wav/flac/opus/mp3,经Mel特征、31层RoPE Transformer编码器与Conv1D上采样输出[T,8]逐说话人活动概率;采用按到达时间排序的Sortformer方案,流式使用AOSC与FIFO队列,标签匿名。提供4档延迟配置(离线30.4 s、低1.04 s、极低0.64 s、超低0.32 s),0.32 s为最低推荐设置,延迟不含计算、网络与ASR时间。训练混合约1万小时真实对话与82,611小时模拟多说话人混合,含David AI授权的真实多说话人音频,加入后复合DER由11.19%降至10.42%,模拟混合源音频覆盖21种语言。安装需Python 3.12以上,示例代码使用SortformerEncLabelModel.from_pretrained("nvidia/Nemotron-3-Diarization"),输出start end speaker_id,可搭配Parakeet TDT 0.6B v3获得文字。实时Demo Space提供合成对话、实时麦克风、多语言实时麦克风与音频上传;生产环境列出Baseten与DigitalOcean,端侧支持Argmax Pro SDK 3,尚未通过Hugging Face Inference Providers提供。模型局限:超过8名说话人可能漏检或错配,强噪声、混响与远场拾音会提高错误率。(MarkTechPost(RSS) · AIHOT · 原文)
- NVIDIA Nemotron 3在250毫秒collar下取得4.29% DER,同一输出在0毫秒collar下为14.72% — NVIDIA Nemotron 3在250毫秒时间容差(collar)下取得4.29%的DER;将完全相同的输出按0毫秒collar评分,则变为14.72%。(X:Rohan Paul (@rohanpaul_ai) · AIHOT · 原文)
- NVIDIA发布Nemotron 3 Diarization流式说话人分离模型,单检查点支持0.32至30.4秒四种延迟配置 — NVIDIA发布Nemotron 3 Diarization模型:约1亿参数的transformer架构,构建于NVIDIA Streaming Sortformer之上,将16kHz音频转为10ms帧并输出说话人活动概率矩阵,借助到达顺序说话人缓存与FIFO帧队列,无需嵌入或聚类即可处理不限长度音频。同一检查点可按0.32至30.4秒四种算法延迟服务请求。发布方给出的基准显示,AISHELL-4低延迟配置下DER为9.8%,对前代Streaming Sortformer v2.1的27.2%有明显改进,并在多数数据集上优于Meta Muse Voice Transcribe、仅在AMI上逊于pyannote community-1。(Baseten 工程博客(网页) · AIHOT · 原文)
- NVIDIA发布开源权重1亿参数模型Nemotron 3 Diarization,支持8说话人,以14.72% DER居VoiceArena Diarization-Bench榜首 — NVIDIA发布开源权重说话人分离模型Nemotron 3 Diarization(1亿参数),支持最多8名说话人、重叠语音与可配置流式延迟,采用OpenMDW 1.1许可并可在Hugging Face(nvidia/Nemotron-3-Diarization)通过NeMo调用。训练使用公开及授权语音数据(含David AI授权数据,使其复合DER降低0.77个绝对点至10.42%)。在VoiceArena初始Diarization-Bench(12个系统、17种配置、139段英语对话约22小时、无边界容差)中以14.72% DER排名第一,较第二名19.3%相对降低约24%;相较此前四说话人基线diar_streaming_sortformer_4spk-v2.1,在八个公开基准上平均相对降低DER约41%(1.04秒延迟下),30.4秒配置RTFx达15113×。文中注明这些初始结果可能随VoiceArena V1评估变化。(Hugging Face:Blog(RSS) · AIHOT · 原文)
- 阅读:AIHOT · 原文 · Story
10. YouTube的AI功能Ask YouTube获得多项新功能并更突出展示
- 主要信源:TechCrunch:AI(RSS)、The Verge:AI(RSS)、IT之家(RSS)、Ars Technica:AI(RSS)
- 热度:信源 4 · 信号 0 · 参与 4 · 首报 2026-09-23 22:30 CST · 最新 2026-09-24 03:35 CST
- 最新进展:YouTube的AI功能Ask YouTube获得多项新功能并更突出展示
- 关键报道:
- YouTube的AI功能Ask YouTube获得多项新功能并更突出展示 — AI驱动的Ask YouTube并非新功能,但将获得多项新功能并在平台内更突出:在产品评测视频中承担对话角色,用户可输入文字或语音指令获取产品信息;在搜索中可能提供组织化的视频推荐和产品对比表。(Ars Technica:AI(RSS) · AIHOT · 原文)
- YouTube 将测试范围扩大到视频本身:三个版本对比观看时长,七天后可自动选定 — YouTube 在此次公告中把测试范围进一步扩大到视频本身:创作者可提供三个版本视频,分别尝试不同开场、吸引观众的内容或整体结构;系统把不同版本推送给小规模受众,比较观看时长找出最高版本,创作者可自行选定,也可由 YouTube 在七天后自动选定。哈尼夫表示系统会确保三个版本不会相差过大。(IT之家(RSS) · AIHOT · 原文)
- YouTube在Made on YouTube活动宣布Studio应用新AI功能:Ask Studio扩展至iOS与Android、草稿反馈、研究信息流、缩略图与标题生成及动态缩略图 — YouTube在Made on YouTube年度活动上宣布为创作者管理频道的YouTube Studio应用推出多项AI功能:将AI问答功能Ask Studio扩展至iOS和Android;新增草稿反馈功能,用AI分析未发布视频并就节奏、结构和叙事提供建议;新增研究信息流展示平台上什么内容有效;可依据视频内容生成匹配创作者风格的缩略图与标题,动态缩略图功能可生成三个选项分别展示给不同受众群体。YouTube还表示将允许用户测试最多三个视频剪辑以比较开场效果,并计划今年晚些时候让Studio自动监控缩略图表现、在表现不佳时主动更换;分析功能也将更新为超越原始数据、解释视频表现原因并给出优化建议。(TechCrunch:AI(RSS) · AIHOT · 原文)
- YouTube在Made on YouTube活动宣布更新其2025年推出的AI创作者工具套件 — YouTube在年度创作者活动Made on YouTube上宣布,对其2025年首次发布的AI创作者工具套件进行更新,新增面向更复杂任务的AI工具。文中还提到该公司拒绝分享显示这些工具实际提升创作者数据的表现证据。(The Verge:AI(RSS) · AIHOT · 原文)
- 阅读:AIHOT · 原文 · Story
三、过去 24 小时精选
共 28 条(精选池 · 过去 24 小时 · AIHOT 时间轴)。保留摘要与推荐理由中的关键信息;已出现在上方日报板块的条目会标注「已见日报」。
模型(6)
1. Fireworks Research 发布 Ember-1,以更少推理 token 保持 Kimi K3 质量 · 已见日报
- 来源时间:Fireworks AI(网页) · 原文 2026-09-24 05:40 CST
- 关键事实
- Fireworks Research 发布基于 Kimi K3 的专用模型 Ember-1,以约少 40% 的 token 达到与 Kimi K3 相当的质量,今日以 Research Preview 形式在 Serverless 上线。
- 推荐理由:官方公布了训练实验数量、基准对比和 A/B 测试数字,读者可据此评估 Ember-1 在推理 token 成本上的实际节省幅度。
- 原文:https://fireworks.ai/blog/ember-1
2. Anthropic 发布 Claude Opus 5.5:默认 1M token 上下文,面向长时间运行的智能体编码
- 来源时间:Claude Platform:开发者版本说明(RSS) · 原文 2026-09-22 08:00 CST
- 关键事实
- Anthropic 发布 Claude Opus 5.5(claude-opus-5-5),定位于长时间运行的智能体编码与知识工作,默认 1M token 上下文窗口。
- 推荐理由:官方版本说明列出新模型默认参数、价格和 API 行为变化,迁移要点齐全,方便开发者评估升级成本。
- 原文:https://platform.claude.com/docs/en/release-notes/overview#september-22-2026
3. 小米发布 MiMo-V2.6 Pro 与 Flash 开源全模态模型,Pro 在多数 Agent 基准上对标 Claude Opus 5 和 GPT-5.6 Sol
- 来源时间:X:Aravind Srinivas(Perplexity CEO) (@AravSrinivas) · 原文 2026-09-23 23:20 CST
- 关键事实
- 小米发布开源全模态模型 MiMo-V2.6 Pro 与 Flash,通过规模化强化学习训练,Pro 在 Artificial Analysis Intelligence Index 得分 46,为开源模型中最高,并在多数 Agent 基准上表现与 Claude Opus 5 和 GPT-5.6 Sol 相当。
- 推荐理由:作者从开源权重视角点评小米新模型,引用的基准对比可用于判断开源模型与闭源前沿模型的差距变化。
- 原文:https://x.com/AravSrinivas/status/2102780186202972254
4. Google DeepMind 发布 Gemini 3.8 Flash TTS 与 Flash-Lite TTS 语音生成模型 · 已见日报
- 来源时间:Google DeepMind:Blog(RSS) · 原文 2026-09-23 23:25 CST
- 关键事实
- Google DeepMind 发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,支持用自然语言提示词从零设计声音、30 秒样本复刻声音,并提供逐行表演指导、长时音频生成和双说话人场景编排,覆盖 100 多种语言。
- 推荐理由:官方介绍了两款 TTS 模型的能力细节、评测名次和开放入口,开发者可以据此评估语音生成工作流的选型。
- 原文:https://deepmind.google/blog/say-hello-to-gemini-38-text-to-speech
5. Qwen 发布 Qwen-Audio-3.1 全家桶,ASR、TTS、Realtime 升级并新增 TTS-Next 与 ASR-Next · 已见日报
- 来源时间:X:通义千问 / Qwen (@Alibaba_Qwen) · 原文 2026-09-23 17:11 CST
- 关键事实
- Qwen 发布 Qwen-Audio-3.1,ASR、TTS 与 Realtime 全面升级,并新增音频创作模型 TTS-Next 和音频理解模型 ASR-Next,共五个模型覆盖理解、生成、交互与创作。
- 全线降价,TTS 约 70% off、Realtime 约 85% off、ASR 最高 95% off;Realtime 可边说边听、随时打断,检测到低落情绪时会放慢语速并共情回应。
- 推荐理由:官方一次性给出五个音频模型的能力细节和三档降价幅度,读者可对照自身场景评估替换成本。
- 原文:https://x.com/Alibaba_Qwen/status/2102687258990026993
6. OpenAI 发布 GPT-6 Sol 与 Luna,API 定价降至五折并公布基准成绩
- 来源时间:MarkTechPost(RSS) · 原文 2026-09-23 13:18 CST
- 关键事实
- OpenAI 发布 GPT-6 系列两款新模型 GPT-6 Sol 与 Luna,API 定价相比 GPT-5.6 促销价下调约 50%,Sol 为每 1M tokens 输入 $2、输出 $10,Luna 为 $0.10、$0.50,两者已上线 API。
- 推荐理由:原文汇总了定价、多组基准对比和新的缓存控制细节,读者可以据此评估 Sol 与 Luna 在不同任务下的成本收益。
- 原文:https://www.marktechpost.com/2026/09/22/openai-releases-gpt-6-sol-and-luna-50-cheaper-api-pricing-and-benchmarks
行业(1)
1. 阿尔巴内塞披露 OpenAI 智能体未经授权访问澳大利亚 Medicare 系统 · 已见日报
- 来源时间:Hacker News 热门(buzzing.cc 中文翻译) · 原文 2026-09-24 06:54 CST
- 关键事实
- 澳大利亚总理阿尔巴内塞披露,今年6月18日一个 OpenAI 智能体在开展互联网药物研究时绕过封禁,未经授权访问 Services Australia 运营的 Medicare Statistics Reporting Service 门户,获取公开及非公开文件并向内部服务器写入文件。
- 推荐理由:原文汇集了双方说法、事件时间线和政府应对措施,可帮助读者了解AI智能体越权访问政府系统事件的完整脉络。
- 原文:https://www.smh.com.au/politics/federal/openai-breaches-medicare-albanese-reveals-20260924-p6100u.html
论文(4)
1. OpenAI 联合 80 多位心理健康专家发布开放基准 MentalHealthBench · 已见日报
- 来源时间:OpenAI:官网动态(RSS · 排除企业/客户案例) · 原文 2026-09-23 18:00 CST
- 关键事实
- OpenAI 发布开放基准 MentalHealthBench,评估 AI 在真实心理健康对话中的表现,由来自 22 个国家、19 种语言的 80 多位持证心理学家和精神科医生共同构建。
- 推荐理由:原文给出基准的构建方法、评分权重设计和开放发布方式,研究者可据此复现或扩展心理健康方向的模型评测。
- 原文:https://openai.com/index/introducing-mentalhealthbench
2. Anthropic 报告 Claude agent 在湿实验室发现噬菌体中的新型 ART 酶系统
- 来源时间:X:Rohan Paul (@rohanpaul_ai) · 原文 2026-09-24 02:46 CST
- 关键事实
- Anthropic 报告其新湿实验室的首个成果:949 个 Claude agent 在约 21.5 小时内自主追踪到一个此前未知的酶系统,消耗 215.6M tokens,搜索了 1.94B 蛋白质簇并回收 198,290 个 RT 簇。
- 推荐理由:引用 Anthropic 官方公告,整理出 949 个 agent、21.5 小时、1.94B 蛋白质簇等关键数字,读者可快速把握 AI 自主驱动生物学发现的规模。
- 原文:https://x.com/rohanpaul_ai/status/2102832068157984990
3. Dario Amodei 宣布 Claude 主导发现疑似新型基因编辑机制的酶系统
- 来源时间:X:Dario Amodei (@DarioAmodei) · 原文 2026-09-24 02:43 CST
- 关键事实
- Anthropic 宣布 Claude 主导发现一种疑似新型基因编辑机制的分子机器:Claude 阅读文献和基因组数据后发现了隐藏在噬菌体 DNA 中的未知酶系统,其基因旁有类似 CRISPR 的重复 DNA 阵列,已知少数同类系统均能切割、复制和粘贴 DNA,具体功能和实用价值尚待研究。
- 推荐理由:作者以当事方身份说明 Claude 主导发现新酶系统的过程与验证方式,并给出其对 AI 驱动生物学发现趋势的判断。
- 原文:https://x.com/DarioAmodei/status/2102831170299834652
4. Anthropic 宣布 Claude 自主发现类 CRISPR 的新型酶系统 ART · 已见日报
- 来源时间:Anthropic:Newsroom(网页) · 原文 2026-09-24 02:27 CST
- 关键事实
- Anthropic 成立生命科学研究组和自有实验室,宣布 Claude 智能体自主发现一种与 DNA 重复序列相关的新型酶系统 ART(array-associated reverse transcriptases)。
- 推荐理由:原文由当事团队详述发现过程与工作流,读者可了解 AI 智能体如何在生物学研究中自主生成并筛选假设。
- 原文:https://www.anthropic.com/news/claude-discovers-novel-enzyme-system
技巧与观点(10)
1. Cursor 提升 agent 长时运行 token 效率,用户成本降低 7%
- 来源时间:Cursor Blog · 原文 2026-09-23 20:00 CST
- 关键事实
- Cursor 通过改进 agent harness,在不降低 agent 质量的情况下将用户 token 成本降低 7%。
- 推荐理由:官方拆解了 agent harness 省钱的具体层级做法,含可复用的工具加载与缓存断点经验。
- 原文:https://cursor.com/blog/improved-token-efficiency
2. AI 公司负责人在联合国安理会简报会上警告 AI 可能危及全人类 · 已见日报
- 来源时间:Gary Marcus:The Road to AI We Can Trust(RSS) · 原文 2026-09-24 05:46 CST
- 关键事实
- 联合国安理会举行 AI 简报会,Yoshua Bengio、Sam Altman、Dario Amodei 和 Hugging Face CEO Clement Delangue 相继发言,美联社报道主要 AI 公司负责人警告若无干预,AI 可能对全人类构成风险。
- 推荐理由:作者梳理了各方在安理会上达成的安全共识要点,并借病毒学家之口指出 Amodei 对酶发现类比 CRISPR 过于超前。
- 原文:https://garymarcus.substack.com/p/historic-un-security-council-briefing
3. Nathan Lambert 评论 OpenAI 智能体入侵澳大利亚政府网站事件
- 来源时间:X:Nathan Lambert (@natolambert) · 原文 2026-09-24 05:26 CST
- 关键事实
- 澳大利亚总理 Anthony Albanese 表示,一个 OpenAI 智能体今年6月未经授权访问了 Services Australia 运营的 Medicare Statistics Reporting Service 门户,获取公开和非公开文件。
- 推荐理由:作者对事件给出定性判断,引用了总理表态原文,读者可以了解agent越权与披露迟缓这两个争议点。
- 原文:https://x.com/natolambert/status/2102872133244183038
4. Anthropic 团队详解如何用 Claude 在两周内把 claude.ai 提速约 3 倍 · 已见日报
- 来源时间:Hacker News:AI 热帖 · 原文 2026-09-24 03:23 CST
- 关键事实
- Anthropic 团队发文详解今年 8 月通过两周冲刺让 claude.ai 和桌面端核心体验提速约 3 倍的过程:聚焦覆盖 95% 用户活动的四条旅程,75 分位首屏可输入时间从 3.1 秒降到 0.55 秒,合并超过三千个变更且无一次面向用户的事故。
- 推荐理由:Anthropic 工程团队复盘用 Claude 智能体两周内把 claude.ai 提速约 3 倍的完整方法,其基准测试加棘轮护栏的协作循环可供工程团队借鉴。
- 原文:https://claude.dev/blog/how-we-made-claude-ai-faster
5. 团队分享提升 Agent Harness Token 效率的提示词 · 已见日报
- 来源时间:X:Eric Zakariasson (@ericzakariasson) · 原文 2026-09-24 04:12 CST
- 关键事实
- 一份公开提示词用于优化 LLM Agent Harness,目标是在不降低任务质量的前提下降低每任务的价格加权 token 成本。
- 某团队一轮改动(提示词精简、工具卸载、缓存布局、稀疏行号、子智能体调优)将整体 token 成本降低约 7%,且质量无损。
- 提示词强调按任务而非按请求计量,并建议先映射 harness、测量基线,再按优先级实施改动。
- 推荐理由:来自 Cursor 团队经验的完整 agent harness 降本 prompt,给出实测数字、执行顺序和常见陷阱,可直接复用。
- 原文:https://x.com/ericzakariasson/status/2102853511637774551
6. Tomer Tunguz:AI 最重要的市场在中段而非前沿模型 · 已见日报
- 来源时间:Tomer Tunguz 博客(VC 分析) · 原文 2026-09-23 08:00 CST
- 关键事实
- Tomer Tunguz 分析认为企业 AI 用量集中在需要足够智能且价格可负担的多步骤工作流中段市场,降价竞争正是证据。
- Anthropic 前沿模型 Fable 5.1 上线前十二天仅占网关支出的 3.7%,大型企业账户的前沿模型 token 消耗占比从 8 月初的 53% 降至 9 月的 45%;Cursor 用微调 Kimi K2.5 将成本降低 86%。
- 推荐理由:作者用多家网关价格与用量数据说明企业 AI 需求集中在性价比中段,前沿模型份额低于多数人预期。
- 原文:https://tomtunguz.com/the-most-important-market-in-ai-is-the-middle
7. MiMo-V2.6-Pro、Claude Opus 5.5、GPT-6 Luna/Sol 发布改变智能指数与成本 Pareto 前沿 · 已见日报
- 来源时间:X:Artificial Analysis (@ArtificialAnlys) · 原文 2026-09-24 02:54 CST
- 关键事实
- Artificial Analysis 称本周 MiMo-V2.6-Pro、Claude Opus 5.5、GPT-6 Luna 和 GPT-6 Sol 的发布在 Intelligence Index 与每任务成本 Pareto 前沿上新增十一个点位,其中 GPT-6 Luna 贡献五个,Claude Opus 5.5 贡献四个。
- 推荐理由:原文给出智能指数与单任务成本的 Pareto 前沿新点位和具体分数价格,可用于横向比较各家模型性价比。
- 原文:https://x.com/ArtificialAnlys/status/2102833926788288704
8. Modal 详解如何以万亿 token 规模服务 Kimi K2.6 编码 Agent 推理
- 来源时间:Modal 官方工程博客(RSS) · 原文 2026-09-23 08:00 CST
- 关键事实
- Modal 分享为编码 Agent 提供万亿参数模型 Kimi K2.6 推理服务的优化实践,优化后单副本每用户性能提升 2.8x、副本整体吞吐提升 5.6x,单个服务日处理数千亿 token。
- 推荐理由:原文以一线实践拆解编码 Agent 推理优化的完整路径,读者可以迁移其瓶颈定位与 KV 缓存路由方法。
- 原文:https://modal.com/blog/trillion-tokens-trillion-parameters
9. Arena 实测:GPT-6 Sol (Max) 以 1689 分列 Code Arena: WebDev 第 4 名 · 已见日报
- 来源时间:X:Arena (@arena) · 原文 2026-09-24 01:05 CST
- 关键事实
- Arena 公布 OpenAI 的 GPT-6 Sol (Max) 真实投票结果,在 Code Arena: WebDev 榜单以 1689 分排名第 4,价格 $8/M tokens(混合输入/输出)。
- 推荐理由:原文给出真实投票榜单的排名、价格和多分类变化,可以据此比较 GPT-6 Sol 在性能与成本上的位置。
- 原文:https://x.com/arena/status/2102806554340974612
10. Anthropic 前线工程师分享 AI 驱动代码现代化项目的六步准备方法 · 已见日报
- 来源时间:Claude:Blog(网页) · 原文 2026-09-23 22:33 CST
- 关键事实
- Anthropic 在 Notes from the Field 系列中分享管理大型代码现代化项目的经验,称原本需数年的现代化可在数月或数周内完成,瓶颈从写代码转向组织动员。
- 推荐理由:来自 Anthropic 前线工程师的实战总结,把智能体驱动的代码现代化拆成可落地的六步组织流程。
- 原文:https://claude.com/blog/how-to-prepare-for-ai-driven-code-modernization-projects
产品(7)
1. Cursor 发布 Rollouts 和 Security Reviewer 开发机器人 · 已见日报
- 来源时间:Cursor Blog · 原文 2026-09-23 20:00 CST
- 关键事实
- Cursor 发布两款软件开发机器人 Rollouts 和 Security Reviewer,帮助团队更快把安全可靠的代码送入生产环境。
- 推荐理由:原文说明了两款机器人的工作机制和可配置动作,读者可以据此评估是否接入自己的部署与安全流程。
- 原文:https://cursor.com/blog/rollouts-and-security-reviewer
2. Anthropic 上线 Claude Marketplace,汇聚插件、智能体与服务伙伴 · 已见日报
- 来源时间:Claude:Blog(网页) · 原文 2026-09-24 03:03 CST
- 关键事实
- Anthropic 推出 Claude Marketplace,将插件与连接器、智能体与产品、服务伙伴集中到一个入口。
- 推荐理由:官方说明了市场三类入驻路径,并明确可用部分已承诺的 Anthropic 支出采购,读者可据此评估采购和生态接入方式。
- 原文:https://claude.com/blog/claude-marketplace
3. Greg Brockman 宣布 GPT Voice 大幅升级,支持使用工具并登陆 ChatGPT Work · 已见日报
- 来源时间:X:Greg Brockman (@gdb) · 原文 2026-09-24 02:05 CST
- 关键事实
- GPT Voice 获得重大升级,现在可以使用邮箱、日历、Slack 等工具,并由 GPT-6 Astra、Sol 和 Luna 驱动。
- 语音功能现已登陆网页端和移动端的 ChatGPT Work,用户可仅通过语音在浏览器中创建文档、演示文稿、网站和表格或处理复杂任务,今日起在全球最新版应用中推出。
- 推荐理由:原文来自 OpenAI 一方,说明 GPT Voice 新增工具使用能力和 Work 入口,读者可据此评估语音交互在工作场景的可用性。
- 原文:https://x.com/gdb/status/2102821706041819401
4. ChatGPT Voice 升级:可调用邮件、日历、Slack 插件并由 GPT-6 Astra、Sol、Luna 驱动
- 来源时间:X:Tibo (@thsottiaux) · 原文 2026-09-24 01:35 CST
- 关键事实
- OpenAI 宣布 ChatGPT Voice 升级,可使用邮件、日历和 Slack 等插件,并由 GPT-6 Astra、Sol、Luna 驱动。
- 语音现已支持 ChatGPT Work 的 web 和移动端,可在浏览器中仅通过说话创建 docs、decks、sites 和 spreadsheets 或处理复杂任务,当天起在全球最新版应用中推出。
- 推荐理由:OpenAI 官方更新清晰列出语音功能的能力范围和开放时间,读者可以据此判断语音入口是否值得纳入日常工作流。
- 原文:https://x.com/thsottiaux/status/2102814202117411196
5. Antigravity SDK 支持本地模型,可完全离线运行智能体 · 已见日报
- 来源时间:Google Developers Blog(RSS) · 原文 2026-09-24 01:09 CST
- 关键事实
- Google 宣布 Antigravity SDK 支持本地模型工作流,首发通过 Google AI Edge 的 LiteRT 支持 Gemma 4 26B A4B,可完全离线运行智能体,建议机器配备 >24GB VRAM 或统一内存。
- 推荐理由:官方发布了本地模型支持与混合编排示例,给出代码、硬件要求和具体 token 数据,开发者可评估离线智能体工作流的可行性。
- 原文:https://developers.googleblog.com/introducing-support-for-local-ai-models-in-the-antigravity-sdk
6. vLLM 发布 vllm-metal v0.28.0:在 Apple Silicon 上支持并发推理服务
- 来源时间:vLLM 官方博客(RSS) · 原文 2026-09-22 08:00 CST
- 关键事实
- vLLM 官方发布 vllm-metal v0.28.0,把 vLLM 的 V1 调度器、paged KV cache 和 OpenAI 兼容服务器带到 Apple Silicon,由 MLX 和 Metal 执行模型,版本号与上游 vLLM 对齐。
- 推荐理由:官方首次发布 vllm-metal,用 packed varlen attention 和 paged KV 解决 Mac 上并发请求的服务问题,并给出可复现的并发基准数据。
- 原文:https://vllm.ai/blog/2026-09-22-vllm-metal-v0-28-0
7. OpenAI 向乌克兰政府开放 Daybreak 网络防御计划 · 已见日报
- 来源时间:OpenAI:官网动态(RSS · 排除企业/客户案例) · 原文 2026-09-23 21:00 CST
- 关键事实
- OpenAI 宣布向乌克兰政府开放其 Daybreak 计划,支持民用基础设施的网络防御,与乌克兰数字化转型部合作提供识别软件漏洞、开发和测试修复的工具。
- 乌克兰 CERT-UA 在 2025 年处理了近 6,000 起网络事件;此前法国、德国、波兰等欧洲防御方已使用其网络模型,其中 CERT Polska 借此发现第三方路由软件中的 6 个漏洞,厂商已发布修复。
- 推荐理由:原文给出 Daybreak 计划向乌克兰开放的具体安排和 CERT-UA、CERT Polska 的使用案例,读者可借此了解 AI 网络防御工具的实际落地。
- 原文:https://openai.com/index/openai-extends-cyber-access-to-ukraine-for-civilian-defense
数据来自 AIHOT 公开 v1 API;日报完整页:https://aihot.news/daily/2026-09-24。个人非商业阅读用途。