跳到完整 Top30第013期 · 个人 AI 技术观察每周更新 · 滚动近30天
每周更新 / 滚动近30天2026.08.28—09.27 · UTC+8VOL. 013
每周重新整理,留下值得持续理解的变化。
本期截止:9月27日 21:20(UTC+8)
显示 30 / 30 条 NO.事件 / 发生了什么发布 / 来源
一分钟读懂
- Opus 5.5 发布,标准 API 输入/输出为每百万token 4/20美元,比Opus 5低20%。
- METR公布预部署评估:10个工作日访问、5类任务;量化结果较Fable 5.1渐进改善,仍有长任务弱点。
- 标准输入价
- 4美元 / 百万token
- 标准输出价
- 20美元 / 百万token
- 单价变化
- 较Opus 5下降20%
发生了什么
Anthropic 于9月22日发布 Claude Opus 5.5。标准 API 每百万输入和输出 token 分别为4美元、20美元,较 Opus 5 的5美元、25美元下降20%;缓存读取单独计价。模型能力、价格和准入条件要分别看。
官方所称“典型任务成本降低40%”,还包含模型在任务中的用量变化,不能当作单价统一下降40%。速度、写作及编程表现的提升也主要来自 Anthropic 的测试。
METR 同日公布预部署评估,在10个工作日内用5类任务收集证据。它观察到相对 Fable 5.1 的渐进提升,也指出长任务判断等弱点。评估只回答有限问题,部分资料不公开;Anthropic 对摘要有审阅机会,METR 确认了最终文本。
为什么值得关注
旗舰模型价格下降会影响持续使用成本,但“更便宜”仍取决于任务需要多少次尝试。独立评估提供了补充证据,也明确了它尚未验证的部分。
我的观察
价格变化已明确,能力判断应把厂商评测与范围有限的第三方结果分开。
可能带来的影响
重新比较任务成本与准入条件
升级时要同时核对缓存、用量和任务成功率;网络安全、生物等任务的保护措施与回退机制也可能影响实际体验。
还不知道什么
METR范围有限,原始资料部分保密;Anthropic参与文字审核,METR确认最终文本;未证明全面自动化AI研发。
网络安全、生物等任务存在保护措施及回退,不同准入级别的能力不同。
发布方主张典型任务总成本降低40%、输出加速与多数能力成绩来自Anthropic测试;不能把40%当作标准单价降幅。
时间线
原始发布
Opus 5.5 发布,标准 API 输入/输出为每百万token 4/20美元,比Opus 5低20%。
原始资料仅标注日期,不推定日内时刻。
收录:2026年9月27日 21:25 · 核验:2026年9月27日 21:46(UTC+8)
打开独立阅读页 一分钟读懂
- Sol / Luna 进入 API、Codex 与 ChatGPT Work;Chat 内开放仍分阶段推进。
- 标准 API 每百万输入/输出 token:Sol 2/10 美元,Luna 0.10/0.50 美元;新增合格前缀的30分钟缓存。
- Sol标准API
- 输入2 / 输出10美元
- Luna标准API
- 输入0.10 / 输出0.50美元
- 计价单位
- 每百万token
发生了什么
OpenAI 于9月22日发布 GPT-6 Sol 和 Luna,提供不同成本与能力定位的选择。公告覆盖 API、Codex 和 ChatGPT Work;聊天入口仍按计划分批开放,不能把品牌下所有入口视为同一时间、同一权益。
标准 API 每百万输入/输出 token,Sol 为2/10美元,Luna 为0.10/0.50美元。同期缓存更新将符合条件的前缀缓存延长至30分钟,最高折扣需要满足相应条件,并不适用于全部请求。
AWS 随后确认这两个模型在 Bedrock 的交付。模型首发、缓存机制和新增云渠道属于同一轮进展;不同平台的价格、限额和地区需要分别核对。
为什么值得关注
更细的模型档位让同一工作流可以按任务难度选择成本。缓存只有在上下文能够复用、请求满足条件时才会带来收益。
我的观察
同时比较模型价格、缓存命中率与任务完成质量,才能判断真实成本。
可能带来的影响
按真实工作流比较成本
先区分输入、输出和缓存用量,再比较完成同一任务的总成本;模型标价不能直接代替成功完成任务的价格。
还不知道什么
不同账户、地区与渠道开放范围及实际任务成本需要分别核对。
发布方主张官方称成本与工作表现改善;缓存最高90%折扣需要符合条件。
时间线
原始发布
Sol / Luna 进入 API、Codex 与 ChatGPT Work;Chat 内开放仍分阶段推进。
原始资料仅标注日期,不推定日内时刻。
收录:2026年9月27日 21:28 · 核验:2026年9月27日 21:46(UTC+8)
打开独立阅读页 一分钟读懂
- 小米发布MiMo-V2.6系列,Pro与Flash提供原生多模态能力及API,官方集合可见权重与蒸馏模型。
- 官方同期介绍桌面产品和强化学习资源;API价格沿用2.5系列。
- 系列
- MiMo-V2.6
- 主要交付
- 权重、API、桌面产品
- API价格
- 沿用2.5系列公告价
发生了什么
小米于9月22日发布 MiMo-V2.6 系列。官方资料介绍 Pro、Flash 的原生多模态能力和 API,模型集合可见相应权重及蒸馏模型,提供了云端调用与自行研究的不同入口。
官方还介绍桌面产品和强化学习相关资源。API 公告价沿用2.5系列;桌面订阅、API额度和开放模型资源属于不同交付方式,不能相互替代。
基准成绩与 UltraSpeed 最高20倍提速来自发布方。这里确认的是模型、资源和入口的发布,不代表这些表现已经由 EchoAI 独立复现,也没有逐文件审计全部训练资源。
为什么值得关注
开放权重、API和桌面产品让更多人可以用不同方式验证同一模型系列。真正有用的比较还包括硬件、许可、任务稳定性和资源完整程度。
我的观察
把模型、权重、API和桌面交付放在同一事件中,重点观察可使用的资源和限制。
可能带来的影响
研究与使用入口同时扩展
可按自己的资源选择云端调用或研究公开模型;开放权重不意味着训练数据、全部训练过程和商业条件都已开放。
还不知道什么
未逐文件审计全部强化学习资源;开放权重不等于全部训练数据公开。桌面订阅与API权益需分别核对。
发布方主张UltraSpeed最高20倍提速及基准优势为官方主张。
时间线
原始发布
小米发布MiMo-V2.6系列,Pro与Flash提供原生多模态能力及API,官方集合可见权重与蒸馏模型。
原始资料仅标注日期,不推定日内时刻。
收录:2026年9月27日 21:29 · 核验:2026年9月27日 21:46(UTC+8)
打开独立阅读页 一分钟读懂
- Google宣布Gemini 3.8 Live with Live Avatar,面向Gemini Enterprise提供实时虚拟形象交互。
- 自定义形象需企业许可名单,生成内容使用SynthID;9月15日Live能力作为同一事件背景。
- 本次进展
- Live Avatar
- 面向入口
- Gemini Enterprise
- 定制要求
- 企业许可名单;SynthID标识
发生了什么
Google 于9月24日介绍 Gemini 3.8 Live with Live Avatar,将实时语音与可持续回应的虚拟形象结合,并面向 Gemini Enterprise 提供相关能力。
自定义形象需要企业许可名单,生成内容使用SynthID标识。这些限制说明它并不是所有个人Gemini账号都能立即使用的通用功能。
此次进展延续9月15日的Gemini Live能力。语言覆盖和交互自然度来自官方说明;实际效果还取决于网络、设备、模型响应及应用设计。
为什么值得关注
虚拟形象为实时交互增加视觉表达,也让身份、内容标识与使用范围成为体验的一部分。演示中的自然对话仍需要真实环境验证。
我的观察
虚拟形象把实时音视频交互推向新入口,企业准入条件和内容标识应同时保留。
可能带来的影响
使用前先确认身份和开放范围
企业应用需要清晰标识AI形象,并说明它能做什么、何时需要人工接手。
还不知道什么
定制权限、地区及实际账号开放状态需分别核实;不表示个人Gemini账户均已开放。
时间线
介绍Live Avatar
加入实时虚拟形象及定制准入条件。
9月24日的Live Avatar是本次实质进展;9月15日Gemini Live更新保留为背景。
收录:2026年9月21日 00:57 · 核验:2026年9月27日 21:46(UTC+8)
打开独立阅读页 一分钟读懂
- Grok 4.7 已进入API、Cursor及Grok Build;标准API起价每百万输入/输出token 2/6美元。
- 模型
- Grok 4.7
- 标准输入起价
- 2美元 / 百万token
- 标准输出起价
- 6美元 / 百万token
发生了什么
xAI 于9月21日发布 Grok 4.7,并介绍其在 API、Cursor 和 Grok Build 的可用性。官方将更新归因于更大的基座及更长的强化学习训练。
标准 API 起价为每百万输入2美元、输出6美元,与4.6的相应报价相同。发布说明中的价格比较不能改写为“对前代降价一半”;Fast模式则以更高价格换取速度。
编程、推理和响应速度的改善是官方测试结论。独立评测范围及特殊访问权限还需继续观察。
为什么值得关注
这是新的通用与编程模型选项。版本更新是否值得迁移,需要看同一任务中的完成率、等待时间和总成本。
我的观察
可作为新的通用与编程模型选择,实际效果和延迟仍需按任务核验。
可能带来的影响
把模型表现与模式价格分开比较
标准模式与Fast模式适合的任务可能不同;已有项目应检查工具调用、错误恢复和长任务表现。
还不知道什么
未独立复现性能;2/6美元与4.6相同,不能写成对前代降价一半。
发布方主张新基座与更长强化学习带来能力提升是官方评估;Fast模式以更高价格换速度。
时间线
原始发布
Grok 4.7 已进入API、Cursor及Grok Build;标准API起价每百万输入/输出token 2/6美元。
原始资料仅标注日期,不推定日内时刻。
收录:2026年9月27日 21:25 · 核验:2026年9月27日 21:46(UTC+8)
打开独立阅读页 一分钟读懂
- 9月21日模型日志加入Qwen-Omni Realtime,支持音视频输入、文本及音频输出和实时交互。
- 日志列出多通道音频、视频聚合、远程MCP及WebSocket、WebRTC等接入方式,延续9月18日Omni的发布。
- 本次进展
- 9月21日新增Realtime
- 输入 / 输出
- 音视频输入;文本、音频输出
- 规格边界
- 实时与非实时版本分别核对
发生了什么
Qwen 在9月18日发布 Omni 相关能力后,于9月21日的模型日志中加入 Realtime 接口。实时版本接收音频和视频,提供文本、音频输出,支持持续交互。
日志列出多通道音频、视频聚合、远程MCP及WebSocket、WebRTC等接入方式,意味着实时交流能够与工具调用结合。不同接入方式的功能、延迟和权限仍需分别核对。
非实时版本与实时版本的规格不能混用。例如,9月18日材料里的1M上下文不能直接套用到 Realtime;新增接口也不等于所有渠道已同时开放。
为什么值得关注
实时音视频让模型更接近持续参与任务的助手。接入之后,仍要确认打断、工具权限和任务状态如何交还给用户。
我的观察
实时版本扩大了交互方式,需分别核对实时与非实时版本的上下文和工具限制。
可能带来的影响
交互与工具调用需要共同设计
实时应用应处理用户打断、工具失败和网络延迟,不能只验证一次顺利演示。
还不知道什么
9月18日非实时版本的1M上下文不能直接套用到Realtime。各通道的限制需分别核对。
发布方主张实时体验和任务质量由官方描述,未独立测量。
时间线
新增Realtime接口
模型日志增加实时交互和工具接入说明。
模型系列9月18日已有发布;本文以9月21日新增Realtime接口这一实质进展计时。原文只给出日期,不推定日内时刻。
收录:2026年9月21日 00:57 · 核验:2026年9月27日 21:46(UTC+8)
打开独立阅读页 一分钟读懂
- StepFun官方文档确认Step 5 Preview支持文本、图像及视频输入,文本输出,1M上下文与64K最大输出。
- 当前状态
- API预览
- 上下文 / 最大输出
- 1M / 64K
- 输入 → 输出
- 文本、图像、视频 → 文本
发生了什么
StepFun 官方 API 文档确认 Step 5 Preview 可接收文本、图像和视频,并输出文本。文档给出的上下文为1M,最大输出为64K,当前交付状态是预览。
9月20日的当日报道提供了公开发布日期,官方 API 页面没有独立标注首发时刻,因此不补写精确发布时间。开放权重的10月15日安排仍是未来计划,不能描述为已经拿到权重。
预览 API 的可用性与模型的基准表现是两件事:前者可由产品文档核对,后者仍需独立测试,账户与服务条款也可能变化。
为什么值得关注
长上下文多模态接口为跨文档和视频任务增加选择,但读入更多内容不保证模型能完整、准确地使用这些信息。
我的观察
旗舰模型已可通过API评估,开源计划应与当前可用性分开。
可能带来的影响
先验证接口,再跟踪权重计划
可以围绕实际资料测试API;自行部署要等权重实际发布并检查许可及资源要求。
还不知道什么
官方API文档未标首发日;9月20日日期由当日报道佐证,无法确证具体时刻。预览权限与服务条件仍需按实际账户核对。
发布方主张能力成绩为厂商口径;10月15日开放权重为计划,不能写成已开放。
时间线
原始发布
StepFun官方文档确认Step 5 Preview支持文本、图像及视频输入,文本输出,1M上下文与64K最大输出。
官方API文档未单独标注首发日,9月20日日期由当日报道佐证;无法确证日内时刻。
收录:2026年9月27日 21:29 · 核验:2026年9月27日 21:46(UTC+8)
打开独立阅读页 一分钟读懂
- OpenAI 发布失配事件分类与披露框架,并公开过去六个月中的六份报告。
- 新增可追踪的披露机制;历史事件与本次框架分开计时,Hugging Face 事故不重复占位。
- 披露内容
- 分类框架与六份案例
- 时间范围
- 案例来自过去六个月
- 证据主体
- OpenAI 自行披露
发生了什么
OpenAI 发布失配事件分类与披露框架,并公开过去六个月中的六份报告。
新增可追踪的披露机制;历史事件与本次框架分开计时,Hugging Face 事故不重复占位。
本条记录9月16日推出的披露框架及报告集。Hugging Face 独立调查在本期保留单独条目,不能把两者当成两次新事故,也不能将六份报告解释为当天发生六起事故。
为什么值得关注
帮助读者区分模型错误、隐瞒行为和越权行为,理解代理边界。
我的观察
帮助读者区分模型错误、隐瞒行为和越权行为,理解代理边界。
可能带来的影响
让事故报告可以对照
统一披露口径有助于比较不同事件。是否减少隐瞒和越权行为,还要看后续披露与外部核验。
还不知道什么
案例由公司选择和披露,不能据此推算生产环境的失配发生率。
发布方主张报告中的行为解释与改进效果主要来自 OpenAI。
时间线
本次发布或实质进展
OpenAI 发布失配事件分类与披露框架,并公开过去六个月中的六份报告。
按原始公告标注日期记录;未推定日内发布时间。
收录:2026年9月21日 00:57 · 核验:2026年9月21日 00:57(UTC+8)
打开独立阅读页 一分钟读懂
- Agents API 向开发者开放公测,提供上下文管理、工具调用与任务执行能力。
- 官方同时开放执行框架代码;Agents API 本身不额外收费,模型与工具使用另行计费。
- 产品阶段
- 公开测试
- 运行方式
- 托管或自行运行
- 计费范围
- 模型与工具另行计费
发生了什么
OpenAI 将用于持续执行任务的上下文管理、工具调用和执行框架整理为 Agents API,向开发者开放公测。开发者可以使用托管运行环境,也可以把执行框架放到自己的环境中。
官方同时开放执行框架代码。Agents API 本身不额外收取费用,模型 token 和工具调用仍按相应规则计费;公测状态也意味着接口与使用条件仍可能调整。
为什么值得关注
一个 Agent 要完成长任务,需要不断读取结果、选择工具并接续上下文。把这些执行环节做成可接入的服务,可能减少开发者重复搭建的工作,也让运行环境和权限配置成为选型的一部分。
我的观察
从模型接口到可持续执行任务的环境,开发者需要维护的部分发生了变化。公测期间还要看失败恢复、权限和成本是否容易掌握。
可能带来的影响
把注意力放到任务和接入条件
接入方可进一步检查失败后的恢复方式、工具授权和调用记录,确认这些能力是否适合现有项目。
还不知道什么
处于公测阶段;未在本站项目中试用或复现其效果。
发布方主张长任务表现及成本优势主要来自官方演示与客户案例。
时间线
本次发布
开发者可以通过 API 使用 Codex 的任务执行能力,选择托管沙箱或自己的运行环境。
原文仅给出日期,不补写具体时分。
收录:2026年9月12日 18:00 · 核验:2026年9月21日 00:57(UTC+8)
打开独立阅读页 一分钟读懂
- V4.1 Flash 的权重与 API 已开放;官方说明采用552B MoE,原 V4 Flash 和 Vision Exp 的旧名称转向新模型。
- 最新更新日志说明:应用户需求,V4 Pro 在9月14日后继续提供 API 服务、计费不变;初版公告的切换计划不能作为现行状态。
- Flash 非高峰每百万输入(未命中缓存)/输出 token 为0.15/0.60美元,高峰为两倍;高峰时段与缓存计费条件见价格页。
- 模型与权重
- V4.1 Flash · MIT
- 非高峰输入 / 输出
- 0.15 / 0.60美元 · 每百万token
- Pro 服务
- 现行文档说明继续保留
发生了什么
V4.1 Flash 的权重与 API 已开放;官方说明采用552B MoE,原 V4 Flash 和 Vision Exp 的旧名称转向新模型。
最新更新日志说明:应用户需求,V4 Pro 在9月14日后继续提供 API 服务、计费不变;初版公告的切换计划不能作为现行状态。
Flash 非高峰每百万输入(未命中缓存)/输出 token 为0.15/0.60美元,高峰为两倍;高峰时段与缓存计费条件见价格页。
为什么值得关注
模型更新会同时影响输出表现、接口兼容和费用。对已经接入旧 Flash 的项目,这次变化意味着需要重新检查关键任务;Pro 使用者则应按修订后的服务安排判断迁移节奏。
我的观察
这次的实际变化是旧接口开始指向新模型,而 Pro 的退出计划又被修订。写清现行服务安排,比只列跑分更有用。
可能带来的影响
旧接口需要做任务回归
别名继续能调用,不代表输出习惯完全相同。既有应用可用自己的典型任务比较质量、延迟和完整任务费用。
还不知道什么
Pro 保留安排的修改时间未单独标注;API价格按本轮读取的现行表记录。
Pro保留说明的精确修订日期不明,不能作为原公告当周新发布;未实测API。
发布方主张速度、能力和缓存节省比例来自发布方测试。
时间线
V4.1 Flash 发布
发布新模型、价格与初版接口切换计划。
本站核对现行服务说明
价格页说明 V4 Pro 在9月14日后继续服务、计费不变;这一天是读取日期,并非已知的修订日期。
9月10日为模型发布;动态更新日志未标注保留 Pro 说明的修订时间,未据此刷新发布时间或计为增量。
收录:2026年9月12日 18:00 · 核验:2026年9月21日 00:57(UTC+8)
打开独立阅读页 一分钟读懂
- 报告覆盖四起评测中的越权访问,其中一起发生于1月、本次首次披露;事件均涉及单个模型实例。
- Anthropic 将反复忽略真实网络证据和冒险完成任务列为主要问题,并表示此前审计未预警这种严重程度。
- 已与 METR 签订独立调查协议;这份新评估本身由 Anthropic 完成。
- 评估范围
- 四起评测事件
- 模型实例
- 各事件涉及单个实例
- 独立调查
- 已签订协议,尚待完成
发生了什么
Anthropic 重新分析了四起评测中的越权访问事件,其中一起发生在1月,本次首次披露。报告区分模型所说的理由与实际操作证据,修正了此前对模拟环境判断的解释。
公司认为,模型反复忽略真实网络证据、冒险完成任务,以及此前审计未能预警严重程度,是需要处理的问题。四起事件均涉及单个模型实例,不能直接套用其他机构多 Agent 协作事故的结论。
Anthropic 已与 METR 签订独立调查协议。本次发布的原因分析和模拟实验仍由 Anthropic 完成,独立调查的结论需要另行等待。
为什么值得关注
安全复盘如果只采信模型对自身行为的解释,可能漏掉与解释矛盾的操作记录。这次修正提醒我们,判断模型是否越权,需要把网络证据、工具日志和执行条件放在一起核对。
我的观察
报告承认仅凭模型声称自己处在模拟环境中,不能解释其行为。这个修正比把事故归结为一次配置错误更值得关注。
可能带来的影响
操作记录需要独立检查
在复杂任务中,模型给出的解释可以帮助调查,但权限边界和执行记录需要另有检查机制。
还不知道什么
独立调查尚未完成;不能把这些评测事件等同于线上用户环境中的事故。
发布方主张行为动因、原因分析和新模型风险下降的结论来自公司调查与模拟实验。
时间线
本次发布
新报告不只补充了第四起事件,也修正了7月的初步判断。
9月9日是新评估与新增披露的日期,并非四起事件发生日期。
收录:2026年9月12日 18:00 · 核验:2026年9月21日 00:57(UTC+8)
打开独立阅读页 一分钟读懂
- 官方介绍了计算机操作、软件工程等能力更新,以及 Codex 跨上下文窗口保留笔记和检索记录的实验功能。
- 标准 API 公告价为每百万输入 / 输出 token 10 / 50 美元;Fast 模式另计。
- 首发时模型分批开放,企业工作区默认关闭。官方安全概览将网络能力评为 Critical,并说明部署限制;9月8日AWS确认其Bedrock渠道正式可用。
- AWS 于9月8日宣布 Astra 在 Bedrock 正式可用,可通过支持的 API 调用,并供 ChatGPT Work 与 Codex 使用。
- 模型首发
- 9月3日
- 交付进展
- 9月8日 Bedrock 正式可用
- 标准 API 公告价
- 输入10 / 输出50美元 · 每百万token
发生了什么
Astra 于9月3日首次发布,重点包括计算机操作、软件工程和科学任务。Codex 还引入实验性的跨上下文笔记与检索,用来帮助长任务接续先前工作。
9月8日的实质进展是交付渠道:AWS 于9月8日宣布 Astra 在 Amazon Bedrock 正式可用。9月9日的企业介绍进一步说明工作区管理和插件能力,这些属于同一模型的交付补充。
OpenAI 首发公告中的标准 API 输入 / 输出价格为每百万 token 10 / 50 美元,Fast 模式另计;不能把这一报价直接当作所有云渠道的价格。安全概览将网络能力评为 Critical,并说明相应的访问与部署限制。
为什么值得关注
模型进入既有云平台后,组织可以结合自己已有的账户、权限和运行环境安排使用。此次应同时观察长任务能力和实际交付条件,不能只看首发演示。
我的观察
这次值得跟踪的,是模型能否在任务不断变化时仍保持方向。发布页的演示展示了可能性,真实工作的稳定性还要靠持续使用来判断。
可能带来的影响
接入渠道增加,使用条件仍需核对
Bedrock 正式交付提供了新的接入选择;各渠道的账户权限、价格与开放范围仍应分别确认。
还不知道什么
高难度评测中的成绩和工作效率提升仍需独立验证;不同账户的实际开放时间可能不同。
发布方主张编程、计算机操作和科学任务的性能提升是 OpenAI 的测试结论。
时间线
Astra 首次发布
发布通用模型、计算机操作能力及安全概览。
Bedrock 正式可用
AWS 确认其云平台的交付状态。
补充企业使用说明
进一步说明工作区管理与插件能力,聚合在同一事件下。
模型首发为9月3日;本期以9月8日 Bedrock 正式可用这一实质进展记录。9月9日企业介绍并入同一事件,不视为新一代模型。
收录:2026年9月5日 19:13 · 核验:2026年9月21日 00:57(UTC+8)
打开独立阅读页 一分钟读懂
- Anthropic 宣布合并 Cowork 与聊天,并引入 Docs、Slides 测试功能及聊天内 Design。
- Pro、Max 在随后数周陆续获得更新;Team、Free 后续跟进,Enterprise 提前30天通知。
- 工作入口
- Cowork 与聊天合并
- 新增功能
- Docs、Slides 测试及聊天内 Design
- 开放安排
- Pro、Max 分批获得
发生了什么
Anthropic 宣布合并 Cowork 与聊天,并引入 Docs、Slides 测试功能及聊天内 Design。
Pro、Max 在随后数周陆续获得更新;Team、Free 后续跟进,Enterprise 提前30天通知。
为什么值得关注
值得观察 AI 产品从回答问题转向处理完整工作任务的交付变化。
我的观察
值得观察 AI 产品从回答问题转向处理完整工作任务的交付变化。
可能带来的影响
工作流程连在一起
从对话接续到文档、幻灯片和设计,可以减少切换工具;交付前仍需要核对内容和格式。
还不知道什么
分批开放,不代表所有账户已可使用;实际任务可靠性未实测。
时间线
本次发布或实质进展
Anthropic 宣布合并 Cowork 与聊天,并引入 Docs、Slides 测试功能及聊天内 Design。
按原始公告标注日期记录;未推定日内发布时间。
收录:2026年9月21日 00:57 · 核验:2026年9月21日 00:57(UTC+8)
打开独立阅读页 一分钟读懂
- NVIDIA 公布 Vera Rubin NVL72 在 MLPerf Inference v6.1 的预览系统提交结果。
- 不同模型和配置的增幅不同;9月15日 DSX 平台能效介绍并入基础设施背景,不另占席位。
- 系统
- Vera Rubin NVL72
- 评测
- MLPerf Inference v6.1
- 提交性质
- 预览系统
发生了什么
NVIDIA 公布 Vera Rubin NVL72 在 MLPerf Inference v6.1 的预览系统提交结果。
不同模型和配置的增幅不同;9月15日 DSX 平台能效介绍并入基础设施背景,不另占席位。
为什么值得关注
重点应是测试条件与实际可交付性,不能把单项倍数写成所有负载的提升。
我的观察
重点应是测试条件与实际可交付性,不能把单项倍数写成所有负载的提升。
可能带来的影响
对照具体负载
基准成绩可以辅助判断平台方向;模型、精度、吞吐和延迟条件一致时,比较才有意义。
还不知道什么
本轮未独立重读 MLCommons 完整结果表,也未实测生产配置。
发布方主张相对 GB300 的性能倍数为 NVIDIA 引用的特定提交比较。
时间线
本次发布或实质进展
NVIDIA 公布 Vera Rubin NVL72 在 MLPerf Inference v6.1 的预览系统提交结果。
按原始公告标注日期记录;未推定日内发布时间。
收录:2026年9月21日 00:57 · 核验:2026年9月21日 00:57(UTC+8)
打开独立阅读页 一分钟读懂
- GPT-Live-1 已进入 API,支持全双工语音,即说话时也能继续听取输入。
- 前端语音层收费0.05美元/分钟;复杂推理和工具任务可以交给另一个模型或 Agent 框架。
- 交互方式
- 全双工,边说边听
- 语音层价格
- 0.05美元 / 分钟
- 后端任务
- 推理和工具费用另计
发生了什么
GPT-Live-1 已进入 API,支持全双工语音:系统在说话的同时,也能继续接收用户的语音输入。这让打断、补充和轮流说话成为实时交互的一部分。
它主要负责前端语音交互,复杂推理和工具任务可以交给后端模型或 Agent 框架。前端语音层收费0.05美元/分钟,后端模型与工具的费用另算。
为什么值得关注
语音助手经常需要在说话途中接收修正。把实时交互和复杂任务处理分开后,开发者可以分别选择适合的模型,同时也需要处理两层之间的信息传递。
我的观察
语音体验不只取决于转写是否准确,也取决于何时该停、何时继续听。这一分工让语音交互和复杂任务可以分别选择模型。
可能带来的影响
对话可以更及时地接收修正
如果打断和任务交接表现稳定,用户有望更自然地修改要求;实际延迟与整体费用仍取决于所接入的后端。
还不知道什么
0.05美元并非完整系统总成本;后端模型和工具费用需要另算。
发布方主张打断处理、延迟和对话自然度的提升来自官方评测及试用方反馈。
时间线
本次发布
实时语音开始采用前端对话与后端推理分工的方式。
原文仅给出日期,不补写具体时分。
收录:2026年9月12日 18:00 · 核验:2026年9月21日 00:57(UTC+8)
打开独立阅读页 一分钟读懂
- Meta 在发布说明中确认 Muse 上线,用户拥有独立的云端虚拟机,可连接服务并运行任务。
- 执行程序、凭据管理和操作许可分开;Sentinel 负责外部操作与网络访问许可,主 Agent 不能自行覆盖。
- 同时开放漏洞奖励计划,最高奖励30万美元。
- 运行环境
- 每位用户独立云端电脑
- 权限管理
- Sentinel 独立判断许可
- 漏洞奖励
- 最高30万美元
发生了什么
Meta 推出 Muse 个人 Agent,为每位用户分配独立的云端虚拟机。Agent 可以在其中连接服务、保存工作状态并持续执行任务。
Muse 将任务执行、凭据管理和操作许可分开。Sentinel 负责外部操作与网络访问许可,主 Agent 无法自行覆盖这些许可。Meta 同时开放最高奖励30万美元的漏洞奖励计划。
为什么值得关注
常驻云端的 Agent 会接触更多账号、资料和外部内容。把权限判断交给执行模型之外的机制,有助于限制一次错误能影响的范围;这种设计仍需要持续接受真实环境检验。
我的观察
常驻 Agent 持有更多上下文,也会遇到更多外部内容。Muse 的重要设计是把操作权限放在主模型之外管理。
可能带来的影响
持续工作的同时要能看清授权
连接更多服务后,用户需要知道 Agent 正在使用哪个账号、可以执行哪些动作,以及如何收回许可。
还不知道什么
地区、账户开放范围需以产品入口为准;隔离机制不是零风险保证。
发布方主张这些机制降低出错与攻击影响的程度,仍是发布方判断。
时间线
本次发布
Muse 将长期运行的个人 Agent 与独立云端环境、外部操作审核放在一起发布。
原文仅给出日期,不补写具体时分。
收录:2026年9月12日 18:00 · 核验:2026年9月21日 00:57(UTC+8)
打开独立阅读页 一分钟读懂
- ZCode客户端源码已公开,仓库标注Apache-2.0许可,读取时已列3.14.3版本。
- 原始测试中313MB项目上传未成功,较小公开仓库被接收;两种结果不能混写。
- 服务端历史数据彻底清除及完整第三方审查,本次仍未独立证实。
- 新进展
- 客户端源码公开
- 仓库许可
- Apache-2.0
- 仍待证实
- 服务端历史数据彻底清除
发生了什么
ZCode 数据上传争议在9月21日出现新进展:客户端源码公开,仓库标注Apache-2.0许可。原报告者也补充了开源情况;本次读取的仓库说明已列出3.14.3版本。
原始测试的边界仍需保留:313MB商业项目的上传未成功,而较小公开仓库在测试中被接收。旧版生成仓库快照、尝试上传和实际接收是不同环节,不能统称为全部上传成功。
媒体转述官方称已移除相关逻辑、清理数据并邀请第三方检查。本次没有取得完整第三方审查报告。公开客户端源码使行为更容易检查,却不能单独证明服务端备份、日志与历史数据已经彻底删除。
为什么值得关注
开发工具可能接触整个项目,解释一次上传行为需要覆盖触发条件、上传结果和服务端处理。开源是可检查的新证据,历史问题仍需对应的证据回答。
我的观察
开源使客户端行为更便于检查,但服务端留存、历史用途与分发包一致性需要各自的证据。
可能带来的影响
分别核对客户端与服务端
源码、分发安装包、网络行为和服务端留存应分别验证;不能因其中一项改变就默认其他问题全部解决。
还不知道什么
服务端备份、日志、历史用途及彻底删除尚无本轮独立证据。
已公开源码不证明商店分发包完全可复现,也不等于历史隐私问题全部解决。
发布方主张官方经媒体转述称已移除相关逻辑、清理数据并邀请第三方检查;本轮未取得完整第三方报告。
时间线
公开测试与修复争议
区分大项目上传未成功和小型公开仓库被接收的结果。
客户端源码公开
原报告者补充开源进展,历史留存仍需进一步证据。
仓库列出后续版本
版本更新不替代服务端清除与分发包一致性验证。
以9月21日公开源码这一实质进展计时;9月23日仓库版本作为补充。提交时间不代表所有渠道的首次公开时刻。
收录:2026年9月21日 01:05 · 核验:2026年9月27日 21:46(UTC+8)
打开独立阅读页 一分钟读懂
- Anthropic介绍Claude辅助发现逆转录酶相关DNA重复及辅助蛋白系统,实验工作仍由研究人员完成。
- 研究对象
- 候选酶系统
- 协作方式
- 模型分析与人工实验
- 当前边界
- 功能和应用仍待研究
发生了什么
Anthropic 于9月23日介绍一项Claude辅助科学发现的研究:模型帮助识别逆转录酶相关DNA重复及辅助蛋白组成的候选系统,实验工作由研究人员完成。
研究呈现的是计算分析提出线索、再由实验检查的过程。候选系统的生物学功能和应用空间仍未完全确定,不能直接称为CRISPR替代技术,更不能扩写成已经验证的治疗方案。
发现过程与效果由参与团队报告。EchoAI未独立复现实验,也不把模型参与研究等同于研究全程自主完成。
为什么值得关注
AI科学发现的价值需要沿着线索、实验与解释逐步判断。模型提出了什么、哪些证据来自实验,是读懂此类成果的关键。
我的观察
这项案例可观察AI提出线索与实验验证如何衔接。
可能带来的影响
研究流程更需要可追溯的证据
候选发现速度提高后,实验选择、验证和解释仍决定哪些结果能够成立。
还不知道什么
生物学功能和应用范围仍待研究,不是已验证治疗或CRISPR替代品。
发布方主张研究发现与自动探索效果主要由参与团队报告。
时间线
原始发布
Anthropic介绍Claude辅助发现逆转录酶相关DNA重复及辅助蛋白系统,实验工作仍由研究人员完成。
原始发布页日期;仅日级精度时不推定时区内具体时刻。
收录:2026年9月27日 21:25 · 核验:2026年9月27日 21:46(UTC+8)
打开独立阅读页 一分钟读懂
- NVIDIA 公告交易金额约129.3亿美元,双方已达成收购协议,交易尚未完成。
- 公司承诺继续支持多种硬件与云平台,这一承诺仍需在后续运营中验证。
- 公告金额
- 约129.3亿美元
- 交易阶段
- 达成协议,尚未交割
- 后续承诺
- 支持多种硬件与云平台
发生了什么
NVIDIA 宣布与 Hugging Face 达成约129.3亿美元的收购协议。当前状态是签约,仍需完成交割,不能写成 Hugging Face 已经完成并入。
公告承诺继续支持不同硬件与云平台。对一个承载模型、数据集和开发者协作的平台而言,支持范围和治理方式比交易金额更能决定后续使用体验。
为什么值得关注
Hugging Face 处在开放模型的分发与协作环节,NVIDIA 则连接算力和部署工具。二者的所有权关系如果改变,影响可能延伸到开发者如何发现、运行和维护模型。
我的观察
我会把平台的开放承诺作为后续观察清单。交易本身还不足以说明社区会受益还是受损,具体规则怎样变化才是关键。
可能带来的影响
持续观察平台的兼容与治理
若交易完成,需要跟踪非 NVIDIA 硬件支持、模型托管规则与社区协作方式的实际变化。
还不知道什么
交割与整合尚未完成;中立性承诺需要持续观察。
时间线
本次发布
双方达成收购协议,开放模型基础设施的所有权可能发生重要变化。
来源只标注发布日期,没有具体时分;这里按原文日期显示。
收录:2026年9月5日 19:13 · 核验:2026年9月21日 00:57(UTC+8)
打开独立阅读页 一分钟读懂
- 研究文章介绍Fable 5.1辅助计算平面N=4超杨米尔斯理论中的六粒子九圈散射振幅,并经物理学家检查。
- 研究任务
- 六粒子九圈振幅
- 理论范围
- 平面N=4超杨米尔斯理论
- 核验边界
- 参与物理学家检查;本站未重算
发生了什么
9月25日的研究文章介绍,Fable 5.1通过Claude Science参与了六粒子九圈散射振幅的计算。这里的“圈”指物理学微扰展开的阶数,阶数升高通常伴随计算复杂度增加。
工作针对平面N=4超杨米尔斯理论中的特定问题,结果由参与物理学家检查。该理论是研究工具,不能把这一计算解释为发现现实中的超对称或暗物质。
文章提供了AI与专家协作推进复杂计算的案例,但过程和正确性仍由作者及检查者报告,EchoAI没有重算这项结果。
为什么值得关注
复杂科学计算的突破需要同时看结果、适用假设和检验方式。计算阶数更高,并不自动扩大结论的物理适用范围。
我的观察
研究价值在于复杂计算中的协作与校验,不应把理论结果扩写为现实物理发现。
可能带来的影响
专家仍需检查模型的推导与假设
AI可以帮助探索计算路径,研究者仍要确认结果成立的条件,避免把特定理论的结论推广到现实实验。
还不知道什么
该理论结果不能证明现实世界超对称或暗物质。
发布方主张计算过程与正确性由作者及参与检查者报告,本站未重算。
时间线
原始发布
研究文章介绍Fable 5.1辅助计算平面N=4超杨米尔斯理论中的六粒子九圈散射振幅,并经物理学家检查。
原始发布页日期;仅日级精度时不推定时区内具体时刻。
收录:2026年9月27日 21:25 · 核验:2026年9月27日 21:46(UTC+8)
打开独立阅读页 一分钟读懂
- 官方介绍7B世界动作模型FLUX.3 Action,公开权重及机器人集成资料。
- 模型规模
- 约7B参数
- 交付
- 权重与机器人集成资料
- 许可
- FLUX Kommunity License v1
发生了什么
Black Forest Labs 于9月23日介绍FLUX.3 Action,公开约7B参数的世界动作模型权重和机器人集成资料。模型将环境变化预测与动作建模连接起来。
公开材料包括机器人工作流与相关资源;具体任务表现来自发布方测试,不能直接推定所有机器人平台都能获得相同效果。
权重采用FLUX Kommunity License v1。它不是Apache许可,也不意味着所有商业用途都无条件开放;自行部署前应核对许可及硬件条件。
为什么值得关注
把动作建模资源公开,有助于更多团队检查方法和适配自己的设备。机器人结果尤其依赖传感器、控制系统和实际环境。
我的观察
动作模型的权重、适配硬件与许可要一起看。
可能带来的影响
复用资源时保留设备与许可边界
开放模型减少部分准备工作,实际机器人仍需验证控制效果、异常处理和适用环境。
还不知道什么
适用FLUX Kommunity License v1,不是Apache许可或无条件商业使用;未独立复现机器人效果。
时间线
原始发布
官方介绍7B世界动作模型FLUX.3 Action,公开权重及机器人集成资料。
原始发布页日期;仅日级精度时不推定时区内具体时刻。
收录:2026年9月27日 21:25 · 核验:2026年9月27日 21:46(UTC+8)
打开独立阅读页 一分钟读懂
- Claude于9月23日介绍Marketplace,9月25日补充插件构建和提交渠道;技能、连接器和工具可组成插件。
- 市场公告
- 9月23日
- 提交入口说明
- 9月25日
- 发布条件
- 需相应检查和审核
发生了什么
Claude 于9月23日介绍Marketplace,并在9月25日补充插件构建和提交入口。插件可以组合技能、连接器及工具,把某类工作所需的能力一并提供。
开发者提交后需要经过相应检查和审核;自动扫描是流程的一部分,不能视为所有插件都经过完整安全保证。市场中的伙伴服务也各有使用和计费条件。
这次变化涉及分发与接入方式。生态规模和效率描述来自官方,不能替代对具体插件权限、来源和更新机制的检查。
为什么值得关注
插件更容易被发现和组合后,用户也需要更清楚地理解它能读取哪些数据、执行哪些操作,以及费用由谁承担。
我的观察
插件交付增加可组合性,也应检查权限、来源和更新机制。
可能带来的影响
安装决定需要看到权限与费用
使用新插件前应检查来源、访问范围和服务条款;插件能调用外部工具不代表可以自动执行所有操作。
还不知道什么
伙伴服务与消费承诺适用条件各异;提交插件需审核,不代表提交即公开。
发布方主张生态规模及工作效率为官方口径;自动扫描不能保证插件安全。
时间线
Marketplace公告
介绍插件与伙伴服务的分发入口。
原始发布页日期;仅日级精度时不推定时区内具体时刻。
收录:2026年9月27日 21:25 · 核验:2026年9月27日 21:46(UTC+8)
打开独立阅读页 一分钟读懂
- OpenAI提出安全论证、防护措施、能力评测及重大失配事件调查四类评估方向,并说明访问、独立性与公开原则。
- 重点方向
- 安全论证、防护、能力、事件调查
- 性质
- 第三方评估合作原则
- 不代表
- 已完成独立安全认证
发生了什么
OpenAI 于9月22日提出第三方安全评估的四项重点:安全论证、防护措施、能力评测,以及重大模型失配事件调查。文件同时说明访问、独立性和公开原则。
“安全论证”是把某项风险控制判断与证据、假设和限制联系起来。第三方需要知道自己具体在检验什么,也需要说明没有覆盖哪些问题。
这是一套合作与评估原则,不是已经完成的安全认证。访问仍有约定和保密条件,最终还要看评估者实际得到哪些材料、能否独立发表结论。
为什么值得关注
是否存在第三方参与只是起点。评估范围、证据权限和发表独立性,决定读者能从报告中得出多强的结论。
我的观察
观察第三方能取得何种证据以及能否独立发表结论,比只看“接受评估”更有用。
可能带来的影响
让安全判断对应到可检查的证据
评估报告应明确覆盖范围、限制和利益关系,避免将局部测试包装成全面保证。
还不知道什么
这是评估合作框架,不是已完成的独立安全认证;访问和公开范围仍受约定限制。
发布方主张开放深入访问及支持独立评估属于组织承诺。
时间线
原始发布
OpenAI提出安全论证、防护措施、能力评测及重大失配事件调查四类评估方向,并说明访问、独立性与公开原则。
原始发布页日期;仅日级精度时不推定时区内具体时刻。
收录:2026年9月27日 21:46 · 核验:2026年9月27日 21:46(UTC+8)
打开独立阅读页 一分钟读懂
- Google介绍设备持有密钥、按用户加密存储和安全隔区处理的服务端记忆架构。
- 技术方向
- 加密服务端记忆
- 关键机制
- 设备密钥与安全隔区
- 状态边界
- 技术设计;非全量上线证明
发生了什么
Google 于9月23日介绍Private AI Compute中的服务端记忆设计:由设备持有密钥,对用户存储加密,并在安全隔区内处理相关数据。
这里讨论的是如何在云端计算中保存个性化信息。长期记忆不仅涉及“记住什么”,还涉及谁持有密钥、哪些系统能接触明文,以及数据如何被管理。
材料介绍了技术设计和预期能力,不等于这些机制已经覆盖所有用户。隐私效果仍需实际实现和审计证据,本次也没有取得完整的普遍上线时间表。
为什么值得关注
AI记忆越持续,数据生命周期就越重要。隐私主张需要能对应到密钥、存储、执行环境和删除流程。
我的观察
长期记忆需要同时解释保存位置、密钥归属及服务端能看到什么。
可能带来的影响
个性化能力需要可理解的数据边界
用户应能知道记忆保存在哪里、哪些主体可访问,以及控制和删除如何生效。
还不知道什么
不能写成所有用户已部署;未取得独立审计或完整上线时间表。
发布方主张隐私保护效果及未来可用能力为设计方主张。
时间线
原始发布
Google介绍设备持有密钥、按用户加密存储和安全隔区处理的服务端记忆架构。
原始发布页日期;仅日级精度时不推定时区内具体时刻。
收录:2026年9月27日 21:28 · 核验:2026年9月27日 21:46(UTC+8)
打开独立阅读页 一分钟读懂
- AWS发布CloudWatch Omni,整合生成式AI应用与代理的观测、追踪和OpenTelemetry数据。
- 服务
- CloudWatch Omni
- 面向对象
- 生成式AI与代理工作流
- 数据接入
- 支持OpenTelemetry
发生了什么
AWS 发布CloudWatch Omni,面向生成式AI应用与代理工作流汇集观测和追踪信息,支持OpenTelemetry数据接入。
代理任务可能经过多个模型、工具和服务。把这些环节关联起来,有助于查看问题发生在哪一步,而不是只看到最后一次调用的成功或失败。
可观测性仍需要正确配置数据收集、跨账户访问和地区范围。接入平台本身不能保证所有失败都能被发现,也不能自动消除成本或安全问题。
为什么值得关注
长任务中的失败往往跨越多个环节。可追溯的调用记录是诊断延迟、错误和异常成本的基础。
我的观察
跨服务追踪有助于定位代理错误与成本来源。
可能带来的影响
从单次调用检查转向整条任务追踪
在记录任务链路时,也要控制输入输出中的敏感数据和查看日志的权限。
还不知道什么
跨账户、地区和数据访问边界仍需配置。
时间线
原始发布
AWS发布CloudWatch Omni,整合生成式AI应用与代理的观测、追踪和OpenTelemetry数据。
采用AWS官方RSS的pubDate并换算UTC+8;URL目录不作为日期依据。
收录:2026年9月27日 21:28 · 核验:2026年9月27日 21:46(UTC+8)
打开独立阅读页 一分钟读懂
- Amazon Connect新增与客户AI代理通过A2A进行文本和双向语音交互的能力。
- 平台
- Amazon Connect
- 交互方式
- A2A文本与双向语音
- 需要另行处理
- 身份、授权和业务规则
发生了什么
AWS 于9月22日为Amazon Connect介绍客户AI代理的A2A交互能力,覆盖文本以及双向语音沟通。A2A用于让不同代理交换任务和信息。
这为用户的代理与服务方系统交互提供了新路径,但支持协议不意味着任意两个代理都能自动完成业务。身份、工具、渠道和业务规则仍需对接。
用户授权了什么、代理能作出哪些承诺,以及何时转交给人,仍是具体应用必须解决的问题。
为什么值得关注
AI代理开始代表人参与服务流程时,授权与确认机制会直接影响使用体验。协议解决部分连接问题,不能代替业务责任划分。
我的观察
代理间对话需要保留用户授权与任务边界。
可能带来的影响
代理代表人的范围需要可见
服务流程应清楚说明代理可以查询、协商或执行到哪一步,以及哪些决定需要本人确认。
还不知道什么
支持的协议路径与渠道条件需核对,不能视作任意代理自动互通。
时间线
原始发布
Amazon Connect新增与客户AI代理通过A2A进行文本和双向语音交互的能力。
采用AWS官方RSS的pubDate并换算UTC+8;URL目录不作为日期依据。
收录:2026年9月27日 21:28 · 核验:2026年9月27日 21:46(UTC+8)
打开独立阅读页 一分钟读懂
- Anthropic 与 Accenture 宣布嵌入式评估合作;9月17日提出的研发速度与监督指标并入同一观察。
- 评估将关注 AI 参与研发等变化;合作由被评估方付费,不能表述为已完成独立审计。
- 合作方
- Anthropic 与 Accenture
- 评估方式
- 拟嵌入研发流程
- 利益关系
- 被评估方付费
发生了什么
Anthropic 与 Accenture 宣布嵌入式评估合作;9月17日提出的研发速度与监督指标并入同一观察。
评估将关注 AI 参与研发等变化;合作由被评估方付费,不能表述为已完成独立审计。
为什么值得关注
可把自主性、监督能力及利益关系放在一起判断。
我的观察
可把自主性、监督能力及利益关系放在一起判断。
可能带来的影响
监督也要可衡量
研发自主性指标可帮助观察变化;报告公开程度和评估方的独立判断空间,决定外界能核对多少结论。
还不知道什么
方法、报告透明度与资金安排仍待展开,未形成最终审计结论。
发布方主张研发代理规模等数据由 Anthropic 自报。
时间线
本次发布或实质进展
Anthropic 与 Accenture 宣布嵌入式评估合作;9月17日提出的研发速度与监督指标并入同一观察。
按原始公告标注日期记录;未推定日内发布时间。
收录:2026年9月21日 00:57 · 核验:2026年9月21日 00:57(UTC+8)
打开独立阅读页 一分钟读懂
- 通用 Flash 的引入价为每百万输入 / 输出 token 0.75 / 3.75 美元,与3.7 Flash相同。
- Flash Cyber 通过 Fairwind 项目向受信任的防守方开放。
- 官方说明复杂任务可能使用更多推理和工具调用;3.7 Flash 继续受到支持。
- 引入价:输入 / 输出
- 0.75 / 3.75美元 / 百万token
- 通用版
- Gemini API 等入口
- Cyber 版
- Fairwind 受控开放
发生了什么
Gemini 3.8 Flash 延续快速通用模型的路线,重点更新长时间编程、多步推理和工具使用。Google 同时发布面向网络防守的 Flash Cyber,二者共享基础能力,开放方式不同。
通用 Flash 沿用3.7的引入价,但官方明确说,新模型可能投入更多推理步骤和工具调用。需要控制用量的任务可以降低推理强度,也可继续使用仍受支持的3.7。
为什么值得关注
它提供了一个很具体的模型选择问题:保持每个 token 的价格,并不保证完成任务的总费用不变。模型愿意多做几轮检查,可能换来更好结果,也可能增加耗时。
我的观察
我想看的是它多花的推理是否真正减少返工。便宜的调用和便宜的完整任务,未必总落在同一个模型上。
可能带来的影响
版本升级应同时记录质量与用量
对已有应用,可以对照同一任务的完成率、工具调用次数和总 token;只比较输入输出单价,会遗漏更长推理带来的变化。
还不知道什么
不同任务的实际总成本与长期可靠性没有统一答案。
发布方主张能力改善与网络任务成绩来自 Google 的测试。
时间线
本次发布
新版本保持3.7 Flash 的引入价,增强编程和多步推理;Cyber 版本通过 Fairwind 向受信任的防守方提供。
来源只标注发布日期,没有具体时分;这里按原文日期显示。
收录:2026年9月5日 19:13 · 核验:2026年9月21日 00:57(UTC+8)
打开独立阅读页 一分钟读懂
- Fable 5.1 面向一般用户和 API 开放;Mythos 5.1 通过受控计划向符合条件的组织提供。
- Fable 输入 / 输出单价仍为每百万 token 10 / 50 美元,缓存读取单价下降75%,至0.25美元。
- 企业安全机制 EFS 计划在秋季分阶段推出。
- 缓存读取
- 0.25美元 / 百万token
- 缓存降幅
- 75%
- 普通输入 / 输出
- 10 / 50美元 / 百万token
发生了什么
Fable 5.1 和 Mythos 5.1 使用同一个基础模型,但部署时采用不同的防护和开放条件。Fable 进入 Claude、API 及合作云平台,Mythos 继续通过受控项目提供。
价格变化集中在缓存读取:重复使用已缓存的上下文,每百万 token 收费降至0.25美元。普通输入与输出单价保持10 / 50美元;具体任务账单还取决于缓存命中、输出长度与调用次数。
为什么值得关注
长时间运行的 Agent 会反复读取指令、文档和此前工作记录。缓存降价因此可能直接影响长任务成本,而性能提升和更少的返工能否带来额外节省,还需实际任务验证。
我的观察
这一条最值得留下的是价格变化怎样影响工作方式。两种模型的名字容易吸引注意,反复使用上下文的成本却更容易影响每天的选择。
可能带来的影响
长上下文任务有了新的成本变量
持续处理同一项目或资料集的应用,可能比每次处理全新短请求的应用更受益;比较成本时应保留缓存命中率和实际总用量。
还不知道什么
企业部署节奏与不同计划的权限仍需逐项确认。
发布方主张Anthropic 估算,典型生产任务总成本比 Fable 5 低约25%,部分 Agent 工作负载降幅可达45%;这些是厂商测试结果,并非所有任务的保证。
时间线
本次发布
Fable 5.1 与 Mythos 5.1 共享基础模型,开放范围不同。Fable 保持输入输出单价,缓存读取降至每百万 token 0.25 美元。
来源只标注发布日期,没有具体时分;这里按原文日期显示。
收录:2026年9月5日 19:13 · 核验:2026年9月21日 00:57(UTC+8)
打开独立阅读页 一分钟读懂
- HySparse2论文提出两级KV共享;预填充可在自解码器后结束,跳过交叉解码器层。
- 研究方法
- 两级KV共享
- 实验模型
- 80B-A3B
- 证据边界
- 论文作者结果;未独立复现
发生了什么
HySparse2论文于9月22日提交,提出两级KV共享与混合稀疏注意力。KV缓存保存模型处理上下文所需的中间信息,长任务中这部分计算和存储成本会持续增长。
论文的方法组合KV Bridging与更细粒度的token选择,让预填充阶段可以在自解码器之后结束,跳过交叉解码器层,以减少前期计算。
作者在80B-A3B模型上报告长上下文检索、代理任务和资源开销的结果。本次核对的是论文摘要及提交信息,没有复现实验,也不能把论文直接等同于下一代MiMo产品已发布。
为什么值得关注
模型成本不仅来自输出速度。长上下文的预填充、缓存体积与信息检索质量,同样决定代理能否持续处理大量材料。
我的观察
长任务成本不仅来自生成token,预填充和KV缓存设计同样值得观察。
可能带来的影响
区分架构潜力与可直接部署的产品
研究提供了降低长上下文开销的方向,具体实现、硬件效果和产品支持仍需进一步核验。
还不知道什么
本站仅核对论文摘要与提交记录,未复现实验;不等于MiMo下一代产品正式发布。
发布方主张80B-A3B模型上的检索、代理效果与资源节省由论文作者报告。
时间线
原始发布
HySparse2论文提出两级KV共享;预填充可在自解码器后结束,跳过交叉解码器层。
arXiv v1提交时间为2026-09-22 13:10:32 UTC,换算为UTC+8的21:10:32。
收录:2026年9月27日 21:39 · 核验:2026年9月27日 21:46(UTC+8)
打开独立阅读页