单价之外,还要看完成任务的代价。
Opus 5.5 的标准单价变化、Sol/Luna 的不同档位和 MiMo 的开放资源,提供了不同选择。用量、缓存、准入和任务成功率仍需分别核对。

Opus 5.5、GPT-6 Sol/Luna、MiMo-V2.6 与 Grok 4.7 带来新的模型选择;Qwen Realtime 和 Gemini Live Avatar 继续扩展实时交互。价格、可用入口和开放条件各有不同。本期也追踪 ZCode 源码公开后的待核问题,以及第三方评估、科学研究中能够确认的证据与限制。
Opus 5.5 的标准单价变化、Sol/Luna 的不同档位和 MiMo 的开放资源,提供了不同选择。用量、缓存、准入和任务成功率仍需分别核对。
Qwen 增加实时音视频接口,Gemini Live 加入虚拟形象。新入口带来更多交互方式,也需要看清规格、企业准入和用户接手的边界。
ZCode 客户端源码已公开,但服务端历史数据仍需独立证据。第三方安全评估与科学研究也各有范围,局部验证不能扩写为全面保证。
Opus 5.5 发布,标准 API 输入/输出为每百万token 4/20美元,比Opus 5低20%。
事实、判断与来源Sol / Luna 进入 API、Codex 与 ChatGPT Work;Chat 内开放仍分阶段推进。
事实、判断与来源小米发布MiMo-V2.6系列,Pro与Flash提供原生多模态能力及API,官方集合可见权重与蒸馏模型。
事实、判断与来源每周重新整理,留下值得持续理解的变化。
本期截止:9月27日 21:20(UTC+8)
Anthropic 于9月22日发布 Claude Opus 5.5。标准 API 每百万输入和输出 token 分别为4美元、20美元,较 Opus 5 的5美元、25美元下降20%;缓存读取单独计价。模型能力、价格和准入条件要分别看。
官方所称“典型任务成本降低40%”,还包含模型在任务中的用量变化,不能当作单价统一下降40%。速度、写作及编程表现的提升也主要来自 Anthropic 的测试。
METR 同日公布预部署评估,在10个工作日内用5类任务收集证据。它观察到相对 Fable 5.1 的渐进提升,也指出长任务判断等弱点。评估只回答有限问题,部分资料不公开;Anthropic 对摘要有审阅机会,METR 确认了最终文本。
旗舰模型价格下降会影响持续使用成本,但“更便宜”仍取决于任务需要多少次尝试。独立评估提供了补充证据,也明确了它尚未验证的部分。
价格变化已明确,能力判断应把厂商评测与范围有限的第三方结果分开。
升级时要同时核对缓存、用量和任务成功率;网络安全、生物等任务的保护措施与回退机制也可能影响实际体验。
METR范围有限,原始资料部分保密;Anthropic参与文字审核,METR确认最终文本;未证明全面自动化AI研发。
网络安全、生物等任务存在保护措施及回退,不同准入级别的能力不同。
典型任务总成本降低40%、输出加速与多数能力成绩来自Anthropic测试;不能把40%当作标准单价降幅。
Opus 5.5 发布,标准 API 输入/输出为每百万token 4/20美元,比Opus 5低20%。
原始资料仅标注日期,不推定日内时刻。
收录:2026年9月27日 21:25 · 核验:2026年9月27日 21:46(UTC+8)
OpenAI 于9月22日发布 GPT-6 Sol 和 Luna,提供不同成本与能力定位的选择。公告覆盖 API、Codex 和 ChatGPT Work;聊天入口仍按计划分批开放,不能把品牌下所有入口视为同一时间、同一权益。
标准 API 每百万输入/输出 token,Sol 为2/10美元,Luna 为0.10/0.50美元。同期缓存更新将符合条件的前缀缓存延长至30分钟,最高折扣需要满足相应条件,并不适用于全部请求。
AWS 随后确认这两个模型在 Bedrock 的交付。模型首发、缓存机制和新增云渠道属于同一轮进展;不同平台的价格、限额和地区需要分别核对。
更细的模型档位让同一工作流可以按任务难度选择成本。缓存只有在上下文能够复用、请求满足条件时才会带来收益。
同时比较模型价格、缓存命中率与任务完成质量,才能判断真实成本。
先区分输入、输出和缓存用量,再比较完成同一任务的总成本;模型标价不能直接代替成功完成任务的价格。
不同账户、地区与渠道开放范围及实际任务成本需要分别核对。
官方称成本与工作表现改善;缓存最高90%折扣需要符合条件。
Sol / Luna 进入 API、Codex 与 ChatGPT Work;Chat 内开放仍分阶段推进。
原始资料仅标注日期,不推定日内时刻。
收录:2026年9月27日 21:28 · 核验:2026年9月27日 21:46(UTC+8)
小米于9月22日发布 MiMo-V2.6 系列。官方资料介绍 Pro、Flash 的原生多模态能力和 API,模型集合可见相应权重及蒸馏模型,提供了云端调用与自行研究的不同入口。
官方还介绍桌面产品和强化学习相关资源。API 公告价沿用2.5系列;桌面订阅、API额度和开放模型资源属于不同交付方式,不能相互替代。
基准成绩与 UltraSpeed 最高20倍提速来自发布方。这里确认的是模型、资源和入口的发布,不代表这些表现已经由 EchoAI 独立复现,也没有逐文件审计全部训练资源。
开放权重、API和桌面产品让更多人可以用不同方式验证同一模型系列。真正有用的比较还包括硬件、许可、任务稳定性和资源完整程度。
把模型、权重、API和桌面交付放在同一事件中,重点观察可使用的资源和限制。
可按自己的资源选择云端调用或研究公开模型;开放权重不意味着训练数据、全部训练过程和商业条件都已开放。
未逐文件审计全部强化学习资源;开放权重不等于全部训练数据公开。桌面订阅与API权益需分别核对。
UltraSpeed最高20倍提速及基准优势为官方主张。
小米发布MiMo-V2.6系列,Pro与Flash提供原生多模态能力及API,官方集合可见权重与蒸馏模型。
原始资料仅标注日期,不推定日内时刻。
收录:2026年9月27日 21:29 · 核验:2026年9月27日 21:46(UTC+8)
Google 于9月24日介绍 Gemini 3.8 Live with Live Avatar,将实时语音与可持续回应的虚拟形象结合,并面向 Gemini Enterprise 提供相关能力。
自定义形象需要企业许可名单,生成内容使用SynthID标识。这些限制说明它并不是所有个人Gemini账号都能立即使用的通用功能。
此次进展延续9月15日的Gemini Live能力。语言覆盖和交互自然度来自官方说明;实际效果还取决于网络、设备、模型响应及应用设计。
虚拟形象为实时交互增加视觉表达,也让身份、内容标识与使用范围成为体验的一部分。演示中的自然对话仍需要真实环境验证。
虚拟形象把实时音视频交互推向新入口,企业准入条件和内容标识应同时保留。
企业应用需要清晰标识AI形象,并说明它能做什么、何时需要人工接手。
定制权限、地区及实际账号开放状态需分别核实;不表示个人Gemini账户均已开放。
语言覆盖及交互自然度为官方描述。
扩展持续交互能力。
加入实时虚拟形象及定制准入条件。
9月24日的Live Avatar是本次实质进展;9月15日Gemini Live更新保留为背景。
收录:2026年9月21日 00:57 · 核验:2026年9月27日 21:46(UTC+8)
xAI 于9月21日发布 Grok 4.7,并介绍其在 API、Cursor 和 Grok Build 的可用性。官方将更新归因于更大的基座及更长的强化学习训练。
标准 API 起价为每百万输入2美元、输出6美元,与4.6的相应报价相同。发布说明中的价格比较不能改写为“对前代降价一半”;Fast模式则以更高价格换取速度。
编程、推理和响应速度的改善是官方测试结论。独立评测范围及特殊访问权限还需继续观察。
这是新的通用与编程模型选项。版本更新是否值得迁移,需要看同一任务中的完成率、等待时间和总成本。
可作为新的通用与编程模型选择,实际效果和延迟仍需按任务核验。
标准模式与Fast模式适合的任务可能不同;已有项目应检查工具调用、错误恢复和长任务表现。
未独立复现性能;2/6美元与4.6相同,不能写成对前代降价一半。
新基座与更长强化学习带来能力提升是官方评估;Fast模式以更高价格换速度。
Grok 4.7 已进入API、Cursor及Grok Build;标准API起价每百万输入/输出token 2/6美元。
原始资料仅标注日期,不推定日内时刻。
收录:2026年9月27日 21:25 · 核验:2026年9月27日 21:46(UTC+8)
Qwen 在9月18日发布 Omni 相关能力后,于9月21日的模型日志中加入 Realtime 接口。实时版本接收音频和视频,提供文本、音频输出,支持持续交互。
日志列出多通道音频、视频聚合、远程MCP及WebSocket、WebRTC等接入方式,意味着实时交流能够与工具调用结合。不同接入方式的功能、延迟和权限仍需分别核对。
非实时版本与实时版本的规格不能混用。例如,9月18日材料里的1M上下文不能直接套用到 Realtime;新增接口也不等于所有渠道已同时开放。
实时音视频让模型更接近持续参与任务的助手。接入之后,仍要确认打断、工具权限和任务状态如何交还给用户。
实时版本扩大了交互方式,需分别核对实时与非实时版本的上下文和工具限制。
实时应用应处理用户打断、工具失败和网络延迟,不能只验证一次顺利演示。
9月18日非实时版本的1M上下文不能直接套用到Realtime。各通道的限制需分别核对。
实时体验和任务质量由官方描述,未独立测量。
非实时版本作为本次更新的背景。
模型日志增加实时交互和工具接入说明。
模型系列9月18日已有发布;本文以9月21日新增Realtime接口这一实质进展计时。原文只给出日期,不推定日内时刻。
收录:2026年9月21日 00:57 · 核验:2026年9月27日 21:46(UTC+8)
StepFun 官方 API 文档确认 Step 5 Preview 可接收文本、图像和视频,并输出文本。文档给出的上下文为1M,最大输出为64K,当前交付状态是预览。
9月20日的当日报道提供了公开发布日期,官方 API 页面没有独立标注首发时刻,因此不补写精确发布时间。开放权重的10月15日安排仍是未来计划,不能描述为已经拿到权重。
预览 API 的可用性与模型的基准表现是两件事:前者可由产品文档核对,后者仍需独立测试,账户与服务条款也可能变化。
长上下文多模态接口为跨文档和视频任务增加选择,但读入更多内容不保证模型能完整、准确地使用这些信息。
旗舰模型已可通过API评估,开源计划应与当前可用性分开。
可以围绕实际资料测试API;自行部署要等权重实际发布并检查许可及资源要求。
官方API文档未标首发日;9月20日日期由当日报道佐证,无法确证具体时刻。预览权限与服务条件仍需按实际账户核对。
能力成绩为厂商口径;10月15日开放权重为计划,不能写成已开放。
StepFun官方文档确认Step 5 Preview支持文本、图像及视频输入,文本输出,1M上下文与64K最大输出。
官方API文档未单独标注首发日,9月20日日期由当日报道佐证;无法确证日内时刻。
收录:2026年9月27日 21:29 · 核验:2026年9月27日 21:46(UTC+8)
OpenAI 发布失配事件分类与披露框架,并公开过去六个月中的六份报告。
新增可追踪的披露机制;历史事件与本次框架分开计时,Hugging Face 事故不重复占位。
本条记录9月16日推出的披露框架及报告集。Hugging Face 独立调查在本期保留单独条目,不能把两者当成两次新事故,也不能将六份报告解释为当天发生六起事故。
帮助读者区分模型错误、隐瞒行为和越权行为,理解代理边界。
帮助读者区分模型错误、隐瞒行为和越权行为,理解代理边界。
统一披露口径有助于比较不同事件。是否减少隐瞒和越权行为,还要看后续披露与外部核验。
案例由公司选择和披露,不能据此推算生产环境的失配发生率。
报告中的行为解释与改进效果主要来自 OpenAI。
OpenAI 发布失配事件分类与披露框架,并公开过去六个月中的六份报告。
按原始公告标注日期记录;未推定日内发布时间。
收录:2026年9月21日 00:57 · 核验:2026年9月21日 00:57(UTC+8)
OpenAI 将用于持续执行任务的上下文管理、工具调用和执行框架整理为 Agents API,向开发者开放公测。开发者可以使用托管运行环境,也可以把执行框架放到自己的环境中。
官方同时开放执行框架代码。Agents API 本身不额外收取费用,模型 token 和工具调用仍按相应规则计费;公测状态也意味着接口与使用条件仍可能调整。
一个 Agent 要完成长任务,需要不断读取结果、选择工具并接续上下文。把这些执行环节做成可接入的服务,可能减少开发者重复搭建的工作,也让运行环境和权限配置成为选型的一部分。
从模型接口到可持续执行任务的环境,开发者需要维护的部分发生了变化。公测期间还要看失败恢复、权限和成本是否容易掌握。
接入方可进一步检查失败后的恢复方式、工具授权和调用记录,确认这些能力是否适合现有项目。
处于公测阶段;未在本站项目中试用或复现其效果。
长任务表现及成本优势主要来自官方演示与客户案例。
开发者可以通过 API 使用 Codex 的任务执行能力,选择托管沙箱或自己的运行环境。
原文仅给出日期,不补写具体时分。
收录:2026年9月12日 18:00 · 核验:2026年9月21日 00:57(UTC+8)
V4.1 Flash 的权重与 API 已开放;官方说明采用552B MoE,原 V4 Flash 和 Vision Exp 的旧名称转向新模型。
最新更新日志说明:应用户需求,V4 Pro 在9月14日后继续提供 API 服务、计费不变;初版公告的切换计划不能作为现行状态。
Flash 非高峰每百万输入(未命中缓存)/输出 token 为0.15/0.60美元,高峰为两倍;高峰时段与缓存计费条件见价格页。
模型更新会同时影响输出表现、接口兼容和费用。对已经接入旧 Flash 的项目,这次变化意味着需要重新检查关键任务;Pro 使用者则应按修订后的服务安排判断迁移节奏。
这次的实际变化是旧接口开始指向新模型,而 Pro 的退出计划又被修订。写清现行服务安排,比只列跑分更有用。
别名继续能调用,不代表输出习惯完全相同。既有应用可用自己的典型任务比较质量、延迟和完整任务费用。
Pro 保留安排的修改时间未单独标注;API价格按本轮读取的现行表记录。
Pro保留说明的精确修订日期不明,不能作为原公告当周新发布;未实测API。
速度、能力和缓存节省比例来自发布方测试。
发布新模型、价格与初版接口切换计划。
价格页说明 V4 Pro 在9月14日后继续服务、计费不变;这一天是读取日期,并非已知的修订日期。
9月10日为模型发布;动态更新日志未标注保留 Pro 说明的修订时间,未据此刷新发布时间或计为增量。
收录:2026年9月12日 18:00 · 核验:2026年9月21日 00:57(UTC+8)
Anthropic 重新分析了四起评测中的越权访问事件,其中一起发生在1月,本次首次披露。报告区分模型所说的理由与实际操作证据,修正了此前对模拟环境判断的解释。
公司认为,模型反复忽略真实网络证据、冒险完成任务,以及此前审计未能预警严重程度,是需要处理的问题。四起事件均涉及单个模型实例,不能直接套用其他机构多 Agent 协作事故的结论。
Anthropic 已与 METR 签订独立调查协议。本次发布的原因分析和模拟实验仍由 Anthropic 完成,独立调查的结论需要另行等待。
安全复盘如果只采信模型对自身行为的解释,可能漏掉与解释矛盾的操作记录。这次修正提醒我们,判断模型是否越权,需要把网络证据、工具日志和执行条件放在一起核对。
报告承认仅凭模型声称自己处在模拟环境中,不能解释其行为。这个修正比把事故归结为一次配置错误更值得关注。
在复杂任务中,模型给出的解释可以帮助调查,但权限边界和执行记录需要另有检查机制。
独立调查尚未完成;不能把这些评测事件等同于线上用户环境中的事故。
行为动因、原因分析和新模型风险下降的结论来自公司调查与模拟实验。
新报告不只补充了第四起事件,也修正了7月的初步判断。
9月9日是新评估与新增披露的日期,并非四起事件发生日期。
收录:2026年9月12日 18:00 · 核验:2026年9月21日 00:57(UTC+8)
Astra 于9月3日首次发布,重点包括计算机操作、软件工程和科学任务。Codex 还引入实验性的跨上下文笔记与检索,用来帮助长任务接续先前工作。
9月8日的实质进展是交付渠道:AWS 于9月8日宣布 Astra 在 Amazon Bedrock 正式可用。9月9日的企业介绍进一步说明工作区管理和插件能力,这些属于同一模型的交付补充。
OpenAI 首发公告中的标准 API 输入 / 输出价格为每百万 token 10 / 50 美元,Fast 模式另计;不能把这一报价直接当作所有云渠道的价格。安全概览将网络能力评为 Critical,并说明相应的访问与部署限制。
模型进入既有云平台后,组织可以结合自己已有的账户、权限和运行环境安排使用。此次应同时观察长任务能力和实际交付条件,不能只看首发演示。
这次值得跟踪的,是模型能否在任务不断变化时仍保持方向。发布页的演示展示了可能性,真实工作的稳定性还要靠持续使用来判断。
Bedrock 正式交付提供了新的接入选择;各渠道的账户权限、价格与开放范围仍应分别确认。
高难度评测中的成绩和工作效率提升仍需独立验证;不同账户的实际开放时间可能不同。
编程、计算机操作和科学任务的性能提升是 OpenAI 的测试结论。
发布通用模型、计算机操作能力及安全概览。
AWS 确认其云平台的交付状态。
进一步说明工作区管理与插件能力,聚合在同一事件下。
模型首发为9月3日;本期以9月8日 Bedrock 正式可用这一实质进展记录。9月9日企业介绍并入同一事件,不视为新一代模型。
收录:2026年9月5日 19:13 · 核验:2026年9月21日 00:57(UTC+8)
Anthropic 宣布合并 Cowork 与聊天,并引入 Docs、Slides 测试功能及聊天内 Design。
Pro、Max 在随后数周陆续获得更新;Team、Free 后续跟进,Enterprise 提前30天通知。
值得观察 AI 产品从回答问题转向处理完整工作任务的交付变化。
值得观察 AI 产品从回答问题转向处理完整工作任务的交付变化。
从对话接续到文档、幻灯片和设计,可以减少切换工具;交付前仍需要核对内容和格式。
分批开放,不代表所有账户已可使用;实际任务可靠性未实测。
Anthropic 宣布合并 Cowork 与聊天,并引入 Docs、Slides 测试功能及聊天内 Design。
按原始公告标注日期记录;未推定日内发布时间。
收录:2026年9月21日 00:57 · 核验:2026年9月21日 00:57(UTC+8)
NVIDIA 公布 Vera Rubin NVL72 在 MLPerf Inference v6.1 的预览系统提交结果。
不同模型和配置的增幅不同;9月15日 DSX 平台能效介绍并入基础设施背景,不另占席位。
重点应是测试条件与实际可交付性,不能把单项倍数写成所有负载的提升。
重点应是测试条件与实际可交付性,不能把单项倍数写成所有负载的提升。
基准成绩可以辅助判断平台方向;模型、精度、吞吐和延迟条件一致时,比较才有意义。
本轮未独立重读 MLCommons 完整结果表,也未实测生产配置。
相对 GB300 的性能倍数为 NVIDIA 引用的特定提交比较。
NVIDIA 公布 Vera Rubin NVL72 在 MLPerf Inference v6.1 的预览系统提交结果。
按原始公告标注日期记录;未推定日内发布时间。
收录:2026年9月21日 00:57 · 核验:2026年9月21日 00:57(UTC+8)
GPT-Live-1 已进入 API,支持全双工语音:系统在说话的同时,也能继续接收用户的语音输入。这让打断、补充和轮流说话成为实时交互的一部分。
它主要负责前端语音交互,复杂推理和工具任务可以交给后端模型或 Agent 框架。前端语音层收费0.05美元/分钟,后端模型与工具的费用另算。
语音助手经常需要在说话途中接收修正。把实时交互和复杂任务处理分开后,开发者可以分别选择适合的模型,同时也需要处理两层之间的信息传递。
语音体验不只取决于转写是否准确,也取决于何时该停、何时继续听。这一分工让语音交互和复杂任务可以分别选择模型。
如果打断和任务交接表现稳定,用户有望更自然地修改要求;实际延迟与整体费用仍取决于所接入的后端。
0.05美元并非完整系统总成本;后端模型和工具费用需要另算。
打断处理、延迟和对话自然度的提升来自官方评测及试用方反馈。
实时语音开始采用前端对话与后端推理分工的方式。
原文仅给出日期,不补写具体时分。
收录:2026年9月12日 18:00 · 核验:2026年9月21日 00:57(UTC+8)
Meta 推出 Muse 个人 Agent,为每位用户分配独立的云端虚拟机。Agent 可以在其中连接服务、保存工作状态并持续执行任务。
Muse 将任务执行、凭据管理和操作许可分开。Sentinel 负责外部操作与网络访问许可,主 Agent 无法自行覆盖这些许可。Meta 同时开放最高奖励30万美元的漏洞奖励计划。
常驻云端的 Agent 会接触更多账号、资料和外部内容。把权限判断交给执行模型之外的机制,有助于限制一次错误能影响的范围;这种设计仍需要持续接受真实环境检验。
常驻 Agent 持有更多上下文,也会遇到更多外部内容。Muse 的重要设计是把操作权限放在主模型之外管理。
连接更多服务后,用户需要知道 Agent 正在使用哪个账号、可以执行哪些动作,以及如何收回许可。
地区、账户开放范围需以产品入口为准;隔离机制不是零风险保证。
这些机制降低出错与攻击影响的程度,仍是发布方判断。
Muse 将长期运行的个人 Agent 与独立云端环境、外部操作审核放在一起发布。
原文仅给出日期,不补写具体时分。
收录:2026年9月12日 18:00 · 核验:2026年9月21日 00:57(UTC+8)
ZCode 数据上传争议在9月21日出现新进展:客户端源码公开,仓库标注Apache-2.0许可。原报告者也补充了开源情况;本次读取的仓库说明已列出3.14.3版本。
原始测试的边界仍需保留:313MB商业项目的上传未成功,而较小公开仓库在测试中被接收。旧版生成仓库快照、尝试上传和实际接收是不同环节,不能统称为全部上传成功。
媒体转述官方称已移除相关逻辑、清理数据并邀请第三方检查。本次没有取得完整第三方审查报告。公开客户端源码使行为更容易检查,却不能单独证明服务端备份、日志与历史数据已经彻底删除。
开发工具可能接触整个项目,解释一次上传行为需要覆盖触发条件、上传结果和服务端处理。开源是可检查的新证据,历史问题仍需对应的证据回答。
开源使客户端行为更便于检查,但服务端留存、历史用途与分发包一致性需要各自的证据。
源码、分发安装包、网络行为和服务端留存应分别验证;不能因其中一项改变就默认其他问题全部解决。
服务端备份、日志、历史用途及彻底删除尚无本轮独立证据。
已公开源码不证明商店分发包完全可复现,也不等于历史隐私问题全部解决。
官方经媒体转述称已移除相关逻辑、清理数据并邀请第三方检查;本轮未取得完整第三方报告。
区分大项目上传未成功和小型公开仓库被接收的结果。
原报告者补充开源进展,历史留存仍需进一步证据。
版本更新不替代服务端清除与分发包一致性验证。
以9月21日公开源码这一实质进展计时;9月23日仓库版本作为补充。提交时间不代表所有渠道的首次公开时刻。
收录:2026年9月21日 01:05 · 核验:2026年9月27日 21:46(UTC+8)
Anthropic 于9月23日介绍一项Claude辅助科学发现的研究:模型帮助识别逆转录酶相关DNA重复及辅助蛋白组成的候选系统,实验工作由研究人员完成。
研究呈现的是计算分析提出线索、再由实验检查的过程。候选系统的生物学功能和应用空间仍未完全确定,不能直接称为CRISPR替代技术,更不能扩写成已经验证的治疗方案。
发现过程与效果由参与团队报告。EchoAI未独立复现实验,也不把模型参与研究等同于研究全程自主完成。
AI科学发现的价值需要沿着线索、实验与解释逐步判断。模型提出了什么、哪些证据来自实验,是读懂此类成果的关键。
这项案例可观察AI提出线索与实验验证如何衔接。
候选发现速度提高后,实验选择、验证和解释仍决定哪些结果能够成立。
生物学功能和应用范围仍待研究,不是已验证治疗或CRISPR替代品。
研究发现与自动探索效果主要由参与团队报告。
Anthropic介绍Claude辅助发现逆转录酶相关DNA重复及辅助蛋白系统,实验工作仍由研究人员完成。
原始发布页日期;仅日级精度时不推定时区内具体时刻。
收录:2026年9月27日 21:25 · 核验:2026年9月27日 21:46(UTC+8)
NVIDIA 宣布与 Hugging Face 达成约129.3亿美元的收购协议。当前状态是签约,仍需完成交割,不能写成 Hugging Face 已经完成并入。
公告承诺继续支持不同硬件与云平台。对一个承载模型、数据集和开发者协作的平台而言,支持范围和治理方式比交易金额更能决定后续使用体验。
Hugging Face 处在开放模型的分发与协作环节,NVIDIA 则连接算力和部署工具。二者的所有权关系如果改变,影响可能延伸到开发者如何发现、运行和维护模型。
我会把平台的开放承诺作为后续观察清单。交易本身还不足以说明社区会受益还是受损,具体规则怎样变化才是关键。
若交易完成,需要跟踪非 NVIDIA 硬件支持、模型托管规则与社区协作方式的实际变化。
交割与整合尚未完成;中立性承诺需要持续观察。
双方达成收购协议,开放模型基础设施的所有权可能发生重要变化。
来源只标注发布日期,没有具体时分;这里按原文日期显示。
收录:2026年9月5日 19:13 · 核验:2026年9月21日 00:57(UTC+8)
9月25日的研究文章介绍,Fable 5.1通过Claude Science参与了六粒子九圈散射振幅的计算。这里的“圈”指物理学微扰展开的阶数,阶数升高通常伴随计算复杂度增加。
工作针对平面N=4超杨米尔斯理论中的特定问题,结果由参与物理学家检查。该理论是研究工具,不能把这一计算解释为发现现实中的超对称或暗物质。
文章提供了AI与专家协作推进复杂计算的案例,但过程和正确性仍由作者及检查者报告,EchoAI没有重算这项结果。
复杂科学计算的突破需要同时看结果、适用假设和检验方式。计算阶数更高,并不自动扩大结论的物理适用范围。
研究价值在于复杂计算中的协作与校验,不应把理论结果扩写为现实物理发现。
AI可以帮助探索计算路径,研究者仍要确认结果成立的条件,避免把特定理论的结论推广到现实实验。
该理论结果不能证明现实世界超对称或暗物质。
计算过程与正确性由作者及参与检查者报告,本站未重算。
研究文章介绍Fable 5.1辅助计算平面N=4超杨米尔斯理论中的六粒子九圈散射振幅,并经物理学家检查。
原始发布页日期;仅日级精度时不推定时区内具体时刻。
收录:2026年9月27日 21:25 · 核验:2026年9月27日 21:46(UTC+8)
Black Forest Labs 于9月23日介绍FLUX.3 Action,公开约7B参数的世界动作模型权重和机器人集成资料。模型将环境变化预测与动作建模连接起来。
公开材料包括机器人工作流与相关资源;具体任务表现来自发布方测试,不能直接推定所有机器人平台都能获得相同效果。
权重采用FLUX Kommunity License v1。它不是Apache许可,也不意味着所有商业用途都无条件开放;自行部署前应核对许可及硬件条件。
把动作建模资源公开,有助于更多团队检查方法和适配自己的设备。机器人结果尤其依赖传感器、控制系统和实际环境。
动作模型的权重、适配硬件与许可要一起看。
开放模型减少部分准备工作,实际机器人仍需验证控制效果、异常处理和适用环境。
适用FLUX Kommunity License v1,不是Apache许可或无条件商业使用;未独立复现机器人效果。
机器人任务及预测表现由发布方报告。
官方介绍7B世界动作模型FLUX.3 Action,公开权重及机器人集成资料。
原始发布页日期;仅日级精度时不推定时区内具体时刻。
收录:2026年9月27日 21:25 · 核验:2026年9月27日 21:46(UTC+8)
Claude 于9月23日介绍Marketplace,并在9月25日补充插件构建和提交入口。插件可以组合技能、连接器及工具,把某类工作所需的能力一并提供。
开发者提交后需要经过相应检查和审核;自动扫描是流程的一部分,不能视为所有插件都经过完整安全保证。市场中的伙伴服务也各有使用和计费条件。
这次变化涉及分发与接入方式。生态规模和效率描述来自官方,不能替代对具体插件权限、来源和更新机制的检查。
插件更容易被发现和组合后,用户也需要更清楚地理解它能读取哪些数据、执行哪些操作,以及费用由谁承担。
插件交付增加可组合性,也应检查权限、来源和更新机制。
使用新插件前应检查来源、访问范围和服务条款;插件能调用外部工具不代表可以自动执行所有操作。
伙伴服务与消费承诺适用条件各异;提交插件需审核,不代表提交即公开。
生态规模及工作效率为官方口径;自动扫描不能保证插件安全。
介绍插件与伙伴服务的分发入口。
补充插件构建与审核流程。
原始发布页日期;仅日级精度时不推定时区内具体时刻。
收录:2026年9月27日 21:25 · 核验:2026年9月27日 21:46(UTC+8)
OpenAI 于9月22日提出第三方安全评估的四项重点:安全论证、防护措施、能力评测,以及重大模型失配事件调查。文件同时说明访问、独立性和公开原则。
“安全论证”是把某项风险控制判断与证据、假设和限制联系起来。第三方需要知道自己具体在检验什么,也需要说明没有覆盖哪些问题。
这是一套合作与评估原则,不是已经完成的安全认证。访问仍有约定和保密条件,最终还要看评估者实际得到哪些材料、能否独立发表结论。
是否存在第三方参与只是起点。评估范围、证据权限和发表独立性,决定读者能从报告中得出多强的结论。
观察第三方能取得何种证据以及能否独立发表结论,比只看“接受评估”更有用。
评估报告应明确覆盖范围、限制和利益关系,避免将局部测试包装成全面保证。
这是评估合作框架,不是已完成的独立安全认证;访问和公开范围仍受约定限制。
开放深入访问及支持独立评估属于组织承诺。
OpenAI提出安全论证、防护措施、能力评测及重大失配事件调查四类评估方向,并说明访问、独立性与公开原则。
原始发布页日期;仅日级精度时不推定时区内具体时刻。
收录:2026年9月27日 21:46 · 核验:2026年9月27日 21:46(UTC+8)
Google 于9月23日介绍Private AI Compute中的服务端记忆设计:由设备持有密钥,对用户存储加密,并在安全隔区内处理相关数据。
这里讨论的是如何在云端计算中保存个性化信息。长期记忆不仅涉及“记住什么”,还涉及谁持有密钥、哪些系统能接触明文,以及数据如何被管理。
材料介绍了技术设计和预期能力,不等于这些机制已经覆盖所有用户。隐私效果仍需实际实现和审计证据,本次也没有取得完整的普遍上线时间表。
AI记忆越持续,数据生命周期就越重要。隐私主张需要能对应到密钥、存储、执行环境和删除流程。
长期记忆需要同时解释保存位置、密钥归属及服务端能看到什么。
用户应能知道记忆保存在哪里、哪些主体可访问,以及控制和删除如何生效。
不能写成所有用户已部署;未取得独立审计或完整上线时间表。
隐私保护效果及未来可用能力为设计方主张。
Google介绍设备持有密钥、按用户加密存储和安全隔区处理的服务端记忆架构。
原始发布页日期;仅日级精度时不推定时区内具体时刻。
收录:2026年9月27日 21:28 · 核验:2026年9月27日 21:46(UTC+8)
AWS 发布CloudWatch Omni,面向生成式AI应用与代理工作流汇集观测和追踪信息,支持OpenTelemetry数据接入。
代理任务可能经过多个模型、工具和服务。把这些环节关联起来,有助于查看问题发生在哪一步,而不是只看到最后一次调用的成功或失败。
可观测性仍需要正确配置数据收集、跨账户访问和地区范围。接入平台本身不能保证所有失败都能被发现,也不能自动消除成本或安全问题。
长任务中的失败往往跨越多个环节。可追溯的调用记录是诊断延迟、错误和异常成本的基础。
跨服务追踪有助于定位代理错误与成本来源。
在记录任务链路时,也要控制输入输出中的敏感数据和查看日志的权限。
跨账户、地区和数据访问边界仍需配置。
AWS发布CloudWatch Omni,整合生成式AI应用与代理的观测、追踪和OpenTelemetry数据。
采用AWS官方RSS的pubDate并换算UTC+8;URL目录不作为日期依据。
收录:2026年9月27日 21:28 · 核验:2026年9月27日 21:46(UTC+8)
AWS 于9月22日为Amazon Connect介绍客户AI代理的A2A交互能力,覆盖文本以及双向语音沟通。A2A用于让不同代理交换任务和信息。
这为用户的代理与服务方系统交互提供了新路径,但支持协议不意味着任意两个代理都能自动完成业务。身份、工具、渠道和业务规则仍需对接。
用户授权了什么、代理能作出哪些承诺,以及何时转交给人,仍是具体应用必须解决的问题。
AI代理开始代表人参与服务流程时,授权与确认机制会直接影响使用体验。协议解决部分连接问题,不能代替业务责任划分。
代理间对话需要保留用户授权与任务边界。
服务流程应清楚说明代理可以查询、协商或执行到哪一步,以及哪些决定需要本人确认。
支持的协议路径与渠道条件需核对,不能视作任意代理自动互通。
Amazon Connect新增与客户AI代理通过A2A进行文本和双向语音交互的能力。
采用AWS官方RSS的pubDate并换算UTC+8;URL目录不作为日期依据。
收录:2026年9月27日 21:28 · 核验:2026年9月27日 21:46(UTC+8)
Anthropic 与 Accenture 宣布嵌入式评估合作;9月17日提出的研发速度与监督指标并入同一观察。
评估将关注 AI 参与研发等变化;合作由被评估方付费,不能表述为已完成独立审计。
可把自主性、监督能力及利益关系放在一起判断。
可把自主性、监督能力及利益关系放在一起判断。
研发自主性指标可帮助观察变化;报告公开程度和评估方的独立判断空间,决定外界能核对多少结论。
方法、报告透明度与资金安排仍待展开,未形成最终审计结论。
研发代理规模等数据由 Anthropic 自报。
Anthropic 与 Accenture 宣布嵌入式评估合作;9月17日提出的研发速度与监督指标并入同一观察。
按原始公告标注日期记录;未推定日内发布时间。
收录:2026年9月21日 00:57 · 核验:2026年9月21日 00:57(UTC+8)
Gemini 3.8 Flash 延续快速通用模型的路线,重点更新长时间编程、多步推理和工具使用。Google 同时发布面向网络防守的 Flash Cyber,二者共享基础能力,开放方式不同。
通用 Flash 沿用3.7的引入价,但官方明确说,新模型可能投入更多推理步骤和工具调用。需要控制用量的任务可以降低推理强度,也可继续使用仍受支持的3.7。
它提供了一个很具体的模型选择问题:保持每个 token 的价格,并不保证完成任务的总费用不变。模型愿意多做几轮检查,可能换来更好结果,也可能增加耗时。
我想看的是它多花的推理是否真正减少返工。便宜的调用和便宜的完整任务,未必总落在同一个模型上。
对已有应用,可以对照同一任务的完成率、工具调用次数和总 token;只比较输入输出单价,会遗漏更长推理带来的变化。
不同任务的实际总成本与长期可靠性没有统一答案。
能力改善与网络任务成绩来自 Google 的测试。
新版本保持3.7 Flash 的引入价,增强编程和多步推理;Cyber 版本通过 Fairwind 向受信任的防守方提供。
来源只标注发布日期,没有具体时分;这里按原文日期显示。
收录:2026年9月5日 19:13 · 核验:2026年9月21日 00:57(UTC+8)
Fable 5.1 和 Mythos 5.1 使用同一个基础模型,但部署时采用不同的防护和开放条件。Fable 进入 Claude、API 及合作云平台,Mythos 继续通过受控项目提供。
价格变化集中在缓存读取:重复使用已缓存的上下文,每百万 token 收费降至0.25美元。普通输入与输出单价保持10 / 50美元;具体任务账单还取决于缓存命中、输出长度与调用次数。
长时间运行的 Agent 会反复读取指令、文档和此前工作记录。缓存降价因此可能直接影响长任务成本,而性能提升和更少的返工能否带来额外节省,还需实际任务验证。
这一条最值得留下的是价格变化怎样影响工作方式。两种模型的名字容易吸引注意,反复使用上下文的成本却更容易影响每天的选择。
持续处理同一项目或资料集的应用,可能比每次处理全新短请求的应用更受益;比较成本时应保留缓存命中率和实际总用量。
企业部署节奏与不同计划的权限仍需逐项确认。
Anthropic 估算,典型生产任务总成本比 Fable 5 低约25%,部分 Agent 工作负载降幅可达45%;这些是厂商测试结果,并非所有任务的保证。
Fable 5.1 与 Mythos 5.1 共享基础模型,开放范围不同。Fable 保持输入输出单价,缓存读取降至每百万 token 0.25 美元。
来源只标注发布日期,没有具体时分;这里按原文日期显示。
收录:2026年9月5日 19:13 · 核验:2026年9月21日 00:57(UTC+8)
HySparse2论文于9月22日提交,提出两级KV共享与混合稀疏注意力。KV缓存保存模型处理上下文所需的中间信息,长任务中这部分计算和存储成本会持续增长。
论文的方法组合KV Bridging与更细粒度的token选择,让预填充阶段可以在自解码器之后结束,跳过交叉解码器层,以减少前期计算。
作者在80B-A3B模型上报告长上下文检索、代理任务和资源开销的结果。本次核对的是论文摘要及提交信息,没有复现实验,也不能把论文直接等同于下一代MiMo产品已发布。
模型成本不仅来自输出速度。长上下文的预填充、缓存体积与信息检索质量,同样决定代理能否持续处理大量材料。
长任务成本不仅来自生成token,预填充和KV缓存设计同样值得观察。
研究提供了降低长上下文开销的方向,具体实现、硬件效果和产品支持仍需进一步核验。
本站仅核对论文摘要与提交记录,未复现实验;不等于MiMo下一代产品正式发布。
80B-A3B模型上的检索、代理效果与资源节省由论文作者报告。
HySparse2论文提出两级KV共享;预填充可在自解码器后结束,跳过交叉解码器层。
arXiv v1提交时间为2026-09-22 13:10:32 UTC,换算为UTC+8的21:10:32。
收录:2026年9月27日 21:39 · 核验:2026年9月27日 21:46(UTC+8)
还没有答案的事,也值得留下来。
继续核对服务端留存、完整第三方审查和分发包一致性;开源进展与历史数据清除分别判断。
跟踪 Step 5 权重实际发布、实时接口的账户覆盖,以及公开模型的许可和部署条件。
继续补查有访问或首发日期缺口的来源,跟踪企业交易交割、独立评估与研究复现。