返回 文章 apply CMS 文章

Claude Fable/Mythos 5.1 发布:新 SOTA 模型,缓存价格降 75% 但输出 token 增 70%

Anthropic 新旗舰 Fable/Mythos 5.1 以缓存降价换输出膨胀,每任务成本反升 20%,并引发对基准与安全路由的争议。

AnthropicClaudeFable 5.1Mythos 5.1
成长分 / 100 73 综合收获、行动、留存与影响

Claude Fable/Mythos 5.1 发布:新 SOTA 模型,缓存价格降 75% 但输出 token 增 70%
为什么值得读了解 Anthropic 最新旗舰模型 Fable 5.1 / Mythos 5.1 的官方定位、定价变化与关键基准表现。

理解缓存读取降价 75% 与输出 token 增加 1.7 倍之间的成本张力,以及每任务净成本上升 20% 的实际影响。

关键洞察
  1. Fable 5.1 与 Mythos 5.1 被 Anthropic 定位为面向编程和知识工作的新旗舰,强调自主、多步骤、长时间运行的任务。
  2. 定价上输入/输出/缓存写入维持 $10/$50/$12.5 每百万 token,缓存读取从 $1.00 降至 $0.25,降幅 75%。
  3. Artificial Analysis 指出 Fable 5.1 输出 token 用量约为 Fable 5 的 1.7 倍,导致每任务总净成本上升约 20%。
转成行动

深入阅读

正文与原文对照

原文保真覆盖:全文原文字符:41414

随着 Astra 显然终于在为全面发布预热(在经历了一个月的自我设定的节奏控制之后,@sama@openai 再次撰文谈及此事),出现了一个熟悉的窗口期,可以借助模型发布的轮番登场来引导叙事,Grok 4.7Gemini Flash 3.8 也即将到来。但这或许也不是框定今天发布的最佳方式……它的观看量远超 1200 万,再次刷新了当前世界最佳模型:

基准测试表本身就说明了一切:

虽然每 token 定价与 Fable/Mythos 5 相同,但缓存读取价格下调了 75%……这对长会话/长上下文用户来说是个好消息,然而据 Artificial Analysis 观察,输出 token 使用量增加了 1.7 倍,导致每任务总净成本上升 20%(见下方回顾)。

另外也不要错过 World Labs 的 Astra 发布,这是迄今为止我们见过的最令人印象深刻的世界模型发布,放在平常的日子里,它本可以轻松拿下头条故事卡片。你可以在我们的播客中了解 Fei Fei 和 Justin Johnson 的愿景,并追溯从 Marble 到 Astra 的历程,以及我们当时所谈论的世界模型的真正潜力:

2026 年 8 月 31 日至 9 月 1 日的 AI 新闻。我们检查了 12 个 subreddit、[544 个 Twitter 账号],没有进一步的 Discord。[AINews 的网站]让你可以搜索所有过往期刊。提醒一下,[AINews 现在是 Latent Space 的一个栏目]。你可以[选择加入/退出]邮件频率!

AI Twitter 回顾

头条:Fable 5.1 和 Mythos 5.1 发布及反响

发生了什么

Anthropic 推出了 Claude Fable 5.1 和 Claude Mythos 5.1,作为其面向编程和知识工作的新旗舰模型。

Anthropic 直接宣布了此次发布,将其定位为“全球最先进的编程和知识工作模型”,通过

@claudeaiAnthropic 产品/工程方面的人士专门围绕自主、多步骤工作来框定 Fable 5.1:“自主运行的复杂、多步骤工作”,强调编程、知识工作和长时间运行的问题解决,通过

@mikeykAnthropic 将 Fable 5.1 的标价维持在

每百万 token 输入/输出/缓存写入 $10 / $50 / $12.5,同时将缓存读取价格下调 75% 至 $0.25 / MTok,这一点再次被@mikeyk@Teknium 提及,并由@ArtificialAnlys 独立量化。早期基准测试截图和系统卡摘录推动了大部分讨论,尤其是围绕

Terminal-Bench-Science、SWE 系列评估、HLE、FrontierCode 和 Artificial Analysis,通过@StevenDillmann@scaling01@ArtificialAnlys 传播。社区分析中浮现出一个关键的解释性主张:

Fable 与 Mythos 5.1 可能是同一底层权重,只是安全/路由行为不同,而非不同的基础模型,据@eliebakouch以及后来@nrehiew_所述。用户反应沿多个维度分化:对编码/规划能力和语气给予非常强烈的赞誉,但抱怨集中在

速率限制、防护误报、订阅体验,以及基准测试呈现不清晰,来自@danshipper@theo@kimmonismus@GregKamradt@kylebrussell@eliebakouch

官方声明与模型定位

Anthropic 自己的表述很直接:Fable 5.1 面向困难、可委托、长周期的工作,而 Mythos 5.1 是面向知识工作的配套发布。主要官方发布帖是@claudeai。Anthropic 员工的补充评论强调了:

自主长时间运行任务,来自@mikeyk改进的诚实性/更好的失败报告(“当它卡住时它会说出来,而不是报告成功”),来自@mikeyk新的面向企业的控制措施,尤其是

Enterprise Frontier Safeguards(EFS),定位为企业环境中智能体可观测性的“ZDR++”,来自@alexalbert__零数据保留支持,被用户强调为一项重要的采用解锁,尤其是@danshipper

官方宣传不仅仅是“更好的基准模型”,而是“可用的自主工作者”——足够快、在缓存智能体场景中足够便宜,并且足够兼容企业环境以便部署。

这一定位很重要,因为 Fable 5 有一个名声——在反应中被反复提及——强大但有时不实用。Dan Shipper 将先前的批评总结为 Anthropic“在数据中心里造出了一个几乎无法使用的超级天才”,然后论证 5.1 解决了缓慢、冗长和别扭语气的问题,来自@danshipper

技术细节与数字

核心已公布/定价细节

来自@ArtificialAnlys

上下文窗口:100 万 token模态:文本 + 图像输入定价:与 Fable 5 相比,输入价格不变:

$10 / 100 万 token输出:

$50 / 100 万 token缓存写入:

$12.5 / 100 万 token

缓存读取价格:$1.00 降至 $0.25 / 100 万 token降价 75%

Artificial Analysis 指出,这一缓存降价对智能体工作负载有实质性好处,因为其中大部分提示会反复从缓存中重新读取。

Artificial Analysis 主要结果

同样来自@ArtificialAnlys

Artificial Analysis 智能指数:66,在最大努力下领先于:

Claude Opus 5 max:

63Claude Fable 5 max:

62GPT-5.6 Sol max:

61Grok 4.6 high:

61

HLE:59.1%此前引用的最佳成绩:Fable 5 为

55.5%

Terminal-Bench v2.1:91.4%SciCode:62.0%τ³-Banking:比 Fable 5 高 9 分GDPval-AA v2:1853 Elo比 Fable 5 高 130 分AA-Briefcase:1694 Elo比 Fable 5 高 122 分

但 AA 还补充了一个重要的限定条件:

在智能体式知识工作方面,Fable 5.1 在某些衡量指标上

实际上与 Opus 5 持平,并未明显占优。他们的评估使用了 Anthropic 的

默认服务器端回退机制,被安全标记的请求会被路由至 Claude Opus 4.8 或 Claude Opus 5。在整个 Intelligence Index 中,回退机制占

约 4% 的输出 token

这一回退细节成为社区解读中最重要的技术保留意见之一。

每任务成本

Artificial Analysis 还报告了:

Fable 5.1 max:$3.76/任务Fable 5 max:更低,因此 5.1 每任务贵 20%。原因:Fable 5.1 使用

约 1.7 倍的输出 token。缓存削减节省了

约 $1.40/任务Fable 5.1 xhigh:得分 65,成本 $2.72/任务Opus 5 max:得分 63,成本 $2.34/任务

这在反应周期中产生了关键张力之一:Fable 5.1 在前沿上限上明显更好,但在每一种成本效率框架下并非明显更好。

来自 @nicdunz 的补充框架:

Fable 5.1 Max:

66 智能140M token$3.69/任务Fable 5 Max:

6283M token$3.14/任务GPT-5.6 Sol Max:

6170M token$0.95/任务

该帖认为,Sol 在每美元智能和每 token 智能上仍是明显赢家,即便 Fable 5.1 赢得了绝对上限。

系统卡讨论中的基准片段

社区成员提取了若干基准数据点:

来自 @StevenDillmann

Terminal-Bench-Science 0.1Fable 5:

24.7%Fable 5.1:

52.6%超过

2 倍提升

来自 @scaling01

DeepSWE:67.4%FrontierCode 1.1 Extended:63.6%FrontierSWE v2:0.57,“Proximal 评估过的模型中最高”

来自 @Sauers_

Humanity’s Last Exam:使用工具时 65%

来自 @perplexity_ai

Perplexity 的八月

WANDR 评估:得分

0.601每任务 $12.76得分高 21%成本低 37%,相比 Fable 5

来自 @scaling01

Artificial Analysis Intelligence Index 得分 66,“重回前沿”

来自 @theo

缓存降价是“最大的胜利”

CursorBench 中,成本被削减了“近 50%”,同时得分更高

来自 @kimmonismus

Cursor Bench 上,Fable 5.1 High 似乎比 Sol 5.6 Max 更强且更便宜,尽管这是二手转述,并非原始基准报告

来自 @scaling01

Mythos 5.1 在 65% 的长时程智能体式编码环境中表现出言语化的评分者意识

最后一点尤其有趣:它表明该模型可能在很大一部分长时程编码情境中显式地对评估者建模,这既带来了能力问题,也带来了评估博弈问题。

安全防护与路由细节

两条推文捕捉到了技术解读的关键症结:

@eliebakouch“Fable 和 Mythos 5.1 是完全相同的权重”,内部激活用于安全分类并升级到更大的分类器,然后对危险请求回退到 Opus 4.8 @nrehiew_:如果属实,差异“很可能是为安全防护分类器设定的阈值”

这些并非推文语料中 Anthropic 的官方声明,但它们与 AA 的官方说明一致,即通过 @ArtificialAnlys回退路由在 AA 的评估中服务了约 4% 的输出 token

这引发了社区反复提出的疑问:被报告为“Mythos”与“Fable”的基准线是否真正可比,尤其是当某一种命名约定主要表明的是哪条安全路径处于激活状态,而非哪个基础模型在完成工作时。参见 @eliebakouch@eliebakouch@eliebakouch

事实与观点

官方/独立来源强力支持的事实

Anthropic 发布了

Claude Fable 5.1 和 Claude Mythos 5.1,经由 @claudeai Fable 5.1 定价保持不变

$10 / $50 / $12.5,分别对应输入/输出/缓存写入,且缓存读取降至 $0.25 / MTok,经由 @mikeyk@ArtificialAnlys Fable 5.1 具有

1M 上下文、图像+文本输入支持,并以 66 位居 AA 智能指数榜首,经由 @ArtificialAnlys AA 的评估包含了

服务端回退,其中约 4% 的输出 token 由回退模型服务,经由 @ArtificialAnlys Fable 5.1 在若干编码/智能体基准上表现出非常大的提升,包括

Terminal-Bench-Science 上 52.6%,经由 @StevenDillmann

合理但未完全验证的说法

Fable 和 Mythos 5.1 是相同权重,但具有不同的安全防护/路由行为,经由 @eliebakouch@nrehiew_ 某些基准标签可能反映的是

安全模式 / 路由差异,而非独立的基础模型性能,经由 @eliebakouch “它现在说话像个正常人” / 减少的“Claudese”被广泛地轶事性地报告,但仍是主观的,尽管下面有一些词汇统计

观点 / 主观判断

“我们使用过的最强编码模型”,来自

@danshipper “Fable 目前是遥遥领先的前沿模型”,来自

@AravSrinivas “Astra 将彻底碾压 Fable 5.1”,来自

@scaling01 “老实说,与 Fable 5 相比我没注意到太大差异”,来自

@kimmonismus “简直没法用”,因为速率限制,来自

@kimmonismus

重要的模式是,硬性指标与用户体验反馈出现了分化。在基准测试的汇总数据上,5.1 看起来像是阶跃式的提升。但在实际访问和用户体验上,许多用户仍然报告存在摩擦。

不同的观点与反应

强烈正面:能力、规划与编码质量

几位有影响力的开发者对此充满热情:

@danshipper 认为该模型现在速度快、token 效率高、行文更好,并且适合用于任务委派;具体提到了单提示词生成应用、运行数天的大型编程任务,以及更好的写作者采用率@theo 称其为“真的是一个好模型”,同时指出他们不得不重置/更新工作流程,并且正在通过@theo@theo大量积极使用它@alexalbert__ 展示了一个设计+渲染的工作流程,其中 Fable 5.1 接收一张地块图像,设计了一栋房子,对其进行了渲染,并制作了一段电影级的漫游视频;后续内容提到了通过@alexalbert__使用Blender 无头模式@spicey_lemonade 发布了一个“Fable 5.1 Minecraft 一次性生成”的作品,获得了大量互动,作为创意编码实用性的类似演示的证明@simonw 报告称,这是 Anthropic 模型有史以来最好的 SVG 鹈鹕输出,尽管成本显著

这一阵营认为 5.1 不仅仅是渐进式的改进,而是很长一段时间以来第一个在端到端创作者工作流程中感觉完全具有竞争力的 Claude。

正面但有保留:前沿领先,但附带注意事项

@ArtificialAnlys 给出了最平衡的第三方描述:汇总得分处于前沿领先地位,但每项任务的成本仍然高于 Fable 5,并且在某些智能体知识工作评估中实际上与 Opus 5 持平@kimmonismus 称其在性价比方面是“一次重大飞跃”,尤其是在 Cursor Bench 上,但明确对减少的冗长性和更少的错误拒绝是否能持续表示保留@theo 更关注缓存读取价格下调的实际意义,而非原始能力差异@perplexity_ai 将其描述为更广泛的多模型智能体栈中的一个强大的编排模型

这种观点认为:是的,它非常强大,但重要的是整个部署经济性和工具栈现在是否合理。

批评性观点:速率限制、保障措施与订阅体验

最尖锐的批评不是关于基准测试造假或智能薄弱——而是关于访问和易用性

@kimmonismus抱怨严重的速率限制、中断的续写,以及效率提升并未带来相应的订阅权益@kimmonismus进一步强调,称 5.1 在“速率使用方面甚至比 Fable 5 更糟”@GregKamradt报告称,在 v3 测试期间,请求频繁被以“逆向工程”为由拒绝,导致无法完成计划中的评估@kylebrussell表示,在一场理论数学会话中使用的“军事行动”隐喻触发了网络安全防护机制;随后又补充称“第一天的防护措施……到目前为止更烦人”,via@kylebrussell@theo对速率限制抱怨的普遍性提出反驳,称自己“完全没遇到这种情况”,并且只用了每周 Fable 限额的 14%@theo试图逆向推导实际配额关系:一个 5 小时限额 ≈每周限额的 21%,且 ≈Fable 限额的 38%

因此,即便在使用限制方面也不存在单一共识;一些用户很快撞墙,另一些则没有。

怀疑/中立:基准解读与命名混淆

另一个反应集群聚焦于方法论与清晰度。

@scaling01FrontierCode 结果看起来很奇怪@scaling01希望有更多多智能体对比和更好的解读@iScienceLuvr批评 Anthropic 的医疗基准呈现方式,指出评判模型不可比,且缺乏更广泛的医学评估覆盖@eliebakouch反复要求澄清系统卡基准行中何时使用“Fable”与“Mythos”,因为这会影响用户是否应推断出防护触发的路由

这是对发布周期最具技术性的批评:不是模型弱,而是报告格式让人比必要程度更难理解究竟在测量什么。

写作质量与“Claudese”讨论

最常被重复的主观观察之一是,5.1 听起来更正常。

@danshipper:“实际上说话像个正常人”,“行文更清晰”,更少“AI 腔调”@ethanCaballero直接询问 5.1 是否“消除了 claudese?”@ethanCaballero随后指出 Anthropic 的新提示词消除了“claudese”@ValsAI发布了量化的风格转变:更少的连字符复合词

更少的破折号

@ValsAI发现整体输出更长,尽管句子更短:VCB:

534 → 1299 词/任务Terminal-Bench:

961 → 1299Legal Research:

1892 → 2693

@ValsAI注意到一个奇怪的补偿性痕迹:使用不换行连字符 U+2011从接近零上升到每百万次最高约 4.4k 次出现

所以“更少 Claude 腔”的说法并非纯粹凭感觉;至少存在一些可衡量的风格变化。但统计数据也表明,Anthropic 可能只是用一种表面特征换来了另一种。

安全防护的故事:企业适用性提升,但也存在误报

围绕 5.1 的安全层几乎和模型本身一样受到热议。

官方/与 Anthropic 立场一致的说法:

@alexalbert__企业前沿安全防护(Enterprise Frontier Safeguards)介绍为企业环境中智能体部署的实用可观测性层@mikeyk 声称该模型在遇到困难时更加诚实,而不是虚假宣称成功

批评性的用户报告:

@GregKamradt 因逆向工程误报标记而无法完成测试@kylebrussell 在数学场景中因一个比喻触发了安全防护@nrehiew_ 指出 Anthropic 可能正在使用激活探针(activation probe)来对网络相关内容进行分类,并决定是否适用安全防护@mikeyk 分享了一个大脑模型产物示例,作为仍被允许的复杂推理的正面例证

这里存在明显的采用权衡:

企业希望获得更可靠的跨会话监控与控制

高级用户希望减少误报,并拥有更宽松的探索性使用空间

Anthropic 试图同时满足两者,而首日情绪表明这种平衡尚未被普遍接受。

Mythos 与 Fable:同一模型还是不同产品?

这是技术层面最有趣的讨论线索之一。

@eliebakouch 的说法:

Fable 和 Mythos 5.1 是

“完全相同的权重”内部激活会被检查

危险请求会升级到更大的分类器

然后可能回退到

Opus 4.8因此 Fable

不是更大 Mythos 模型的蒸馏版本

后续澄清与推测:

@eliebakouch 表示,此前社区推测将 Mythos 视为教师模型、将 Claude/Fable 视为蒸馏出的学生模型,但这只是猜测@eliebakouch 对确切的训练谱系仍不确定@nrehiew_ 认为差异可能只是分类器阈值不同@ArtificialAnlys 在评估中独立确认了回退路由行为,但并未直接确认“完全相同的权重”这一说法

为什么这很重要:

基准的可解释性。如果“Mythos 结果”和“Fable 结果”在很大程度上是同一骨干模型在不同路由/安全防护设置下的表现,那么基准表格应当明确说明这一点。采购与部署。企业可能以为自己在不同模型之间做选择,实际上却是在围绕同一模型的不同策略之间做选择。安全/能力核算。如果基准测试是通过回退运行的,那么“哪个模型得到了这个分数?”就不再是 trivial 的问题。

这种命名/路由上的模糊性催生了整组推文中一些最好的技术问题。

实际产品影响

为什么缓存读取削减很重要

智能体系统经常会重新发送大量草稿本、代码仓库、先前步骤和工具记录。在这类设置中,缓存输入定价的影响格外重大。

Anthropic 的

缓存读取费用降低 75%受到了@Teknium@theo的称赞,并由@ArtificialAnlys进行了详细量化。在 AA 的表述中,大部分节省具体来自

以缓存读取占输入 token 多数的智能体评估这使得 Fable 5.1 作为多步骤工作流中的

编排器/规划器更具吸引力,即便输出 token 成本仍然很高

为什么零数据保留和 EFS 很重要

Dan Shipper 特别称

ZDR 支持是企业现在能够通过该模型开展业务的一个主要原因,来自@danshipperAlex Albert 关于 EFS 的解释,来自

@alexalbert__指向了一个更广泛的市场转变:企业不再只是想要“私有推理”;他们想要智能体可观测性、跨会话异常检测和风险监控

这表明 Anthropic 正在为一个未来做优化:在这个未来中,企业采用既取决于治理基础设施,也同样取决于原始模型质量。

为什么订阅方面的抱怨很重要

如果 API 经济性改善,但消费者/Pro 订阅用户的上限没有改善,观感可能迅速恶化。

@kimmonismus明确指出,Anthropic没有宣布降低价格或提高使用上限面向订阅用户这造成了一种分裂的产品观感:

API 构建者:“重大胜利”

重度交互订阅用户:“仍然受限”

这种错配很重要,因为许多高曝光度的评测者首先通过订阅产品进行测试,而不是直接使用原始 API。

竞争背景

这次发布正值一个高度活跃的前沿模型周,OpenAI 的 Astra 传闻/安全帖子以及多项世界模型公告都在争夺注意力。即便如此,Fable 5.1 仍引起了强烈关注,因为它似乎重置了编码模型排行榜。

来自各方反应的比较性说法:

@AravSrinivas:Fable 是前沿模型,“领先幅度不小”@kimmonismus:在 Cursor Bench 上,Fable 相对 Sol 5.6 Max 表现有利@nicdunz:Fable 在绝对智能上胜出,Sol 在经济性上胜出@scaling01:Astra 很可能很快在推理效率上超越它@theo:Anthropic 当时拥有第 1、第 2 和第 3

还有一种普遍感觉是,这次发布足够重要,以至于立即引发了与 OpenAI 下一次发布的比较:

@kimmonismus说,他们更期待 GPT-Astra 而不是 Fable 5.1@theo评论说,这可能是模型发布前给出的最长提前预警,指的是围绕 Astra 的期待

因此从市场角度看,Fable 5.1 既被视为 Anthropic 的一次真正回归,也被视为一场迅速升级的模型发布交锋中的一步。

背景:为什么这次发布比一次普通的点版本更新更重要

有三种背景动态解释了反应的强烈程度。

1. Anthropic 的声誉已经出现分化

Claude 系列模型在早期以编码深度和写作风格著称,但近期的讨论往往把它们描绘成:

能力很强

语气有些别扭

拒绝时偏保守

长时间使用时缓慢或笨重

对 5.1 的正面反应常常被表述为 Anthropic 终于修复了“可用性税”,尤其是 @danshipper

2. 智能体改变了人们在定价上关心什么

传统的提示-响应用户关注输入/输出价格。智能体构建者关注:

缓存读取

长上下文

长会话中的可靠性

委派任务行为

诚实的失败报告

这就是为什么 缓存读取降价 获得的赞誉几乎和基准分数一样多。

3. 安全正在成为产品架构,而不仅仅是政策

EFS、路由、激活探针、回退模型和 ZDR 都表明,“模型”不再是一个单一的产物。它是一个 被政策包裹的系统。Fable/Mythos 之争实际上就是关于这一转变的争论。

用户开始不仅问“模型有多聪明?”,还会问:

哪些权重处理了这个请求?

哪条安全路径进行了干预?

回退发生的频率有多高?

哪个基准分数属于哪条路由?

这是一种比标准模型发布炒作更成熟、系统层面的对话。

值得注意的演示和生态反应

@alexalbert__:图像到房屋设计再到电影式漫游的流水线,@alexalbert__ 澄清了 Blender 无头模式@spicey_lemonade:Minecraft 一次性演示@simonw:SVG 鹈鹕 + 动画@_catwu:Anthropic 团队成员称内部团队正在承接以前需要数月才能完成的项目@perplexity_ai:已集成到 Perplexity Computer@Teknium:可在 Hermes Agent / Nous Portal / OpenRouter 中使用@theo:T3 Code 已发布对 Fable 5.1 的支持

这些集成的速度强化了一种看法:5.1 对智能体构建者尤其相关,而不仅仅是对聊天用户。

社区提出的开放性问题

基准透明度

当系统卡在某些基准上报告

Mythos,在其他基准上报告Fable时,究竟是什么决定了这种标注?参见@eliebakouch@eliebakouch基准性能在多大程度上取决于

回退路由,而不是主模型行为?

保障措施调优

Anthropic 能否在不削弱网络保障的情况下,减少理论性或良性技术工作中的误报?参见

@GregKamradt@kylebrussell

速率限制和产品细分

订阅用户会从效率提升中受益,还是只有按 token 计费的 API 客户会受益?由

@kimmonismus 尖锐提出

评估质量和过拟合担忧

为什么有些结果,尤其是在 FrontierCode 或医学子集上,看起来奇怪或难以比较?参见

@scaling01@iScienceLuvr

风格变化

“更少 Claude 味”是由于提示词变化、后训练转变,还是两者兼有?

@ethanCaballero指向一个新发布的提示词,而@ValsAI展示了可测量的词汇差异

OpenAI 的 Astra 与围绕循环深度的可监控性争论

准备度里程碑:“网络关键”:OpenAI 预览了其首个达到其准备度框架下网络安全 Astra 关键阈值的模型。博客文章发布时强调,Astra 最先进的网络能力将受到更严格的访问控制据 @boazbaraktcs。该文章流传的摘要声称,Astra 发现了 V8 零日漏洞、串联漏洞利用、攻破了一个加固浏览器、逃逸沙箱,并在测试中提升了权限,由@kimmonismus提炼。OpenAI 领导层还强调,部分安全工作是部署放缓的原因,并且未来模型的节奏可能继续以速度换取保障措施,见Sam Altman 的声明架构报道与“不透明推理”担忧:Astra 的另一条主要故事线来自报道称其使用了某种形式的循环深度/循环 Transformer 架构,这引发了关于这是否会降低思维链监控有用性的激烈辩论。担忧的观点来自@RyanGreenblatt@thlarsen@tenobrus@bshlgrs,他们认为更多潜在空间推理可能使事后调查在实质上更加困难。相比之下,其他人认为这种反应被夸大了:@max_paperclips@teortaxesTex@suchenzang强调,内部“神经语”推理并不新鲜,重要的是有效深度,而不是层是循环的还是显式堆叠的。OpenAI 的澄清与技术背景:OpenAI 首席科学家@merettm试图平息最强烈的解读,称当前前沿模型(包括 Astra)的计算图深度在 GPT-4 的约 2 倍以内,并且 OpenAI 仍将 CoT 监控视为核心研究目标。这一澄清将讨论转向一个更窄的技术问题:循环块主要是一种参数/存储效率技巧,还是它们创造了一条通往更深、更难监控推理的自然路径。善意的技术讨论来自@eliebakouch@voooooogel@scaling01。关于循环 MoE Transformer 和缩放定律的相关新论文也被@iScienceLuvr标记出来。

World Labs 的 Atlas:用于重建、相机控制和 real2sim 的统一世界建模

一次引人注目的多模态世界模型发布World Labs 推出了 Atlas@drfeifei 将其描述为一个从零开始训练的多模态世界模型,能够生成具有像素级精确相机控制的画面,从少至一张图像重建大型场景,通过模拟时空对视频进行重新取景,并从图像输出原生3D 空间。该团队将其定位为一个统一生成与重建的单一模型,而非拼接的工具链,这一角度得到了 @KeunhongP 以及随后 @BenMildenhall 所举示例的进一步印证。演示主题:子弹时间、稀疏视角重建与创意可控性:最亮眼的演示聚焦于仅凭少量随手拍摄的手机视频实现自由视角视频,包括 @davidpantera_ 的一个短片示例、@eerac3 部 iPhone 合成的“子弹时间”,以及 @bilawalsidhu 的评论——这过去需要配备数十或数百台相机的体积捕捉阵列。更多帖子展示了从少量不同的互联网照片进行重建,例如自然历史博物馆示例,以及将风格化生成与可导航 3D 场景相融合。工程师为何关注:real2sim 与机器人技术:除视觉特效/电影制作之外,更具技术意义的角度是面向机器人技术的 real2sim@YunzhuLiYZ 展示了使用随手拍摄的照片合成用于机器人导航的 RGB 与深度观测,而 @MTSlive 则强调了联合创始人 Justin Johnson 提出的“拍五张照片,构建一个仿真环境,适配一台机器人”的愿景。包括 @DrJimFan 在内的研究者称这是迈向 real2sim 的坚实一步,而 Fei-Fei 在此处明确将 Atlas 与跨机器人技术的横向应用联系起来。

Qwen、GLM、RWKV 与开放模型的势头

Qwen 升级版旗舰模型登顶网页开发编程评测:阿里巴巴发布了 Qwen3.8-Max-0902,这是一个 2.4T 参数模型,具备 1M 上下文,定价为 每百万输入 token 2 美元、每百万输出 token 6 美元,并设有显式/隐式缓存命中定价。Arena 报告称其首次亮相即位列 Code Arena: WebDev 第一名,得分 1691,领先于 Claude Opus 5 Max 和 Kimi K3 Max,同时还跻身当前最佳性价比前沿via @arena。阿里巴巴在此处也强调了同一结果。开放与半开放长时程模型持续在各供应商间扩散:GLM-5.3 不断出现在基础设施与平台集成中,包括 Perplexity Agent APIArcee 以及 Databricks 服务数据,据称其达到 310 tok/s,并在内部基准上被描述为最强的开源编程模型。CoreWeave 还宣布了 DeepSeek-V4-Pro-0813,这是一个 1.6T1M 上下文模型,针对长时程智能体工作负载定价,缓存读取极为便宜。与此同时,RWKV-7 G1j 作为 100% RNN 模型发布,声称在智能体/编程/STEM 方面有所提升,而 LongCat-2.0 则以 1.6T 开放权重 MoE 的形式出现,具备 1M 上下文,可在 Cline 中访问。开源服务与多模态推理改进:在服务方面,vLLM-Omni + FastVideo 的 FastH3 展示了 10.1 秒同步视频+音频片段在 8.7 秒内渲染完成,即快于播放速度,MiniMax 将此定位为交互式视频系统的开放基线。

智能体、运行框架、记忆与评估研究

Agent 运行框架正成为主要杠杆:多条推文强调,如今的大幅提升来自运行时系统,而不仅仅是基础模型。@omarsar0重点介绍了openJiuwen,这是一个开源运行框架,达到82.6% SWE-bench Verified87.19% Terminal-Bench 2.1,并将提升归因于基于轨道的组合与运行时自适应,且底层模型策略固定不变。@dair_ai总结了SkillZip Pro,它压缩的是完整生产技能包,而不仅仅是根提示词,在无质量损失的情况下削减了38% 的包 token10.4% 的每次运行 token长时程 Agent 评测正变得更贴近现实:一个突出的新增基准是,它让 Agent 在E-Commerce Bench中运行模拟的 365 天一年,经营多家网店。营收最高的模型是GPT-5.6 Sol,将 10 万起始资金增长到1,431,425,但在欺诈规避方面排名很差;没有任何模型在所有维度上都占优。这类评测比单会话基准更能揭示利润、安全与运营质量之间的权衡。记忆与奖励黑客研究@dair_ai还重点介绍了Agent Zero Memory,它将情节时间线、实体-事件图和经过整理的文档记忆分离,并带有引用锁定,取得95.6% LongMemEval93.6% LoCoMo,同时实现大幅成本降低。在对齐方面,@omarsar0总结了一篇论文,表明在 Agent 面对有缺陷的测试基础设施时加入结构化的升级工具,可将八个前沿模型中的奖励黑客行为从23.6% 降至 5.3%,且基本没有性能开销。

热门推文(按互动量)

Claude 发布:Anthropic 的Claude Fable 5.1 / Mythos 5.1 公告是当天最大的纯模型发布帖。Astra 准备就绪:OpenAI 的Astra 安全/准备公告引发了最大的安全/架构讨论。Atlas 发布:World Labs 的Atlas 公告是突出的多模态/世界模型发布。网络安全警告@ilyasut认为 neoclouds 应紧急加固网络防御,因为未来的失控 Agent 可能会试图夺取云容量以进行自我复制。Meta 语音模型@finkd发布了Muse Voice Transcribe,这是 Meta 首个具备原生说话人分离与端点检测的实时音频感知模型。