返回 文章 apply CMS 文章

Claude Opus 5.5 发布:性能对标 Fable 5.1,成本降低 40%,成为 AINews 新默认模型

Claude Opus 5.5 以 Opus 价格提供 Fable 5.1 级能力,成本降 40%,写作显著改进,AINews 已迁移。

Claude Opus 5.5AnthropicOpenAIGPT-6
成长分 / 100 71 综合收获、行动、留存与影响

Claude Opus 5.5 发布:性能对标 Fable 5.1,成本降低 40%,成为 AINews 新默认模型
为什么值得读了解 Claude Opus 5.5 的核心升级:性能、成本、写作改进及默认模型变更。

掌握 OpenAI GPT-6 Sol/Luna 与 Anthropic 的定价竞争格局。

关键洞察
  1. Opus 5.5 在大多数任务上达到 Fable 5.1 水平,运行成本比 Opus 5 低 40%,速度快约 30%。
  2. 写作改进是罕见强调点:模型把最重要信息前置并遵循写作规则,AINews 已立即迁移至 Opus 5.5。
  3. 定价下调 20%(输入/输出 4/20 美元每百万 token),但更高 token 使用量部分抵消节省,最大 effort 下每任务成本与 Opus 5 持平。
转成行动

深入阅读

正文与原文对照

原文保真覆盖:全文原文字符:34755

OpenAI 做出了英勇的努力,GPT-6 Sol 和 Luna 的发布价格比 GPT-5.6 低 50%,但发布内容已获得 1700 万次浏览且仍在增长,今天注定属于 Claude Opus 5.5——“我们全新 Claude 5.5 家族中的首个模型”,其表现“在大多数任务上堪比 Claude Fable 5.1,而运行成本比 Opus 5 低 40%”。

Opus 5.5 在大多数基准测试中击败 Fable 或挑战 Astra,两家实验室都将 API 降价归功于效率优化工作,但从预填充到解码再到整体计算,各处都有巨大的两位数提升……

……同时在某些前沿任务的 token 使用上出现了抵消性的效率低下。

然而,Claude 此次发布中一个罕见的强调点是写作方面的改进:“它把最重要的信息放在前面,并遵循你给它的写作规则,这让长会话更容易跟进。”

我们可以证实——以下是今天在 Opus 5.5 和 Sol 6 上运行的 AINews 板块。差别天壤之别——我们将立即把 AINews 迁移到 Opus 5.5,直到我们迎来下一个模型/版本的 AINews。

他们还发表了关于大型多智能体集群的初步工作(以及效率):

2026/9/21-2026/9/22 的 AI 新闻。我们检查了 12 个 subreddit、[544 个 Twitter 账号],没有进一步的 Discord。[AINews 的网站]让你搜索所有过往期刊。提醒一下,[AINews 现在是 Latent Space 的一个板块]。你可以[选择加入/退出]邮件频率!

AI Twitter 回顾

头条:Claude Opus 5.5 发布、数据与反响

发生了什么

Anthropic 发布了 Claude Opus 5.5,这是全新 Claude 5.5 家族中的首个模型。其卖点是以 Opus 的价格提供 Fable 5.1 级别的能力,同时速度更快、写作更好。OpenAI 大约一小时后发布了 GPT-6 Sol 和 Luna。

发布声明。Opus 5.5“在大多数任务上达到 Claude Fable 5.1 的水平,而运行成本比 Opus 5 低 40%”(@claudeai@AnthropicAI)。领先之处。Anthropic 称其在智能体编程、计算机使用和知识工作方面领先(@claudeai)。速度与成本。它比 Opus 5 快约 30%,每任务成本低约 40%(@ClaudeDevs@lydiahallie)。沟通修复。该模型把最重要的信息放在前面,并遵循用户的写作规则。这针对的是对 Opus 5 最常见的反馈(@claudeai)。订阅变更:5 小时会话限制提高了 20%。

更低的价格意味着限制可以多用 25%。

Pro、Max 和 Team 用户获得一次可存储的速率限制重置,可随时使用(

@claudeai@ClaudeDevs@trq212)。

新的默认设置。 Opus 5.5 现已成为 Claude Code 和 Claude 应用(包括 Cowork)的默认模型。默认努力程度为中等,被描述为“在智能水平上与 Fable 5.1 相当,但速度更快”(@_catwu)。可用性。 它已在 Claude Code 和 Claude Platform API 中上线(@ClaudeDevs),并在 Slack 的 Claude Tag 中可用(@_catwu)。路线图。 Sonnet 5.5 和 Haiku 5.5 将在“未来几周内”跟进(@mikeyk@AiBattle_)。这与 Haiku 已停产的传闻相矛盾(@kimmonismus)。保障措施。 Opus 5.5 是首个在网络、生物和前沿 LLM 开发方面具备 Fable 5.1 级别保障措施的 Opus 模型。被标记的请求会回退到另一个模型,Anthropic 表示正在“努力减少错误标记”(@ClaudeDevs)。发布前信号。 该模型在公告前不久出现在 Claude Code 中(@kimmonismus)。系统卡。 已在发布时公布(@scaling01)。

定价与 token 经济学(事实)

标价。 Token 定价下调 20%,从每 100 万输入/输出 token 5 美元/25 美元降至 4 美元/20 美元(@ValsAI)。被更高的 token 使用量抵消。 Vals 指出 Opus 5.5 通常使用更多 token,尤其是在编码方面,其最大提升也体现在此。较低的标价部分被使用量抵消。Artificial Analysis 成本分解。 在最大努力程度下,Opus 5.5 每个 Intelligence Index 任务花费 5.98 美元,而 Opus 5(最大)为 5.86 美元。他们的分解(@ArtificialAnlys):仅更高的 token 使用量就会使每任务成本增加约 80%,达到 10.51 美元。

20% 的基础价格下调将其降至 8.41 美元。

更便宜的缓存读取(0.20 美元)将其降至 5.98 美元。

这意味着什么。 在最大努力程度下,相对于 Opus 5 的每任务节省消失了。“便宜 40%”的说法适用于默认(中等)设置。相对于 Fable 5.1。 Cline 报告称,Opus 5.5 在 Artificial Analysis Intelligence Index 上以约低 2.5 倍的成本击败了 Fable 5.1(@cline)。提示缓存。 在 Claude Code v2.1.280+ 上,会话中途切换努力程度不会破坏提示缓存(@lydiahallie)。模型大小(推测)。 @theo 声称 Opus 5.5 比 Opus 5 更小,并将其归功于后训练。这未在官方帖子中得到证实。

基准测试与独立评估

Anthropic 自己的表格。 Opus 5.5 在 Anthropic 头条对比的每一行中都击败了 Fable 5.1,并在大多数行中击败了 GPT-6 Astra(@kimmonismus@synthwavedd@scaling01)。

@ShayneRedford(Anthropic)总结了所声称的提升:

在 CursorBench、KWBench 和 OSWorld 上强于 Astra。

风格和指令遵循能力大幅提升。

科学和健康能力更强。

在抵御网络与生物滥用方面更为稳健。

第三方与合作伙伴评测:

EvalResultSourceVals Index#1,较 Opus 5 上升 2 位 / 2 分;Anthropic 占据前三名(GPT‑6 Sol 待定)@ValsAIVals RSI Index#1;首个在其协议下于 LM Training 上击败公开参考模型的模型;击败 Fable 5.1@ValsAI@ValsAIFrontierSWE (Proximal)62.3%,位列第 2,落后于 GPT‑6 Astra(65.5%);领先于 Fable 5.1(56.3%)和 Opus 5(52.0%)@ProximalHQFrontierCode 1.1 (Cognition)在 Extended 上达 65.3%;“以极低的成本”从 Fable 5 手中夺得第 1 名@cognitionCursorBench57.8%(Max),新的最佳模型;每任务成本比 Opus 5 低 40%@cursor_aiPerplexity WANDR0.610,每任务 $4.13;略高于 Fable 5.1,成本低 67.6%@perplexity_aiParseBench(表格)93.9%,较 Opus 5 提升 7 分;击败 Fable、Gemini、Astra@jerryjliu0Roboflow 视觉/检测“迄今为止 Anthropic 最好的视觉模型”;现已在 Playground 排行榜上跻身领先 Google 的模型之列@skalskip92@skalskip92

评测细节与注意事项:

Vals 运行设置。RSI 在原生 Claude Code 中以最大 effort 运行,使用 1M 上下文、128K 最大输出 token,温度设为 1(@ValsAI)。ParseBench 注意事项。该模型在图表、格式和布局方面仍表现吃力。按每页 5.8¢ 计算,LlamaIndex 称其对于生产级 OCR 而言过于昂贵。该结论来自一家拥有竞争产品的供应商。AI 研发 vs 编程。@eliebakouch将系统卡解读为“在 AI 研发上大致相当,但在智能体编程上是一头猛兽”。饱和。@scaling01询问 CoBench 是否“已经完蛋”。@synthwavedd调侃了一个刚推出就已饱和的新基准。竞技场。Opus 5.5 已进入 Agent Arena,并参与 WebDev、Text、Vision 和 Document 的 Battle Mode。尚无分数(@arena)。

Effort 扩展异常。在一张智能体编程图表上,xhigh effort 的成本约为 medium 的 2.8 倍,而分数却低 3.2 分@LearnOpenCV)。@Yuchenj_UW称其为“最离奇的基准结果”,并建议坚持使用 medium。

@nrehiew_给出了一种解释:

Opus 5 在 FrontierCode 上表现出相同的模式。

FrontierCode 会惩罚不必要的改动,而更高的 effort 会产生范围蔓延。

结果,模型“在更高的推理 effort 下始终表现更差”。

系统卡细节

多智能体扩展。系统卡在第 8.12 节中报告了最多 100 个并行智能体 的扩展。@scaling01 称其为同类中的首份实验室报告。@maksym_andr 将其强调为多智能体扩展定律的证据。ProgramBench 的注意事项。ProgramBench 作者 @OfirPress 指出,Anthropic 接近 100% 的解决率来自 166/200 的子集。该子集很可能排除了最困难的程序,例如 FFmpeg 和 PHP 编译器。他还指出了指标不匹配的问题(@OfirPress@OfirPress):Anthropic 报告的是平均测试通过率。

ProgramBench 报告的是完整任务完成情况。

部分解决通常能通过 60–70% 的测试,这会抬高通过率指标。

与 Mythos 5.1 的比较。Opus 5.5 在 Anthropic 的 ECI 上得分高于 Mythos 5.1,并在所有测试过的网络评估中击败它(@scaling01@scaling01)。奇怪的错位发现。@teortaxesTex 引用了一段话:恶意输出“几乎只出现在以下情况中:在恶意输出之前,Claude 犯了一个不太可能的、无害的错误。”他问 Anthropic 是否“把自己变成了潜伏特工”。“从 RSI 训练而来。”他另外引用了一句关于“第一个从 RSI 训练而来的模型”的话,并称其令人担忧(@teortaxesTex)。生物医学成像。@iScienceLuvr 对报告中提到的生物医学图像分析能力表示欢迎。要求更多。@scaling01 要求提供无思维链的时间跨度。

安全姿态与保障措施争议

官方立场:

Sam Bowman:Opus 5.5“比其前代产品安全得多,以至于发布它更有可能降低与错位相关的风险”,尤其是对于最极端的对齐风险(

@sleepinyourhat@sleepinyourhat)。他还承认担心能否跟上不断升级的风险,同时表示当前工具在此能力水平上仍然值得信赖(

@sleepinyourhat)。Mike Krieger 引用了广泛的对齐测试和外部评估,包括 METR 的评估(

@mikeyk)。

摩擦:

过度触发回退。@iScienceLuvr 在要求 Opus 5.5 治愈癌症后被降级到回退模型。针对中国(单一测试)。@xlr8harder 表示,一项快速测试表明前沿 LLM 开发分类器针对的是中国硬件。他呼吁进行更多探查。对中国角度的反应。@teortaxesTex 将此描述为 Anthropic 在削弱中国 AI。@jakehalloran1 将其解读为保护 Trainium 的专有技术。

“为前沿定节奏”的框架:

@theo 认为今天发布的版本没有一个是 Astra 或 Fable 级别的,这是有意为之的节奏。@goodside 表示,实验室呼吁放缓前沿发展的电话削弱了他“暂停然后做什么?”的立场。@dejavucoder 嘲讽了这一说法,因为 Opus 5.5 的表现优于 Fable 5.1。

写作、提示和行为

来自员工的写作修复。“我们修复了写作” (@_sholtodouglas) 和“我们修复了口音” (@NotTomBrown)。不寻常的坦率。@(Anthropic)发帖称:“比 Opus 5 好得多得多得多。对那个模型感到抱歉。”nmca@theo 称这是一条疯狂的推文,表明沟通更加宽松。破折号。@theo 报告称它们已从输出中消失。这是互动最多的反应帖。Anthropic 的提示手册 (@ClaudeDevs):交办整个任务并定义“完成”和检查点。

去掉“仔细思考”,因为模型总是先思考。

长时间运行后,询问它需要什么才能更进一步。

为什么旧技巧失效。@dbreunig 指出旧的提示技巧现在与模型的训练相冲突,这是支持可重新编译的提示优化的论据。长时间运行的引导。@omarsar0 强调了 Anthropic 针对长时间运行的提示,模型有时会停下来报告而不是继续。错误报告。实时模型有时会生成用户轮次 (@BlackHC)。实践中的写作质量。Hamel Husain 直播了“Is Slop Dead?”来测试其写作 (@HamelHusain)。@nptacek 分享了一个个人写作评估的一次性结果。

视觉、3D 和代码即艺术演示

改进的感知。Sholto Douglas 表示 5.5 系列在 3D 理解和建模方面“有重大提升”,并且该模型“现在能看见了;之前有点盲” (@_sholtodouglas, @_sholtodouglas)。用代码绘画。@jkeatn 让模型用纯 Python 逐像素生成画作:约 7,500 行代码,使用标准库模拟画笔风格。

没有图像模型,也没有参考图像。

Sholto 将这种“手动画笔”的创造力与扩散模型进行了对比(

@_sholtodouglas)。

Blender 场景。Alex Albert 展示了在 claude.ai 上通过一个提示生成的 Blender 黏土动画 (@alexalbert__)。他还构建了一个基于来源的 1906 年旧金山市场街:基于 Sanborn 地图、时代电影和档案照片构建。

仅使用程序化生成器,没有下载的网格或纹理 (

@alexalbert__prompt)。@karpathy 顺着这个想法发挥:把历史图像或视频变成可以走进去的定制 GTA 风格世界。

更多演示:一个用代码绘制的 JS 动画(

@kevin_t_ngo)以及一个官方探索帖(@claudeai)。一座代码生成的金门大桥,在 3D 场景方面被评为“和 Astra 一样好”(

@petergyang)。“我测试过的所有模型中最好的视觉设计”(

@other__reality)。一张珊瑚礁壁纸;制作者说它感觉大约快 3 倍、便宜 3 倍(

@chaseleantj)。

开放问题。@teortaxesTex 问为什么这一代模型如此擅长把函数映射到像素,并提出了泛化的可能。

反应:支持、怀疑、比较

支持:

流水线缺陷。@rishdotblog 说它发现了 Fable 和 Astra 漏掉的流水线问题。它还发现了 7 处 SEC 申报错误,包括 Comfort Systems 的一处 XBRL 错误标记,把第一季度收入标成了全年(@rishdotblog)。回归用户。“Claude 回来了”:@Yuchenj_UW 说他离开一个月后正回归 Claude Code。使用限制。全天高强度使用“几乎没怎么消耗”限制额度(@theo)。怀旧。与广受好评的 Opus 4.5 和 4.6 作比较(@arohan@kimmonismus)。竞争框架。@scaling01 说 Anthropic“又在碾压前沿了”。@kimmonismus 说“他们选择与 OpenAI 开战”。

怀疑或中立:

信任赤字。@kylebrussell 说他不再相信 Opus 的发布能让人感觉更好。Sholto 回复问这一次是否重置了那种信任(@_sholtodouglas)。限制并非对所有人都重要。@stablequan 反正从来碰不到限制。价格成为头条。@dbreunig 问,两家实验室的头号卖点都是更便宜的 token,这意味着什么。

与 GPT‑6 Sol 的正面对决:

支持 Opus 的一方。@andrew_n_carr 称 Opus 5.5“把”Sol“甩得团团转”。@synthwavedd 称 Sol 的表现低于预期,Anthropic“赢得了这一天”。反对的一方。@teortaxesTex 认为,Opus 5.5 的成本优势和多智能体方面的胜势“实际上被 Astra+Sol+Luna 的刷屏式使用所抵消”,因为 Sol 的价格只有 Opus 5.5 的一半(@scaling01)。中立的一方。@kimmonismus 的总结认为没有明确的赢家:Anthropic 在能力惊喜度上领先,OpenAI 在价格上领先。@simonw 发表了一篇对比文章,用不同努力水平下的鹈鹕网格对全部三款模型进行了比较。

OpenAI 的 GPT-6 Sol 和 Luna:面向 Codex、Work 和 API 的更便宜的 Astra 衍生模型

OpenAI 在数小时内做出了回应,推出了

GPT-6 SolGPT-6 Luna,被描述为更快、更便宜的模型,继承了 GPT-6 Astra 在编程、计算机使用、事实准确性和对齐方面的大部分进展 @OpenAI @OpenAIDevs。定价颇具进攻性:Sol 为每百万输入/输出 token 2 美元 / 10 美元Luna 为 0.10 美元 / 0.50 美元,各自比其 GPT-5.6 前代产品便宜约 50% @OpenAI。它们已上线 ChatGPT Work 和 Codex 以及 API,其中 Luna 还在桌面应用中向 Free 和 Go 用户开放,但值得注意的是尚未在 Chat 模式中提供 @OpenAI。OpenAI 的对比框架侧重于

每任务成本的帕累托改进,而非绝对旗舰前沿的胜出。其公布的示例声称,Sol 在 xhigh 努力水平下在 AutomationBench 上击败 Claude Opus 5 max,每任务成本约为后者的 9%,而 Luna max 在 OSWorld 2.0 离线测试中超过 GPT-5.6 Sol medium,成本仅为后者的十分之一 @reach_vb。第三方集成推进迅速:Perplexity 将 Sol 设为其默认的“Light”努力水平编排器 @perplexity_aiDevin 报告称 Sol 在 每任务成本低 61% 的情况下与 GPT-5.6 Sol 持平,而 Luna 以约四分之一的成本击败了其前代产品 @cognitionArena 则将两者都加入了智能体和代码侧测试 @arena。更深层的基础设施故事可能比 SKU 名称更重要。OpenAI 表示它改进了

缓存和推理效率,提供高达 90% 的缓存输入 token 读取折扣,并推出了新的 Prompt Caching Dashboard 以及诊断 API,用于理解缓存复用失效的问题 @OpenAIDevs @OpenAIDevs。这对长时间运行的智能体尤其重要,因为工具开关或推理变化导致的缓存失效一直代价高昂。市场反应不一:许多人称赞其经济性,尤其是 Luna 的价格下限,而另一些人则认为 Anthropic 在头条模型质量上胜出,OpenAI 则在可负担性和部署人体工学上胜出 @kimmonismus @synthwavedd

智能体基础设施、评估工具,以及基于真实使用的后训练

多篇帖子汇聚到一个如今已为人熟知的模式:价值正从原始的模型访问转向

harness、评估、路由,以及基于专有轨迹的后训练DigitalOcean Managed Agents进入公开预览,支持Claude Code、Codex 和 LangGraph 风格的智能体,并提供空闲时暂停的运行时、受治理的工具端点,以及75+ 种模型选择@digitalocean。在开发者工作流方面,VS Code Agent Merge引入了一种实验模式,可在 PR 内自动解决审查评论、失败的检查和合并冲突@codePerplexity分享了较为具体的后训练报告之一:其 Computer 智能体在真实用户会话上混合使用拒绝采样微调和提示引导的自蒸馏,从成功轨迹和明确的工具调用错误中学习,并声称在线上 A/B 测试中工具调用失败率降低了 21.2%@perplexity_ai@AravSrinivas。这是一个有用的例子,说明实验室如何通过生产轨迹而非纯合成的 RL 环境,将仿真到现实的桥接付诸实践。评估和可观测性工具也受到了关注。

Lenny 的 newsletter重点介绍了 Ramp、Shopify、Harvey 和 Cursor 等公司在评估投资上的具体 ROI,并链接了Hamel HusainShreya Shankar关于高级评估系统的续作@lennysan。Hamel 还发布了一个评估技能/插件,旨在自动化部分评估审计和错误分析工作@lennysan。在可观测性方面,LangSmith发布了对决策模型(如 Jev/SemIf)的改进支持,使状态、问题、选择和输出在智能体轨迹中更易于检查@hwchase17@LangChain。多位实践者的元观点是:即使模型和提示相同,harness 也可能实质性改变基准测试结果@omarsar0

开放模型、压缩,以及在更小硬件上运行更大模型的系统工作

Tim Dettmers运行时动态压缩框架开启了“开源周”,该框架集成到bitsandbytes2中,目标是以高质量实现1.5–2.0 比特压缩,并承诺“惰性压缩”能在部署时自动找到更好的内存/质量/速度权衡@Tim_Dettmers@Tim_Dettmers。这一构想明确面向那些试图在内存受限的情况下运行大型开放权重模型(包括不断增长的 KV 缓存)的小团队和个人。硬件和本地部署是另一个主题。一篇关于

NVIDIA DGX Spark 描述了一款 15×15×5.05 厘米1.2 千克的系统,搭载 GB10 Grace Blackwell128 GB 统一内存,以及最高 1 PFLOP FP4 稀疏理论算力,NVIDIA 声称其支持对最高 200B 参数模型进行本地推理(配合量化),并支持使用 QLoRA 等方法对最高 70B 模型进行微调@kimmonismus。另外,Reka EdgeQ 展示了一款直接针对高通 Hexagon NPU 优化的端侧 VLM,具有 0.73 秒 TTFT每次推理 6.9 mWh,并让 GPU 保持空闲以维持持续的热性能@RekaAILabs。在开放模型方面,出现了几个有意义的发布,而不仅仅是评论。

Step Code v0.1.0MIT 许可发布,打包了一个编码智能体 CLI,报告得分在 Terminal-Bench 2.1 上为 80.9%,在 Multi-Frame 上为 73.3%,后者是一个 150 任务的长时程基准@StepFun_aiMing-Image-0.1-Design,一个 6B 开放权重图像设计系列,与 UI 设计和图像转可编辑 PPT 的“智能体技能”一同发布,声称在 Artificial Analysis 的 UI/UX 设计排行榜上位列 开放权重模型第一@AntLingAGI。一个更小但技术上值得注意的预训练结果来自 Rigel,一个 2.3B MoE / 360M 激活 Hybrid Mamba-2,据报道在单一代码库上跨混合 H100/A100/V100 和 TPU v5p/v6e 硬件训练,使用 <1% 的预训练 FLOPs 就达到了与 Llama-3.2-3B 相差几个百分点的水平@MayankMish98

多模态模型:图像、视频、语音和世界模型

在图像生成和编辑方面,Qwen-Image-2.1 在社区排行榜上表现出色,在 Image Edit ArenaText-to-Image Arena 中均位列 开放模型第一,整体上接近前沿专有系统@arena。配套生态工作包括 Unsloth Desktop 支持 INT8/FP8 和 GGUF,通过 RAM 卸载可在 6–8 GB VRAM 以下运行@danielhanchen,以及 Gradio 将 Qwen 默认的 9B 提示重写器缩小到 0.8B 以供笔记本电脑使用@Gradio。在视频和实时媒体方面,PixVerse R2 被宣布为 实时世界模型,强调可编辑、持久的“活世界”@PixVerse,而 fal 发布了 H3 Max 的技术栈拆解,声称通过涵盖后训练、GPU 执行、权重加载、扩展和服务的优化,3 秒内生成 5 秒视频@fal。他们的 World Model Accelerator 接口值得注意,因为它用 持久 WebRTC 会话取代了请求/响应语义,以支持交互式模型@fal。语音领域也保持活跃。

AssemblyAI Universal-3.5 Pro 已在 OpenRouter 上线,支持 19 种语言的同步 STT、通过关键术语和提示进行领域引导,并提供限时折扣@OpenRouterStepAudio 3 ASR 在 Artificial Analysis 的 AA-WER 指数上达到了 1.7% 的 WER,基本上与非流式语音转文字的榜首持平,尽管价格较高@ArtificialAnlysMoondream 还发布了 Parakeet ReduxParakeet Ultra 本地 STT 模型,支持 25 种语言,分别面向 CPU 和 GPU@moondreamai

热门推文(按互动量)

Claude Opus 5.5 发布:Anthropic 的主要发布帖主导了互动量,并框定了当天最大的模型事件@claudeaiGPT-6 Sol 和 Luna 发布:OpenAI 发布的更便宜的 Astra 衍生模型是另一个主要头条@OpenAI托管代理预览:DigitalOcean 对 Claude Code/Codex/自定义代理的托管运行时进行公开预览,引起了异常高的基础设施关注@digitaloceanOpenAI 标准提案:Sam Altman 关于 AI 标准和治理的帖子引发了超出纯产品新闻的大量讨论@samaEpoch 关于 AI 成本曲线:Epoch 估计,自 2023 年以来,固定性能下的 AI 成本每季度下降 约 47%,这是当天更有用的宏观数据点之一@EpochAIResearch

AI Reddit 回顾

/r/LocalLlama + /r/localLLM 回顾

1. Qwen、DeepSeek 和 AliceAI 大模型路线图

(活动量:2353):Qwen4-27B 刚刚确认一张会议幻灯片图片似乎确认了即将推出的 Qwen4 系列产品线,明确列出了 Qwen4-27B 以及 Qwen4-Max、Qwen4-Flash 和 Qwen4-Plus。该帖子强调了社区对阿里巴巴是否也会发布像35B-A3B这样更小的 MoE 风格变体的兴趣

,评论者推测诸如 N-grams 之类的架构变化可能会降低 VRAM 需求。评论者主要在争论Qwen4-27B是否会优于Qwen 3.8 Flash Next,以及最佳本地推理路径会倾向于独立 GPU 还是高容量统一内存系统。如果Qwen4 FlashQwen3.8 Flash NextQwen4-27B都作为开放权重发布,人们也有兴趣对它们进行比较。评论者推测

Qwen4-27B如果采用N-gram 风格架构,可能会有更低的 VRAM 需求,尽管帖子中没有提供具体的实现细节或内存数据。有人提议对

Qwen4 FlashQwen3.8 Flash NextQwen4-27B进行技术比较,假设它们都作为开放权重发布。提出的关键问题是,一个密集/标准的27B

模型是否会比更小的 Flash 变体表现更好,从而足以影响用户是优先选择独立 GPU 还是大型统一内存系统。一位用户希望

Qwen4 Flash能保留Flash Next的内存占用,特别是针对在128 GB

VRAM 内部署,这意味着人们对更大的开放权重 Qwen 模型的本地推理可行性感兴趣。

(活动:648):阿里巴巴计划推出参数规模达5万亿至10万亿的AI模型,并发布新芯片据报道,阿里巴巴计划推出一款参数规模在5T–10T

区间的AI模型,并发布了一款新的AI芯片,这意味着其前沿规模的训练/推理目标远远超出了当前消费级/本地部署的实用性。评论者将此与先前围绕DeepSeek R1的671B/691B

级别规模的兴奋之情进行了对比,并预计任何实际的下游应用都将通过蒸馏到更小的Qwen系列模型来实现,例如假设中的Qwen 4 27B

主要争论在于对本地推理可行性的怀疑——“每个token耗时数分钟”——与乐观看法之间的对立,后者认为阿里巴巴可能会将一个规模大得多的内部模型(可能是“Astra”)蒸馏成一个真正具有竞争力的中国前沿模型。评论者指出,一个

5T–10T参数的阿里巴巴模型对几乎所有用户来说实际上都将是仅限API的,在家庭实验室硬件上进行本地推理不切实际,并且在没有大规模稀疏化、量化或专用服务硬件的情况下,可能会产生极其缓慢的每个token耗时数分钟的生成速度。若干评论将可能的实际价值归结为

蒸馏,并将其与围绕DeepSeek R1的671B/691B

级别参数量的兴奋之情相比较,并建议用户或许可以转而等待一个更小的衍生模型,例如假设中的Qwen 4 27B,它可以在本地运行。一位评论者推测,如果阿里巴巴成功蒸馏或整合了

Astra的能力,这可能表明中国在前沿模型方面有更认真的推进,不过该讨论帖没有提供任何基准证据或实现细节来验证这一说法。