TheInformation 率先报道,如今他们已获得确认——英伟达正以 130 亿美元收购 HuggingFace,约为其 $150M ARR 的 80 倍,其客户群在 2026 年翻了一番。这几乎是英伟达 2026 年 1 月最初 70 亿美元报价的两倍。
我们能说什么呢?我们喜欢好人获胜。但在 GLM-5.3-Flash(又名 Ox Alpha)令所有人印象深刻(除了 GDM vaguepoasters)以及 Qwen 也在中国芯片上推出了一款令人印象深刻的 Flash 模型的背景下,或许Hot Chips 对话之后关于西方开放 AI 的讨论是这件事的绝佳背景。
2026/8/25-2026/8/26 的 AI 新闻。我们检查了 12 个 subreddit、[544 个 Twitter] 账号,没有更多 Discord。[AINews 网站]让你搜索所有过往期刊。提醒一下,[AINews 现在是 Latent Space 的一个栏目]。你可以[选择加入/退出]邮件频率!
AI Twitter 回顾
头条:GLM 5.3 Flash 发布及反响
发生了什么
Z.ai 正式发布 GLM-5.3-Flash,揭示此前预览的“Ox Alpha”模型就是它的公开身份。
Z.ai 宣布
GLM-5.3-Flash 是一款原生多模态模型,具有 100 万 token 上下文窗口、320B 总参数 / 18B 激活参数,以 MIT 许可证发布,可通过权重、API、聊天、编码计划和 AutoClaw 获取。Z.ai 同时将其定位为 GLM-5.2 的高性价比继任者,声称在其内部基准测试中,它
在每个努力级别上都优于 GLM-5.2,并在编码方面与 Claude Opus 4.8 持平。此次发布还解开了长期存在的 Ox Alpha 之谜:多位发帖者明确将 Ox Alpha 与 GLM-5.3-Flash 联系起来,包括
SemiAnalysis、rasbt、theo 和 Cline。早期第三方模型基础设施支持几乎立即出现:
CoreWeave、Baseten,以及 Cline 在 VS Code / JetBrains / CLI 中的免费集成。发布后不久,Z.ai 工程师 Zixuan Li 表示
聊天模板已更新,早期下载者应重新下载模型,暗示存在第 0 天的打包或提示格式修正。Artificial Analysis 最初发布了一份概述,其中包含错误的
400k 上下文窗口,随后发布更正为 100 万上下文,与 Z.ai 最初的公告一致。社区对这次开放权重发布的反应异常强烈,从简短的震惊反应如
“HOLY”到更实质性的说法,即该模型现在可能是每美元智能的最佳选择,例如Artificial Analysis和zainhas。此次发布被纳入围绕中国前沿开源模型的更宏大叙事中,有帖子认为中国开源实验室正在趋同于相似的架构选择,围绕
线性注意力、稀疏注意力、残差路径设计和 Muon。至少有一项模态声明出现了独立的反驳:
skalskip92认为,尽管该模型是“原生视觉”,但在若干视觉/目标检测任务上表现较弱。
官方声明与发布细节
Z.ai 的主要发布推文是事实锚点:GLM-5.3-Flash被描述为:
320B 总参数 / 18B 激活1M token 上下文原生多模态MIT 许可此前预览为
Ox Alpha“完全在中国 AI 芯片上运行”
发布时的分发/可用性:
Hugging Face 上的权重Z.ai APIChatZCodeCoding planAutoClaw
最强的厂商自报性能声明来自 Z.ai 的编码推文:在 Z.ai Code Bench 上,GLM-5.3-Flash “在每个努力级别上都明显优于 GLM-5.2,并与 Claude Opus 4.8 表现相当”。由于这是一方基准测试,它有用,但应比独立评估更谨慎地看待。
AutoClaw 的一篇后续发布支持帖子将该模型定位为适合视觉语言理解、代码生成和长时程智能体任务,并将可用性与积分/返利配对,但这主要是推广信息,而非新的技术证据:AutoClaw 发布帖。
独立基准与成本/性能定位
推文集中最实质性的独立评估来自 Artificial Analysis。他们的总结:GLM-5.3-Flash 在 Artificial Analysis Intelligence Index 上得分 57。
引用的 Artificial Analysis 指标
AA Intelligence Index 得分:57与 GLM-5.3 的差距:落后 3 分,GLM-5.3 为60每任务成本:$0.09API 价格:$0.15 / 1M 输入,$0.50 / 1M 输出缓存输入:约 $0.026–$0.03 / 1M,描述为80% 折扣模型规模:320B 总参数 / 18B 激活许可:MIT上下文:最初列为 400k,后来更正为 1M
Artificial Analysis 引用的比较
并列
GPT-5.6 Terra和Muse Spark 1.2在57分,但每任务成本低得多。$0.09/任务对比 GLM-5.3 max 的$0.68/任务。声称
每任务成本比 GLM-5.3 max 低约 7.5 倍。声称
每任务比 GPT-5.6 Terra 便宜约 5.7 倍,比 Muse Spark 1.2 便宜约 4.4 倍。
Token 效率与推理混合
Artificial Analysis 指出了一个有趣的权衡:
GLM-5.3-Flash 运行 Intelligence Index 使用了
149M 输出 token,相比之下
GLM-5.3 为168M,但多于
Kimi K3(133M)和Qwen3.8 2.4T A95B(136M)在相似的 Intelligence Index 得分下149M token 中的 134M(约 90%)是推理 token
这是一个重要的细微差别:该模型的经济性看起来极佳,很大程度上是因为token 定价极低,而不是因为它特别节省 token。
来自 Artificial Analysis 的智能体/工作评估
Artificial Analysis 还报告称,GLM-5.3-Flash 在智能体任务上的表现比其原始知识指标所暗示的更强:
GDPval-AA v2 Elo:1770在误差范围内与
GLM-5.3和Grok 4.6并列,仅次于
Claude Opus 5 xhigh/max
Terminal-Bench v2.1:84.3%对比83.9%(GLM-5.3)τ³-Banking:47.2%,落后 GLM-5.3 3.1 个百分点
知识/幻觉统计
AA-Omniscience 得分:+7准确率:28%幻觉率:28%与 GLM-5.3 相比:
GLM-5.3 准确率
34%GLM-5.3 幻觉率
30%
与 GPT-5.6 Terra 相比:
Terra 准确率
47%
这表明反应中反复出现的一个主题:GLM-5.3-Flash 可能在实际代码/智能体工作流上比在广泛的现实世界事实知识上强得多。
架构与系统细节
一些有技术背景的反应试图逆向工程或总结 GLM-5.2 / GLM-5.x 的变化。
推文集中最详细的公开架构分析来自 rasbt,他表示 GLM-5.3-Flash 从 GLM-5.2 的 744B-A40B 主干转向 320B-A18B,并使用:
Kimi Linear 风格的 3:1 混合注意力34 个 KDA 层(Kimi Delta Attention)11 个 MLA/DSA 层MLA = 多头潜在注意力
DSA = DeepSeek 稀疏注意力
DeepSeek V4 风格的 mHC 残差路径四条并行流外加一个
原生视觉编码器
同一推文将其描述为“超级混合”,因为两个主要注意力组件都已经是“高效”变体,而不是简单的高效/全注意力混合。
另一份有用的系统导向总结来自 thealexker,将此次发布定位为一个效率故事,强调:
与 GLM-5.2 相比:
约 1/10 的成本活跃参数
32B → 18B层数
92 → 45
混合线性 + 稀疏注意力每层平均 KV 缓存更小长上下文下注意力计算复合效应更低
声称视觉智能受益于编码/RL 风格的改进
表示
GLM-5.3 基础设施智能体通过帮助处理内核、瓶颈和服务栈优化,共同撰写了部分工作
来自 eliebakouch 的更广泛背景帖子带有观点,但在技术上值得注意,因为它将 GLM 置于中国开放模型的趋势中:
几乎所有中国前沿模型现在都使用
线性注意力几乎所有都使用
稀疏注意力 / 索引器压缩设计许多使用
花式残差如mHC、注意力残差、门控残差许多使用
Muon
该帖子不是直接的 GLM 论文总结,但它有助于解释为什么架构细节立即引起模型工程师的共鸣:GLM-5.3-Flash 似乎是快速趋同的效率优先的中国前沿 OSS 设计空间中的又一个数据点。
中国芯片角度与服务影响
硬件/服务方面是此次发布中讨论最多的部分之一。
Z.ai 自己表示,该模型“完全运行在中国 AI 芯片上”。最强烈的放大来自 SemiAnalysis,它聚焦于每天 100T tokens 在中国芯片上被服务的说法。那条推文没有提供完整的推导过程,但它将这一基础设施壮举描述为此次发布中最令人震惊的部分。
各方反应强调了其重要意义:
theo:“Ox 作为一个‘flash’模型已经很疯狂了。把所有流量都跑在中国芯片上更是疯狂至极。”同日 OSS 情绪帖将 GLM 纳入了更广泛的庆祝性开源叙事之中。
还有来自 teortaxesTex 的明确粗略容量推算:
如果推理经济性与 V4-Flash 相当,10K tokens/s/NPU是“现实的”每芯片 864M/天100T/天将意味着大约116K 芯片表明
100K+ 芯片规模,“可行”,但会消耗总算力的极大一部分
这一估计是推测性的而非已确认的,但它显示了工程师们如何解读这一服务声明:不仅仅是营销话术,而是一项基础设施声明,暗示着非常庞大的国产加速器集群和成熟的推理优化。
采用与分发方面的反应
反应周期中一个值得注意的部分是使用类帖子出现得有多快。
Cline 表示 GLM-5.3 Flash 已经是其Cline 历史上增长最快的模型,在不到一周内驱动了全部流量的 11%,同时还宣传它在 Cline 中免费。这在一定程度上是推广,但也是一个具体的需求信号。
基础设施提供商迅速行动:
CoreWeave:“即将登陆 CoreWeave Serverless Inference”Baseten:day-0 可用,强调通用智能 + 智能体编程、原生视觉和1M 上下文Dell via Jeff Boudier:将 GLM 5.3 Flash 和 Qwen 3.8 Flash 描述为可进行本地部署的开源模型
这一点很重要,因为它强化了 GLM-5.3-Flash 并未被视为新奇之物;它立即被纳入了真实的推理/开发者技术栈。
事实与观点
事实 / 可外部归因的说法
Z.ai 发布了
GLM-5.3-Flash,为320B 总量 / 18B 激活、1M 上下文、MIT 许可、多模态,此前预览名为Ox Alpha。Z.ai 声称该模型运行在
中国 AI 芯片上。Artificial Analysis 报告
AA 智能指数 57 和每任务 $0.09 成本,以及各种基准细节和定价。Artificial Analysis 后来
将其上下文列表从 400k 更正为 1M。Zixuan Li 表示
聊天模板已更新,模型用户应重新下载。Cline 表示该模型
在不到一周内驱动了全部流量的 11%。Baseten、CoreWeave、AutoClaw 等宣布了支持/分发。
观点 / 解读
theo、zephyr_z9 和 nicdunz 表达了强烈的正面惊喜。thealexker 主要将此次发布解读为一个关于效率工程的故事。eliebakouch 将其视为中国前沿开放架构令人振奋的趋同的证据。zainhas 认为它现在是每美元智能的最佳选择。skalskip92 认为该模型在视觉方面表现糟糕,对此次发布的多模态定位提出了反驳。scaling01 声称 Ox Alpha 是 GLM 模型这一点“明显得令人痛苦”,并进一步声称 ZAI 使用了炒作账号;该说法在这组推文中未经证实。
