返回 文章 学习 CMS 文章

英伟达130亿美元收购HuggingFace,GLM-5.3-Flash开源发布

英伟达高价收购HuggingFace,中国开源模型GLM-5.3-Flash以极致性价比和国产芯片推理引发关注。

英伟达HuggingFaceGLM-5.3-Flash开源模型
成长分 / 100 69 综合收获、行动、留存与影响

英伟达130亿美元收购HuggingFace,GLM-5.3-Flash开源发布
为什么值得读了解英伟达收购HuggingFace的估值逻辑与开源生态的商业价值。

掌握GLM-5.3-Flash的核心规格、独立基准表现及成本优势。

关键洞察
  1. 英伟达以130亿美元收购HuggingFace,约为其1.5亿美元ARR的80倍,几乎是2026年1月最初70亿美元报价的两倍。
  2. GLM-5.3-Flash为320B总参数/18B激活、1M token上下文、原生多模态、MIT许可,此前预览名为Ox Alpha。
  3. Artificial Analysis独立评估显示其AA智能指数57分,每任务成本0.09美元,比GLM-5.3 max低约7.5倍。
转成行动

深入阅读

正文与原文对照

原文保真覆盖:全文原文字符:14694

TheInformation 率先报道,如今他们已获得确认——英伟达正以 130 亿美元收购 HuggingFace,约为其 $150M ARR 的 80 倍,其客户群在 2026 年翻了一番。这几乎是英伟达 2026 年 1 月最初 70 亿美元报价的两倍。

我们能说什么呢?我们喜欢好人获胜。但在 GLM-5.3-Flash(又名 Ox Alpha)令所有人印象深刻(除了 GDM vaguepoasters)以及 Qwen 也在中国芯片上推出了一款令人印象深刻的 Flash 模型的背景下,或许Hot Chips 对话之后关于西方开放 AI 的讨论是这件事的绝佳背景。

2026/8/25-2026/8/26 的 AI 新闻。我们检查了 12 个 subreddit、[544 个 Twitter] 账号,没有更多 Discord。[AINews 网站]让你搜索所有过往期刊。提醒一下,[AINews 现在是 Latent Space 的一个栏目]。你可以[选择加入/退出]邮件频率!

AI Twitter 回顾

头条:GLM 5.3 Flash 发布及反响

发生了什么

Z.ai 正式发布 GLM-5.3-Flash,揭示此前预览的“Ox Alpha”模型就是它的公开身份。

Z.ai 宣布

GLM-5.3-Flash 是一款原生多模态模型,具有 100 万 token 上下文窗口320B 总参数 / 18B 激活参数,以 MIT 许可证发布,可通过权重、API、聊天、编码计划和 AutoClaw 获取。Z.ai 同时将其定位为 GLM-5.2 的高性价比继任者,声称在其内部基准测试中,它

在每个努力级别上都优于 GLM-5.2,并在编码方面与 Claude Opus 4.8 持平。此次发布还解开了长期存在的 Ox Alpha 之谜:多位发帖者明确将 Ox Alpha 与 GLM-5.3-Flash 联系起来,包括

SemiAnalysisrasbttheoCline。早期第三方模型基础设施支持几乎立即出现:

CoreWeaveBaseten,以及 Cline 在 VS Code / JetBrains / CLI 中的免费集成。发布后不久,Z.ai 工程师 Zixuan Li 表示

聊天模板已更新,早期下载者应重新下载模型,暗示存在第 0 天的打包或提示格式修正。Artificial Analysis 最初发布了一份概述,其中包含错误的

400k 上下文窗口,随后发布更正为 100 万上下文,与 Z.ai 最初的公告一致。社区对这次开放权重发布的反应异常强烈,从简短的震惊反应如

“HOLY”到更实质性的说法,即该模型现在可能是每美元智能的最佳选择,例如Artificial Analysiszainhas。此次发布被纳入围绕中国前沿开源模型的更宏大叙事中,有帖子认为中国开源实验室正在趋同于相似的架构选择,围绕

线性注意力、稀疏注意力、残差路径设计和 Muon。至少有一项模态声明出现了独立的反驳:

skalskip92认为,尽管该模型是“原生视觉”,但在若干视觉/目标检测任务上表现较弱。

官方声明与发布细节

Z.ai 的主要发布推文是事实锚点:GLM-5.3-Flash被描述为:

320B 总参数 / 18B 激活1M token 上下文原生多模态MIT 许可此前预览为

Ox Alpha“完全在中国 AI 芯片上运行”

发布时的分发/可用性:

Hugging Face 上的权重Z.ai APIChatZCodeCoding planAutoClaw

最强的厂商自报性能声明来自 Z.ai 的编码推文:在 Z.ai Code Bench 上,GLM-5.3-Flash “在每个努力级别上都明显优于 GLM-5.2,并与 Claude Opus 4.8 表现相当”。由于这是一方基准测试,它有用,但应比独立评估更谨慎地看待。

AutoClaw 的一篇后续发布支持帖子将该模型定位为适合视觉语言理解、代码生成和长时程智能体任务,并将可用性与积分/返利配对,但这主要是推广信息,而非新的技术证据:AutoClaw 发布帖

独立基准与成本/性能定位

推文集中最实质性的独立评估来自 Artificial Analysis。他们的总结:GLM-5.3-Flash 在 Artificial Analysis Intelligence Index 上得分 57

引用的 Artificial Analysis 指标

AA Intelligence Index 得分:57与 GLM-5.3 的差距:落后 3 分,GLM-5.3 为60每任务成本:$0.09API 价格:$0.15 / 1M 输入$0.50 / 1M 输出缓存输入:约 $0.026–$0.03 / 1M,描述为80% 折扣模型规模:320B 总参数 / 18B 激活许可:MIT上下文:最初列为 400k,后来更正为 1M

Artificial Analysis 引用的比较

并列

GPT-5.6 TerraMuse Spark 1.257分,但每任务成本低得多。$0.09/任务对比 GLM-5.3 max 的$0.68/任务。声称

每任务成本比 GLM-5.3 max 低约 7.5 倍。声称

每任务比 GPT-5.6 Terra 便宜约 5.7 倍,比 Muse Spark 1.2 便宜约 4.4 倍

Token 效率与推理混合

Artificial Analysis 指出了一个有趣的权衡:

GLM-5.3-Flash 运行 Intelligence Index 使用了

149M 输出 token,相比之下

GLM-5.3 为168M,但多于

Kimi K3(133M)Qwen3.8 2.4T A95B(136M)在相似的 Intelligence Index 得分下149M token 中的 134M(约 90%)是推理 token

这是一个重要的细微差别:该模型的经济性看起来极佳,很大程度上是因为token 定价极低,而不是因为它特别节省 token。

来自 Artificial Analysis 的智能体/工作评估

Artificial Analysis 还报告称,GLM-5.3-Flash 在智能体任务上的表现比其原始知识指标所暗示的更强:

GDPval-AA v2 Elo:1770在误差范围内与

GLM-5.3Grok 4.6并列,仅次于

Claude Opus 5 xhigh/max

Terminal-Bench v2.1:84.3%对比83.9%(GLM-5.3)τ³-Banking:47.2%,落后 GLM-5.3 3.1 个百分点

知识/幻觉统计

AA-Omniscience 得分:+7准确率:28%幻觉率:28%与 GLM-5.3 相比:

GLM-5.3 准确率

34%GLM-5.3 幻觉率

30%

与 GPT-5.6 Terra 相比:

Terra 准确率

47%

这表明反应中反复出现的一个主题:GLM-5.3-Flash 可能在实际代码/智能体工作流上比在广泛的现实世界事实知识上强得多

架构与系统细节

一些有技术背景的反应试图逆向工程或总结 GLM-5.2 / GLM-5.x 的变化。

推文集中最详细的公开架构分析来自 rasbt,他表示 GLM-5.3-Flash 从 GLM-5.2 的 744B-A40B 主干转向 320B-A18B,并使用:

Kimi Linear 风格的 3:1 混合注意力34 个 KDA 层(Kimi Delta Attention)11 个 MLA/DSA 层MLA = 多头潜在注意力

DSA = DeepSeek 稀疏注意力

DeepSeek V4 风格的 mHC 残差路径四条并行流外加一个

原生视觉编码器

同一推文将其描述为“超级混合”,因为两个主要注意力组件都已经是“高效”变体,而不是简单的高效/全注意力混合。

另一份有用的系统导向总结来自 thealexker,将此次发布定位为一个效率故事,强调:

与 GLM-5.2 相比:

约 1/10 的成本活跃参数

32B → 18B层数

92 → 45

混合线性 + 稀疏注意力每层平均 KV 缓存更小长上下文下注意力计算复合效应更低

声称视觉智能受益于编码/RL 风格的改进

表示

GLM-5.3 基础设施智能体通过帮助处理内核、瓶颈和服务栈优化,共同撰写了部分工作

来自 eliebakouch 的更广泛背景帖子带有观点,但在技术上值得注意,因为它将 GLM 置于中国开放模型的趋势中:

几乎所有中国前沿模型现在都使用

线性注意力几乎所有都使用

稀疏注意力 / 索引器压缩设计许多使用

花式残差mHC、注意力残差、门控残差许多使用

Muon

该帖子不是直接的 GLM 论文总结,但它有助于解释为什么架构细节立即引起模型工程师的共鸣:GLM-5.3-Flash 似乎是快速趋同的效率优先的中国前沿 OSS 设计空间中的又一个数据点。

中国芯片角度与服务影响

硬件/服务方面是此次发布中讨论最多的部分之一。

Z.ai 自己表示,该模型“完全运行在中国 AI 芯片上”。最强烈的放大来自 SemiAnalysis,它聚焦于每天 100T tokens 在中国芯片上被服务的说法。那条推文没有提供完整的推导过程,但它将这一基础设施壮举描述为此次发布中最令人震惊的部分。

各方反应强调了其重要意义:

theo:“Ox 作为一个‘flash’模型已经很疯狂了。把所有流量都跑在中国芯片上更是疯狂至极。”同日 OSS 情绪帖将 GLM 纳入了更广泛的庆祝性开源叙事之中。

还有来自 teortaxesTex 的明确粗略容量推算:

如果推理经济性与 V4-Flash 相当,10K tokens/s/NPU是“现实的”每芯片 864M/天100T/天将意味着大约116K 芯片表明

100K+ 芯片规模,“可行”,但会消耗总算力的极大一部分

这一估计是推测性的而非已确认的,但它显示了工程师们如何解读这一服务声明:不仅仅是营销话术,而是一项基础设施声明,暗示着非常庞大的国产加速器集群和成熟的推理优化。

采用与分发方面的反应

反应周期中一个值得注意的部分是使用类帖子出现得有多快。

Cline 表示 GLM-5.3 Flash 已经是其Cline 历史上增长最快的模型,在不到一周内驱动了全部流量的 11%,同时还宣传它在 Cline 中免费。这在一定程度上是推广,但也是一个具体的需求信号。

基础设施提供商迅速行动:

CoreWeave:“即将登陆 CoreWeave Serverless Inference”Baseten:day-0 可用,强调通用智能 + 智能体编程原生视觉1M 上下文Dell via Jeff Boudier:将 GLM 5.3 Flash 和 Qwen 3.8 Flash 描述为可进行本地部署的开源模型

这一点很重要,因为它强化了 GLM-5.3-Flash 并未被视为新奇之物;它立即被纳入了真实的推理/开发者技术栈。

事实与观点

事实 / 可外部归因的说法

Z.ai 发布了

GLM-5.3-Flash,为320B 总量 / 18B 激活1M 上下文MIT 许可多模态,此前预览名为Ox Alpha。Z.ai 声称该模型运行在

中国 AI 芯片上。Artificial Analysis 报告

AA 智能指数 57 和每任务 $0.09 成本,以及各种基准细节和定价。Artificial Analysis 后来

将其上下文列表从 400k 更正为 1M。Zixuan Li 表示

聊天模板已更新,模型用户应重新下载。Cline 表示该模型

在不到一周内驱动了全部流量的 11%。Baseten、CoreWeave、AutoClaw 等宣布了支持/分发。

观点 / 解读

theozephyr_z9nicdunz 表达了强烈的正面惊喜。thealexker 主要将此次发布解读为一个关于效率工程的故事。eliebakouch 将其视为中国前沿开放架构令人振奋的趋同的证据。zainhas 认为它现在是每美元智能的最佳选择skalskip92 认为该模型在视觉方面表现糟糕,对此次发布的多模态定位提出了反驳。scaling01 声称 Ox Alpha 是 GLM 模型这一点“明显得令人痛苦”,并进一步声称 ZAI 使用了炒作账号;该说法在这组推文中未经证实。