返回 讨论 学习 CMS 文章

Longcat 2 模型权重发布:1.6万亿参数MoE模型

Longcat 2.0 是一个1.6万亿参数的MoE模型,在AI ASIC上训练,展示了替代硬件平台的大规模训练能力。

Longcat 2MoE1.6万亿参数AI ASIC
成长分 / 100 66 综合收获、行动、留存与影响

为什么值得读了解大规模MoE模型的最新进展,总参数1.6万亿,激活参数480亿。

关注AI ASIC超级计算集群在训练超大规模模型中的实际应用和稳定性。

关键洞察
  1. Longcat 2.0 是一个MoE语言模型,总参数1.6万亿,每token激活约480亿参数。
  2. 训练基于AI ASIC超级计算集群,处理超过35万亿个token,无回滚或不可恢复损失尖峰。
  3. 相比前代Longcat模型有显著提升,并伴随多项架构改进。
转成行动

深入阅读

正文与原文对照

原文保真覆盖:全文原文字符:882

讨论精选

kmouratidis (0↑): 我们推出了 LongCat-2.0,这是一个大规模 MoE 语言模型,拥有 1.6 万亿总参数

,每个 token 激活约 480 亿参数——相比之前的 LongCat 模型有显著提升,并伴随多项架构改进。

完整的训练运行和大规模部署完全基于 AI ASIC 超级计算集群。预训练跨越数百万加速器天,处理超过

35 万亿个 token

,没有出现回滚或不可恢复的损失尖峰——

这展示了我们在替代硬件平台上进行前沿规模训练的能力。

这真是一个了不起的成就。

ga239577 (0↑): 这是我让它画一只长猫时生成的结果。开个玩笑——那是我画的。基准测试看起来不错,真希望我能运行它。

TheRealMasonMac (0↑): 妈妈:我们家里有 Le Chaton Fat 家里的 Le Chaton Fat: