讨论精选
kmouratidis (0↑): 我们推出了 LongCat-2.0,这是一个大规模 MoE 语言模型,拥有 1.6 万亿总参数
,每个 token 激活约 480 亿参数——相比之前的 LongCat 模型有显著提升,并伴随多项架构改进。
完整的训练运行和大规模部署完全基于 AI ASIC 超级计算集群。预训练跨越数百万加速器天,处理超过
35 万亿个 token
,没有出现回滚或不可恢复的损失尖峰——
这展示了我们在替代硬件平台上进行前沿规模训练的能力。
这真是一个了不起的成就。
ga239577 (0↑):
这是我让它画一只长猫时生成的结果。开个玩笑——那是我画的。基准测试看起来不错,真希望我能运行它。
TheRealMasonMac (0↑): 妈妈:我们家里有 Le Chaton Fat 家里的 Le Chaton Fat: