DeepSeek(中国AI公司)今天让一切看起来轻而易举,他们开源了一个前沿级大语言模型的权重,而训练预算少得可笑(2048块GPU,训练2个月,花费600万美元)。
作为参考,这种能力水平通常需要接近16000块GPU的集群,而今天正在建设的集群规模更接近10万块GPU。例如,Llama 3 405B使用了3080万GPU小时,而DeepSeek-V3看起来是一个更强的模型,仅用了280万GPU小时(计算量约为前者的1/11)。如果该模型也能通过“氛围测试”(例如LLM竞技场排名正在进行中,我快速测试的几个例子目前表现良好),这将是资源受限条件下研究和工程能力的令人印象深刻的展示。
这是否意味着前沿大语言模型不需要大型GPU集群?不,但你必须确保不浪费已有的资源,而这看起来是一个很好的证明,表明在数据和算法方面仍有很多可以挖掘的空间。
技术报告也非常出色且详细,我正在阅读。