热烈祝贺 @AIatMeta 发布 Llama 3.1!
几点说明:
今天,随着 405B 模型的发布,这是首次让所有人都能使用和构建具有前沿能力的 LLM。该模型似乎达到了 GPT-4 / Claude 3.5 Sonnet 的水平,并且权重开放且许可宽松,包括商业使用、合成数据生成、蒸馏和微调。这是 Meta 真正开放、前沿能力的 LLM 发布。此次发布包含更多内容,例如一份 92 页的 PDF,其中包含大量关于模型的详细信息:
此次发布背后的理念体现在扎克伯格的长文中,非常值得一读,因为它很好地涵盖了支持开放 AI 生态系统世界观的所有主要观点和论据:
“开源 AI 是前进之路”
我想说,现在仍处于早期阶段,我们仿佛又回到了计算机时代的 1980 年代,LLM 是下一个主要的计算范式,而 Meta 显然正在将自己定位为开放生态系统的领导者。
- 人们将使用提示和 RAG 与模型交互。
- 人们将微调模型。
- 人们将把它们蒸馏成更小的专家模型,用于狭窄的任务和应用。
- 人们将进行研究、基准测试和优化。
开放生态系统还会以模块化的方式自组织成产品、应用和服务,每一方都可以贡献自己独特的专业知识。今天早上的一个例子是 @GroqInc,他们制造了一种新芯片,可以非常快地推理 LLM。他们已经集成了 Llama 3.1 模型,并且似乎能够几乎即时地推理 8B 模型:
而且(由于服务器压力,我似乎无法尝试)在 Groq 上运行的 405B 可能是目前能力最强、速度最快的 LLM(?)。
早期的模型评估看起来不错:
https://t.co/RLR5YBpmks https://t.co/ipT4x4wCvy
仍然有待进行的是“氛围检查”,请在未来几天(或几小时?)关注 X / r/LocalLlama。
我预计闭源模型玩家(我认为他们在生态系统中也有一席之地)很快就会追赶上来,我对此充满期待。
在技术方面也有很多值得喜欢的地方,例如多语言、上下文长度、函数调用、多模态等。等我读完那 92 页论文后,稍后我会发布一些技术笔记。