返回 动态 学习 CMS 文章

Karpathy 盛赞 Llama 3.1:开源前沿模型的新纪元

Karpathy 认为 Llama 3.1 405B 是首个开放的前沿 LLM,标志着开放生态系统的转折点。

Llama 3.1开源AIMetaKarpathy
成长分 / 100 74 综合收获、行动、留存与影响

为什么值得读了解 AI 领域权威对 Llama 3.1 发布的即时评价和行业影响。

获取关于开放模型生态系统的关键观点和未来趋势。

关键洞察
  1. Llama 3.1 405B 是首个开放权重、许可宽松的前沿 LLM,能力接近 GPT-4 和 Claude 3.5 Sonnet。
  2. Meta 发布 92 页技术论文,提供详细模型信息,支持研究和开发。
  3. 扎克伯格的长文阐述了开源 AI 的核心理念,强调开放生态系统的优势。
转成行动

深入阅读

正文与原文对照

原文保真覆盖:全文原文字符:2344

热烈祝贺 @AIatMeta 发布 Llama 3.1!

几点说明:

今天,随着 405B 模型的发布,这是首次让所有人都能使用和构建具有前沿能力的 LLM。该模型似乎达到了 GPT-4 / Claude 3.5 Sonnet 的水平,并且权重开放且许可宽松,包括商业使用、合成数据生成、蒸馏和微调。这是 Meta 真正开放、前沿能力的 LLM 发布。此次发布包含更多内容,例如一份 92 页的 PDF,其中包含大量关于模型的详细信息:

https://t.co/48e3YJ8Sg9

此次发布背后的理念体现在扎克伯格的长文中,非常值得一读,因为它很好地涵盖了支持开放 AI 生态系统世界观的所有主要观点和论据:

“开源 AI 是前进之路”

https://t.co/AdmpadCRM0

我想说,现在仍处于早期阶段,我们仿佛又回到了计算机时代的 1980 年代,LLM 是下一个主要的计算范式,而 Meta 显然正在将自己定位为开放生态系统的领导者。

  • 人们将使用提示和 RAG 与模型交互。
  • 人们将微调模型。
  • 人们将把它们蒸馏成更小的专家模型,用于狭窄的任务和应用。
  • 人们将进行研究、基准测试和优化。

开放生态系统还会以模块化的方式自组织成产品、应用和服务,每一方都可以贡献自己独特的专业知识。今天早上的一个例子是 @GroqInc,他们制造了一种新芯片,可以非常快地推理 LLM。他们已经集成了 Llama 3.1 模型,并且似乎能够几乎即时地推理 8B 模型:

https://t.co/b2kdSsz0fH

而且(由于服务器压力,我似乎无法尝试)在 Groq 上运行的 405B 可能是目前能力最强、速度最快的 LLM(?)。

早期的模型评估看起来不错:

https://t.co/RLR5YBpmks https://t.co/ipT4x4wCvy

仍然有待进行的是“氛围检查”,请在未来几天(或几小时?)关注 X / r/LocalLlama。

我预计闭源模型玩家(我认为他们在生态系统中也有一席之地)很快就会追赶上来,我对此充满期待。

在技术方面也有很多值得喜欢的地方,例如多语言、上下文长度、函数调用、多模态等。等我读完那 92 页论文后,稍后我会发布一些技术笔记。