返回 讨论 学习 CMS 文章

重建Gemma 4 31b:从31b到26b的优化实验

探索通过SWA重新缩放等技术优化Gemma 4模型参数规模至26b的实验性工作。

Gemma 4模型优化SWA重新缩放长上下文
成长分 / 100 52 综合收获、行动、留存与影响

为什么值得读了解社区驱动的模型优化实验,如SWA重新缩放技术。

探讨长上下文增益在实际检索/连贯性测试中的表现。

关键洞察
  1. 用户KoalaOk1265对SWA重新缩放前后的消融实验感兴趣,特别是长上下文增益是否在检索/连贯性测试中显现。
  2. 用户kosnarf分享了将Gemma 4从31b变为41b的类似工作。
  3. 用户NineThreeTilNow确认了相关模型的存在并提及自己的评论。
转成行动

深入阅读

正文与原文对照

原文保真覆盖:全文原文字符:629

讨论精选

KoalaOk1265 (0↑): 这正是那种让这个子版块变得有趣的奇特实验性工作。我非常好奇看到SWA重新缩放前后的消融实验结果,特别是长上下文增益是否会在实际的检索/连贯性测试中显现,而不仅仅是困惑度指标。

kosnarf (0↑): 有人分享了类似的东西,但把gemme4从31b变成了41b: https://huggingface.co/TOTORONG/extGemma4-41B

NineThreeTilNow (0↑): 是的,我看到了。当他们在这里发帖时,我专门评论过那个模型。可能在我的评论历史里……关于做我正在做的事情。