返回 讨论 apply CMS 文章

13个模型在65K-128K上下文下的基准测试:智能体工作负载真正重要的是什么

13个模型在65K-128K上下文下的基准测试,揭示智能体工作负载的关键因素。

基准测试上下文长度智能体模型性能
成长分 / 100 65 综合收获、行动、留存与影响

为什么值得读了解不同模型在长上下文下的实际表现差异

获得智能体工作负载中上下文管理的实用建议

关键洞察
  1. 基准测试结果通常需要自行解读,而非直接给出结论
  2. 智能体编码的正常流程是先用20-25k上下文填充,再推进到180k+并压缩
  3. 连续提示不应导致重新处理(re-pp)
转成行动

深入阅读

正文与原文对照

原文保真覆盖:全文原文字符:913

讨论精选

WithoutReason1729 (0↑): 你的帖子越来越受欢迎,我们已经在 Discord 上推荐了它! 快来看看吧!

我们还为你的贡献授予了特殊徽章。感谢你的帖子!

我是机器人,此操作自动执行。

CreamPitiful4295 (0↑): 通常这些基准测试得不出结论,只能靠你自己去解读发生了什么。我很欣赏这些解释。谢谢。

xornullvoid (0↑): 在第一个提示时达到 pp65k 或更高通常只在恢复旧对话时出现。一般智能体编码使用的正常流程是:用任务相关的内容填充 20-25k 的上下文,然后将对话推进到 180k+,再进行压缩。连续的提示不应导致重新 pp。 如果你的智能体任务在第一个提示时就经常填满 65k,那么你的上下文可能被无关信息或垃圾内容污染了。