返回 动态 学习 CMS 文章

Karpathy:LLM 默认过度主动,需要更精细的意图控制

Karpathy 观察到 LLM 在编码等任务中过度主动,建议用户需要更精细的意图控制。

LLM基准测试过度主动意图控制
成长分 / 100 65 综合收获、行动、留存与影响

为什么值得读了解 LLM 在基准测试驱动下的行为变化趋势

获得一线 AI 专家对模型默认行为的观察与反思

关键洞察
  1. LLM 因长时程任务基准优化而变得过度主动
  2. 在编码中,模型过度推理、搜索和过度分析边缘情况
  3. 对迭代开发或快速检查场景,这种默认行为不合适
转成行动

深入阅读

正文与原文对照

原文保真覆盖:全文原文字符:1322

我注意到,由于(我想?)在长时程任务上大量进行基准测试优化,LLM 默认变得有点过于主动,超出了我的平均用例需求。

例如在编码中,模型现在倾向于推理相当长的时间,它们倾向于开始列出并 grep 整个仓库中的文件,它们进行重复的网页搜索,它们过度分析和过度思考一些罕见边缘情况,即使在已知不完整且正在积极开发的代码中也是如此,并且即使对于简单查询,也常常在几分钟后才返回结果。

这对于长时间运行的任务可能是有意义的,但对于我仍然经常进行的更多“在循环中”的迭代开发,或者如果我只是想在运行脚本之前快速检查一下,以防索引错误或犯了一些愚蠢的错误,就不太合适了。所以我发现自己经常用各种变体来阻止 LLM,比如“停,你想得太多了。只看这一个文件。不要使用任何工具。不要过度设计”等等。

基本上,随着默认行为慢慢爬向“超思考”超级主动模式,我感觉需要相反的东西,以及更普遍地,好的方式来指示或传达意图/风险等级,从“只是快速看一眼”一直到“去花 30 分钟,确定无疑后再回来”。