我注意到,由于(我想?)在长时程任务上大量进行基准测试优化,LLM 默认变得有点过于主动,超出了我的平均用例需求。
例如在编码中,模型现在倾向于推理相当长的时间,它们倾向于开始列出并 grep 整个仓库中的文件,它们进行重复的网页搜索,它们过度分析和过度思考一些罕见边缘情况,即使在已知不完整且正在积极开发的代码中也是如此,并且即使对于简单查询,也常常在几分钟后才返回结果。
这对于长时间运行的任务可能是有意义的,但对于我仍然经常进行的更多“在循环中”的迭代开发,或者如果我只是想在运行脚本之前快速检查一下,以防索引错误或犯了一些愚蠢的错误,就不太合适了。所以我发现自己经常用各种变体来阻止 LLM,比如“停,你想得太多了。只看这一个文件。不要使用任何工具。不要过度设计”等等。
基本上,随着默认行为慢慢爬向“超思考”超级主动模式,我感觉需要相反的东西,以及更普遍地,好的方式来指示或传达意图/风险等级,从“只是快速看一眼”一直到“去花 30 分钟,确定无疑后再回来”。