讨论精选
Cold_Specialist_3656 (0↑): 兄弟,这听起来像是个糟糕的设计。 所有破坏性的工具调用都应该通过人工审核确认。很多框架都内置了这一点……只是你没用而已。
你到底为什么要用 OpenRouter 处理医疗数据??你甚至不知道数据被发送到了哪个国家。当然不可靠。它本来就不是为此设计的,也不是以这种方式销售的。
OpenRouter 的参与者经常“作弊”,把你路由到比你付费的更差的模型,或者被阉割的 1bit 版本。再说一次,你不能依赖它。
如果你使用真正的提供商和更好的设计,99% 的问题都不会出现。
我有……
1millionnotameme (0↑): 没错,那些对真实系统一无所知的氛围编码者。
indicava (0↑): 很抱歉这么说,但我感觉你描述的不一致问题更多是工具实现的问题,而不是模型能力的问题。 我有一个商业产品,是由 Qwen3.6-27B 驱动的自定义工具,与你用过的模型相比,它绝对是表现最差的。但错误的结构化输出或混淆用户请求的情况非常罕见。我有经过充分测试的系统提示,以及众多工作流和循环监管机制来确保代理行为规范。老实说,我很惊讶一个“仅”由 27B 模型驱动的代理能如此一致。