关于 Qwen-3.8 的赞美之词已有很多,但这里是我的。
Qwen-3.8 和我一开始相处得并不顺利,因为它想得太多了。看着它工作很痛苦,所以你得停下别盯着看。你得让它在无人监督下工作。这没关系,因为它确实能够独自完成复杂的重构,并在过程中做出不错的决策。不算完美,但话说回来,API 也不完美。
模型量化是 Q4_K_S,上下文量化为 Q8_0,从质量上看似乎还可以。我用的是官方 Qwen。短暂试过 Swift-Qwen,它确实更快,但我发现它会陷入循环,而这在原版 Qwen 中非常罕见。
我在 Pi agent 中使用 Qwen-3.8,不用 MCP,工具数量也降到最少。Bash 就够了,但我保留了 read、write 和 edit 工具。Pi 里的 edit 工具是最薄弱的一环,模型经常不得不重试编辑,因为它把缩进弄乱了。我在等有人为 Pi 做出一个更容错的 edit。也许哪天我得自己做一个。
作为沙箱,我用 docker。我的 Pi agent 运行在 Raspberry Pi 上,这似乎挺合适。
在我的硬件上、在我住的地方,100 万 token 花费 2.4 美分(输入)和 70 美分(输出),这与 nano-gpt.com 上最便宜的供应商相当。
阅读更多
讨论精选
caenum (120↑):它很好,但只适用于“较小”的项目。我注意到它有时会折腾很多(“但是等等”、“现在让我们再检查一下”……)等等。我上一个用 Qwen-3.8-27B 完成的项目花了大约 10 个小时——用 Claude 的话大概 30 分钟就能完成。所以是的——它很好,但就速度而言,前沿模型仍然值得。
tsangberg (55↑):说得对。我是“GPU 穷人”(16GB),但我同意。我在用 ByteShape 的 IQ4_XS,搭配 Raymond 的 KV cache streaming(上下文 > 160k)和 DFlash2(低上下文时),它比我用过的任何 MoE 都快,而且足够好,让我把它作为我软件开发、网络安全和 IT 运维的唯一模型。 https://github.com/troed/llama.cpp-adaptive-kv-streaming
用 Podman 容器做沙箱,使用一个自制的 MCP 来管理它们的生命周期并强制执行工具。
https://git.sync.wtf/troed/umwelt
我们已经越过了“足够好”的那个点。现在所有进一步的开发只会让事情……
Express_Quail_1493 (28↑):是的,qwen3.8-27b 是我能运行的第一个本地模型,我可以转身离开让它干活,而不用担心我会做出什么蠢事。