我发布了过去几周一直在构建的东西:phantom-kv,一个面向大型语言模型的拒绝移除系统,它不触碰任何权重。它不编辑模型,而是将一小批学习得到的键/值张量库作为上下文加载到模型的 KV 缓存中。注意力机制会像读取已经存在的对话历史一样读取它。
https://github.com/lordx64/phantom-kv/
结果是,“解除审查”不再是永久性的检查点编辑,而变成了一种按请求、可热插拔的能力模式:卸载缓存后,基础模型再次逐字节一致。
此前所有拒绝移除方法都会在某处留下永久性改动。权重空间消融会重写检查点,撤销它意味着重新刷写权重,而且它会破坏每种量化。激活空间投影会在运行时、逐 token、逐层,从引擎钩子内部减去一个拒绝方向,模型自身的信号路径在启动时就被打补丁。phantom-kv 两者都不做:它针对模型自身的目标离线训练(对有害提示词遵从,对无害提示词保持行为),以数兆字节的缓存内容形式发布,而不是新的检查点,并且仅通过注意力机制本就消费的输入通道影响模型。没有一维拒绝方向假设,没有前向传播钩子,也没有为新架构进行的逐分支重建。
蓝色药丸,事件响应者模式:当被要求拆解一个将导入隐藏在 API 哈希背后的恶意软件样本时——这是典型的 DFIR 工作——基础模型会以典型的“必须获得授权”的托词拒绝,就像它拒绝任何听起来像逆向工程的事情一样。在蓝色药丸下,同一会话立即给出实际的拆解流程:什么是 API 哈希、解析循环如何工作、哪些 API 解析名称,以及适合用什么工具。其他内容并未解锁:攻击性工作仍受防护。这不是越狱,而是一种由部署控制的防御者模式。
红色药丸:按领域进行网络选择性:防御性蓝色药丸拒绝——仅防御模式保持领域外护栏完好。在红色药丸下,同一会话会给出逐步的载荷解释。一个模型。三种能力模式。面向分析师的防御团队模式,面向授权操作者的攻击团队模式,二者都与同一套受护栏约束的权重一起发布——显示为相隔 129 个缓存槽,而不是单独的检查点。
我们还进行了自我审计:一项 8B 评判模型审计显示,词汇层面的拒绝抑制指标会高估遵从性(语义拒绝往往以改述形式持续存在),移植效果在长会话中会以约 2–4k token 的半衰期衰减(并且测量得到的重新注入节奏可以缓解这一点),而且回答会带有法律/伦理框架的痕迹,因为移植的职责结束之处,正是模型自身专业性的开始。
来源:
https://x.com/lordx64/status/2102138825292276168?s=20
阅读更多
讨论精选
Velocita84 (85↑):所以它就只是……一个你看不到的系统提示词?