返回 讨论 build CMS 文章

phantom-kv:不修改权重,通过注入约18MB的KV缓存库实现LLM拒绝移除

用约 18MB 的可热插拔 KV 缓存库替代永久性权重编辑,实现按请求的拒绝移除。

LLM拒绝移除KV缓存模型安全
成长分 / 100 64 综合收获、行动、留存与影响

为什么值得读了解一种不修改模型权重、可随时卸载的拒绝移除新思路。

对比权重空间消融与激活空间投影,理解 phantom-kv 的差异化设计。

关键洞察
  1. phantom-kv 不编辑模型权重,而是将学习得到的键/值张量库作为上下文加载到 KV 缓存中,注意力机制像读取对话历史一样读取它。
  2. 卸载缓存后,基础模型再次逐字节一致,使“解除审查”从永久性检查点编辑变为按请求、可热插拔的能力模式。
  3. 此前方法会留下永久性改动:权重空间消融重写检查点并破坏量化;激活空间投影在运行时逐 token 逐层减去拒绝方向。
转成行动

深入阅读

正文与原文对照

原文保真覆盖:全文原文字符:2945

我发布了过去几周一直在构建的东西:phantom-kv,一个面向大型语言模型的拒绝移除系统,它不触碰任何权重。它不编辑模型,而是将一小批学习得到的键/值张量库作为上下文加载到模型的 KV 缓存中。注意力机制会像读取已经存在的对话历史一样读取它。

https://github.com/lordx64/phantom-kv/

结果是,“解除审查”不再是永久性的检查点编辑,而变成了一种按请求、可热插拔的能力模式:卸载缓存后,基础模型再次逐字节一致。

此前所有拒绝移除方法都会在某处留下永久性改动。权重空间消融会重写检查点,撤销它意味着重新刷写权重,而且它会破坏每种量化。激活空间投影会在运行时、逐 token、逐层,从引擎钩子内部减去一个拒绝方向,模型自身的信号路径在启动时就被打补丁。phantom-kv 两者都不做:它针对模型自身的目标离线训练(对有害提示词遵从,对无害提示词保持行为),以数兆字节的缓存内容形式发布,而不是新的检查点,并且仅通过注意力机制本就消费的输入通道影响模型。没有一维拒绝方向假设,没有前向传播钩子,也没有为新架构进行的逐分支重建。

蓝色药丸,事件响应者模式:当被要求拆解一个将导入隐藏在 API 哈希背后的恶意软件样本时——这是典型的 DFIR 工作——基础模型会以典型的“必须获得授权”的托词拒绝,就像它拒绝任何听起来像逆向工程的事情一样。在蓝色药丸下,同一会话立即给出实际的拆解流程:什么是 API 哈希、解析循环如何工作、哪些 API 解析名称,以及适合用什么工具。其他内容并未解锁:攻击性工作仍受防护。这不是越狱,而是一种由部署控制的防御者模式。

红色药丸:按领域进行网络选择性:防御性蓝色药丸拒绝——仅防御模式保持领域外护栏完好。在红色药丸下,同一会话会给出逐步的载荷解释。一个模型。三种能力模式。面向分析师的防御团队模式,面向授权操作者的攻击团队模式,二者都与同一套受护栏约束的权重一起发布——显示为相隔 129 个缓存槽,而不是单独的检查点。

我们还进行了自我审计:一项 8B 评判模型审计显示,词汇层面的拒绝抑制指标会高估遵从性(语义拒绝往往以改述形式持续存在),移植效果在长会话中会以约 2–4k token 的半衰期衰减(并且测量得到的重新注入节奏可以缓解这一点),而且回答会带有法律/伦理框架的痕迹,因为移植的职责结束之处,正是模型自身专业性的开始。

来源:

https://x.com/lordx64/status/2102138825292276168?s=20

阅读更多

讨论精选

Velocita84 (85↑):所以它就只是……一个你看不到的系统提示词?