返回 文章 学习 CMS 文章

Diffusion Controller:统一并简化AI图像生成的轻量级转向阻尼器

Diffusion Controller 将图像去噪过程重构为平滑连续的控制问题,用轻量级附加网络实现精确引导,无需修改基础模型。

Diffusion Controller图像生成可控生成轻量级网络
成长分 / 100 72 综合收获、行动、留存与影响

Diffusion Controller:统一并简化AI图像生成的轻量级转向阻尼器
为什么值得读了解如何在不微调基础模型的情况下,通过轻量级附加网络精确控制图像生成,提升提示词对齐。

掌握 Diffusion Controller 在闭源模型上的应用潜力,以及其相对于 LoRA 等方法的优势。

关键洞察
  1. Diffusion Controller 将图像生成视为平滑连续的控制问题,而非孤立刚性步骤。
  2. 轻量级转向阻尼器网络动态调整生成轨迹,平衡用户偏好对齐与图像质量。
  3. 在完全可访问的白盒和高度受限的灰盒环境中均优于基线,灰盒版本在 HPS-v2 胜率上超越 LoRA。
转成行动

深入阅读

正文与原文对照

原文保真覆盖:全文原文字符:10074

2026年9月29日

许志伟(Chih-wei Hsu)和柳文卿(Moonkyung Ryu),Google Research 软件工程师

我们推出 Diffusion Controller,一个轻量级的“转向阻尼器”网络,能够精确引导图像生成,从而实现显著更好的提示词对齐。它可以无缝附加到甚至访问受限的闭源模型上,在不破坏基线稳定性的前提下提升图像质量。

文本到图像 AI 模型(如 Nano Banana、Stable Diffusion 和 Flux)的快速发展,从根本上改变了创意设计,使任何人都能根据文本描述合成照片级真实感、高保真的图像。然而,引导这些庞大的模型以满足精确的用户意图、下游目标或严格的视觉约束,仍然是一项微妙且不可预测的平衡工作。例如,想象一下向模型输入“一只戴着墨镜的蜥蜴”的提示词。模型可能会生成一只逼真的蜥蜴,但没有戴墨镜。或者,强制模型包含墨镜可能会扭曲蜥蜴的脸部,破坏图像质量。

现有的引导或微调图像生成的方法非常割裂。一方面,开发者使用推理时技术(例如,无分类器扩散引导)来调整文本提示词的影响,并即时引导图像生成过程。另一方面,他们依赖繁重的微调,使用参数高效的适配器,如 LoRA、奖励加权回归或策略梯度来改变模型的行为。

由于这些工具历来被视为彼此独立、互不相关的修复手段,该领域一直缺乏一种单一、有原则的数学语言来统一、分析和优化我们控制生成模型的方式。这种碎片化的方法常常迫使工程师在平衡用户偏好对齐与图像质量时依赖猜测。

为了解决这一平衡难题,我们提出了 Diffusion Controller 框架。Diffusion Controller 不将图像生成视为一系列孤立的刚性步骤,而是将整个去噪过程重新构建为一个平滑、连续的控制问题。我们的结果表明,Diffusion Controller 的轻量级附加网络在匹配人类偏好方面优于行业标准。此外,其完全解锁版本(即经过微调、拥有“白盒”或无限制访问权限以修改内部模型权重的模型)相对于基线模型取得了 90% 的胜率。

Diffusion Controller 框架将图像生成过程(AI 模型从随机噪声开始,逐步将其细化为清晰图像)视为一段平滑控制的旅程。想象基础预训练模型是一辆庞大而强大的摩托车;重建其核心引擎以改变其行驶方式既低效又冒险。相反,Diffusion Controller 充当附着其上的轻量级转向阻尼器,而主模型(摩托车)则完全冻结、安全无扰。

Diffusion Controller 的核心机制(转向阻尼器)并非在每一步猜测如何引导生成,而是在图像创建过程中动态调整生成轨迹。它平滑地重新校准模型的标准默认行为,为最大化用户定义目标(例如实现某种艺术风格或上下文对齐)的方向赋予更多权重。

并排视觉矩阵,比较基础预训练模型、LoRA 和 Diffusion Controller 在复杂提示下的输出。

通过借助反馈从数学上优化生成轨迹中的这些偏移,Diffusion Controller 框架实现了平衡,成功地将模型的生成过程导向新的用户偏好,同时完全保留了基础模型清晰的视觉图像质量和底层稳定性。回到上面的蜥蜴示例,这意味着转向阻尼器引导模型确保包含太阳镜,但惩罚护栏会介入,防止系统为了做到这一点而扭曲蜥蜴的自然鳞片和比例。

为了将这一理论控制问题转化为实用工具,我们将抽象且可能棘手的方程之间的鸿沟弥合为两种完全基于最终奖励分数的高效微调方法:

Diffusion Controller 框架像转向阻尼器一样运作,解决了一个巨大的现实商业问题。通常,要改变模型的行为,你需要“白盒”访问权限来深入其核心引擎并更改其内部设置。然而,世界上最好的图像生成模型往往是企业机密(被称为黑盒或灰盒)。

转向阻尼器网络依赖于完美的图像引导指令,即基础模型知识加上一个小修正的组合。它在图像被清除静态噪声的过程中进行观察,并注入精确、微观的转向修正。这使得工程师能够完美控制和定制即使是被严格锁定、闭源的模型,而无需触及底层代码。

高级示意图,说明冻结的主干如何将中间反向均值传递给 Diffusion Controller 侧网络以计算组合分数。

我们使用 Stable Diffusion v1.4 主干网络,在三种微调机制下评估了 Diffusion Controller 框架的能力:监督微调(SFT)、奖励加权损失(RWL)和 PPO。性能使用标准化的 Human Preference Score(HPS-v2)来衡量,以确定生成的图像与用户提示和美学选择的契合程度。

我们在 Diffusion Controller 框架下实现了四种网络结构:

在所有设置下(各自使用其报告的检查点),针对预训练模型在 HPS-v2 测试提示集上的 HPS-v2 胜率:SFT(顶部)、RWL(中部)和 PPO(底部)。

结果表明,Diffusion Controller 在完全可访问的“白盒”环境和高度受限的“灰盒”环境中均表现出色,持续优于其对应的基线,并实现了更好的质量-效率权衡。

在 SFT 和 RWL 赛道中,灰盒 Diffusion Controller 转向阻尼器网络在 HPPS-v2 胜率上优于 LoRA——这一最先进的参数高效白盒方法。这是一个重要的里程碑,因为 Diffusion Controller 在实现这一点的同时,操纵的内部模型层数显著少于 LoRA。此外,在综合人工评估小组中,Diffusion Controller 在复杂的多属性测试提示上记录了最佳的主观质量和提示匹配结果。

训练结束时的胜率与基线对比。每个子图报告三项配对比较:(灰盒)Diffusion Controller 对 Diffusion Controller-Naive;(白盒)Diffusion Controller-J 对 LoRA;(白盒)Diffusion Controller-S 对 LoRA。(a-c):SFT/RWL/PPO 的 HPSv2 胜率,橙色误差条表示标准差;(d):PPO 的人工评估胜率。

该框架的一个核心特性是其运行时的灵活性。通过调整单个推理时引导强度参数,用户可以动态调高或调低控制约束的强度。这允许在不破坏基线图像稳定性或引起旧式引导方法典型视觉失真的情况下,对提示对齐进行平滑、细粒度的即时调整。

通过将数学控制与图像生成模型相结合,Diffusion Controller 弥合了纯数学与现代创意工具之间的鸿沟。它不依赖于猜测和快速修复的拼凑来调整模型,而是提供了一个单一的、数学上合理的系统来引导图像生成。最重要的是,它提供了一个实用、轻量级的“转向阻尼器”蓝图,即使在访问受限的闭源模型上也能完美运行。

展望未来,这一统一框架为研究开辟了令人兴奋的新路径。由于控制层与模型的核心引擎完全分离,未来的开发者可以将 Diffusion Controller 用于远不止匹配文本提示的用途。 immediate 下一步包括使用该框架构建高级个性化工具、开发稳健的安全机制以帮助减轻有害内容生成,以及调整转向阻尼器网络以控制复杂的下一代视频模型。

我们感谢来自 Google Research、Google DeepMind 和学术界的共同作者和合作者对本工作的贡献。