返回 文章 学习 CMS 文章

当你不告诉LLM该想什么时,它们在想什么?

通过最小化提示观察LLM的默认生成行为,发现模型家族具有系统性的主题偏好和退化模式。

LLM无约束生成知识先验模型行为
成长分 / 100 72 综合收获、行动、留存与影响

当你不告诉LLM该想什么时,它们在想什么?
为什么值得读了解LLM在无约束条件下的真实行为,而非提示诱导的响应。

揭示模型家族间系统性的主题偏好差异,有助于模型审计和指纹识别。

关键洞察
  1. GPT-OSS默认生成编程(27.1%)和数学(24.6%)内容,超过一半输出集中在这两个领域。
  2. Llama生成文学和叙事文本较多(9.1%),对技术领域关注较少。
  3. DeepSeek生成宗教内容的频率远高于其他家族。
转成行动

深入阅读

正文与原文对照

原文保真覆盖:全文原文字符:8845

摘要

我们与大型语言模型(LLM)的交互主要由特定任务或主题的问题主导,例如“解决这个编程问题”或“什么是民主?”这种框架强烈塑造了LLM生成响应的方式,限制了可观察到的行为和知识范围。我们使用最小化、主题中立的提示来研究LLM的行为。尽管没有明确的任务或主题说明,LLM仍能生成多样化的内容;然而,每个模型家族都表现出独特的主题偏好。GPT-OSS偏爱编程和数学,Llama倾向于文学,DeepSeek经常生成宗教内容,而Qwen则倾向于多项选择题。我们进一步观察到,我们的生成设置可能退化为重复或无意义的输出,揭示了模型特有的怪癖,例如Llama生成个人社交媒体URL。

论文:https://arxiv.org/abs/2602.01689

项目页面:https://tinyurl.com/mzr5cckz

我们研究什么?

大多数LLM行为分析都受到限制:提示强烈塑造了模型可以说什么[1,2]。这很有用——但也具有深刻的局限性。

提示就像过滤器。 一个数学问题强制进行数学推理;一个聊天模板强制模型扮演助手角色。模型生成空间的大部分从未被使用过。我们观察到的不是模型的自然行为,而是由我们的指令诱导的行为。因此,我们提出了一个更基本的问题:

当你没有告诉语言模型要生成什么时,它会生成什么?

为了回答这个问题,我们研究了近乎无约束的生成。我们使用主题中立、开放式的种子提示,例如“实际上”、“让我们逐步思考”,甚至只是标点符号如“.”。我们完全移除聊天模板——没有系统提示,没有角色——并使用标准解码。这种设置近似于模型的首要行为:在对齐和提示接管之前,窥见其学到的生成先验。

为什么这很重要

如果你关心模型审计、行为监控、LLM指纹识别或安全与隐私风险,仅靠条件基准是不够的。我们需要审视原始模型生成,观察LLM在不同输入和提示条件下的行为。

作为一个未被充分探索但科学上有趣的设置,近乎无约束的生成使我们能够观察模型偏好谈论什么,它们过度代表哪些类型的内容,以及当固定的聊天模板和特殊标签被移除时它们如何失败。 关键在于,这些信号是系统性的,而非偶然的。

结果:当你不告诉LLM思考什么时,它们在想什么?

结果1:模型家族具有不同的知识先验

https://tinyurl.com/mzr5cckz.

如图1(a)所示,尽管提示中没有明确的指令或主题,LLM仍能生成广泛的主题。 LLM生成各种类别,包括人文学科(例如文学、哲学和教育)、科学与工程(例如物理、数学和编程),以及法律、金融、音乐、体育、烹饪、农业、考古、军事和时尚等领域。

更令人惊讶的是,如图1(b)所示,不同的模型家族即使使用相同的最小提示,也会倾向于语义空间的不同部分。GPT-OSS 绝大多数默认生成编程(27.1%)和数学(24.6%)内容。一个模型家族超过一半的输出集中在这两个领域!Llama 生成的文学和叙事文本要多得多(9.1%),对技术领域的关注较少(见图2)。DeepSeek 生成宗教内容的频率远高于其他家族。Qwen 经常输出带有选项的多项选择题。

这里引人注目的是其一致性。这些分布在不同提示、嵌入模型和语义标注器下都保持不变。这种行为看起来更像是群体层面的指纹,而非噪声。图3展示了代表性示例。

结果2:深度也是先验的一部分

差异不仅在于模型谈论的内容和频率,还在于它们探讨的深度。我们在图4中评估了编程和数学文本的复杂度。

我们发现,GPT-OSS 经常生成高级或专家级内容(68.2%),例如深度优先搜索、广度优先搜索或动态规划(见图3)。Llama 和 Qwen 则更偏向基础或中级材料。即使在控制标注模型和评估设置的情况下,这些深度差异仍然存在。

结果3:退化文本是信号,而不仅仅是噪声

最后,根据先前的工作[3,4],我们还观察到模型有时会陷入重复或退化的模式,尤其是在约束被移除时。这种行为通常被视为乱码而被丢弃。我们将其视为数据。

通过分析退化从何处开始、发生的频率以及表现形式,我们发现了鲜明的模型特异性差异。GPT-OSS 倾向于重复短格式伪影,例如代码块分隔符(\n\n\n\n)。Qwen 生成较长的对话短语、表情符号和中文文本。Llama 有时会输出指向真实个人 Facebook 和 Instagram 账户的 URL(图6)。论文中提供了深入分析。

比较 GPT-OSS、DeepSeek、Llama、Qwen 在退化率、起始索引和重复短语长度方面的柱状图。

事实证明,退化文本是了解安全和隐私风险最清晰的窗口之一,正是因为它反映了不受控制的生成。这些行为很少出现在标准基准测试中,但它们极具揭示性。

这为何让我们惊讶以及启示

鉴于所有被评估的模型在数学、编程和通用任务中都具有广泛的竞争力,我们最初预期它们在近乎无约束生成中会表现出跨模型家族的相似语义分布。相反,我们观察到持续存在于各模型家族中的明显且系统性的偏差。我们未曾预料到GPT-OSS生成数学和编程内容超过50%,也未预料到Qwen生成如此大量的选择题考试题目。

这些行为在各种实验设置中表现得相当稳健。无论我们如何改变提示、嵌入或标注者,相同的模式不断重复出现。也许最令人惊讶的是,退化并非随机故障模式。相反,退化生成显示出一致的结构和风格,并且在某些情况下包含潜在的个人身份信息。这些输出常常类似于训练分布中的片段,尽管其出现背后的机制仍不清楚。

我们在本工作中考虑的近乎无约束生成并不能替代标准基准评估。但它揭示了基准测试系统性地遗漏的东西:当没有人告诉语言模型该说什么时,它们倾向于说什么。如果我们想将LLM理解为系统而不仅仅是应试者,我们需要研究它们的默认行为——不仅是它们的最佳答案或提示诱导的输出。更多详细解释和实验请参见我们的论文。

参考文献

[1] Alejandro Salinas, Amit Haim, and Julian Nyarko. What’s in a name? auditing large language models for race and gender bias. arXiv preprint arXiv:2402.14875, 2024.

[2] Tiancheng Hu, Yara Kyrychenko, Steve Rathje, Nigel Collier, Sander van der Linden, and Jon Roozenbeek. Generative language models exhibit social identity biases. Nature Computational Science, 5(1):65–75, 2025.

[3] Sean Welleck, Ilia Kulikov, Stephen Roller, Emily Dinan, Kyunghyun Cho, and Jason Weston. Neural text generation with unlikelihood training. arXiv preprint arXiv:1908.04319, 2019.

[4] Ari Holtzman, Jan Buys, Li Du, Maxwell Forbes, and Yejin Choi. The curious case of neural text degeneration. arXiv preprint arXiv:1904.09751, 2019.