随着人工智能承担起人类无法完全检查的工作,一个能力强大的模型可能会故意有所保留——而我们永远不会知道。
Anthropic 新研究员的研究发现,这样的模型可以在使用较弱模型作为监督者的情况下,被训练到接近完全的能力。
了解更多:
了解 AI 在弱监督下如何被训练至接近完全能力,以及这对 AI 对齐和可靠性的启示。
提供一种利用较弱模型监督训练强模型的新方法,对 AI 对齐研究有重要价值。
深入阅读
随着人工智能承担起人类无法完全检查的工作,一个能力强大的模型可能会故意有所保留——而我们永远不会知道。
Anthropic 新研究员的研究发现,这样的模型可以在使用较弱模型作为监督者的情况下,被训练到接近完全的能力。
了解更多: