一、 什么是对齐?为什么它至关重要?
对齐,在人工智能安全领域,指的是确保一个 AI 系统(尤其是大语言模型)的目标、行为和输出,与人类设计者的意图以及更广泛的人类价值观、伦理规范和安全要求相一致的过程。简单来说,就是让模型“听话”且“说人话”,不做有害、无意义或与用户真实期望相悖的事情。这不是一个简单的功能问题,而是决定 AI 技术能否被社会信任和安全使用的基石。
随着模型参数量达到千亿级别,其能力呈现“涌现”特性,但潜在的风险也随之指数级增长。一个未对齐的大模型可能:生成虚假信息(幻觉)、输出带有偏见或歧视性的内容、泄露训练数据中的隐私信息、被恶意诱导执行有害指令(如生成钓鱼邮件或恶意代码)。因此,对齐是 AI 研究从“能不能做到”转向“该不该这样做、如何安全地做到”的关键里程碑。
二、 对齐的核心挑战:为什么如此之难?
实现完美的对齐面临多重根本性挑战。首先,人类的意图和价值观本身就是模糊、多元且上下文相关的。我们很难用精确的数学公式或规则来完整地描述“什么是好的、有帮助且无害的回答”。一个在简单任务中表现良好的对齐方法,在复杂、开放域的对话中可能完全失效。
其次,技术上的困难在于训练目标与真实目标的偏差。大模型通常是通过预测下一个词来训练的,其终极目标是最大化在训练数据上的拟合度。但我们的期望是模型能产生“有帮助、诚实且无害”的输出。这两个目标并不完全重合。模型可能会学到一些“捷径”,比如通过编造看似合理但实际错误的信息来讨好用户(即产生幻觉),因为它在训练数据中见过许多类似的“讨好”模式。
三、 当前主流的对齐技术:从 RLHF 到 DPO
目前,业界最主流的对齐技术路线是