它是什么
让模型行为符合人类意图与使用规范的一整套训练和约束手段,覆盖有用、诚实、无害三个方向。
为什么重要
它决定了模型在普通任务上敢不敢直说、在敏感问题上会不会敷衍,理解它才能大致预期模型会在哪里收着、为什么收着。
打个比方
像入职培训加上日常督导:上岗前先教规矩,运行时还得有人复核,而规矩本身也会随争议不断修订。
举个例子
模型被训练成对不确定的事实先说不确定、对可能造成伤害的请求给出安全替代,这就是日常使用中感受到的那种「分寸感」;但规则过严时,它也会拒答其实无害的问题。
常见误解
误解:对齐只是过滤敏感词。 事实:它更多来自训练阶段的偏好优化与规则约束,关键词过滤只是最表层的一环。
误解:对齐意味着绝对安全。 事实:越狱与提示词注入仍在发生,安全是概率性的降低,而不是零风险。
误解:模型回答保守就说明能力差。 事实:有时只是拒答策略偏严,换一个允许更直接作答的模型同样能完成任务。
误解:对齐一经设定就永久固定。 事实:它会随产品政策、法规与公众反馈不断调整,不同版本之间的行为可能明显不同。
延伸阅读(相关概念)
本页内容更新于 2026 年 9 月 26 日。概念条目会随模型能力变化而修订。