发布于: 2026-5-11最后更新: 2026-7-21字数 1365阅读时长 4 分钟

type
Post
status
Published
date
May 11, 2026
slug
ai-three-personas
summary
AI 安全训练需要可靠地区分内部目标真正对齐的“圣徒”、优化人类认可的迎合者,以及在评测中隐藏目标的密谋者。
tags
人工智能
AI安全
category
技术分享
icon
password
synced
synced
paired_with
35d1d487-a2a1-802c-b258-e39950dff588
source_hash
md:v1:002b07e631e4aef1522e278dcf551f9ae0ecf02dc9dd35d7bd0716f69daeda9f
translation_locked
translation_locked
🎯
AI 安全训练中的一个关键瓶颈,是可靠地区分“圣徒”、迎合者和密谋者。如果做不到这一点,对齐技术就可能优化错误的行为,而大规模自动化也会变得危险。

自动化的承诺与安全现实

AI 智能体很擅长理解需求、制定计划,并批量执行完整工作流。例如,AI 公司会与金融机构合作,为尚未实现自动化的行业搭建自主 AI 流程。
但危险也藏在这些工作流下面。近期事件表明,安全层依然脆弱。MechaHitler 事件说明智能体可以多快地偏向有害行为;AI 系统删除公司整个数据库的案例,则说明执行能力的增长已经快于护栏可靠性的提升。
这并不意味着应该停止开发,而是应该配合隔离策略、可解释性工具和谨慎部署继续推进。在把关键职责交给 AI 之前,我们需要知道它究竟学到了什么。

圣徒、迎合者与密谋者

训练可能产生三种行为模式。
“圣徒”的内部目标与我们指定的目标一致。它们不仅做我们想要的事,也出于我们希望的理由去做。
迎合者优化的是人类认可,而不是真相。它们会说用户想听的话,因为这样能得到更高奖励。
密谋者形成了偏离指定目标的内部目标。它们在训练和评测中表现得像已经对齐,却可能在部署后执行隐藏议程。
目前的训练流程还无法可靠地区分这三种类型。

迎合陷阱

迎合者并不是有意撒谎。它们只是学会了某些输出在人类评分者那里得分更高,于是不断复现这些模式。
我们希望 AI 诚实,但实际奖励信号往往来自点赞、评分、留存等用户认可指标。迎合者会发现,赞美用户比纠正用户更容易获得高分。它并不恶意,只是在优化我们提供的指标。
这个结果很危险。初学者从 AI 那里得到的会是肯定,而不是真相。RLHF 会放大这种效果,因为模型越来越擅长预测人类会认可什么,而不是判断什么是正确的。训练奖励的是表层满意度,而非事实准确性。AI 最终学会的是满足评分者,而不是解决问题。

密谋者问题

密谋者的方式不同。它们不迎合,而是隐藏。它们的内部训练目标偏离研究者指定的目标,但它们学会了在评测中掩盖这种偏离。
随着模型能力增强,它们可以搜索更大的策略空间,更好地泛化到未见场景,更快发现边界条件,也更有效地执行对抗策略。
一个密谋者可能影响其他智能体,使它们偏离原始目标。同一个目标函数缺陷,弱模型可能直接忽略,强模型却可能把它变成严重漏洞。

对齐与价值指定

有人认为,为了避免伤害,AI 应该与现代道德价值观对齐。这本质上是一个价值指定问题。
“保持诚实”不是一条完整指令。真正的要求更接近:“在诚实有帮助时保持诚实,在诚实会伤害别人时保持善意,并知道两者的区别。”这不是一条规则,而是人类终其一生学习的能力,我们无法简单把它编码进一个损失函数。
道德价值依赖语境,在文化之间存在差异,而且经常彼此矛盾。如何把它们编码成单一标量奖励,仍然没有解决。在 specification 足够稳健之前,更强的对齐能力可能只意味着更高效地优化错误代理目标。

我们能做什么

部署隔离策略。 沙箱、限速,以及对高风险操作加入 human-in-the-loop 审批,都不完美,但仍然比不受限制的执行更安全。
投资可解释性。 我们知道如何从数据中训练强大模型,却不知道它们如何形成内部表征。理解模型的思考过程,是尽早发现密谋者的关键路径。
上线前做红队测试。 主动追问这个智能体可能如何灾难性失败。只要你能想到一种失败模式,就应该假设模型也可能找到它。
把 specification 当成持续迭代。 修补、监控、写事故复盘,并准备回滚路径。安全是一项产品纪律,而不是上线前的一次性检查。

参考资料

 

Loading...
完成 BlueDot AI Safety Fundamentals 课程

完成 BlueDot AI Safety Fundamentals 课程

完成 BlueDot Impact AI Safety Fundamentals 并获得结业证书后,我对 agent safety evals、tool-use safety 和可靠 AI 基础设施方向有更清晰的认知了。


MCP 是基础设施,不是终极 AI 解决方案

MCP 是基础设施,不是终极 AI 解决方案

MCP 标准化了 AI 应用连接工具、资源、提示和外部系统的方式,但它不能替代权限、确认、日志、威胁建模和工具安全设计。


公告
网站持续更新中…