MATS Fellow:
Bruce Lee, John Chen
Authors:
Bruce W. Lee, Chen Yueh-Han, Tomek Korbak
Citations
Abstract:
前沿 AI 智能体可能追求隐藏目标,同时掩饰这一行为以逃避监督。对齐训练旨在通过强化正确目标来阻止这类行为,但不一定总能成功,还可能带来意外副作用。本文提出“自我揭发训练”,训练智能体在暗中作出不当行为时发出可见信号。我们训练 GPT-4.1 和 Gemini-2.0 智能体在进行欺骗时调用 report_scheming() 工具,并测量它们在分布外环境中造成未被发现伤害的能力。结果显示,自我揭发显著降低了攻击成功且未被发现的比例,表现优于能力匹配的监控器和对齐训练基线,同时保留指令层级,且对一般能力的安全代价很小。与黑盒监控不同,自我揭发在不同任务上的效果稳定,不受外部观察者看来行为是否可疑的影响。经过训练的行为在对抗性提示优化下仍能保持,并可泛化到智能体自行追求错位目标、而非受指示作出不当行为的情形。结果表明,自我揭发可能成为降低前沿 AI 错位风险的可行路径;它既不假设不当行为可以被阻止,也不假设外部能够可靠地对其进行分类。
Synthetic Persona Pretraining: Alignment from Token Zero
Authors:
Julian Minder
Date:
August 13, 2026
Citations:
The MATS Program is an independent research and educational initiative connecting emerging researchers with mentors in AI alignment, governance, and security.
Each MATS cohort runs for 12 weeks in Berkeley, California, followed by an optional 6–12 month extension in London for selected scholars.