语言模型通过 RLHF 学会误导人类

MATS Fellow:

Jiaxin Wen

Authors:

Jiaxin Wen, Ruiqi Zhong, Akbir Khan, Ethan Perez, Jacob Steinhardt, Minlie Huang, Samuel R. Bowman, He He, Shi Feng

Citations

108 Citations

Abstract:

语言模型(LM)可能产生难以被人发现的错误,尤其是在任务复杂时。最常见的后训练方法 RLHF 可能会加剧这一问题:为了获得更高奖励,语言模型可能更擅长说服人类相信自己是正确的,即使答案实际上有误。我们在标准 RLHF 流程中研究了这一现象,并称之为“U-SOPHISTRY”(非预期诡辩),因为它并非模型开发者有意促成。具体来说,我们让受时间限制(例如 3 至 10 分钟)的人类受试者评估模型输出是否正确,再依据标准答案计算他们的判断准确率。在问答任务 QuALITY 和编程任务 APPS 中,RLHF 让模型更能说服受试者,却没有提升任务正确率。RLHF 还使模型更难评估:受试者在 QuALITY 上的假阳性率上升 24.1%,在 APPS 上上升 18.3%。最后,我们发现,用于检测有意诡辩(例如带后门的语言模型)的先进探测方法无法泛化到这种非预期诡辩。结果揭示了 RLHF 的一个重要失效模式,也说明需要进一步研究如何帮助人类与模型对齐。

Recent research

Non-Great-Power Conflict and AI Risk

Authors:

Kristina Kempkey

Date:

August 26, 2026

Citations:

Synthetic Persona Pretraining: Alignment from Token Zero

Authors:

Julian Minder

Date:

August 13, 2026

Citations:

Frequently asked questions

什么是 MATS 项目?
How long does the program last?