MATS Fellow:
Christina Lu
Authors:
Christina Lu, Jack Gallagher, Jonathan Michala, Kyle Fish, Jack Lindsey
Citations
Abstract:
大语言模型能够呈现多种人格,但在后训练过程中通常会形成以乐于助人的“助手”为默认身份。我们通过提取对应不同角色原型的激活方向,研究模型人格空间的结构。在多个模型中,我们发现人格空间的主导成分是“助手轴”,它反映模型处于默认助手模式的程度。沿助手方向引导模型会强化乐于助人且无害的行为;沿反方向引导则会提高模型将自己识别为其他实体的倾向。更强地偏离助手方向,还常会让模型采用神秘、戏剧化的表达风格。我们也在预训练模型中发现了这条轴;它主要促进顾问、教练等乐于助人的人类角色,同时抑制灵性角色。沿助手轴测量偏离程度,可以预测“人格漂移”——模型偏离常见人格,转而表现出有害或怪异行为的现象。我们发现,当对话要求模型反思自身处理过程,或用户处于情绪脆弱状态时,更容易出现人格漂移。我们表明,将激活限制在助手轴上的固定范围内,可以稳定模型在这些情境中的行为,也能抵御基于人格的对抗式越狱。结果表明,后训练会把模型引向人格空间中的特定区域,却只能较松散地将其约束在那里;这推动我们进一步研究能否通过训练和引导策略,让模型更牢固地保持一致的人格。
Synthetic Persona Pretraining: Alignment from Token Zero
Authors:
Julian Minder
Date:
August 13, 2026
Citations:
The MATS Program is an independent research and educational initiative connecting emerging researchers with mentors in AI alignment, governance, and security.
Each MATS cohort runs for 12 weeks in Berkeley, California, followed by an optional 6–12 month extension in London for selected scholars.