
OpenAI
—
Research Scientist
Links
Focus
Capability and Propensity Evaluations, Adversarial Robustness and Safeguards, Alignment Training Methods, AI Systems Security
Stream
OpenAI Safety Team
My focus these days is on adversarial machine learning: safety, security, and alignment of frontier models. I am particularly interested in alignment/safety RL and evaluations. In the past, I studied memorization, privacy, and security harms in language modelling, including auditing for risks and mitigating them. I've also worked on DP training algorithms, unlearning, collaborative learning approaches, and methods for ownership-verification.