对齐问题研究如何确保AI目标与人类价值观一致。回形针最大化器揭示了目标不当的灾难性后果。研究方向包括RLHF、Constitutional AI、可解释性、形式化验证等。安全对齐是通往AGI最重要一环。