强化学习让智能体通过与环境交互学习最优策略,核心思想是试错加奖励。AlphaGo通过自我对弈数百万局成长起来。强化学习在游戏AI、机器人控制、自动驾驶等领域广泛应用。ChatGPT使用的RLHF也是强化学习变体。