介绍_基础知识)
基本概念强化学习是机器学习的三大范式之一另外两个是监督学习和无监督学习核心思想是智能体通过与环境不断交互、试错根据获得的奖励信号来学习最优行为策略。基本组成部分一个强化学习问题通常包含这几个基本组成部分智能体Agent做决策的主体比如下棋的AI、控制机器人的程序环境Environment智能体所处并与之交互的外部世界状态State环境在某一时刻的描述动作Action智能体可以采取的行为奖励Reward环境对智能体动作的反馈信号用来评价这个动作的好坏策略Policy智能体根据当前状态选择动作的规则是强化学习要学习的核心对象这个循环不断重复智能体观察状态 → 选策略 → 执行动作 → 环境反馈奖励和新状态 → 智能体据此调整策略。这个用反馈调整行为的过程就是强化学习的本质。与其他学习范式的区别类型特点监督学习有标准答案标签直接告诉模型对错无监督学习没有标签寻找数据内在结构强化学习没有标准答案只有好不好的反馈奖励且反馈可能延迟到来强化学习的一个关键难点是信用分配问题credit assignment如果一局游戏最后赢了很难判断中间哪几步动作起了决定性作用。几个核心概念价值函数Value Function评估某个状态或状态-动作对未来能获得多少累计奖励帮助智能体判断现在处境好不好探索与利用的权衡Exploration vs Exploitation智能体要在尝试新动作看看效果和用已知最优动作获取稳定收益之间做取舍——这是强化学习特有的难题折扣因子Discount Factor衡量未来奖励相对于当前奖励的重要程度避免智能体只顾眼前常见算法方向基于价值Value-based如 Q-learning、DQN学习每个动作值多少再据此选择基于策略Policy-based如策略梯度Policy Gradient、PPO直接学习该怎么做的策略Actor-Critic结合两者优点一个网络评估价值一个网络输出动作典型应用游戏AlphaGo、Atari游戏、机器人控制、自动驾驶、推荐系统、以及近年很热门的RLHF基于人类反馈的强化学习用于训练像我这样的对话模型使回答更符合人类偏好。马尔可夫链(Markov Chain):满足马尔可夫性的链 而这个链包括一组状态有限或无限多个状态 和状态之间的转移概率马尔可夫性即马尔可夫假设 假设当前状态只和前τ个状态有关默认为1 即一阶马尔可夫链 反之为高阶该马尔可夫链的转移矩阵如下 同时 为了更清楚地表示行和列对应于哪个状态 我们对转移概率进行了如下可视化马尔可夫决策过程(Markov Decision Process, MDP):马尔可夫决策过程MDP强化学习问题的数学框架假设未来只取决于当前状态与历史无关。马尔可夫链在强化学习领域的具体应用 包括一组状态、 一组动作、 状态转移概率、 奖励函数和折扣因子• 在MDP中 智能体可以选择动作 然后在环境下根据状态转移概率确定下一个状态 并返回一个即时奖励• MDP的目标是找到一个最优策略 以最大化期望累积回报或价值函数策略函数Policy Function在某个state下可以选择一个具体动作 这依靠策略函数分为两种确定性策略Deterministic Policy 给定一个状态 策略函数直接输出一个唯一的动作可以表示为——在状态 s 下 策略直接给出唯一动作随机性策略Stochastic Policy 对于给定的状态 策略输出的是一个动作的概率分布,可以表示为——在状态 s 下采取动作 a 的概率 将状态映射到动作的概率分布上, 也就是我们之前说的状态转移概率实际情况往往是第二种 在深度学习中 这个策略函数由神经网络表示上面只描述了一种情况 所有的可能为树形结构其中环境的随机性例如掷骰子强化学习算法介绍强化学习_自动驾驶中可以解决哪些问题RL通过模拟人类驾驶的“试错-学习”过程在以下几个典型场景中发挥着不可替代的作用1. 长时序决策问题本质自动驾驶中的很多动作如是否提前变道、是否礼让其好坏往往需要几秒甚至几十秒后才能体现因果属于典型的长时域决策问题。RL的优势RL通过最大化“累积回报Return”来建模长期收益能够学习到“短期让一步长期更顺畅”的隐式策略而非短视的贪心决策。典型场景高速提前变道、城市路口通行策略、拥堵路段策略选择。2. 多目标权衡Safety / Efficiency / Comfort问题本质自动驾驶绝非单一目标优化而是需要在安全零碰撞、通行效率、舒适性Jerk、急刹、法规合规及社会规范之间寻找平衡这些目标往往相互冲突。RL的优势RL的reward函数可以天然地将多个目标进行加权和权衡在复杂的 Trade-off 中自动学习到最优策略。典型场景加塞博弈、绕行与危险变道的平衡。3. 不确定交互建模Multi-agent interaction问题本质现实交通是多智能体博弈系统行人、其他车辆传统规则/MPC需要显式假设对方行为模型难以覆盖人类的“非理性行为”。RL的优势RL可以在仿真中通过大量交互经验自主学习策略自然地处理礼让、博弈、抢行等复杂社交交互行为。典型场景路口人车交互、高速变道博弈。4. 稀疏/延迟反馈场景问题本质很多驾驶体验如“一路顺畅无接管”没有即时标注信号属于稀疏奖励问题。RL的优势RL不依赖逐帧标签而是通过 Episode-level整局的奖励反向约束行为适合端到端驾驶策略和舒适性优化。典型场景路口左右转轨迹类人性、人类偏好对齐。5. 规则难以穷举的“灰色决策区”问题本质现实中大量场景如窄路会车、礼让行人但不被拖死法规未写清或存在冲突需要“人类直觉”。RL的优势不依赖明确规则直接从海量真实或仿真数据中学习“隐含策略”。强化学习_自动驾驶中遇到哪些挑战尽管RL优势明显但在实际工程落地中仍面临核心瓶颈尤其是Reward 设计 和样本效率 问题。1. Reward 设计的困境与“ Reward Hacking”自动驾驶期望的是“规则安全常识”而RL只能理解“数值可微累积期望”两者在数学表达上存在天然鸿沟Reward 不完备自动驾驶涉及安全、法规、舒适、效率、社会规范等多个维度只要漏掉一项RL就会疯狂利用这个漏洞例如只奖励速度导致车辆横冲直撞。权重不可调人工拍脑袋设定的权重往往不可解释、不可验证如 -1000 和 -2000 的碰撞惩罚有本质区别吗。长时 Credit Assignment归因崩溃几秒前的激进行为可能导致10秒后的险情但 Reward 只在最后给出RL 极难判断到底是哪个动作导致了事故。与人类直觉不一致人类驾驶讲究“守住一点”、“给对方留空间”而 RL 看到的是“你没撞 你快了”。这导致 RL 学会“赌对方减速”或“边缘试探”。Sim2Real 失效仿真中 Reward 很好但传感器噪声和真实物理规律不同导致模型学到“表面安全实则埋雷”的策略对 Rare Case长尾场景完全失效。Reward Hacking奖励黑客现象模型为了最大化奖励往往会走捷径而不是执行真正想要的驾驶行为。例如reward -collision - jerk speed模型可能学到“慢到永远不出事”或“穿模型车缝隙”的策略。本质Reward Hacking 不是 RL 的 Bug而是它的本性。在自动驾驶中唯一正确的做法是不指望 Reward 正确而是设计系统能容忍 Reward 不完美。应对思路采用多 Reward 随机化Domain Randomization、用人类偏好IRL / Preference RL / DPO代替手写公式让“人”来定义好坏。2. 样本效率问题自动驾驶的试错成本极高真实路测危险且昂贵而经典 RL 往往需要海量样本才能收敛。解决方法奖励塑造Reward Shaping设计更频繁的辅助奖励如“创伤重放记忆”只包含碰撞情况引导智能体从更少样本中学习中间目标。模仿学习助力的强化学习IL bootstrapped RL先从专家演示人类驾驶数据中学习初始策略再用 RL 自我提升大幅降低探索成本。参与者-评价者与经验重放结合ACER利用重放缓冲区高效利用每一段采样经验进行策略梯度更新。有效的状态表示Efficient State Representations使用 VAEs变分自编码器等世界模型学习压缩的时空表示直接从低维特征推导策略提升学习效率。小结RL 为自动驾驶带来了处理复杂、动态、非结构化环境的强大范式尤其在长时序决策、多目标权衡和人车交互博弈上表现优异。然而“Reward 设计”是当前最大的拦路虎它决定了模型的价值观和行为边界同时“样本效率”和“仿真到现实的迁移Sim2Real” 也是制约其大规模落地的关键。未来的发展方向必然是“混合智能”结合规则的安全兜底、人类的先验知识与 RL 的自主探索能力在可容忍 Reward 不完美的系统中实现安全、舒适、高效的自动驾驶。