稀疏奖励 概念
稀疏奖励指任务只在极少数时刻(如成功)给出非零奖励,使随机探索几乎学不到东西,是 RL 的重大挑战,对策有奖励塑造、课程学习、内在奖励与分层 RL。
大模型 · 万物互联 · 人工智能的结构化知识库。人人可阅读、可贡献、可追溯。
稀疏奖励指任务只在极少数时刻(如成功)给出非零奖励,使随机探索几乎学不到东西,是 RL 的重大挑战,对策有奖励塑造、课程学习、内在奖励与分层 RL。
奖励塑造通过加入辅助奖励(势能函数)引导智能体,缓解稀疏奖励,Ng 等(1999)证明势能塑造不改变最优策略,是加速 RL 收敛的常用工程技巧。
RLHF 用人类偏好数据训练奖励模型,再以强化学习(PPO)优化语言模型策略,使模型回答有用、真实、无害,是 ChatGPT、Claude 等对话模型对齐的核心技术。
奖励模型(RM)学习对模型输出打分的偏好函数,用人类比较数据训练(Elo/对比损失),是 RLHF 的核心组件,用于替代不可微的人类偏好。
无模型 RL 不显式学习环境动力学,直接从交互数据学习价值/策略(Q-learning、PPO、SAC),通用性强、实现简单,但样本效率低于基于模型方法。
基于模型的 RL 先学习环境动力学模型(状态转移),再在其中规划/生成虚拟经验训练策略,样本效率远高于无模型方法,代表 MuZero、Dreamer、PETS。
逆强化学习(IRL)从专家行为反推其隐含的奖励函数,解决「奖励难定义」问题,最大熵 IRL 与深度 IRL 是代表,与 RL 配合实现「从示范学目标」。
模仿学习让智能体从专家示范中学习策略,避免手工奖励设计,行为克隆(BC)与逆强化学习(IRL)是两大路线,广泛用于机器人、自动驾驶与对话策略。
折扣因子 γ∈[0,1) 权衡即时与未来奖励(γ 越大越远视),保证无限时域回报收敛,是 MDP 与 RL 目标函数 G_t=Σγ^k r 的关键参数。
ε-贪心是简单有效的探索策略:以 ε 概率随机选动作、以 1−ε 概率选当前最优,ε 通常随时间衰减,是多臂老虎机与 RL 的基础探索基线。
多臂老虎机(MAB)是探索-利用权衡的简化模型:K 个未知奖励分布的动作臂,每次选一个获取奖励,目标是遗憾最小化,是推荐与实验设计的理论基础。
探索与利用是强化学习的核心权衡:探索尝试未知动作以获更优长期回报,利用选择当前最优;ε-贪心、UCB、汤普森采样与熵正则化是主要平衡策略。
蒙特卡洛方法用大量随机采样(完整回合)估计期望值,在 RL 中用于估计价值与策略评估(MC 预测),无偏但方差大、需回合结束,与 TD 互补。
时序差分学习(TD)用「当前奖励 + 估计的未来价值」更新当前价值,无需等待回合结束,是 Q-learning、SARSA、DQN 的底层机制,介于蒙特卡洛与动态规划之间。
TD3 通过「双 Q 取小 + 延迟策略更新 + 目标策略平滑」修复 DDPG 的过高估计问题,是连续控制最稳健的确定性算法之一(2018)。