百科

大模型 · 万物互联 · 人工智能的结构化知识库。人人可阅读、可贡献、可追溯。

学科分类

最新收录

SAC 技术

SAC 在 Actor-Critic 中加入最大熵正则:最大化回报+熵,提升探索与鲁棒性,2018 年提出后成为连续控制领域最稳健的样本高效算法。

DDPG 技术

DDPG 结合 DQN 与确定性策略梯度,用 Actor 输出连续动作、Critic 评估,配合经验回放与目标网络,是连续控制深度 RL 的开山算法(2016)。

PPO 技术

PPO 通过裁剪概率比限制每次策略更新幅度,兼顾 TRPO 的稳定性与实现的简单性,2017 年提出,是 RLHF(ChatGPT 对齐)与机器人强化学习的默认算法。

演员-评论家 技术

演员-评论家(Actor-Critic)由策略网络(Actor)与价值网络(Critic)组成,Critic 评估动作好坏降低策略梯度方差,是 PPO、SAC、DDPG 等现代 RL 算法的共同骨架。

深度Q网络 技术

DQN 用深度网络逼近 Q 函数,配合经验回放与目标网络稳定训练,2015 年以人类级表现玩 Atari 游戏,开启深度强化学习时代。

Q学习 技术

Q-learning 是 1989 年 Watkins 提出的离策略时序差分算法,通过 Q(s,a)←Q+α[r+γmax Q(s',·)-Q] 逼近最优动作价值,是表格与深度 RL(DQN)的共同基石。

策略梯度 技术

策略梯度直接对策略参数求奖励期望的梯度并更新,天然支持连续动作与随机策略,REINFORCE 是基础,配合基线(baseline)降方差,PPO/TRPO 是其进阶形态。

马尔可夫决策过程 概念

马尔可夫决策过程(MDP)是强化学习的数学框架:(S,A,P,R,γ),状态转移满足马尔可夫性质,目标是最大化期望折扣累积奖励,几乎所有 RL 问题都建模为 MDP。

深度强化学习 概念

深度强化学习用深度神经网络作为价值/策略函数逼近器,2015 年 DQN 在 Atari 上超越人类,开启现代 RL 时代,AlphaGo、机器人学习与大模型对齐都建立其上。

强化学习 概念

强化学习(RL)让智能体通过与环境交互、试错获得累积奖励最大化策略,是继监督/无监督之外的第三大学习范式,AlphaGo、ChatGPT 对齐(RLHF)均依赖它。

稠密模型 概念

稠密模型指推理时激活全部参数的神经网络(区别于稀疏激活的 MoE),GPT-3、PaLM、LLaMA 均为稠密模型,训练稳定、实现简单,但参数-算力比随规模上升。

学习率调度 技术

学习率调度按训练阶段调整学习率(阶梯衰减、余弦退火、Warmup),在快速收敛与稳定收敛间平衡,是大模型训练(Warmup+余弦)与超参数调优的关键技巧。

梯度消失 概念

梯度消失指反向传播中梯度随层数指数衰减,使深层网络无法学习,源于饱和激活与链式相乘,LSTM 门控、ReLU、残差连接与归一化是主要对策。

分布式训练 技术

分布式训练用多 GPU/多机并行训练大模型:数据并行(DDP)、张量并行、流水线并行与 ZeRO 显存优化,通信用 AllReduce/All-to-All,是 GPT-4、Llama 3 级模型的必备技术。

混合精度训练 技术

混合精度训练用 FP16/BF16 计算与存储、FP32 主权重与损失缩放,在保持精度的同时降低显存并利用 Tensor Core 加速,是大模型训练的标准配置(AMP、DeepSpeed、bfloat16)。

A

B

C

D

E

F

G

H

I

J

K

L

M

N

O

P

Q

R

S

T

U

V

W

X

Y

Z

#

0.1208s