百科

大模型 · 万物互联 · 人工智能的结构化知识库。人人可阅读、可贡献、可追溯。

学科分类

最新收录

多查询注意力 技术

多查询注意力(MQA)让所有查询头共享同一组键值头,把解码 KV 缓存降至 1/h,是 GQA 的极端特例,牺牲少量质量换取显著显存与延迟收益。

分组查询注意力 技术

分组查询注意力(GQA)让多个查询头共享一组键值头(介于 MHA 与 MQA 之间),显著降低 KV 缓存与推理显存,同时保持接近 MHA 的质量,是 LLaMA 2/3、Mistral 等大模型的标准配置。

FlashAttention 技术

FlashAttention 通过 IO 感知的分块计算(tiling + online softmax)把注意力运算保持在片上 SRAM,避免读写 HBM 中间矩阵,使注意力训练提速 2-4 倍并大幅省显存,是长上下文大模型的基石。

剪枝 技术

剪枝删除网络中不重要的权重、通道或层(重要性由幅度/梯度/贡献衡量),在尽量保持精度下减小模型体积与加速推理,常与量化、蒸馏组合用于模型压缩。

模型量化 技术

模型量化把权重/激活从 FP32 压缩到低精度(FP16/INT8/INT4),显著减小模型体积并加速推理,是大模型端侧部署的关键技术,代表方法 GPTQ、AWQ、LLM.int8()。

变分自编码器 技术

变分自编码器(VAE)用变分推断学习可采样的潜变量分布,损失=重构误差+KL 正则,是生成模型的开创之作(2013/2014),也是稳定扩散潜空间的组件。

池化 技术

池化对局部区域做聚合(最大/平均)实现下采样,降低计算与过拟合并带来平移不变性,是 CNN 的标配组件,全局平均池化常用于分类头。

ReLU 技术

ReLU(修正线性单元)为 f(x)=max(0,x),计算极快且正区间梯度恒为 1,缓解梯度消失,是深度学习默认激活函数,衍生 LeakyReLU 等解决神经元死亡。

激活函数 技术

激活函数为神经网络引入非线性(否则多层退化为线性),ReLU 族(ReLU、LeakyReLU、GELU)是主流,sigmoid/tanh 用于概率与门控,激活选择影响收敛与表达。

批归一化 技术

批归一化(BatchNorm)在训练时用 mini-batch 统计归一化层激活,显著加速收敛并改善梯度,是 CNN 深度化的关键技巧(2015),但依赖批大小、在序列任务中被 LayerNorm 取代。

层归一化 技术

层归一化(LayerNorm)对单个样本的层内激活做均值方差归一化(加仿射),与样本顺序无关,是 Transformer 的标准组件,替代批归一化用于序列与 Transformer 模型。

多头注意力 技术

多头注意力把注意力计算并行拆成多个头(不同子空间),分别建模不同关系再拼接,是 Transformer 的核心组件,提升表达能力与并行效率。

注意力机制 技术

注意力机制让模型动态聚焦输入中的关键部分:从 seq2seq 的对齐注意力(2015)到 Transformer 的自注意力(2017),是现代大模型与多模态系统的核心机制。

ResNet 技术

ResNet 通过「残差连接」(恒等捷径)让数百层网络可训练,解决深度网络的退化与梯度消失,2015 年 ImageNet 夺冠并推动 CNN 深度革命,是现代网络的标配。

GRU 技术

GRU 是 2014 年提出的简化门控循环网络,仅用重置门与更新门,参数更少、训练更快,性能与 LSTM 相当,是机器翻译等序列任务的高效选择。

A

B

C

D

E

F

G

H

I

J

K

L

M

N

O

P

Q

R

S

T

U

V

W

X

Y

Z

#

0.1176s