LSTM 技术
LSTM 是 1997 年提出的门控循环网络,用遗忘/输入/输出门与细胞状态缓解梯度消失,曾是语音、翻译与时间序列的最强序列模型。
大模型 · 万物互联 · 人工智能的结构化知识库。人人可阅读、可贡献、可追溯。
LSTM 是 1997 年提出的门控循环网络,用遗忘/输入/输出门与细胞状态缓解梯度消失,曾是语音、翻译与时间序列的最强序列模型。
神经网络由大量带权重的「神经元」分层连接而成,通过激活函数实现非线性映射,用反向传播训练,是深度学习的基础模型,从感知机到 Transformer 不断演化。
深度学习用多层神经网络从数据中自动学习分层表征,2006 年 Hinton 提出逐层预训练,2012 年 AlexNet 引爆,现已主导视觉、语音与自然语言处理。
联邦学习让多参与方在数据不出本地的前提下协同训练模型(聚合梯度/参数),保护隐私与数据主权,FedAvg 是基础算法,广泛用于手机输入法与医疗跨机构建模。
元学习让模型「学会如何学习」:在大量任务上训练快速适应新任务的机制,代表为 MAML(学习初始化)、度量型(原型网络)与优化器型,支撑少样本学习与快速适应。
度量学习学习一个嵌入空间,使同类样本距离近、异类距离远,是识别与检索的核心范式:三元组损失(FaceNet)、对比损失、softmax 间隔损失(ArcFace)均属此类。
对比学习通过拉近正样本对(同一数据的不同视图)、推远负样本对来学习表征,InfoNCE 是标准损失,SimCLR、MoCo 与 CLIP 使其成为自监督学习的主流。
模型蒸馏用大模型(教师)的软标签指导小模型(学生)训练,实现知识迁移与模型压缩,Hinton 2015 年提出,是边缘部署与大模型压缩的关键技术。
Boosting 串行训练基学习器,每轮更关注上一轮错分样本(重加权/残差拟合),显著降低偏差,AdaBoost 与梯度提升(GBDT/XGBoost)是两大代表。
Bagging 用 Bootstrap 有放回采样生成多份训练集并行训练基模型,再聚合预测,显著降低方差(尤其高方差算法如决策树),随机森林是其代表。
t-SNE 是 2008 年提出的非线性降维可视化方法:把高维相似度转为低维概率并用 t 分布优化 KL 散度,擅长展示聚簇结构,是数据可视化的事实标准。
降维把高维数据映射到低维表示,缓解维度灾难、加速计算并支持可视化,线性方法(PCA、LDA)与非线性流形方法(t-SNE、UMAP)两大类。
XGBoost 是 2016 年开源的梯度提升树库,引入正则化、二阶梯度与近似分裂算法,曾是 Kaggle 竞赛的统治性算法,至今仍是结构化数据建模的默认选择。
梯度提升(GBM)以加法模型顺序拟合「负梯度」(伪残差),每次用弱学习器逼近残差,XGBoost、LightGBM、CatBoost 使其成为表格数据最强算法族。
K-means 通过迭代分配-更新质心把数据分为 K 簇,简单高效、应用极广,是聚类与图像量化的默认算法,但对 K 值、初始点与离群点敏感。