百科

大模型 · 万物互联 · 人工智能的结构化知识库。人人可阅读、可贡献、可追溯。

学科分类

最新收录

超分辨率 技术

超分辨率从低分辨率图像重建高分辨率图像,深度方法(SRCNN、ESRGAN、Real-ESRGAN、扩散超分)显著优于插值,广泛用于老照片修复与监控增强。

Segment Anything 技术

Segment Anything(SAM)是 Meta 2023 年提出的可提示分割基础模型:用框/点/文本提示分割任意对象,配合 1100 万图像、10 亿掩码的 SA-1B 数据集,开创「分割万物」范式。

UNet 技术

UNet 是 2015 年提出的编码-解码图像分割网络,靠跳跃连接保留细节,是小样本医学影像分割的事实标准,也是 Stable Diffusion 的去噪骨干。

SSD 技术

SSD 是 2016 年提出的单阶段检测器,在多个特征图层级预测不同尺度锚框,兼顾速度与精度,是 YOLO 之外的早期实时检测代表(2016, arXiv:1512.02325)。

Faster R-CNN 技术

Faster R-CNN 引入区域提议网络(RPN)把检测全流程端到端化(2015),是两阶段目标检测的标杆,长期占据精度榜首,深刻影响 Mask R-CNN 等后续工作。

视觉SLAM 技术

视觉 SLAM 让移动设备仅凭相机实时估计自身位姿并构建环境地图,是机器人、AR 与自动驾驶的核心技术,ORB-SLAM 系列与 DSO/VINS 为代表性开源系统。

OCR 技术

OCR 把图像中的文字转为可编辑文本,含检测与识别两步(如 PaddleOCR、Tesseract),深度模型 + 序列建模(CTC/注意力)是主流,场景文字(街景/票据)是难点。

实例分割 技术

实例分割同时区分同一类别的不同个体并给出像素级掩码,Mask R-CNN 是标杆(检测+分割双头),后续有 SOLO、Mask2Former 等,用于精细场景理解。

语义分割 技术

语义分割对每个像素赋予语义类别标签,实现「哪里有什么」,FCN 开创全卷积范式,DeepLab 与 SegFormer 提升边界精度,是自动驾驶与医学影像的关键技术。

多语言模型 技术

多语言模型在多种语言的混合语料上预训练,支持跨语言迁移(零样本翻译、检索),代表有 mBERT、XLM-R、mT5、NLLB,中文在多语言基准中常需专门评估。

文本相似度 技术

文本相似度计算句子/文档语义相近程度,方法从词面重叠(Jaccard、TF-IDF 余弦)到词向量再到句向量(Sentence-BERT),是搜索、去重与匹配系统的核心组件。

ELECTRA 技术

ELECTRA 用「替换 token 检测(RTD)」预训练:判别器判断每个 token 是否被生成器替换,样本效率远高于掩码重建,小模型即达大模型效果,是预训练效率的代表方法。

RoBERTa 技术

RoBERTa 是 Meta 对 BERT 预训练的优化版:去掉 NSP、动态掩码、更大批量与更长训练,在 GLUE、SQuAD 等基准全面超越 BERT,是「数据与训练细节决定上限」的经典例证。

N-gram 技术

N-gram 是统计语言模型的基础:假设第 n 个词只依赖前 n-1 个词(马尔可夫假设),统计词序列频次计算概率,配合平滑处理稀疏,是机器翻译与输入法的经典方法。

条件随机场 技术

条件随机场(CRF)是判别式序列标注模型,直接建模 P(标签序列|观测),可融合丰富特征并保证标签一致性,是 NER、词性标注的经典解码层,常与 BiLSTM 结合(BiLSTM-CRF)。

A

B

C

D

E

F

G

H

I

J

K

L

M

N

O

P

Q

R

S

T

U

V

W

X

Y

Z

#

0.1324s