百科

大模型 · 万物互联 · 人工智能的结构化知识库。人人可阅读、可贡献、可追溯。

学科分类

最新收录

数据版权 概念

数据版权聚焦 AI 训练语料的知识产权:大模型使用受版权文本/图像训练是否构成侵权(合理使用?),多起诉讼(NYT、Getty)正在重塑数据授权模式与训练实践。

合成数据 概念

合成数据由模型或仿真生成(而非真实采集):用于补齐长尾、保护隐私、降低标注成本,大模型「蒸馏数据」训练小模型成为主流(Phi、DeepSeek-R1 的 R1 数据),但存在「模型坍缩」风险。

WebArena 技术

WebArena 是 2023 年发布的真实网页操作 Agent 基准:自托管的电子商务、论坛、CMS 等网站,812 个任务测「浏览+操作」能力,是浏览器 Agent 评测标准。

SWE-bench 技术

SWE-bench 是 2023 年发布的真实软件工程评测:2294 个 GitHub issue + 对应 PR 补丁,要求模型修复真实 bug,是「AI 工程师」Agent 能力的行业标准基准。

TruthfulQA 技术

TruthfulQA 是 2022 年发布的 817 道「常识误解」问答基准(含错误被广泛相信的题目),专门测模型「真实性而非流畅性」,是幻觉与真实性评估的经典工具。

BIG-bench 技术

BIG-bench 是 2022 年发布的 200+ 任务协作式 LLM 评测基准(推理、知识、多语言、社会偏见等),其 BIG-Bench Hard(BBH)聚焦 23 个「涌现」难任务,是分析模型能力的标准工具。

Common Voice 技术

Common Voice 是 Mozilla 发起的众包多语言语音数据集(CC0 许可,100+ 语言),用于 ASR 与语音研究,数据全开放是其在多语言低资源场景的价值所在。

LibriSpeech 技术

LibriSpeech 是基于 LibriVox 有声书的约 1000 小时英语语音数据集(2015),含清晰/噪声测试集,是 ASR 研究的经典开源基准。

Kinetics 技术

Kinetics 是 YouTube 视频动作识别数据集(Kinetics-400/600/700,约 65 万视频片段、400-700 类),是行为识别模型(I3D、SlowFast)预训练与评测的标准基准。

Cityscapes 技术

Cityscapes 是 5000 张精细标注 + 2 万张粗糙标注的城市场景驾驶数据集(像素级语义/实例分割),2016 年发布,是自动驾驶分割研究的标杆基准。

CIFAR-10 技术

CIFAR-10 是 6 万张 32×32 彩色图像、10 类(飞机、猫、狗等)的经典图像分类数据集,2009 年发布,是 CNN 与 ViT 研究的标准小型基准。

MNIST 技术

MNIST 是 6 万张 28×28 手写数字(0-9)的经典数据集,1998 年发布,是深度学习的「Hello World」,用于教学与算法验证。

C4 技术

C4 是 Google 基于 Common Crawl 清洗的 750GB 英文语料(去重、语言/质量过滤),用于 T5 训练,是「清洗版 CC」的开源标杆。

WebText 技术

WebText 是 OpenAI 为 GPT-2 构建的高质量网页语料(4500 万外链网页,按 Reddit 3 赞以上过滤),以「质量过滤」开创 LLM 语料范式,其公共重构建为 OpenWebText。

The Pile 技术

The Pile 是 EleutherAI 2020 年发布的 800GB 多源英文语料(22 个子集:书籍、学术、代码、对话等),用于 GPT-NeoX 等开源大模型训练,是「语料即论文」的典范。

A

B

C

D

E

F

G

H

I

J

K

L

M

N

O

P

Q

R

S

T

U

V

W

X

Y

Z

#

0.1234s