Common Crawl 技术
Common Crawl 是每月更新的开源网页爬取存档(数百 TB),是大模型预训练语料的主要来源,经清洗(C4、FineWeb)后用于 GPT、LLaMA 等模型训练。
大模型 · 万物互联 · 人工智能的结构化知识库。人人可阅读、可贡献、可追溯。
Common Crawl 是每月更新的开源网页爬取存档(数百 TB),是大模型预训练语料的主要来源,经清洗(C4、FineWeb)后用于 GPT、LLaMA 等模型训练。
偏好数据是「同一提示下多个输出的人为排序/比较」集合,用于训练奖励模型与 DPO,是 RLHF 的核心原料,采集成本高、标注主观性强。
指令数据集是「指令-回答」样本集合,用于指令微调(SFT)与对齐:人工撰写(InstructGPT)、模型生成(Alpaca 自举)与混合增强,其质量决定对话模型基础能力。
基准测试(Benchmark)是固定任务与数据上的标准化评测,用于横向比较模型:ImageNet、GLUE、MMLU、HumanEval 等,是 AI 研究迭代与排行榜竞争的核心工具。
GSM8K 是 2021 年发布的 8500 道小学数学应用题基准(含逐步解答),是评测大模型数学推理的行业标准,思维链(CoT)在此显著提升准确率。
数据清洗去除重复、噪声、错误与有害内容(去重、去毒、过滤、格式规范化),大模型时代「数据工程」对模型质量影响关键,如 RedPajama、FineWeb 等清洗管线。
数据标注为原始数据添加标签(分类、框选、分割、文本标注),是监督学习的必要环节,有人工、半自动与 AI 辅助标注(大模型),标注质量直接决定模型上限。
LAION-5B 是 2022 年发布的 58.5 亿图文对数据集(网页爬取+CLIP 过滤),是 Stable Diffusion 等文生图模型的训练基础,也因版权争议成为 AI 版权诉讼焦点。
HumanEval 是 OpenAI 2021 年发布的代码生成基准:164 道手写编程题(函数签名+docstring),以 pass@k 评测,是 Codex 与代码大模型的标配评测。
SQuAD 是斯坦福发布的抽取式问答数据集:10 万+ 问题基于维基百科段落,SQuAD 1.1(2016)与 2.0(不可回答,2018)是阅读理解基准,BERT 曾在此首超人类。
MMLU 是 2020 年发布的通用知识多项选择基准:57 个学科、1.4 万道题,覆盖人文、社科、理工与专业领域,是大模型「通识能力」的行业标准评测。
GLUE 是 2019 年发布的多任务 NLP 理解基准(9 个任务:情感、蕴含、NLI、相似度等),与 SuperGLUE 一起成为 BERT 时代语言模型的标尺。
COCO 是 2014 年发布的视觉识别数据集:33 万张图像、80 类物体,标注实例分割、关键点与图像描述,是目标检测与分割的事实标准基准。
ImageNet 是 1400 万张、2.2 万类图像的经典视觉数据集,其 ILSVRC 挑战赛(2010-2017)见证了 AlexNet 引爆深度学习,至今仍是图像分类基准。
数据集是 AI 训练与评估的基础资产,按用途分训练/验证/测试集,类型覆盖文本、图像、语音、多模态与结构化数据,其规模与质量决定模型能力上限。