百科

大模型 · 万物互联 · 人工智能的结构化知识库。人人可阅读、可贡献、可追溯。

学科分类

最新收录

RAG框架 技术

RAG 框架提供检索增强生成的工程化能力:文档加载、切分、向量化、检索、重排与引用输出,LlamaIndex、LangChain 检索器、Haystack 等为代表,是企业知识问答的公共底座。

LLM-as-a-Judge 技术

LLM-as-a-Judge 用大模型给模型输出评分/对比(1-5 分或 A/B 胜者),与人类评分高度相关(约 80%+),成为大模型评估的廉价规模化方案,但存在偏好与偏差风险。

AutoGen 产品

AutoGen 是微软开源的 Agent 框架:通过多智能体对话(对话模式)构建复杂应用,支持群聊、工具、人机混合与代码执行,是 2023 多智能体热潮的代表框架。

Open WebUI 产品

Open WebUI 是开源的 LLM 聊天界面(前身 Ollama WebUI):多用户、知识库(RAG)、工具/Agent、模型管理与权限,是本地部署大模型的标准前端。

vLLM 产品

vLLM 是加州伯克利开源的 LLM 推理服务引擎:PagedAttention 显存管理与连续批处理实现高吞吐,是开源 LLM 服务的事实标准(2023)。

MLflow 产品

MLflow 是 Databricks 开源的 MLOps 平台:实验追踪、模型注册、项目打包与模型服务(Serving),提供「训练到部署」的标准化流程。

Weights & Biases 产品

Weights & Biases(W&B)是 AI 实验追踪平台:指标曲线、超参对比、模型产物管理与团队协作,Sweeps 自动调参,是大模型与深度研究最常用的实验管理工具。

模型微调框架 产品

模型微调框架封装高效微调流程:Hugging Face PEFT(LoRA 族)、Axolotl、LLaMA-Factory、Unsloth 等,提供数据集、训练脚本与量化支持,是开源微调的公共工具层。

LoRA(低秩适配) 技术

LoRA 冻结预训练权重、只训练低秩增量矩阵(ΔW=BA),把可训练参数降至约 0.1%-1%,显著降低微调显存与成本,是大模型微调的事实标准方法。

ONNX Runtime 产品

ONNX Runtime 是微软开源的跨平台推理引擎:模型转 ONNX 后可在 CPU/GPU/端侧统一运行,提供图优化与量化,是模型互操作与部署的事实中间格式。

LLM应用框架 概念

LLM 应用框架提供构建大模型应用(RAG、Agent、工作流)的组件化能力:LangChain、LlamaIndex、Dify、Coze 与各大 SDK,2023 起成为 AI 应用开发的公共底座。

Ollama 产品

Ollama 是「一键本地跑开源模型」的工具(基于 llama.cpp):命令行+API+模型库管理,支持 Llama/Qwen/DeepSeek 等,成为开发者本地实验大模型的最常用入口。

llama.cpp 产品

llama.cpp 是 2023 年开源的高效 LLM 推理项目:C/C++ 实现、GGUF 量化格式与纯 CPU/Apple Silicon 运行,让 7B-70B 模型可在消费级设备本地运行,是端侧大模型的基石。

TensorRT 产品

TensorRT 是 NVIDIA 的推理优化引擎:图层融合、精度校准(INT8/FP8)与内核自动调优,把模型编译为高度优化引擎,是大模型与 CV 推理吞吐提升的关键工具。

推理引擎 产品

推理引擎优化模型执行:TensorRT(NVIDIA)、ONNX Runtime、vLLM(LLM 高吞吐)、llama.cpp(端侧)等,提供图优化、量化与算子融合,是模型服务性能的关键。

A

B

C

D

E

F

G

H

I

J

K

L

M

N

O

P

Q

R

S

T

U

V

W

X

Y

Z

#

0.0965s