RAG框架 技术
RAG 框架提供检索增强生成的工程化能力:文档加载、切分、向量化、检索、重排与引用输出,LlamaIndex、LangChain 检索器、Haystack 等为代表,是企业知识问答的公共底座。
大模型 · 万物互联 · 人工智能的结构化知识库。人人可阅读、可贡献、可追溯。
RAG 框架提供检索增强生成的工程化能力:文档加载、切分、向量化、检索、重排与引用输出,LlamaIndex、LangChain 检索器、Haystack 等为代表,是企业知识问答的公共底座。
LLM-as-a-Judge 用大模型给模型输出评分/对比(1-5 分或 A/B 胜者),与人类评分高度相关(约 80%+),成为大模型评估的廉价规模化方案,但存在偏好与偏差风险。
AutoGen 是微软开源的 Agent 框架:通过多智能体对话(对话模式)构建复杂应用,支持群聊、工具、人机混合与代码执行,是 2023 多智能体热潮的代表框架。
Open WebUI 是开源的 LLM 聊天界面(前身 Ollama WebUI):多用户、知识库(RAG)、工具/Agent、模型管理与权限,是本地部署大模型的标准前端。
vLLM 是加州伯克利开源的 LLM 推理服务引擎:PagedAttention 显存管理与连续批处理实现高吞吐,是开源 LLM 服务的事实标准(2023)。
MLflow 是 Databricks 开源的 MLOps 平台:实验追踪、模型注册、项目打包与模型服务(Serving),提供「训练到部署」的标准化流程。
Weights & Biases(W&B)是 AI 实验追踪平台:指标曲线、超参对比、模型产物管理与团队协作,Sweeps 自动调参,是大模型与深度研究最常用的实验管理工具。
模型微调框架封装高效微调流程:Hugging Face PEFT(LoRA 族)、Axolotl、LLaMA-Factory、Unsloth 等,提供数据集、训练脚本与量化支持,是开源微调的公共工具层。
LoRA 冻结预训练权重、只训练低秩增量矩阵(ΔW=BA),把可训练参数降至约 0.1%-1%,显著降低微调显存与成本,是大模型微调的事实标准方法。
ONNX Runtime 是微软开源的跨平台推理引擎:模型转 ONNX 后可在 CPU/GPU/端侧统一运行,提供图优化与量化,是模型互操作与部署的事实中间格式。
LLM 应用框架提供构建大模型应用(RAG、Agent、工作流)的组件化能力:LangChain、LlamaIndex、Dify、Coze 与各大 SDK,2023 起成为 AI 应用开发的公共底座。
Ollama 是「一键本地跑开源模型」的工具(基于 llama.cpp):命令行+API+模型库管理,支持 Llama/Qwen/DeepSeek 等,成为开发者本地实验大模型的最常用入口。
llama.cpp 是 2023 年开源的高效 LLM 推理项目:C/C++ 实现、GGUF 量化格式与纯 CPU/Apple Silicon 运行,让 7B-70B 模型可在消费级设备本地运行,是端侧大模型的基石。
TensorRT 是 NVIDIA 的推理优化引擎:图层融合、精度校准(INT8/FP8)与内核自动调优,把模型编译为高度优化引擎,是大模型与 CV 推理吞吐提升的关键工具。
推理引擎优化模型执行:TensorRT(NVIDIA)、ONNX Runtime、vLLM(LLM 高吞吐)、llama.cpp(端侧)等,提供图优化、量化与算子融合,是模型服务性能的关键。