工具调用 技术
工具调用(Tool/Function Calling)让 LLM 在生成中声明调用外部函数/API,由宿主执行并回传结果,是 Agent 连接现实世界的关键能力,OpenAI/Anthropic/Google 均提供原生支持。
大模型 · 万物互联 · 人工智能的结构化知识库。人人可阅读、可贡献、可追溯。
工具调用(Tool/Function Calling)让 LLM 在生成中声明调用外部函数/API,由宿主执行并回传结果,是 Agent 连接现实世界的关键能力,OpenAI/Anthropic/Google 均提供原生支持。
多智能体系统由多个协作或竞争的智能体组成,通过分工、协商与编排完成单智能体难胜任的复杂任务,大模型时代出现 AutoGen、MetaGPT、CrewAI 等编排框架。
生成式智能体是用大语言模型驱动的拟人化模拟体:具备记忆、反思与规划,能模拟可信的人类行为,斯坦福「虚拟小镇」(2023)是开创性工作。
自主智能体指能独立设定/拆解目标、自主规划、调用工具执行并自我纠错的 AI 系统,无需逐步人工干预,AutoGPT、BabyAGI 为代表,是 AGI 路线的重要形态。
智能体(Agent)是能感知环境、自主规划决策并采取行动达成目标的 AI 系统,大模型时代演变为「LLM + 规划 + 工具调用 + 记忆」的自主体,AutoGPT、Manus 为代表。
在策略学习用「当前策略」本身产生的数据更新策略,实现简单、无分布偏移,SARSA、A2C、PPO 为代表,但样本浪费(旧数据不能复用)。
离策略学习用「行为策略」产生的数据优化「目标策略」,可复用历史/他人数据,Q-learning、DQN、SAC 均为离策略,需重要性采样或贝尔曼最优算子处理分布差异。
动作价值函数 Q^π(s,a) 表示在状态 s 采取动作 a 后按策略 π 的期望回报,Q-learning 与 DQN 直接学习 Q,通过 Q 取最大动作即可得策略。
状态价值函数 V^π(s) 表示从状态 s 出发按策略 π 行动的期望折扣回报,是策略评估的核心对象,与动作价值 Q 通过 V(s)=E_π[Q(s,a)] 关联。
重要性采样用「目标分布与采样分布的似然比」加权估计期望,使离策略(off-policy)数据可用于训练目标策略,是 PPO、离策略 RL 与 RLHF 重放的核心工具。
策略评估计算给定策略下的价值函数 V^π(期望回报),是策略迭代与强化学习的基础步骤,方法包括动态规划、蒙特卡洛、时序差分与神经网络逼近。
MuZero 是 DeepMind 2020 年提出的无模型规划算法:在不被告知环境规则的情况下,通过学习隐式环境模型(潜空间转移)结合 MCTS,在围棋、将棋、国际象棋与 Atari 上达到超人水平。
AlphaZero 是 DeepMind 2017 年推出的通用棋类 AI:不依赖人类棋谱,仅凭自对弈从零学习围棋、国际象棋与将棋,统一了 AlphaGo 的架构,证明「自我学习」的通用性。
AlphaGo 是 DeepMind 2016 年击败人类围棋冠军的 AI 系统,结合深度价值/策略网络与蒙特卡洛树搜索(MCTS),是深度强化学习的历史性里程碑。
多智能体强化学习(MARL)研究多个智能体同时学习与环境及其他智能体交互,涉及竞争/合作/混合博弈,代表作有 AlphaStar、OpenAI Five 与 MADDPG、MAPPO 等算法。