Agent(智能体)

一种让LLM自主决策和行动的架构模式,核心公式:Agent = LLM + 工具 + 记忆 + 规划。与Chatbot(一问一答)和Copilot(辅助人类)不同,Agent能自主分解任务、选择工具、执行并纠错。

Agent(智能体)

一句话理解

不是一个新模型,而是一种让 LLM 从"被动回答"变成"主动行动"的架构模式。

核心组成

Agent 的本质是将多个核心组件组装到一起:

  • LLM(大脑)— 负责推理和决策
  • 工具(手脚)— Function Calling / MCP 提供的外部能力
  • 记忆(知识)— RAG 提供的外部知识检索
  • 规划(调度)— 把复杂任务拆解为子任务,决定执行顺序

类比:LLM 是 CPU,工具是 I/O 设备,RAG 是硬盘,Agent 是操作系统——OS 的核心职责就是调度。

Agent vs Chatbot vs Copilot

ChatbotCopilotAgent
决策权建议,人决定自主决定
状态无状态会话内跨任务持久
工具使用辅助调用主动选择和调用
纠错提示人自主反思重试

当前绝大多数标榜"Agent"的产品本质还是 Copilot——人仍然在决策回路中。真正自主的 Agent 仍处于早期阶段。

核心机制:ReAct 循环

Agent 最常用的执行框架是 ReAct(Reasoning + Acting):

  1. Thought(推理)— 分析当前状态,决定下一步
  2. Action(行动)— 调用工具执行操作
  3. Observation(观察)— 获取执行结果
  4. 回到第 1 步,直到任务完成

这个循环本质是一个有限状态机:根据当前状态决定动作,执行后观察结果进入新状态,循环往复直到达成目标。

当前局限

  • 规划不稳定:复杂任务容易"跑偏"
  • 错误级联:一步错,后续全错
  • 安全边界:能操作工具意味着能造成真实后果

Agent 的现状是"有用但脆弱"——适合结构化、有明确边界的任务,不适合开放式、高风险的场景。

引用本术语的文章