第二章 Agent 范式与架构¶
本章概览¶
本章回答"智能体 (Agent) 是什么、与 LLM 聊天有何区别、如何思考与行动"。从定义与发展史出发, 拆解 ReAct/Plan-and-Solve/Reflection 等经典范式, 介绍工具调用与多智能体协作, 最后辨析 AI Native Agent 与流程驱动 Agent 的本质差异。
小节目录¶
2.1 智能体定义¶
定义¶
Agent 是以 LLM 为大脑、能感知环境、自主规划、调用工具、维护记忆、执行行动以完成目标的系统。可公式化表述为 Agent = Perception + Planning + Action + Memory, 即感知、规划、行动、记忆四要素的有机组合。这一定义将 Agent 从单纯的"对话生成器"提升为"目标驱动的自主系统"。
原理¶
Chatbot 是单轮或多轮对话系统, 输入文本输出文本, 无目标导向与状态维护能力。Agent 与之本质区别在于: Agent 有明确目标, 能将目标拆解为可执行子任务, 能调用工具影响外部环境, 并根据反馈调整下一步动作。在 Agent 体系中, LLM 不再扮演"文本生成器", 而是充当"推理引擎 (reasoning engine)", 负责决策何时思考、何时行动、何时终止。
关键点¶
四要素中, 感知负责接收环境信号, 规划负责拆解任务, 行动负责调用工具或产出结果, 记忆负责跨步维持上下文。自主性 (autonomy) 是 Agent 与 Workflow 的核心分水岭 — Workflow 流程固定, Agent 流程动态。反馈闭环 (feedback loop) 让 Agent 能基于工具返回结果纠错, 这是 Agent 区别于一次性生成的关键。
应用·对比¶
Chatbot 与 Agent 在目标导向、工具使用、状态维护、反馈闭环上差异显著, 详见下表。
| 维度 | Chatbot | Agent |
|---|---|---|
| 目标导向 | 无明确目标, 完成对话即结束 | 有明确目标, 达成才终止 |
| 工具使用 | 不调用外部工具 | 主动调用函数/API/检索器 |
| 状态维护 | 仅上下文窗口内对话历史 | 跨步维护任务状态与记忆 |
| 反馈闭环 | 无, 输出即终态 | 有, 根据观察修正下一步 |
| LLM 角色 | 文本生成器 | 推理引擎 |
2.2 智能体发展史¶
定义¶
智能体概念可追溯至符号主义 AI (Symbolicism), 经历三大阶段演进至 LLM 驱动的现代 Agent。每个阶段对应不同的环境假设、奖励信号与开发范式, 共同塑造了今日 Agent 的形态。
原理¶
第一阶段为符号主义 (GOFAI, Good Old-Fashioned AI), 以规则系统为代表, 如 SHRDLU 在积木世界中通过符号推理完成任务, 依赖人工编码的世界模型。第二阶段为强化学习 (Reinforcement Learning), 代表如 AlphaGo、Atari Agent, 通过与环境交互、最大化奖励信号学习策略, 在封闭环境中表现卓越。第三阶段为 LLM 驱动, 以 AutoGPT、BabyAGI、ReAct 为代表, 以自然语言作为推理与行动的统一接口。关键里程碑包括 2022 年 ReAct 论文、2023 年 AutoGPT 爆火、LangChain 兴起、以及多智能体框架涌现。
关键点¶
LLM 让 Agent 从"封闭环境"走向"开放世界" — 不再依赖预定义的状态空间与动作集。语言接口降低了 Agent 开发门槛, 任何能用语言描述的任务都可尝试 Agent 化。但可靠性 (reliability) 仍是核心挑战, LLM 的幻觉与不可预测性直接传导到 Agent 行为。
应用·对比¶
三阶段 Agent 在环境、奖励信号、泛化能力、开发方式上差异显著, 详见下表。
| 维度 | 符号主义 | 强化学习 | LLM 驱动 |
|---|---|---|---|
| 环境 | 封闭、人工定义 | 封闭、仿真器 | 开放、真实世界 |
| 奖励信号 | 无, 靠规则匹配 | 环境奖励, 需手工设计 | 工具观察 + LLM 自评 |
| 泛化能力 | 弱, 仅限预设领域 | 弱, 迁移困难 | 强, 语言泛化 |
| 开发方式 | 人工编码规则 | 训练策略网络 | Prompt + 工具描述 |
2.3 智能体分类¶
定义¶
智能体可按两个正交维度分类。按数量分为单智能体 (Single-Agent) 与多智能体 (Multi-Agent), 按架构分为反应型 (Reactive)、慎思型 (Deliberative) 与混合型 (Hybrid)。两个维度交叉可描述几乎所有 Agent 形态。
原理¶
反应型 Agent 直接刺激-反应, 无内部世界模型, 代表为 Brooks 的子sumption 架构, 强调快速响应。慎思型 Agent 内部建模环境并显式规划, 代表为 BDI (Belief-Desire-Intention) 架构, 强调理性决策但响应慢。混合型 Agent 采用分层架构, 反应层处理紧急情况, 规划层处理长程任务。LLM Agent 多为混合型 — LLM 提供慎思能力 (推理与规划), 工具调用提供反应能力 (即时行动)。
关键点¶
单智能体与多智能体的权衡在于简单性与鲁棒性: 单体简单但能力上限受限于单 LLM 上下文, 多体可分工但通信成本高。混合型是 LLM Agent 主流选择, 兼顾灵活性与可靠性。多智能体协作的具体模式详见 2.6 节。
应用·对比¶
三类架构在响应速度、规划能力、适用场景上差异显著, 详见下表。
| 维度 | 反应型 | 慎思型 | 混合型 |
|---|---|---|---|
| 响应速度 | 快 | 慢 | 中等, 可分层 |
| 规划能力 | 无 | 强 | 强 (规划层) |
| 内部模型 | 无 | 显式建模 | 部分建模 |
| 适用场景 | 实时控制 | 复杂决策 | LLM Agent 主流 |
2.4 经典范式¶
定义¶
经典范式是 Agent 思考与行动的固定模式, 决定 LLM 如何拆解任务、调用工具、迭代修正。不同范式对应不同任务类型与成本结构, 选对范式是 Agent 设计的关键。
原理¶
ReAct (Reasoning + Acting) 是基础范式, 采用 Thought → Action → Observation 交替循环, 边推理边行动, 每步根据观察决定下一步。Plan-and-Solve 先整体规划 (Plan) 再逐步执行 (Solve), 适合复杂长程任务, 解决 ReAct 短视问题。Reflection 在执行后自我反思 (Reflect) 修正错误, 提升鲁棒性, 代表工作 Reflexion。Tree of Thoughts (ToT) 以树状结构探索多条推理路径, 支持回溯, 适合搜索类任务。Graph of Thoughts (GoT) 在 ToT 基础上扩展为图状结构, 允许路径合并与复用, 适合需要组合优化的任务。
关键点¶
ReAct 是基础范式, 多数 Agent 框架默认采用。Plan-and-Solve 解决 ReAct 短视问题, 适合需要全局视角的任务。Reflection 提升自纠能力, 是提升 Agent 鲁棒性的通用手段。ToT 与 GoT 成本高 (需多次 LLM 调用与路径评估), 但在搜索类任务上效果显著, 应按需选用。
应用·对比¶
五种范式在任务类型、token 成本、可回溯性、实现复杂度上差异显著, 详见下表。
| 范式 | 任务类型 | token 成本 | 可回溯性 | 实现复杂度 |
|---|---|---|---|---|
| ReAct | 通用、短程 | 低 | 无 | 低 |
| Plan-and-Solve | 复杂长程 | 中 | 无 | 中 |
| Reflection | 需自纠的任务 | 中高 | 部分 (可重试) | 中 |
| Tree of Thoughts | 搜索类、需回溯 | 高 | 强 (树搜索) | 高 |
| Graph of Thoughts | 组合优化类 | 很高 | 强 (图搜索+合并) | 很高 |
2.5 工具调用¶
定义¶
工具调用 (Tool Use / Function Calling) 让 Agent 能调用外部函数、API、检索器, 突破 LLM 静态知识与无法直接操作环境的限制。这是 Agent 从"会说"走向"会做"的关键能力。
原理¶
模型原生 Function Calling 是 OpenAI、Anthropic、Qwen 等厂商在模型训练阶段注入的能力, 模型直接输出结构化函数调用 JSON, 框架解析后执行。框架封装方式 (如 LangChain Tool / ReAct prompt) 通过 prompt 引导模型输出工具调用文本, 再用正则或解析器提取, 无需模型原生支持。两种方式都依赖工具描述 (tool description) 注入 prompt, 告知模型有哪些工具可用、参数格式如何。执行结果 (observation) 回填上下文, 供 LLM 决定下一步。
关键点¶
原生 Function Calling 比纯 prompt 引导更稳定, 因模型针对工具调用做过对齐训练, 输出格式可靠。工具描述质量直接影响调用准确率 — 描述模糊或冗余都会导致误调。工具数量过多时需引入检索机制 (见 Agent Skills), 避免 prompt 膨胀导致模型困惑。
应用·对比¶
原生 Function Calling 与框架封装 ReAct 在稳定性、token 成本、模型依赖上差异显著, 详见下表。
| 维度 | 原生 Function Calling | 框架封装 ReAct |
|---|---|---|
| 稳定性 | 高, 模型对齐过 | 中, 依赖 prompt |
| token 成本 | 低, 结构化输出 | 高, 需解释推理过程 |
| 模型依赖 | 需支持 FC 的模型 | 任意 LLM |
| 可控性 | 厂商约定 | 完全自定义 |
2.6 多智能体协作¶
定义¶
多智能体协作 (Multi-Agent Collaboration) 指多个 Agent 角色分工、通信、协同完成复杂任务。通过分解责任与引入多元视角, 多智能体可处理单 Agent 难以胜任的复杂场景。
原理¶
Manager-Worker 模式中, 一个 Manager Agent 拆解任务并分发给多个 Worker Agent, Manager 汇总结果, 适合任务可分解的层级场景。Debate 模式中, 多个 Agent 观点对立辩论, 通过多轮交锋收敛到更优答案, 适合需要多角度验证的判断任务。Society of Mind 模式中, 多 Agent 自由交互涌现群体智能, 代表为 Stanford 小镇 (Generative Agents), 适合模拟与开放式探索。三种模式各有适用场景, 也可混合使用。
关键点¶
角色分工降低单 Agent 上下文压力, 每个 Agent 只需关注子任务。通信成本与一致性是多智能体的核心挑战 — 通信过多浪费 token, 过少导致信息割裂。Debate 适合需多角度验证的任务, 但成本随轮次线性增长。
应用·对比¶
三种协作模式在结构、通信开销、适用场景上差异显著, 详见下表。
| 维度 | Manager-Worker | Debate | Society of Mind |
|---|---|---|---|
| 结构 | 层级化 | 对等辩论 | 自由交互 |
| 通信开销 | 中, Manager 调度 | 高, 多轮辩论 | 高, 涌现性 |
| 一致性 | 强, Manager 统筹 | 中, 收敛过程 | 弱, 涌现结果 |
| 适用场景 | 可分解的复杂任务 | 需多角度验证 | 模拟与开放式探索 |
2.7 Agent vs Workflow¶
定义¶
AI Native Agent 与流程驱动 Agent 是两条不同路线。前者以 LLM 驱动决策, 流程动态生成; 后者以 Dify、Coze、n8n 为代表, 预定义流程, LLM 仅作为数据处理节点。
原理¶
AI Native Agent 的核心是 LLM 自主决策下一步动作, 流程非预定义, 由 LLM 根据上下文与工具观察动态决定。Workflow (Dify/Coze/n8n) 本质是流程驱动软件开发, 流程由人预定义, LLM 作为流程中的数据处理节点 (如文本分类、摘要生成), 不参与流程决策。Hello-Agents 教程强调前者, 即培养 LLM 自主决策能力的 Agent 范式。两者并非互斥, 实际产品常混合使用 — 关键路径用 Workflow 保证可控, 探索环节用 Agent 保证灵活。
关键点¶
AI Native 灵活但可控性弱, 行为不可完全预测, 调试困难。Workflow 可控但灵活性低, 流程变更需重新编排。实际产品常混合 — 关键路径用 Workflow 保障稳定性, 探索环节用 Agent 应对开放性问题。理解两者本质差异有助于选型与架构设计。
应用·对比¶
AI Native Agent 与 Workflow 在决策主体、灵活性、可控性、调试难度、适用场景上差异显著, 详见下表。
| 维度 | AI Native Agent | Workflow (Dify/Coze/n8n) |
|---|---|---|
| 决策主体 | LLM 自主决策 | 人预定义流程 |
| 灵活性 | 高, 动态适应 | 低, 流程固定 |
| 可控性 | 弱, 行为不可完全预测 | 强, 流程透明 |
| 调试难度 | 高, 需轨迹分析 | 低, 流程可视化 |
| 适用场景 | 开放性、探索性任务 | 标准化、可重复任务 |
延伸阅读¶
- AI 知识库目录 - 系统教程与课程 - Hello-Agents 教程第一章初识智能体、第二章发展史、第四章经典范式
- AI 知识库目录 - 论文与文档 - ReAct / Reflexion / Tree of Thoughts 论文