跳转至

第二章 Agent 范式与架构

本章概览

本章回答"智能体 (Agent) 是什么、与 LLM 聊天有何区别、如何思考与行动"。从定义与发展史出发, 拆解 ReAct/Plan-and-Solve/Reflection 等经典范式, 介绍工具调用与多智能体协作, 最后辨析 AI Native Agent 与流程驱动 Agent 的本质差异。

小节目录


2.1 智能体定义

定义

Agent 是以 LLM 为大脑、能感知环境、自主规划、调用工具、维护记忆、执行行动以完成目标的系统。可公式化表述为 Agent = Perception + Planning + Action + Memory, 即感知、规划、行动、记忆四要素的有机组合。这一定义将 Agent 从单纯的"对话生成器"提升为"目标驱动的自主系统"。

原理

Chatbot 是单轮或多轮对话系统, 输入文本输出文本, 无目标导向与状态维护能力。Agent 与之本质区别在于: Agent 有明确目标, 能将目标拆解为可执行子任务, 能调用工具影响外部环境, 并根据反馈调整下一步动作。在 Agent 体系中, LLM 不再扮演"文本生成器", 而是充当"推理引擎 (reasoning engine)", 负责决策何时思考、何时行动、何时终止。

关键点

四要素中, 感知负责接收环境信号, 规划负责拆解任务, 行动负责调用工具或产出结果, 记忆负责跨步维持上下文。自主性 (autonomy) 是 Agent 与 Workflow 的核心分水岭 — Workflow 流程固定, Agent 流程动态。反馈闭环 (feedback loop) 让 Agent 能基于工具返回结果纠错, 这是 Agent 区别于一次性生成的关键。

应用·对比

Chatbot 与 Agent 在目标导向、工具使用、状态维护、反馈闭环上差异显著, 详见下表。

维度 Chatbot Agent
目标导向 无明确目标, 完成对话即结束 有明确目标, 达成才终止
工具使用 不调用外部工具 主动调用函数/API/检索器
状态维护 仅上下文窗口内对话历史 跨步维护任务状态与记忆
反馈闭环 无, 输出即终态 有, 根据观察修正下一步
LLM 角色 文本生成器 推理引擎

2.2 智能体发展史

定义

智能体概念可追溯至符号主义 AI (Symbolicism), 经历三大阶段演进至 LLM 驱动的现代 Agent。每个阶段对应不同的环境假设、奖励信号与开发范式, 共同塑造了今日 Agent 的形态。

原理

第一阶段为符号主义 (GOFAI, Good Old-Fashioned AI), 以规则系统为代表, 如 SHRDLU 在积木世界中通过符号推理完成任务, 依赖人工编码的世界模型。第二阶段为强化学习 (Reinforcement Learning), 代表如 AlphaGo、Atari Agent, 通过与环境交互、最大化奖励信号学习策略, 在封闭环境中表现卓越。第三阶段为 LLM 驱动, 以 AutoGPT、BabyAGI、ReAct 为代表, 以自然语言作为推理与行动的统一接口。关键里程碑包括 2022 年 ReAct 论文、2023 年 AutoGPT 爆火、LangChain 兴起、以及多智能体框架涌现。

关键点

LLM 让 Agent 从"封闭环境"走向"开放世界" — 不再依赖预定义的状态空间与动作集。语言接口降低了 Agent 开发门槛, 任何能用语言描述的任务都可尝试 Agent 化。但可靠性 (reliability) 仍是核心挑战, LLM 的幻觉与不可预测性直接传导到 Agent 行为。

应用·对比

三阶段 Agent 在环境、奖励信号、泛化能力、开发方式上差异显著, 详见下表。

维度 符号主义 强化学习 LLM 驱动
环境 封闭、人工定义 封闭、仿真器 开放、真实世界
奖励信号 无, 靠规则匹配 环境奖励, 需手工设计 工具观察 + LLM 自评
泛化能力 弱, 仅限预设领域 弱, 迁移困难 强, 语言泛化
开发方式 人工编码规则 训练策略网络 Prompt + 工具描述

2.3 智能体分类

定义

智能体可按两个正交维度分类。按数量分为单智能体 (Single-Agent) 与多智能体 (Multi-Agent), 按架构分为反应型 (Reactive)、慎思型 (Deliberative) 与混合型 (Hybrid)。两个维度交叉可描述几乎所有 Agent 形态。

原理

反应型 Agent 直接刺激-反应, 无内部世界模型, 代表为 Brooks 的子sumption 架构, 强调快速响应。慎思型 Agent 内部建模环境并显式规划, 代表为 BDI (Belief-Desire-Intention) 架构, 强调理性决策但响应慢。混合型 Agent 采用分层架构, 反应层处理紧急情况, 规划层处理长程任务。LLM Agent 多为混合型 — LLM 提供慎思能力 (推理与规划), 工具调用提供反应能力 (即时行动)。

关键点

单智能体与多智能体的权衡在于简单性与鲁棒性: 单体简单但能力上限受限于单 LLM 上下文, 多体可分工但通信成本高。混合型是 LLM Agent 主流选择, 兼顾灵活性与可靠性。多智能体协作的具体模式详见 2.6 节。

应用·对比

三类架构在响应速度、规划能力、适用场景上差异显著, 详见下表。

维度 反应型 慎思型 混合型
响应速度 中等, 可分层
规划能力 强 (规划层)
内部模型 显式建模 部分建模
适用场景 实时控制 复杂决策 LLM Agent 主流

2.4 经典范式

定义

经典范式是 Agent 思考与行动的固定模式, 决定 LLM 如何拆解任务、调用工具、迭代修正。不同范式对应不同任务类型与成本结构, 选对范式是 Agent 设计的关键。

原理

ReAct (Reasoning + Acting) 是基础范式, 采用 Thought → Action → Observation 交替循环, 边推理边行动, 每步根据观察决定下一步。Plan-and-Solve 先整体规划 (Plan) 再逐步执行 (Solve), 适合复杂长程任务, 解决 ReAct 短视问题。Reflection 在执行后自我反思 (Reflect) 修正错误, 提升鲁棒性, 代表工作 Reflexion。Tree of Thoughts (ToT) 以树状结构探索多条推理路径, 支持回溯, 适合搜索类任务。Graph of Thoughts (GoT) 在 ToT 基础上扩展为图状结构, 允许路径合并与复用, 适合需要组合优化的任务。

关键点

ReAct 是基础范式, 多数 Agent 框架默认采用。Plan-and-Solve 解决 ReAct 短视问题, 适合需要全局视角的任务。Reflection 提升自纠能力, 是提升 Agent 鲁棒性的通用手段。ToT 与 GoT 成本高 (需多次 LLM 调用与路径评估), 但在搜索类任务上效果显著, 应按需选用。

应用·对比

五种范式在任务类型、token 成本、可回溯性、实现复杂度上差异显著, 详见下表。

范式 任务类型 token 成本 可回溯性 实现复杂度
ReAct 通用、短程
Plan-and-Solve 复杂长程
Reflection 需自纠的任务 中高 部分 (可重试)
Tree of Thoughts 搜索类、需回溯 强 (树搜索)
Graph of Thoughts 组合优化类 很高 强 (图搜索+合并) 很高

2.5 工具调用

定义

工具调用 (Tool Use / Function Calling) 让 Agent 能调用外部函数、API、检索器, 突破 LLM 静态知识与无法直接操作环境的限制。这是 Agent 从"会说"走向"会做"的关键能力。

原理

模型原生 Function Calling 是 OpenAI、Anthropic、Qwen 等厂商在模型训练阶段注入的能力, 模型直接输出结构化函数调用 JSON, 框架解析后执行。框架封装方式 (如 LangChain Tool / ReAct prompt) 通过 prompt 引导模型输出工具调用文本, 再用正则或解析器提取, 无需模型原生支持。两种方式都依赖工具描述 (tool description) 注入 prompt, 告知模型有哪些工具可用、参数格式如何。执行结果 (observation) 回填上下文, 供 LLM 决定下一步。

关键点

原生 Function Calling 比纯 prompt 引导更稳定, 因模型针对工具调用做过对齐训练, 输出格式可靠。工具描述质量直接影响调用准确率 — 描述模糊或冗余都会导致误调。工具数量过多时需引入检索机制 (见 Agent Skills), 避免 prompt 膨胀导致模型困惑。

应用·对比

原生 Function Calling 与框架封装 ReAct 在稳定性、token 成本、模型依赖上差异显著, 详见下表。

维度 原生 Function Calling 框架封装 ReAct
稳定性 高, 模型对齐过 中, 依赖 prompt
token 成本 低, 结构化输出 高, 需解释推理过程
模型依赖 需支持 FC 的模型 任意 LLM
可控性 厂商约定 完全自定义

2.6 多智能体协作

定义

多智能体协作 (Multi-Agent Collaboration) 指多个 Agent 角色分工、通信、协同完成复杂任务。通过分解责任与引入多元视角, 多智能体可处理单 Agent 难以胜任的复杂场景。

原理

Manager-Worker 模式中, 一个 Manager Agent 拆解任务并分发给多个 Worker Agent, Manager 汇总结果, 适合任务可分解的层级场景。Debate 模式中, 多个 Agent 观点对立辩论, 通过多轮交锋收敛到更优答案, 适合需要多角度验证的判断任务。Society of Mind 模式中, 多 Agent 自由交互涌现群体智能, 代表为 Stanford 小镇 (Generative Agents), 适合模拟与开放式探索。三种模式各有适用场景, 也可混合使用。

关键点

角色分工降低单 Agent 上下文压力, 每个 Agent 只需关注子任务。通信成本与一致性是多智能体的核心挑战 — 通信过多浪费 token, 过少导致信息割裂。Debate 适合需多角度验证的任务, 但成本随轮次线性增长。

应用·对比

三种协作模式在结构、通信开销、适用场景上差异显著, 详见下表。

维度 Manager-Worker Debate Society of Mind
结构 层级化 对等辩论 自由交互
通信开销 中, Manager 调度 高, 多轮辩论 高, 涌现性
一致性 强, Manager 统筹 中, 收敛过程 弱, 涌现结果
适用场景 可分解的复杂任务 需多角度验证 模拟与开放式探索

2.7 Agent vs Workflow

定义

AI Native Agent 与流程驱动 Agent 是两条不同路线。前者以 LLM 驱动决策, 流程动态生成; 后者以 Dify、Coze、n8n 为代表, 预定义流程, LLM 仅作为数据处理节点。

原理

AI Native Agent 的核心是 LLM 自主决策下一步动作, 流程非预定义, 由 LLM 根据上下文与工具观察动态决定。Workflow (Dify/Coze/n8n) 本质是流程驱动软件开发, 流程由人预定义, LLM 作为流程中的数据处理节点 (如文本分类、摘要生成), 不参与流程决策。Hello-Agents 教程强调前者, 即培养 LLM 自主决策能力的 Agent 范式。两者并非互斥, 实际产品常混合使用 — 关键路径用 Workflow 保证可控, 探索环节用 Agent 保证灵活。

关键点

AI Native 灵活但可控性弱, 行为不可完全预测, 调试困难。Workflow 可控但灵活性低, 流程变更需重新编排。实际产品常混合 — 关键路径用 Workflow 保障稳定性, 探索环节用 Agent 应对开放性问题。理解两者本质差异有助于选型与架构设计。

应用·对比

AI Native Agent 与 Workflow 在决策主体、灵活性、可控性、调试难度、适用场景上差异显著, 详见下表。

维度 AI Native Agent Workflow (Dify/Coze/n8n)
决策主体 LLM 自主决策 人预定义流程
灵活性 高, 动态适应 低, 流程固定
可控性 弱, 行为不可完全预测 强, 流程透明
调试难度 高, 需轨迹分析 低, 流程可视化
适用场景 开放性、探索性任务 标准化、可重复任务

延伸阅读