AI Agent 名词全解:智能体、RAG、MCP、多智能体,一文全看懂

AI Agent 名词全解:智能体、RAG、MCP、多智能体,一文全看懂
最近两年,AI 圈最热的词大概就是 Agent(智能体)。它背后的名词更是一串接一串:LLM、Token、上下文窗口、Function Calling、RAG、知识库、向量数据库、Memory、ReAct、MCP、Multi-Agent、Orchestrator……很多人看文章像看天书。这篇文章把 Agent 生态里的高频名词按"三层结构"梳理一遍,每个词给你一句话定义 + 一个通俗类比,最后用几张图讲清楚它们到底是怎么配合工作的。建议收藏,边用边查。

01 先回答一个问题:到底什么是 AI Agent?

AI Agent(人工智能智能体)可以理解为:一个以"大语言模型"为大脑、能够自主完成任务的系统

它和普通聊天机器人最大的区别是:聊天机器人只负责"说",Agent 负责"做"。

比如你问聊天机器人"帮我订一张周五去上海的机票",它只能告诉你"你可以去某某 App 订";而一个 Agent 会自己去调用订票工具、查询航班、比价、下单,把一件完整的事办完。

用一句话概括 Agent 的公式,业界普遍认可的是:

Agent = LLM(大脑)+ Planning(规划)+ Memory(记忆)+ Tools(工具)

下面所有名词,都是在给这个公式的各个部分"添砖加瓦"。

02 先看全貌:Agent 名词全景图

AI Agent 名词全解:智能体、RAG、MCP、多智能体,一文全看懂

整个 Agent 生态可以分成三层:模型基础层(Agent 的"身体")、能力增强层(Agent 的"手脚和记忆")、工程协作层(让 Agent 真正跑起来的"系统")。

 

03 第一层:模型基础层——Agent 的"身体"

这一层的名词解决的是"模型本身是什么、怎么描述输入输出"的问题。

LLM(大语言模型) 全称 Large Language Model,基于 Transformer 架构、用海量文本训练出来的语言模型。它负责理解你的问题并生成回答,是 Agent 的"大脑"。我们常说的 GPT、Claude、豆包、DeepSeek,指的都是这类模型。

Token(词元) 模型处理文本的最小单位。英文一个单词常被切成 1~2 个 Token,中文一个字大约对应 1~2 个 Token。Token 既是模型计费的"字数单位",也是上下文窗口的"容量单位"。

上下文窗口(Context Window) 模型单次能"同时看到"的 Token 上限。窗口越大,能一次性塞进去的对话、文档就越多。现在的旗舰模型普遍支持 128K 甚至 1M Token 的上下文。

Prompt(提示词) 你发给模型的指令文本。写提示词有一定方法论,叫 Prompt Engineering(提示工程)——好的提示词能让模型表现提升一个档次。注意:提示词只是"输入",不会改变模型的权重。

Embedding(向量化/嵌入) 把一段文字(或图片、声音)映射成一串高维数字(向量),让"意思相近的内容"在向量空间里距离也近。它是后面 RAG、记忆、知识库的基础技术。

微调(Fine-tuning) 用特定领域的数据对模型继续训练,让它在某些任务上表现更好。和 RAG 不同,微调改变的是模型本身的"知识储备"。

04 第二层:能力增强层——Agent 的"手脚、眼睛和记忆"

只有大脑的 Agent 什么都做不了,这一层的名词让 Agent 真正"能干活"。

Function Calling(函数调用 / 工具调用) 让模型在回答过程中"调用外部程序"的机制:模型输出一段结构化指令(比如"调用搜索函数,关键词=XXX"),程序执行后把结果塞回给模型,模型再基于结果继续回答。这是 Agent 能"动手做事"的关键开关。

Tools(工具) Agent 可以调用的外部能力集合:搜索引擎、计算器、代码执行器、数据库、API 接口、甚至其他软件。工具是 Agent 的"手和脚"。

RAG(检索增强生成) 全称 Retrieval-Augmented Generation。核心思路:模型回答前,先从外部知识库"查资料",再把查到的资料连同问题一起交给模型生成回答。作用是引入最新/私有知识、显著减少幻觉(一本正经地胡说八道)

知识库(Knowledge Base) 存放外部资料的集合,比如公司文档、产品手册、论文。知识库里的文档通常会被切分成小块、向量化后存入向量数据库。

向量数据库(Vector Database) 专门存"向量"并支持快速相似检索的数据库,代表作有 FAISS、Milvus、Chroma、Pinecone。RAG 的"查资料"环节就是在这里完成的。

Memory(记忆) Agent 的记忆分两类:短期记忆(当前对话的上下文,存在上下文窗口里)和长期记忆(把重要信息写入数据库,下次会话还能想起)。记忆让 Agent 从"一问一答"进化为"越用越懂你"。

Planning(规划) 把一个大任务拆成多个小步骤并安排顺序的能力。常见方法包括:

  • CoT(思维链)
    :让模型一步一步推理,而不是直接给答案;
  • ReAct(推理+行动)
    :Thought(思考)→ Action(行动)→ Observation(观察结果),循环往复,是目前 Agent 最主流的工作范式;
  • Plan-and-Execute
    :先定完整计划,再按计划逐步执行。

05 第三层:工程协作层——让 Agent 真正跑起来

单个 Agent 能干活之后,接下来就是"怎么把它做成产品、怎么让多个 Agent 协作"。

Workflow(工作流) 提前把步骤写死的自动化流程:节点固定、顺序固定、每个节点做什么都是人预先设计好的。适合流程稳定的场景(如"每天 9 点抓取数据→生成日报→发送邮件")。

Agent Framework(智能体框架) 帮你开发 Agent 的工具集/平台,比如 LangChain、LlamaIndex、AutoGen、CrewAI,以及国内的可口可乐式的低代码平台 Coze(扣子)、百炼等。框架把"调模型、接工具、管记忆、跑循环"这些繁琐事封装好,让你专注业务逻辑。

MCP(模型上下文协议) 全称 Model Context Protocol,由 Anthropic 于 2024 年底开源。它定义了一套"模型如何统一地连接外部工具和数据"的标准协议,可以类比为 "AI 世界的 USB-C 接口":以前每个工具都要单独对接(协议各异),现在只要工具实现一个 MCP 接口,所有支持 MCP 的 Agent 都能即插即用。

Multi-Agent(多智能体系统) 让多个各司其职的 Agent 分工协作:一个负责拆任务,一个负责查资料,一个负责写初稿,一个负责审核……像一支小型团队。

Orchestrator(编排者/总控) 多智能体系统里的"项目经理":负责理解总目标、把任务拆解分配给各个子 Agent、汇总结果、把控质量。我们日常使用的一些产品背后,就是"总控 Agent + 多个子 Agent"的架构。

Sub-agent(子智能体) 被 Orchestrator 调度、负责执行具体子任务的 Agent。多个子 Agent 可以并行干活,显著提速。

A2A(Agent 到 Agent 协议) Google 于 2025 年发布的 Agent 间通信协议,解决"不同厂商的 Agent 之间怎么对话协作"的问题,与 MCP 互补:MCP 管"Agent 连工具",A2A 管"Agent 连 Agent"。

06 原理一:一个 Agent 是怎么工作的?

把上面名词串起来,一个典型 Agent 的工作循环是这样的:

AI Agent 名词全解:智能体、RAG、MCP、多智能体,一文全看懂

 

具体来说分四步:

  1. 感知
    :接收用户请求(问题、指令);
  1. 规划
    :LLM 基于提示词和记忆,把任务拆解成步骤(如用 ReAct 模式);
  1. 行动
    :需要外部信息时,通过 Function Calling 调用工具;需要私有知识时,走 RAG 从知识库检索;
  1. 观察与迭代
    :拿到工具/检索结果,LLM 继续推理,直到任务完成,最后把答案返回给用户。

整个过程是一个"思考→行动→观察→再思考"的循环,而不是一次问答就结束。

07 原理二:关键机制是怎么运作的?

RAG 的运作流程:

AI Agent 名词全解:智能体、RAG、MCP、多智能体,一文全看懂

 

一句话总结 RAG:先查资料、再写回答。它解决了 LLM"只懂训练时学过的知识、不知道最新消息和你的私有资料"的痛点。

Function Calling 的时序:

AI Agent 名词全解:智能体、RAG、MCP、多智能体,一文全看懂

 

MCP 的架构:

AI Agent 名词全解:智能体、RAG、MCP、多智能体,一文全看懂

 

在 MCP 架构里:Host(如你的 Agent 应用)通过 MCP Client 连接 MCP Server,每个 Server 背后挂一个或多个外部数据源/工具。换工具时只需换 Server,Agent 本体不用改。

多智能体协作:

AI Agent 名词全解:智能体、RAG、MCP、多智能体,一文全看懂

 

08 一张表看懂:LLM / Workflow / Agent / Multi-Agent 的区别

AI Agent 名词全解:智能体、RAG、MCP、多智能体,一文全看懂

 

用一句话记忆:

  • LLM
     是"大脑",只会想和说;
  • Workflow
     是"流水线",路径人定死了;
  • Agent
     是"员工",自己想办法完成任务;
  • Multi-Agent
     是"团队",多个人分工协作。

写在最后

Agent 的生态还在快速进化,今天的热词明天可能就被新协议、新框架取代。但底层的逻辑是稳定的:让模型更强(模型层)、让模型能干更多事(能力层)、让模型能规模化协作(协作层)

记住这个三层框架,以后再遇到任何新名词,你都能快速找到它在整个图景里的位置。

 


 

内容说明:本文为 AI 智能体技术科普,所涉术语与概念依据公开技术资料整理(包括 Anthropic MCP 官方文档、Google A2A 文档、LangChain 等框架公开资料);MCP 与 A2A 等协议细节可能随版本更新,请以官方文档为准。

 

分享到: 文章二维码
© 版权声明

暂无评论

您必须登录才能参与评论!
暂无评论...