不止一位客服负责人问过我们类似的问题:
“知识库已经建得很全了,为什么用户还是觉得不好用,动不动就要转人工?”
答案往往不在知识库,而在能力的边界:传统机器人只能“答”,不能“办”。而这两年真正的分水岭,不是模型参数多大,而是架构变了——从“检索问答”升级成了“自主决策 + 工具执行”。
这篇文章,我们就把这套现代客服 Agent 架构,从进化脉络一路讲到落地调优。有点长,但读完,你手里会多一副能拆解任何一款 AI 客服产品的“骨架图”。
客服行业正在发生的一次转变
从会答题的接待员,到能办事的客服
过去十年,客户联络行业把多渠道接入、工单系统、知识库、问答机器人这套基础设施打磨得相当成熟。但做过客服系统的人都清楚一个天花板——机器人只能“答”,不能“办”。
用户说“我要退货”,它会给你一段退货政策文案;可真要把这单退掉——查订单、核对政策、收集凭证、创建工单——它做不了,最后很有可能还是要转人工。它是一个“会背知识库的接待员”,而不是一个“能办事的客服”。
2024 到 2025 年,大模型的能力重心从“回答问题”明显转向了“完成任务”,行业里冒出一个新词:AI Agent(智能体)。
在我们服务客户联络场景的实践中,有个判断越来越清晰:真正的分水岭不是模型多大,而是那套支撑它的架构。要看懂这套架构,得先知道 AI 客服是怎么一步步走到今天的。
四步进化:为什么是“现在”
从匹配话术到多步办事的四级跳
AI 客服走到今天,大致经过了四步,每一步都在补上一步的死穴。
第一步,传统 NLP(向量相似度)。把知识库里的标准问都存好,用户来问,系统用向量余弦算“谁最相似”,超过阈值就把答案推出去。优点是:成本低、速度快。缺点是死板,用户换个说法大概率就匹配不到。
第二步,提示词工程(2023–2024)。大模型让机器人学会了“说人话”,靠一段好提示词就能自然作答,还能不断打补丁修正 bad case。但它有天花板——只能一问一答,办不了事。
第三步,工具调用(Function Call → MCP)。模型遇到自己不知道的事,会主动调一个工具去查真实数据,再组织成人话回复,从此从“闭卷考试”变成“开卷可查”。MCP(2024 年 12 月出现)可以理解为 Function Call 的规范化封装升级,解决的是“大模型如何统一接入外部系统”。
第四步,现代 Agent(2024–2025)。核心思想是松耦合:大模型只负责“想”,“干活”全交给外部程序和工具。它不再凭空猜数据,幻觉也就越来越少。
四步连起来,客服 AI 走的是这样一条路:
匹配固定话术 → 能听懂并讲清政策 → 能查你这笔订单再回答 → 直接帮你把事办完
之所以说“现在”是 Agent 时刻,是因为三件事同时成立了:模型会想、能调工具、能多步规划。缺任何一样,都办不成一件完整的事。而把这三样组织起来的,正是下面这张四层架构图。
四层架构:客服 Agent 的骨架
一条客服消息进来的完整旅程
现代 Agent 产品,几乎都逃不出这样一张四层架构图。我们用一句客服消息——“我想退耳机”走一遍,看它一路经过哪四层。

1接入层:把不同渠道的话变成统一格式
这句“我想退耳机”,可能来自微信、WhatsApp、官网、IM 或 App,格式各不相同。接入层先把多渠道消息归一成一种标准格式,后面各层才好统一处理。这是客户联络系统的老本行,也是整个 Agent 的入口。
2调度层:决定这句话交给谁
“想退耳机”该走退货流程,还是当普通问答?调度层负责判断意图,把消息路由到最合适的处理方式。这一层怎么做,我们放在本节后半段单独讲——因为它直接关系到高并发下的成本。
3处理层:真正干活的地方
这是系统真正“办事”的一层,通常有四种方式:RAG(查知识库)、Workflow(走固定流程)、ReAct(自主决策)、转人工。大模型主要就待在这里,充当“大脑”。这四种能力在下一节将展开。
4资源层:干活要用的弹药库
处理层动手时,手上得有“弹药”。资源层提供四类关键资源:
· 知识库:退货政策、产品说明这类可检索的内容;
· 工具(Tool):查订单、建工单这类能调用的接口;
· 记忆(Memory):这个用户是不是 VIP、之前聊过什么;
· Skill 与变量:可复用的技能包与流程参数。
四层各司其职,缺一层,Agent 就跑不完一件事。
回到那句“想退耳机”。判断意图最省事的做法是直接问大模型,但那样又慢又贵;而客服是高并发场景,每条消息都动用大模型,成本会失控。成熟做法是搭一个三层级联分类器,从最便宜的方式开始试,层层递进——任何一层拿到确定结果,就立刻路由走,不再往下:
· 先用关键词匹配试一遍,命中就直接分流;
· 没命中,降级到向量相似度再试;
· 还不确定,才动用最贵的大模型来兜底。
不要小看第一层的关键词匹配——它速度最快、成本几乎为零,而客服场景里有相当大比例的问题,靠它就能直接分流掉。“能用便宜方式解决就不动用贵的”,正是高并发客服控成本的关键。
四大能力:走近处理层
RAG、Workflow、ReAct、转人工
处理层看似复杂,其实只有四种能力。客服里几乎所有工作,都由它们组合完成。
1RAG:基于知识准确回答
用户问“这款耳机续航多少小时”,系统去产品说明书里检索最相关的切片,召回后组织成答案。它解决的是“基于既有知识准确回答”,是客服知识库的现代形态。
2Workflow:把流程卡死
有些业务企业是卡死的,必须一步步走。比如退款:第一步弹表单让用户填订单号,第二步系统拿订单号发起查询,第三步核对政策……顺序固定,不容自由发挥。大模型在 Workflow 里只在个别节点充当能力增强,比如做一次图片质检、判断走哪个分支。
3ReAct:只给目标,边想边干
只给目标和可用工具,让 Agent 自己规划怎么达成。你现在用的 AI 编程工具,本质都是 ReAct——目标是把程序写出来,能调用的工具是跑命令、读写文件、搜索,怎么组合由它自己决定。
ReAct 的内核朴素得惊人——就是一个循环。任何编程语言都有循环:不停执行同一段逻辑,直到满足条件才跳出。ReAct 就是这样一个循环,每一轮做四件事:
· THINK(思考):把当前上下文送进大模型,得到一个回复;
· DONE(判断):回复里有工具调用,就是没干完;是纯文本,就是干完了;
· ACT(执行):调用工具,拿到返回结果;
· OBSERVE(更新):把本轮内容追加进对话,进入下一轮。
判断逻辑一句话:要调工具,就没干完;输出纯文本,就退出循环。这也解释了为什么 Agent 的上下文会越来越长——每一轮的思考、调用、结果,都被拼进同一段对话里,滚雪球式增长。
4转人工:守住业务红线
通过一组 hard rules(硬性规则)设定红线:当大模型判断用户情绪超过可处理范围,或涉及金额超限、定制商品等场景,立刻调用转人工接口,把事交给人。这是客服区别于其他 Agent 场景的关键一环——有些事,AI 必须懂得“交出去”。
一个重要的行业判断:客服不能全用 ReAct。
写代码最适合 ReAct,因为“怎么写都行,能实现就好”;但客服有大量环节涉及合规、财务、售后政策,企业要把流程定义死——该用 Workflow 的地方硬上 ReAct,反而会失控。成熟的客服 Agent,一定是四种能力按场景组合,而不是迷信某一种。
这四样凑齐,理论上能覆盖客服的绝大多数工作。四层地图到这里就画完了。
落地与选型:从下往上排查
把架构当成排障图和验收清单
四层都钻过一遍,这张图就能倒过来用。理解这套架构,最大的收益是排查问题时有的放矢。过去效果不好,只能盲目调提示词;有了完整架构,一个 bad case 进来,你可以从下往上一层层定位:它从哪个渠道进来 → 被路由到哪个 Agent → 走的是 Workflow 还是 ReAct → 在 ReAct 的哪一步卡住 → 是记忆没做好,还是 Skill 分类不准。
对应的主要调优维度有五个:
· Skill 的 description 是否精准——直接决定路由准确率;
· Skill 之间的边界是否清晰——避免混淆跳转;
· hard rules 是否覆盖业务红线——财务、合规、情绪的兜底;
· 接入的外部系统与记忆是否丰富——越丰富,服务越个性化;
· 底层大模型的选择——直接影响“Think”的质量。
如果你正在为企业选型或自建客服 Agent,这套架构可以直接当验收清单:四层是否齐全、四大能力是否都具备、Skill 与 Memory 的工程化是否落地、Multi-Agent 的扩展路径是否预留。缺哪一块,就知道它的能力边界在哪。




