
Agent 从破圈走向大众视野,也就两年左右的时间,客观上还处在一个相当早期的阶段,整个行业还处于极客技术驱动的阶段。
像 openclaw 这一类产品的爆火,本质上是技术突破带来的注意力红利,远大于它当前能兑现的实际商业价值。
这种热度带偏了不少团队的节奏,导致现在很多 AI 应用公司有点过于炫技,把过多的精力花在模型适配、以及各种 Harness 之上,把技术能力本身当成了交付给用户的产品价值。
技术上的兴奋,我能理解。
但技术能力和产品价值之间,还有一段距离需要走。
想要看清这当中的差距,不妨回到 Agent 最底层的构成公式:
Agent = 模型 + Harness + Context
模型和 Harness 决定了一个 Agent 产品的能力下限和上限。
Context,决定了用户在持续使用中能不能获得超预期的复利体验。
模型迭代和 Harness 工程优化,都在大模型公司的能力范围内。
创业公司如果想活下来,必须主动和它们拉开一定的身位。
Context 恰恰就是那个与大模型公司存在 15 度夹角、最适合创业公司切入的 sweet spot。

如果跳出技术视角,从需求来看,用户其实根本不在乎产品背后用了什么复杂的技术栈,在乎的其实很朴素:
随手丢出一个模糊想法,Agent 能不能准确理解并闭环搞定,把“意图”到“结果”之间的冗长路径砍到最短; 不要让用户在日常使用中反复纠结切哪个模型、死记硬背各种斜杠指令; 在日积月累的高频交互中,系统能不能表现得越来越懂用户,响应越来越主动。
这些让用户最有体感、最愿意留存的体验,大都依赖 Context。
所以无论是从商业落地考量,还是从实际体验出发,Context 带来的产品体验提升,用户体感是最强烈的。
所以我认为,现在开始,做 Agent 的重心必须换一换了。
过去做 Agent,习惯了吃模型升级的免费红利。
但在当下,主流基座模型的能力纷纷越过及格线,单纯依赖模型变强的窗口正在关闭。
做 Agent 的重心,要从“以模型为中心”转向“以用户的 Context 为中心”。
最终决定一个 Agent 产品会长成什么模样、能不能持续建立竞争优势,本质上取决于它能沉淀多深的用户 Context,而非单单依靠底层的技术堆叠。

交互门槛✖️端到端完成任务能力
交互门槛的高低,核心取决于系统对 Context 的理解与沉淀,当系统积累了足够的 Context,交互才能被无限简化成下意识的自然表达。
端到端完成任务能力的高低,由模型与 Harness 决定。
下面,我想用交互门槛的高低和端到端完成任务能力的高低这两个维度,重新划分一下市面上的 Agent 产品。

高交互门槛,高任务自动化:Coding Agent
代表产品:Claude Code、Codex
这是第一个真正跑通、并且被市场验证了 PMF 的 Agent ,也让 Anthropic 在过去一年的势头开始超过 OpenAI。
不过从 Anthropic 最近两个月的 ARR 数据来看,Coding Agent 这个单一品类的增速,已经开始出现放缓的迹象。
所以 Anthropic 要给资本市场讲一个更宏大的叙事。
Coding Agent 在数字世界里具备极强的泛化能力。以 Coding Agent 为技术底座,向更广泛的工作与个人场景延伸。
从技术能力上看,这个逻辑是成立的。
我自己年初就开始用 Coding Agent 来处理日常生活和研究工作,这大半年来,它的表现确实越来越强,能端到端交付的成果也越来越稳定。
高交互门槛,低任务自动化:Working Agent
代表产品:
Office Agent:Workbuddy、豆包办公、千问办公,还有去年就小火的Genspark、Youmind; 垂直高价值场景:金融领域的 Rogo、法律领域的 Harvey 等;

国内当前打得如火如荼的办公 Agent 大战,底层逻辑基本都是从 Coding Agent 延伸出来的泛化尝试。
虽然现阶段它们在复杂办公场景下,还做不到像写代码那样成熟的端到端交付,但在能力演进的维度上,我其实并不悲观。
只要在真实业务里调用的频次足够高、数据与正负反馈足够丰富,模型解决专业任务的能力上限,未来大概率能被持续推高,自动化最终不会是最大的卡点。
但我觉得Working Agent的问题,在于交互体验。
许多团队偷懒复刻了 Coding Agent 的交互框架,但用面向程序员的操作手感去处理泛化办公,体验是完全错位的。
写代码有天然结构化的代码库作为现成 Context。
但跨入日常生活和泛化的工作,Agent对个人的工作习惯、知识背景与意图 Context 几乎一片空白。
没有足够的用户 Context 抹平操作门槛,就要让用户经常主动喂上下文和使用斜杠指令,使用起来自然觉得既笨重又复杂。
用户原本是想找个助手来分担工作,最终注意力却被消耗在频繁打断、微调指令上,导致难以进入办公的心流。
低交互门槛,低任务自动化:Personal Agent
我们这边在打办公大战,硅谷那边开始打起个人助理大战了,Instinct、Town、Meta Muse,还有 Grok Bot。

相比于 Coding Agent 和 Working Agent,Personal Agent 在定位与交互上的差异化明显得多。
这些产品很多都受到了Openclaw的启发,在交互方式上进一步创新。
比如主打拟人性格与长期记忆,更加积极地拥抱纯云端架构,直接嵌入到各类日常 IM中。
在任务设计上,也主动砍掉了那些复杂的长链条任务,把每一次交互的心理门槛压到了最低。
在底层逻辑上,这恰恰是把重心转向了用户 Context:通过高频、方便的触达,持续吸收用户的信息与行为偏好。
就日常手感而言,像日程安排、行程提醒、随手记日记这些高频且碎片化的生活需求,这种轻量级 Agent 的体验要顺滑得多。
虽然在端到端完成复杂任务的自动化程度上,它们目前表现得并不激进,但凭借极低的交互摩擦,避开了极客界面的那种笨重感
从跨越鸿沟的角度来说,Personal Agent 会比 Coding Agent 和 Working Agent,更早被大众用户接纳。
低交互门槛,高任务自动化:通用 Agent 与 AI 员工
这其实是所有 Agent 都追求的终极产品形态。
在前端,用户的交互门槛被压到极低,自然语言甚至下意识的行为就能随时唤醒。
在后端执行侧,又拥有足够的自动化能力,能够端到端交付确定性的结果。
Manus是最早朝着这种形态去做的产品,只不过当时还没有那么成熟的技术,让在本地运行的Coding Agent更快找到了PMF,夺走了市场的注意力。
相对而言,Claude Tag 已经是一个完成度比较高的产品。
用户只需像在群里@同事一样随手交代任务,它就能潜伏在协作流中持续吸收上下文,在后台异步自主跑完搜集、验证与调度的复杂长链路,端到端交付结果。

这种低门槛、高自动化的交互形态,可能会是10倍 coding agent市场规模。
大家目标都一样
既然所有 Agent 都想去做通用 Agent 与 AI 员工,为什么当下还会有这么多形态的 Agent?
我认为是这些Agent拥有的初始 Context 不同,各自搜集和沉淀 Context 的环境也完全不同。
Coding Agent 是代码和开发环境; Working Agent 是专业知识和工作流程; Personal Agent 从个人生活和个人偏好。
大家不过是依托着各自熟悉的场景和已有的 Context 优势,选了一条阻力最小的路径出发。
如果从战略角度来看,所有 Agent 最终争夺的,也远远不止是做通用 Agent 与 AI 员工,而是要成为下一代Agent OS入口。

这个入口一旦形成,就会具备极强的网络效应和赢家通吃的特征。
就像微信成为移动互联网连接人与人、人与内容、人与服务的总入口一样,AI时代谁掌握了Agent OS入口,谁就拥有了调度用户意图的最高权限。
正因如此,大家虽然从不同场景出发,最终的目标却高度统一:
用户有需求时,能在第一时间想到自己; 用户愿意把越来越多的任务和意图交给自己托管; 借由高频互动,持续、排他性地沉淀用户的 Context; 再通过这些 Context,向上向下调度更多的专业工具与下游服务; 最终从一个垂类单点工具,逐渐膨胀为一个不可替代的通用 Agent OS入口。
区别仅仅在于,当前大家选择拿哪一种 Context 作为最初的起点。
从 Context 推演未来的入口格局
那我们到底需要多少个Agent OS入口?
我认为这不取决于市面上有多少种 Agent,而是取决于Agent背后的 Context 能否跨生态互通,以及用户最核心的 Context 最终被沉淀在何处。
情形一:Context 完全互通
如果未来的生态足够开放,所有的 Context 都能通过 MCP 或 CLI 接口实现无缝互通,那么整个商业格局将收敛为一个终极的全局入口。
这个入口将成为唯一的超级调度中枢。
它占据着用户最核心的信任位,垄断了最完整的个人意图与全局偏好 Context。而在它身后,则是由无数垂直的 Agent 构成的 A2A 网络。
用户不再需要记住具体的Agent,只需面对一个极简且统一的交互界面表达诉求。
超级入口负责解析意图、拆解任务,并在后台精准调度下游各领域的专业 Agent 闭环执行。
在 Context 彻底互通的世界里,下层垂类工具的入口价值会被全面抹平,赢家通吃的终局只有一个。
入口数量:1 个。
情形二:Context 完全不互通
如果各大厂商依然各自画地为牢,不同 Agent 之间无法跨越生态壁垒共享 Context,那么每一种细分 Context 背后,都会各自圈地形成一个独立的入口。
这基本就是今天移动互联网的格局。如果真是这样,我会觉得无比的悲观。
用户面对不同的事情,依然要在大脑里先做一次手动路由,根据具体任务去切换不同的 Agent 产品,甚至在跨场景协作时,还要充当搬运工,手动把 A 处的 Context 复制粘贴给 B 处的 Agent。
这在体验上不仅割裂,而且完全违背了 AI 时代追求极简心流的体验。
入口数量:N 个。
情形三:Context 部分互通,形成产业分化
商业世界很少走向极端的理想或彻底的割裂,更有可能出现的是一种中间状态。
日常生活和工作是最高频的两个场景,每个场景内部的 Context 具备极强的互通可能。
但个人 Context 与组织 Context 之间,因为数据归属权、安全合规、使用规则的不同,大概率不会互通。
因此,未来大概率会收敛形成两类核心入口:
- 个人入口
持续沉淀日常生活、行为习惯、日程轨迹与私密偏好相关的 Context,扮演专属的人生第二大脑; - 工作入口
持续沉淀业务流程、企业资产、组织规则与协同关系相关的 Context,充当高效的数字职场中枢。
在这两个核心入口之外,垂直门槛极高的专业 Agent,要么沦为底层的原子化技能模块,被个人或工作入口按需调用;要么只在少数的场景里保留极窄的独立入口。
核心入口数量:2 个。
结论
回到最开始的问题:我们到底需要多少个 Agent,以及多少个 Agent OS 入口?
在入口层面,极其收敛。
一个主内,接管个人生活;一个主外,接管组织工作。
用户的心智带宽极其有限,谁能在这两端垄断用户的 Context,谁就能抢到AI时代的船票。
在 Agent 层面,极度繁荣。
在核心入口的调度帷幕之后,我们需要成千上万个专业 Agent。
它们不再需要各自费尽心力去圈占用户界面、逼用户学习操作手册,而是卸掉交互包袱,以纯粹的原子化能力接入生态网络,在后台承接超级入口分发过来的复杂长链路任务。
从拼模型、卷 Harness ,走向以用户的 Context 为中心,这或许才是 Agent 从极客玩具走向大众的路径。




