我们需要多少Agent以及Agent OS入口?

我们需要多少Agent以及Agent OS入口?
 

Agent 从破圈走向大众视野,也就两年左右的时间,客观上还处在一个相当早期的阶段,整个行业还处于极客技术驱动的阶段。

像 openclaw 这一类产品的爆火,本质上是技术突破带来的注意力红利,远大于它当前能兑现的实际商业价值。

这种热度带偏了不少团队的节奏,导致现在很多 AI 应用公司有点过于炫技,把过多的精力花在模型适配、以及各种 Harness 之上,把技术能力本身当成了交付给用户的产品价值。

技术上的兴奋,我能理解。

但技术能力和产品价值之间,还有一段距离需要走。

想要看清这当中的差距,不妨回到 Agent 最底层的构成公式:

Agent = 模型 + Harness + Context

模型和 Harness 决定了一个 Agent 产品的能力下限和上限。

Context,决定了用户在持续使用中能不能获得超预期的复利体验。

模型迭代和 Harness 工程优化,都在大模型公司的能力范围内。

创业公司如果想活下来,必须主动和它们拉开一定的身位。

Context 恰恰就是那个与大模型公司存在 15 度夹角、最适合创业公司切入的 sweet spot。

我们需要多少Agent以及Agent OS入口?

如果跳出技术视角,从需求来看,用户其实根本不在乎产品背后用了什么复杂的技术栈,在乎的其实很朴素:

  • 随手丢出一个模糊想法,Agent 能不能准确理解并闭环搞定,把“意图”到“结果”之间的冗长路径砍到最短;
  • 不要让用户在日常使用中反复纠结切哪个模型、死记硬背各种斜杠指令;
  • 在日积月累的高频交互中,系统能不能表现得越来越懂用户,响应越来越主动。

这些让用户最有体感、最愿意留存的体验,大都依赖 Context。

所以无论是从商业落地考量,还是从实际体验出发,Context 带来的产品体验提升,用户体感是最强烈的。

所以我认为,现在开始,做 Agent 的重心必须换一换了。

过去做 Agent,习惯了吃模型升级的免费红利。

但在当下,主流基座模型的能力纷纷越过及格线,单纯依赖模型变强的窗口正在关闭。

做 Agent 的重心,要从“以模型为中心”转向“以用户的 Context 为中心”。

最终决定一个 Agent 产品会长成什么模样、能不能持续建立竞争优势,本质上取决于它能沉淀多深的用户 Context,而非单单依靠底层的技术堆叠。

我们需要多少Agent以及Agent OS入口?

交互门槛✖️端到端完成任务能力

交互门槛的高低,核心取决于系统对 Context 的理解与沉淀,当系统积累了足够的 Context,交互才能被无限简化成下意识的自然表达。

端到端完成任务能力的高低,由模型与 Harness 决定。

下面,我想用交互门槛的高低端到端完成任务能力的高低这两个维度,重新划分一下市面上的 Agent 产品。

我们需要多少Agent以及Agent OS入口?

高交互门槛,高任务自动化:Coding Agent

代表产品:Claude Code、Codex

这是第一个真正跑通、并且被市场验证了 PMF 的 Agent ,也让 Anthropic 在过去一年的势头开始超过 OpenAI。

不过从 Anthropic 最近两个月的 ARR 数据来看,Coding Agent 这个单一品类的增速,已经开始出现放缓的迹象。

所以 Anthropic 要给资本市场讲一个更宏大的叙事。

Coding Agent 在数字世界里具备极强的泛化能力。以 Coding Agent 为技术底座,向更广泛的工作与个人场景延伸。

从技术能力上看,这个逻辑是成立的。

我自己年初就开始用 Coding Agent 来处理日常生活和研究工作,这大半年来,它的表现确实越来越强,能端到端交付的成果也越来越稳定。

高交互门槛,低任务自动化:Working Agent

代表产品:

  • Office Agent:Workbuddy、豆包办公、千问办公,还有去年就小火的Genspark、Youmind;
  • 垂直高价值场景:金融领域的 Rogo、法律领域的 Harvey 等;
我们需要多少Agent以及Agent OS入口?

国内当前打得如火如荼的办公 Agent 大战,底层逻辑基本都是从 Coding Agent 延伸出来的泛化尝试。

虽然现阶段它们在复杂办公场景下,还做不到像写代码那样成熟的端到端交付,但在能力演进的维度上,我其实并不悲观。

只要在真实业务里调用的频次足够高、数据与正负反馈足够丰富,模型解决专业任务的能力上限,未来大概率能被持续推高,自动化最终不会是最大的卡点。

但我觉得Working Agent的问题,在于交互体验。

许多团队偷懒复刻了 Coding Agent 的交互框架,但用面向程序员的操作手感去处理泛化办公,体验是完全错位的。

写代码有天然结构化的代码库作为现成 Context。

但跨入日常生活和泛化的工作,Agent对个人的工作习惯、知识背景与意图 Context 几乎一片空白。

没有足够的用户 Context 抹平操作门槛,就要让用户经常主动喂上下文和使用斜杠指令,使用起来自然觉得既笨重又复杂。

用户原本是想找个助手来分担工作,最终注意力却被消耗在频繁打断、微调指令上,导致难以进入办公的心流。

低交互门槛,低任务自动化:Personal Agent

我们这边在打办公大战,硅谷那边开始打起个人助理大战了,Instinct、Town、Meta Muse,还有 Grok Bot。

我们需要多少Agent以及Agent OS入口?

相比于 Coding Agent 和 Working Agent,Personal Agent 在定位与交互上的差异化明显得多。

这些产品很多都受到了Openclaw的启发,在交互方式上进一步创新。

比如主打拟人性格与长期记忆,更加积极地拥抱纯云端架构,直接嵌入到各类日常 IM中。

在任务设计上,也主动砍掉了那些复杂的长链条任务,把每一次交互的心理门槛压到了最低。

在底层逻辑上,这恰恰是把重心转向了用户 Context:通过高频、方便的触达,持续吸收用户的信息与行为偏好。

就日常手感而言,像日程安排、行程提醒、随手记日记这些高频且碎片化的生活需求,这种轻量级 Agent 的体验要顺滑得多。

虽然在端到端完成复杂任务的自动化程度上,它们目前表现得并不激进,但凭借极低的交互摩擦,避开了极客界面的那种笨重感

从跨越鸿沟的角度来说,Personal Agent 会比 Coding Agent 和 Working Agent,更早被大众用户接纳。

低交互门槛,高任务自动化:通用 Agent 与 AI 员工

这其实是所有 Agent 都追求的终极产品形态。

在前端,用户的交互门槛被压到极低,自然语言甚至下意识的行为就能随时唤醒。

在后端执行侧,又拥有足够的自动化能力,能够端到端交付确定性的结果。

Manus是最早朝着这种形态去做的产品,只不过当时还没有那么成熟的技术,让在本地运行的Coding Agent更快找到了PMF,夺走了市场的注意力。

相对而言,Claude Tag 已经是一个完成度比较高的产品。

用户只需像在群里@同事一样随手交代任务,它就能潜伏在协作流中持续吸收上下文,在后台异步自主跑完搜集、验证与调度的复杂长链路,端到端交付结果。

我们需要多少Agent以及Agent OS入口?

这种低门槛、高自动化的交互形态,可能会是10倍 coding agent市场规模。

大家目标都一样

既然所有 Agent 都想去做通用 Agent 与 AI 员工,为什么当下还会有这么多形态的 Agent?

我认为是这些Agent拥有的初始 Context 不同,各自搜集和沉淀 Context 的环境也完全不同。

  • Coding Agent 是代码和开发环境;
  • Working Agent 是专业知识和工作流程;
  • Personal Agent 从个人生活和个人偏好。

大家不过是依托着各自熟悉的场景和已有的 Context 优势,选了一条阻力最小的路径出发。

如果从战略角度来看,所有 Agent 最终争夺的,也远远不止是做通用 Agent 与 AI 员工,而是要成为下一代Agent OS入口。

我们需要多少Agent以及Agent OS入口?

这个入口一旦形成,就会具备极强的网络效应和赢家通吃的特征。

就像微信成为移动互联网连接人与人、人与内容、人与服务的总入口一样,AI时代谁掌握了Agent OS入口,谁就拥有了调度用户意图的最高权限。

正因如此,大家虽然从不同场景出发,最终的目标却高度统一:

  • 用户有需求时,能在第一时间想到自己;
  • 用户愿意把越来越多的任务和意图交给自己托管;
  • 借由高频互动,持续、排他性地沉淀用户的 Context;
  • 再通过这些 Context,向上向下调度更多的专业工具与下游服务;
  • 最终从一个垂类单点工具,逐渐膨胀为一个不可替代的通用 Agent OS入口。

区别仅仅在于,当前大家选择拿哪一种 Context 作为最初的起点。

从 Context 推演未来的入口格局

那我们到底需要多少个Agent OS入口?

我认为这不取决于市面上有多少种 Agent,而是取决于Agent背后的 Context 能否跨生态互通,以及用户最核心的 Context 最终被沉淀在何处。

情形一:Context 完全互通

如果未来的生态足够开放,所有的 Context 都能通过 MCP 或 CLI 接口实现无缝互通,那么整个商业格局将收敛为一个终极的全局入口。

这个入口将成为唯一的超级调度中枢。

它占据着用户最核心的信任位,垄断了最完整的个人意图与全局偏好 Context。而在它身后,则是由无数垂直的 Agent 构成的 A2A 网络。

用户不再需要记住具体的Agent,只需面对一个极简且统一的交互界面表达诉求。

超级入口负责解析意图、拆解任务,并在后台精准调度下游各领域的专业 Agent 闭环执行。

在 Context 彻底互通的世界里,下层垂类工具的入口价值会被全面抹平,赢家通吃的终局只有一个。

入口数量:1 个。

情形二:Context 完全不互通

如果各大厂商依然各自画地为牢,不同 Agent 之间无法跨越生态壁垒共享 Context,那么每一种细分 Context 背后,都会各自圈地形成一个独立的入口。

这基本就是今天移动互联网的格局。如果真是这样,我会觉得无比的悲观。

用户面对不同的事情,依然要在大脑里先做一次手动路由,根据具体任务去切换不同的 Agent 产品,甚至在跨场景协作时,还要充当搬运工,手动把 A 处的 Context 复制粘贴给 B 处的 Agent。

这在体验上不仅割裂,而且完全违背了 AI 时代追求极简心流的体验。

入口数量:N 个。

情形三:Context 部分互通,形成产业分化

商业世界很少走向极端的理想或彻底的割裂,更有可能出现的是一种中间状态。

日常生活和工作是最高频的两个场景,每个场景内部的 Context 具备极强的互通可能。

但个人 Context 与组织 Context 之间,因为数据归属权、安全合规、使用规则的不同,大概率不会互通。

因此,未来大概率会收敛形成两类核心入口:

  • 个人入口
    持续沉淀日常生活、行为习惯、日程轨迹与私密偏好相关的 Context,扮演专属的人生第二大脑;
  • 工作入口
    持续沉淀业务流程、企业资产、组织规则与协同关系相关的 Context,充当高效的数字职场中枢。

在这两个核心入口之外,垂直门槛极高的专业 Agent,要么沦为底层的原子化技能模块,被个人或工作入口按需调用;要么只在少数的场景里保留极窄的独立入口。

核心入口数量:2 个。

结论

回到最开始的问题:我们到底需要多少个 Agent,以及多少个 Agent OS 入口?

在入口层面,极其收敛。

一个主内,接管个人生活;一个主外,接管组织工作。

用户的心智带宽极其有限,谁能在这两端垄断用户的 Context,谁就能抢到AI时代的船票。

在 Agent 层面,极度繁荣。

在核心入口的调度帷幕之后,我们需要成千上万个专业 Agent。

它们不再需要各自费尽心力去圈占用户界面、逼用户学习操作手册,而是卸掉交互包袱,以纯粹的原子化能力接入生态网络,在后台承接超级入口分发过来的复杂长链路任务。

从拼模型、卷 Harness ,走向以用户的 Context 为中心,这或许才是 Agent 从极客玩具走向大众的路径。

 

分享到: 文章二维码
© 版权声明

暂无评论

您必须登录才能参与评论!
暂无评论...