首页 • 程序员 • 程序员 • AI算法 • Agent 能力竞争:从单次任务成功率到长程任务执行系统 随着智能体(Agent)从演示场景进入真实业务环境,其能力评价标准也在发生变化,过去关注的是它能否完成某个任务,如今更关键的是,它能否在多步骤、多工具和多重约束下持续、稳定地推进任务。 Agent 的能力竞争,正在从“单次任务成功率”转向“长程任务执行系统”。 长程任务执行系统(Long-horizon Task Execution System)指的是围绕复杂任务持续执行所形成的一整套工程架构,包括任务规划、技能调用、状态管理、项目记忆、模型路由、过程评测、权限控制和人工确认。 它关心的不只是某一次回答是否正确,而是 Agent 能否在复杂环境中持续推进任务,并在出现偏差时及时发现、恢复和调整。 一、为什么“单次成功”已经不够 在单轮问答或短任务中,评价一个 Agent 相对简单:给定一个目标,观察它是否输出正确结果。 一个软件开发 Agent 可能需要先理解代码库,再定位问题、修改多个文件、运行测试、分析错误,最后提交变更。 一个研究 Agent 可能需要连续搜索、筛选来源、交叉验证、整理证据并形成报告。 一个运营 Agent 则可能跨越邮件、表格、工单和内部系统,完成一条完整流程。 这些任务通常具有几个共同特点:执行步骤多,持续时间长;中间状态复杂,工具和数据源不断变化;任意一步的错误都可能向后传播;失败后不能简单地从头开始。 一个 Agent 即使在单步任务上具有较高准确率,也可能在长链条执行中因为状态丢失、工具误用、错误累积或者成本失控而失败 。假设每个步骤都有较高、但并非百分之百的成功概率,任务步骤越多,完整链路无误完成的难度就越大。 长程任务真正考验的,是系统能否持续维持正确的目标、状态和约束 。 二、核心难点不是“会做”,而是“持续做对” 1. 始终知道自己正在做什么 在执行几十甚至上百个步骤后,模型可能偏离原始目标,重复已经完成的工作,或者把临时假设误认为确定事实。 因此,系统需要显式维护任务计划、完成状态、未决问题和关键约束,而不能只依赖不断增长的对话上下文。 2. 知道何时调用哪一种能力 当技能库、工具库和子 Agent 的数量增加后,新的问题会随之出现:应该选择哪个技能?这个技能是否适用于当前状态?多个技能之间如何排序?错误选择后如何撤销? 此时,能力选择本身已经成为需要训练和评测的决策过程。 3. 积累项目与组织知识 通用模型知道如何编程,却未必了解某个项目的模块边界、测试约定、历史设计决策和内部接口。 它也可能理解财务、法务或客服的一般知识,却不了解特定企业的审批规则、风险边界和操作习惯。 如果这些知识不能被持续沉淀,Agent 每次执行任务都要重新探索,不仅成本较高,也容易重复犯错。 4. 控制错误、成本与权限 让最强模型处理所有步骤,通常成本过高;让小模型处理所有步骤,又可能在关键决策上失误。 与此同时,部分操作还涉及代码提交、数据修改、邮件发送和系统配置,必须设置权限边界、审计记录与人工确认。 这些问题已经超出单一模型的能力范围,进入了系统工程范畴。 三、三个技术信号:Agent 正在 从模型能力走向系统工程 近期几项技术进展,分别指向长程任务执行系统中的三个关键环节:技能选择、项目知识和模型路由。 1. SkillGate:技能选择本身需要单独训练 随着 Agent 技能库不断扩大,如何选择技能不再是一个附属问题。 SkillGate 研究指出,在长程任务中,如果只根据最终任务结果训练 Agent,技能选择动作很难获得准确反馈。 一次正确的技能选择,可能因为后续执行失败而受到负向奖励;一次错误选择,也可能因为后续步骤偶然成功而没有得到纠正。 研究者将这种现象称为“选择器信用饥饿 ”(Selector Credit Starvation),并为技能选择与后续执行建立不同的反馈通道。 根据论文报告,在包含16个候选技能的设置下,SkillGate 将一个90亿参数策略模型在五项 Agent 基准上的试验成功率从40.8%提高到53.2%,同时减少了对误导性技能的读取。 这项研究的意义在于,当技能数量持续增加时,技能检索与选择不能长期依赖提示词和固定规则,而会逐渐成为独立的训练、评测与治理对象。 2. SkillForge:项目知识可能成为 Agent 的私有能力层 SkillForge 关注的是另一个现实问题:通用 Agent 缺少特定项目知识。 它的做法不是等待真实问题出现后再学习,而是从代码仓库中主动生成与项目相关的合成问题,再通过解决这些问题提炼可复用技能,并将技能关联到具体代码实体。 论文实验显示,这种主动获取项目知识的方式,在开源模型和闭源模型上均能改善软件问题解决表现。 这一方向意味着,未来企业 Agent 的差异化可能不只来自底层模型,还来自长期积累的组织知识层,包括项目结构和代码约定、历史故障及处理经验、企业内部流程与审批规则、特定业务场景的操作知识,以及经过验证的工具调用模式。 这些知识不会自然存在于通用基础模型中,也不一定适合通过重新训练基础模型解决。 更现实的方式,是将其沉淀为可检索、可验证、可更新的技能与记忆。 企业真正需要建设的是一套能够持续积累组织经验的 Agent 能力层。 3. NeMo Switchyard:模型路由开始成为基础设施 长程任务的另一个突出问题是成本,很多单位已经面临token消耗带来巨额开支的问题。 不同步骤对模型能力的要求并不相同。任务规划、复杂推理和异常恢复可能需要前沿模型;信息分类、格式转换和稳定的工具操作,则可能由更小、更快的模型完成。 NVIDIA NeMo Switchyard 将模型路由(Model Routing)作为独立的编排层,根据任务内容、执行阶段、历史状态、成本和延迟等信号,在专用模型与前沿模型之间动态选择。 NVIDIA 公布的一组合作伙伴测试显示,在一套多轮 Agent 任务中,升级式路由相较于全部使用前沿模型降低了74%的成本,但准确率约下降6个百分点。 另一项编码任务测试则报告,在接近前沿模型表现的情况下,平均成本降低约28%。 这些数据来自 NVIDIA 及其合作伙伴的特定测试环境,不能直接视为所有业务场景的普遍结论。但它揭示了一个明确的工程方向: Agent 的优化单位,正在从“选择一个模型”转变为“管理一个模型组合” 。未来的 Agent 平台需要进一步回答:不同任务步骤应该使用哪一种模型,何时升级到能力更强的模型,何时切换到成本更低的模型;当路由判断出现错误时,系统应当如何发现和纠正,模型切换是否会破坏既有任务状态,以及如何在准确率、响应延迟和运行成本之间取得平衡。 模型路由因此不再只是推理优化技巧,而正在成为 Agent 运行时的一部分。 四、长程任务执行系统的五层架构 综合这些技术信号,一个较完整的长程任务执行系统,至少需要五个层次。 1. 任务规划层 负责把目标拆解为阶段、子任务和检查点,并持续记录哪些任务已经完成、哪些任务发生阻塞、哪些假设仍需验证。 规划不能只是任务开始时生成的一段文本,而应当成为一种可更新的结构化状态。 2. 技能与工具层 负责选择、调用和组合外部能力,包括搜索、代码执行、数据库查询、文件操作、业务接口和专业技能。 这一层需要处理技能发现、参数校验、依赖关系、调用权限、失败重试和结果验证。 SkillGate 所代表的技能选择问题,主要发生在这一层。 3. 记忆与知识层 它不仅要解决“记住什么”,还要判断知识来源是否可靠、内容是否过期、不同版本是否冲突,以及哪些信息可以被当前任务访问。 SkillForge 所代表的项目知识沉淀,主要对应这一层。 4. 模型路由层 负责根据任务难度、执行阶段、上下文长度、延迟要求和预算约束选择模型。 成熟的路由系统还需要支持异常升级:当小模型反复失败、任务停滞或者风险升高时,将任务切换到能力更强的模型。 NeMo Switchyard 所代表的系统化模型路由,主要对应这一层。 5. 安全与治理层 负责权限、审计、过程评测、敏感操作确认和异常终止。 对于代码提交、生产环境变更、资金操作、外部通信等高影响行为,系统不能只判断“Agent 是否能够执行”,还必须判断“是否允许执行、由谁授权、如何回滚”。 这五层并不是彼此独立的模块,它们需要在同一条任务链上共享状态,并形成闭环。 五、评价 Agent 的指标也需要改变 当竞争焦点转向长程任务执行系统后,单次任务成功率仍然重要,但已经不够。 更完整的评价体系,应当同时考察端到端任务完成率、单位任务的总成本与完成时间、关键检查点通过率、错误发现与恢复能力、重复调用和无效探索比例、工具选择与模型路由准确率,以及人工介入次数、高风险操作越权率和执行过程的可审计性与可复现性。 一个真正可用的 Agent,不一定在每一步都调用最强模型,也不一定追求完全自主。 它更重要的特征是:在可接受的成本和时间内完成任务;在不确定时主动升级或者请求确认;在失败后能够定位原因并恢复;同时让整个过程可以被理解和审计。 六、对企业落地意味着什么 1. 模型选型只是起点 基础模型决定能力上限,但任务编排、知识沉淀、工具治理和模型路由,决定系统能否稳定运行。 2. 企业知识需要被工程化管理 真正有价值的知识还需要与业务实体、任务阶段、适用条件和验证记录建立关联,并具备更新、淘汰和权限控制机制。 3. 人工确认不是自动化失败 成熟的 Agent 系统追求的不是取消所有人工操作,而是把人放在最需要判断和承担责任的位置。 4. 必须记录完整执行轨迹 没有过程记录,系统就无法解释失败原因,也无法优化技能选择、模型路由和任务规划。 执行轨迹将成为 Agent 评测、训练和治理的重要数据资产。 5. 成本控制需要进入架构设计 Agent 成本不仅来自模型输入和输出,还来自重复探索、无效工具调用、超长上下文和错误恢复。 成本优化不能只依赖更低的模型单价,而要从整条任务链进行分析。 结语:从能力展示到执行基础设施 过去衡量 Agent,往往看它是否能够完成一个令人印象深刻的任务。 下一阶段更值得关注的问题是:它能否连续运行数小时甚至数天?能否跨越多个系统保持状态?能否在环境变化后调整计划?能否在失败后恢复?能否把经验沉淀为下一次任务可复用的能力?能否把错误和成本控制在组织可以接受的范围内? 这意味着,Agent 的竞争不再只是模型能力竞赛,而是模型、技能、知识、运行时、评测和治理共同构成的系统竞争。 单次任务成功率回答的是:这个 Agent 有没有可能完成任务? 长程任务执行系统回答的则是:这个 Agent 能否持续、稳定、经济并且可控地完成任务? 后者是Agent 能否真正从演示产品走向生产系统的关键。 SkillGate: Training In-Policy Skill Selection in Long-Horizon Agents,2026年8月19日 SkillForge: Self-Distilling Agents for Project-Specific Issue Resolution,2026年8月19日 Route AI Agent Workloads Across Models with NVIDIA NeMo Switchyard,2026年8月11日
分享到: © 版权声明
文章版权归作者所有,未经允许请勿转载。