通用电脑操作能力让 Agent 的行动范围不再局限于预先接好的工具;能否在此基础上持续把真实事情办成,决定了它是否是一个合格的数字员工。
01

为什么多数 Agent 仍然停在中间产物

今天被称为 Agent 的产品很多,但真正接近“数字员工”的产品仍然很少。大多数 Agent 最擅长的仍然是生成内容:回答问题、写文章、制作 PPT、生成代码,或者在少数预先接好的工具中执行固定动作。

它们可以交付一份报告、一段代码或一套操作建议,却常常不能继续完成报告之后、代码之后和建议之后的真实工作。

这并不完全是因为它们不够聪明。一个更直接的原因是:多数 Agent 仍然不能在足够广泛的电脑环境中行动。

真实工作通常分散在网页、文件、终端、桌面软件、通信工具、系统对话框和需要登录的账号中。一个 Agent 即使知道下一步应该做什么,只要它不能打开对应的软件、识别界面、输入信息、处理反馈并在不同应用之间继续工作,就必须把任务重新交还给人。

因此,对未经专门接入的软件进行通用电脑操作的能力,是 Agent 从“依赖预接工具提供中间产物”走向“能够覆盖广泛工作并交付最终结果”的关键分水岭。

本文依据公开资料筛选候选,不是流马已经完成的实测排名,也不是最终交付建议。

02

真正完整的数字员工应该能做什么?

从最终能力边界看,我们认为:在用户授权和现有硬件允许的范围内,数字员工应该能够完成电脑上人类可以完成的任何任务。

这里的“完成”不是输出一份说明书,告诉用户接下来应该怎么做;而是能够理解目标、操作所需软件、跨越不同工具、处理执行反馈,并把事情持续推进到用户真正想要的结果。

例如,用户交代“在预算内帮我采购两台符合要求的电脑”。如果后续平台没有可用的 API、连接器或专用自动化,缺少通用电脑操作能力的 Agent 仍然可以分析需求、搜索产品并生成一份完全正确的采购报告。但用户还要自己登录平台、联系商家、核实库存、下单、付款、跟踪物流并处理异常。

当原始任务是“完成采购”时,这份正确报告仍然只是中间产物。

拥有足够广泛电脑操作能力的 Agent,则有机会继续调查产品与供应商、核实价格和库存、计算总成本、联系商家、提出决策建议,在付款节点请求用户授权,完成下单,跟踪物流,处理异常,并在设备到达和验收后关闭任务。

真正的变化不是从错误内容走向正确内容,而是从帮助用户思考工作,走向替用户把工作真正办成。
03

通用电脑操作能力目前仍然稀缺

不能把“Agent”与“可以完整操作电脑”画上等号。目前多数产品仍主要工作在对话框、代码仓库、命令行、浏览器或有限的工具集合中。

浏览器自动化很有价值,但它不等于完整电脑操作。单靠浏览器无法自然覆盖本地软件、系统设置、文件选择器、授权弹窗、外设以及网页之外的业务流程。

通用 Computer Use 也不必取代所有专用接口。有稳定 API、MCP、命令行或专用浏览器自动化时,这些方式往往更快、更可靠。Computer Use 的独特价值,是在没有专用接口时继续扩大 Agent 的行动范围。

当前只有少数顶尖 Agent 开始把广泛电脑操作、强推理和持续执行组合到同一个闭环中。Codex 和 Claude Code 是其中最值得关注的代表。

  • 足够强的任务理解能够识别用户真正想要的结果,而不只是复述指令。
  • 终端、文件和浏览器能够通过当前最可靠的接口处理结构化数字工作。
  • 桌面与 Computer Use在没有合适 API 或预接工具时,仍能操作真实软件界面。
  • 跨应用连续工作能够在网页、文件、桌面应用和通信工具之间延续上下文与责任。
  • 持续执行与恢复遇到断网、重启、权限和工具异常后可以继续推进。
  • 结果验证能够判断真实目标是否实现,而不是把中间步骤当成完成。
04

有了“手脚”,也不等于一定能把事情办成

通用电脑操作能力扩大了 Agent 可以采取的动作范围,使它有机会跨越未为自动化预先准备的软件和界面,完成更广泛的端到端工作。

但它不能自动保证成功。一个 Agent 可能已经能够打开网页、操作软件和执行命令,却仍然可能理解错目标、选择错误路径、在异常后停止、反复追问用户下一步,或者声称完成了实际上没有完成的任务。

因此,真正的数字员工需要通过两道相互独立的门。

只有推理、无法行动,任务会停在中途;只有行动、不能可靠闭环,也只是更灵活的自动化工具。
  • 第一道门:关键动作可达任务需要的动作,无论通过 API、MCP、终端、浏览器还是桌面界面,Agent 都必须能够完成。只要关键步骤仍需用户接管,它通常交付的仍是中间产物。
  • 第二道门:目标真正闭环在关键动作可达后,Agent 还必须把步骤组织成完整流程,处理异常,验证结果,并持续推进到用户的真实目标实现。
05

数字员工能力的四个层级

可以把当前 Agent 产品的能力粗略分成四层。同一产品可能因为平台、权限、工具、模型和任务配置不同而处于不同层级,这不是一张固定产品分类表。

目前大量 Agent 测评仍停留在第一层,把“是否生成了一个交付物”作为成功标准;更多工具型 Agent 位于第二层;只有少数产品开始进入第三层;第四层仍是需要通过真实任务反复证明的目标。

这也解释了为什么过去很多 Agent 只能交付文章、报告、代码和操作方案:问题不只是生成内容是否正确,而是它的行动范围在工作结束以前已经终止。

  • 1. 内容生成生成文章、PPT、图片、网页、代码或其他内容资产。
  • 2. 局部执行在命令行、浏览器、代码仓库或少数已接入工具中完成动作。
  • 3. 完整电脑执行像人一样操作网页、本地软件与系统界面,并跨工具推进工作。
  • 4. 通用任务闭环在广泛电脑任务中持续行动、处理异常、验证结果并对最终目标负责。
06

第一指标应该是真实任务独立闭环率

数字员工基座不应主要按照模型参数、工具数量、一次漂亮的 Computer Use 演示,或者一个回合点击了多少次来评价。

第一指标应该是真实任务独立闭环率:除必要的人类授权外无需用户接管、最终实现真实目标的任务,占所有有效分配任务的比例。

关键动作是否可达,决定 Agent 能否承担某一项具体任务;通用电脑操作能力,决定这种承担范围能否扩展到未经专门接入的软件;真实任务独立闭环率,才决定它是否足以成为数字员工。

真实任务独立闭环率 = 除必要人类授权外无需用户接管、最终实现预定目标的任务数 ÷ 实际分配的有效任务数
  • 电脑任务覆盖率真实任务所需的电脑操作中,Agent 能自主完成多少?
  • 虚假完成率Agent 声称成功,但用户的真实目标并未实现的比例是多少?
  • 人工接管率除必要授权外,用户需要亲自继续或修复工作的比例是多少?
  • 阻塞可见率发生问题后,Agent 能否及时、准确地报告?
  • 恢复成功率网络中断、重启、权限缺失或工具异常后能否继续?
  • 单位闭环成本每件真正办成的事情消耗多少时间、模型额度、基础设施和人工精力?
07

Codex 与 Claude Code:优先验证的通用电脑执行候选

公开资料只能证明一个产品提供了哪些能力,不能证明它已经能够稳定完成所有真实任务。下面的产品应被视为首轮测试候选,而不是预先写好的排行榜。

  • CodexCodex 把高能力模型、终端、文件、技能和连接器放进同一个工作环境;在受支持的桌面应用中启用相应能力并授予系统权限后,还可以使用浏览器和 Computer Use。它因此获得了从理解与生成内容继续走向真实软件操作的路径。但实际可靠性仍取决于网络、权限、状态可见性、长任务恢复、错误发现和人工接管频率。
  • Claude CodeClaude Code 原本主要围绕终端、文件和软件工程工作,现在又加入浏览器与 Computer Use,使它开始从代码环境延伸到真实图形界面,并进入少数具备通用数字员工潜力的候选范围。其 Computer Use 仍属于研究预览,存在平台和使用方式限制;在国内交付中,账号与网络资源的稳定可获得性同样会影响最终可用性。
公开依据OpenAI · Introducing the Codex appOpenAI · How agents are transforming workAnthropic · How Claude Code worksAnthropic · Computer Use
08

OpenClaw 与 Hermes Agent:需要继续建设的开放基座

开放 Agent 运行框架可以提供数字员工所需的持续运行、控制、记忆和扩展能力,但“开放且功能丰富”不能被误写成“每个部署都已经具有成熟的通用电脑操作能力”。

  • OpenClawOpenClaw 提供 Agent 循环、工具、浏览器、记忆、Goal、后台任务、消息渠道、节点和恢复机制,也已经提供基于节点的电脑控制通路。实际桌面能力仍随操作系统、节点设计、Computer Use 组件、权限和部署环境而变化。Claw-SWE-Bench 中,同一个模型在简陋适配器中的 Pass@1 为19.1%,在完整 OpenClaw 适配器中达到73.4%。这说明运行框架在该代码基准中非常重要,但不能直接证明一般业务或桌面任务的可靠完成率。
  • Hermes AgentNous Research 的 Hermes Agent 是开放、模型无关、可自托管的运行框架,提供终端、文件、浏览器、记忆、技能、定时任务和持续 Goal。桌面操作可以通过额外的 CUA Driver 与系统权限获得,但不是所有 Hermes 部署天然具备。官方文档也承认 Goal 完成判断可能出现假阳性或假阴性,因此工具、Goal 和 Computer Use 仍只是基础设施,真实任务是否办成需要独立验收。
公开依据OpenClaw · Agent runtimeOpenClaw · Tools overviewClaw-SWE-BenchNous Research · Hermes AgentHermes Agent · Computer UseHermes Agent · Persistent Goals
09

国内与对照候选首先要证明行动边界

Qwen Code 的官方资料已经把 Computer Use 列为产品能力,因此不应简单归入“只有命令行能力”的候选。它还具备终端、文件、MCP 和多模型能力,在国内交付环境中尤其值得优先验证。

但官方声明具备 Computer Use,不等于已经证明它能稳定覆盖各种桌面软件。支持平台、权限方式、跨应用连续性、异常恢复和真实任务闭环率,仍需独立实测。

WorkBuddy、Kimi Code 和 OpenHands 等产品也值得研究,它们分别在国内办公入口、终端执行、开放模型和自托管环境方面具有价值。

在把任何产品称为完整数字员工基座以前,都必须先回答:它能否稳定操作目标业务所需的完整电脑环境,还是主要停留在办公内容、命令行、代码仓库、浏览器或有限工具范围内?

能够调用 MCP、执行命令或操作网页,不能被直接当作已经能够完成电脑上人类广泛工作的证据。

公开依据Alibaba Qwen · Qwen Code腾讯 · WorkBuddy 产品简介Moonshot AI · Kimi CodeOpenHands
10

最好的基座必须从真实工作中产生

当前公开研究表明,Codex、Claude Code 应优先作为通用电脑执行候选进行验证;OpenClaw、Hermes Agent 是值得建设和测试的开放运行基座;Qwen Code 值得优先确认其在国内环境中的 Computer Use 成熟度;其他产品可以作为国内交付、特定任务和模型中立对照,但必须先确认行动边界。

目前没有足够证据宣布其中任何一个产品已经是所有业务场景里最好的数字员工。

最终方案可能是一个成品 Agent,也可能是强模型与开放运行框架的组合,还可能因为市场、网络条件和任务类型而变化。

真正的最佳数字员工基座,是能够覆盖目标工作所需动作,并在真实任务中以较少人工接管、较低虚假完成和可接受长期成本,持续把事情办成的那套组合。
11

流马实验室接下来怎样验证

流马实验室不会先宣布冠军,再去寻找支持结论的材料。

我们将从真实工作中建立测试任务,让候选系统在明确授权和验收标准下承担一段完整责任。

每次测试都会记录:哪些动作 Agent 能自己完成,哪里仍需人工接管,最终目标是否实现,是否发生虚假完成,异常后能否恢复,以及闭环任务的真实成本。

文章、报告、PPT、代码和网页只有在它们本身就是用户最终目标时,才能作为最终结果;否则,它们只是任务过程中产生的资产。

通用电脑操作能力让 Agent 有机会越过预接工具,追求更广泛工作的端到端结果;能否反复把真实事情办成,决定了它是否有资格被称为数字员工。
  • 真实采购在给定需求和预算内完成采购,直到订单、物流与验收闭环。
  • 网站交付把网站从需求推进到公开可访问,并验证核心业务功能。
  • 客户服务接收真实咨询,核实必要事实,处理问题并回传结果。
  • 跨应用工作在多个真实桌面软件之间完成一段业务流程。
  • 故障恢复在断网、缺少权限、重启或工具失败后恢复并完成任务。