
摘要a16z 最新研究显示Computer Use 类 Agent 时薪 6-8 美元已低于印度离岸外包的 10 美元桌面任务基准完成率也首次超过人类。但 85% 意味着每 100 个任务仍失败 15 个基准分数不等于生产可行性。本文拆解这组数字的成立条件分析谁先受影响、谁不用慌。一小时的 AI Agent 现在多少钱6 到 8 美元。这是 a16z 合伙人 Fabrizio Serafini 在 8 月 10 日发布的研究《Can Agents Use a Computer Yet?》里给出的数字来源a16z 原文。这项研究测的东西通俗讲就是AI 像人一样操作电脑干活——看屏幕、点鼠标、敲键盘、填表单、跑完一个完整业务流程。它一年前还只是能演示今年已经有人拿它批量跑生产流程了。同一条赛道上印度离岸 BPO 人力是 10 美元一小时美国本土后台岗位是 30 到 45 美元。数字一出不少团队开始坐不住——要不要把某个标准化外包岗位换成 Agent成了例会上的常驻话题。但先别急着下结论。这组数字的背后有几个前提条件被大多数人忽略了。三根成本柱子怎么算出来的先把账算清楚。Serafini 摆了三根柱子一小时 Computer Use Agent、一小时印度 BPO 人力、一小时美国本土后台人力。Agent6 到 8 美元区间 3 到 15 美元。来自一位创业者的估算再用主流模型 token 定价和公开推理成本交叉校验印度 BPO约 10 美元区间 8 到 15 美元参考 2026 年外包报价追踪平台数据美国本土30 到 45 美元起点是美国劳工统计局客服岗位时薪中位数 20.59 美元再叠加约三成福利和管理成本Serafini 特意提醒这组数字该当量级参考不是精确报价。而且有个关键细节容易被漏掉——6 到 8 美元是最贵的跑法。逐帧截图、全程调用旗舰模型才会到这个价。真正搭得好的团队把重复劳动交给写死的代码只让模型处理需要判断力的环节混合下来成本降得更快。85% 的完成率意味着什么成本只是半边天另一半是准确率。Serafini 援引 llm-stats.com 排行榜数据截至 2026 年 6 月在 OSWorld-Verified 基准上最优模型 Claude Fable 5 的完成率达到 85%而人类测试者在同一任务集上是 72%。一年前最优模型还只有 42%。这个基准模拟真实桌面环境覆盖 Ubuntu、Windows、macOS 工作流——浏览器操作、表单填写、按钮点击都是后台岗位的日常。85% 超过 72%是不是意味着 Agent 已经比人强了不是。85% 意味着每 100 个任务有 15 个失败而后台业务流程要求每一步都成功。Serafini 在原文里专门强调基准分数不是生产可行性的充分条件真正决定部署成败的是模型之外的一切——验证机制、异常上报、错误处理以及当零售商门户一夜之间改版时系统能不能自己修正。一位在该领域创业的创始人说得很直接直到 2026 年 2 月 Opus 4.6 发布之前这些模型都不够好无法独立用于生产环境。能力跃升是最近半年的事不是一直如此。谁在用怎么用数字再漂亮也要看落地。Serafini 举了两个案例一个消费品数据平台部署 Agent 后每月处理 1500 万到 2000 万次门户交互任务。零售商网站更新界面导致传统爬虫失效时系统 2 小时内完成故障诊断、流程修复和数据恢复维护团队规模缩减 50%。一个全球系统集成商27 条 Agent 工作流每天处理 1800 张 IT 工单目标是把 25% 的人力从低利润托管服务中释放出来。注意这两个案例的共同点都是高重复、可验证、有明确成功标准的流程。门户交互有没有成功、工单有没有处理完结果是确定的Agent 干完可以验证。还有一点被很多人忽略生产环境里企业几乎不用 Claude、ChatGPT 这类消费级产品而是直接调用原始 API自己搭建沙箱虚拟机、编排逻辑、验证与重试机制。Agent 的产出质量很大程度取决于围在模型外面的那套 harness 搭得好不好——这跟我们写代码是一个道理框架好业务才好。成本结构贵在重试对想部署的团队来说成本账还有个隐藏项重试。Agent 跑一次任务失败也会消耗 token。如果成功率是 85%那 15% 的失败任务都要重跑成本要按推理成本 重试成本一起算。上下文越长、截图频率越高利润空间越薄。所以市场上有三种定价模式在竞争按任务、按小时、按结果。三种模式对应不同的风险分配——按结果计费对供应商最狠但也最能倒逼他们优化 harness。目前还没有统一标准。国内对照告别价格战这组数字漂洋过海到国内语境里要打个折扣看。国内模型 API 价格正在上行。8 月 17 日起DeepSeek 对 V4 全系列实行峰谷定价高峰时段9:00-12:00、14:00-18:00V4-Pro 输出 27 元/百万 token空闲时段半价 13.5 元V4-Flash 高峰输出 9 元/百万 token来源DeepSeek 官方公告2026 年 8 月。摩根士丹利 8 月 9 日研报《告别价格战打响智力战》统计2026 年第二季度国内大模型 API 平均输入价格 4.9 元/百万 token、输出 21.9 元相比 2025 年一季度分别上涨约 48% 和 80%来源大摩研报2026 年 8 月。两个数据放一起看结论很清楚国内模型在 Agent 场景的单任务成本虽然仍低于海外旗舰DeepSeek V4-Flash 输出价格是 Claude 系旗舰的零头但价格差在收窄而且不再白菜价。拿 6 美元的海外数字直接套国内会高估成本优势——国内企业部署 Agent 的账得用国内定价重算。我的判断谁先慌谁别慌外包岗位第一批受影响。但不是所有外包。受影响的是高重复、可验证、有明确成功标准的流程——数据录入、表单处理、信息核对这类。这类工作 Agent 完成率已经接近甚至超过人工成本还便宜。但替换没那么快。15% 的失败率意味着必须有人兜底、有人处理异常。企业不会一夜之间裁掉整个外包团队更可能的路径是Agent 处理 80% 的标准任务人力收缩到处理剩余 20% 的异常和边缘情况。岗位数量下降但不是清零。企业决策者别只看 85%。先问三个问题我的任务每一步都可验证吗失败了我能及时发现并重试吗业务流程改了Agent 能自适应吗三个都答是才值得上答不上来先补 harness 再谈部署。工程师反而是受益方。护城河从谁的模型强转移到谁懂工作流、谁有验证机制、谁能把 Agent 和业务系统深度集成。这恰恰是 8 月最值钱的能力——围绕模型搭 harness把不确定的模型能力变成确定的生产流程。模型会越来越便宜但搭 harness 的手艺不会贬值。一句话收尾拐点是真的但它是工程拐点不是裁员信号。慌的人是只看到 6 美元数字的人不慌的人看到了 15% 失败率和 harness 的价值。作者唐悦玮 | 从后端出发用 AI 拓展到全栈的工程师。