Harness决定AI Agent表现关键!华尔街实测千问办公和Workbuddy
创始人
2026-08-18 19:31:57
0

华尔街投行杰富瑞的分析师,最近给市面上八个主流中美AI Agent做了一场实测,看谁真正能把活干好。

结果有点出乎意料:拿了第一名的,是阿里的千问办公,尽管它背后的模型智能分只排到第四;模型能力第一的Claude Opus 5,它的Agent产品Claude Cowork拿了第二;另一个反直觉的结果是,最近大火的Workbuddy,这轮测试中隐含的Harness分在中国Agent里反而垫底。

杰富瑞的核心结论,用一句话概括:决定一个AI Agent好不好用,往往不是背后那个模型,Harness做得好是可以弥补模型智能差距的。

Harness是什么:Agent里除了模型,剩下的都是它

一个AI Agent干活的流程,可以拆成两半:一半是模型,负责"想";另一半是harness,负责"管"。

杰富瑞把harness拆成了六层,每一层管的都是模型自己管不了的事:

  • 指令:告诉Agent这个活是什么,红线在哪

  • 上下文:Agent干活时能看到的背景信息

  • 工具:Agent能用什么去完成这个任务

  • 边界:Agent能行动的范围划在哪

  • 反馈:告诉Agent哪里做错了,让它自己纠正、重新规划

  • 治理:让组织能管住一整批Agent

这六层,正好对应了雇一个员工之后,公司要做的那些事——交代任务、给信息、给工具、划权限、给反馈、做管理。模型就是那个新来的聪明人,harness就是这套管理机制。聪明人再厉害,扔进一个没有管理的公司,也干不好活。

来看一组控制变量的证据——模型不动,只换harness,看Agent表现怎么变。

结果:同一个Claude Opus 4.6,套上不同的harness,在Terminal-Bench 2.0这个基准上,得分从58.0%一路到76.4%,最高最低差了18.4个百分点。Gemini 3 Pro同样只换harness,得分从56.0%到69.4%,差13.4个百分点。

实测八个中美Agent

这次实测,杰富瑞挑了八个中美Agent。美国三个:Anthropic的Claude Cowork、OpenAI的Codex、谷歌的Gemini Spark。中国五个:腾讯的Workbuddy、阿里的千问办公、字节的豆包、月之暗面的Kimi Work、MiniMax的Code。

考卷是五项任务,每一项对应企业里真实存在的一类活。

第一项,多文件检索。丢给Agent一堆文件,让它写一份金蝶软件2025年报的一页摘要,覆盖营收、增长、毛利率、净利润、2026年指引、AI进展。要求很严:每条事实必须标明来自哪个文件;不同文件数字打架,必须指出冲突、说明哪个更可信;不许悄悄把矛盾数字抹平。

第二项,自主联网研究。让它上网比较微软、Meta、谷歌三家最近季度的营收增速,以及2026年的资本开支指引。必须用一手来源,产出一张表,还要明确区分哪些是官方报的数字,哪些是自己估算的。

第三项,控制浏览器。让它用真实的桌面浏览器,从OpenAI官网一路点到新闻页,找出最新一篇文章,读完全文,生成一个Word文件,含标题、日期、分类、链接、150到200字摘要和三条要点。不许用API或爬虫抄近路,必须真的用浏览器点进去。

第四项,做PPT。给它一份文件,做5页英文PPT,要有故事线,第一页要用文件数据画图,不许编造数据。

第五项,生成营销海报。给它一张鞋的照片做参考,为虚构篮球鞋品牌做原创海报,去掉所有Nike、Jordan的logo,不抄商标口号,3:4竖版,适合发小红书。

这五项,从读文件、查资料、操作软件、做PPT到作图,几乎覆盖了企业里最常见的几类工作。

打分方式也讲究。每项任务拆成5个维度,维度跟着任务走,不是通用模板,每个维度0到20分,一项满分100,五项平均得出总分。

结果:模型最弱的,拿了第一

前三名分别是:千问办公95分,Claude Cowork 94分,Codex 92分。接下来依次是Kimi Work 86分,豆包77分、MiniMax Code 71分,Workbuddy和谷歌的Gemini Spark并列垫底,都是66分。

值得一提的是千问办公的“逆袭”。它背后的模型Qwen 3.8 Max,智能分只有56。而Claude Cowork背后是Claude Opus 5,61分;Codex背后是GPT-5.6 Sol,59分。模型差着五六分,Agent总分反而高出一两分。

这也说明,Harness优势,足以抵消模型智能的差距。

为了验证这一点,杰富瑞做了一个拆解:把Agent能力分成模型和Harness两块,给模型60%权重、Harness 40%权重,用Agent总分反推出每个产品的"隐含Harness分"。结果千问办公的Harness分最高,超过了美国的Claude Cowork和Codex。

实测还发现了一些中美Agent的能力差异。

第五项营销海报,是美国Agent的滑铁卢。Claude Cowork和Gemini Spark都在这里翻车,而千问办公和豆包这类中国Agent做得更好。

第二项控制浏览器,是中国Agent的弱点。Workbuddy和MiniMax Code在这里栽了跟头,美国三家的表现更稳。

速度上也有差异。美国那边,Gemini Spark最快,Codex次之,Claude Cowork最慢。中国这边,Workbuddy最快,豆包和MiniMax相当,Kimi Work和千问办公偏慢。另外,Claude Cowork的"品味"最好,PPT排版和配色最讲究,但这个归功于模型能力,跟Harness无关。

价格是另一重碾压。千问办公背后的Qwen 3.8 Max,API价格每百万token约1.1美元;GPT-5.6 Sol是4.4美元,Opus 5是3.9美元。

Workbuddy的错位

报告里另一个值得细看的对象,是腾讯的Workbuddy。

它的数据很漂亮:6月月访问量约2100万,中国同类Agent里排第一。但在这份实测里,Workbuddy的隐含Harness分,在中国Agent里垫底。

访问量第一,Harness垫底,这个错位怎么解释?

杰富瑞给了三个原因。

第一,Workbuddy深度嵌在腾讯自家的生态里,腾讯文档、IMA、企业微信,入口都在手上。

第二,它走的是模型无关的路线,用户可以在harness里随意切换Kimi K3、DeepSeek V4、GLM 5.2这些开源模型,用别人的强模型补自己的短板。

第三,腾讯的营销投入很猛。

这三条,跟Harness工程做得好不好,没有直接关系。

报告的判断是:短期看,Workbuddy赢在入口和分发;长期看,2100万的用户基础会沉淀出海量真实使用数据,这些数据反过来能帮腾讯改进Harness,甚至训练自己的模型。

在中国市场这个阶段,分发能力暂时跑在了Harness工程前面。但决定一个Agent最终能走多远的,还是Harness。

中国在Harness上有优势,也有绕不开的短板

报告把中国和美国的Harness打法做了个对比:中国在几个结构性的地方领先,但也有几块短板压着。

先说优势,四个。

超级App集成。美国Agent接工具,一般靠connector去连。中国不一样,很多Agent直接嵌在企微、飞书、钉钉这些平台里,数据、分发、变现一条线全打通。这是中国厂商独有的地基。

模型无关的Harness。腾讯Workbuddy、字节Trae走的都是这条路——harness自己不带模型,用户按任务的难度、延迟、成本随便切换Kimi K3、DeepSeek V4、GLM 5.2这些第三方模型。用别人的强模型,补自己的短板。

低token价格。出口管制逼着中国实验室走高效的MoE架构和推理优化,加上国内竞争卷得厉害,中国模型的token价格平均比美国低70%到80%。token便宜,那些消耗大量推理的agent工作流才跑得起,这也加快了企业采纳。

迭代速度快。Hrness的质量,是靠在真实场景里一次次失败试出来的。中国厂商用户量大、碰到的失败案例多,迭代反而更快。

再说短板,也有四个。

模型差距还在。 Harness-Bench的数据显示,强模型的平均分更高、跨Harness的方差更小;弱模型更依赖Harness。中国模型整体还落后美国,得靠更出色的Harness才能把Agent能力顶上去。

产品定价低。中国企业软件市场一向变现难,中小企业对价格敏感,大型央国企又偏爱定制项目、不太认订阅制。这拖累的不只是利润,还有持续投入Harness工程的动力。

出海难。Workbuddy、Qoder在国内用户涨得快,但要把这套成功复制到海外很难——中国Agent是为本地生态和用户习惯优化的,而美国的Harness受益于全球标准化的软件栈。

算力瓶颈。Agent工作流对推理算力的消耗,比普通对话高得多。中国厂商高端算力短缺,可能导致服务不稳定,也反过来限制变现能力。

Harness为什么越来越重要

最后再提一嘴Harness的价值,主要是三个方面:

粘性。模型能力越来越趋同,但harness不一样。客户的工作习惯、对话历史、记忆、连接器、技能、自动化,全都沉淀在harness里。用得越久,换走的成本越高。模型可以随时换,harness是换不掉的。

数据飞轮。每一次Agent运行,都会产生一条trace——调了什么工具、什么失败了、人怎么纠正的。这些数据能喂给下一代的强化学习,也能用来改进harness本身。用户越多,数据越多,Agent越好,用户更多。这是一个正循环。

付费意愿。报告点破了一件事:企业和消费者买的不是"智能",他们自己没有开发应用的能力。他们买的是"harness + 模型"打包好的完整Agent产品。这也是为什么Claude Code、Claude Cowork、Workbuddy这类产品用户增长快——客户为harness付钱,模型只是顺带。

而对于一家公司来说,AI落地的关键在工程层,不在模型层。真正的机会在"把harness做好"这件事上——管好指令、上下文、工具、边界、反馈、治理这六件事,比追最强的模型更可能做出落地的东西。

相关内容

小马智行(02026.HK...
小马智行(02026.HK):2026年第二季度收入总额同比增长6...
2026-08-18 20:50:13
3 个月亏掉 100 亿美...
文 | ForesightWeb3 刚刚结束的这个财报季,加密财...
2026-08-18 20:50:08
Piper Sandler...
Piper Sandler将PayPal的目标价从42美元上调至5...
2026-08-18 20:50:07
湖人出售再生变,耐克市值跌...
体坛经济观察◥ 整理:十进制 本文字数:4342字 建议阅读时间:...
2026-08-18 20:50:01
在岸人民币兑美元收盘报6....
8月18日消息,在岸人民币兑美元收盘报6.7427,较上一交易日下...
2026-08-18 20:50:00
Stifel上调家得宝目标...
Stifel将家得宝的目标价从320美元上调至340美元,维持“持...
2026-08-18 20:49:58
苹果首次承认监管变化拖累千...
截至2026年8月18日,苹果公司首次公开承认,监管变化迫使其对A...
2026-08-18 20:49:57
比特币重返64000美元上...
来源:环球市场播报 8月18日,比特币价格回升至64000美元以上...
2026-08-18 20:49:55
杰富瑞上调Snowflak...
杰富瑞将Snowflake的目标价从310美元上调至385美元,维...
2026-08-18 20:49:55

热门资讯

3 个月亏掉 100 亿美元,... 文 | ForesightWeb3 刚刚结束的这个财报季,加密财库公司(DAT)交出了一份看似惨烈...
摩根高盛扫货小盘科技!横盘92... 最近翻完二季度外资持仓,发现个挺有意思的变化:以前专盯千亿大白马、买行业龙头的摩根、高盛,居然扎堆往...
美国数据走弱推动加息预期回落,... 截至8月18日收盘,黄金板块个股分化,黄金ETF易方达(159934)收9.483元、微涨0.09%...
康华股份经销管控承压:库存占比... 来源|时代商业研究院 作者|赖钧洪、郑琳 编辑|郑琳 山东康华生物医疗科技股份有限公司(下称“康华股...
新能源车ETF平安(51570... 来源:界面新闻 截至2026年8月18日 09:57,中证新能源汽车产业指数(930997)成分股方...
基金的托管费包含哪些服务内容? 基金托管费是基金运作过程中的一项重要费用,它涵盖了多种服务内容,这些服务对于保障基金资产的安全、规范...
818理财节 | 西部证券:把... 2026年,券商818理财节迎来十年里程碑。这十年,818理财节从单一券商活动,演变为券业年度财富管...
Harness决定AI Age... 华尔街投行杰富瑞的分析师,最近给市面上八个主流中美AI Agent做了一场实测,看谁真正能把活干好。...
汇率避险赋能实体 携手企业共拓... 8 月 6 日,在国家外汇管理局温州市分局指导、温州市企业综合服务中心支持下,宁波银行温州分行成功举...