客户端通用Agent角逐,最看好腾讯的workbuddy、豆包工作
发布日期:2026-09-17
2026 年被行业称为"桌面 Agent 元年"。这一年,三家大厂把产品、组织和生态全推到了台面上:腾讯 WorkBuddy 在 3 月率先商用、9 月开放平台;阿里千问办公 8 月初把三款旧产品整合公测;字节豆包工作 8 月下旬发布,9 月中旬与飞书完成原生融合。它们争的不是模型分数,而是下一个工作入口。
这个赛道的产品我横着看了一遍。结论先放这里:三家我都能挑出短板,但如果只让选两个,我选腾讯 WorkBuddy 和字节豆包工作——前者赢在时间差与生态位置,后者赢在上下文的所有权。下面是理由,也包括我为什么没把起量更快的阿里千问办公放进前二。
一、先定义清楚:什么叫"客户端通用 Agent"
这个词现在被用得很松,随便一个能聊天的桌面软件都敢自称 Agent。但它和前两代 AI 产品有一条很硬的分界线,不是"聪明程度",而是执行权限。
这条线一划,很多"看起来很热"的产品就掉出去了。没有本地执行权限的,本质是聊天框套壳;只在 IDE 里干活的,是开发者工具而不是通用入口;而这两年被反复讨论的 RPA(流程自动化机器人),走的是另一条路——它播放预先录好的流程,界面一变就断,而 Agent 每步都重新看屏幕、重新决策。前者是"照单买菜",后者是"给个目标自己想办法"。
再往里拆,客户端通用 Agent 在工程上有两条明显不同的技术路线,这决定了后面所有能力差异:
一条是"连接器优先"。能用 API 或连接器解决的,绝不碰屏幕。Anthropic 在 Claude Code 里把优先级写得很直白:先 MCP Server,再命令行,然后 Chrome 扩展,最后才是屏幕控制。原因是效率差了一个数量级——一次接口调用就能拿到结果,屏幕操作要几十轮截图与点击。
另一条是"云电脑兜底"。本地算力不够、或者任务太长跑不完,就把任务丢到云端一台虚拟电脑上继续。字节豆包工作用的就是这个思路:任务耗时久可以调云电脑后台运行,本地设备关机任务也不中断,手机上还能远程接着推。这条路解决了"Agent 不能 7×24 干活"的硬伤,代价是成本与数据出域。
二、格局:三强贴身,第二梯队各据一角
把三家的时间线并排放在一起,会看出一个很明显的差别:腾讯早了整整五个月,阿里整合得最晚但起量最快,字节出手最晚却把组织问题先解决掉了。
第二梯队各有各的活法:金山办公把 WPS 的文档兼容与企业部署基础重新包装成组织级 AI 办公入口;360 在 7 月底推出企业智能体工作平台"纳米 Work";百度把内部办公智能体与"百度搭子"的团队整合成集中作战;网易有道在 WAIC 期间展示开源的桌面办公助手 LobsterAI;实在智能这类玩家则直接扎根在制造业、能源这些无 API 遗留系统的场景里,走的是重交付路线。
还有一个容易被忽略的背景数字:2026 年 6 月,国内主要桌面端 AI 办公智能体平台的月访问总量超过 6000 万次(易观),同期桌面端月活跃用户总量约 3000 万。企业侧的采纳率从 2024 年底的 17.3% 升到 2026 年中的 40.3%(沙丘智库)。盘子已经从"尝鲜"跨进"生产工具",这正是三强必须在 2026 年贴身肉搏的原因。
三、最看好腾讯 WorkBuddy:它想做的不是更强的工具,而是"操作系统"
腾讯云副总裁、CodeBuddy 与 WorkBuddy 负责人刘毅在 9 月 2 日开放平台发布会上说了一句很能代表这家公司野心的话:"我们希望把 WorkBuddy 打造成面向 Agent 时代的操作系统——不是做一个更强的工具,而是做一个能承载所有工具的平台。"
这句话不是场面话,它解释了 WorkBuddy 今年所有动作的逻辑:
第一,时间差摆在那里。1 月 19 日在腾讯内部开放体验,2 月 6 日开放内测申请,3 月 9 日正式上线——比阿里的整合产品公测早 5 个月,比豆包工作发布早 5 个半月。在 Agent 这种"用户习惯要靠时间养"的产品上,五个月的先手意味着它已经跨过了最难的冷启动。易观数据显示 6 月它以 2097 万月访问量居国内 AI 办公智能体首位;QuestMobile 的第三方估算则给出 7 月 PC 端月活 658.2 万(同期 QClaw 约 225.9 万,需注意这是估算而非官方披露)。
第二,它把"平台"这件事真的做了三层开放。9 月 2 日上线的开放平台,一次拿出了 Skill(技能)、Expert(专家)、Connector(连接器)三种能力形态,让开发者按标准协议接入;Skill 解决的是"会做什么",Connector 解决的是"能连什么",Expert 解决的是"按谁的方法做"——这三层正好对应长尾场景的三个缺口。同时它还兼容 OpenClaw 技能体系与 MCP 协议,等于在"自己的生态"之外,把外部的协议标准也接了进来。
第三,硬件与跨端的铺法最宽。发布会现场首发 9 款联名智能硬件(Rokid、影石、优篮子、科大讯飞、安克、猛玛、京东京造等),覆盖智能眼镜、录音卡片、麦克风、耳机、桌面陪伴设备、智能穿戴等十余个品类。眼镜端的麦克风与摄像头负责采集,WorkBuddy 负责理解、规划与执行,账号、任务、记忆与产物在眼镜、手机、PC、Web 之间同步。它也是首个上架鸿蒙电脑应用市场的桌面办公智能体(7 月 27 日)。
第四,"Ask / Plan / Craft"三模式是一个被低估的设计。Ask 只问答不操作,Plan 先规划后执行,Craft 直接执行——它把"信任"做成了可调档位,而不是让用户一次性把电脑交出去。配合沙盒隔离与高危指令拦截,这套组合对"第一次用 Agent 的人"心理门槛最低。而它靠 QQ、微信、企业微信、飞书、钉钉都能远程调度,跨端接力的路径已经通了。
四、最看好豆包工作:它的护城河是"上下文",不是模型
如果 WorkBuddy 赢在时间与生态位置,豆包工作赢在另一样东西——它知道你在什么公司、做什么事。
8 月 25 日发布的豆包工作,最大的差异化不是生成能力(写方案、做表格、画 PPT、生成图片视频网页应用,这些三强都有),而是与飞书的深度打通:用户用飞书账号登录后,在授权范围内直接继承企业权限,以及已经沉淀下来的聊天记录、文档、会议纪要、日程。产出还会回流到飞书,形成可复用的企业知识库。
这件事的分量在于:通用大模型能起草一份备忘录,但它不知道你们公司的财务口径是怎么算的、采购要过哪些审批。9 月 15 日发布会上,豆包工作产品负责人童遥演示的财务分析场景说得很清楚——豆包工作并不自己算完所有东西,而是调用企业已有的专业财务智能体按内部口径取数计算,再把结果交回来生成表格和分析材料。这不是"更强的模型",这是"更对的上下文+更顺的流程"。
9 月 15 日的飞书未来无限大会暨豆包工作开工大会,把这条路线推到了下一格:
- 飞书 8.0 完成"适 Agent 化改造":Agent 可以被拉进群聊、写文档、操作多维表格、安排日程待办、参与会议、查阅云盘与妙记、发起审批——人能在飞书里干的事,Agent 基本都能干。飞书 CLI 向 Agent 开放的功能点从 3 月的 247 个扩展到 767 个,公司演示中提到调用成功率接近 95%、调用速度提升约 39%。
- 权限与使用者严格一致:员工看不到的信息,Agent 也拿不到。
- 推出"豆包工作伙伴":拥有独立组织身份、独立权限与独立记忆,能像同事一样加入飞书群聊,企业统一配置其权限、能力与用量,全员与同一个智能体协作。目前处于与企业定向共创阶段。
- 组织上先解决了问题:两个月前把豆包、飞书、火山引擎整合到一起——豆包工作提供 AI 能力,飞书承载企业上下文与工具,火山引擎提供模型、算力与开发工具。字节 CEO 梁汝波的判断是"Agent 不是孤立存在的,需要和人、工作环境以及其他 Agent 协作"。
这套打法的效果已经有了初步印证:飞书 2026 年上半年 ARR 增速达到去年同期的 2.5 倍,创成立以来新高;中小企业客户总量过去一年增长约 70%;超过九成新增客户同步采购了 AI 产品——说明"协作平台 + Agent"的打包对客户是有吸引力的。
更值得注意的是"豆包工作伙伴"这个形态。它把 Agent 从"个人助手"变成"团队成员",这是权限模型上的一次跳跃:个人智能体只需要一个人的授权,团队智能体要处理的是"一个 Agent 在组织里的身份是什么"。国内目前只有字节把它做成了产品。量子位在报道里把它对标 Anthropic 的 Claude Tag,方向是一致的。
五、千问办公起量最快,为什么我没有把它排进前二
必须先承认事实:阿里千问办公的用户起量是三家最快的。8 月 3 日公测,9 月 4 日就宣布首月用户数突破 3000 万,企业用户占比过半,并且已经推出国际版、计划上线独立 App 端。这个速度比 WorkBuddy 和豆包工作都猛。
它的产品架构也是最"全"的:同时支持桌面端 Agent、云端 Agent、企业协同 Agent——桌面端来自 QoderWork(1 月 30 日发布),云端来自 MuleRun(服务范围覆盖 43 个国家、单月付费用户占比 34%),企业协同来自"悟空"(3 月发布)。7 月 2 日把三者整合成一款面向企业生产力场景的产品,由新任钉钉 CEO 陈宇森负责。它是唯一一个把"桌面、云端、企业协同"三类 Agent 一次性摆平的产品。
那为什么还是排在第三?三个原因,都是"时间"造成的:
一是整合完成得最晚。1 月就有了 QoderWork,但直到 8 月 3 日才把三款产品合并成"千问办公"对外公测。这意味着它的品牌认知、用户心智、开发者生态都起步最晚。3000 万这个数字里,有多少是从钉钉与原有产品导流过来的存量,有多少是新增,报告里没有拆开。用户数领先不等于产品完成度领先。
二是"钉钉既是资产也是约束"。钉钉给了它中国最厚的中小企业底盘(服务超 2000 万家企业及组织),但企业的信息、组织与权限都长在钉钉上,产品形态就容易被钉钉的边界框住。对比之下,WorkBuddy 是"谁的生态都接",豆包工作是"飞书原生",而千问办公更像"钉钉的一部分"。这三者的天花板不一样。
三是品牌与入口还在磨合期。推出国际版、计划独立 App 端,都说明它自己也知道"必须脱离钉钉的壳才能长大"。但这一步到目前为止还是计划,不是既成事实。
如果它明年把独立 App 做起来、并且把"组织级 Skill"的复用真正跑通——让一个部门沉淀的流程能被别的部门直接调用——那它会重新回到牌桌中央。我把它排在第三,不是说它弱,是说它现在还在整合期,而前两家已经在跑第二局了。
| 维度 | 腾讯 WorkBuddy | 阿里 千问办公 | 字节 豆包工作 |
|---|---|---|---|
| 正式对外 | 2026-03-09 上线商用 | 2026-08-03 公测(三产品合一) | 2026-08-25 正式发布 |
| 端覆盖 | Win / macOS / 鸿蒙电脑 + App + 小程序 | Win / macOS / HarmonyOS + 网页 + 钉钉内置 | 豆包电脑客户端 + 官网独立版 |
| 上下文来源 | 本地文件为主,靠 QQ / 微信 / 企业微信 / 飞书 / 钉钉远程调度 | 钉钉:群聊、考勤、审批、会议、文档表单 | 飞书:聊天、文档、会议纪要、日程(继承企业权限) |
| 执行方式 | 本地执行;Ask / Plan / Craft 三模式,沙盒隔离 + 高危指令拦截 | 桌面 Agent + 云端 Agent + 企业协同 Agent 三类并存 | 本地操作 + 云电脑后台续跑 + 手机远程操控 |
| 生态开放 | 开放平台三层:Skill / Expert / Connector,首批 100+ 伙伴,9 款联名硬件 | 工作流可保存为可复用的"组织级 Skill" | 技能 / 连接器 / 工作伙伴,支持多 Agent 工作小队 |
| 公开规模数据 | 易观 6 月月访问 2097 万居首;QuestMobile 估算 7 月 PC 月活 658.2 万 | 9 月 4 日称首月用户破 3000 万,企业占比过半 | 飞书侧:上半年 ARR 增速为去年同期 2.5 倍 |
注:三家的规模数字来源与统计口径不同(易观为月访问量、QuestMobile 为月活跃设备、阿里为注册用户口径),不宜直接横向相减;QuestMobile 数据为第三方估算,非厂商官方披露。
六、胜负手其实只有四个变量,和模型能力关系不大
把三家摆在一起看久了会发现一件反直觉的事:决定它们排位的,几乎都不是模型能力。因为它们背后都能换模型——千问办公已经同时接入 Qwen3.8-Max、GLM-5.3、DeepSeek V4 Pro 三款国产旗舰,WorkBuddy 内置多模型切换,豆包工作背后是整个火山引擎。模型是水电,不是护城河。
第一是上下文的所有权。这是豆包工作最强的一项,也是飞书真正值钱的地方。企业要的不是"更聪明的模型",而是"知道我们公司怎么回事的助手"。
第二是权限与安全。这一项最容易在选型时被忽略,但在企业里是一票否决项。Agent 能读什么、能改什么、能替谁发消息、能不能触发审批,全部取决于权限模型。飞书的选择是"Agent 权限永远等于使用者权限",WorkBuddy 的选择是"三档信任模式 + 沙盒 + 高危拦截",两种解法都在回答同一个问题:怎么让企业敢把流程交出去。豆包工作还叠加了设备接入、额度管理、数据加密、操作审计的全链路防护,并把个人与企业数据做了物理隔离。
第三是生态开放度。企业的长尾系统无穷多,没有哪家厂商能全做完。WorkBuddy 在这项上是目前最激进的——它把自己的能力拆成 Skill、Expert、Connector 三种形态开放出去,甚至喊出"做承载所有工具的平台"。这等于承认"我干不完,所以让所有人来干",短期内生态扩张最快,长期风险是质量与安全难以完全管控。
第四是跨端连续性。Agent 的任务往往是长任务,人不可能一直守在电脑前。豆包工作的"云电脑续跑 + 手机远程"和 WorkBuddy 的"多 IM 远程调度 + 硬件跨端同步"都在解决它。这一项看起来是体验问题,实际上决定了 Agent 能否从"你盯着它干活"变成"它自己干活"。
顺手说一个海外的对照,因为路线差异比国内更醒目:
| 产品 | 是否在本机执行 | 上下文与工具路径 | 值得注意的一点 |
|---|---|---|---|
| Claude Desktop(Cowork) | 是,在沙盒虚拟机里跑独立环境 | 连接器优先:MCP Server → 命令行 → Chrome 扩展 → 最后才接管屏幕 | 9 月 1 日起远程会话进入 beta,笔记本休眠后任务继续 |
| ChatGPT(Windows 版) | 否,重活放在 OpenAI 云端 | Codex、Work agents、Data agent(9 月 10 日起可连 Snowflake、BigQuery 等) | 生态最全,但桌面端更像入口而非本地执行器 |
| Gemini for Windows | 浏览器自动化为主 | 与 Google 生态深度绑定,Computer Use 内置于模型 | 浏览器自动浏览功能目前仅限美国及 AI Pro / Ultra 订阅 |
海外三家的分野恰好印证了前面那条技术路线之争:Anthropic 把"在本机真干活"做成了产品本身,OpenAI 把桌面端做成了云能力的入口。国内三强目前都选择了偏"本机执行"的路线,但在云电脑兜底上,字节走得最远。这不是巧合——国内用户的电脑普遍更弱、任务更碎,本地执行反而是更现实的选择。
七、看好的同时,必须说清楚风险
只讲优点不是分析,是站队。三家的风险都很实在:
第一,Agent 越能干,权限风险越大。当它能读你的群聊、会议纪要和云盘,还能操作浏览器与本地软件时,一次越权或提示注入的代价远高于一个聊天机器人。7 月就有安全团队披露过针对微软 Copilot 的"CoSnitch"类漏洞,一次点击即可窃取邮件与云端数据——这不是某一家的问题,是整个赛道共同面对的门槛。企业侧的"操作审计"和"权限隔离"能不能真的落地,比发布会上的能力演示重要得多。
第二,"能演示"和"能天天用"之间差距很大。飞书自己披露的 Agent 接口调用成功率接近 95%——这个数字在演示场景里是优秀的,但放在每天上百次的真实流程里,意味着每天仍有若干次需要人工兜底。企业的容忍度取决于任务类型:写周报可以重来,改生产代码不行。
第三,云电脑的后台成本会变成一个新变量。任务跑到云端就意味着持续计费,长任务越多、账单越难预测。WorkBuddy 已经在 4 月公告过计费方案调整(5 月 15 日起执行新方案),说明这个赛道的补贴期不会无限长。
第四,团队智能体是全新命题,还没有大规模验证。"豆包工作伙伴"让一个 Agent 以独立身份进入组织,要处理的是"它代表谁、它的权限谁来审、它记错了东西怎么办"。国内目前只有字节走到这一步,也意味着没有前人踩过的坑可以参照。它现在处于定向共创阶段,正式铺开后的组织摩擦值得盯。
第五,规模数字的口径很不统一。易观算月访问量、QuestMobile 算月活跃设备、阿里报的是用户数,三个数字不能直接比较。看到"某某第一"时,先看它说的是哪个口径。
结语
回到标题。我为什么更看好腾讯 WorkBuddy 和字节豆包工作,一句话:它们各自握住了一个别人短期补不上的东西。
WorkBuddy 握的是时间和生态位——比对手早五个月商用,把跨端和硬件铺得最宽,并且明确选择做"承载所有工具的平台"而不是"更强的工具"。这条路一旦成立,它的天花板是操作系统,而不是一个应用。
豆包工作握的是上下文的所有权——飞书里的聊天、文档、会议纪要、日程是企业真实工作的沉淀,Agent 继承这份上下文后,输出才可能真正可用。而且它把 Agent 从个人助手推进到了团队成员的形态,这是权限模型上的一次跳跃。
阿里千问办公不是不强,它是三家架构最全、用户起量最快的一个,但三产品整合到 8 月才完成,品牌与入口还在磨合期。它是这三家里最有可能在明年翻盘的一个,也是最需要再观察半年的一个。
最后说一个判断:这场角逐的终局,大概率不是"谁家的 Agent 更聪明"。模型会趋同、价格会趋同、能力清单会互相抄完。真正拉开差距的,是谁拿到了可信的上下文、谁通过了企业的安全审查、谁的工具生态接得够长尾、谁的任务能跨设备不断线。这四件事,都不在模型里。
资料来源:腾讯 WorkBuddy 开放平台发布报道(央广网、中证网,2026-09-02)、WorkBuddy 产品文档与官方资料、字节跳动豆包工作发布报道(上海证券报、广州日报大洋网、信息时报,2026-08-25)、2026 飞书未来无限大会暨豆包工作开工大会报道(北京商报、量子位、时代周报、Pandaily,2026-09-15)、阿里巴巴千问办公产品沿革与公测信息(公开资料梳理)、易观分析桌面端 AI 办公智能体月访问数据(2026-06)、QuestMobile 第三方估算(2026-07)、艾媒咨询与科智咨询中国 AI 智能体市场规模数据、沙丘智库企业 AI Agent 采纳率调研、Anthropic / OpenAI / Google 官方产品资料与公开技术文档(Claude Cowork、ChatGPT Windows 版、Gemini for Windows,2026)。
本文为公开信息梳理与技术讨论,不构成任何投资建议。文中产品数据来自厂商发布与第三方机构口径,各家统计定义不同、不可直接横向比较,引用请以官方披露与一手报道为准。