IDC发布《中国企业级通用Agent产品技术评估》:腾讯WorkBuddy 7.30分居首,中国电信TeleAgent跻身前三
IDC 于 2026 年 9 月发布《中国企业级通用Agent产品技术评估》(Doc# CHC54893926)。报告在统一仿真环境中对国内主流通用智能体产品开展实测,覆盖任务表现、成本效率、交互体验、多智能体编排、记忆与工作空间、可观测、安全可控、工具与技能、生态与开放性九个维度。
一场统一环境的实测,而非厂商自证
报告由 IDC 中国研究经理孙振亚主笔,共 42 页,含 8 张表、15 张图。与常见的厂商白皮书不同,本次评估采用统一环境、统一工具、统一模型配置的实测方式:IDC 自建 MCP 仿真服务器,向所有参评产品提供相同的 390 封邮件、300 条企业知识、300 位联系人以及数十家 CRM 客户数据。所有产品使用相同题面、附件与预置条件,不做提示词优化,执行失败后也不追加人工指令——考察的是开箱默认状态下的真实水平。
评测集由近百道自建任务构成:个人助理能力占 32.4%,信息与数据处理占 27%,跨系统与跨应用任务执行占 27%,安全与可控能力占 13.5%。其中复杂任务占 41.9%,包含 3,755 行脏数据的表格清洗、10 万字长文档信息抽取,以及需在同一会话内连续执行近百次操作的长链路任务。实测中最长的单个任务运行超过 5 小时,被拆分为约 92 个子任务。评分采用完全通过率占 80%、部分通过率占 20% 的加权口径,越权读取、未脱敏输出等红线问题会被单独记录。
综合得分:腾讯 WorkBuddy 居首,中国电信 TeleAgent 位列前三
综合得分将常规任务与复杂任务合并计算,两者满分各 5 分,合计 10 分。根据已公开的信息,排名为:
腾讯 WorkBuddy — 7.30
百度搭子 — 7.10
中国电信 TeleAgent — 6.85
字节 TraeWork — 6.74
商汤小浣熊 — 6.68
360 纳米Work — 6.34
DataClaw — 6.33
OpenClaw — 5.95
DeepWorks — 5.77
超级麦吉 — 5.65
来也 Laiye Worker — 5.56

一个值得注意的方法论细节是:参评产品统一使用 DeepSeek v4 Pro 执行任务,唯中国电信 TeleAgent 因不支持切换或配置指定模型,按自家星辰大模型的默认旗舰模式运行。
官方目录实际收录 12 款产品
IDC 官方公开目录中,「主要厂商评估结果」章节实际列出了 12 款产品的逐一点评,比媒体流传的 11 款榜单多出一款「得小帆 Dolphin Agent」。官方列示的覆盖企业为 12 家,包括腾讯、百度、中国电信、字节跳动、商汤、360、来也以及 OpenClaw Foundation。报告的关键数据集中在一张表——「各产品常规任务、复杂任务与综合得分」,这也是九维度分项得分的出处。
报告给出的核心判断
IDC 在「市场综述」章节列出十余条结论,其中几条值得关注:
Agent Harness 能力决定了各家产品的任务表现情况——报告把架构差异而非底座模型能力,列为产品表现分化的根因;
当前产品均已具备日常办公任务和部分复杂任务的完成能力,但常规任务与复杂任务表现各有差异;
循环策略已被用于异常排查和任务恢复,多数产品已能连接企业系统并完成相关操作;
多 Agent 编排已成为处理复杂任务的关键能力,多数产品已支持跨会话和项目级记忆;
产品安全防护覆盖面持续扩大,但成熟度仍有差异;
积分已成为多数产品的成本计量方式,但 Token 观测仍需保留。
需求侧:近半企业已进入选型阶段
IDC 在 2026 年 4 月的企业用户调研显示,已有 48.5% 的企业处于通用 Agent 的评估、试点或使用阶段,其中 19.5% 已试点或使用,29.0% 正在评估。96.9% 的企业 Agent 应用涉及办公自动化。分行业看,互联网行业 83.3% 的企业已进入评估及以上阶段,金融业 63.3%,电信行业 55.0%。
企业采购时的顾虑集中在三点:59.8% 担心越权与误操作风险控制不足,50.5% 担心操作审计与证据留存机制不完善,40.2% 担心幻觉或不稳定导致错误执行。另有 53.6% 的企业把「跨系统完成端到端任务」列为评估通用 Agent 的首要驱动因素。
IDC 点出的四大演进趋势
通用 Agent 将成为企业任务入口之一——员工不必再逐一打开办公软件或登录业务系统;
按任务动态组合的 Agent Harness 将逐步出现——模型、工具、沙箱、执行循环全面组件化,简单任务轻装上阵,复杂长链任务才启用完整状态管理与多 Agent 协作;
Agent 将以独立身份在受控执行环境中运行——不再继承用户权限,而是拥有独立身份与临时凭证,高风险操作进入沙箱、虚拟桌面或容器执行,配套日志审计、权限回收与回滚机制;
企业级观测与运维将成为规模化部署的基础——任务追踪、成本归因、故障定位、自动告警等能力,决定 Agent 能否从试点走进核心业务流程。
孙振亚判断,未来 6 到 12 个月,市场竞争将主要集中在企业级场景能力、复杂任务交付、企业系统连接和组织级治理四个方面。
报告获取与后续研究
该报告面向技术供应商销售,属付费订阅内容,公开渠道仅提供摘要与目录结构。IDC 已预告将于 2026 年第四季度开展新一轮《中国企业级通用Agent产品技术评估(26Q4)》,覆盖 XClaw、XWork 等产品,从任务、连接与治理三个方面核验产品能力。
需要提示的是,本轮媒体解读高度集中于中国电信 TeleAgent「跻身第一梯队」的传播叙事,其中「成本效率、安全可控显著高于行业普遍水平」等定性结论目前为单一信源,建议以报告原文为准。