央企做了个通用Agent,直接杀进IDC实测前三!

栏目:科技 | 来源:量子位 | 2026-09-17 17:32

金磊 发自 凹非寺
量子位 | 公众号 QbitAI

起猛了,央企做的企业级通用Agent,排进了国内前三!

这便是IDC在最新发布的国内首份《中国企业级通用Agent产品技术评估》给出的结果:

而这家央企,便是中国电信

并且这次IDC没有继续沿用大家熟悉的大模型Benchmark,而是拿近百道非公开任务,直接考察一款Agent在真实办公环境里到底能不能把事情做完。

具体来看,TeleAgent常规任务得分3.49分、复杂任务得分3.36分;九项能力中,任务表现拿到5分满分,成本效率为此次测评最高分。

而且TeleAgent正式上线的时间还不算久,今年4月,TeleAgent桌面端还在公司内部试用。到7月,V1.0才正式对外推出。短短一个多月,如今用户规模已经接近120万。

那么问题来了:

一家央企做出来的通用Agent,为什么能在这一轮竞争里跑得这么快?

近百道题考Agent,中国电信跑进前三

在深挖TeleAgent如何拿下第三名之前,我们且得先需要了解一下IDC这次到底考了什么。

以前我们熟知的Benchmark,更多是倾向于把问题简化成一组分数;数学、代码、推理、知识,一项项跑完以后,就能大致判断模型能力处在哪个位置。

但要考验通用Agent的能力,评测的打法就不一样了;毕竟它面对的是公司内部纷繁复杂的业务。

也正因如此,IDC这次把测试的重点放在了端到端把事情办完上。

按照IDC的定义,企业级通用Agent需要能够理解目标、调用工具和Skill、连接企业知识和业务系统,并且持续执行任务。

围绕这个目标,IDC设计了将近百道非公开任务,既包括邮件、日程、文档处理这类日常办公,也加入了长上下文、多步骤循环、复杂PPT、表格处理和浏览器操作等复杂任务。

其中有些题目已经很接近真实工作,比如Agent要处理3755行脏数据,或者从约3万字材料中提炼内容,生成11页PPT。

任务跑完还不算结束,IDC还会继续核验系统状态和最终文件,确认Agent是否真的完成了任务。

而从测试结果来看,现在大多数通用Agent已经能把复杂任务跑起来,但随着任务变长、步骤变多,交付质量和资源消耗的差距也会随之放大。

也正是在这套考法下,TeleAgent的任务表现拿到满分,同时又把成本效率做到此次评测最高。

随着任务复杂度、上下文长度和工具调用次数不断增加,各家产品之间的成本和交付差异也同步放大。

这说明通用Agent发展到现在,底层模型已经很难解释全部差距;一款Agent最后好不好用,越来越取决于模型外围那整套工程系统。

一个Agent能否干好活,模型只是一部分

IDC在这次报告里还专门提到了一个词——Agent Harness。我们可以把它简单理解成围绕大模型搭起来的一整套执行系统。

模型负责理解和推理,但一个复杂任务真正开始运行以后,系统还要安排上下文、调度工具、保存任务状态、控制执行环境。中途一旦出现异常,它还得判断是重试、换路径,还是恢复之前的进度。最后结果生成出来以后,系统还要检查任务到底有没有完成。

这些能力在短任务里不一定明显,可任务一旦拉长,差距就会被迅速放大。TeleAgent这次拿到的几个高分项,也基本可以从这条工程链路往下拆。

首先是上下文。

Agent工作时间越长,打开的文件、调用工具返回的结果、前面聊过的内容都会不断塞进上下文。如果系统一直往里堆,Token很快就会膨胀;可如果压缩得太狠,Agent又可能把用户一开始交代的要求一起忘掉。

TeleAgent为此做了一套分级处理。系统会先对价值相对较低的旧工具输出做轻量剪枝,如果上下文依然过长,再由专门的压缩模型对整段内容进行处理。同时,系统还会实时监测上下文是否接近上限,一旦触发窗口限制,就先自动压缩,再继续执行后续任务。目前TeleAgent的上下文窗口已经突破400K。

但仅仅让一次长任务不断线还不够,因为企业办公经常会跨天甚至跨项目。所以TeleAgent又加上了autoDream长期记忆

它会定期整理近期对话,再把新的信息与已有记忆合并。如此一来,项目背景、用户习惯和个人偏好可以跨会话继续保留,用户第二天重新打开时,不需要每次从头解释自己在做什么。

而在更底层,中国电信并没有直接把一个现成的Coding Agent框架套进办公场景。

TeleAgent的核心内核包含约3万行自研Go代码,团队还专门处理了Windows PowerShell、麒麟、统信等系统里的兼容性问题。与此同时,产品侧也针对办公任务重新做了适配,因为做PPT、写报告、处理Excel,和在代码仓库里找Bug,本来就是两套截然不同的工作方式。

解决完长任务能不能跑下去,下一件事就变成了这么跑到底贵不贵。这也是企业使用Agent时很难绕开的账。

TeleAgent为此又做了一套ModelRouter

每次请求进来以后,系统会先根据模态、长度、关键词等信息判断任务复杂度,再把任务分配到轻量、均衡和旗舰三档模型。像翻译、总结、格式化这类任务,会优先交给轻量模型;到了PPT、文档生成和办公自动化,系统会进入均衡档;如果用户要做深度研究、代码调试或者复杂方案,再调动旗舰模型。

这样一来,Agent不用每处理一个简单任务都调用最重的模型。

从优化的数据来看,这套智能路由可以把推理成本降低约40%,简单任务响应时间可以控制在3-5秒,路由延迟低于10ms。与此同时,TeleAgent还在推理侧加入了PD分离、KV Cache和负载感知调度等优化。

这也就不难理解,为什么TeleAgent这次在IDC的成本效率维度拿到了最高分。

但企业真的要把Agent接进内部系统,还得再解决一个问题,也就是安全

当Agent只负责生成一段文字时,出错以后最多重新生成一次。可现在的Agent开始能够操作文件、调用系统、修改数据,甚至代替员工执行一些业务流程,一次错误操作带来的影响明显更大。

而TeleAgent从一开始就把这部分看得比较重。Skill进入系统以前需要检查来源、病毒和漏洞;短期记忆与长期记忆分别管理;文件读写被限制在指定工作目录;高危命令会被监控,代码和文件操作则尽可能放在隔离环境中完成。

当然,这套思路也直接影响了TeleAgent的上线节奏。今年4月,桌面端其实已经进入内部试用,但TeleAgent随后又花了两个月做安全测试和能力优化,直到7月才正式推出。

对于一款追求快速增长的互联网产品来说,这样的节奏可能显得保守;放到央企内部,这反而成了产品必须先过的一道门槛。

也正因如此,TeleAgent成为首批通过中国信通院相关安全评测的智能体产品之一;在中国电信研究院内部安全评测中,通过率达到98.2%;与外部安全厂商联合进行的28个场景、336个测试用例里,通过率达到99.7%。

我们再把这些能力放到一起来看,便不难发现,TeleAgent这次的几个高分项其实是连起来的:

上下文管理和Harness工程决定任务能不能持续往下跑;模型路由和推理优化决定同样一个任务需要花多少钱;安全和权限控制则决定企业敢不敢真的把系统交给Agent操作。

而这三件事,恰好也是通用Agent从Demo走向企业日常办公以后,越来越绕不开的问题。

央企也开始用互联网打法做AI产品了

不过有一说一,如果只看今年这轮Agent热潮,或许很多人会以为TeleAgent也是看到风口以后快速追出来的产品。

但若是我们把时间线再拉长一些,就会不难发现,中国电信对智能体的投入其实已然是有一段时间了。

2024年底,中国电信已经开始建设星辰智能体平台;2025年4月,这个平台被确定为集团智能体基础设施。到了同年8月,团队又推出星辰超级智能体网页版,开始尝试自主式Agent。此后,随着Coding Agent开始从写代码往通用办公延伸,团队又把Coding增强、Skill和桌面环境逐渐接了进来。

等到2026年4月TeleAgent桌面端进入内部试用时,前面已经积累了一年多的平台、技术和产品经验。

而且,TeleAgent虽然生长在央企内部,做产品的方式却带着很明显的互联网色彩。

中电信人工智能公司目前有1200多人,其中九成以上来自社会化招聘,团队里也吸收了不少来自头部互联网公司和AI企业的研发人才,整体平均年龄只有30岁出头。

在具体的产品团队里,公司又给核心骨干留出了较大的自主招聘和技术探索空间。产品方向尚未完全确定时,团队可以先通过试错把体验做出来;公司内部对早期产品的要求,也没有急着先算收入,而是希望产品先获得用户口碑。

除此之外,其组织方式也跟着发生了一定的变化。过去大型央企内部做一个跨部门产品,很容易陷进多部门、多公司的长协同链条。到了TeleAgent这里,团队把资源决策尽量集中起来,让熟悉电信业务的人和有互联网产品经验的人直接在一线配合。

另一方面,中国电信原本的组织体量,又给这支团队提供了互联网创业公司很难拥有的试验环境。

TeleAgent上线早期,产品先在集团内部大规模使用。中国电信拥有大量员工,内部又分布着办公、网络、政企、云、号卡、宽带等各种业务,这意味着Agent每天碰到的都是真实需求,而不是为了演示效果提前设计好的任务。

比如中国电信内部的Skill广场,目前已经累计上架5.6万个技能,被添加近200万次,参与开发和贡献Skill的员工也达到2万人。

员工自己造出来的东西,也很接地气。有人围绕宽带、号卡这些主营业务制作Skill,有人用Agent生成符合内部格式的PPT,还有一线员工直接把Agent拿去做摄像头巡检和电表识别。原本这些小工具可能需要走立项和开发流程,现在一些需求开始由业务人员自己完成。

这些使用场景反过来又会继续喂给产品团队。因此,中国电信内部既成了TeleAgent早期最大的用户池,也成了一个相当复杂的企业Agent测试场。产品得同时面对普通员工、专业业务、系统权限和真实数据,这些问题如果在内部都跑不顺,后面面向外部企业就更难谈规模化。

而现在,整个企业市场也正在走到这个阶段。IDC今年4月的调研显示,已经有48.5%的企业进入通用Agent评估、试点或使用阶段。与此同时,96.9%的企业Agent应用都涉及办公自动化,流程自动化、知识管理和数据分析等场景也排在前列。

到这里,中国电信做Agent的特殊性也逐渐显出来了。

它手里原本就有云、算力、安全、政企客户和大量复杂业务场景,现在又开始把互联网公司做产品时常见的快速迭代、用户反馈和成本优化方法吸收进来。

而企业Agent接下来要解决的,恰好需要这两套能力同时发挥作用。

总而言之,中国电信这次进入IDC发布的评测的前三,其实也是再次印证了一点——

中国电信,已经不是你印象中的运营商;已经是Full of AI的那种。

下载地址:

https://www.teleai.com.cn/product/teleagent

了解更多

猜你想看

← 返回首页