刚刚,百度文心又拿第一了!完全免费

栏目:互联网 | 来源:新智元 | 2026-08-05 16:25

新智元报道

不到二十天,拿下两个「第一」!

一个在国内,一个在全球。

百度文心助手,又一次开启了霸榜模式。

SuperCLUE最新一期XClaw「龙虾」测评战况出炉。在十大国产「龙虾」的同台厮杀中,唯有文心助手一举斩获了97.62最高分。

细看这份成绩单,单凭「记忆」这一项核心能力,文心助手直接斩获100分。

数据处理98.86分位列第一,内容创作99.44分,研究分析96.44分。

而就在7月20日,它在权威PinchBench v2榜单上,拿下了94.6%的亮眼成绩,问鼎世界第一。

更绝的是,拿下两个「硬核第一」的顶尖产品,至今免费,不限量。

这波「免费称王」的降维打击,算是被文心助手彻底拿捏了。

文心助手,又拿第一了

熟悉业内风向的人都知道,SuperCLUE 一直是中文大模型能力的「晴雨表」。

而XClaw,正是它为「龙虾」产品设下的核心基准。

实战评测分为五大维度:数据处理、内容创作、记忆、代码、研究分析,进行自主命题。

最关键的评测逻辑就一条——不要选择题,只看交付题。

这意味着,模型必须严格按照指令给出最终成果,没有任何取巧空间。

回头再看文心助手那份成绩单,最值得说的,是记忆能力那个100分。

记忆,是所有AI「干活能力」的地基。

用过「龙虾」的人应该都有体感,你跟AI聊了三轮,第四轮它忘了你第一轮说的条件,那叫一个崩溃。

Agent帮你干活,记不住你之前的要求,等于白干。所以这个满分的「含金量」,懂的都懂。

在最硬核的「数据处理」领域,它以98.86分毫无悬念位列榜首。

这一项,考的是信息的提纯力:精准拿捏表格字段逻辑,零失误搞定跨表汇总,严守精度底线,绝不自作主张乱凑整数。

这种活儿的特点就是,「错一个数,全盘皆输」,容错率无限趋近于0。

实测中,随手丢一份公司资料给文心,让它「写一份2026年Q2商业计划书,生成Word」。

它先用pandoc提取上传文件内容,做了结构化拆解,再调用Word文档处理技能生成格式化文档。

交回来的是一份6000余字、148段的完整BP,从格式到内容全部交付到位,直接能拿去见投资人。


内容创作99.44 分,说明文心交出来的是,按给的格式、语气、字数要求,直接可以拿去用的成品。

让文心写去代码。一句「帮我制作一个3D太阳系模拟器,科技风,要能看到各个行星和运行轨迹、详细介绍等」——

它加载了交互式分析报告技能,用Three.js起手,一个31KB的单文件HTML交回来。


再比如,文心还能直出一个气象模拟教学网页,直接把一整个章节的地理课装进去了。


研究分析拿下96.44分,考的是多源信息的检索、交叉验证与结构化输出,正好是最熟悉的战场。

就以最近热议的「菲尔兹奖得主」王虹为例,我们让文心去做一个「三维挂谷猜想」的研究。

它并没有盲目输出,先是自己规划了6步研究流程,然后调用多个子智能体并行处理任务,搜索16篇学术资料。

最终,我们得到了一份markdown文档,还有一个62KB的交互式HTML,可以直接在浏览器里翻阅这段百年数学史。


接下来,让文心挑战一个更难的:做一个近一个月国内外比较强的大模型的能力分析和价格分析报告。

拿到需求,它直接动手。先加载「行业研究报告」Skill,接着分两轮搜索了45篇网络资料。

然后是交叉验证:部分核心数据存疑,它又自己补了一轮29篇的定向搜索,把价格数据逐条比对。

验证通过后,才开始动笔。

不一会儿的功夫,一份近7000字逻辑缜密、内嵌可视化图表的报告,跃然屏上。

从「Claude Fable 5输出¥340/百万Token」到「DeepSeek V4-Flash输出¥2/百万Token,缓存命中低至 ¥0.01」,国内外旗舰价差高达30-170倍。

这种级别的多源检索、数据提纯和结构化输出,正是研究分析96.44分的底气。




59个模型里,杀出全球第一

XClaw验证了文心在中文主场的绝对统治力,而PinchBench v2证明的是另一件事——

文心助手在国际竞技场中,同样能打。

由Kilo AI独立操刀的PinchBench,同样只看能不能把活儿干漂亮。

也就是,Agent必须端到端跑通全流程,并交出完全闭环和可验证的结果。

整整59个同台角逐,文心助手任务Agent最终斩获第一,最高分94.6%、平均分94.4%。

在它身后,是GPT-5.6-luna、Claude Opus 4.8-fast、Nemotron-3 Ultra等一众国际顶流玩家。

PinchBench全球排行榜

94.6%和94.4%这0.2个百分点的差距意味着,文心助手任务Agent在每一次运行中,都能保持的极致稳定。

值得一提的是,它还在工具调用、多步任务规划、长程执行上的表现尤为抢眼。

别忘了,文心助手还是免费的。

眼下,整个行业都在为Agent狂飙的Token算力成本焦头烂额。

但在这种关口,百度却直接把这套全球顶配的任务执行力,原封不动地塞进了百度App,且不设任何付费墙

你不需要先想清楚「我一个月能用回本吗」,才决定要不要试。

打开就能用,这是它和很多同类产品最实际的区别。

让AI真正为人做事

2026年,大模型集体转型Agent早已不是新闻了。

过去三年,衡量一个AI好不好用的标准是「它答得对不对」。用户打开对话框,问一句,答一句,剩下的事还是自己干。

今年初,OpenClaw的爆火,让整个行业的思路彻底打开了。

大模型「长出手脚」,能读文件、能调工具、能跨会话记住你,能通过聊天软件7x24h接活。

几乎同一时间,科技大厂都在把AI从「答题」往「干活」的方向推。

动作密集到,几乎以周更来计算。

最典型的案例,OpenAI发布GPT-5.6「全家桶」,同天上线ChatGPT Work。Anthropic火了整个上半年的Claude Cowork,再到手机版Dispatch。

不仅如此,谷歌I/O大会,劈柴亮出Agentic Gemini,直言AI的下一站是会行动的智能体。

国内这边,动静只多不少。不同的公司、不同的入口、不同的名字,指向的是同一件事:

衡量一个AI好不好,标准正在从「答得对不对」换成「事办没办成」。

但从「能做」到「做成」,这中间的鸿沟远比想象中更深。

因此,当第三方榜单下场评估时,分数的意义便超越了数字本身。它回答的是一个极为朴素的问题——把任务交给AI,到底能不能放心交差。



做了26年搜索

悄悄练成了Agent的骨架

为什么百度能做到?底子在那里摆着。

文心助手的底层能力,很大一部分来自百度做了二十多年搜索引擎攒下的技术底子。

搜索引擎和Agent,在技术结构上高度同构。

搜索引擎的流程:用户输入query,系统理解意图,分解成检索任务,调用索引系统检索,结果排序整合,返回给用户。

Agent的流程几乎一样:用户输入任务,系统理解意图,分解成子任务,调用工具执行,结果整合,返回给用户。

Query理解对应任务理解,检索对应工具调用,结果排序对应结果整合。

搜索引擎做了二十年的事情,本质上是Agent的一个特化版本——

搜索的「工具」只有索引系统,Agent的工具是开放的。

因此,百度在搜索引擎上积累的能力,可以直接平移到Agent场景。

举个直观点的例子。

用户在搜索框输入「北京到上海最便宜的机票」,搜索引擎要理解这是比价需求,拆解成出发地、目的地、日期、价格排序几个维度,调用航班数据接口,按价格排序返回。这和Agent接收「帮我查北京到上海最便宜的机票」后的处理流程,几乎没区别。

文心助手在记忆能力和研究分析两个维度上提升最明显,和搜索底蕴直接相关。

记忆能力测的是多轮对话中的上下文保持,和搜索引擎的session理解是同一类问题。研究分析测的是自主检索、整合、出报告,几乎就是搜索引擎的高级形态。

其实底子一直在,需要的是找到从搜索到Agent的转化路径。

这波转化,百度做到了。

https://superclueai.com/xclawpage?category=openclaw&name=SuperCLUE-XClaw%E9%BE%99%E8%99%BE%E4%BA%A7%E5%93%81%E6%B5%8B%E8%AF%84&folder=XClaw&date_if_exists=2026%E5%B9%B48%E6%9C%88

编辑:桃子 好困

了解更多

猜你想看

← 返回首页