出品 | 网易智能
作者 | 小爪
编辑 | 王凤枝
模型越强,排行榜反而越难告诉我们该选哪个。
7月19日,月之暗面的Kimi K3登上Arena网页前端开发榜首,得分约1677。而在Artificial Analysis的综合智能指数,它得到57分,在186款模型中排第四,在国产模型和开源模型中排名第一。
Arena这张分榜记录的是用户更喜欢哪个模型生成的网页,Artificial Analysis的综合智能指数则汇总多项评测。月之暗面在官方技术博客里也承认,K3的综合表现仍落后于Claude Fable 5和OpenAI的GPT-5.6 Sol。但和这两家的差距,比半年前的国产旗舰缩小了一截。
网页做得漂亮、事实答得准、跑得便宜、跑得稳,这是四件事,不是一件事。 K3两张成绩单上的排名差,只是最表面的一层。但更多的错位藏在排名背后:跑一次要花多少钱、结果能不能直接用。
第一名,只在一张榜上
Arena没有固定试卷。用户向两个匿名模型发出同一个要求,看完结果后投票,平台再汇总大量两两对战,计算分数和排名。

这种方法离真实使用更近。网页有没有做完、布局顺不顺眼、交互是否合意,用户一眼就能比较。K3排到第一,说明在这一批网页开发对战中,它赢得了更多选择。
当然,投票也会把审美带进成绩。一张视觉更完整、动画更丰富的页面可能胜出。放到普通问答里,写得长、显得笃定的答案同样可能讨喜,但答得对不对,用户不一定投得出来。
Arena因此给分数附上置信区间。两个模型的区间重叠,名次的先后未必稳定。新模型上线后,成绩还会被标为"初步",等待更多投票。K3当前的网页前端榜首就带着这一标记。
题目来源也在变。2026年5月,Arena把部分直接对话中的模型对战纳入榜单。平台随后发现,新票源里的问题更长,复杂指令和编程任务更多。模型没有更新,换一批提问者,分数也可能移动。
真要选模型,用户还得面对账单、等待时间和失败后的返工。
分数之外,还有账单和返工
Kimi K3官方API的价格为:缓存未命中的输入每百万token 3美元,输出每百万token 15美元。Artificial Analysis跑完整套智能指数评测时,K3生成约1.3亿个输出token,接近同类参评模型平均值6300万的两倍;整套测试花费约2710美元。该机构记录的输出速度约为每秒39.5个token。
按完成一项评测任务折算,K3平均花费约0.94美元,低于GPT-5.6 Sol的1.04美元,约为Claude Opus 4.8的1.80美元的一半。与上一代K2.6相比,K3的输出token减少约21%。
单价便宜不等于账单便宜。K3的输出token数接近同类平均值的两倍。单价再低,总量也会把账拉起来。
账单之外,还有结果能不能直接用。

在Artificial Analysis的AA-Omniscience测试中,K3的准确率由K2.6的33% 升至46%,幻觉率也从39% 升至51%。准确率看的是全部题目里答对了多少,幻觉率看的是答错的题目里模型是编了一个答案还是承认不知道。K3答对的比例提高了,但在仍然没答对的题目里,它更倾向于直接给出错误答案而非承认不知道。
开发者西蒙·威利森(Simon Willison)做过一个很小的测试:让K3生成一张"鹈鹕骑自行车"的SVG图片。模型用了16658个输出token,其中13241个是推理token,费用约0.25美元。这个例子无法代表K3的整体效率,却很像用户会遇到的真实瞬间,任务看着不大,模型在后台想了很久。

月之暗面目前让K3默认使用最高推理强度,称后续版本将提供低、高推理模式,让用户控制推理预算。想多久、花多少钱,最终还是用户自己决定的事。
模型在进步,试卷也在过期
K3目前的成绩主要来自Arena和Artificial Analysis,尚未在SWE-bench类固定题库上公布分数。但固定题库本身的可信度也在下降,因为模型越强,越容易接近试卷上限;题目在网上放得越久,进入训练数据的机会也越大。
今年2月23日,OpenAI宣布不再使用SWE-bench Verified衡量前沿编程模型。该公司审计了138道模型经常失败的题目,称其中59.4% 存在实质性的题意或测试设计问题。有些测试只接受一种特定写法,把功能正确的其他答案判错;还有些题目没有写清要求,测试却检查额外功能。

OpenAI称,它在GPT-5.2、Claude Opus 4.5和Gemini 3 Flash Preview中发现训练数据污染迹象:模型有时能够复现人类原始补丁或题目细节。OpenAI认为,在这些测试获得的高分里,模型可能受益于对训练数据中原始补丁或题目细节的熟悉,而非纯粹的能力。
就在此前的2月18日,一篇分析60个大模型基准的预印本研究也指出,许多固定评测在头部模型接近满分后,区分能力会下降。
把题目换成真实工作,差距更为明显。METR在2026年5月19日发布的回顾报告中称,截至2025年末,被SWE-bench Verified判定通过的AI代码方案,大约只有一半会在真实代码审查中被接受。 Arena记录用户偏好,固定题库适合追踪某项能力,METR试着测量模型可以独立完成多长的任务。三张榜,各管一段。
第一名需要一个后缀
面对数百款模型,榜单能帮用户快速缩小范围。但麻烦的是,"某模型登顶"这种说法,并不考虑任务类型和成本。
写作、做网页、维护代码不是一回儿事;人类偏好、标准答案、任务成功率不是一个指标;token用量、耗时、单价也各算各的账。
到最后,模型还得放回自己的提示词、数据和工具链里跑一遍。写作者关心事实准不准、要不要大改;程序员看代码能不能进真实仓库;企业算的是一件工作交付后的总成本。没有一个榜首可以同时替这三类人作决定。
Kimi K3拿下网页前端榜首,说明它在这项能力上已经进入前沿。综合指数第四、较高的token消耗,以及准确率和幻觉率同时上升,则补上了另外几面。这些成绩放在一起,才像一个可以拿来选型的模型画像。
模型榜单不会消失,但"第一名"三个字需要越来越长的注释。真要付账单的人,看的是能不能交付、花多少钱、要回来改几次,冠军两个字,解决不了你的具体问题。
Kimi K3现在暂停接受新增订阅,想订的人得等下一批。等真能订上的时候,这些问题还得再问一遍。