深度对话联想:自主把事办完,成AI终端L3级智能“分水岭”

栏目:互联网 | 来源:智东西 | 2026-09-24 14:44
智东西作者 云鹏编辑 李水青

在一项人工智能终端测试中,题目不是写诗、总结文章,也不是让模型回答一道知识题,而是在平板上通过购物软件,购买一张过去买过的电影票。

乍看之下,这个任务平常得不能再平常。用户甚至不需要知道背后用了什么模型,只会关心票有没有买对:影片、影院、场次、座位和支付环节能否被准确衔接,遇到权限确认、页面变化或网络波动时,系统是否知道下一步该做什么。

但对AI终端而言,这恰恰是一道比聊天难得多的综合题。它要求设备先理解一句自然语言背后的真实意图,再从历史记录中定位对象,调用应用和系统服务,跨越多个界面完成操作,并在涉及支付等敏感环节时把控制权交还用户。任何一个节点掉链子,前面再聪明的回答都没有意义。

近期,《人工智能终端智能化分级》系列国家标准发布。在首批公布的66款产品中,拯救者Y900系列是唯一达到人工智能国标最高L3级平板产品。与其把这理解为又一项产品认证,不如把它看成一个行业信号:AI终端的评价尺度,正在从“能不能生成”推进到“能不能交付”。

联想集团高级副总裁、全球创新中心负责人贾朝晖将L3称为“从工具到智能伙伴的标尺”。这句话的关键不在“伙伴”这个拟人化称呼,而在于角色变化。工具等待用户一步步操作;智能伙伴则要理解目标、组织步骤、调度资源,并对结果负责。

这也意味着,AI硬件竞争正在进入更难的一段。大模型可以为终端提供一颗更聪明的大脑,但一台设备能不能稳定把事情办完,取决于整套任务执行链是否成熟。

一、L3把AI终端从“生成”能力推向“任务交付”

过去两年,终端厂商展示AI时,最常见的项目是问答、翻译、摘要、文生图。这些能力容易演示,也容易用模型参数、响应速度和榜单分数比较。但它们大多停留在“给出内容”的层面,输入和输出之间的路径相对短。

任务执行完全不同。以电影票任务为例,系统至少要完成五个环节:识别用户意图,读取与当前任务相关的上下文,规划操作步骤,调用系统或第三方应用,确认结果并处理异常。它不只是在概率意义上生成一段“像答案的文字”,而是要改变真实世界中的状态。

这一区别决定了任务型AI的容错率更低。生成一段摘要时,措辞略有不同往往不影响使用;订错日期、选错影院或重复提交订单,却会直接造成损失。模型的单点能力越强,并不必然意味着整条链路越可靠。一个执行任务成功率为95%的步骤,连续经过多个步骤后,整体成功率会不断折损;如果链路中还有应用更新、弹窗、权限和网络等变量,稳定性会进一步下降。

因此,L3的意义不只是给AI能力划等级,而是把测试对象从“模型回答”扩大到“整机交付”。终端需要证明自己能把理解、规划、调用、执行、校验串成闭环。所谓“会办事”,不是自动点击得越多越好,而是在该自动化的地方自动化,在需要确认的地方停下来,并且能向用户说明当前进度和结果。

这也重新定义了终端智能化。把一个大模型应用装进设备,只能解决“入口在哪里”;要完成跨应用任务,则必须让AI深入系统权限、服务接口、硬件资源和设备生态。贾朝晖对此区分得很直接:在设备上装AI应用是“+AI”,依据AI的特点重新设计系统才是“AI+”。

前者增加一个功能,后者改变设备组织能力的方式。L3所测试的,正是后者有没有真正落地。

二、拆解AI任务执行链的三层门槛:系统、算力与连续状态

AI终端要稳定完成任务,至少要跨过三层门槛。它们分别解决“能不能动手”“把任务放在哪里算”以及“换设备后还能不能接着做”。

第一层,是进入系统层。

聊天机器人通常只需读取用户输入并生成回复;任务型智能体必须获得受控调用能力。它要知道设备上有哪些服务、哪些应用能够完成当前步骤,如何传递参数,又该怎样处理授权和返回结果。据联想介绍,其基于天禧AI底座组合调度端侧模型与云端模型,并基于MCP协议贯通系统服务,用于跨应用自动化和多设备互动。

这里真正困难的不是让AI“看见”按钮,而是建立一套可管理、可确认、可回退的调用机制。应用界面会改版,登录状态会变化,同一句指令也可能对应不同条件。成熟的任务链需要把意图理解、工具选择、权限边界、异常处理和结果校验都纳入系统设计。否则,所谓智能体只是更复杂的自动点击器。

第二层,是组织端、边、云算力。

在联想的体系中,“端-边-云”架构于2026年5月19日随天禧AI 4.0发布并落地,负责算力与数据的组织方式;9月初迭代至4.3版本后,重点推进的是智能体自主执行与多设备协同能力。底座与执行分属两层,任务执行建立在算力组织之上。

任务为何不能全部扔给云端?一方面,个人知识、历史记录和敏感数据需要更清晰的隐私边界;另一方面,频繁调用云端模型会带来时延和Token成本。反过来,若所有任务都压在端侧,受限于功耗、内存和模型规模,也难以覆盖复杂长尾需求。

端边云协同的价值,在于按任务动态分配资源:低时延、强隐私、与设备状态紧密相关的部分尽可能在端侧或边侧处理;需要更强泛化能力的部分再调用云端。它不是三个算力节点的简单叠加,而是调度问题。系统要判断哪些数据可以离开设备、哪种模型适合当前步骤,以及失败后如何切换路径。

第三层,是维持跨设备的连续状态。

真实任务很少永远锁在一块屏幕里。用户可能在平板发起任务,让PC调用更强算力或本地知识库处理,再把结果返回平板;也可能在手机上补充信息。联想将天禧AI 4.3的多设备协同概括为数据库、上下文与记忆、任务执行与接力三个一体化。

这比普通的文件互传更难。跨设备任务需要携带的不只是结果文件,还包括任务处于哪一步、已经调用过什么、用户做过哪些确认,以及后续应该由哪台设备继续。只有状态连续,设备矩阵才不是多个AI入口,而是一条可以迁移的执行链。

从这个角度看,L3背后测的其实是一套系统工程:模型负责理解和规划,操作系统提供受控能力,端边云提供算力,设备生态保存任务状态。任何一层缺位,“一句话办事”都可能停在演示阶段。

三、为什么说平板更适合成为AI综合交互与任务入口?

在手机、PC和平板之间,平板未必拥有最强算力,也不是用户随身时间最长的设备,但它具备一种特殊的平衡:屏幕足够大,又比PC轻便;可以触控、手写、键盘输入,也适合语音和视觉交互。

联想集团高级副总裁、中国消费业务群总经理张华把AI平板称为“AI天生的容器”。如果把这句话拆开看,平板的价值不只在承载更多AI功能,而在于它更适合呈现任务全过程。

聊天只需要一个输入框,任务执行却需要让用户随时理解系统正在做什么:目标是否识别正确,哪些资料被调用,当前执行到哪一步,哪个环节需要确认,最终结果是什么。相比手机的小屏,平板更能同时容纳任务上下文、候选结果和操作反馈;相比PC,它又天然支持拿起即用、语音、触控与手写等低门槛交互。

手写笔在这里也不应只被视为配件参数竞争。根据现场介绍,联想希望把笔从输入工具变成意图入口:提笔书写、转笔擦除,圈选不同类型内容后触发相应处理。其价值不在多一个AI按钮,而在于用户沿用原本熟悉的动作,系统在背后识别对象和意图。

这符合任务型AI的一条重要原则:最好的智能不应该要求用户先学习一套复杂指令。贾朝晖所说的“真正的AI隐形于设备、无所不在”,如果落到产品层面,就是用户表达目标的方式越来越自然,而系统承担更多理解和编排工作。

不过,平板适合作为入口,不等于所有任务都必须在平板本地完成。恰恰相反,它更像一个综合交互面板:负责收集语音、触控、笔迹和视觉信息,展示任务进度,并在需要时调用PC算力、个人知识库或云端服务。平板的竞争力由此不再只取决于屏幕和芯片,而取决于它能否把多种输入和多端能力组织成一条顺畅链路。

值得一提的是,联想面向课堂的研学方案——根据课程安排推送知识、汇总录音课件与照片并生成个性化课堂笔记——目前仍处于规划阶段,尚未上市。它说明的是任务链未来可能延伸的方向,也提示外界:把规划写成既有能力,同样是对这类产品的一种误读。

四、从实验室通过到日常稳定,中间还差一个反馈闭环

标准测试的价值,是用一致题目验证能力边界;但用户每天遇到的环境远比实验室复杂。应用版本更新、页面布局变化、网络中断、账号状态异常,都可能令原本可用的执行链失效。

因此,通过L3不是终点,而是获得了一张进入真实世界的入场券。

任务型AI上线后,厂商真正要盯的不是“功能是否存在”,而是每个环节为何失败:是意图识别偏差,还是工具选择错误;是权限被拒绝,还是第三方应用改版;是端侧模型能力不足,还是云端调用延迟;用户在哪一步主动接管,又在哪一步直接放弃。

联想介绍的“月月新”和“超核社区”,对应的正是这一问题。前者以月度节奏推送体验和优化,后者让用户在设备内反馈问题,再由团队和AI归纳共性需求。对传统硬件而言,产品上市往往意味着主要功能已经定型;对AI终端而言,上市只是任务成功率开始接受大规模检验。

这种闭环还有一个容易被忽略的价值:判断哪些任务值得自动化。并非所有能做的功能都有必要做,也不是执行步骤越长越能体现技术实力。真正高频、刚需、容错边界清晰的任务,才适合优先进入自动执行。用户反馈不仅帮助修复失败案例,也帮助厂商避免为了展示AI而制造需求。

联想所强调的“用得上、用得起、用得好”,最终都要落到这里。用得上,是用户可以用自然方式发起真实任务;用得起,是算力调度和商业成本能够长期支撑;用得好,则是任务在日常环境下保持稳定,并且持续改善。

五、AI终端的下一张考卷:任务完成率

当大模型能力逐渐成为公共底座,终端发布会仍然可以展示模型规模、推理速度和生成效果,但这些指标与用户价值之间的距离正在拉大。

用户不会因为设备调用了更大的模型,就原谅一张买错日期的电影票;也不会因为智能体规划了十个步骤,就接受任务在第九步失败。对任务型AI而言,最朴素也最严格的指标,是完成率。

但“任务完成率”不能只是一个孤立数字。它至少应包含一次成功率、平均完成时长、人工接管次数、异常恢复率、敏感操作确认准确率,以及跨设备接力成功率。更进一步,还应区分演示环境与真实环境、高频任务与长尾任务、首次使用与长期使用。

这套尺度会倒逼终端行业改变竞争方式。模型参数仍然重要,却只是必要条件;芯片算力仍然重要,却必须转化为稳定执行;应用数量也不再等于生态能力,关键要看接口是否能被安全调用、任务是否可以闭环。

电影票测试之所以值得关注,就在于它把宏大的“智能伙伴”叙事压缩成一个可验证的问题:用户交代一件事,设备到底能不能办成。

联想平板通过L3,证明其在当前测试范围内已经把模型、系统、应用调用和设备能力串了起来。但对联想以及整个行业来说,更艰难的比赛才刚刚开始:从规定场景走向千人千面的日常,从一次通过走向长期稳定,从能执行走向值得托付。

未来,AI终端真正拉开差距的时刻,可能不是它说出一句多惊艳的话,而是用户回过神来,发现事情已经被准确、透明、安全地办完了。

了解更多

猜你想看

← 返回首页