9月23日,2026未来大会在杭州举行。本届大会以“碳硅相逢,万象启元”为主题,由网易公司主办,杭州市商务局、杭州市经济和信息化局(杭州市数字经济局)、杭州高新技术产业开发区管委会联合指导。五位院士领衔,来自学界、产业界和投资界的嘉宾齐聚一堂,围绕科技前沿、人工智能产业化与未来商业展开交流。
从可控核聚变、AI大模型技术与通信智能,到AI PC、智能体、AI制药与具身智能;从院士专家的前沿判断,到产业先锋、投资人与00后创业者的实践探索,本届大会试图回答一个共同的问题:当碳基文明与硅基智能加速相逢,技术将如何突破边界,又将怎样走进真实世界?

曦望Sunrise联席CEO王湛带来题为《Token经济学:AI时代的成本革命》的主题演讲。相比许多围绕模型能力、参数规模和应用想象的讨论,王湛把问题拉回到一张更现实的产业账本上:AI能不能真正普及,不只取决于模型是否足够聪明,也取决于每一次调用背后的Token成本能否降下来。
王湛判断:AI产业的损益表正在被Token重写。每一次AI调用背后都是一笔Token消耗:对使用者是成本单元,对算力提供方是收入前提。Token价格的高低直接决定了智能经济的规模。
在王湛看来,Token经济不是一个抽象概念,万亿Token时代已经来临,Token已经成为一种生产要素,连接着技术供给与社会生产需求。

需求侧的爆发有明确数据支撑:国家数据局披露,国内日均Token调用量已从2024年初的1000亿增至今年3月的140万亿。OpenRouter 2026年8月数据显示,7日日均Token调用量中,Agent已是人类的5倍以上。会上,王湛也与大家分享了三大典型场景的Token消耗情况——AI编程领域,一个典型编码任务平均消耗约417万Token;AIGC领域,以王湛列举的可灵V3为例,生成一条15秒720P视频需135万Token,同样时长的4K视频则达450万Token;AI办公领域,有实测案例显示单任务消耗约180万至300万Token。
但供给端是另一回事。Token靠推理算力产生。算力中心建设属重资产,产能只能线性增长,需求却在指数级攀升。王湛判断,结构性缺口大概率延续到2028年,未来5年内都难以缓解。
他给出的解法落回芯片技术创新。曦望专注推理GPU,其新一代启望S3专为大模型和AI智能体打造,性能为上一代的5倍,单Token成本降低90%,算子利用率与算子效率分别达99%和98%。一个重要创新在于"换内存"——以消费电子级的LPDDR替代昂贵的高带宽内存HBM,并重写底层架构、对记忆做冷热分层。
他强调,公司成立之初就定下方向:不拼参数,只拼单位经济性。要做AI产业的"损益优化师"。曦望致力于通过提供高性价比的推理算力来降低单位Token成本,与产业伙伴们一起为中国的AI发展铸算力底座,共同促进AI普惠和智能社会发展。(易科)
以下是曦望Sunrise联席CEO王湛在“2026网易未来大会”上的演讲实录:
王湛:各位朋友大家好,非常感谢网易的邀请,刚才杨院士讲的张量人工智能,我觉得很前沿,也让我有一种仰望星空之感。我现在跟大家聊的是脚踏实地,关于成本的事。我是做企业的,我们做企业的也知道,一个东西非常好用,这是它能够被普及的第一原因。但是同时它也得够便宜,如果很贵,大家都用不起,它也很难普及。我今天演讲的主题是:Token经济学,AI时代的成本革命。
在这里我想先抛出一个观点:现在AI产业的损益表正在被Token重写。为什么这么说?AI 出现后,大家觉得很好用,但今年随着龙虾热、Agent 的爆发,很多人都意识到:龙虾虽好,但它运行起来是要花钱的,它要消耗Token。每一次AI 调用的背后,都是一笔Token 的消耗。对于AI 使用者来说,Token 是成本单元;而对于算力提供方来说,Token 也是收入的前提。Token 的价格直接决定了智能经济最终的规模能有多大。
所以我们曦望成立之初,就给自己定下了一个非常朴素的方向:我们不拼参数规模,只拼单位经济性。我们要做AI 产业的损益优化师,这就是我们要做的事——降低大家使用AI 时消耗的单位 Token 成本。
为什么现在 Token 的使用量会迎来如此爆发式的增长?这背后有一个结构性的变化。ChatGPT 刚出现时,它是对话式 AI;直到今天,很多人仍习惯把它当成更先进、更好用的搜索引擎:问问题、查信息等等。但 AI 的能力其实远远不止于此。今年 Agent(智能体)开始出现,真正让 AI 从“只回答问题”变成了“能帮你干活”。正是这一步转变,推动了 Agent 的大量涌现。
我这儿举个例子,比如我自己最常用的几个 Agent,有一个是专门帮我梳理周报的。因为以前在公司里,做周报或者了解周报很重要,我每天要收下来很多份公司同事给我的周报。如果你一份一份地去看,会花很多时间。
现在很简单,我只要告诉 AI:“帮我把这几个部门的周报按部门梳理,形成待办列表,并标出需要我关注的重点”,它就能每周自动帮我搞定。这就是我用的一个 Agent。前两天 Facebook(也就是 Meta)刚刚推出了 Muse 这个产品,不知道大家有没有关注?这款产品发布后,直接推动其股价上涨了好几十个百分点。它到底是什么?其实就是一个面向普通用户、能覆盖生活与办公需求的 Agent,也就是智能体。
所以我们可以看到,我们的生活可以有很多智能体来提供服务,工作也有很多;对于工厂、对于制造业来说,它可以有更多的智能体来提供服务。而这些智能体要想工作、想要跑起来,其实都是在消耗 Token。智能体消耗 Token 的方式跟我们人是不太一样的,它的量会非常巨大。
这里有一个来自 OpenRouter 2026年8月的数据:在7日平均 Token 调用量中,Agent 已经是人类的5倍以上。也就是说,现在每天在 AI 世界消耗的 Token 里,Agent 的消耗量已是人类的5倍。而 Agent 的数量很快会超过人类,因为它们每天都在不断增加。
我们可以看一下需求曲线,这里有两组数据。第一组来自中国,是国家数据局披露的日均 Token 调用量:2024年初只有1000亿,而到了今年3月增长到了140万亿。这只是今年3月的数据,其实那时候 Agent 还没充分爆发,如果是现在的数据会比这个高很多。那么现在的增长有多快?
我们再看一下 OpenRouter 平台的数据。在5个月的时间里,该平台上的 Token 周调用量从20.4万亿增长到了69万亿,增至原来的约3.4倍。这说明什么?说明现在每周的 Token 总消耗量正以非常惊人的速度上升。
这么多的 Token 调用都用来干什么了?刚才我们讲到智能体,这是一个具体的例子。其实可以看到,现在已经非常明确地出现了三大场景。
第一个场景是 AI 编程。大家可能都知道 Cursor,这是一款熟悉的 AI 代码编辑器。今年因为 AI 编程调用量的上升,它的年化收入已经达到了40亿美元,而一年前只有5亿美元,一年增至原来的8倍。这背后就是 Token 的消耗。因为编程时 Agent 要做什么?它要读代码库、读文档、读报错日志,而且每一轮调用都会把累积的上下文重新推进模型。所以,一个典型的 Agent 编码任务平均消耗大概有417万 Token。随着 AI 能力越来越强,AI 编程的应用场景也越来越多,Token 的消耗量自然在不断上升。
第二个场景,我想大家现在也能感觉到了,就是生成内容,也就是 AIGC。现在 AI 短剧非常流行,前两天国家有关部门公布了一组数据:今年前8个月一共上线了微短剧43万部,是去年全年的13倍。其中 AI 剧的占比超过90%,平均每36秒就有一部新的 AI 短剧上线。这些 AI 短剧之所以能生成,是因为背后有专门做视频生成的模型在运行,而模型消耗的就是 Token。以可灵 V3为例,生成一条15秒的720P 视频需要135万 Token;如果是4K 清晰度,直接就是450万 Token。分辨率每提升一档,单条视频的消耗量就成倍上升。
还有一个重要场景,也是在最近几个月突然爆火,那就是 AI 办公。今年8月,这个赛道突然加速:大家可能已经感觉到,先是腾讯推出了 WorkBuddy,接着阿里发布了千问办公;字节则做得更彻底,直接推出了豆包工作版,还把飞书整合进了豆包。为什么会出现这种情况?因为随着 Agent 的发展,大家发现将这些 Agent 与日常办公中的大量数据——如汇报、工作记录以及基于工作的聊天内容等沉淀数据结合起来,能极大提升办公效率。而且这些 Agent 能力非常强:能读文档、分析数据、制作 PPT 等等。所以这个市场正在迅速扩大。
大家可以想一想,当你用上几个好的 Agent 帮你解决很多问题后,你会停下来吗?你停不下来的。你每天还会继续用它,身边也会出现更多的 Agent,因此消耗量也在不断上升。
据钛媒体2026年8月对千问办公用户的实测,典型办公场景下 Agent 的单任务消耗大概是180万到300万 Token:一个值班日报就是180万,一个自媒体简报约200万 Token。
所以,这3个场景告诉我们一件事:Agent 已经成为新的生产力工具,而 Token 需求的增长才刚刚开始。
我们再看看更大的层面。今年以来,国家出台了跟 Token 相关的很多举措,而且是全方位的,涵盖产业、城市、金融和国家层面。我们来看一看:5月份,中移动、中联通、中国电信都推出了Token 套餐;6月份,各地城投开始行动,着手建设算力中心来运营 Token 服务,像卖水电一样去提供Token。
8月份,中国信通院人工智能研究所发布了《Token 运营管理能力要求》,这标志着产业 Token 正式进入全新的运营管理阶段。与此同时,几大银行也敏锐捕捉到趋势,自8月起陆续推出“Token 贷”产品。业界普遍预期,随着 Token 需求量的巨大爆发,它将成为经济的重要热点。
然而,需求呈指数级增长,但每一次调用都有成本。如果成本降不下来,AI 就无法真正普及。所以我们常说,成本是 AI 普惠的“最后一公里”。那么,谁来重写这条成本曲线?又该如何把成本降下来?
我们先看看现状。刚才提到 Token 需求量爆发,但供给端情况如何?首先,Token 的供给依赖建设算力中心。但按行话说,算力中心建设、服务器及芯片生产都是个“重活”,产能只能线性增长,而 Token 的需求量却在指数级攀升。
所以,这个需求缺口正在越来越大。它直接导致了两件事:首先是算力租金不断上升,其次是整个推理算力的需求量迅速攀升。其实今年我们已经看到,推理算力的需求量已是训练算力的4倍。毕竟AI 训练只是把大模型做出来,而让大模型每天工作、真正用起来,靠的都是消耗 Token。
第三点,大家可能已经有感受了:有时候你去用豆包,如果是普通用户,问题问得更多一些,它可能就会告诉你:“哎呀,今天聊的内容已经挺多了,我们歇一歇。”其实这是什么原因?就是因为算力不足,所以头部模型也被卡住了。这个问题到后期会变得更加严重。
所以,结构性缺口大概率会延续到2028年。但这只是目前的预测;就我个人判断,未来5年内这个缺口都很难缓解,因为需求增长实在太快了。我们希望做一家什么样的公司?我们专注于打造推理 GPU。正如刚才所说,成立之初我们就明确:不拼参数,只拼单位经济性。我们共拥有8年的技术沉淀、100余项知识产权积累,并成功量产了两代 GPU。这些构成了我们研发推理 GPU的底层基础。
今年,我们推出了全新的启望S3,这是一款专为推理设计的 GPU。一会儿我会详细讲解它如何降低推理成本,这里先做个概览:首先,性能是上一代启望S2的5倍;其次,单 Token 成本降低了90%。在使用效率上,算子利用率和算子效率分别达到了99% 和98%,均处于业界极高水准,因此非常好用。
怎么才能把成本降下来呢?启望S3做了4项重要的技术创新,其中最重要的一项就是“换内存”。大家可能听说过,今年以来全球所有资产里涨幅最高的是什么?其实是内存条。
内存条的暴涨引发了很多有意思的现象。比如,有人4年前买的服务器,用了4年现在准备回收当二手机器卖掉,结果发现芯片售价比当初买入时还贵了好多。为什么?因为内存在暴涨。但内存里最贵的是什么?是高带宽内存,也就是 HBM。
我们仔细研究了 AI 的推理需求后,提出了一条创新路线:用 LPDDR 这个内存方案来做推理 GPU。LPDDR 以前是专供消费电子的。
前两天,长鑫刚和小米一起发布了新一代 LPDDR6内存。既然小米是做消费电子的,而 LPDDR 又是给消费电子用的,那它的成本就不会很高。因为如果抬得太高,这些消费电子产品大家都会觉得用不起。我们用 LPDDR 内存来做推理 GPU,就比用 HBM 内存的方案在价格上少很多。
第二条,我们研究了训练和推理,以前的 GPU都是训推一体,我们专门做推理之后,我们仔细研究了训练和推理的不同算力需求,我们没有训练方面的需要,我们的 GPU每一分算力是给推理用的,这样的话,我们做的芯片晶体管数量不是特别夸张,所以它的成本也能降低很多。
第三个,很重要的一个点是在 AI 使用过程当中的互联,互联的效率决定了你整个芯片来跑推理的模型效率,我们重写了互联架构,形成了三层互联体系,总体来讲效率得到了大幅提升。
还有一个很重要的点:内存如此昂贵,那么这些内存的使用方式是否足够高效?为此,我们对记忆进行了分层,编写了新的记忆结构,让冷数据、温数据、热数据能够分层存储和使用。这些东西加在一起,使得我们推理 GPU 的效率得到了显著提升。
除了单芯片的推理成本,其实我们更关注客户的 TCO,也就是总体拥有成本。启望S3支持低精度推理,能从几十张卡一路扩展到256卡的超节点集群,为客户提供系统级方案。此外,我们还完全自研了整套软件栈,高度兼容主流生态,客户现有的推理任务可以无缝迁移,一整套软硬件能力,可以有效降低客户总体拥有成本。
经过多个行业解决方案的验证,我们在客户真实业务中可以持续降低成本,提高单位经济性。规模化的交付本身也是成本革命的一部分。
除了做产品以外,我们还跟产业链上下游共建生态。今年8月,曦望与浙江省数据集团和中国工业互联网研究院已经签署了战略协议,将共同推进 Token 公共服务体系建设。此外我们和浙江大学共建了智能计算联合研发中心,我们将继续拓展 AI 推理算力的科研与产创空间,推动其向更广领域发展。
在 Token 经济时代,我们希望与生态伙伴一起共建 AI 产业的损益表。
最后回到今天的主题:讲到成本,我们希望通过提供高性价比的推理算力,有效降低单位 Token 成本;与产业伙伴们一起实现 AI 时代的成本革命,共同促进 AI 普惠和智能社会的发展。
在此,再次重申曦望的使命:为中国AI发展铸算力底座。
好,我的分享就这么多,谢谢大家。