机器之心发布
AI 音乐工具已经存在好几年了,生成的歌曲越来越像那么回事,独角兽 Suno 估值冲到 54 亿美元,赛道热度居高不下。但一个反直觉的事却是:大多数用过 AI 做歌的人,试过一次就放弃了。
不是因为音质不够好,也不是因为生成速度不够快,而是每一次生成出来的东西,总觉得差那么点意思。
想要温柔治愈的氛围感,出来的旋律千篇一律。想要细腻走心的人声,成品僵硬机械。想微调某个乐器的细节,只能反复改提示词、重新生成,折腾大半天,最后无奈删掉。
这个 “差点意思” 的感觉,几乎每一个用过 AI 音乐工具的人都经历过。
问题出在哪?
不是你的灵感不够好,也不是 AI 的能力不够强。而是这中间存在一个根本性的错位,你脑海里的东西和 AI 能接收的东西,用的是两套语言。
为什么 “差点意思”?
一个被忽略的结构性错位
美国物理学家费曼在自传里讲过一个故事。
他有个习惯,在实验室里默默数数来计时,从一数到六十,差不多就是一分钟。数着数着,他发现一件奇怪的事:一边数数一边看书,毫无问题。但一边数数一边说话,就不行了,数到一半就串了。
有次午餐,他把这事讲给同事约翰・图基听。图基是数学家,听完一脸不可思议:数数的时候说话有什么难的?我完全没障碍啊。费曼说,那你数数的时候能看书吗?图基试了一下,不行。
两个人对视了一眼。
原来,费曼数数的方式是在脑子里 “听到” 数字,一二三四,一个声音接着一个声音。既然脑子里的 “嘴巴” 在忙着数数,外面的嘴巴自然就说不了话。而图基数数的方式,是在脑子里 “看到” 一条数字纸带在跳动,“咔嗒、咔嗒、咔嗒”。既然用的是视觉通道,嘴巴当然闲着,但眼睛一忙,就冲突了。
费曼后来感慨:哪怕是数数这么简单的事,人们以为自己在做同一件事,脑子里的运作方式却可能完全不同。有些人靠声音思考,有些人靠画面思考,有些人靠节拍和韵律。
这个发现,恰好能解释 AI 音乐行业那个 “差点意思” 的困局。
那些在脑子里 “听到” 旋律的人、在身体里 “感受” 到节奏的人,他们心里的音乐是声音、是律动、是情绪的起伏。可当他们要把这些 “翻译” 给 AI 时,唯一能用的通道是文字。而文字,本质上是一种视觉和逻辑通道的媒介。
让一个听觉型的人用文字描述他脑海中的旋律,就像让费曼用眼睛去数数,不是做不到,是通道不对,信息注定会失真。
这不是谁的问题,是整个 AI 音乐行业从第一天起就存在的结构性瓶颈。
Suno 很强
但中文歌始终硬伤
聊 AI 音乐,绕不开 Suno。这家独角兽今年 6 月刚完成新一轮融资,投后估值冲到 54 亿美元,坐稳全球 AI 音乐的头把交椅。它的英文歌生成能力确实能打,很多人第一次用的时候都会被惊艳到。
但如果你试过让 Suno 做一首中文歌,体验会急转直下。咬字生硬、转音别扭、气声做作,中文歌词的韵律和语气感几乎完全丢失。原因并不复杂:Suno 的训练数据以英文为主,中文语境对它来说是一种 “外语”,它理解不了中文里那些微妙的声调变化、气声控制和语感节奏。
这就像让一个美国歌手硬唱中文歌,歌词或许也能对上,但 “味道” 永远差着。
而 “味道” 这个词,在 AI 音乐里其实有着非常具体的含义。它不是一个玄学概念,而是由模型对特定语言、特定文化、特定审美习惯的理解深度决定的。
中文歌的 “味道”,那种细腻的咬字、绵长的气声、情绪在字里行间的流转,不是靠更多数据就能解决的,而是需要模型从底层架构上就针对中文语境做优化。
这恰恰是国产 AI 音乐最大的机会,当然也是最难的一步。
连续两年拿下 WAIC 主题曲
凭的是什么?
在聊国产音乐大模型之前,需要先说一件更能说明问题的事。
最近火热的 WAIC 世界人工智能大会,它的官方主题曲,其实都出自同一款国产自研大模型 —— 音潮,2025 年的《AI For Good》,2026 年的《共创未来》。
熟悉 WAIC 的都清楚,这个大会是国内 AI 圈顶流盛会,主题曲的筛选相当严格,每年竞标团队卧虎藏龙。能中选一次就已经是实力证明,连续两年卫冕,含金量不用多说。
2025 年《AI For Good》刚出来的时候,其实就打破了不少人的刻板印象。以往科技向配乐,大多逃不开厚重宏大、迷幻电子的套路,冰冷、严肃、距离感十足。但这首纯 AI 制作的曲子,走的是清爽青春路线,温柔又有力量,也让业内第一次注意到:国产 AI 音乐,也能兼顾科技感和人情味。
时隔一年,迭代升级后的音潮大模型带来的《共创未来》,进步更是肉眼可见。整首歌的创作核心很直白:AI 不是冰冷的数据,而是并肩同行的伙伴。曲风上刻意避开了科技展会的 “流水线配乐风格”,选择了阳光朝气的科技流行摇滚。
最加分的是它的双语设计,中文侧重温情、坚守与陪伴,细腻接地气。英文聚焦探索、突破、全球连接,格局拉得很开。两种语言衔接自然不割裂,既悄悄秀了把自家模型的能力,又藏着 “科技无国界” 的内核,适配 WAIC 的全球舞台,细节处理相当成熟。

音频见原文:https://mp.weixin.qq.com/s/VuH1NNFnQD2bhoX6xFMfjw
但真正让圈内人坐直的,不是歌曲本身,而是它背后的制作方式。
按照传统模式,一首顶级行业盛会的官方主题曲,从前期创意对接、写词作曲、编曲录制,到后期混音精修、反复打磨定稿,整套流程走下来至少两三个月,百万级预算是常态。最头疼的是,可选版本极少,一旦甲方不满意、需要推翻调整,返工成本高到离谱,容错率极低。
音潮团队用模型能力,直接把这套传统流程压缩到了一个下午。
依托音潮大模型的批量创作能力,团队根据 WAIC 的大会主题、风格调性和核心诉求,批量生成上百首高质量原创备选曲目,然后优中选优、逐句精雕细琢,最终敲定《共创未来》。
周期、成本、创意上限,三重维度全面突破。
所以,连续两年拿下 WAIC 官方主题曲,不是运气加持,不是官方偏爱,是审美、技术、落地能力全方位在线的结果。而这家成立于 2023 年的公司,目标也远不止于此,它公开对标海外顶流,立志做本土化的中国版 Suno。
音潮大更新
从底层开始重构

8 月 14 日,音潮大模型 V4.0 正式发布。
连续两年 WAIC 主题曲的实战验证,已经证明了音潮大模型的基本功。但这次大更新真正值得关注的,不是延续,而是跃迁。
先说结论:这不是一次版本微调,而是底层架构的全方位重构。从音潮大模型 V3.5 到 V4.0 的跨越,不是在旧模型上打补丁,而是从底层重新训练,核心变化集中在三个维度,指令理解、情绪落地、曲风细分。
回到开头费曼的框架。如果说过去的 AI 音乐工具只能服务 “视觉型” 和 “逻辑型” 的人,也就那些能精确描述自己想要什么、能把情绪翻译成结构化文字的人,那么音潮大模型 V4.0 试图做的,是让那些 “听觉型” 的人、感受到旋律和节奏却说不出来的人,也能被 AI 接住。
让那些脑子里先有声音、先有情绪、先有画面,却苦于无法用文字精确翻译的人,终于有一条属于自己的创作通道。
它的迭代逻辑很纯粹:让 AI 音乐从被动 “猜你想要”,进化为主动 “懂你所想”。正如此次迭代中音潮提出的理念,你的灵感,值得被最动听的旋律托起。
实测对比
真实存在的代差
说得再好,不如直接听。
我们对音潮大模型 V3.5 与 V4.0 进行了盲测对比,结论很明确,两代模型之间的差距远远不是 “好一点”,而是跨越式的进步。
第一组测试,用的是海外通用专业 Prompt:一首温暖、律动感十足且轻快愉悦的世界音乐,温暖的男声主唱,融入合成器贝斯与打击乐器。

音频见原文:https://mp.weixin.qq.com/s/VuH1NNFnQD2bhoX6xFMfjw
V3.5 能勉强识别 “欢快” 的基础基调,但无法将情绪、曲风、配器深度绑定,整首作品平铺直叙,缺少律动和氛围,就是大家常吐槽的 “差一口气”。

音频见原文:https://mp.weixin.qq.com/s/VuH1NNFnQD2bhoX6xFMfjw
音潮大模型 V4.0 精准锁定了 “温暖、律动、愉悦” 三个核心情绪关键词,顺势落地轻快的拉丁舞曲曲风,靠饱满流畅的律动感撑起整首作品的氛围,情绪统一、风格精准、演绎完整。
第二组测试更有意思。提示词是 “一首轻松的蓝调音乐,慵懒的男声,搭配电吉他和爵士鼓”。两代模型虽然都生成了蓝调音乐,但质感差距明显,V3.5 偏向大众化流水线风格,没有凸显曲风特色。

音频见原文:https://mp.weixin.qq.com/s/VuH1NNFnQD2bhoX6xFMfjw

音频见原文:https://mp.weixin.qq.com/s/VuH1NNFnQD2bhoX6xFMfjw
音潮大模型 V4.0 精准还原了经典十二小节正统布鲁斯结构,完美适配 “慵懒松弛” 的人声质感,风格纯度和细节把控远超旧版。
第三组加码高阶测试。提示词包含多种乐器:“一首忧郁、感性、温暖的韩国流行歌曲,融合原声吉他、电钢琴与大提琴”。

音频见原文:https://mp.weixin.qq.com/s/VuH1NNFnQD2bhoX6xFMfjw
V3.5 中,原声吉他、大提琴这些核心配器被严重弱化,乐器层次模糊、整体编曲单薄空洞。

音频见原文:https://mp.weixin.qq.com/s/VuH1NNFnQD2bhoX6xFMfjw
音潮 V4.0 精准拿捏了每一种乐器的音色特质,吉他的温润、大提琴的深情清晰突出,多乐器融合自然和谐,完美贴合忧郁又温暖的核心情绪基调。
这三组测试的指向其实是一致的:音潮 V4.0 不再机械执行你的提示词,而是真正读懂了文字背后的画面与情绪。
这背后是模型对指令理解能力的根本性提升。日常创作中,人们输入的提示词大多是碎片化、口语化、带情绪的,“想写一首深夜 emo 的歌”“要那种慵懒的调调”“来点治愈的”。旧版模型很容易机械套用参数,无法结合上下文融会贯通,最终成品自然偏离预期。
音潮大模型 V4.0 做的,是把这种 “模糊的、感性的、听觉型的” 输入,翻译成大模型能精准执行的内部表征。

“读懂” 之后
才是真正的开始
音潮大模型 V4.0 的底层重构,还解锁了两个此前国产 AI 音乐一直缺失的能力。
一是语种全覆盖。音潮 V3.5 已支持中、英、韩、西等多国语言创作,V4.0 在此基础上新增俄、德、葡、意、法五大语种,实现全球十大主流语种全覆盖。配合深耕多年的中文语境积累和本土化审美优势,音潮大模型 V4.0 彻底打破了国产 AI “只会做中文歌” 的固有偏见,真正具备了征战全球赛道的能力。
二是纯音乐生成全面开放。此前音潮的纯音乐创作能力仅面向 B 端商用客户,V4.0 上线后,普通用户也能自由使用,生成作品可自主选择 “带人声 / 纯音乐” 两种模式。短视频氛围感 BGM、影视配乐、舞台伴奏、日常解压的治愈纯音,一键生成,覆盖个人娱乐、专业创作、商业商用全场景。

这两项能力看似是 “功能更新”,实际上指向的是同一个判断:AI 音乐的终局,不是让所有人用同一种方式做同一首歌,而是让不同思维类型的人、不同场景的需求,都能找到属于自己的创作通道。
算法 + 算力双重国产化
真正走向差异化

在 AI 音乐赛道,技术实力和落地成果是硬通货。但音潮团队有一条更深层的差异化路线,常常被忽略,算法和算力的双重国产化。
音潮大模型全程依托壁仞国产 GPU 完成训练与迭代,彻底摆脱了对海外算力的依赖。
这件事的意义,远不止于 “情怀”。
当前,算力供应链的稳定性已经成为所有 AI 公司必须面对的现实问题。一家 AI 公司如果从训练到推理都依赖海外 GPU,那它的技术路线、迭代节奏甚至产品定价,都存在外部风险。
而音潮团队从第一天起就选择了国产算力,这意味着它对技术路线的掌控力更强,迭代节奏不受制于人,长期成本也更可控。
更重要的是,在国产 GPU 上训练出能够对标 Suno 的模型,本身就是对国产算力可用性的一次验证。
在产品层面,音潮团队已经形成了完整的矩阵:音潮 APP 面向普通用户,主打轻量化即时创作,最快 15 秒出旋律、一分钟生成带完整人声的成品原创歌曲,目前平台已有百万用户,日均产出上万首原创音乐。
音潮 Studio 面向专业音乐人,提供高可控、高精度的创作工作台,支持自定义曲风权重、调节创意随机度、拆分段落精细微调,相当于 24 小时在线的专属编曲助理。
Hitto 面向海外市场,以对话式写歌的新玩法布局全球,目前海外口碑相当不错。
API 平台则面向企业和开发者,提供标准化接口,集齐歌词生成、歌曲生成、歌曲仿写、歌曲扩写四大核心能力,目前正处于限时免费试用阶段。
C 端产品 + 专业工具 + 出海 + B 端,四线齐头并进,而非只靠一首主题曲出圈。
团队配置也很有意思,算法技术团队和科班音乐人跨界搭配,程序员深耕乐理、吃透音乐逻辑,音乐人深度参与模型迭代,这种组合有效避开了很多 AI 音乐 “旋律还行、毫无灵魂” 的通病。
CEO 姜涛早年深耕音频技术大厂,最初做 AI 音乐的初衷甚至带点浪漫色彩,想给妻子做一首专属纪念歌曲,却发现传统音乐制作成本动辄上万、周期几周,这创作门槛普通人根本没招,由此萌生搭建普惠 AI 音乐工具的想法。
从 “能听” 到 “想听”
回到费曼的发现。
他后来常常想起那个数数实验。特别是在教很艰深的课时,他会看见方程式的数字、符号是五彩的,J 是棕色的,N 是紫色的,X 是黑色的,四处漂浮着。他不知道学生们是怎么看它的。
这个感慨,其实也是 AI 音乐行业最需要回答的问题:你的用户是怎么 “听” 的?
长期以来,AI 音乐工具的设计逻辑,都是围绕着 “视觉型” 和 “逻辑型” 的人展开的,你写清楚,我来生成。但那些 “听觉型” 的人,那些脑子里先有旋律、先有节奏、先有情绪起伏的人,一直在被这套逻辑忽略。
音潮 V4.0 做的,不是让 AI 音乐变得更强,而是让 AI 音乐变得更能 “读懂”,读懂文字背后的画面,读懂提示词之间的情绪,读懂那些无法被精确描述却真实存在的音乐直觉。
从 “能听” 到 “想听”,差的就是这点意思。
而当 AI 音乐真正开始 “读懂” 人的时候,那些一直被文字通道挡在门外的 “听觉型” 创作者,终于有了一条属于自己的路。
AI 音乐的下一个阶段,或许不是谁生成得更快、谁参数更大,而是谁更懂站在旋律那一头的人。

注:音潮 V4.0 已于 8 月 14 日全平台上线,音潮 APP、音潮 Studio、Hitto 及 API 平台同步更新。API 平台目前处于限时免费试用阶段,所有意向合作企业与开发者完成对接接入后,即可免费调用全量 API 接口。
- 音潮API平台:https://platform.yinchaoyongxian.com/
- 音潮AI音乐创作平台:www.yinchaoyongxian.com