10美元、两小时、5500行代码,卡帕西让Claude Opus 5搭出《指环王》3D世界

栏目:互联网 | 来源:智东西 | 2026-08-03 19:13
智东西编译 茄子编辑 程茜

智东西8月3日消息,昨天,OpenAI联合创始人、现Anthropic预训练团队成员、AI大神安德烈·卡帕西(Andrej Karpathy)在X展示了一种模型测试的新方法。他让Claude Opus 5将《指环王》开篇的故事用Three.js制作成3D动画,预算100万token。最终,Claude Opus 5运行约2小时,写出约5500行代码,任务成本约为10美元(约合人民币68元),卡帕西认为成片虽然有些粗糙,但很有趣。

▲卡帕西推文(图源:X)

与“用SVG画一只骑自行车的鹈鹕”这类静态测试相比,《指环王》测试把任务从一次代码生成扩展到持续约2小时的完整制作流程。

Claude Opus 5需要理解原文、拆解场景、创建多边形资产,将人物和物体放入三维坐标,再编写镜头与动画代码,并在运行过程中检查和修改结果。最终交付物不是视频模型合成的画面,而是一个能够在浏览器中运行的Three.js程序。

▲Claude Opus 5根据《指环王》开篇生成的Three.js动画画面(图源:X)

但测试也暴露了模型的短板。Claude Opus 5不能高效观看连续视频,也无法进入场景试玩,只能缓慢截取不同时点的画面逐张检查。卡帕西称,Claude Opus 5因此出现了数次错误,最终成片仍有不少粗糙之处。

芬兰手游公司Supercell创意AI主管、AIGC创作者鲁普·雷尼斯托(Roope Rainisto)提议,将程序化动画输入Seedance等视频模型,提高画面质量。卡帕西赞同这一思路,认为程序化代码可以负责分镜和控制,视频到视频模型则负责纹理和最终视觉效果。

▲雷尼斯托建议使用视频模型提升画面质量(图源:X)

一、从骑车鹈鹕到搭建中土世界,卡帕西把静态测试扩展为两小时3D任务

过去测试大模型视觉编程能力时,开发者经常让模型“用SVG画一只骑自行车的鹈鹕”。这类任务结果直观,生成时间短,也方便比较模型能否正确理解物体、空间关系和代码语法。

卡帕西认为,模型能力已经开始越过这类单幅图像测试的范围。他此次将任务扩展为一个长程项目,向Claude Opus 5输入《指环王》开篇第一段,提供100万token预算,并要求该模型用Three.js把文字内容渲染出来。

Three.js是一款面向网页的JavaScript 3D库。开发者可以用它处理场景、灯光、阴影、材质、纹理和三维数学运算,并在浏览器中绘制3D内容。

这意味着Claude Opus 5面对的并不是一次简单的“文字转画面”请求。该模型需要先理解原文涉及的场景和叙事元素,再将这些内容拆解为程序能够调用的几何资产,确定它们在x、y、z三个坐标轴上的位置,并编写镜头、动作和时间线代码。

经过约2小时运行,Claude Opus 5生成了约5500行代码,用程序化方式完成了故事渲染。卡帕西评价成片“有些粗糙,但很有趣”。并且,令他感到难以置信的是,Claude Opus 5能够在三维坐标中摆放和组织多种多边形资产,编写动画代码,并最终生成可以运行的内容。

卡帕西在评论区附上了“鹈鹕骑自行车”测试提出者西蒙·威利森(Simon Willison)的博客链接,供用户查看更多测试案例。他还公开了此次项目的源码和浏览器版本,用户可以直接运行或继续修改。卡帕西随后调侃称,可以期待“《侠盗猎车手》霍比屯版”,它说不定会赶在《侠盗猎车手6》之前问世。

▲卡帕西公开项目源代码和浏览器版本(图源:X)

二、Claude Opus 5生成动画,配音由ElevenLabs生成

这段作品并非全部由Claude Opus 5独立完成。有网友在评论区询问,视频中的音频是否也由Claude Opus生成。卡帕西回复称,配音来自AI语音公司ElevenLabs,而且由他手动选择声音,因为他对配音效果有明确偏好。

▲卡帕西回复配音由ElevenLabs生成(图源:X)

卡帕西同时称,大模型可以比较容易地调用此类语音API。此次实验中,Claude Opus 5主要负责Three.js场景、资产和动画代码,ElevenLabs则承担配音生成。

Three.js官方账号在评论区给出专业建议,提示模型应当合理使用“实例化网格”优化渲染性能。实例化网格能够批量渲染外形、材质一致、位置不同的物体,削减GPU渲染指令开销。

卡帕西将这条建议交给Claude Opus 5后,模型检查了场景代码。按照模型给出的统计,原版霍比屯场景包含1569次独立渲染调用;如果对草地、野花等重复物体使用实例化网格,只需4次调用即可渲染1154个同类物体。

这组数据说明,Claude Opus 5生成的初版程序虽然能够运行,但没有主动采用这一常见的3D渲染优化方式,仍需外部专业反馈。

▲Three.js评论模型适当情况下使用“实例化网格”与卡帕西的恢复(图源:X)

三、10美元让定制化世界成为可能,但Claude Opus 5还不会“玩”自己的作品

卡帕西没有披露输入、输出和工具调用分别消耗了多少token,因此100万token是任务预算,不能直接理解为模型最终输出了100万token。

此次实验的价值,不在于用10美元替代一部专业动画电影,而在于让过去投入产出比过低、几乎没人愿意制作的一次性项目变得可行。大模型能够连续工作约2小时,完成数千行只服务于特定场景的代码。

卡帕西认为,这类能力可能催生按需生成的高度定制化世界。未来用户只需给出一个主题,大模型就能临时生成一个类似《侠盗猎车手》的可探索世界。例如,用户可以进入模型生成的中土世界,以旁观者、非玩家角色或原作人物的身份参与《指环王》的故事。

不过,模型的生成能力已经走在审查能力之前。Claude Opus 5无法连续观看动画或控制角色试玩,只能逐张检查截图。这种方式不仅速度慢,还会丢失动作和镜头之间的连续信息。

卡帕西称,Claude Opus 5在检查和修改过程中数次出错。该模型虽然能够生成5500行代码,却无法确认最终结果在画面、空间和时间线上是否全部正确。

与静态SVG相比,这项测试不再只看模型能否生成一张图,而是观察模型能否持续规划、运行程序、检查结果并修复错误。实验说明,Claude Opus 5已经可以把一段文字转化为可运行的3D场景,但视觉审查和错误修复能力仍未跟上代码生成能力。

卡帕西的实验没有提供一个新的标准化评测分数,但提出了另一种观察模型的方法:将模型放进开放式、跨模态、长时间运行的任务中,检查它能否把文字理解、代码生成、空间推理和视觉反馈串成完整工作流。

结语:模型已经能够搭建场景,完整游戏仍需形成测试闭环

从静态SVG到可运行的3D程序,大模型能够承担的任务长度和复杂度都在增加。一些过去因制作成本过高而无人实施的定制内容,已经可以用较低成本快速验证。

要让这类程序进一步变成可玩的游戏,模型还需要理解连续视频、操作游戏角色,并根据试玩结果定位和修改代码。目前,这些环节仍需人类参与。

来源:X

了解更多

猜你想看

← 返回首页