Karpathy 用指环王开篇测试 Opus 5 的长时程生成

Karpathy 在 X 上提出一个新观察:对 LLM 的测试正在离开「画一只骑自行车的鹈鹕」这类单步提示的范畴。作为延伸实验,他给 Opus 5 一段《指环王》开篇文字和 1M token 的预算(约 10 美元),要求用 three.js 渲染出来。模型自主工作了约两小时,写下 5500 行代码,程序化地构建出一个可交互的故事场景,源码已公开在 karpathy.ai/lotr-movie。

这个例子的意义在于成本结构的变化:这类超个性化的内容过去「没人会花时间做」,现在变成「为什么不呢,反正近乎免费」。他设想按需生成可进入的定制世界——一种按需生成的「临时 GTA」。但实验也暴露了模型短板:模型无法原生观看视频或亲自进入游戏自查,Opus 5 只能缓慢地截图检查,产出不少瑕疵。多模态感知与玩法审计仍是明显缺口。

对智能体经济而言,长时程自主任务的边际成本趋零,正在改写内容生产的边界;评估模型的方式也需要从单步 benchmark 转向任务级考察。

阅读原文