全文探讨定制化游戏世界的可能性与AI当前的空间认知缺陷。
你管这叫鹈鹕自行车测试的升级版?
还记得去年全网疯传的那个测试吗?让AI画一只骑自行车的鹈鹕。那玩意儿的走红程度堪比猫猫表情包。大家比谁的鹈鹕翅膀更自然,谁的车轮更圆润。但Karpathy这哥们儿直接掀桌子了。他觉得让AI画一只静态的鸟已经不够看了。他要让AI凭空创造一个世界。
你给他《指环王》的第一段文字。就一段。他让Opus 5模型花了将近两个小时,吭哧吭哧写了5500行代码。然后这代码在浏览器里跑出来一个袋底洞的3D场景。有树,有山坡,有那个圆形的绿色大门。比尔博·巴金斯还在门口晃悠了一圈然后消失了。这玩意儿看着确实有点粗糙,画面抖动得跟手持摄像机拍的似的。但问题是——这玩意儿是AI从一个文本段落里硬生生“想”出来的。
这不是画图。这是造物。
AI在干一件正常人绝对不会花时间去做的事。你想想,哪个脑子正常的人会为了一个社交媒体的帖子,花上两个小时去写五千多行三维渲染代码?只有AI有这个耐心。因为对于它来说,两小时和两秒钟可能区别不大。它不会被“这事儿太麻烦了”这种人类独有的懒惰情绪影响。
为啥AI宁可写代码也不肯老实画图?
这里有个特别反直觉的现象。你让AI画一只骑自行车的鹈鹕,它画出来的玩意儿经常缺胳膊少腿。车轮子是方的,鸟嘴长在肚子上。但你让它写一段生成三维场景的JavaScript代码,它居然能把霍比特人的洞穴给搭出来。这背后的逻辑是啥?
因为大语言模型本质上是个文字接龙游戏。它最擅长的是预测下一个词该是什么。当你要求它生成一张图片时,它是在像素空间里做预测。那个空间对它来说太混乱了。但当你要求它写代码时,它是在逻辑空间里做预测。代码有语法规则,有函数调用,有坐标系。这些东西在它的训练数据里多得是。
本质上,AI是通过数学公式来理解世界的。它把“袋底洞”这个词转换成了三维空间里的x、y、z坐标。它把“圆形大门”转换成了几何体参数。这就好比一个盲人通过触摸来理解大象的形状。它看不见,但它能用数学描述。所以我们现在看到的场景是——AI在视觉生成上笨手笨脚,但在程序化生成上却像个经验丰富的架构师。
十美元买一段尴尬的动画到底图啥?
Karpathy提到这次实验的成本大概是10美元。1M token的预算。10美元在纽约连个像样的三明治都买不到。但在这边,你买到了一个AI耗费两个小时算力产出的虚拟世界。这听起来很划算对吧?问题在于这个世界的质量。它勉强能看,但绝对称不上精美。窗户浮在半空中,树木的贴图错位,比尔博消失的方式像是被黑洞吸走了。
但Karpathy的观点恰恰在于此。他说这种例子之所以有趣,是因为“正常人绝对不会花时间去写这种定制化的东西”。以前你如果想做一个《指环王》的粉丝向3D场景,你得学Blender,学建模,学纹理烘焙。那是几百个小时的工作量。现在你只需要10美元和一段话。质量从“专业级”降级到了“能看出来是那么回事儿”。
这就引出了一个认知层面的反差。我们习惯了用“质量”来评判一个东西好不好。但如果成本趋近于零,质量的权重就会下降。当你花10美元就能生成一个凑合能看的3D场景时,你会突然发现自己愿意容忍很多瑕疵。这就像你花两块钱买了个一次性打火机,你不会介意它外壳有点毛刺,能用就行。AI生成的世界正在变成那种“能用就行”的一次性商品。
我们离定制版GTA还有多远?
Karpathy提出了一个让人兴奋的愿景。想象一下,你打开一个游戏,里面的世界是根据你刚读完的那本小说实时生成的。你可以作为一个NPC旁观者进入《指环王》的世界。或者你直接扮演甘道夫。又或者你想要一个“赛博朋克版的《傲慢与偏见》”。今天下午你想玩什么,AI就给你现搓一个出来。
这听起来像科幻小说对吧?但Karpathy认为这已经触手可及。因为基础能力已经具备了。AI能写代码,能生成三维模型,能理解文本语义。现在缺的只是一个把这些东西串起来的编排层。就像你有了面粉、鸡蛋和糖,只差一个食谱和烤箱。
但这里有个巨大的坑。你发现没有?所有这些“生成世界”的实验,都是AI在单方面输出。它写代码,然后你在浏览器里看结果。这是一个单向通道。真正意义上的可玩世界是需要互动的。你得能走进去,能推开门,能跟NPC说话。目前的AI生成代码能做到“看起来像个世界”,但做不到“运行起来像个世界”。因为后者需要极低的延迟和极高的逻辑一致性。
AI给自己做体检的能力约等于零
Karpathy指出了一个非常致命的弱点。他说AI在这个领域暴露了一个巨大的短板——它们没法高效地审视自己的作品。你想啊,一个人类画家画完一幅画,看一眼就知道哪儿画歪了。一个人类程序员写完代码,跑一下测试就知道哪儿崩了。
但AI不行。AI“看”不到自己生成的3D场景。它只能通过文字描述或者代码逻辑来推测。在Opus 5生成这个《指环王》场景的过程中,它不得不非常缓慢且痛苦地在不同节点截取屏幕截图,然后通过视觉模块去“看”这些截图。这相当于一个盲人在黑暗中摸象,摸一下,调整一下,再摸一下。效率极低。
而且这玩意儿经常翻车。它以为窗户在墙上,结果代码写出来窗户在天上飘。它以为树在房子前面,结果树插在了房子正中间。这种“视觉自省”能力的缺失,意味着目前的AI虽然能造物,但它是个不会检查作业的学生。它把作业写完了就交卷,对错全看运气。
我们是不是在给AI当免费的产品经理?
这里面有个特别讽刺的点。所有人都在欢呼AI能生成3D世界了,但仔细一看,那个世界全是bug。窗户悬空,贴图撕裂,物理引擎跟不存在一样。然而大家依然觉得这很了不起。为什么?因为参照物变了。
以前我们评判一个3D场景,标准是《阿凡达》或者《荒野大镖客2》。现在我们评判一个AI生成的3D场景,标准是“去年AI还只能画歪把子自行车”。标准的降低让我们对“进步”产生了幻觉。Karpathy当然知道这玩意儿烂。但他把这种“烂”包装成了“探险”。他说这是暴露弱点的好机会。
这就是顶级认知策略师的玩法。他不跟你讨论这东西能不能用。他跟你讨论这东西“展示了什么可能性”。他把你的注意力从“窗户在飞”转移到“天啊它居然知道袋底洞长什么样”。这是一个认知框架的转移。一旦你接受了这个新框架,你就会觉得10美元花得真值,那些bug反而成了“可爱的瑕疵”。
为什么学渣AI反而在创造世界?
我们继续深挖这个认知冲突。按照常理,一个连自行车链条都画不明白的AI,应该是个学渣对吧?但这个学渣居然能写三维空间变换矩阵。这就像一个连鞋带都系不好的人,突然解出了微积分方程。这背后是训练数据的分布问题。
AI在训练时看到过几百万张图片,但它看到的代码更多。尤其是在GitHub上那些开源的三维引擎代码。那些代码包含了大量关于空间、光照、透视的知识。AI把这些知识以参数的形式压缩进了神经网络里。当你说“袋底洞”时,它激活的不仅是关于《指环王》的文本记忆,还有关于“如何用Three.js构建一个圆形建筑”的代码记忆。
所以它不是在“理解”空间,它是在“复现”代码模板。它见过类似的结构。它知道在这种场景下通常怎么定义摄像机位置,怎么设置环境光。这就像鹦鹉学舌,但学的是一门叫“计算机图形学”的外语。它能流利地背诵句子,但不一定懂语法。所以它生成的场景乍一看像回事,细看全是逻辑硬伤。这恰恰说明了目前大语言模型的本质——高级的模板匹配器。
被压缩的想象力
我们再来聊聊所谓的“定制化世界”到底有多大价值。Karpathy想象的那种“按需生成的GTA”,听起来确实很酷。但这里有一个哲学问题。如果世界是为你一个人现搓的,这个世界还有探索的乐趣吗?
游戏之所以好玩,很大一部分原因在于它的“确定性”和“共享性”。你知道艾尔登法环里的那个隐藏洞穴就在那里,不管你去不去,它都在。你可以跟朋友讨论怎么找到它。但如果AI在你进入游戏的前一秒才生成那个洞穴,它就没有“历史”可言。它是一个泡沫。吹出来很美,一戳就破。
这种“瞬时生成”的东西,在认知心理学上被称为“低投入体验”。人类对于需要付出努力才能获得的东西,会给予更高的价值评价。如果你只是花了10美元和一段话就得到了一个世界,你会在里面待多久?大概率是五分钟,拍个屏,发个推,然后关掉。AI消除了创作的摩擦力,但也抹掉了作品背后的故事和意义。
10美元的精神鸦片
最后我们回到那个最核心的反差。Karpathy说这是“从没人会这么做变成为什么不呢,反正几乎免费”的例子。但他偷换了一个概念。对AI来说,“几乎免费”意味着算力成本低。对人类来说,“几乎免费”意味着心理负担小。但这两种“免费”碰撞在一起,产生了一种新型的消费主义。
你花10美元让AI给你造了一个《指环王》的梦。这个梦粗糙、短暂、充满bug。但你发到社交媒体上,收获了几百个点赞。你获得的不是那个世界的体验,而是“我居然用AI造了一个世界”的优越感。这10美元买的是幻觉,不是产品。
现在的AI生成内容正在批量制造这种廉价幻觉。它们看起来像是通往未来的钥匙,实际上只是通往你钱包的钥匙。我们在这股浪潮里冲浪,觉得浪很高,但忘了自己其实在浴缸里。直到AI真正解决那个“视觉自省”的短板之前,所有关于“定制化世界”的讨论,都不过是科技圈的高级自慰。
总结:AI生成3D世界的能力看似惊艳,实则是文本接龙模型在代码领域的投机取巧。十美元买来的粗糙场景远不足以支撑“定制化GTA”的野心,视觉自省能力的缺失更是致命硬伤。与其说这是通向元宇宙的阶梯,不如说它是我们集体自我感动的一场行为艺术。可惜大家都沉醉在这廉价的造物主幻觉里,没人愿意戳破这层窗户纸。
网友灌水
根据Hacker News原帖下的讨论,网友观点主要集中在以下几个层面:
1. 对“鹈鹕测试”是否过时的争议
- 一派认为:当前最先进的模型(如Grok、GPT-5.6、Sonnet 5)生成的鹈鹕自行车SVG仍存在明显结构错误(链条、前叉、车架角度),说明该测试远未“解决”,人类对细节的感知依然远高于AI。
- 另一派认为:既然人类自己凭记忆画自行车也常常错漏百出,这个测试已经触及“合理预期”上限,继续纠缠细节没有意义,应该转向更复杂的任务(如3D场景生成)。
2. 对《指环王》3D渲染实验的评价
- 多数网友承认这个Demo在技术层面令人印象深刻(AI能写5500行Three.js代码且跑出可识别场景),但指出它严重依赖训练数据中的电影画面和粉丝艺术,本质是“复现”而非“创造”。
- 不少人批评最终效果“粗糙”“窗子悬浮”“物理错误”,认为这恰恰暴露了AI在空间推理和视觉自省上的短板,远达不到可玩或可用的标准。
3. 对“AI生成游戏/世界”前景的怀疑
- 大量游戏从业者和玩家吐槽:目前所有“一键生成”的游戏都毫无可玩性,缺乏手感、关卡设计和创意,只是“技术演示”而非“产品”,热度来自“看熊跳舞”的猎奇心态,而非实际价值。
- 有人指出:LLM生成的代码在后续迭代中极易崩坏,维护成本极高,且无法像人类设计师那样反复打磨“好玩”的细节。
4. 对成本和商业动机的质疑
- 网友算账:$10成本并不“免费”,且背后是数据中心电费和投资人的钱;Karpathy作为Anthropic员工,此番言论有为其雇主宣传的嫌疑。
- 也有人认为,即便$10能搞出个粗糙Demo,也只是“烧钱换流量”,对真实生产力场景帮助甚微。
5. 对AI未来能力的冷静判断
- 共识是:当前LLM在代码生成上确实强,但缺乏对物理世界和视觉输出的内在校验能力(只能靠截图反馈,效率极低),这是短期瓶颈。
- 多数人并不相信“按需定制GTA”会在近期成真,因为游戏的核心是交互、社区和长期内容沉淀,而不是一次性生成的静态场景。
总体而言,HN评论区呈现两极:一面惊叹于“居然能跑起来”,另一面则对这种“粗糙但花哨”的Demo持强烈保留态度,认为其噱头大于实质,且技术天花板清晰可见。