❯ Karpathy 宣布鹈鹕测试退役,用 100 万 token 让 Opus 5 把《魔戒》渲染成可玩场景
流行评测终结Andrej Karpathy 在社交平台披露了一组实验数据,并称用”画一只骑自行车的鹈鹕”来测大模型的时代快结束了。他给 Opus 5 喂进《魔戒》第一段,配 100 万 token 预算(约 10 美元),让它做 three.js 渲染。模型跑了约两小时、写出 5500 行代码,程序化地把这段文字渲染成一个可在浏览器里游走的场景。源码已开源,可直接打开来玩。
从产出物到世界他给出的判断比这个实验本身更值得记:模型正从生成单个产出物,转向按需造出高度定制的整个世界——但它仍然缺乏原生感知与审计自己造出来的东西的能力。这是个具体的工程缺口,不是哲学感慨:5500 行代码渲染出的画面对不对、有没有穿模、是不是忠于原文,模型自己看不见,只能靠人打开浏览器去看。Simon Willison——“鹈鹕骑自行车”这个测试的提出者——也参与了讨论。旧测试失效的原因很朴素:前沿模型现在都能画得像样,那道题已经问不出差距了。
评测要跟着预算走要跟着改的是评测的成本量级。一道题几百 token、几秒出结果的测法,测不出一个能连续工作两小时的模型;而按 10 美元一次的跑法,任何榜单都很难做成日更。做模型评测的团队面前摆着一个新约束:长任务的评分标准由谁来定。人工验收 5500 行代码不现实,让另一个模型来验,又回到了”模型看不见自己产出”的原点。
▪ SIGNAL模型已经能造世界,却还没长出眼睛——评测的瓶颈从出题变成了验收。