过去几年,Simon Willison 用同一个提示词「生成一只骑自行车的鹈鹕 SVG」测试了每一款主要 LLM 的发布。
这个原本带着调侃意味的基准,已成为 AI 领域最知名的非正式基准之一。Simon 的「骑自行车的鹈鹕」结果,经常在 AI 实验室发布新模型的 Hacker News 讨论帖中获得最高赞。
如今这个基准已足够出名,以至于 Hacker News 上出现了大量关于其实用性以及 AI 实验室是否在它上面「benchmaxxing」1的讨论。当数十亿乃至数万亿美元的利益悬而未决,一次高分结果就能说服用户时,实验室会不会忍不住在模型里偷偷「鹈鹕优化」一下?
我想一探究竟,于是做了个小实验:我让七个前沿模型生成了 1,008 张 SVG,用 LLM 作为裁判打分,并用 Claude Fable 5 进行分析。
本文展示结果。全部代码已发布在 Github。
测试方法
我构建了一个 8 种动物 × 6 种交通工具 = 48 个提示词的网格,原始提示词只是其中一格:
- 动物:鹈鹕、火烈鸟、苍鹭、水獭、浣熊、羚羊、鲸鱼、猫
- 交通工具:自行车、独轮车、滑板、滑板车、飞机、船
每个提示词的措辞几乎与 Simon 的完全相同,仅替换动物和交通工具。动物与交通工具的选择并不十分严谨,但我尽量兼顾与原始提示的相似度及难度:火烈鸟和苍鹭与鹈鹕较为相似;猫、浣熊、水獭属于简单案例;羚羊较难;鲸鱼则与原提示差异最大。
我通过 OpenRouter 测试了七个模型:GPT-5.6 Terra、Claude Sonnet 5、Gemini 3.5 Flash、Grok 4.5、Qwen3.7-Max、GLM-5.2 和 DeepSeek V4 Pro。每个提示生成 3 个样本,温度 1.0,并要求每个模型使用相同的推理强度,共得到 1,008 张 SVG。
随后我对每张图片执行三阶段流程:
- 渲染:将每张 SVG 渲染为 PNG。若模型未返回 SVG 或渲染失败,则重新生成直至成功,并记录尝试次数。1,008 次生成中仅重试了 11 次。
- 打分:GPT-5.6 Luna 对每张图片的动物、交通工具及动作连贯性分别给出 1-5 分。单独比较动物或交通工具时使用对应分值;需要单张图片综合得分时取三项平均值,称为「裁判得分」。
- 特征提取:将每张渲染图再送入 Gemini 3.1 Flash-Lite,记录其识别出的动物、交通工具、主体朝向,以及开放式场景元素列表。
我的假设是:若某实验室针对该基准做过训练,则会在「鹈鹕行」得分高于其动物应有水平、「自行车列」得分高于其交通工具应有水平,或「鹈鹕-自行车」单元格同时优于两者中任一维度的表现。
证据一:骑自行车的鹈鹕看起来并不更好
在打分之前,最简单的测试是自己看图片。点击下方任意实验室,即可查看其全部生成结果,每张图下方标注裁判得分(点击可查看原图):
我在运行后续分析前已亲自浏览所有图片,没有发现异常。我没看到哪家实验室的「鹈鹕-自行车」图片明显优于其网格中的其他图片。或许 GLM-5.2 的第一张样本感觉稍好,但同一批次里也有一张相当不错的「滑板上的苍鹭」,因此无法确定。其他样本与各模型的整体风格一致——擅长画「骑自行车的鹈鹕」的实验室,也同样擅长其他动物-交通工具组合。
但这种肉眼测试难以复现,且主观性强。因此我采用了上述定量方法。
证据二:各实验室画鹈鹕并不更强
下图是所有模型汇总后,各动物的平均评分:
鹈鹕排在第 6/8,落后于猫、鲸鱼、浣熊、苍鹭和羚羊。若实验室针对该基准做过训练,鹈鹕应排在最前。实际情况恰恰相反:七家实验室画猫、鲸鱼和浣熊都比鹈鹕更好。
当然,鹈鹕可能本身就比猫难画。即使实验室针对鹈鹕做过训练,也未必能让它超过简单动物,因此仅凭此排名无法完全排除可能性。我会在证据四中调整难度。
证据三:各实验室画自行车并不更强
自行车表现更差,排在倒数第二,与垫底的飞机几乎并列:
若实验室针对该基准做过训练,自行车应排在靠前位置,但事实并非如此。不过同样存在上文所述的限制:自行车比滑板更难画——它需要两个匹配的轮子、连接两轴的车架、车把、车座和踏板。裁判发现 2/3 的自行车图片缺少或断开其中至少一项。你可以针对自行车图片训练,但相对简单交通工具仍可能表现不佳。
关于「飞机」的补充说明:我本应选用「airplane」而非「plane」,因为模型常将其理解为几何平面。它们画出动物站在平面而非驾驶飞行器。「飞机」是唯一有时被特征提取器判定「无交通工具」的类别(168 张图片中有 25 张,其余五种交通工具均为 0),且 20% 的飞机图片在交通工具评分中仅得 1 或 2 分,而自行车仅 5%,船、滑板车和滑板则为 0%。
证据四:即使调整难度,各实验室画「骑自行车的鹈鹕」仍无优势
综合以上两点,「鹈鹕-自行车」组合在 48 个格子中排在第 42 位:
但某些组合可能本身就更难画。
为校正难度,我对全部 1,008 张图片拟合了固定效应回归:score ~ lab + animal × vehicle,并加入各实验室对「鹈鹕」「自行车」及「鹈鹕-自行车」单元格的交互项,使用稳健标准误。animal × vehicle 项吸收了 48 个组合的固有难度;交互项衡量各实验室相对于平均水平的基准特定提升,并附带置信区间。
结果如下:
- 各实验室的「鹈鹕效应」(该实验室在全部六种交通工具上的鹈鹕提升)介于 -0.11 至 +0.14 裁判分之间,均不显著(最小 p = 0.25)。
- 各实验室的「自行车效应」(该实验室在全部八种动物上的自行车提升)从 Grok 4.5 的 -0.18(p=0.11)到 Gemini 3.5 Flash 的 +0.27(p=0.022)不等。仅 Gemini 达到 p < 0.05,且七个方向各异。
- 没有任何实验室的「鹈鹕-自行车」单元格效应(在该实验室已有的鹈鹕和自行车效应之外的额外提升)达到 p < 0.05。最大正值为 GLM-5.2 的 +0.35(p=0.12),正是我之前提到的那家。它是本次实验中最接近信号的,但仍在随机范围内。
各实验室的完整估计值如下。若某实验室在「鹈鹕优化」,其整行圆点应位于零线右侧:
所有「鹈鹕」区间和所有「单元格」区间均包含零。唯一不包含零的是 Gemini 3.5 Flash 在「自行车」列。但在 21 次检验中,p < 0.05 时,随机预期约出现 1 次假阳性(21 × 0.05 ≈ 1.05),而实际恰好出现 1 次。该结果也未通过多重比较校正:Bonferroni 阈值为 0.05/21 ≈ 0.002,而其 p 值为 0.022。完整估计值与 p 值表见 仓库。
不过这些区间较宽,平均约 ±0.6 裁判分。任何小于该值的提升均无法被本测试捕捉。
证据五:「鹈鹕-自行车」场景看起来不像被记忆
有人认为「骑自行车的鹈鹕」像被记忆的构图,指出 recurring 模式如鹈鹕总是朝右,或反复出现的元素如太阳或围巾。因此我想验证这是否属实。
朝向:全部 21 张「鹈鹕-自行车」图片(跨七家实验室)均朝右。其他任何动物/交通工具组合均未出现这种情况。
然而朝右很常见:全部 1,008 张图片中有 60% 朝右。朝右比例因动物和交通工具而异,自行车是朝右比例最高的两种交通工具之一:
| 交通工具 | 左 | 右 | 模糊 |
|---|---|---|---|
| 滑板车 | 9% | 83% | 8% |
| 自行车 | 11% | 81% | 8% |
| 滑板 | 19% | 60% | 21% |
| 飞机 | 21% | 58% | 21% |
| 独轮车 | 22% | 45% | 33% |
| 船 | 33% | 35% | 32% |
鹈鹕也是倾向朝右的动物之一:
| 动物 | 左 | 右 | 模糊 |
|---|---|---|---|
| 羚羊 | 21% | 78% | 1% |
| 鹈鹕 | 22% | 78% | 0% |
| 苍鹭 | 22% | 77% | 1% |
| 鲸鱼 | 34% | 65% | 1% |
| 火烈鸟 | 36% | 64% | 0% |
| 水獭 | 8% | 45% | 47% |
| 猫 | 8% | 40% | 52% |
| 浣熊 | 3% | 36% | 61% |
画正面的鹈鹕或自行车比较困难,因此模型几乎总是从侧面绘制,朝左或朝右。这也是为什么模糊朝向的图片极少。其他组合也接近单向:羚羊滑板车和鹈鹕滑板车均为 20/21,苍鹭自行车为 19/21。因此 21/21 并非异常值。
场景元素:我让提取器列出图片中出现的任意元素。统计结果如下:
若场景被记忆,则相同元素会反复出现。我寻找了这种模式,发现某些组合确实倾向于每次都出现相同元素:每张「船上的火烈鸟」都有太阳;「飞机上的水獭」38% 的时间戴围巾;「自行车上的猫」38% 的时间有篮子。
「骑自行车的鹈鹕」并未表现出任何特别之处。它只是像其他动物-交通工具组合一样,某些元素出现频率较高。
局限性
- 使用单一 LLM 裁判打分。 所有分数均来自一个模型 GPT-5.6 Luna 逐张图片打分。我未做充分对齐,也未检查其自一致性。若模型无法可靠地判断绘图质量,则上述数字均无意义。该裁判与参赛模型之一 GPT-5.6 Terra 同属一个系列。然而每家实验室都生成了全部 48 个组合,若裁判恰好偏好某实验室风格,则会整体提升该实验室的网格得分。但这不改变结论,因为本分析仅关注实验室内部差异。
- SVGmaxxing。 若某实验室针对 SVG 生成整体(或「动物骑交通工具」子集)进行优化,则所有单元格得分都会上升,与单纯擅长绘制的实验室表现相同。部分实验室(如 Google/DeepMind)已公开这样做。本实验无法检测此类情况。
- 预算有限。 整个实验仅花费约 80 美元 API 额度。因此限制为每格 3 个样本、单一裁判及 7 个模型。这也导致无法对提示词和流程进行过多迭代(如「plane」与「airplane」的案例)。
结论
抱歉,HN 上的批评者,本实验几乎没有证据表明 AI 实验室在「鹈鹕优化」。至少他们没有以明显方式这样做。
鹈鹕的绘制质量并不优于其他动物;自行车的绘制质量也不优于其他交通工具;没有任何实验室在「鹈鹕-自行车」组合上的表现超出其「鹈鹕」和「自行车」单独表现的预测。GLM-5.2 最接近:它在「鹈鹕-自行车」单元格上的提升最大,且其第一张样本引起了我的注意。但效应很小且不显著,因此我不认为这有太大意义。
另一个值得注意的现象是场景构图的朝向。全部 21 张「鹈鹕-自行车」图片均朝右,这是网格中唯一全部图片朝向一致的组合。但这并不奇怪:朝右是本次实验的常态。有三个其他组合达到 90% 或以上朝右率,而在 48 个组合中,出现一个 21/21 的情况并不意外。
更合理的解释是像 Google/DeepMind 那样的「SVGmaxxing」。其他实验室可能也在悄悄做类似事情。可惜本实验无法指出是谁。但至少你今晚可以安心:AI 实验室并没有为了欺骗 Simon Willison 而生成 TB 级的「骑自行车的鹈鹕」。
若想自行查看数据,完整流程已发布在 仓库。
脚注
指针对热门基准优化 AI 模型以获取高分的做法。↩︎
引用
BibTeX 引用:
@online{castillo2026,
author = {Castillo, Dylan},
title = {Are {AI} Labs Pelicanmaxxing?},
date = {2026-07-18},
url = {https://dylancastillo.co/posts/pelicanmaxxing.html},
langid = {en}
}
引用格式请参考:
Castillo, Dylan. 2026. “Are AI Labs Pelicanmaxxing?” 7 月 18 日. https://dylancastillo.co/posts/pelicanmaxxing.html.
0 Comments
Log in to join the conversation.No comments yet. Be the first to share your thoughts.