过去几年,Simon Willison 用同一个提示词「生成一只骑自行车的鹈鹕 SVG」测试了每一款主要 LLM 的发布。

这个原本带着调侃意味的基准,已成为 AI 领域最知名的非正式基准之一。Simon 的「骑自行车的鹈鹕」结果,经常在 AI 实验室发布新模型的 Hacker News 讨论帖中获得最高赞。

如今这个基准已足够出名,以至于 Hacker News 上出现了大量关于实用性以及 AI 实验室是否在它上面「benchmaxxing」1的讨论。当数十亿乃至数万亿美元的利益悬而未决,一次高分结果就能说服用户时,实验室会不会忍不住在模型里偷偷「鹈鹕优化」一下?

我想一探究竟,于是做了个小实验:我让七个前沿模型生成了 1,008 张 SVG,用 LLM 作为裁判打分,并用 Claude Fable 5 进行分析。

本文展示结果。全部代码已发布在 Github

测试方法

我构建了一个 8 种动物 × 6 种交通工具 = 48 个提示词的网格,原始提示词只是其中一格:

  1. 动物:鹈鹕、火烈鸟、苍鹭、水獭、浣熊、羚羊、鲸鱼、猫
  2. 交通工具:自行车、独轮车、滑板、滑板车、飞机、船

每个提示词的措辞几乎与 Simon 的完全相同,仅替换动物和交通工具。动物与交通工具的选择并不十分严谨,但我尽量兼顾与原始提示的相似度及难度:火烈鸟和苍鹭与鹈鹕较为相似;猫、浣熊、水獭属于简单案例;羚羊较难;鲸鱼则与原提示差异最大。

我通过 OpenRouter 测试了七个模型:GPT-5.6 TerraClaude Sonnet 5Gemini 3.5 FlashGrok 4.5Qwen3.7-MaxGLM-5.2DeepSeek V4 Pro。每个提示生成 3 个样本,温度 1.0,并要求每个模型使用相同的推理强度,共得到 1,008 张 SVG。

随后我对每张图片执行三阶段流程:

  1. 渲染:将每张 SVG 渲染为 PNG。若模型未返回 SVG 或渲染失败,则重新生成直至成功,并记录尝试次数。1,008 次生成中仅重试了 11 次。
  2. 打分GPT-5.6 Luna 对每张图片的动物、交通工具及动作连贯性分别给出 1-5 分。单独比较动物或交通工具时使用对应分值;需要单张图片综合得分时取三项平均值,称为「裁判得分」。
  3. 特征提取:将每张渲染图再送入 Gemini 3.1 Flash-Lite,记录其识别出的动物、交通工具、主体朝向,以及开放式场景元素列表。

我的假设是:若某实验室针对该基准做过训练,则会在「鹈鹕行」得分高于其动物应有水平、「自行车列」得分高于其交通工具应有水平,或「鹈鹕-自行车」单元格同时优于两者中任一维度的表现。

证据一:骑自行车的鹈鹕看起来并不更好

在打分之前,最简单的测试是自己看图片。点击下方任意实验室,即可查看其全部生成结果,每张图下方标注裁判得分(点击可查看原图):

我在运行后续分析前已亲自浏览所有图片,没有发现异常。我没看到哪家实验室的「鹈鹕-自行车」图片明显优于其网格中的其他图片。或许 GLM-5.2 的第一张样本感觉稍好,但同一批次里也有一张相当不错的「滑板上的苍鹭」,因此无法确定。其他样本与各模型的整体风格一致——擅长画「骑自行车的鹈鹕」的实验室,也同样擅长其他动物-交通工具组合。

但这种肉眼测试难以复现,且主观性强。因此我采用了上述定量方法。

证据二:各实验室画鹈鹕并不更强

下图是所有模型汇总后,各动物的平均评分:

图 1:所有模型汇总后的各动物平均评分。

鹈鹕排在第 6/8,落后于猫、鲸鱼、浣熊、苍鹭和羚羊。若实验室针对该基准做过训练,鹈鹕应排在最前。实际情况恰恰相反:七家实验室画猫、鲸鱼和浣熊都比鹈鹕更好。

当然,鹈鹕可能本身就比猫难画。即使实验室针对鹈鹕做过训练,也未必能让它超过简单动物,因此仅凭此排名无法完全排除可能性。我会在证据四中调整难度。

证据三:各实验室画自行车并不更强

自行车表现更差,排在倒数第二,与垫底的飞机几乎并列:

图 2:所有模型汇总后的各交通工具平均评分。

若实验室针对该基准做过训练,自行车应排在靠前位置,但事实并非如此。不过同样存在上文所述的限制:自行车比滑板更难画——它需要两个匹配的轮子、连接两轴的车架、车把、车座和踏板。裁判发现 2/3 的自行车图片缺少或断开其中至少一项。你可以针对自行车图片训练,但相对简单交通工具仍可能表现不佳。

关于「飞机」的补充说明:我本应选用「airplane」而非「plane」,因为模型常将其理解为几何平面。它们画出动物站在平面而非驾驶飞行器。「飞机」是唯一有时被特征提取器判定「无交通工具」的类别(168 张图片中有 25 张,其余五种交通工具均为 0),且 20% 的飞机图片在交通工具评分中仅得 1 或 2 分,而自行车仅 5%,船、滑板车和滑板则为 0%。

证据四:即使调整难度,各实验室画「骑自行车的鹈鹕」仍无优势

综合以上两点,「鹈鹕-自行车」组合在 48 个格子中排在第 42 位:

图 3:全部 48 个组合排名;已高亮「鹈鹕+自行车」。

但某些组合可能本身就更难画。

为校正难度,我对全部 1,008 张图片拟合了固定效应回归:score ~ lab + animal × vehicle,并加入各实验室对「鹈鹕」「自行车」及「鹈鹕-自行车」单元格的交互项,使用稳健标准误。animal × vehicle 项吸收了 48 个组合的固有难度;交互项衡量各实验室相对于平均水平的基准特定提升,并附带置信区间。

结果如下:

  1. 各实验室的「鹈鹕效应」(该实验室在全部六种交通工具上的鹈鹕提升)介于 -0.11 至 +0.14 裁判分之间,均不显著(最小 p = 0.25)。
  2. 各实验室的「自行车效应」(该实验室在全部八种动物上的自行车提升)从 Grok 4.5 的 -0.18(p=0.11)到 Gemini 3.5 Flash 的 +0.27(p=0.022)不等。仅 Gemini 达到 p < 0.05,且七个方向各异。
  3. 没有任何实验室的「鹈鹕-自行车」单元格效应(在该实验室已有的鹈鹕和自行车效应之外的额外提升)达到 p < 0.05。最大正值为 GLM-5.2 的 +0.35(p=0.12),正是我之前提到的那家。它是本次实验中最接近信号的,但仍在随机范围内。

各实验室的完整估计值如下。若某实验室在「鹈鹕优化」,其整行圆点应位于零线右侧:

图 4:各实验室经难度调整后的效应,附 95% 置信区间。已高亮不包含零的区间。

所有「鹈鹕」区间和所有「单元格」区间均包含零。唯一不包含零的是 Gemini 3.5 Flash 在「自行车」列。但在 21 次检验中,p < 0.05 时,随机预期约出现 1 次假阳性(21 × 0.05 ≈ 1.05),而实际恰好出现 1 次。该结果也未通过多重比较校正:Bonferroni 阈值为 0.05/21 ≈ 0.002,而其 p 值为 0.022。完整估计值与 p 值表见 仓库

不过这些区间较宽,平均约 ±0.6 裁判分。任何小于该值的提升均无法被本测试捕捉。

证据五:「鹈鹕-自行车」场景看起来不像被记忆

有人认为「骑自行车的鹈鹕」像被记忆的构图,指出 recurring 模式如鹈鹕总是朝右,或反复出现的元素如太阳或围巾。因此我想验证这是否属实。

朝向:全部 21 张「鹈鹕-自行车」图片(跨七家实验室)均朝右。其他任何动物/交通工具组合均未出现这种情况。

然而朝右很常见:全部 1,008 张图片中有 60% 朝右。朝右比例因动物和交通工具而异,自行车是朝右比例最高的两种交通工具之一:

交通工具 模糊
滑板车 9% 83% 8%
自行车 11% 81% 8%
滑板 19% 60% 21%
飞机 21% 58% 21%
独轮车 22% 45% 33%
33% 35% 32%

鹈鹕也是倾向朝右的动物之一:

动物 模糊
羚羊 21% 78% 1%
鹈鹕 22% 78% 0%
苍鹭 22% 77% 1%
鲸鱼 34% 65% 1%
火烈鸟 36% 64% 0%
水獭 8% 45% 47%
8% 40% 52%
浣熊 3% 36% 61%

画正面的鹈鹕或自行车比较困难,因此模型几乎总是从侧面绘制,朝左或朝右。这也是为什么模糊朝向的图片极少。其他组合也接近单向:羚羊滑板车和鹈鹕滑板车均为 20/21,苍鹭自行车为 19/21。因此 21/21 并非异常值。

场景元素:我让提取器列出图片中出现的任意元素。统计结果如下:

图 5:开放式提取中各元素出现的图片占比。

若场景被记忆,则相同元素会反复出现。我寻找了这种模式,发现某些组合确实倾向于每次都出现相同元素:每张「船上的火烈鸟」都有太阳;「飞机上的水獭」38% 的时间戴围巾;「自行车上的猫」38% 的时间有篮子。

「骑自行车的鹈鹕」并未表现出任何特别之处。它只是像其他动物-交通工具组合一样,某些元素出现频率较高。

局限性

  1. 使用单一 LLM 裁判打分。 所有分数均来自一个模型 GPT-5.6 Luna 逐张图片打分。我未做充分对齐,也未检查其自一致性。若模型无法可靠地判断绘图质量,则上述数字均无意义。该裁判与参赛模型之一 GPT-5.6 Terra 同属一个系列。然而每家实验室都生成了全部 48 个组合,若裁判恰好偏好某实验室风格,则会整体提升该实验室的网格得分。但这不改变结论,因为本分析仅关注实验室内部差异。
  2. SVGmaxxing。 若某实验室针对 SVG 生成整体(或「动物骑交通工具」子集)进行优化,则所有单元格得分都会上升,与单纯擅长绘制的实验室表现相同。部分实验室(如 Google/DeepMind)已公开这样做。本实验无法检测此类情况。
  3. 预算有限。 整个实验仅花费约 80 美元 API 额度。因此限制为每格 3 个样本、单一裁判及 7 个模型。这也导致无法对提示词和流程进行过多迭代(如「plane」与「airplane」的案例)。

结论

抱歉,HN 上的批评者,本实验几乎没有证据表明 AI 实验室在「鹈鹕优化」。至少他们没有以明显方式这样做。

鹈鹕的绘制质量并不优于其他动物;自行车的绘制质量也不优于其他交通工具;没有任何实验室在「鹈鹕-自行车」组合上的表现超出其「鹈鹕」和「自行车」单独表现的预测。GLM-5.2 最接近:它在「鹈鹕-自行车」单元格上的提升最大,且其第一张样本引起了我的注意。但效应很小且不显著,因此我不认为这有太大意义。

另一个值得注意的现象是场景构图的朝向。全部 21 张「鹈鹕-自行车」图片均朝右,这是网格中唯一全部图片朝向一致的组合。但这并不奇怪:朝右是本次实验的常态。有三个其他组合达到 90% 或以上朝右率,而在 48 个组合中,出现一个 21/21 的情况并不意外。

更合理的解释是像 Google/DeepMind 那样的「SVGmaxxing」。其他实验室可能也在悄悄做类似事情。可惜本实验无法指出是谁。但至少你今晚可以安心:AI 实验室并没有为了欺骗 Simon Willison 而生成 TB 级的「骑自行车的鹈鹕」。

若想自行查看数据,完整流程已发布在 仓库

脚注

  1. 指针对热门基准优化 AI 模型以获取高分的做法。↩︎

引用

BibTeX 引用:

@online{castillo2026,
  author = {Castillo, Dylan},
  title = {Are {AI} Labs Pelicanmaxxing?},
  date = {2026-07-18},
  url = {https://dylancastillo.co/posts/pelicanmaxxing.html},
  langid = {en}
}

引用格式请参考:

Castillo, Dylan. 2026. “Are AI Labs Pelicanmaxxing?” 7 月 18 日. https://dylancastillo.co/posts/pelicanmaxxing.html.