過去幾年,Simon Willison 都用同一個提示詞測試每一次主要的 LLM 發佈:「Generate an SVG of a pelican riding a bicycle」。

這個原本帶點戲謔意味的基準,已經成為 AI 領域最知名的非正式基準之一。Simon 的「騎自行車的鵜鶘」結果,經常出現在 AI 實驗室新版本發佈的 Hacker News 討論串中,成為最受歡迎的評論之一。

這個基準已經知名到甚至出現不少 討論 關於其有用性,以及 AI 實驗室是否可能在這個基準上 benchmaxxing1。當數十億甚至數兆美元的資金都押在結果上時,若是得到好結果就能說服使用者,那麼稍微對模型做點 pelicanmaxx 的誘惑難道不會存在嗎?

我很想找出答案,因此進行了一個小型實驗。我在七個前沿模型中生成了 1,008 個 SVG,並使用 LLM 評審進行評分,再用 Claude Fable 5 進行分析。

本文將呈現這些結果。所有程式碼都已放在 Github 上。

我的測試方式

我建立了一個 8 種動物 × 6 種交通工具 = 48 個提示詞的矩陣,其中最著名的提示詞只是其中一個格子:

  1. 動物:pelican、flamingo、heron、otter、raccoon、antelope、whale、cat
  2. 交通工具:bicycle、unicycle、skateboard、scooter、plane、boat

每個提示詞的用語幾乎與 Simon 的完全相同,只替換了動物與交通工具。動物與交通工具的選擇並非嚴謹進行,但我嘗試在與原始提示詞的相似度與難度之間取得變化。Flamingo 與 heron 與 pelican 相當相似;cat、raccoon 與 otter 屬於容易的案例;antelope 較難;而 whale 則是與原提示詞差異最大的選擇。

我透過 OpenRouter 測試了七個模型:GPT-5.6 TerraClaude Sonnet 5Gemini 3.5 FlashGrok 4.5Qwen3.7-MaxGLM-5.2 以及 DeepSeek V4 Pro。我針對每個提示詞生成 3 個樣本,溫度設定為 1.0,並要求每個模型使用相同的推理強度,總共產生 1,008 個 SVG。

接著,我將每張圖片送進三階段流程:

  1. 渲染:將每個 SVG 渲染成 PNG。如果模型沒有回傳 SVG 或回傳無法渲染的結果,我會重新生成,直到它產生有效的 SVG,並記錄嘗試次數。在 1,008 次生成中,僅有 11 次需要重試。
  2. 評分GPT-5.6 Luna 針對每張圖片給出 1–5 分的評分,分別針對動物、交通工具以及動作的連貫性。當我針對動物或交通工具進行排名時,會使用各自的評分;若需要單一圖片分數,則使用三者的平均值,稱為 judge score。
  3. 特徵擷取:為了更詳細的分析,我還將每張渲染後的圖片送給 Gemini 3.1 Flash-Lite,讓它記錄辨識出的動物與交通工具、主角面向的方向,以及場景元素的開放式清單。

我的假設是:如果某個實驗室針對這個基準進行訓練,那麼應該會在以下幾種情況中出現——pelican 那一列的分數高於該動物應得的分數、bicycle 那一欄的分數高於該交通工具應得的分數,或是 pelican-bicycle 這個特定格子同時優於兩者。

證據一:騎自行車的鵜鶘看起來並沒有比較好

在進行任何評分之前,最簡單的測試就是親自查看圖片。點選某個實驗室,就能看到它繪製的所有圖片,每張圖片下方都有 judge 的評分(點擊可放大):

我在進行下方分析之前,自己先看過這些圖片。沒有任何地方讓我覺得突兀。我找不到任何案例顯示,pelican-bicycle 的圖片明顯優於該模型的其他圖片。或許在 GLM-5.2 的第一個樣本中,它感覺比其他圖片稍好,但那批圖片也產生了一張相當酷的 heron 騎 skateboard,因此我無法確定。其他情況下,它們看起來都與各模型的其他作品一致,而畫得出好的 pelican on bicycle 的實驗室,也同樣能畫好其他動物與交通工具的組合。

但這個測試很難複製,每個人的看法也會不同。因此我想要更量化的結果,這也是為什麼我選擇了上述方法。

證據二:實驗室在畫鵜鶘上並沒有比較好

以下是所有模型彙總後,每種動物的平均動物評分:

圖 1:所有模型彙總後,各動物的平均動物評分。

Pelican 排名第 6(共 8 種),落後於 cat、whale、raccoon、heron 與 antelope。如果 AI 實驗室針對這個基準進行訓練,你會預期 pelican 排在最前面。但結果卻落在後半段。所有七個實驗室畫 cat、whale 與 raccoon 都比 pelican 好。

當然,pelican 可能本來就比 cat 難畫。一個實驗室可能針對 pelican 進行訓練,但仍然無法讓它超越容易畫的動物,因此單看這個排名無法排除這種可能性。我會在證據四中調整難度。

證據三:實驗室在畫自行車上並沒有比較好

自行車的表現更差。它排名倒數第二,幾乎與排名最後的 plane 打成平手:

圖 2:所有模型彙總後,各交通工具的平均交通工具評分。

如果實驗室針對這個基準進行訓練,你會預期 bicycle 排在前面。但它們並沒有。然而,同樣的注意事項也適用於此。Bicycle 比 skateboard 更難畫:它需要兩個對稱的輪子、連接兩個軸的車架、把手、座椅以及踏板。Judge 在 2/3 的 bicycle 圖片中,都標記出缺少或未連接的上述元素之一。即使針對 bicycle 圖片進行訓練,相對於更簡單的交通工具,仍可能無法畫得很好。

關於 plane,有一點需要說明:我原本應該選擇「airplane」而不是「plane」,因為模型經常將其解讀為幾何形狀。它們畫出動物站在平坦表面,而不是在飛行器上。Plane 是唯一有時特徵擷取器找不到任何交通工具的項目(168 張圖片中有 25 張,其他五種交通工具則為零),而 20% 的 plane 圖片在交通工具評分中得到 1 或 2 分,相較之下 bicycle 只有 5%,boat、scooter 與 skateboard 則完全沒有。

證據四:即使調整難度後,實驗室在畫「鵜鶘騎自行車」上也沒有比較好

將兩者合併後,「pelican on a bicycle」落在排名第 42(共 48 個):

圖 3:所有 48 個組合的排名;pelican + bicycle 以高亮顯示。

但同樣地,有些組合可能本來就比其他組合更難畫。

為了考量這點,我對所有 1,008 張圖片進行固定效應迴歸:score ~ lab + animal × vehicle,並加入各實驗室針對 pelican、bicycle 以及 pelican-bicycle 格子的交互作用項,使用穩健標準誤。Animal × vehicle 項吸收了所有 48 個組合的固有難度。交互作用項則衡量各實驗室相對於平均實驗室的基準特定提升,並附上信賴區間。

結果如下:

  1. 各實驗室的 pelican 效應(該實驗室在所有六種交通工具上對 pelican 的提升)落在 -0.11 到 +0.14 judge 分之間,且沒有一個接近顯著水準(最小 p 值 = 0.25)。
  2. 各實驗室的 bicycle 效應(該實驗室在所有八種動物上對 bicycle 的提升)從 Grok 4.5 的 -0.18(p=0.11)到 Gemini 3.5 Flash 的 +0.27(p=0.022)。只有 Gemini 通過 p < 0.05,且七個方向不一。
  3. 沒有任何 pelican-bicycle 格子效應(在該實驗室的 pelican 與 bicycle 效應之上,針對特定組合的額外提升)通過 p < 0.05。最大的正值是 GLM-5.2 的 +0.35(p=0.12),也就是我之前提到的那個。這是本次實驗中最接近訊號的結果,但仍在機率範圍內。

以下是各實驗室的完整估計值。若有 pelicanmaxxing 的實驗室,其整列的點應該會落在零線的右側:

圖 4:各實驗室經難度調整後的效應,附有 95% 信賴區間。高亮區間不包含零。

所有 pelican 區間與所有格子區間都包含零。只有一個不包含:Gemini 3.5 Flash 在 bicycle 欄。但在 21 次檢定中,p < 0.05 時,機率預測約會出現一次偽陽性(21 × 0.05 ≈ 1.05),而實際上也恰好出現一次。它也無法通過多重比較校正:21 次檢定的 Bonferroni 閾值為 0.05/21 ≈ 0.002,而其 p 值為 0.022。完整估計值與 p 值表格請見 repo

但這些區間相當寬,平均約 ±0.6 judge 分。任何小於此值的提升都無法被本測試捕捉到。

證據五:「鵜鶘騎自行車」的場景看起來不像被記憶

有些人認為 pelican on a bicycle 看起來像被記憶的構圖,指出一些重複出現的模式,例如 pelican 總是面向右側,或是重複出現的元素如太陽或圍巾。因此我想知道這是否屬實。

方向:所有七個實驗室的 21 張 pelican-bicycle 圖片,全部都面向右側。其他動物/交通工具組合都沒有這種情況。

然而,面向右側很常見:所有 1,008 張圖片中有 60% 都是如此。頻率取決於動物與交通工具,而 bicycle 是其中兩個頻率最高的交通工具之一:

vehicle left right ambiguous
scooter 9% 83% 8%
bicycle 11% 81% 8%
skateboard 19% 60% 21%
plane 21% 58% 21%
unicycle 22% 45% 33%
boat 33% 35% 32%

Pelican 也是傾向面向右側的動物之一:

animal left right ambiguous
antelope 21% 78% 1%
pelican 22% 78% 0%
heron 22% 77% 1%
whale 34% 65% 1%
flamingo 36% 64% 0%
otter 8% 45% 47%
cat 8% 40% 52%
raccoon 3% 36% 61%

要畫出面向觀眾的 pelican 或 bicycle 很困難,因此模型幾乎總是從側面畫,面向左側或右側。這也是為什麼它們的圖片中很少有 ambiguous 的情況。其他組合也接近一致:antelope on a scooter 與 pelican on a scooter 達到 20/21,heron on a bicycle 達到 19/21。因此 21/21 似乎並非異常值。

場景元素:我讓擷取器命名它在圖片中看到的任何元素。以下是計數結果:

圖 5:開放式擷取過程中,各元素出現在圖片中的比例。

若場景被記憶,則會呈現相同的元素集合反覆出現。我找尋這種情況,並發現有些組合確實傾向每次產生相同的元素。每張 flamingo on a boat 都有太陽。Otters on planes 有 38% 的時間戴圍巾。Cats on bicycles 有 38% 的時間有籃子。

Pelican on a bicycle 似乎沒有任何特別之處。它只是有一些元素出現得更頻繁,就像其他動物-交通工具組合一樣。

限制

  1. 使用單一 LLM 評審進行評分。這裡的所有分數都來自單一模型 GPT-5.6 Luna,一次看一張圖片。我沒有進行太多對齊,也沒有檢查它在重新執行時與自己的一致性。如果一個模型無法可靠地評判一張圖畫,那麼上述所有數字都沒有意義。這個評審也與參賽者之一 GPT-5.6 Terra 屬於同一家系。然而,每個實驗室都畫了所有 48 個組合,因此若評審碰巧喜歡某個實驗室的風格,會同時提升該實驗室的整個矩陣。但這並不會改變結果,因為本分析只關心實驗室內部的差異。
  2. SVGmaxxing。一個針對 SVG 生成整體(或動物騎交通工具等子集)進行最佳化的實驗室,會同時在所有格子上升,看起來與只是擅長的實驗室完全相同。有些實驗室,例如 Google/DeepMind,公開這麼做。本實驗無法偵測到這種情況。
  3. 預算有限。整個實驗大約使用了 80 美元的 API 額度。這限制了每個格子只能有 3 個樣本、單一評審,以及 7 個模型。這也讓我無法對提示詞與流程進行太多迭代,例如「plane」與「airplane」的案例。

結論

抱歉,HN 的批評者們,但幾乎沒有證據顯示 AI 實驗室正在 pelicanmaxxing。至少它們並沒有以明顯的方式這麼做。

Pelican 並沒有比其他動物畫得更好。Bicycle 也沒有比其他交通工具畫得更好。沒有任何實驗室畫這個組合比其 pelican 與 bicycle 已經能預測的更好。GLM-5.2 最接近:它在 pelican-bicycle 這個特定格子上有最大的提升,而它的第一個 pelican-on-bicycle 樣本也引起了我的注意。但這個效應很小且不顯著,因此我不打算太重視它。

另一個突出的現象是場景構圖的方向。所有 21 張 pelican-bicycle 圖片都面向右側,這是網格中唯一所有圖片都一致的組合。但這似乎並不奇怪。面向右側是本次實驗的常態。有三個其他組合達到 90% 或以上,而在 48 個組合中,我並不驚訝其中一個達到 21/21。

更合理的說法是像 Google/DeepMind 那樣進行 SVGmaxxing。其他實驗室可能更低調地這麼做。可惜本實驗無法指出是誰在這麼做。但至少你今晚可以安心,知道 AI 實驗室並沒有產生數 TB 的 pelican on bicycles,只是為了欺騙 Simon Willison。

如果你想自己查看資料,完整流程都在 repo 中。

註腳

  1. 針對熱門基準取得高分的 AI 模型最佳化做法。↩︎

引用

BibTeX 引用:

@online{castillo2026,
  author = {Castillo, Dylan},
  title = {Are {AI} Labs Pelicanmaxxing?},
  date = {2026-07-18},
  url = {https://dylancastillo.co/posts/pelicanmaxxing.html},
  langid = {en}
}

引用格式請參考:

Castillo, Dylan. 2026. “Are AI Labs Pelicanmaxxing?” 7 月 18 日. https://dylancastillo.co/posts/pelicanmaxxing.html