過去幾年,Simon Willison 都用同一個提示詞測試每一次主要的 LLM 發佈:「Generate an SVG of a pelican riding a bicycle」。
這個原本帶點戲謔意味的基準,已經成為 AI 領域最知名的非正式基準之一。Simon 的「騎自行車的鵜鶘」結果,經常出現在 AI 實驗室新版本發佈的 Hacker News 討論串中,成為最受歡迎的評論之一。
這個基準已經知名到甚至出現不少 討論 關於其有用性,以及 AI 實驗室是否可能在這個基準上 benchmaxxing1。當數十億甚至數兆美元的資金都押在結果上時,若是得到好結果就能說服使用者,那麼稍微對模型做點 pelicanmaxx 的誘惑難道不會存在嗎?
我很想找出答案,因此進行了一個小型實驗。我在七個前沿模型中生成了 1,008 個 SVG,並使用 LLM 評審進行評分,再用 Claude Fable 5 進行分析。
本文將呈現這些結果。所有程式碼都已放在 Github 上。
我的測試方式
我建立了一個 8 種動物 × 6 種交通工具 = 48 個提示詞的矩陣,其中最著名的提示詞只是其中一個格子:
- 動物:pelican、flamingo、heron、otter、raccoon、antelope、whale、cat
- 交通工具:bicycle、unicycle、skateboard、scooter、plane、boat
每個提示詞的用語幾乎與 Simon 的完全相同,只替換了動物與交通工具。動物與交通工具的選擇並非嚴謹進行,但我嘗試在與原始提示詞的相似度與難度之間取得變化。Flamingo 與 heron 與 pelican 相當相似;cat、raccoon 與 otter 屬於容易的案例;antelope 較難;而 whale 則是與原提示詞差異最大的選擇。
我透過 OpenRouter 測試了七個模型:GPT-5.6 Terra、Claude Sonnet 5、Gemini 3.5 Flash、Grok 4.5、Qwen3.7-Max、GLM-5.2 以及 DeepSeek V4 Pro。我針對每個提示詞生成 3 個樣本,溫度設定為 1.0,並要求每個模型使用相同的推理強度,總共產生 1,008 個 SVG。
接著,我將每張圖片送進三階段流程:
- 渲染:將每個 SVG 渲染成 PNG。如果模型沒有回傳 SVG 或回傳無法渲染的結果,我會重新生成,直到它產生有效的 SVG,並記錄嘗試次數。在 1,008 次生成中,僅有 11 次需要重試。
- 評分:GPT-5.6 Luna 針對每張圖片給出 1–5 分的評分,分別針對動物、交通工具以及動作的連貫性。當我針對動物或交通工具進行排名時,會使用各自的評分;若需要單一圖片分數,則使用三者的平均值,稱為 judge score。
- 特徵擷取:為了更詳細的分析,我還將每張渲染後的圖片送給 Gemini 3.1 Flash-Lite,讓它記錄辨識出的動物與交通工具、主角面向的方向,以及場景元素的開放式清單。
我的假設是:如果某個實驗室針對這個基準進行訓練,那麼應該會在以下幾種情況中出現——pelican 那一列的分數高於該動物應得的分數、bicycle 那一欄的分數高於該交通工具應得的分數,或是 pelican-bicycle 這個特定格子同時優於兩者。
證據一:騎自行車的鵜鶘看起來並沒有比較好
在進行任何評分之前,最簡單的測試就是親自查看圖片。點選某個實驗室,就能看到它繪製的所有圖片,每張圖片下方都有 judge 的評分(點擊可放大):
我在進行下方分析之前,自己先看過這些圖片。沒有任何地方讓我覺得突兀。我找不到任何案例顯示,pelican-bicycle 的圖片明顯優於該模型的其他圖片。或許在 GLM-5.2 的第一個樣本中,它感覺比其他圖片稍好,但那批圖片也產生了一張相當酷的 heron 騎 skateboard,因此我無法確定。其他情況下,它們看起來都與各模型的其他作品一致,而畫得出好的 pelican on bicycle 的實驗室,也同樣能畫好其他動物與交通工具的組合。
但這個測試很難複製,每個人的看法也會不同。因此我想要更量化的結果,這也是為什麼我選擇了上述方法。
證據二:實驗室在畫鵜鶘上並沒有比較好
以下是所有模型彙總後,每種動物的平均動物評分:
Pelican 排名第 6(共 8 種),落後於 cat、whale、raccoon、heron 與 antelope。如果 AI 實驗室針對這個基準進行訓練,你會預期 pelican 排在最前面。但結果卻落在後半段。所有七個實驗室畫 cat、whale 與 raccoon 都比 pelican 好。
當然,pelican 可能本來就比 cat 難畫。一個實驗室可能針對 pelican 進行訓練,但仍然無法讓它超越容易畫的動物,因此單看這個排名無法排除這種可能性。我會在證據四中調整難度。
證據三:實驗室在畫自行車上並沒有比較好
自行車的表現更差。它排名倒數第二,幾乎與排名最後的 plane 打成平手:
如果實驗室針對這個基準進行訓練,你會預期 bicycle 排在前面。但它們並沒有。然而,同樣的注意事項也適用於此。Bicycle 比 skateboard 更難畫:它需要兩個對稱的輪子、連接兩個軸的車架、把手、座椅以及踏板。Judge 在 2/3 的 bicycle 圖片中,都標記出缺少或未連接的上述元素之一。即使針對 bicycle 圖片進行訓練,相對於更簡單的交通工具,仍可能無法畫得很好。
關於 plane,有一點需要說明:我原本應該選擇「airplane」而不是「plane」,因為模型經常將其解讀為幾何形狀。它們畫出動物站在平坦表面,而不是在飛行器上。Plane 是唯一有時特徵擷取器找不到任何交通工具的項目(168 張圖片中有 25 張,其他五種交通工具則為零),而 20% 的 plane 圖片在交通工具評分中得到 1 或 2 分,相較之下 bicycle 只有 5%,boat、scooter 與 skateboard 則完全沒有。
證據四:即使調整難度後,實驗室在畫「鵜鶘騎自行車」上也沒有比較好
將兩者合併後,「pelican on a bicycle」落在排名第 42(共 48 個):
但同樣地,有些組合可能本來就比其他組合更難畫。
為了考量這點,我對所有 1,008 張圖片進行固定效應迴歸:score ~ lab + animal × vehicle,並加入各實驗室針對 pelican、bicycle 以及 pelican-bicycle 格子的交互作用項,使用穩健標準誤。Animal × vehicle 項吸收了所有 48 個組合的固有難度。交互作用項則衡量各實驗室相對於平均實驗室的基準特定提升,並附上信賴區間。
結果如下:
- 各實驗室的 pelican 效應(該實驗室在所有六種交通工具上對 pelican 的提升)落在 -0.11 到 +0.14 judge 分之間,且沒有一個接近顯著水準(最小 p 值 = 0.25)。
- 各實驗室的 bicycle 效應(該實驗室在所有八種動物上對 bicycle 的提升)從 Grok 4.5 的 -0.18(p=0.11)到 Gemini 3.5 Flash 的 +0.27(p=0.022)。只有 Gemini 通過 p < 0.05,且七個方向不一。
- 沒有任何 pelican-bicycle 格子效應(在該實驗室的 pelican 與 bicycle 效應之上,針對特定組合的額外提升)通過 p < 0.05。最大的正值是 GLM-5.2 的 +0.35(p=0.12),也就是我之前提到的那個。這是本次實驗中最接近訊號的結果,但仍在機率範圍內。
以下是各實驗室的完整估計值。若有 pelicanmaxxing 的實驗室,其整列的點應該會落在零線的右側:
所有 pelican 區間與所有格子區間都包含零。只有一個不包含:Gemini 3.5 Flash 在 bicycle 欄。但在 21 次檢定中,p < 0.05 時,機率預測約會出現一次偽陽性(21 × 0.05 ≈ 1.05),而實際上也恰好出現一次。它也無法通過多重比較校正:21 次檢定的 Bonferroni 閾值為 0.05/21 ≈ 0.002,而其 p 值為 0.022。完整估計值與 p 值表格請見 repo。
但這些區間相當寬,平均約 ±0.6 judge 分。任何小於此值的提升都無法被本測試捕捉到。
證據五:「鵜鶘騎自行車」的場景看起來不像被記憶
有些人認為 pelican on a bicycle 看起來像被記憶的構圖,指出一些重複出現的模式,例如 pelican 總是面向右側,或是重複出現的元素如太陽或圍巾。因此我想知道這是否屬實。
方向:所有七個實驗室的 21 張 pelican-bicycle 圖片,全部都面向右側。其他動物/交通工具組合都沒有這種情況。
然而,面向右側很常見:所有 1,008 張圖片中有 60% 都是如此。頻率取決於動物與交通工具,而 bicycle 是其中兩個頻率最高的交通工具之一:
| vehicle | left | right | ambiguous |
|---|---|---|---|
| scooter | 9% | 83% | 8% |
| bicycle | 11% | 81% | 8% |
| skateboard | 19% | 60% | 21% |
| plane | 21% | 58% | 21% |
| unicycle | 22% | 45% | 33% |
| boat | 33% | 35% | 32% |
Pelican 也是傾向面向右側的動物之一:
| animal | left | right | ambiguous |
|---|---|---|---|
| antelope | 21% | 78% | 1% |
| pelican | 22% | 78% | 0% |
| heron | 22% | 77% | 1% |
| whale | 34% | 65% | 1% |
| flamingo | 36% | 64% | 0% |
| otter | 8% | 45% | 47% |
| cat | 8% | 40% | 52% |
| raccoon | 3% | 36% | 61% |
要畫出面向觀眾的 pelican 或 bicycle 很困難,因此模型幾乎總是從側面畫,面向左側或右側。這也是為什麼它們的圖片中很少有 ambiguous 的情況。其他組合也接近一致:antelope on a scooter 與 pelican on a scooter 達到 20/21,heron on a bicycle 達到 19/21。因此 21/21 似乎並非異常值。
場景元素:我讓擷取器命名它在圖片中看到的任何元素。以下是計數結果:
若場景被記憶,則會呈現相同的元素集合反覆出現。我找尋這種情況,並發現有些組合確實傾向每次產生相同的元素。每張 flamingo on a boat 都有太陽。Otters on planes 有 38% 的時間戴圍巾。Cats on bicycles 有 38% 的時間有籃子。
Pelican on a bicycle 似乎沒有任何特別之處。它只是有一些元素出現得更頻繁,就像其他動物-交通工具組合一樣。
限制
- 使用單一 LLM 評審進行評分。這裡的所有分數都來自單一模型 GPT-5.6 Luna,一次看一張圖片。我沒有進行太多對齊,也沒有檢查它在重新執行時與自己的一致性。如果一個模型無法可靠地評判一張圖畫,那麼上述所有數字都沒有意義。這個評審也與參賽者之一 GPT-5.6 Terra 屬於同一家系。然而,每個實驗室都畫了所有 48 個組合,因此若評審碰巧喜歡某個實驗室的風格,會同時提升該實驗室的整個矩陣。但這並不會改變結果,因為本分析只關心實驗室內部的差異。
- SVGmaxxing。一個針對 SVG 生成整體(或動物騎交通工具等子集)進行最佳化的實驗室,會同時在所有格子上升,看起來與只是擅長的實驗室完全相同。有些實驗室,例如 Google/DeepMind,公開這麼做。本實驗無法偵測到這種情況。
- 預算有限。整個實驗大約使用了 80 美元的 API 額度。這限制了每個格子只能有 3 個樣本、單一評審,以及 7 個模型。這也讓我無法對提示詞與流程進行太多迭代,例如「plane」與「airplane」的案例。
結論
抱歉,HN 的批評者們,但幾乎沒有證據顯示 AI 實驗室正在 pelicanmaxxing。至少它們並沒有以明顯的方式這麼做。
Pelican 並沒有比其他動物畫得更好。Bicycle 也沒有比其他交通工具畫得更好。沒有任何實驗室畫這個組合比其 pelican 與 bicycle 已經能預測的更好。GLM-5.2 最接近:它在 pelican-bicycle 這個特定格子上有最大的提升,而它的第一個 pelican-on-bicycle 樣本也引起了我的注意。但這個效應很小且不顯著,因此我不打算太重視它。
另一個突出的現象是場景構圖的方向。所有 21 張 pelican-bicycle 圖片都面向右側,這是網格中唯一所有圖片都一致的組合。但這似乎並不奇怪。面向右側是本次實驗的常態。有三個其他組合達到 90% 或以上,而在 48 個組合中,我並不驚訝其中一個達到 21/21。
更合理的說法是像 Google/DeepMind 那樣進行 SVGmaxxing。其他實驗室可能更低調地這麼做。可惜本實驗無法指出是誰在這麼做。但至少你今晚可以安心,知道 AI 實驗室並沒有產生數 TB 的 pelican on bicycles,只是為了欺騙 Simon Willison。
如果你想自己查看資料,完整流程都在 repo 中。
註腳
針對熱門基準取得高分的 AI 模型最佳化做法。↩︎
引用
BibTeX 引用:
@online{castillo2026,
author = {Castillo, Dylan},
title = {Are {AI} Labs Pelicanmaxxing?},
date = {2026-07-18},
url = {https://dylancastillo.co/posts/pelicanmaxxing.html},
langid = {en}
}
引用格式請參考:
Castillo, Dylan. 2026. “Are AI Labs Pelicanmaxxing?” 7 月 18 日. https://dylancastillo.co/posts/pelicanmaxxing.html。
0 Comments
Log in to join the conversation.No comments yet. Be the first to share your thoughts.