全世界的 AI 都畫不好一隻騎自行車的鵜鶘,直到最近才有人勉強過關
從 Simon Willison 的「鵜鶘騎自行車」SVG 測試回顧兩年來 AI 模型的進化軌跡,說明這個玩笑測試為何意外成為觀察模型能力的可靠窗口。
「畫一隻騎自行車的鵜鶘」,這句話聽起來像幼稚園的美術題目,但從 2024 年 10 月 25 日開始,它成了 AI 圈最有名的一張考卷。英國程式設計師 Simon Willison 在部落格上發了一篇很短的文章,把手邊能用的 16 個大模型全部叫來,丟給它們同一句指令:Generate an SVG of a pelican riding a bicycle。也就是用程式碼畫出一隻騎自行車的鵜鶕。他再把結果一張張貼出來,稱之為自己的模型評測。
兩年過去,這個測試從一個笑話,長成了觀察 AI 能力變化最直觀的窗口。這篇文章把它當成一張時間軸,看模型這兩年到底進步在哪裡,以及為什麼一隻不存在的鳥,比任何跑分都誠實。
為什麼偏偏是鵜鶘,偏偏是自行車
Willison 選這個題目的理由很樸素。他喜歡鵜鶘,他住在加州半月灣,海邊就能看到。更關鍵的一點是,他非常確定網路上不存在「鵜鶘騎自行車」的 SVG 檔案,模型不可能在訓練資料裡抄答案。
這裡需要先講清楚 SVG 是什麼。SVG 是一種向量圖檔格式,本質是一段程式碼,你用座標、半徑、路徑去描述每個形狀,瀏覽器再照著這段描述把圖畫出來。這就像是蒙著眼睛,只靠口頭指示朋友在座標紙上畫圖:「在 (200, 300) 畫一個半徑 80 的圓,那是輪子。」大語言模型是文字系統,不會真正「看到」自己畫了什麼,它憑的是對形狀描述的統計記憶,全程不知道成果長什麼樣。
而自行車本身就是人類的難題。現在不要看任何照片,試著憑記憶畫一臺自行車,多數人會發現自己記不清車架那幾根桿子怎麼連。鵜鶘也不好畫。Willison 在演講裡把最刁鑽的一條講透了,他的原話大意是:鵜鶘根本騎不了自行車,牠們的身材就不對。模型得在沒有任何參考範本的情況下,硬掰出一個不存在的物理結構。
還有個意外的好處:SVG 支援註解。模型幾乎都會在程式碼裡寫註解,告訴你這一坨是車輪、那一坨是喙。對照註解和實際畫出來的東西,中間的落差往往就是笑點所在。
2024 年的鵜鶘有多慘
頭幾個月的成果,用慘不忍睹形容並不誇張。Willison 自己的描述是:Claude 3.5 Sonnet 交出兩個圓,中間連一個三角形,喙像一根黃色的香蕉笑臉。Llama 3.3 70B 畫了一個小圓圈、一根豎線,還有一個形狀像水槽的東西。Qwen2.5-Coder 的自行車是幾塊棕色形狀疊在一起,看著像臺拖拉機。Mistral Small 3 則畫出一隻矮胖的白鴨子,蹲在一副槓鈴上。
2025 年 1 月,DeepSeek 發布 R1,接下來幾天輝達市值掉了六千億美元。Willison 後來在演講裡把 R1 的鵜鶘單獨拎出來,叫它「讓股市崩盤的那隻鵜鶘」。他的評價是,那是當時為止最好的一張:自行車能看出是自行車,旁邊有隻鳥勉強像鵜鶘,只是牠沒在騎車。
有意思的是,這一年裡各家的鵜鶘從一堆色塊慢慢變成能認出來的東西,而鵜鶘的優劣和模型的實際工作能力,大致對得上。畫得好的模型,寫程式碼做事也確實更強。Willison 說這個測試本來是個玩笑,用來嘲笑「比較模型」這件事有多荒唐,結果玩笑越玩越像真的。
一場 560 局的鵜鶘錦標賽,裁判費 18 美分
2025 年 6 月,Willison 在舊金山的 AI 工程師大會上演講。他手裡累積了 34 張鵜鶘,想排個名次,又懶得一張張自己比。
他的做法很工程師:讓 Claude 寫一個小工具,把任意兩張鵜鶘並排放在網頁上截圖。34 張圖兩兩配對,一共 560 場對決。每一場交給 GPT-4.1 mini 當裁判,請它選出「更好的鵜鶘騎自行車插畫」並說明理由,最後用 Elo 積分算出排名。整個裁判過程的花費,大約 18 美分。
冠軍是 Gemini 2.5 Pro 的一個預覽版,墊底的是 Llama 3.3 70B。裁判給兩張圖對決的理由很直白:左圖明顯畫了一隻鵜鶘在騎自行車,右圖只是幾個極簡的形狀,看不出在畫什麼。
同一場演講他還算了成本帳。o1-pro 畫一隻鵜鶘花了 88.755 美元,換算下來每一美分都極其昂貴;Gemini 2.5 Pro 畫一隻只要 4.77 美分,畫出來的結果還更好。這組對比後來常被引用,因為它點出一件事:模型能力的進步和推論成本的下降,是同時發生的。
模型開始有脾氣了,然後考題升級
2025 年 8 月出現一個轉折。Willison 在自己的筆記型電腦上跑 Qwen3-4B-Thinking,一個 4B 參數的小模型。它沒有畫自行車,畫了一個藍色的圓,上面蓋一行紅字:This is art - pelicans don’t ride bikes!(這是藝術,鵜鶘不騎車!)Willison 直接把這句話拿來當文章標題。
一個模型面對做不到的題目,選擇拒答並嘲諷出題者,這個行為本身就比畫得爛更值得玩味。它顯示模型在「硬掰一個答案」和「承認題目有問題」之間,開始有了某種偏向。
同年 11 月 Gemini 3 發布。低推理檔位下畫出的鵜鶘戴了一頂小帽子,SVG 註解裡寫著「帽子(可選趣味細節)」;高檔位下車架終於是正確的形狀。Willison 覺得題目開始不夠難了,於是出了一版進階題:要畫加州褐鵜鶘,自行車必須有輻條和正確車架,鵜鶘要有大喉囊,要能看出羽毛,要明確在蹬踏板,還要畫出繁殖期的羽色。他附上一張自己拍的照片當標準答案。
結果各家模型都漏掉同一個關鍵細節:加州褐鵜鶘其實不是棕色的。
考題升級的邏輯值得注意。當基礎題大家都會寫之後,測試的鑑別力就消失了,必須往更細的知識和更複雜的結構壓。這和任何能力評鑑的演化是同一條路。
2026 年 4 月:筆記型電腦上的小模型,對上旗艦
2026 年 4 月 16 日,兩件事撞在同一天:阿裏巴巴發布 Qwen3.6-35B-A3B,Anthropic 發布 Claude Opus 4.7。Willison 的對照方式一如既往地不講情面:他用一個 20.9GB 的量化版,在自己的 MacBook 上跑 Qwen,再用官方 API 跑 Opus。
一個是筆記型電腦就能裝下的開源模型,一個是頂級閉源旗艦,中間隔著的是幾個數量級的訓練成本和完全不同的商業模式。而它們被放進同一張考卷,比的是同一隻不存在的鳥。
這個測試對一般人的意義
看完兩年的鵜鶘史,可以收斂出幾個對日常工作有用的判斷。
第一,評測不需要華麗。「畫一隻騎自行車的鵜鶘」之所以有效,是因為它滿足了三個條件:訓練資料裡一定沒有答案、題目對人和對機器都難、成果一眼就能判斷好壞。你在工作中要挑模型或挑工具,套用同樣的邏輯,用自己業務裡「網路上找不到範本」的真實題目去測,比看任何排行榜都準。
第二,模型的「能力」正在從模仿走向組合。早期那些色塊鸚鵡,是在背誦訓練資料裡的形狀統計;能畫出有輻條的車架和蹬踏板的鵜鶘,代表模型能把多個概念正確組裝起來。這正是寫程式、做文件、處理長流程任務需要的能力,鵜鶘畫得好不好,確實洩漏了這些能力的高低。
第三,成本下降的速度值得寫進任何採購或導入決策。從 o1-pro 的 88 美分到 Gemini 2.5 Pro 的不到 5 美分,再到能在 MacBook 上離線跑的開源模型,同一等級的輸出,兩年內價格塌了不只一個檔次。今天覺得太貴做不起的 AI 應用,兩年後再看一次帳,答案可能完全不同。
第四,注意模型的拒答傾向。Qwen3-4B 那句「鵜鶘不騎車」可以是機智,也可以是未來你在工作流程裡會遇到的麻煩:當模型開始有「意見」,你要設計的不只是怎麼下指令,還包括怎麼處理它不配合的時候。
一隻不存在的鳥,騎了兩年不存在的自行車,把 AI 產業的進步、降價和脾氣全都馱在背上。下次有人問你模型到底進步了多少,別引用跑分,叫他畫一隻鵜鶘。
主題