十分鐘拿下8864分:攜程筆試的AI coding題,把「會寫程式」重新定義了一次
攜程筆試的AI coding題出現「8864」等分數討論潮,這篇專欄從計分機制與徵才篩選邏輯,分析十分鐘速通背後企業到底想考什麼。
九月六日晚間,牛客網上出現一串看起來像亂碼的數字:8864、8712、8854、8866。發文者不是在報股票,而是在比對攜程秋招筆試裡AI coding題目的得分。有人花十分鐘拿到8864直接交卷,有人改了一個小時,分數反而從8864掉到8854。這串數字為什麼值得拿出來講,因為它透露的訊號比分數本身重要得多:企業篩選工程師的尺,已經換了一把。
這篇專欄由沈安執筆,想談的是這種題目到底在量測什麼,以及打算投入今年秋招的人該怎麼調整準備方向。
那串數字是怎麼來的
先講機制。AI coding筆試不是傳統的演算法題, judge給你一個「對或錯」,而是讓你在一個模擬的工程環境裡,搭配AI助手完成一個有規模的任務,例如一個快遞物流配送系統,裡面有幾十個介面,包裹、運單、網點、快遞員、理賠、代收貨款等狀態互相影響。
最後的成績是綜合指標換算出來的分數。所以你會看到8864這種四位數,也會看到另一種判題結果,寫著「本次全部用例總耗時11.49秒,輸出文件檢查通過」再加一排排序結果。不同公司、不同平臺的計分維度不一樣,有的看測試通過率,有的看程式碼品質指標,有的把執行效率也算進去。
用一個貼近日常的比喻:傳統筆試像考駕照的筆測,答案是死的;AI coding筆試像路考,你帶著一個副駕駛(AI)上路,評分的是你最後把車停成什麼樣子、開得多順,至於中間是誰打的方向盤,計分表不太在乎。
這也解釋了留言區的一個現象:有人說「寫完後加個code review,直接8875」。分數能靠事後打磨往上蹭,代表它量的東西是連續的工程品質,一道閾值線上的通過與否。
為什麼有人十分鐘,有人一小時還倒退
留言區最有信息量的一條是:「十分鐘8854直接交了,之前每次修一小時都一點不漲。」
這句話點出了這類題目的真實難點。它考的不是你會不會寫,而是你會不會「指揮」。牛客上流傳的解題思路講得很直白:幾十個介面,人類根本沒必要逐個讀懂。讓AI先讀題寫文件,再照文件寫程式,接著讓AI自己補測試,你負責跑測試、把結果貼回去讓AI修,循環到收斂為止。全程人做的是流程管理和品質把關,不是逐行實作。
反過來,那些修一小時不漲分的人,多半是掉進了人腦逐步debug的舊習慣。你在用算盤的速度跟一個已經把流程外包出去的競爭者比賽。而「8712改到8866,實在沒招了」的那位,卡的很可能是最後幾個指標之間的互相牽制,這種時候繼續硬修的邊際效益極低,果斷交卷反而是正確決策。
這與我們先前分析的米哈遊筆試裡一句話指揮AI只拿六分是同一個趨勢的兩個切面:企業已經確認,純粹的指令下達拿不到高分,純粹的手寫能力又不再是唯一標準,中間那層「拆解任務、驗收結果、決定何時停手」的能力,才是新的得分區。
對今年秋招的人,實際意味著什麼
把鏡頭拉回讀者的處境,有幾個判斷可以直接用。
第一,開發崗的筆試內容正在跟大模型知識靠攏。留言裡有應徵開發崗的人抱怨,選擇題全是預訓練跟SFT的內容。這不是出題老師跑錯棚,而是業界對「工程師」這個職位的基本盤假設變了。不懂模型怎麼運作,往後在面試裡會越來越像不懂網路的後端。
第二,練習的單位要換。以前刷題以「一題」為單位,現在有效的練習單位是「一個流程」:讀題、寫規格、生成、測試、修復、停手。平時用AI寫程式的人自帶肌肉記憶,留言裡那位「平時AI用多了就是不一樣」的考生,第一次做就四個指標滿分,靠的就是日常累積的協作節奏。
第三,要知道何時收手。8864跟8875之間的差距,在篩選上大概率沒有意義,但為了這十一分多燒四十分鐘,可能讓你在別的題目上失血。工程師的停損判斷,第一次被放進筆試計分裡。
還有一個小地方值得留意:考試環境的模型不見得是你平日用的那套。有人反映現場模型卡頓、甚至產出語法錯誤,最後得靠人工改。這提醒我們,這類考試量的終究是人在不理想工具下的應變,不是在完美環境裡的表現。
尺換了,量的人也得換
攜程不是第一家這樣考的公司,也不會是最後一家。當筆試成績從「零或一百」變成「8864」,企業其實是在承認一件事:他們要找的人,價值不在於能從零寫出每個介面,而在於能對一個複雜系統的產出品質負責。
對求職者來說,與其糾結那串數字的個位數,不如把注意力放回自己平日跟AI協作的習慣:有沒有先寫規格再動手、有沒有幫產出補測試、有沒有在指標互相牽制時判斷停手。這三件事做順了,十分鐘交卷不是運氣,是方法。