用便宜模型跑出旗艦成績?Gear 這套自動調校工具,考驗的是你對評測的信任
開源專案 Gear 主張用便宜模型加自動調校的 harness,在部分評測追上昂貴模型,本文從機制與成本結構分析這條路對開發者的實際意義。
模型選單越拉越長,錢包越來越薄,這是現在每個用 AI Agent 做事的人共同的處境。九月二十一日,開發者 tangyehui 在 V2EX 貼出了自己的開源專案 Gear(General Evolution ARchitecture),口號很直白:讓 Agent 用便宜模型的價格,達到旗艦模型的性能。這類主張在社羣裡出現的頻率不低,但這一篇的後續討論,剛好把「省錢跑 Agent」這件事最容易踩的三個坑攤在陽光下。
Gear 在做什麼:調的不是模型,是模型周邊的「工作環境」
先把機制講清楚。Gear 想解決的問題是:同一個模型,接上不同的 harness(也就是 Agent 的執行框架,包含提示詞結構、工具呼叫方式、上下文管理等),表現會差很多。過去這套 harness 多半靠工程師手工調整,憑經驗、憑手感。
Gear 的做法是讓這件事自動化。你給它一個 benchmark,它就反覆跑、反覆改,自動演化出最適合這個場景的 harness。講個比喻:這像是請了一位廚藝教練,不換掉廚師(模型),而是重新設計廚房的動線、調整火候表、重排調味罐的位置,讓一位學徒用米其林主廚的流程做出接近的菜。
作者公布的數據是:在 automation bench 的 marketing 任務上,經 Gear 優化的 DSH 搭配 OpenAI 的便宜模型 Luna,達到 88% 的目標完成率,高於 Astra 搭配 Codex 的 84%,而且單任務成本降低 95%。
數字很漂亮,但先別急著換工具。
成本降 95%,但「場景對上了嗎」是第一個問題
這裡有個容易被略過的細節:88% 對 84% 的勝負,只發生在 automation bench 的 marketing 這一類任務上。Gear 的邏輯本來就是「給定一個 benchmark,針對它最佳化」,這意味著它的強項是窄場景。你的工作如果剛好落在這個場景內,省錢效果可能很實在;一旦任務性質換了,調好的 harness 未必還是優勢,甚至可能因為過度適配而變成包袱。
這和模型選型的老問題是同一個結構。我們先前在GPT-6 對上 GPT-5.6 的模型分配難題裡提過,任務的可驗證性越高,越適合把工作交給便宜模型去試;越是開放式、難以自動評分的任務,旗艦模型的判斷力就越難被取代。Gear 本質上把這條界線再往前推了一步:它不只挑模型,還替「可驗證的窄場景」量身打造執行環境。
所以 Gear 最適用的讀者,是任務高度重複、成果可以自動評分的那羣人,例如批次行銷文案產出、固定流程的資料處理。如果你每天面對的是需求飄忽的開發工作,這個工具的直接幫助有限,但它示範的思路值得記住。
第二個坑:別人信的 benchmark,你未必信
貼文下方的討論很快出現質疑。網友 lancevps 直接建議跑 Terminal-Bench 4,理由是「我對這個評測比較相信」。作者的回應也誠實:自己的 token 燒不動,歡迎社羣貢獻。他倒是補了 Terminal-Bench 2.1 的結果,Luna 加 Gear 調校的 DSH 拿到 84.26%,低於 Astra 加 Codex 的 87.4%,與 Fable 加 ClaudeCode 的 83.8% 相當。
這組數字反而比行銷任務那組更有參考價值,因為它顯示:換到更通用的工程場景,便宜模型加調校的組合追上了第二梯隊,但沒有追上旗艦。這正是常態。省錢方案的天花板,通常出現在最難的那批任務上。
換 benchmark 就換排名,這件事提醒我們:看任何「便宜方案超越旗艦」的主張,第一個動作永遠是問評測內容是什麼。這也呼應我們先前分析GPT-6 的 AGI 宣言該怎麼當行銷文本讀時的角度,宣稱的強度,取決於量尺是誰定的。
第三個坑:省了錢,別默默賠了時間
網友 sampeng 的質疑更貼近日常使用:Astra 五分鐘做完的事,Luna 要花十五分鐘就難以接受。這句話戳中成本計算最常被漏掉的一欄,時間也是成本。
作者事後給出的統計值得肯定。在 automation 任務上,Luna 的 Agent 平均運行時間為 5 分 51 秒,Astra 為 5 分 39 秒;中位數兩者幾乎相同;若把環境準備、執行和評分都算進去,Luna 組合的平均總耗時 7 分 07 秒,反而比 Astra 組合的 8 分 30 秒快。
也就是說,至少在這個場景裡,「便宜等於慢」的直覺沒有成立。但這份統計同樣只涵蓋 automation 任務, sampeng 最初體感來源的那些任務究竟是哪些,並沒有對上。這提醒我們評估 Agent 成本時該看的三個欄位:token 花費、總耗時、以及你的注意力被呼叫了幾次。三者相乘才是真實成本。
給一般開發者的三個實際判斷
第一,把 Gear 這類自進化工具理解成「窄場景的省錢方案」,別期待它是通用的模型替代品。任務能定義清楚、能自動評分的團隊,值得花一週試跑;任務性質多變的團隊,先觀望。
第二,看待任何 benchmark 數字時,先確認量尺。同一個工具在不同評測上從超越旗艦到落後三個百分點,中間的落差就是你的決策風險。
第三,省錢的前提是不賠時間與品質。把 token 帳單、耗時統計、人工介入次數放進同一張表再看結論,很多「成本降低 95%」的故事會自動現出原形,也有少數,像 Gear 在 marketing 任務上那組數據,經得起這樣攤開檢驗。
Gear 的價值不在於它今天超越了誰,而在於它把「harness 也可以被自動最佳化」這件事做成了開源專案。模型廠商繼續競爭智商的上限,這類工具在競爭的是同一份智商能被壓榨出多少產值。對每天在 Agent 裡燒 token 的人來說,後者可能才是更切身的那場競賽。
主題