2026 年 9 月,Anthropic 發布報告,點名阿裏、DeepSeek、月之暗面、智譜、小米、商湯、MiniMax 七家中國公司,指控它們以各種方式「蒸餾」Claude 模型的能力。報告列出的數字相當驚人:阿裏被指在 5 到 7 月間產生 1.5 億次交互;DeepSeek 被指在 14 天內把 1200 萬次用戶請求轉發給 Claude;月之暗面被指把近 30 萬真實用戶的問題直接交給 Claude 代答。這些都是 Anthropic 單方面的指控,被點名的公司大多沒有回應,真相仍有待查證。
不過,吵歸吵,有一個技術問題值得先搞清楚:蒸餾到底是什麼?為什麼模型公司這麼怕它?
同一時間,美國國安體系也曾以「工業化蒸餾」為由點名六家中國 AI 企業,相關的指控與蒸餾界線之爭的分析可以對照著看。這篇文章要做的,是把這個詞的技術內涵講明白。
蒸餾:讓小模型跟大模型學
蒸餾(Distillation)的思路很樸素:讓一個小模型,學一個大模型的行為。大模型能力強,但跑一次要消耗大量 GPU;小模型便宜,卻沒那麼聰明。解法是讓大模型當老師、小模型當學生。老師做一百萬道題,把答案連同思考過程記下來,學生對著這批標準答案做監督學習。
流程聽起來很合理,但有一個致命缺陷:學生犯錯時,沒人管。
想像學生模型解一道數學題。老師的標準答案是「先配方,再求根」,但學生沒學會配方,自己走了一條歪路,先對兩邊同乘 x,這步錯了,後面全錯。問題在於,老師不會犯錯,所以老師的作業本裡從來沒有出現過「兩邊同乘 x」這種錯誤路徑。學生只看過正確答案,一旦生成時走偏,就進入老師從未示範過的地帶,之後產生的每個 token 都越來越歪,一路錯到底。
這叫暴露偏差(exposure bias):訓練時學生只見過標準答案,生成時卻要面對自己的錯誤,兩者的資料分布完全不同。就像教練只給你看世界冠軍的滑冰錄影,從不告訴你起跳姿勢錯了會怎樣。結果你一上冰場,第一個動作就走樣,後面全部變形,錄影完全幫不上忙。
強化學習的解法,與新的麻煩
強化學習(RL)換了個思路:不看老師的錄影了,讓學生自己生成答案,然後給獎勵訊號,答案對就是不對。學生自己生成的內容,就算全錯也會被打分,模型得以從自己的錯誤中學習,暴露偏差的問題解決了。
但新麻煩上場:獎勵太稀疏。一道題生成一百個 token,最後只給一個對或不對的訊號,中間九十九個 token 哪步走對、哪步走錯,模型完全不知道。就像考卷只給你總分,不告訴你哪題錯了,學習效率極低。代價直接反映在算力帳單上:Qwen3 用 RL 訓練,花了 17920 個 GPU 小時,AIME 數學競賽成績是 67.6%。
OPD:學生自己作答,老師逐字批改
2025 年底到 2026 年,一種叫 OPD(On-Policy Distillation,在線策略蒸餾)的方法火了起來。Qwen3 的技術報告顯示,它只花 1800 個 GPU 小時,就把成績推到 74.4%,效率接近純 RL 的十倍。
它的做法,是各取蒸餾與 RL 的長處。學生自己生成答案,這是 RL 的路數,訓練的是學生自己的分布而非老師的分布;老師則對每個 token 逐字打分,這是蒸餾的路數,每個位置都有密集訊號,不必等最後的總分。
關鍵在第二步。老師不再負責生成標準答案,而是變成一臺逐字批改機:學生每寫一個 token,老師就在旁邊說這個字寫得好,或這個字不對。打分用的數學工具是逆向 KL 散度,這個選擇講究之處在於衡量分布差距的方向,本文先不展開數學細節。
效果數字相當突出。有實驗從 60% 成績的檢查點出發,OPD 只用 150 步就達到 70%;另一個更誇張的案例是在單一 prompt 上連訓 20 步,模型就恢復到老師水準,而同樣情境下的 RL 只會死記硬背。
所以呢
回到開頭那份報告。無論指控最終是否成立,蒸餾在技術上本來就是公開且廣泛使用的方法,業界真正的爭執點在於界線:用自己的模型對著 API 大量生成訓練資料,算正當的學習,還是違反服務條款的搬運?這條線目前說不清楚,也是這類報告每隔一段時間就會引爆爭議的原因。
對一般開發者與關注 AI 產業的人,這件事留下兩個實用的判斷點。第一,看到「某公司蒸餾某模型」的指控,先分辨它指的是正規的模型壓縮技術,還是把大量用戶請求轉發給他廠 API 的行為,兩者性質完全不同。第二,OPD 這類方法的意義不只是分數提升,而是訓練成本的量級下降;當訓練一個接近前沿水準的小模型的算力門檻持續降低,模型能力的擴散速度,恐怕會比任何一份報告的指控都快。