跳至主要內容
科技 分析

參數直上五到十萬億:阿裏巴巴下一世代模型,把賭注押在「大」這一字上

傳阿裏巴巴下一代模型參數規模將擴大到5至10萬億級別,本文從算力、成本與應用落地角度分析這個規模跳升對開發者與企業用戶的實際意義。

YIM NEWS 編輯台 閱讀約 4 分鐘

規格表上看不到的,往往才是重點。Solidot 日前轉述的消息指出,阿裏巴巴的下一代模型計畫把參數規模擴大到 5 至 10 萬億(trillion)級別,相較目前主流模型普遍在數千億到一萬多億參數的水準,這是一次數量級的跳升。消息本身只有一行字,但它牽動的是算力採購、訓練成本與應用節奏三件事,值得把鏡頭拉近一點看清楚。

先把「參數」講成日常語言

參數可以想成模型腦中「經驗的存放格」。一個模型看過的資料越多、存放格越多,理論上能記住越細緻的模式,回答也越靈活。目前市面上旗艦模型的存放格數量,大致在一萬億上下打轉;阿裏巴巴傳出的下一代目標,是把存放格一口氣擴大到五倍甚至十倍。

但存放格變多,代價同步放大。訓練階段需要更多 GPU、更長時間;推理階段,也就是你我每天跟模型對話的那一刻,每一次回答都要動用更多計算資源。這就像把一家便利商店升級成大賣場,貨齊了,但水電費、人事成本全部翻倍。賣場要活下來,關鍵是來客量與客單價能否撐起營運,模型也一樣。

為什麼是現在,為什麼是阿裏巴巴

這條消息的時機值得注意。過去一年,產業的主流論述是「小模型加好工具也能打出好成績」,開源社羣不斷證明經過調校的中型模型,在特定任務上可以逼近旗艦。我們先前分析過的Gear 開源自動調校工具如何在部分評測追平昂貴模型,就是這條路線的代表案例。

在這個氛圍下押注超大參數,等於是反方向加碼。邏輯並不難理解:工具鏈的進步壓縮了中型模型的劣勢,但模型規模依然是多步驟推理、長脈絡理解這些難題上最直接的解方之一。當一家公司同時握有雲端基礎設施(阿裏雲)、自有晶片布局與完整應用場景,把規模做大,是它相對於純模型公司最難被複製的優勢。規模本身就是護城河,只要你養得起。

成本結構會怎麼變

5 到 10 萬億參數若成真,第一波感受到壓力的是推理成本。這也正是近月模型定價戰的主戰場,DeepSeek Flash 九月的調價把輸入端價格回到原點,顯示低價位競爭已經打到各家必須精算毛利結構的程度。當旗艦模型的參數放大五到十倍,直接透過 API 呼叫的成本曲線會變得更陡。

業界實際的因應做法是把大模型「蒸餾」成小模型再上線,大模型負責最難的題目與知識來源,小模型負責日常流量。這像中央廚房與門市的分工:中央廚房(大模型)做出醬料與半成品,門市(小模型)快速出餐。對開發者來說,下一代超大模型真正影響日常的,可能不是你直接呼叫它的帳單,而是你手上的小模型會因為它而變強多少。

對不同讀者的「所以呢」

對應用開發者,訊號是:不必急著把架構綁死在任何單一模型上。規模競賽加速,模型能力的排名洗牌週期只會更短,抽象層與可替換的推理介面比以往任何時候都重要。

對企業決策者,真正該問的問題不是參數多大,而是訓練資料的品質與合規邊界。超大模型的優勢要兌現,前提是它看過的資料夠乾淨、夠貼近你的業務場景。參數規模是引擎馬力,資料是路況,馬力再大,路不通也快不了。

對一般使用者,短期內的感受會很間接:更穩定的多步驟任務執行、更少的胡言亂語、更長的上下文記憶。這些改善不會出現在規格表上,卻是規模擴張最終要兌現的承諾。

下一步看什麼

驗證這條消息,與其等官方發布會,不如盯三個訊號。第一,阿裏雲的 GPU 叢集擴建與租賃價格變化,訓練超大模型先反映在算力採購。第二,通義系列開源模型的下一個版本,如果開源版本參數也明顯放大,代表路線確定。第三,API 定價的結構調整,推理成本終究會轉嫁到價格表上,屆時整個市場的定位會重新洗牌。

參數規模不是唯一的競賽,但它仍是最燒錢、最誠實的那一條。阿裏巴巴把賭注押在「大」這一字上,成敗會在未來幾個季度的雲端財報與開源社羣的採用率裡,一點一點現形。

#阿裏巴巴+ai模型#通義千問+算力成本#大型語言模型+企業應用