跳至主要內容
科技 科普

27B 模型塞進 7GB:三進制盆栽 Bonsai 2,把大型模型搬回你的書桌

PrismML 推出三進制權重的 Ternary-Bonsai-2-27B,把 Qwen3.8-27B 壓到 7GB 出頭,讓 16GB 消費級顯卡跑得動 27B 模型,這篇文章從壓縮機制與部署實務整理它對本地 AI 使用者的意義。

YIM NEWS 編輯台 閱讀約 5 分鐘

一個 27B 參數的模型,用 FP16 存放要 54GB 的顯存。一般人家裡的顯卡,多半在 8GB 到 16GB 之間,連邊都摸不上。PrismML 在 2026 年 9 月放出的 Ternary-Bonsai-2-27B,把這個數字壓到 7.21GB,一張 16GB 的 RTX 5060 Ti 裝得下,還能把 262K 的上下文開滿。這件事值得講清楚,因為它碰到的不是「又一個壓縮版模型」,而是低比特量化長年解不開的那個結:位寬砍半、智商清零。

三進制是什麼意思:把權重逼到三個選項裡

先講機制。一般模型的每個權重是個浮點數,可以是 0.0372、-1.4847 這種任意值。量化就是把這些連續的數值,換成少數幾個固定值。常見的 4-bit 量化有 16 個臺階可選;三進制更激進,只剩三個:-1、0、+1。

用日常比喻:原本每個權重像一臺可以調到任意音量的旋鈕,三進制則是把旋鈕換成三段開關,大聲、關掉、小聲。聽起來像自殘,但模型有幾百億個權重,少量的「音量補償」可以靠鄰居吸收。Bonsai 2 的做法是每 128 個權重共享一個 FP16 的縮放係數,實際平均位寬 1.72 bpw。這次連 embedding 和 LM head 也一起三進制化,沒有留高精度的後門,壓縮才算徹底。

維持智慧靠的是另一個關鍵:分塊 Hadamard 旋轉。權重在離線階段先做變換,運行時對啟用值做對應的逆變換,把誤差攤平到整個向量裡,而不是集中在少數幾個維度上炸開。這也是為什麼官方配套的 llama.cpp fork 是必需品:原版 llama.cpp 看到這種格式會直接拒載,裝了舊版 fork 則更糟,模型會載入成功但輸出垃圾,而且沒有任何警告。

成績單:96% 到 98% 的保留率意味著什麼

模型卡上的數字值得停下來看。官方 14 項 thinking 模式基準平均 84.78,對照 FP16 保留約 98.2%;數學 96.57,與全精度差距不到半分;編碼 89.42 與基線持平。真正有說服力的對照組是傳統 IQ2_XXS:同樣往 2-bit 附近壓,平均只有 72.59。

低比特量化的老問題向來如此:4-bit 還堪用,3-bit 開始崩,2-bit 幾乎不可用。Bonsai 2 的路線顯示,搭配得當的數學工具(三進制加旋轉)有機會把這條懸崖往後推。對使用者的意義很實際:本地跑 27B 級模型的門檻,從一張兩三萬元的專業卡,降成一張遊戲卡。

兩種打包格式:同樣的權重,不同的裝箱法

Bonsai 2 提供兩種格式,選哪個是部署時最常見的困惑。PTQ1_0 是密集三值,1.75 bpw,檔案 5.95GB;PQ2_0 則讓每個三值佔一個 2-bit 槽位,2.13 bpw,7.21GB。權重內容完全相同,差別只在儲存與解碼方式:前者更省空間,後者解碼路徑更簡單,換來一點體積付出。

這就像同樣一批貨,一種塞滿貨櫃每個縫隙,另一種用標準棧板好搬好卸。原文作者的實測結論是替讀者做了了斷:空間緊張選 PTQ1_0,要穩要省事選 PQ2_0,兩者的輸出品質一致,因為權重根本是同一套。

部署時的三個坑

實際裝起來不難,但有幾個地方會讓人卡住。第一,必須用 PrismML 自己的 llama.cpp fork,而且裝過一代(7 月基於 Qwen3.6-27B 的版本)的人不能只 git pull,舊版源碼裡連 PQ2_0 這個詞都搜不到,要整個 reset 到上遊最新分支。第二,Windows 上編譯時上遊測試檔用了 POSIX 的 setenv,MSVC 會直接報錯,反正不跑測試,編譯時關掉即可。第三,50 系顯卡(Blackwell 架構)要明確指定 CUDA 架構為 120,漏了這行編譯照樣過,執行時才出現各種玄學問題。

這三個坑有個共同點:錯誤訊息都不會直接告訴你原因。自己編譯推理引擎的經驗價值就在這裡,踩過一次就知道去哪查。

所以呢:本地大模型的算式變了

把視角拉遠一點。過去一年,本地跑大模型的討論常停在一個尷尬位置:小模型塞得進顯卡但不夠聰明,夠聰明的模型塞不進去。雲端 API 因此成為預設選項,代價是資料出門、費用按月流、模型版本由別人決定。

三進制路線如果穩定下來,這個算式會改寫。7GB 的佔用意味著 12GB 級顯卡有餘裕開長上下文,16GB 級可以同時放模型和應用程式。對處理機密文件、離線環境、或者單純不想把工作內容送上雲的人,這是實質的選項,而非示範品。Apache 2.0 的授權也讓商用沒有懸念。

該留意的限制同樣明確:98.2% 的保留率不是 100%,長鏈推理與細微風格差異上仍可能有可感知的落差;配套 runtime 綁定特定 fork,生態工具(各種前端、代理層)要跟上的時間差仍存在。三進制模型目前是一條值得追蹤的路線,還稱不上產業共識。

判斷方式很簡單:如果你的顯卡在 16GB 附近,且一直想本地跑 27B 級模型,現在是第一次這件事在技術上成立。至於要不要把工作流整個搬過去,先拿自己的實際任務測一輪,比看任何基準分數都準。

#prismml+本地ai部署#三進制量化+消費級顯卡#qwen3.8-27b+開源模型