做 Agent 的人多半遇過一種彆扭的呼叫:輸出特別短。用戶傳來一句「升級之後整個部門都登不進去了,今天的工作全卡住」,你不需要模型寫排障報告,只想知道這算故障還是諮詢、有多緊急、要不要交給人工。結果還是得寫一長串提示詞,請模型判斷、只回 JSON、不要解釋、欄位必須如何如何。能用,但總覺得繞了一大圈。
掘金在 2026 年 9 月 23 日有一篇文章,正是從這個最小情境出發,討論 Laya 與 Jev 兩個專門做「判斷」的模型專案。這篇文章把幾個容易混在一起的問題分開講:它們到底做什麼、差在哪、要不要自己部署、接入時怎麼選。以下依該文核對至當日的公開資料整理,本文並未實際下載權重或跑推理。
Laya 做的事:模型判斷,程式決定
Laya 是 Convai Innovations 公開的非自回歸決策模型專案,提供程式碼、權重與 Python SDK,授權採 Apache 2.0。它的輸入分兩份:一是這次要看的材料(state),例如工單內容或幾條相關日誌;二是你想判斷什麼(questions),包括候選選項、每個等級代表什麼,全部由應用自己定義。
輸出則有三種型態。choice 回傳被選中的標籤、各選項機率與置信度,適合「這是故障、諮詢還是功能建議」這類單選題;score 回傳等級的機率分布,並按等級索引算出期望分數,適合緊急程度評估;noul 回傳判斷成立的機率,範圍 0 到 1,例如「材料是否顯示多人受影響」。
score 最容易被誤會成「模型隨口編一個百分制分數」。實際計算方式是:假設定義三個等級,索引 0、1、2,模型給出的機率分別是 0.1、0.3、0.6,期望分數就是 1.5。這組數字是原作用來解釋計算方式的示意,並非實測輸出。
用個比喻:生成式模型像請一位顧問寫完整報告,你再從報告裡撈結論;Laya 像一臺選票機,你把題目和選項擺上去,它直接告訴你每個選項得了幾票。票數透明的好處是出問題時好查:分類錯了,回頭看材料與機率分布;升級規則不合理,改的是業務邏輯。兩者不會糊在一長段提示詞裡。
但「不會生成候選項以外的標籤」不代表「不會判斷錯」。一張故障工單被分進諮詢佇列,回傳格式可以完全正確,業務結果照樣不對。原作也提醒,問題要問得夠具體:「請綜合判斷這個客戶值不值得挽留」太寬;「是否明確提出退訂」「是否重複報障」「目前問題是否阻斷使用」這種問法才好拆開判斷、交給程式組合。
為什麼快:不用先寫答案再抽標籤
生成式模型是一個 token 接一個 token 地生成。Laya 走的是另一條路:把問題、選項和材料一起編碼,直接對候選項計算分數、轉成機率,再按問題型態構造回傳值。不需要先生成一段回答,再從回答裡抽標籤。
從實作看,它採用雙向 Transformer 編碼器加決策頭;每個選項在輸入裡有對應標記,決策頭讀取這些位置打分。選項可以在呼叫時更換,但「能換選項」不保證換到任何領域都判得準。同一次 predict 裡的多個問題會組成一個批次做前向計算,問題多了,計算與記憶體負擔一樣會增加,沒有魔法。
目前公開的幾個 checkpoint 大致是:英文版用 ModernBERT-large 編碼器,約 421M 參數,預設輸入 512 tokens;多語言版用 mmBERT-base,約 322M 參數,預設 1,024 tokens,適合中文等任務;另有 typed-decisions 版本,適合與其專項微調任務接近的工作流。這些長度不全是材料的額度,問題和選項也要佔空間。多語言版的預設問題預算是 256 tokens,材料大約剩 768 tokens 可用,實際還受輸入格式影響。
這種「小模型做專用判斷」的路線,與先前分析的把判斷模型裝進 Codex 讓 Agent 決定下一步是同一個方向的延伸:把決策從生成流程裡拆出來,交給更便宜、更可檢驗的專用元件。
跟 Jev 差在哪,什麼時候自己部署
原作把幾個常被混談的問題分開處理。Laya 與 Jev 的共同點是都讓模型讀材料、回答範圍明確的問題,再把結果交給程式;差異在 Laya 是公開權重、可自架的模型專案,Jev 則偏向可直接使用的產品形態。若你的判斷需求涉及內部資料、需要控制延遲與成本邊界,自架 Laya 這類開源權重才劃算;若只是想快速在既有流程裡加一層判斷,先理解 Jev 這類工具能替你做什麼更實際,這點在Jev 被講爆火之前,先弄懂它替你做什麼一文中有更完整的鋪陳。
部署面,原作以 Laya 0.3.7 為準給出示例,並聲明程式碼與命令依公開介面和釋出源碼核對,未實際運行。對一般團隊,選型時值得先問三件事:你的判斷問題能不能拆成範圍明確的選項;材料長度是否在預算內;判錯的代價由誰承擔。這些答案清楚之前,換模型解決不了流程問題。
回到日常
這類決策模型的意義,不在取代生成式模型,而在把 Agent 裡那些「輸出只有幾個欄位」的呼叫獨立出來。客服分流、工單分級、內容審核初篩,這些工作上到處是範圍明確的判斷題。當判斷的成本降到夠低、結果夠可檢驗,把它嵌進每一條工作流的關卡,才會變成一件不用猶豫的事。
主題