跳至主要內容
科技 分析

Agent的下一步該做什麼,現在可以外包給一個專門「做選擇」的小模型

把Jev判斷模型裝進Codex之後,Agent的下一步動作交給專用小模型決定,本文分析這種分工對日常開發與自動化工作的實際意義。

刊登:(台北時間) 閱讀約 5 分鐘

2026年9月下旬,掘金上一篇標題寫著「給Codex配上Jev,直接起飛」的實測文章在技術圈流傳開來。文章作者示範了一套很新的組合:把Jev這個判斷模型裝進Codex,讓它替Agent決定每一步該幹嘛。影片與文章的熱度都不低,背後其實是一個值得所有在用AI工具工作的人想清楚的問題:當Agent的行動清單越來越長,那個「決定下一步」的環節,是否該交給一個更便宜、更專一的模型。

我們先前已經寫過Jev爆火時先弄懂它替你做什麼,這次把鏡頭拉近到它與Codex的實際搭配,看這個組合改變了工作流程中的哪一環。

判斷模型在做一件很小、但很關鍵的事

先講機制,用一個日常比喻。Jev像公司裡那種資深的櫃檯人員:你把現況告訴他(客戶要什麼)、把手上的選項攤開(直接回覆、查資料、問主管),他不負責執行任何一件事,只負責告訴你「先做哪一件,把握幾成」。

技術上,它的輸入是一個狀態描述加上幾個候選動作,輸出是一個選擇加一個信心分數。在掘金作者的實測案例裡,輸入的狀態是「幫我分析今天輝達股價為什麼上漲」,已知事實為空,可用動作有四個:直接回答、聯網搜尋、檢查本地程式碼、詢問用戶,外加一個保險選項human_review。Jev回傳的結果是web_search,也就是它判斷這個請求依賴最新外部資訊,必須先上網查。

這件事聽起來簡單到有點不像一個產品。但換個角度看,Agent最常出錯的環節往往就是這裡。大型模型很會生成內容,卻不見得擅長在「該問用戶」和「該自己查」之間踩剎車。原因之一是它的訓練目標偏向把任務做完,而不是承認資訊不足。把「選哪條路」抽離出來交給一個只做選擇的小模型,等於把方向盤和引擎分開管理。

安裝方式也不複雜。Jev官方提供了名為TypeSafe的Skill,在Codex裡跑一行npx指令即可裝好,Claude Code與其他Coding Agent也支援。裝完後設定API Key的環境變數,下一輪對話開始,Codex遇到需要判斷、分類、路由或驗證的情境就會自動呼叫。

置信度門檻,才是這套流程真正的設計重點

示範提示詞裡有一條規則值得單獨拿出來講:Jev給出的信心分數達到0.8,Codex才執行它選的動作;低於0.8,一律轉為human_review,也就是暫停下來讓人看一眼。如果Jev的API呼叫失敗,Agent必須停下來回報,不允許大型模型自己補一個判斷矇混過去。

這條規則的意義,是把「不確定」變成一種可以被程式處理的狀態。多數人用AI工具的經驗是:模型要嘛做、要嘛不做,中間的猶豫是黑箱。加上判斷模型後,猶豫本身有了數字,數字有了門檻,門檻之後有人工這個出口。對於處理表單填寫、資料分類、客服路由這類大量重複決策的工作,這個結構比模型本身聰明與否更影響實際結果。畢竟每一次錯誤決策的善後成本,往往遠高於省下的那幾秒。

從成本角度看也合理。掘金作者貼出的回應顯示,Jev那次判斷只用了495個輸入token與63個輸出token。用一個極小的呼叫換掉大型模型內部漫長的自我糾結,帳面上的效率差異來源於此,網路上流傳的「決策快40%」之類的說法,講的正是這個分工,而非模型變聰明了。

判斷外包之後,人的位置反而更清楚

這類工具對不同工作情境的意義不太一樣。

寫程式的人最容易受益。Codex這類Coding Agent每天的難題之一,是該自己改、該查文件、還是該回頭問需求方。判斷模型把這個抉擇標準化之後,開發者得到的效益是「少一次錯誤方向的長途跋涉」。這與我們在模型選單變長之後難的是分配工作裡談的邏輯相通:當工具越來越多,價值逐漸從「哪個模型最強」移向「怎麼把對的決策交給對的環節」。

做營運、做資料整理的人則該注意另一面。判斷模型的效果高度取決於候選動作清單的品質。如果你的選項寫得含糊,或者漏掉了關鍵的第三條路,Jev只能在爛選項裡挑一個相對好的。它放大的是你對流程的理解,不是取代它。把「直接回答」「問用戶」「轉人工」這些選項想清楚、寫明白,這件事依然是人的工作。

下一步訊號:決策層正在長成一個獨立市場

把視野拉遠一點,Jev走紅反映的趨勢是Agent技術堆疊的分工細化。生成、檢索、判斷、執行,原本全塞在一個大模型裡的環節,正在被拆成可以單獨替換的零件。判斷這一環先被產品化,某種程度上是市場用腳投票的結果:大家發現Agent翻車多半翻在決策,而不是生成。

對一般使用者的實際建議有三條。第一,別急著把關鍵流程全交出去,先在低風險任務上試,觀察Jev的選擇與你自己直覺的落差,這個落差就是流程可以改進的地方。第二,門檻數字要按場景調,處理金流或對外溝通,0.8可能太鬆,拉到0.95不為過;整理內部資料,0.7也許就夠。第三,保留human_review這條路,並且認真對待每一次被轉回來的案例,那是系統在告訴你它的能力邊界在哪。

工具會持續換代,但「誰來決定下一步」這個問題會一直在。把這個環節想清楚的人,不管用哪一家的模型,工作品質都會比只追逐最強模型的人穩定。這大概是這波Jev熱潮裡,最值得帶走的一件事。

#jev+ai工作流程#codex+開發效率#判斷模型+自動化決策