Jev 是什麼?不會寫字的 AI,為什麼反而有人搶著用
一句話回答
Jev 是 TypeSafe AI 在 2026 年 9 月推出的模型,特點是不生成文字。你給它一份資料與幾個判斷題,它直接回傳每個選項的機率與一個信心分數,程式可以拿去就用。用途是分類、評分、真假判定這類「軟體要做的決定」,不是拿來跟人聊天。
先講結論:它是一個不會寫字的 AI
你熟悉的 AI 都是拿來「產出東西」的:寫文案、回信、整理會議紀錄。Jev 反過來,它一個字都不寫,只做一件事:回答你給的判斷題。
例如你丟一封客訴信給它,問「這該轉給哪個部門」,它不會回一段話跟你解釋,而是直接回:客服 0.92、業務 0.06、其他 0.02。這串數字你的程式可以直接拿去用,不用再叫另一個 AI 幫你把文字解析成資料。
做這個模型的是 TypeSafe AI,2026 年 9 月 15 日發表,創辦人 Diogo Almeida 是前 OpenAI 研究員,參與過 InstructGPT 與 ChatGPT 的開發。公司同時宣布完成 4,000 萬美元募資。
跟你熟悉的 AI 差在哪
差別不在「比較聰明」,在「產出的東西根本是不同型態」,而這決定了它為什麼快這麼多。
- 一般 LLM 是一個字接一個字算的:每個字都要等前一個字算完,所以答案越長越慢。這個做法叫自迴歸(autoregressive)
- Jev 是一次平行算完:你一次丟三個問題,它把同一份資料讀一遍,三個問題同時判斷,不是排隊做
- 回傳的型態不同:LLM 給你一段文字,你的程式要自己解析。Jev 直接給你數值與機率,格式由系統保證正確
- 訓練方式不同:官方說法是用 RLCD(Reinforcement Learning for Calibrated Decisions,為了讓機率準而訓練),而不是一般 LLM 用來對齊人類偏好的那一套
「System One」這個名字在講什麼
TypeSafe 把 Jev 叫做 System One model,這個詞借自心理學裡「快思」與「慢想」的分法。快思是你看到紅燈就踩煞車,不需要推理。慢想是你算一題數學,要一步一步來。
他們的主張是:軟體裡有大量的決定其實屬於快思。這封信該分到哪、這張單要不要擋、這個申請分幾分,都是。這些事不需要一個會寫論文的模型,需要的是又快又便宜又穩定的判斷。
所以 Jev 不是要取代 ChatGPT 或 Claude。它想搶的是「本來就不該用大模型做,卻沒有更好選擇」的那一塊。
它只回答三種問題
這是用它之前一定要知道的限制。你想做的任何判斷,都得先拆成下面三種其中之一:
- Choice:從你給的選項裡挑一個,回傳每個選項的機率
- Score:照你訂的級距打分,回傳每一級的機率
- Noul:判斷一句陳述是不是真的,回傳一個 0 到 1 的機率
- 選項數量上限 255:超過的話官方建議拆成兩階段:先讓它替每個候選各自打分,再用一次 Choice 從高分的幾個裡選
- 輸入只吃文字:字串、JSON 或文字陣列都可以,但不支援圖片、聲音、影片
它還會告訴你「這題我有多確定」
除了答案,每一題還會附一個 0 到 1 的信心分數。官方的說法是這個分數來自機率分布的形狀:如果某個選項遙遙領先,信心就高。幾個選項機率差不多的時候,信心就低。
這一點是實務上最有價值的地方。你不需要它每題都答對,你需要的是「它答錯的時候,自己會舉手」。
- 門檻怎麼訂,看做錯的代價:錯了只是多花五分鐘,門檻可以低。錯了要賠錢或得罪客人,門檻就要拉高
- 不要一開始就全自動:先讓它跑,但所有結果都還是人看,比對一兩週再決定哪一段可以放手
- ⚠️ 官方自己說「數值校準」比較弱:也就是說「它說 0.9」不保證真的就是九成會對。要把這個分數當相對指標用,不要當成精準的機率
快多少、便宜多少
下面這些是廠商公布的數字,第三方只驗證了其中一部分,我在後面會分開講。先看規格:
- 價格:每一百萬個輸入 token 收 0.042 美元,輸出不收費。官方的講法是「太便宜所以不計費」
- 輸出免費為什麼重要:一般 LLM 的輸出通常比輸入貴好幾倍,而且你要的東西越長付越多。Jev 把這一塊歸零,等於成本只跟「你餵多少資料進去」有關
- 回應時間:70 到 500 毫秒
- 一次能處理的量:單次請求上限 64k token,其中「資料本體加上最長的那一題」不能超過 32k
- 速率限制:每秒 25 萬 token、每分鐘 1,200 次請求,官方標明會動態調整
- 怎麼接:
POST /v1/systemone,模型代號jev-1.13.0,另有jev-latest與jev-preview兩個別名。官方提供 Python 與 JavaScript 的 SDK - 資料政策:官方說不會拿客戶的請求與回應去訓練模型,企業方案另有零留存(ZDR)選項
官方自己列出來做不到的九件事
這是我覺得 TypeSafe 做得不錯的地方:他們在文件裡開了一頁專門講這個模型會在哪裡出錯。要評估值不值得用,這頁比任何行銷素材都有用。
- 照字面讀:它回答你寫的那一題,不是你心裡想的那一題。範圍詞、否定句、隱含條件都會被照字面解讀
- 不會算數:計數、數字比大小、四則運算都不可靠。官方原話是「Jev 不是計算機」
- 日期時間比不出來:它把日期當文字讀,不是當有先後的量。問它「這兩個日期哪個早」不可靠
- 繞來繞去的指令會錯:雙重否定、複雜的間接指涉,正確率會掉
- 塞太多無關資料會變笨:跟這個判斷無關的內容越多,準確度越低
- 可以被惡意內容帶偏:刻意寫來誘導模型的文字,有機會改變它的答案
- 指令互相矛盾會亂:指示跟判準打架的時候,它會混淆
- 沒有邏輯上的一致性保證:問「這句是真的嗎」跟問「這句是假的嗎」,兩個機率不保證加起來等於一
- 不會寫字:硬要它生成文字只會得到不能用的東西
什麼情況適合用、什麼情況不要
實務上不是二選一。判斷交給它,要寫字的還是交給一般 LLM:
- 適合:客訴分類與派工、發票與單據挑異常、申請案初篩、名單評分、內容是否違反規則
- 適合:當一般 LLM 的守門員。LLM 寫完草稿,用它問一句「這段有沒有承諾我們做不到的事」再決定送不送
- 不適合:要算錢、比日期、做多步推理的事
- 不適合:要產出文案、回信、摘要這類需要寫字的事
- 不適合:判斷條件本身講不清楚的情境。拆不成三種題型,通常代表規則還沒想清楚
- 實務上的架構是「多個模型並存」:前面放一層路由,依照這一次要做什麼決定派給誰。判斷走 Jev、寫字走 LLM,而不是整套系統只選一個模型
它還被拿來即時控制東西,但要看清楚前提
發表時最吸引人的不是分類 demo,是幾個即時控制的示範。因為每次判斷只要幾十到幾百毫秒、又幾乎不花錢,所以可以做到「每一幀都問一次」。
- 玩 Doom:把遊戲狀態整理成結構化資料餵給它,由它決定下一步動作
- Minecraft 機器人:出現過沒有特別寫進程式的行為,例如看到殭屍會跑。官方說兩分鐘的遊玩成本大約一美分
- 自駕模擬器:在加速、煞車、變換車道之間即時選一個
- 無人機導航:把位置、速度、離障礙物的距離當成輸入,輸出控制指令
- ⚠️ 這些全部都在模擬器裡:沒有真實硬體、沒有感測器雜訊、也沒有經過安全攸關的失效測試。看的時候要把這件事放在心上
廠商說的,跟目前真的被驗證的
這段是我認為評估新工具時最該看、但多數介紹文章不會寫的部分。把宣稱跟證據分開:
- 已被第三方重現:價格、回應速度(實測每筆約 0.3 到 0.5 秒)、平行判斷(有測試者一次跑 777 個判斷在 0.7 秒內完成)、格式一定正確
- 只有廠商自己說:RLCD 的校準效果目前沒有論文、沒有可靠度曲線、沒有公開的誤差數字
- 「零幻覺」要看清楚講的是什麼:它指的是「輸出格式一定符合你定義的型別」,不是「答案一定對」。格式對跟內容對是兩件事
- 速度與成本的倍數會因情境差很多:同一次發表在不同管道出現過 20 至 200 倍、193.6 倍、最高 100 倍等不同說法,那些是特定情境的峰值,不是你會遇到的平均
- 評測有方法上的偏誤,官方自己也承認:比對的標準答案取自另外兩個大模型的平均,測試流程由 TypeSafe 自己的團隊設計,被比較的模型是透過他們的包裝層跑的
- 獨立測試結果有好有壞:有人測事件驗證拿到約 96% 準確率,也有人發現七個刻意埋的缺陷裡它漏掉一個,而其他模型抓到了
- 目前還沒有公開的客戶名單與營收:採候補名單制的早期存取,還不是「隨時可以上線」的成熟狀態
想試的話,從哪裡開始
如果你手上有那種「每天要判斷幾百次、規則其實很清楚、但一直靠人看」的工作,值得試。建議的順序:
- 先挑一件事,不要一次全上:選規則清楚、量大、做錯代價小的,例如來信分類
- 把判斷拆成三種題型:能不能拆得乾淨,就是這個任務適不適合的第一關。拆不出來通常代表你自己還沒想清楚規則
- 先影子模式跑一陣子:讓它判斷但不真的執行,把它的答案跟人的答案放在一起比對一兩週
- 再用信心分數分流:確認高信心那一段真的夠準,才把那一段放手自動化
- 規格還會變:目前是早期存取,價格、速率限制、模型版本都可能調整,實際以官方文件為準
對一般公司的意義
如果你不打算自己接 API,這件事跟你還是有關,因為它改變的是「自動化的成本結構」。
以前一個判斷要呼叫大模型,成本與延遲都讓你只敢在重要的地方用。當單次判斷便宜到幾乎可以忽略、而且快到使用者感覺不出來,原本「不值得自動化」的那一大堆小決定就變得值得做了。
實際的影響會出現在你用的 SaaS 上:客服系統的自動分類變準、審核流程開始有初篩、表單送出的當下就能判斷要不要擋。你不用知道背後是哪個模型,但知道這件事,你在評估工具時會多問一句「你們的自動判斷是怎麼做的」。
常見問題
Jev 可以取代 ChatGPT 或 Claude 嗎?
不行,用途完全不同。Jev 不會寫字,只回答選擇、評分、真假這三種判斷題。要寫文案、回信、做摘要還是得用一般的 LLM。實務上是兩個搭配用。
「零幻覺」是真的嗎?
要看它在講什麼。它保證的是「輸出格式一定符合你定義的型別」,這點是數學上成立的。但格式對不等於答案對,它一樣會判斷錯。把這句話理解成「不會回傳你程式看不懂的東西」比較準確。
為什麼可以便宜這麼多?
因為它不生成文字。一般 LLM 要一個字一個字算,答案越長成本越高。Jev 只算選項的機率,計算量小很多,而且所有問題平行處理。官方的定價是輸入每百萬 token 0.042 美元、輸出免費。
信心分數可以直接當機率用嗎?
不建議。官方文件自己註明「數值校準」比較弱,也就是它說 0.9 不保證真的九成會對。比較安全的用法是當相對指標,自己用實際資料校出門檻。
它為什麼不會算數?
因為它不是照著步驟推理,而是直接判斷。這類架構在計數、比大小、四則運算上本來就不可靠,官方文件也明講「Jev 不是計算機」。要算數就交給程式或一般 LLM。
中文支援怎麼樣?
官方文件以英文為主,沒有公開中文的專屬評測數字。第三方整理提到英文以外的語言表現「不等同於英文」。要用在中文情境,建議自己拿實際資料先測過再決定。
現在就可以用嗎?
目前是早期存取,要登記候補名單。也還沒有公開的客戶案例與營收資訊,評估時要把「還在早期」這件事算進去。
那些「快 200 倍」的說法可信嗎?
速度快是真的,第三方實測每筆約 0.3 到 0.5 秒。但倍數要看跟誰比、比什麼。同一次發表在不同管道出現過好幾個不同的倍數,那些是特定情境的峰值。看絕對數字比看倍數實在。
我沒有工程師,這跟我有關嗎?
有,但是間接的。它改變的是自動化的成本結構,原本「不值得自動化」的小判斷變得值得做。影響會出現在你用的 SaaS 上,例如客服自動分類變準、審核多了初篩。