學習中心/術語一次搞懂·22 分鐘

Jev 是什麼?不會寫字的 AI,為什麼反而有人搶著用

一句話回答

Jev 是 TypeSafe AI 在 2026 年 9 月推出的模型,特點是不生成文字。你給它一份資料與幾個判斷題,它直接回傳每個選項的機率與一個信心分數,程式可以拿去就用。用途是分類、評分、真假判定這類「軟體要做的決定」,不是拿來跟人聊天。

先講結論:它是一個不會寫字的 AI

你熟悉的 AI 都是拿來「產出東西」的:寫文案、回信、整理會議紀錄。Jev 反過來,它一個字都不寫,只做一件事:回答你給的判斷題。

例如你丟一封客訴信給它,問「這該轉給哪個部門」,它不會回一段話跟你解釋,而是直接回:客服 0.92、業務 0.06、其他 0.02。這串數字你的程式可以直接拿去用,不用再叫另一個 AI 幫你把文字解析成資料。

做這個模型的是 TypeSafe AI,2026 年 9 月 15 日發表,創辦人 Diogo Almeida 是前 OpenAI 研究員,參與過 InstructGPT 與 ChatGPT 的開發。公司同時宣布完成 4,000 萬美元募資。

跟你熟悉的 AI 差在哪

差別不在「比較聰明」,在「產出的東西根本是不同型態」,而這決定了它為什麼快這麼多。

一般 LLM:一個字接一個字每個字都要等前一個字生出來才能算下一個,所以答案越長就越慢。拿到的是一段文字,你的程式還要自己去解析它。Jev:一次把所有問題平行算完同一份資料state要轉給誰客服 0.92 / 業務 0.06 / 其他 0.02急不急普通 0.71 / 緊急 0.29是不是客訴是 0.08 / 否 0.92三個問題同時算,回來的是可以直接進程式的數字,不用再解析文字。
一般 LLM 是把答案一個字一個字寫出來,Jev 不寫字,直接把所有問題同時算出機率。
  • 一般 LLM 是一個字接一個字算的:每個字都要等前一個字算完,所以答案越長越慢。這個做法叫自迴歸(autoregressive)
  • Jev 是一次平行算完:你一次丟三個問題,它把同一份資料讀一遍,三個問題同時判斷,不是排隊做
  • 回傳的型態不同:LLM 給你一段文字,你的程式要自己解析。Jev 直接給你數值與機率,格式由系統保證正確
  • 訓練方式不同:官方說法是用 RLCD(Reinforcement Learning for Calibrated Decisions,為了讓機率準而訓練),而不是一般 LLM 用來對齊人類偏好的那一套

「System One」這個名字在講什麼

TypeSafe 把 Jev 叫做 System One model,這個詞借自心理學裡「快思」與「慢想」的分法。快思是你看到紅燈就踩煞車,不需要推理。慢想是你算一題數學,要一步一步來。

他們的主張是:軟體裡有大量的決定其實屬於快思。這封信該分到哪、這張單要不要擋、這個申請分幾分,都是。這些事不需要一個會寫論文的模型,需要的是又快又便宜又穩定的判斷。

所以 Jev 不是要取代 ChatGPT 或 Claude。它想搶的是「本來就不該用大模型做,卻沒有更好選擇」的那一塊。

它只回答三種問題

這是用它之前一定要知道的限制。你想做的任何判斷,都得先拆成下面三種其中之一:

Choice選一個這封信該轉給哪個部門?客服 0.92|業務 0.06|其他 0.02回傳的是機率分布,不是一句話Score打分數這個客訴有多嚴重?(1 到 5)1:.02 2:.05 3:.18 4:.55 5:.20回傳的是機率分布,不是一句話Noul是不是真的這張發票的金額超過核准額度。0.87回傳的是機率分布,不是一句話
Jev 只接受這三種題型。你要它做的任何判斷,都得先拆成這三種其中之一。
  • Choice:從你給的選項裡挑一個,回傳每個選項的機率
  • Score:照你訂的級距打分,回傳每一級的機率
  • Noul:判斷一句陳述是不是真的,回傳一個 0 到 1 的機率
  • 選項數量上限 255:超過的話官方建議拆成兩階段:先讓它替每個候選各自打分,再用一次 Choice 從高分的幾個裡選
  • 輸入只吃文字:字串、JSON 或文字陣列都可以,但不支援圖片、聲音、影片

它還會告訴你「這題我有多確定」

除了答案,每一題還會附一個 0 到 1 的信心分數。官方的說法是這個分數來自機率分布的形狀:如果某個選項遙遙領先,信心就高。幾個選項機率差不多的時候,信心就低。

這一點是實務上最有價值的地方。你不需要它每題都答對,你需要的是「它答錯的時候,自己會舉手」。

一筆待判斷訂單/信件/申請Jev給答案+信心信心高直接自動處理不用人看信心中等自動做,但排進抽查事後看一眼信心低轉人工人來決定門檻要訂多高,看這件事做錯的代價。錯了只是多花五分鐘,門檻可以低一點。錯了要賠錢或得罪客人,就把門檻拉高、讓更多案子進人工。
它同時回一個信心分數。實務上最有價值的用法,是拿這個分數決定「這件事要不要人看」。
  • 門檻怎麼訂,看做錯的代價:錯了只是多花五分鐘,門檻可以低。錯了要賠錢或得罪客人,門檻就要拉高
  • 不要一開始就全自動:先讓它跑,但所有結果都還是人看,比對一兩週再決定哪一段可以放手
  • ⚠️ 官方自己說「數值校準」比較弱:也就是說「它說 0.9」不保證真的就是九成會對。要把這個分數當相對指標用,不要當成精準的機率

快多少、便宜多少

下面這些是廠商公布的數字,第三方只驗證了其中一部分,我在後面會分開講。先看規格:

  • 價格:每一百萬個輸入 token 收 0.042 美元,輸出不收費。官方的講法是「太便宜所以不計費」
  • 輸出免費為什麼重要:一般 LLM 的輸出通常比輸入貴好幾倍,而且你要的東西越長付越多。Jev 把這一塊歸零,等於成本只跟「你餵多少資料進去」有關
  • 回應時間:70 到 500 毫秒
  • 一次能處理的量:單次請求上限 64k token,其中「資料本體加上最長的那一題」不能超過 32k
  • 速率限制:每秒 25 萬 token、每分鐘 1,200 次請求,官方標明會動態調整
  • 怎麼接POST /v1/systemone,模型代號 jev-1.13.0,另有 jev-latestjev-preview 兩個別名。官方提供 Python 與 JavaScript 的 SDK
  • 資料政策:官方說不會拿客戶的請求與回應去訓練模型,企業方案另有零留存(ZDR)選項

官方自己列出來做不到的九件事

這是我覺得 TypeSafe 做得不錯的地方:他們在文件裡開了一頁專門講這個模型會在哪裡出錯。要評估值不值得用,這頁比任何行銷素材都有用。

  • 照字面讀:它回答你寫的那一題,不是你心裡想的那一題。範圍詞、否定句、隱含條件都會被照字面解讀
  • 不會算數:計數、數字比大小、四則運算都不可靠。官方原話是「Jev 不是計算機」
  • 日期時間比不出來:它把日期當文字讀,不是當有先後的量。問它「這兩個日期哪個早」不可靠
  • 繞來繞去的指令會錯:雙重否定、複雜的間接指涉,正確率會掉
  • 塞太多無關資料會變笨:跟這個判斷無關的內容越多,準確度越低
  • 可以被惡意內容帶偏:刻意寫來誘導模型的文字,有機會改變它的答案
  • 指令互相矛盾會亂:指示跟判準打架的時候,它會混淆
  • 沒有邏輯上的一致性保證:問「這句是真的嗎」跟問「這句是假的嗎」,兩個機率不保證加起來等於一
  • 不會寫字:硬要它生成文字只會得到不能用的東西

什麼情況適合用、什麼情況不要

實務上不是二選一。判斷交給它,要寫字的還是交給一般 LLM:

客人來信分類與判斷Jev寫回覆草稿一般 LLM人拍板快、便宜、可量化會寫字還有一種用法:讓它當一般 LLM 的守門員。LLM 寫完草稿之後,用 Jev 問一句「這段有沒有承諾我們做不到的事」,再決定要不要送出。這一關很便宜,加上去幾乎不影響成本。反過來不行:Jev 不會寫字,要它產出文案只會得到不能用的東西。
實務上不是二選一。判斷交給 Jev,要寫字、要解釋、要創作的那幾步還是交給一般 LLM。
  • 適合:客訴分類與派工、發票與單據挑異常、申請案初篩、名單評分、內容是否違反規則
  • 適合:當一般 LLM 的守門員。LLM 寫完草稿,用它問一句「這段有沒有承諾我們做不到的事」再決定送不送
  • 不適合:要算錢、比日期、做多步推理的事
  • 不適合:要產出文案、回信、摘要這類需要寫字的事
  • 不適合:判斷條件本身講不清楚的情境。拆不成三種題型,通常代表規則還沒想清楚
  • 實務上的架構是「多個模型並存」:前面放一層路由,依照這一次要做什麼決定派給誰。判斷走 Jev、寫字走 LLM,而不是整套系統只選一個模型

它還被拿來即時控制東西,但要看清楚前提

發表時最吸引人的不是分類 demo,是幾個即時控制的示範。因為每次判斷只要幾十到幾百毫秒、又幾乎不花錢,所以可以做到「每一幀都問一次」。

  • 玩 Doom:把遊戲狀態整理成結構化資料餵給它,由它決定下一步動作
  • Minecraft 機器人:出現過沒有特別寫進程式的行為,例如看到殭屍會跑。官方說兩分鐘的遊玩成本大約一美分
  • 自駕模擬器:在加速、煞車、變換車道之間即時選一個
  • 無人機導航:把位置、速度、離障礙物的距離當成輸入,輸出控制指令
  • ⚠️ 這些全部都在模擬器裡:沒有真實硬體、沒有感測器雜訊、也沒有經過安全攸關的失效測試。看的時候要把這件事放在心上

廠商說的,跟目前真的被驗證的

這段是我認為評估新工具時最該看、但多數介紹文章不會寫的部分。把宣稱跟證據分開:

  • 已被第三方重現:價格、回應速度(實測每筆約 0.3 到 0.5 秒)、平行判斷(有測試者一次跑 777 個判斷在 0.7 秒內完成)、格式一定正確
  • 只有廠商自己說:RLCD 的校準效果目前沒有論文、沒有可靠度曲線、沒有公開的誤差數字
  • 「零幻覺」要看清楚講的是什麼:它指的是「輸出格式一定符合你定義的型別」,不是「答案一定對」。格式對跟內容對是兩件事
  • 速度與成本的倍數會因情境差很多:同一次發表在不同管道出現過 20 至 200 倍、193.6 倍、最高 100 倍等不同說法,那些是特定情境的峰值,不是你會遇到的平均
  • 評測有方法上的偏誤,官方自己也承認:比對的標準答案取自另外兩個大模型的平均,測試流程由 TypeSafe 自己的團隊設計,被比較的模型是透過他們的包裝層跑的
  • 獨立測試結果有好有壞:有人測事件驗證拿到約 96% 準確率,也有人發現七個刻意埋的缺陷裡它漏掉一個,而其他模型抓到了
  • 目前還沒有公開的客戶名單與營收:採候補名單制的早期存取,還不是「隨時可以上線」的成熟狀態

想試的話,從哪裡開始

如果你手上有那種「每天要判斷幾百次、規則其實很清楚、但一直靠人看」的工作,值得試。建議的順序:

  • 先挑一件事,不要一次全上:選規則清楚、量大、做錯代價小的,例如來信分類
  • 把判斷拆成三種題型:能不能拆得乾淨,就是這個任務適不適合的第一關。拆不出來通常代表你自己還沒想清楚規則
  • 先影子模式跑一陣子:讓它判斷但不真的執行,把它的答案跟人的答案放在一起比對一兩週
  • 再用信心分數分流:確認高信心那一段真的夠準,才把那一段放手自動化
  • 規格還會變:目前是早期存取,價格、速率限制、模型版本都可能調整,實際以官方文件為準

對一般公司的意義

如果你不打算自己接 API,這件事跟你還是有關,因為它改變的是「自動化的成本結構」。

以前一個判斷要呼叫大模型,成本與延遲都讓你只敢在重要的地方用。當單次判斷便宜到幾乎可以忽略、而且快到使用者感覺不出來,原本「不值得自動化」的那一大堆小決定就變得值得做了。

實際的影響會出現在你用的 SaaS 上:客服系統的自動分類變準、審核流程開始有初篩、表單送出的當下就能判斷要不要擋。你不用知道背後是哪個模型,但知道這件事,你在評估工具時會多問一句「你們的自動判斷是怎麼做的」。

常見問題

Jev 可以取代 ChatGPT 或 Claude 嗎?

不行,用途完全不同。Jev 不會寫字,只回答選擇、評分、真假這三種判斷題。要寫文案、回信、做摘要還是得用一般的 LLM。實務上是兩個搭配用。

「零幻覺」是真的嗎?

要看它在講什麼。它保證的是「輸出格式一定符合你定義的型別」,這點是數學上成立的。但格式對不等於答案對,它一樣會判斷錯。把這句話理解成「不會回傳你程式看不懂的東西」比較準確。

為什麼可以便宜這麼多?

因為它不生成文字。一般 LLM 要一個字一個字算,答案越長成本越高。Jev 只算選項的機率,計算量小很多,而且所有問題平行處理。官方的定價是輸入每百萬 token 0.042 美元、輸出免費。

信心分數可以直接當機率用嗎?

不建議。官方文件自己註明「數值校準」比較弱,也就是它說 0.9 不保證真的九成會對。比較安全的用法是當相對指標,自己用實際資料校出門檻。

它為什麼不會算數?

因為它不是照著步驟推理,而是直接判斷。這類架構在計數、比大小、四則運算上本來就不可靠,官方文件也明講「Jev 不是計算機」。要算數就交給程式或一般 LLM。

中文支援怎麼樣?

官方文件以英文為主,沒有公開中文的專屬評測數字。第三方整理提到英文以外的語言表現「不等同於英文」。要用在中文情境,建議自己拿實際資料先測過再決定。

現在就可以用嗎?

目前是早期存取,要登記候補名單。也還沒有公開的客戶案例與營收資訊,評估時要把「還在早期」這件事算進去。

那些「快 200 倍」的說法可信嗎?

速度快是真的,第三方實測每筆約 0.3 到 0.5 秒。但倍數要看跟誰比、比什麼。同一次發表在不同管道出現過好幾個不同的倍數,那些是特定情境的峰值。看絕對數字比看倍數實在。

我沒有工程師,這跟我有關嗎?

有,但是間接的。它改變的是自動化的成本結構,原本「不值得自動化」的小判斷變得值得做。影響會出現在你用的 SaaS 上,例如客服自動分類變準、審核多了初篩。

延伸閱讀

想讓整個團隊真的會用 AI?

我把自己經營公司在用的 AI 實戰,做成企業內訓 —— 帶團隊用真實任務當場做出成果。

看企業 AI 內訓