Jev 是什麼?不寫字、只做判斷的 AI 模型,跟 LLM 差在哪

Jev 是什麼?不寫字、只做判斷的 AI 模型,跟 LLM 差在哪

企業用 LLM 做客服分流、文件分類時,每筆都要等模型逐字產生回覆。TypeSafe AI 於 2026 年 9 月 15 日發表 Jev,改成直接回傳事先定義的答案與機率。

30 秒看結論

  • Jev 是什麼:TypeSafe AI 的決策模型,只回答事先定好選項的問題,每個答案附機率
  • 跟大型語言模型(LLM)比:官方測試中,每件約 0.4 秒、成本不到 GPT-5.6 Sol 的 1%;準確度低於最強的幾款 LLM,差距依工作而定
  • 適合做什麼:客服分流、大量文件分類、AI 代理挑選工具這類答案範圍固定的判斷;中文表現不如英文,上線前要先用自己的資料測試
  • 怎麼開始用:TypeSafe 官方帳號,或 Elite Cloud 勤英科技自行開發的 MixRoute 閘道,模型代號都是 jev-latest

Jev 是什麼?

Jev 是美國新創 TypeSafe AI 於 2026 年 9 月 15 日發表的 AI 模型,API 模型代號為 jev-latest。創辦人 Diogo Almeida 曾在 OpenAI 參與讓語言模型遵循指令、與人對話的研究。

TypeSafe 把 Jev 歸為「System One 模型」。使用方式是送出一段要判斷的內容,加上幾個事先定好答案範圍的問題,Jev 回傳每題的答案與機率,不寫文章、不寫程式,也不能對話。

Jev 一次回傳多個判斷結果的示意

Jev 能回答三種問題

題型(官方名稱) 用途 測試中問的題目
選一個(Choice) 從你列出的選項挑一個,最多 255 個選項 「這封信該轉給哪個部門?」選項:帳務、技術、業務
評等級(Score) 依你定義的等級評分 「客戶有多不滿?」等級:語氣平和、有些不滿、非常生氣
是非題(Noul) 回答「是」的機率 「這封信的問題需要立即處理嗎?」

這三種問題可以放在同一次請求裡一起問,Jev 會同時回答,多問幾題幾乎不會變慢。

實測:三封中文客服信

勤英科技在 2026 年 9 月 29 日透過 MixRoute 呼叫 Jev,用三封自擬的中文客服信測試,每封信一次問上面三題:

  1. 「我的 Stripe 帳號已經連續三天串接失敗,一直在掉單,麻煩盡快協助處理。」
  2. 「這個月的帳單金額比上個月多了一倍,我想確認是不是算錯了。另外從昨天開始後台一直登不進去,我也沒辦法自己查明細。」
  3. 「請問你們可以開立含統編的三聯式發票嗎?我們下個月才會付款,不急,有空再回覆即可。」
信件 轉給哪個部門 客戶有多不滿 需要立即處理 回應秒數
第 1 封:串接失敗 技術 100% 有些不滿 98% 92% 0.9
第 2 封:帳單與登入 帳務 79%、技術 21% 語氣平和 52%、有些不滿 48% 77% 0.5
第 3 封:詢問發票 帳務 100% 語氣平和 100% 5% 0.4

Jev 給出答案時,也會告訴你它有多確定。第 1 封與第 3 封的機率都集中在單一選項,代表 Jev 很確定;第 2 封的「客戶有多不滿」幾乎一半一半,代表 Jev 拿不定主意。

Jev 會把這種確定程度換算成一個 0 到 1 的「信心值」:第 1 封轉部門的信心值是 1.0,第 2 封的不滿程度信心值只有 0.27。信心值低的案件,適合交給人判斷。

Jev 跟 LLM 差在哪?

ChatGPT、Claude 這類大型語言模型(LLM)一次產生一個字詞。即使用結構化輸出限定只回傳分類標籤,也是逐字產生。Jev 則是一次算出所有題目的答案。TypeSafe 官方的對照如下:

項目 一般 LLM Jev
輸出 一段文字,可能是回覆或程式碼,也可能格式不符 事先定義的選項、分數或機率
產生方式 逐字依序產生 所有題目同時算出
價格(每百萬 token) 輸入 $0.20 到 $10,輸出約為輸入的 5 倍 輸入 $0.042,輸出不收費
信心程度 要求模型自評時,常偏向過度自信 每題附機率,選一個與評等級另附信心值
LLM 生成文字與 Jev 直接給出答案的對比示意

「不會幻覺」指的是答案不會超出你給的範圍

TypeSafe 主打 Jev 不會產生幻覺,依據是它只能回傳事先定義的選項,不會冒出範圍以外的答案或格式錯誤。這不代表每題都答對,Jev 仍可能在合法選項中選錯。

官方所說的機率校準,是指一批判斷的機率與實際正確率相符,不保證單一答案正確。

Jev 的速度、價格與準確度,官方數字怎麼看?

輸出不收費,只算輸入

Jev 每百萬輸入 token $0.042,輸出不收費。至於價格能否維持,TypeSafe 表示目前無法證明沒有補貼,公司預期未來會降價。

比 GPT-5.6 Sol 便宜上百倍、快數十倍,準確度較低

TypeSafe 用自動化流程測試:發票處理與客服回覆。

受測的 LLM 使用各家預設的推理設定,也要跟 Jev 一樣輸出每個答案的機率。TypeSafe 指出,這會比只回答選項更慢、更貴,表中的時間與成本不能直接套用到企業現有的流程。結果如下:

客服回覆(依對話內容與帳戶狀態,決定下一步怎麼回覆、怎麼處理)

模型 準確度 每件成本 每件秒數
Jev 76.0% $0.0001 0.4
GPT-5.6 Sol 78.3% $0.0323 10.1
Claude Opus 5 72.4% $0.0579 16.6
Claude Sonnet 5 69.3% $0.0264 14.3
GPT-5.6 Luna 71.4% $0.0013 8.8

發票處理(比對帳單、訂單與實際交貨,決定付款、暫緩或退回)

模型 準確度 每件成本 每件秒數
Jev 61.8% $0.0011 0.5
GPT-5.6 Sol 79.1% $0.2152 34.3
Claude Opus 5 78.4% $0.4856 92.1
Claude Sonnet 5 72.9% $0.3616 241.3
GPT-5.6 Luna 67.8% $0.0081 21.4

客服回覆,Jev 的準確度只比 GPT-5.6 Sol 低 2.3%,每件成本卻不到 Sol 的百分之一,速度快約 25 倍。發票處理的準確度是五款中最低,比 Sol 低 17%,但速度快約 70 倍。

這兩張表都是 TypeSafe 自己做的測試,不是第三方的獨立評測。

哪些工作適合交給 Jev?

Jev 適合答案範圍能事先列出、量大、需要即時回應的判斷,常見的用途包括:

  • 客服工單分流與排定優先順序
  • 大量文件或郵件的分類與篩選
  • AI 代理(agent)執行中挑選工具,或在 AI Gateway 裡決定每個請求交給哪個模型
  • 檢查其他模型的輸入與輸出是否安全
  • 需要在一秒內做出判斷的即時應用,例如互動介面

用信心值決定哪些案件自動處理

信心值的用法是設一個門檻:高於門檻的,系統依答案自動處理;低於門檻的,再交給能力較強的 LLM 或人工確認。官方文件的客服範例,就把信心值低於 0.3 的工單轉給人工分派。

門檻要依自家資料調整。TypeSafe 建議,調過門檻的系統鎖定模型版本(例如 jev-1.13.0),避免新版上線後答案分布改變。

不適合:生成內容、數值運算與日期比較

官方列出 Jev 目前的弱項:

  • 生成文字:要寫回覆、摘要或程式,仍要用 LLM
  • 數學與計數:金額計算、數量統計要交給程式
  • 日期比較:可以讓 Jev 擷取日期,比先後、算天數交給程式
  • 圖片、音訊與影片:只收文字,要先轉成文字或結構化欄位
  • 過多無關內容:輸入與問題無關的資訊越多,準確度越低,送出前先保留相關資料

中文可以用,但表現不如英文

官方說明 Jev 以英文訓練為主,目前英文的準確度最好,中文等其他語言可以處理,但表現不如英文。官方沒有公布中文的準確度數字。

處理中文資料的企業,上線前可先選一批真實案例,讓 Jev 與現用的 LLM 處理同一批資料,再比較結果與每件成本。

在台灣怎麼開始使用 Jev?

目前可以從以下管道呼叫 Jev:

  • TypeSafe 官方:在 TypeSafe 的開發者平台申請帳號與 API key,以美元計價。TypeSafe 已於 9 月 21 日取消候補名單,開放所有使用者使用
  • MixRoute:勤英科技自行開發的 AI API 閘道,一組 API key 就能呼叫 Jev 與 GPT、Claude、Gemini 等 LLM,低信心案件改交 LLM 處理時不必另外申請帳號,也方便拿同一批資料比較兩者;費用照原廠牌價計算

企業若需要含統編的統一發票,可以向勤英科技採購 MixRoute 的使用額度,由勤英開立發票,做法整理在AI API 統一發票找誰開。

Jev 使用 TypeSafe 專用的請求格式,輸入是一段待判斷的內容和一組問題。這與 LLM 常用的 OpenAI 聊天格式不同,企業若已串接 LLM,仍須另外撰寫呼叫 Jev 的程式。

企業想評估哪些判斷工作可以改用 Jev、哪些留給 LLM,勤英科技的 AI API 串接整合服務提供模型選型、測試部署與中文技術支援。

結論

Jev 適合接手答案範圍固定、量大的判斷工作,要寫內容與推理的部分仍交給 LLM。

先選一項目前由 LLM 處理的分類或分流工作,用同一批真實資料比較 Jev 與現用模型的準確度及每件成本,再依結果設定信心門檻。模型選型與串接,勤英科技可以協助評估。

資料來源

  • Introducing System One Models & Jev(TypeSafe 官方發表文,2026 年 9 月 15 日發表;2026 年 9 月 29 日查閱)
  • TypeSafe 官網(2026 年 9 月 29 日查閱)
  • System One(TypeSafe 官方文件,與 LLM 的差異與校準的定義;2026 年 9 月 29 日查閱)
  • Choice(TypeSafe 官方文件,題型、信心值與客服範例;2026 年 9 月 29 日查閱)
  • Models(TypeSafe 官方文件,價格、長度限制、語言支援與版本;2026 年 9 月 29 日查閱)
  • Jev 1.13 jaggedness(TypeSafe 官方文件,目前的弱項;2026 年 9 月 29 日查閱)
  • Workflow evals(TypeSafe 官方測試,四個工作流程的準確度、成本與時間;2026 年 9 月 29 日查閱)
  • 前 OpenAI 研究員新創 TypeSafe 推 Jev 模型(iThome,2026 年 9 月 21 日;開放時程;2026 年 9 月 29 日查閱)
AI 模型 Jev TypeSafe