限界 · 精度 · 較正

Jev の限界:TypeSafe の判断モデルにできないこと(2026)

このサイトのほとんどのページは何かの良さを説明します。このページが存在するのは、その上に自動化を載せる判断モデルは「失敗から読む」読み方に値するからです。Jev のベンチマークが実際に示した両面、「ハルシネーションしない」が約束することとしないこと、信頼度の数値が嘘をつくと計測された場面、そしてベンダーのページが冒頭に置こうとしない 4 つの構造的限界。

要点

Jev はテキスト専用のホスト型判断モデルです。確率付きの型付き回答を返し、テキストは生成しません。入力 100 万トークンあたり $0.042、出力は無料。独立系の証拠は良い面も悪い面も示しています。vals.ai のプレレジスト評価では、claim verification で GPT-6 クラスに並んだ(0.975、コストは Astra の約 1/498)一方、LegalBench では 12 系統中最下位(0.730)、contract NLI の 1 サブタスクで崩壊(0.485)、同タスクの較正は 12 系統中最悪(ECE 0.108)でした。構造的な限界は 4 つ。画像入力なし、32k トークンの読み取り上限、自由文の推論なし、ツール呼び出しなし。少なくとも 1 チーム(EmDash)は公開直後に Jev を評価し、本番には Clef を選びました。

このページの批判には、賛辞と同等の出典を付けています。vals.ai のプレレジスト評価(2026-10-06)、EmDash の本番運用記事(2026-10-07)、本文で言及したサードパーティの限界レビュー。賛辞と批判は同じ情報源から並べて引用します——片側だけ引用する「限界ページ」は、自らの検査に合格できないからです。当サイト自身の fixture も第三者実行であり、/benchmarks で公開しています。

Jev の精度はどの程度か——ベンチマークが実際に示したもの

最も厳格な独立データは vals.ai のプレレジスト評価(2026-10-06)です。12 系統、SEC 提出書類から構築した 400 項目の人手監査付き claim verification、すべての仮説を評価の実施前に固定。同じ評価が Jev の最高の見出しと最低の成績を同時に産んだので、両方をここに置きます。

実際に強いところ

Claim verification:0.975、1,000 例あたり $0.02——GPT-6 Astra、GPT-6.1 Sol、GPT-6 Luna と統計的に同等で、コストは Astra の約 1/498、ECE 0.011 は 12 系統中最低、中央値レイテンシは約 0.1 秒。評価者が TypeSafe の公開時の見出し「193.6 倍高速・444.6 倍安価」に下した判定は——「確かに成立している」でした。分類型の仕事(ルーティング、トリアージ、主張チェック)なら、自動化を任せてよい成績です。

vals.ai — An Independent Evaluation of TypeSafe’s Jev

実測で苦手と判明したところ

LegalBench の 12 サブタスク プレレジストスライスでは、Jev の class-balanced accuracy は 12 系統中最下位。0.730 対 GPT-5.6 Terra の 0.932 で、他の全システムのリードは統計的に有意でした。contract NLI の 1 サブタスクで崩壊し(33 項目中 30 項目に Yes と答えて 0.485)、同タスクの ECE は 0.108 まで上がって 12 系統中最悪。あるタスクで測った較正は、別のタスクに転移しませんでした。

第三者記録の全体像

vals.ai だけではありません。truestandard.ai は専用記事「Jev Accuracy Tested: 108 Claims Across Three Models」を出し、layer3labs は限界分析と並行して Jev ベンチマークを走らせ、iatrox・benchlm・lmspedia の「Jev 限界」ページは一つの小さなジャンルを形成しています。当サイト自身の fixture と手法は /benchmarks で公開しています——このページの他のすべてと同じく第三者実行であり、同じくタスク固有です。

正直な要約はこうです。分類は強く、法律 NLI は弱い。0.975 も 0.730 もあなたのワークロードを説明しません——説明するのはタスクです。どんな数字の上に自動化を載せる前にも、自分のラベル付き事例を約 100 件走らせること。見栄えの良い数字ほど例外ではありません。

当サイトが公開している fixture・ECE・手法

Jev はハルシネーションを起こすか——「ゼロハルシネーション」の主張を検証する

アーキテクチャの主張自体は真実です。Jev にはテキスト生成ヘッドがなく、散文を書かず、引用を捏造せず、段落をでっち上げません。古典的な LLM の意味でのハルシネーション——流暢だが誤ったテキスト——は構造的に発生し得ません。批判者もこれ自体は認めています。問われているのは、それが実際に何を買ってくれるかです。

しかし精度の主張はアーキテクチャからは導けません。型付き回答も間違えます。モデルは誤った選択肢を選び、そこに高い信頼度を添える。そしてあなたのコードは、その両方を前提に自動化する。「ハルシネーションしない」は「テキストを生成しない」であって「間違えない」ではありません——2 つの独立系レビューの見出しがまさにそれです。andrewbaker.ninja の「Jev AI Can't Hallucinate, But It Can Still Be Wrong」、そして Protos の「Meet Jev, the AI that claims it can't hallucinate」。本当に存在する失敗モードは次のとおりです。

独立系ライターはこの主張をどう位置づけるか

実際に起こる失敗モード

01

高信頼度の型付き誤回答

0.97 の信頼度でファクトチェックに落ちた回答は、当サイト自身の JEV-27B ローカル評価(Jev の生徒モデル、同じ契約形状)に記録されています。0.50〜0.95 の全閾値帯を走らせても、幸運と実力を分けるゲートは一つもありませんでした。

02

タスク境界での較正の崩れ

vals.ai は LegalBench で ECE 0.108——12 系統中最悪——を測りました。同じ評価の別タスクでは 12 系統中最高(0.011)です。Synthpop 監査の一般論がここでも当てはまります。信頼度はモデルの定数ではなく、タスク分布の性質だということ。

03

静かに起こる範囲外の失敗

32k トークンを超える文書、1 枚の画像、複数ステップの推論を要する質問を与えても、失敗はエラーとして現れません。あなたが想定したより少ない情報の上で下された判断として現れます。

較正と過信——信頼度の数値がいつ嘘をつくか

記録の中で最も強力な単一の批判は、vals.ai の較正に関する発見です。LegalBench での Jev の ECE は 0.108——12 系統中最高——で、評価者の結論は「このタスクでは信頼度スコアは生の確率に対して追加の信号を持たない」でした。同じ論文の claim verification での 0.011(12 系統中最低)と並べて読んでください。較正はモデルの定数ではなくタスクの性質だということです。

独立系の監査は別の場所でも同じ形を示しました。Synthpop の 57.5 万コール監査は、答えられない質問でなお自信を持つ応答(正解率 1%、信頼度 32〜36%)を記録し、RUNTIME. の Jev 生徒モデルのローカル評価では、0.969 の信頼度を持つ回答がファクトチェックに落ちました。業界はこの問いを公の場に出しつつあります。Synthpop 自身の公式 Q&A「Does a decision model know when it is guessing?」が過信を公開の論点として扱っているほどです。

本番での答えは地味で、交渉の余地もありません。自分の信頼性ダイアグラムが正直な場所にだけ閾値を置き、その下はレビューレーンへ、タスク構成が変わったら再検証。EmDash の Clef 運用はこの規律の実例です。0.45 以上の最低スコアがなければ自動実行せず、モデルが単独でプラグインを BAN することも決してありません。

Jev の限界:できないことのリスト

4 つの構造的限界——バグでもロードマップ項目でもなく、2026 年 10 月時点で出荷されているアーキテクチャの性質です。layer3labs の限界分析の問いの立て方が上手です。どれだけを読むか、そして何ができないか。

画像を読めない

state はテキストのみ。Perplexity の Decisions API は base64 画像を 32×32 タイルで読み、Clef は最初からマルチモーダル、OpenAI のベータはインライン base64 を受け付けます。判断がスクリーンショットを読むなら、この行がベンダーを決めます。

32k トークンの読み取り上限

Jev が読めるコンテキストは 32k トークンまで。Perplexity は 262k 入力トークン、Clef は 64k を文書化しています。長い文書はチャンク分割と、あなたが担うマージ戦略を必要とします。そしてすべてのチャンク境界は、文脈が静かに失われる場所です。

自由文の推論も説明もない

宣言された選択肢のスコアは出せますが、見知らぬ問題を推論したり、返信を下書きしたり、理由を説明したりはできません。あなたのコードが返ってきた数値の上で推論します。それがこの方式の売りです——その「なぜ」が必要になる日まで。

ツール呼び出しがない

エージェントループはありません。Jev は関数を呼ばず、データを取らず、行動しません。送った state についての質問に答えるだけです。「Jev が X をした」に見えるものはすべて、Jev 呼び出しの周りであなたのコードが X をした結果です。

本番の脚注——評価して乗り換えたチームがいる

CMS プラグインレジストリの EmDash は 2026 年 10 月にこう書きました。「We evaluated Jev when it launched, but unfortunately it underperformed our baseline.」その上で、本番のモデレーションには Clef を採用しました。投稿ごとにテキスト 9 問、画像ごとに 8 問、0.45 の最低スコアでなければ自動実行なし、モデルが単独で BAN することはない。テキスト fixture は 63/63 で期待どおり、エンドツーエンド p95 は 1.64 秒。Jev 側の手法が公表されていない単一の事例です——ベンチマークではなくケーススタディとして読むべき——ですが、公開記録の中で唯一、本番規模で Jev と代替を比較して選んだ物語であり、その結末は Jev の側にはつきませんでした。

EmDash — How EmDash uses Clef to moderate the plugin registry

Jev を使うべき人・使うべきでない人

同じ証拠が、向いている側にも向いていない側にも短いリストを与えます。上で挙げた限界が、この節では選定基準になります。

向いているのは

判断がテキスト分類の形をしているとき(ルーティング、トリアージ、ルブリック採点)。監査に耐える閾値と公開された較正手法が必要なとき。複数質問を 1 回の約 70〜100ms パスで投げたいとき。そして入力 100 万トークンあたり $0.042・出力無料の入力のみ課金がボリュームに合うとき。

他を選ぶべきとき

今日この時点で判断の入力に画像が含まれるとき。文書が 32k トークンを超えるとき。タスクが分類ではなく法律 NLI 型の推論のとき。モデルを自社インフラ内で動かす必要があるとき。そして受け入れ試験がリーダーボードのスコアで、自分のラベル付きデータではないとき。

カテゴリ全体図——全ベンダー・価格・選定

Jev の限界 FAQ

Jev は正確ですか?

タスク次第であり、同じ評価がその両面を証明しています。vals.ai のプレレジスト claim verification では 0.975——GPT-6 クラスと統計的に並び、コストはごく一部。プレレジストの LegalBench スライスでは 12 系統中最下位(0.730 対 GPT-5.6 Terra の 0.932)、contract NLI の 1 サブタスクは 0.485 に崩壊、同タスクの較正は 12 系統中最悪でした。分類型の仕事には強く、法的含意には弱い。そして自分のラベルで試すまで、どちらの数字もあなたのワークロードを説明しません。

Jev はハルシネーションを起こしますか?

古典的な意味では起こしません——テキスト生成ヘッドがないため、流暢な文章や引用や説明をでっち上げることはできません。しかし「ハルシネーションしない」は「間違えない」ではありません。型付き回答は誤り得て、信頼度は崩れ得て(vals.ai の LegalBench スライスで ECE 0.108、12 系統中最悪)、自信のある誤答は腰の引けた誤答より危険なことさえあります。あなたのコードがその上に自動化を載せるからです。正直な言い方はこうです。生成テキストの誤りはない。判断の誤りの免除もない。

Jev はオープンソースですか?

いいえ。Jev はプロプライエタリなホスト型 API で(OpenRouter や各種ゲートウェイ経由でも届きます)、公式の重みは存在しません。ローカル経路はオープンなエコシステム——Kev、SemIf、Von、Laya などの Jev 互換再現——を通ります。比較は当サイトの代替ハブにあります。ワイヤ形式の互換は、精度や較正の一致を保証しないことだけ注意してください。

Jev は画像を入力できますか?

できません——state はテキストのみで、これは構造的な限界であり設定の問題ではありません。Perplexity の Decisions API は base64 画像パートを 32×32 タイルで読み、Cloudflare の Clef はネイティブのマルチモーダル(27B 版は動画も)、OpenAI のベータはインライン base64 を受け付けます。判断がスクリーンショットや証明写真や出品画像を読むなら、ここが一票否決の条件です。

Jev は何が苦手ですか?

測定された弱さは、法的含意(vals.ai の LegalBench スライスで 12 系統中最下位、contract NLI サブタスクは 0.485 に崩壊)と、同タスクの較正(ECE 0.108)。構造的にできないのは、画像入力、32k トークンを超える文書、複数ステップの推論、ツール呼び出し。最初の 2 つは実測、後の 4 つはアーキテクチャです。

EmDash はなぜ Jev ではなく Clef を選んだのですか?

同社の記事はこう述べています。「We evaluated Jev when it launched, but unfortunately it underperformed our baseline」。そして本番のモデレーションに Clef を載せました——能力の行から見て整合します。彼らのパイプラインは出品画像を読む(画像ごとに 8 問)ため、Jev は画像をそもそも受け取れません。Jev 側の評価手法は公表されていないため、堅実な設計(0.45 の最低スコア、人間レビュー)付きの選定逸話として読むべきで、ベンチマークとしては読むべきではありません。

Jev は自信過剰ですか?

タスク次第であり、それ自体が発見です。同じ評価で、Jev の信頼度は claim verification では 12 系統で最も誠実(ECE 0.011)、LegalBench では 12 系統で最も不誠実(ECE 0.108)で、評価者は後者について「信頼度スコアは生の確率に対して追加の信号を持たない」と結論づけました。過信は調べて得られるモデルの定数ではありません。測るしかないタスク分布の性質であり、そのために当サイトの較正ワークフローがあります。