代替 / 選定の判断
Jev の代替:スター数に騙されないための一覧
ロジット読み取り、専用エンコーダ、大規模モデルの改造、拡散の 4 路線を一度に整理します。すべての数値に出典を付け、各プロジェクトが自認する失敗の境界も併記します。誰も触れたがらない事実——JevBench は新しい測定なしに 2 度スコアを変えた——も含めて。
早見:どれを使うべきか
移行コスト最小でコードを触りたくないなら Kev(同じ /v1/systemone 契約)。CPU のみ、GPU 不要なら Von(395M、15ms 未満)。すでに動かしているオープンモデルを再利用し訓練はしたくないなら SemIf か AnyJev。自前ラベルで最も良い結果を出したいなら Laya、そしてその後継 cbjev(GPL-3.0 に注意)。密な制御ループなら NanoJev。画像入力や拡散路線の研究なら djev と OpenJev。
スター数とレイテンシは 2026-09-23/25 時点のスナップショットで、数日で古くなる。 · 収録プロジェクト: 30
4 つの路線は、それぞれ別のものを置き換える
Jev の公開から 1 週間で、コミュニティ自身がオープン再現を 4 派に分類しました(BlockBeats)。これを分けておかないと、「代替品」同士がなぜ比較できないのかが見えません。
専用の意思決定モデルを訓練
小型の非自己回帰エンコーダに判断ヘッドを載せる。テキスト生成は一切なし。古典的な分類器を自然言語の選択肢向けに作り直した形。
- Laya
- Von
- NanoJev
- cbjev
- jevlike
- JevK5
ロジット直読み
新しい重みを作らない。モデルが答えを書く直前に割り込み、各選択肢の確率を読み取る。
- SemIf
- AnyJev
- Verdict
- litjev
- simple-jev
- fastjev
大規模モデルを改造
LLM を基盤として残し、LoRA アダプタやポインタヘッドといった判断構造を追加する。1 回の prefill で全設問に答える。
- Kev
- Nimble
- decider (Mapika)
- Decitron (决策机)
- Winnow-12B
- Open-Jev (Zefan Cai)
拡散モデルで答えを埋める
回答スロットを空けておき、拡散モデルが画像を完成させるように一括で埋める。トークンを 1 つずつデコードしない。
- djev
- OpenJev (razorback16)
- LocalJev
- openjev-sglang
- DiffusionGemma
- Lichen
全プロジェクト対照表
ライセンス、基盤、レイテンシ、スター数、向く用途。内部ページのある項目は詳細へ、それ以外は一次リポジトリへ。
| プロジェクト | ライセンス | 基盤と規模 | レイテンシ | スター | 向く用途 |
|---|---|---|---|---|---|
| LayaConvai Innovations | Apache-2.0 | ModernBERT-large 421M · mmBERT-base 322M (multilingual) | 32.8–39.5 ms/question on a T4 · 7.2 ms for ten batched · other measurements put single-question CPU inference at 193–464 ms | 19,301 | 自前ラベルで微調整するための高速な多言語ベース。ゼロショットの代替品ではない。 |
| KevJared Palmer | Apache-2.0 | Qwen3.5 0.8B / 4B / 9B + rank-16 LoRA + pointer head | 47 ms on MLX (repeated state), 77 ms fresh · 12–26 ms on an H100 | 5,385 | コードを変えずにホスト版 Jev を置き換える。同じ /v1/systemone 契約を実装している。 |
| SemIfTheo Lee | MIT | Frozen Qwen3.5-4B — no fine-tune at all | 1.023 s for 21 binary criteria · 5.21× faster than generating the same answers as JSON | 4,023 | すでにホストしているオープンウェイトモデルを再利用する。訓練ゼロ、出力トークンゼロ。 |
| Vonwfzyx | Apache-2.0 | ModernBERT-Large 395M encoder + three decision heads | Under 15 ms per decision on a CPU — no GPU at all | 546 | GPU が一切不要な配備。ノート PC、古いサーバ、エッジ端末。独立 49 タスク基準で最高のオープンモデルでもある。 |
| NanoJevTianyuCodings | Not stated in the repository; third parties list MIT | Qwen3-0.6B + parallel decision heads | CUDA only — the inference script has no Apple Silicon path | 2,086 | 高頻度の制御ループ。ある課題で実際に Jev を上回る唯一のオープン実装(ViZDoom Basic 128/128 対 56/128)。 |
| cbjevtomek7667 | GPL-3.0-or-later | ModernBERT / mmBERT, fine-tuned from Laya | 3.0 ms for one question · 11.4 ms for ten questions over a 500-token document | — | 同じワイヤ形式を保ったまま、より高速で較正の良い Laya の後継。ライセンスが GPL-3.0 である点に注意。 |
| AnyJevJiamu (Morris) Zhang · Nokia Applied Research | Apache-2.0 | Any open LLM — a training-free debiasing layer | One prefill per call; no generation | — | ラベル 1 枚も使わずに選択肢順序バイアスとラベルバイアスを消し、100〜500 枚で較正する。 |
| djevMaisa | Apache-2.0 per the repository | DiffusionGemma 26B-A4B read as a canvas; no weights shipped | JevBench 74.3 → 73.0 → 52.23 across the three board versions, with no new measurements · 76.87 ms p50 on the older quantized config | — | 拡散路線であり、画像 state に対応するとされる 2 件のうちの 1 つ。根拠は薄い。リポジトリを読み、スコアがどのボードのものかを確認すること。 |
| jevlikevinnylarouge | MIT | Byte encoder, or any frozen Hugging Face encoder | CPU / MPS / CUDA — four commands to train | 1,255 | モデルではなく訓練レシピ。自前の選択肢リストとラベルを持ち込み、ノート PC で訓練する。 |
| VerdictManavarya09 (one of three unrelated projects using the name) | Apache-2.0 | multilingual-e5-small 118M (PyPI verdictml) | 0.5 ms/example batched on an M5 CPU · under 2 ms single with ONNX int8 | — | 正直な確率。温度スケーリングと被覆保証付き conformal 棄権、そして選択肢順序が構造上答えを変えない設計。自己申告の対 Jev 0.77 と、JevBench v1.4.2 の 5.69 という行が併存する点は自分で判断すること。 |
| OpenJev (razorback16)razorback16 — note: "OpenJev" names at least seven unrelated projects | Apache-2.0 | DiffusionGemma 26B-A4B with a one-step structured read | ~94 ms median on an RTX PRO 6000 | 50 | 画像についての設問に答えられる唯一のオープン実装とされ、他のブリッジが参照する原型。必ず作者名を添えること。素の「OpenJev」は使えません。 |
| LocalJevGitHub Next | See repository | DiffusionGemma 26B-A4B through an OpenAI-compatible endpoint | Depends on oMLX; a TypeScript/Bun bridge | — | ランナーに拡散プリミティブが無いときの可搬ブリッジ。README が明言する通り、ワイヤ互換であって数学的に等価ではない。 |
| openjev-sglangekzhang | See repository | Qwen3.6-35B-A3B served on SGLang | B200-class hardware | — | データセンター向け GPU がある場合に、大規模なオープン意思決定モデルを高スループットで配信する。 |
| litjevzhengxuyu | Apache-2.0 | Open weights (Qwen and others), option logits | See repository | 13 | 小さく読める /v1/systemone サーバ。契約全体を自前でホストしたい場合の学習・フォーク向け。Jev との比較値は自前では公開していません。 |
| simple-jevfeatherless-ai | MIT | Any OpenAI-compatible endpoint | See repository | 168 | 最速のゼロ訓練実験。vLLM や Hugging Face のエンドポイントに向け、選択肢をロジットから読む。 |
| fastjevchengyongru | See repository | A SemIf fork | See repository | — | より薄い SemIf。自前ホストの意味判断を、少ない足場で始めたいとき。 |
| JevK5allebee | Apache-2.0 | Open weights, one forward pass | See repository | — | 意思決定モデルを検査したい、あるいは完全に自前で持ちたいときの Apache-2.0 オープンウェイト。 |
| poorjevrupeshpoojary9 | See repository | Runs locally with no API key | ECE 0.170 → 0.071 after calibration | — | オフラインでウェイトリスト不要の実験。生の精度よりも較正が重要な場合。 |
| NimbleBespoke | See repository | Qwen3.5-9B with contrastive post-training | Picked the reference answer 90.1% of the time on 324 held-out samples (Jev: 93.2%) | — | 訓練レシピに関心があるチーム。1 つの事実を変えると正解が反転するよう設計したデータ。リポジトリに LICENSE ファイルは無く、Apache-2.0 の主張はモデルカードのみに依拠します。 |
| decider (Mapika)Mark Marosi | Apache-2.0 | Qwen3.5 2B / 4B / 35B-A3B-Base + one-pass letter-slot readout | 32.3 ms median on a B300 · 3.2 ms with CUDA graphs | — | 現行 JevBench ボード(v1.4.2、64.13)の首位。広く流布した「33ms」は Laya の T4 での値であり、decider のものではありません。 |
| GLiNER2.5-DecideFastino | See source | 340M per the vendor (some cards say 205M — the conflict is unresolved) | 0.698 macro accuracy on the independent 49-task benchmark | — | すでに GLiNER パイプラインがあり、判断がルーティングや抽出の形をしている場合。 |
| sokudan (即断)GeneLab | Apache-2.0 code · MIT backbone | sbintuitions/modernbert-ja-310m with cross-attention | Day-1 results published without releasing weights (bool still below the majority baseline) | — | 日本語ネイティブの判断。公開された day-1 結果は score(順序尺度)課題ですでに全ベースラインを上回る。 |
| DiffusionGemmaGoogle | Gemma terms | 26B-A4B diffusion language model | 27.4 decisions/s in batch routing | — | 代替品ではなくエンジン。上記の複数プロジェクトの土台になっているモデル。 |
| Decitron (决策机)中科闻歌 / Zhongke Wenge | Proprietary | A general-purpose decision LLM | Not comparable | — | Jev のオープン代替ではない。軸は「瞬時の判断 対 将来の推論」であり別カテゴリ。クローンと混同されやすい。 |
| JevForgezwliJay | MIT | Qwen3.5 0.8B / 0.6B with an end-to-end synthesis-train-calibrate-serve toolkit | Test noul 0.826 / 0.776 vs Jev 0.910 · out-of-distribution noul 0.860 / 0.769 vs Jev 0.825 | — | 分布外のいずれかの軸で Jev を上回った唯一の参加者(分布内では劣る)。引用前に独立検証の価値があります。 |
| Winnow-12B— | Apache-2.0 | 12B, 16 GB GPU | 198/231 on one JevBench subset — level with Jev’s 85.71% there | — | 公開サブセットで Jev と同等に達する中規模の選択肢。それを実際の勝利と見なす前に封印精度の列を確認すること。 |
| Open-Jev (Zefan Cai)Zefan Cai | MIT code | LoRA + scalar head + calibration temperature on pinned Qwen3.5 2B / 9B / 27B | 85 ms against Jev’s 295 ms | — | 公開 JevBench のある実行で 197/231(Jev は 200/231)。公開スコア上で最も近いオープン結果ですが、対象は狭いスライスです。 |
| LichenMushroom-Systems | MIT | Docker / llama.cpp over GGUF (gemma-4-26B-A4B) | 93 ms · 207/231 against Jev’s 200/231, p = 0.09 (not significant) | — | コンテナで判断エンドポイントを立てる方法。Jev に対する優位が統計的に有意でないことまで自ら報告しています。 |
| Cygnetblockbrain (Nood Co) | MIT shim / Apache-2.0 weights | Frozen gemma-4-12B-it plus an MIT shim, temperature 3.4 — no fine-tune | 50–72 ms · JevBench v1.4.2 #4 at 61.76 | — | 訓練ゼロで知性サブスコアが decider-4b v2 を上回ります。封印精度は 33.8% で decider は 34.7%。 |
| HopperHopitAI | Apache-2.0 code, but "do not use this adapter commercially" | LoRA r16 on Qwen3.5-4B, ~9 GB, 16 GB GPU minimum | 44–57 ms · JevBench v1.4.2 #5 at 59.43 | — | 較正サブスコアは 79.06 で Jev の 76.34 を上回ります。ライセンス文が商用利用を禁じているため、社内検証の前にも確認してください。 |
スター数ではなく、独立系ベンチマークを見る
この生態系で唯一、どのプロジェクトにも利害関係のない人物が実行したベンチマークです。各システムの失敗モードも記録しています。
| システム | macro accuracy | 記録された失敗モード |
|---|---|---|
| TypeSafe Jev (hosted) | 0.966 | |
| Von (395M, open) | 0.704 | 未知の領域で単一モードに崩壊する |
| GLiNER2 (~300M, open) | 0.698 | キーワードに対して過剰に発火する |
| Laya (421M, open) | 0.583 | 評定尺度を圧縮してしまう |
49 タスク・869 ケース。コンプライアンス、トリアージ、法務、DevOps、言語学、安全を横断。v2 macro accuracy。 jabr/classifier-benchmark
同じプロジェクトに 3 つのスコア:JevBench のボード版
同じシステム群が、新しい測定を一切行わずに 2 度採点し直されました。「X が Jev を破った」という記事は、まずどの版を引用しているかを確認してください。
| ボード版 | 首位 | Jev | djev | 説明 |
|---|---|---|---|---|
| v1.2.8-era | Jev 75.3 | 75.3 (#1) | 74.3 (#3) | 多くのブログが今も引用している版。 |
| v1.3.0 | Jev 74.4 | 74.4 (#1) | 73.0 (#3) | 機会補正した知性スコアとニアチャンス罰則で再採点。新しい測定は無し。 |
| v1.4.2 | decider-4b v2 64.13 | 63.29 (#2) | 52.23 (#8) | 308 件の封印判断と調和平均、汎化ゲート。Jev はもう首位ではありません。 |
名前の衝突に注意
この生態系ではプロジェクト名だけを書くと使えません。同じ名前がまったく別のものを指していることがあります。
OpenJev × 7
少なくとも 7 つの無関係なリポジトリ:SemIf の旧名、Zefan Cai の Open-Jev、S1LV3RJ1NX、razorback16、SiliconLabAI(Next.js のプレイグラウンドでありモデルではない)ほか。必ず作者名を添えること。
Verdict × 3
Manavarya09/verdict(118M、PyPI verdictml)、openJev-verdict-2.0(149.6M ModernBERT + GLiClass)、JevBench の行「verdict-small」は別々の 3 プロジェクトです。
各代替の詳解
各ページにはスペック表、Jev との対照、最小の実行コード、そして最も重要な「使ってはいけない場面」が含まれます。
Laya
519.3k スターの 421M エンコーダ — そして微調整して使うべきモデル
Kev
7公式 SDK をそのまま動かし続ける drop-in
SemIf
5新しいモデルは作らない — 選択肢ロジットを読むだけ
Von
4GPU を使わない答え。独立系ボードで最強のオープンモデルでもある
NanoJev
4ある課題で実際に Jev を上回った唯一のオープン実装
cbjev
4Laya のより高速で較正の良い後継 — ただし GPL という条件付き
AnyJev
4訓練不要のバイアス除去 — Nokia Applied Research 製
djev
5拡散路線 — そしてこのカタログで最も根拠が薄い項目
Jev の代替についてよくある質問
本当に Jev を代替できるオープンなプロジェクトはありますか?
インターフェースとしてはありますが、精度としてはまだです。Kev、cbjev などの実装は同じ /v1/systemone 契約を満たすので base URL を変えるだけで置き換えられます。しかし独立系 49 タスク基準では最強のオープンモデルが約 0.70〜0.72 で、Jev は 0.966 です。コスト・レイテンシ・データ主権ではオープン側が既に勝ち、ゼロショットのクロスドメイン品質では負けています。
同じプロジェクトのスコアが記事によって大きく違うのはなぜですか?
JevBench に 3 つのボード版があるからです。同じシステム群が v1.2.8 期、v1.3.0、v1.4.2 で採点され、その間に新しい測定はありませんでした。djev は 74.3 から 52.23 へ、あるプロジェクトは 67.0 から 40.6 へ、別は 62.4 から 27.4 へ動きました。数値を見たらどの版かを必ず確認してください。
「OpenJev」はどのプロジェクトを指しますか?
少なくとも 7 つの無関係なリポジトリがこの名前を使っています。SemIf の旧名、Zefan Cai の Open-Jev、S1LV3RJ1NX、razorback16、SiliconLabAI(実体は Next.js のプレイグラウンドでモデルではない)などです。Verdict も 3 つ衝突しています。当サイトは常に「作者名/リポジトリ名」で書き、素のプロジェクト名は使いません。
Laya をゼロショットで使ってよいですか?
よくありません。Laya 自身の README が、ベースチェックポイントの typed decisions は 0.362 と 0.342(ランダム 0.318、多数派 0.461)と記しています。よく引用される 0.766 は、そのベンチマークの訓練分割で微調整したチェックポイントです。さらに日本語 300 件の検証では順序尺度に重大な位置バイアスがあり、先頭の選択肢は 300 件中 0〜1 回しか選ばれませんでした。微調整の土台として使うものです。
本番で最も現実的なリスクは何ですか?
精度ではなく「使えているように見えること」です。位置バイアス、自信過剰な誤り、評価集合と訓練集合の重なりは、デモでは良く見え、本番で静かに壊れる原因になります。導入前に自業務のラベル付き事例を数百件用意し、3 点を測ってください。信頼度が本当に信用できるか(ECE)、選択肢を並べ替えると答えが変わるか、低信頼度の事例が実際に難しいか。
これらの数値はどれくらい新しいですか?
スター数とレイテンシは 2026-09-23/25 時点のスナップショット、ベンチマーク値は各出典の表記どおりです。この生態系は週単位で変わります。Jev の公開後 24 時間で最初の再現が現れ、2 日で 6 つのクローンが数えられ、1 週間で 10 を超えました。具体的な数値は引用前に再確認してください。
当サイトは TypeSafe Jev 本体を実測していません。TypeSafe の Master Customer Agreement 2.3(b) は同サービスとその出力を類似製品の開発に用いることを禁じているため、この生態系にクリーンな head-to-head はほとんど存在しません。本ページの数値はすべて第三者の公開値か公開リポジトリの読解であり、結論ではなく仮説として扱ってください。