代替 / 選定の判断

Jev の代替:スター数に騙されないための一覧

ロジット読み取り、専用エンコーダ、大規模モデルの改造、拡散の 4 路線を一度に整理します。すべての数値に出典を付け、各プロジェクトが自認する失敗の境界も併記します。誰も触れたがらない事実——JevBench は新しい測定なしに 2 度スコアを変えた——も含めて。

早見:どれを使うべきか

移行コスト最小でコードを触りたくないなら Kev(同じ /v1/systemone 契約)。CPU のみ、GPU 不要なら Von(395M、15ms 未満)。すでに動かしているオープンモデルを再利用し訓練はしたくないなら SemIf か AnyJev。自前ラベルで最も良い結果を出したいなら Laya、そしてその後継 cbjev(GPL-3.0 に注意)。密な制御ループなら NanoJev。画像入力や拡散路線の研究なら djev と OpenJev。

スター数とレイテンシは 2026-09-23/25 時点のスナップショットで、数日で古くなる。 · 収録プロジェクト: 30

4 つの路線は、それぞれ別のものを置き換える

Jev の公開から 1 週間で、コミュニティ自身がオープン再現を 4 派に分類しました(BlockBeats)。これを分けておかないと、「代替品」同士がなぜ比較できないのかが見えません。

専用の意思決定モデルを訓練

小型の非自己回帰エンコーダに判断ヘッドを載せる。テキスト生成は一切なし。古典的な分類器を自然言語の選択肢向けに作り直した形。

  • Laya
  • Von
  • NanoJev
  • cbjev
  • jevlike
  • JevK5

ロジット直読み

新しい重みを作らない。モデルが答えを書く直前に割り込み、各選択肢の確率を読み取る。

  • SemIf
  • AnyJev
  • Verdict
  • litjev
  • simple-jev
  • fastjev

大規模モデルを改造

LLM を基盤として残し、LoRA アダプタやポインタヘッドといった判断構造を追加する。1 回の prefill で全設問に答える。

  • Kev
  • Nimble
  • decider (Mapika)
  • Decitron (决策机)
  • Winnow-12B
  • Open-Jev (Zefan Cai)

拡散モデルで答えを埋める

回答スロットを空けておき、拡散モデルが画像を完成させるように一括で埋める。トークンを 1 つずつデコードしない。

  • djev
  • OpenJev (razorback16)
  • LocalJev
  • openjev-sglang
  • DiffusionGemma
  • Lichen

全プロジェクト対照表

ライセンス、基盤、レイテンシ、スター数、向く用途。内部ページのある項目は詳細へ、それ以外は一次リポジトリへ。

プロジェクトライセンス基盤と規模レイテンシスター向く用途
LayaConvai InnovationsApache-2.0ModernBERT-large 421M · mmBERT-base 322M (multilingual)32.8–39.5 ms/question on a T4 · 7.2 ms for ten batched · other measurements put single-question CPU inference at 193–464 ms19,301自前ラベルで微調整するための高速な多言語ベース。ゼロショットの代替品ではない。
KevJared PalmerApache-2.0Qwen3.5 0.8B / 4B / 9B + rank-16 LoRA + pointer head47 ms on MLX (repeated state), 77 ms fresh · 12–26 ms on an H1005,385コードを変えずにホスト版 Jev を置き換える。同じ /v1/systemone 契約を実装している。
SemIfTheo LeeMITFrozen Qwen3.5-4B — no fine-tune at all1.023 s for 21 binary criteria · 5.21× faster than generating the same answers as JSON4,023すでにホストしているオープンウェイトモデルを再利用する。訓練ゼロ、出力トークンゼロ。
VonwfzyxApache-2.0ModernBERT-Large 395M encoder + three decision headsUnder 15 ms per decision on a CPU — no GPU at all546GPU が一切不要な配備。ノート PC、古いサーバ、エッジ端末。独立 49 タスク基準で最高のオープンモデルでもある。
NanoJevTianyuCodingsNot stated in the repository; third parties list MITQwen3-0.6B + parallel decision headsCUDA only — the inference script has no Apple Silicon path2,086高頻度の制御ループ。ある課題で実際に Jev を上回る唯一のオープン実装(ViZDoom Basic 128/128 対 56/128)。
cbjevtomek7667GPL-3.0-or-laterModernBERT / mmBERT, fine-tuned from Laya3.0 ms for one question · 11.4 ms for ten questions over a 500-token document—同じワイヤ形式を保ったまま、より高速で較正の良い Laya の後継。ライセンスが GPL-3.0 である点に注意。
AnyJevJiamu (Morris) Zhang · Nokia Applied ResearchApache-2.0Any open LLM — a training-free debiasing layerOne prefill per call; no generation—ラベル 1 枚も使わずに選択肢順序バイアスとラベルバイアスを消し、100〜500 枚で較正する。
djevMaisaApache-2.0 per the repositoryDiffusionGemma 26B-A4B read as a canvas; no weights shippedJevBench 74.3 → 73.0 → 52.23 across the three board versions, with no new measurements · 76.87 ms p50 on the older quantized config—拡散路線であり、画像 state に対応するとされる 2 件のうちの 1 つ。根拠は薄い。リポジトリを読み、スコアがどのボードのものかを確認すること。
jevlikevinnylarougeMITByte encoder, or any frozen Hugging Face encoderCPU / MPS / CUDA — four commands to train1,255モデルではなく訓練レシピ。自前の選択肢リストとラベルを持ち込み、ノート PC で訓練する。
VerdictManavarya09 (one of three unrelated projects using the name)Apache-2.0multilingual-e5-small 118M (PyPI verdictml)0.5 ms/example batched on an M5 CPU · under 2 ms single with ONNX int8—正直な確率。温度スケーリングと被覆保証付き conformal 棄権、そして選択肢順序が構造上答えを変えない設計。自己申告の対 Jev 0.77 と、JevBench v1.4.2 の 5.69 という行が併存する点は自分で判断すること。
OpenJev (razorback16)razorback16 — note: "OpenJev" names at least seven unrelated projectsApache-2.0DiffusionGemma 26B-A4B with a one-step structured read~94 ms median on an RTX PRO 600050画像についての設問に答えられる唯一のオープン実装とされ、他のブリッジが参照する原型。必ず作者名を添えること。素の「OpenJev」は使えません。
LocalJevGitHub NextSee repositoryDiffusionGemma 26B-A4B through an OpenAI-compatible endpointDepends on oMLX; a TypeScript/Bun bridge—ランナーに拡散プリミティブが無いときの可搬ブリッジ。README が明言する通り、ワイヤ互換であって数学的に等価ではない。
openjev-sglangekzhangSee repositoryQwen3.6-35B-A3B served on SGLangB200-class hardware—データセンター向け GPU がある場合に、大規模なオープン意思決定モデルを高スループットで配信する。
litjevzhengxuyuApache-2.0Open weights (Qwen and others), option logitsSee repository13小さく読める /v1/systemone サーバ。契約全体を自前でホストしたい場合の学習・フォーク向け。Jev との比較値は自前では公開していません。
simple-jevfeatherless-aiMITAny OpenAI-compatible endpointSee repository168最速のゼロ訓練実験。vLLM や Hugging Face のエンドポイントに向け、選択肢をロジットから読む。
fastjevchengyongruSee repositoryA SemIf forkSee repository—より薄い SemIf。自前ホストの意味判断を、少ない足場で始めたいとき。
JevK5allebeeApache-2.0Open weights, one forward passSee repository—意思決定モデルを検査したい、あるいは完全に自前で持ちたいときの Apache-2.0 オープンウェイト。
poorjevrupeshpoojary9See repositoryRuns locally with no API keyECE 0.170 → 0.071 after calibration—オフラインでウェイトリスト不要の実験。生の精度よりも較正が重要な場合。
NimbleBespokeSee repositoryQwen3.5-9B with contrastive post-trainingPicked the reference answer 90.1% of the time on 324 held-out samples (Jev: 93.2%)—訓練レシピに関心があるチーム。1 つの事実を変えると正解が反転するよう設計したデータ。リポジトリに LICENSE ファイルは無く、Apache-2.0 の主張はモデルカードのみに依拠します。
decider (Mapika)Mark MarosiApache-2.0Qwen3.5 2B / 4B / 35B-A3B-Base + one-pass letter-slot readout32.3 ms median on a B300 · 3.2 ms with CUDA graphs—現行 JevBench ボード(v1.4.2、64.13)の首位。広く流布した「33ms」は Laya の T4 での値であり、decider のものではありません。
GLiNER2.5-DecideFastinoSee source340M per the vendor (some cards say 205M — the conflict is unresolved)0.698 macro accuracy on the independent 49-task benchmark—すでに GLiNER パイプラインがあり、判断がルーティングや抽出の形をしている場合。
sokudan (即断)GeneLabApache-2.0 code · MIT backbonesbintuitions/modernbert-ja-310m with cross-attentionDay-1 results published without releasing weights (bool still below the majority baseline)—日本語ネイティブの判断。公開された day-1 結果は score(順序尺度)課題ですでに全ベースラインを上回る。
DiffusionGemmaGoogleGemma terms26B-A4B diffusion language model27.4 decisions/s in batch routing—代替品ではなくエンジン。上記の複数プロジェクトの土台になっているモデル。
Decitron (决策机)中科闻歌 / Zhongke WengeProprietaryA general-purpose decision LLMNot comparable—Jev のオープン代替ではない。軸は「瞬時の判断 対 将来の推論」であり別カテゴリ。クローンと混同されやすい。
JevForgezwliJayMITQwen3.5 0.8B / 0.6B with an end-to-end synthesis-train-calibrate-serve toolkitTest noul 0.826 / 0.776 vs Jev 0.910 · out-of-distribution noul 0.860 / 0.769 vs Jev 0.825—分布外のいずれかの軸で Jev を上回った唯一の参加者(分布内では劣る)。引用前に独立検証の価値があります。
Winnow-12B—Apache-2.012B, 16 GB GPU198/231 on one JevBench subset — level with Jev’s 85.71% there—公開サブセットで Jev と同等に達する中規模の選択肢。それを実際の勝利と見なす前に封印精度の列を確認すること。
Open-Jev (Zefan Cai)Zefan CaiMIT codeLoRA + scalar head + calibration temperature on pinned Qwen3.5 2B / 9B / 27B85 ms against Jev’s 295 ms—公開 JevBench のある実行で 197/231(Jev は 200/231)。公開スコア上で最も近いオープン結果ですが、対象は狭いスライスです。
LichenMushroom-SystemsMITDocker / llama.cpp over GGUF (gemma-4-26B-A4B)93 ms · 207/231 against Jev’s 200/231, p = 0.09 (not significant)—コンテナで判断エンドポイントを立てる方法。Jev に対する優位が統計的に有意でないことまで自ら報告しています。
Cygnetblockbrain (Nood Co)MIT shim / Apache-2.0 weightsFrozen gemma-4-12B-it plus an MIT shim, temperature 3.4 — no fine-tune50–72 ms · JevBench v1.4.2 #4 at 61.76—訓練ゼロで知性サブスコアが decider-4b v2 を上回ります。封印精度は 33.8% で decider は 34.7%。
HopperHopitAIApache-2.0 code, but "do not use this adapter commercially"LoRA r16 on Qwen3.5-4B, ~9 GB, 16 GB GPU minimum44–57 ms · JevBench v1.4.2 #5 at 59.43—較正サブスコアは 79.06 で Jev の 76.34 を上回ります。ライセンス文が商用利用を禁じているため、社内検証の前にも確認してください。

スター数ではなく、独立系ベンチマークを見る

この生態系で唯一、どのプロジェクトにも利害関係のない人物が実行したベンチマークです。各システムの失敗モードも記録しています。

システムmacro accuracy記録された失敗モード
TypeSafe Jev (hosted)0.966
Von (395M, open)0.704未知の領域で単一モードに崩壊する
GLiNER2 (~300M, open)0.698キーワードに対して過剰に発火する
Laya (421M, open)0.583評定尺度を圧縮してしまう

49 タスク・869 ケース。コンプライアンス、トリアージ、法務、DevOps、言語学、安全を横断。v2 macro accuracy。 jabr/classifier-benchmark

同じプロジェクトに 3 つのスコア:JevBench のボード版

同じシステム群が、新しい測定を一切行わずに 2 度採点し直されました。「X が Jev を破った」という記事は、まずどの版を引用しているかを確認してください。

ボード版首位Jevdjev説明
v1.2.8-eraJev 75.375.3 (#1)74.3 (#3)多くのブログが今も引用している版。
v1.3.0Jev 74.474.4 (#1)73.0 (#3)機会補正した知性スコアとニアチャンス罰則で再採点。新しい測定は無し。
v1.4.2decider-4b v2 64.1363.29 (#2)52.23 (#8)308 件の封印判断と調和平均、汎化ゲート。Jev はもう首位ではありません。

名前の衝突に注意

この生態系ではプロジェクト名だけを書くと使えません。同じ名前がまったく別のものを指していることがあります。

  • OpenJev × 7

    少なくとも 7 つの無関係なリポジトリ:SemIf の旧名、Zefan Cai の Open-Jev、S1LV3RJ1NX、razorback16、SiliconLabAI(Next.js のプレイグラウンドでありモデルではない)ほか。必ず作者名を添えること。

  • Verdict × 3

    Manavarya09/verdict(118M、PyPI verdictml)、openJev-verdict-2.0(149.6M ModernBERT + GLiClass)、JevBench の行「verdict-small」は別々の 3 プロジェクトです。

Jev の代替についてよくある質問

本当に Jev を代替できるオープンなプロジェクトはありますか?

インターフェースとしてはありますが、精度としてはまだです。Kev、cbjev などの実装は同じ /v1/systemone 契約を満たすので base URL を変えるだけで置き換えられます。しかし独立系 49 タスク基準では最強のオープンモデルが約 0.70〜0.72 で、Jev は 0.966 です。コスト・レイテンシ・データ主権ではオープン側が既に勝ち、ゼロショットのクロスドメイン品質では負けています。

同じプロジェクトのスコアが記事によって大きく違うのはなぜですか?

JevBench に 3 つのボード版があるからです。同じシステム群が v1.2.8 期、v1.3.0、v1.4.2 で採点され、その間に新しい測定はありませんでした。djev は 74.3 から 52.23 へ、あるプロジェクトは 67.0 から 40.6 へ、別は 62.4 から 27.4 へ動きました。数値を見たらどの版かを必ず確認してください。

「OpenJev」はどのプロジェクトを指しますか?

少なくとも 7 つの無関係なリポジトリがこの名前を使っています。SemIf の旧名、Zefan Cai の Open-Jev、S1LV3RJ1NX、razorback16、SiliconLabAI(実体は Next.js のプレイグラウンドでモデルではない)などです。Verdict も 3 つ衝突しています。当サイトは常に「作者名/リポジトリ名」で書き、素のプロジェクト名は使いません。

Laya をゼロショットで使ってよいですか?

よくありません。Laya 自身の README が、ベースチェックポイントの typed decisions は 0.362 と 0.342(ランダム 0.318、多数派 0.461)と記しています。よく引用される 0.766 は、そのベンチマークの訓練分割で微調整したチェックポイントです。さらに日本語 300 件の検証では順序尺度に重大な位置バイアスがあり、先頭の選択肢は 300 件中 0〜1 回しか選ばれませんでした。微調整の土台として使うものです。

本番で最も現実的なリスクは何ですか?

精度ではなく「使えているように見えること」です。位置バイアス、自信過剰な誤り、評価集合と訓練集合の重なりは、デモでは良く見え、本番で静かに壊れる原因になります。導入前に自業務のラベル付き事例を数百件用意し、3 点を測ってください。信頼度が本当に信用できるか(ECE)、選択肢を並べ替えると答えが変わるか、低信頼度の事例が実際に難しいか。

これらの数値はどれくらい新しいですか?

スター数とレイテンシは 2026-09-23/25 時点のスナップショット、ベンチマーク値は各出典の表記どおりです。この生態系は週単位で変わります。Jev の公開後 24 時間で最初の再現が現れ、2 日で 6 つのクローンが数えられ、1 週間で 10 を超えました。具体的な数値は引用前に再確認してください。

当サイトは TypeSafe Jev 本体を実測していません。TypeSafe の Master Customer Agreement 2.3(b) は同サービスとその出力を類似製品の開発に用いることを禁じているため、この生態系にクリーンな head-to-head はほとんど存在しません。本ページの数値はすべて第三者の公開値か公開リポジトリの読解であり、結論ではなく仮説として扱ってください。