Jev の代替
djev
拡散路線 — そしてこのカタログで最も根拠が薄い項目
結論
djev は追う価値がありますが、盲信して採用するものではありません。拡散派の代表で、DiffusionGemma 26B-A4B をトークンごとにデコードせずキャンバスとして読みます。画像 state を受け取れるとされる 2 路線の一方でもあります。公開された JevBench スコアは、新しい測定が一切無いまま、あるボードの 74.3 から後のボードの 52.23 へ下がり、Jev とのクリーンな head-to-head は存在しません。
djev は最小かつ最も興味深い一派に属します。ロジットを読むのでもエンコーダを訓練するのでもなく、拡散言語モデルをキャンバスとして扱い、回答スロットを空けたまま一括で埋めます。独自の重みは配布せず、ベンチマークのスコアはボードの版によって大きく動きます。したがってこれは「方向性は注目に値するが根拠は薄い」を扱うページであり、推薦ではありません。
Fill answers with diffusion
Leave the answer slots blank and fill them all at once, the way a diffusion model completes an image, instead of decoding token by token.
検索別名
主要スペック
- Licence
- リポジトリ表記は Apache-2.0
- Author
- Maisa
- Backbone
- DiffusionGemma 26B-A4B をキャンバスとして読む
- Size
- プロジェクト自身は重みを配布しない
- Latency
- 旧量子化構成で p50 76.87ms
- Wire format
- リポジトリ参照
- Install
- リポジトリ参照
djev と JevBench のボード問題
本ページで最も重要な但し書きです。JevBench は同じシステム群を、新しい測定を一切行わずに 2 度採点し直しました。変動は甚大で、同じプロジェクトが記事によって 3 位にも 8 位にも書かれる理由がここにあります。
| djev と JevBench のボード問題 | djev | Jev |
|---|---|---|
| JevBench 最古のボード | 74.3 — 3 位 | 75.3 — 1 位 |
| JevBench v1.3.0 | 73.0 — 3 位 | 74.4 — 1 位 |
| JevBench v1.4.2 | 52.23 — 8 位 | 63.29 — 2 位 |
| Jev とのクリーンな head-to-head | 公開されたものは無い | — |
| アプローチ | 拡散:回答スロットを一括で埋める | 1 回の順伝播、非生成 |
djev を検討すべきとき
判断が画像に依存するとき、あるいは拡散ベースの意思決定モデルを「出荷する」のではなく「研究する」ときに向きます。この一派はロジット読み取り勢とは確かに異なり、OpenJev も LocalJev もこの路線の上にあります。LocalJev の README は、自身のブリッジ版がワイヤ互換であって数学的に等価ではないと見事に明記しています。画像対応の型付き判断が今すぐ必要なら、評価は自分で行う前提で臨んでください。
見送るべきとき
ブログが「JevBench 3 位」と書いたからといって djev を選ばないでください。それは 3 つあるボードの最も古いもので、現行ボードでは 52.23 です。そして「封印精度」の列——公開されていなかった項目での性能を測る部分——こそ、このカテゴリ全体が崩れる場所です。さらに djev と Jev の間に制御された入力での公開比較は無いため、優劣に関する主張は測定ではなく推論です。
djev を責任を持って評価する
拡散路線チェックリスト
-----------------------
[ ] モデル:DiffusionGemma 26B-A4B(djev は重みを配布しない)
[ ] ランナーが構造化読み取りプリミティブを露出しているか:
- シード付き拡散キャンバス
- 読み取り専用のデノイズ
- 選択トークンの logits / logprobs
これらが無ければ、確率は OpenAI 互換端点を通じて
モデルが「自己申告」したもの — ワイヤ互換だが数学的に非等価。
[ ] スコアがどの JevBench 版のものか記録する。
74.3(最古)-> 73.0(v1.3.0)-> 52.23(v1.4.2)
[ ] 自前のラベル付き判断で比較する。画像目的なら
テスト集合に画像も入れる。djev についてよくある質問
なぜ djev のスコアは 74.3 から 52.23 へ下がったのですか?
モデルが変わったからではありません。JevBench が新しい規則で同じシステム群を採点し直しました。ある版では機会補正した知性スコアとニアチャンスへの罰則、より後の版では封印された判断集合と調和平均を導入し、新しい測定は行っていません。変動は全体で激しく、あるプロジェクトは 67.0 から 40.6、別は 62.4 から 27.4 へ動きました。数値がどのボードのものか必ず明記してください。
djev は重みを配布していますか?
していません。提供されるのは手法で、チェックポイントではありません。DiffusionGemma 26B-A4B をキャンバスとして読みます。したがって結果はランナーに強く依存します。シード付き拡散キャンバス、読み取り専用デノイズ、選択トークンのロジットが必要で、無ければ確率を自己申告するチャット端点になります。
djev は画像を扱えますか?
画像 state を受け取るとされる 2 路線の一方ですが、どちらが主かは情報源で食い違います。広く読まれた比較は razorback16 の OpenJev を「画像についての設問に答えられる唯一のプロジェクト」とし、別の記事は djev を指します。画像対応は「有望だが未検証」として扱い、それが目的なら自分で試してください。
「封印精度」とは何で、なぜ重要ですか?
採点時点で公開されていなかった判断での性能を測るもので、ベンチマーク汚染に対する唯一の防御です。現行ボードでは最高の公開精度が 80% 台である一方、封印精度は 30% 台に落ちます。Jev 自身も同じです。この乖離はこの生態系で最も正直な数字であり、当サイトがすべての比較表を「仮説」と呼ぶ理由です。
出典
本ページの比較数値はすべて第三者の公開値、または公開リポジトリの読解であり、当サイトの実測ではありません。当サイトは TypeSafe Jev 本体を実測しておらず、同社の契約はその出力を類似製品の開発に用いることを禁じています。