Jev の代替

NanoJev

ある課題で実際に Jev を上回った唯一のオープン実装

結論

NanoJev はレイテンシと反復回数で勝ちます。0.6B をローカルで動かし、ViZDoom Basic は 128/128 対 Jev の 56/128。ただし評価している 4 つのゲームは訓練した 4 つのゲームそのもので、迷路テストセットでは Jev が 7/10 対 4/10 で依然勝ちます。「小さな専用モデルは密なループ内でホスト型の判断 API を上回り得る」証拠として扱い、汎用分類器とは考えないでください。

NanoJev は Qwen3-0.6B に並列の判断ヘッドを載せ、4 つのゲーム環境から取った 18,760 件の判断設問で訓練したモデルです。この比較の中で、ある課題で Jev に正面から勝っている唯一のオープン実装ですが、正直に読めばそのベンチマークは自らの訓練分布の内側にあります。チケットではなく制御ループに使ってください。

Train a decision model

A small non-autoregressive encoder with decision heads. No text generation at all — the classic classifier shape, rebuilt for natural-language options.

検索別名

nanojevNanoJevNano JevTianyuCodings/NanoJev

主要スペック

Licence
リポジトリに記載なし。第三者は MIT と表記
Author
TianyuCodings
Backbone
Qwen3-0.6B + 並列判断ヘッド
Size
0.6B パラメータ
Latency
推論スクリプトは CUDA 前提。Apple Silicon 経路なし
Wire format
独自ハーネス。/v1/systemone サーバではない
Install
リポジトリ参照(中国語 README あり)

NanoJev 対 Jev、課題ごとに

プロジェクト自身のホールドアウト値です。範囲の但し書きと併せて読んでください。訓練した 4 ゲームを、そのまま評価しています。

NanoJev 対 Jev、課題ごとにNanoJevJev
ViZDoom Basic128/12856/128
Predict Position27/12811/128
50x50 迷路の試行回数2252,738
迷路テストセット4/107/10
Snake8/88/8(引き分け)
適用範囲訓練も評価も同じ 4 ゲーム汎用のホスト型モデル

NanoJev を選ぶべきとき

判断が密な制御ループの中にあるとき——ゲームエージェント、シミュレータ、高速な分岐評価——そして全体を自分の GPU で動かしたいときに NanoJev です。狭く繰り返しサンプリングされる課題では、0.6B の専用モデルがフロンティアの判断 API を上回り得るという有用な事実を示しています。1 回あたりのレイテンシとコストが支配する領域はまさにそこです。

見送るべきとき

チケットのトリアージ、コンテンツ審査、サポートメールの振り分けに NanoJev を使わないでください。数値は訓練した 4 つのゲーム環境から出たもので、迷路テストセットでは Jev が依然勝ちます。さらに迷路ハーネスを独立に再実行した結果、「北へ 1 歩は空いているか」という単純な設問で、より大きなモデルを含めどの LLM 読み取りも多数派ラベルを超えられませんでした。Apple Silicon 経路も無く、ライセンスも明記されていません。

NanoJev 導入の 3 ステップ

01まずライセンスを確認する。リポジトリに記載が無いため、商用配備は何より先に法務確認が必要です。
02CUDA 環境で動かし、自前の環境で検証する。公開された勝利は訓練済みの 4 ゲームから出たものです。
03成功率だけでなく試行回数と衝突回数も計測する。プロジェクト自身のハーネスでは、目標テストよりも試行回数の方が大きく動きました。
python / ステップごとに並列判断
# NanoJev は 1 つの state に対する複数の設問を
# 1 回の順伝播で答える。これが制御ループを成立させる。
#
# 公開ハーネス結果(ホールドアウトのプレイ):
#   ViZDoom Basic      128/128   (Jev 56/128)
#   Predict Position    27/128   (Jev 11/128)
#   50x50 迷路          225 試行  (Jev 2,738)
#   迷路テストセット    4/10      (Jev 7/10)
#   Snake               8/8       (引き分け)
#
# 訓練・評価パイプラインはリポジトリに同梱。推論は CUDA 前提。
# これらの数値を信じる前に自前の環境で評価すること。
# 4 つのゲームは訓練セットでもある。
再利用できる考え方は、動的な候補集合に対する並列判断を 1 回の順伝播で行うこと。これがステップごとの判断を現実的なコストにします。

NanoJev についてよくある質問

NanoJev は本当に Jev に勝っていますか?

プロジェクトが報告する 2 課題では勝っています。ViZDoom Basic 128/128 対 56/128、Predict Position 27/128 対 11/128 で、迷路の試行回数も大幅に少なくなります。ただし迷路テストセットでは Jev が 7/10 対 4/10 で勝ち、Snake は引き分けです。勝利は本物ですが、訓練した 4 ゲームの範囲に限られます。

汎用分類器として使えますか?

使えません。4 つのゲーム環境の 18,760 件の判断設問で訓練し、同じ 4 つで評価した 0.6B モデルです。この設定のどこもチケットのトリアージや審査、ルーティングには転移せず、プロジェクトもそのような主張をしていません。

商用利用できるライセンスですか?

不明です。リポジトリにライセンスの記載がありません。第三者の記事が MIT と書いていますが、LICENSE ファイルの存在とは別物です。社内配備の前に法務確認を行い、ブログ記事を条項の根拠にしないでください。

このベンチマーク数値は信頼できますか?

正直ですが射程は狭いです。別プロジェクトが NanoJev 自身の迷路ハーネスを再実行したところ、結果は「モデルの読み方」に強く依存しました。同じ未調整の Qwen3-0.6B が、ある読み取りでは 13/15 迷路・20,555 試行、別の読み取りでは 15/15・5,825 試行でした。これは地図理解ではなく読み取り方式の性質です。

出典

本ページの比較数値はすべて第三者の公開値、または公開リポジトリの読解であり、当サイトの実測ではありません。当サイトは TypeSafe Jev 本体を実測しておらず、同社の契約はその出力を類似製品の開発に用いることを禁じています。