Jev の代替
NanoJev
ある課題で実際に Jev を上回った唯一のオープン実装
結論
NanoJev はレイテンシと反復回数で勝ちます。0.6B をローカルで動かし、ViZDoom Basic は 128/128 対 Jev の 56/128。ただし評価している 4 つのゲームは訓練した 4 つのゲームそのもので、迷路テストセットでは Jev が 7/10 対 4/10 で依然勝ちます。「小さな専用モデルは密なループ内でホスト型の判断 API を上回り得る」証拠として扱い、汎用分類器とは考えないでください。
NanoJev は Qwen3-0.6B に並列の判断ヘッドを載せ、4 つのゲーム環境から取った 18,760 件の判断設問で訓練したモデルです。この比較の中で、ある課題で Jev に正面から勝っている唯一のオープン実装ですが、正直に読めばそのベンチマークは自らの訓練分布の内側にあります。チケットではなく制御ループに使ってください。
Train a decision model
A small non-autoregressive encoder with decision heads. No text generation at all — the classic classifier shape, rebuilt for natural-language options.
検索別名
主要スペック
- Licence
- リポジトリに記載なし。第三者は MIT と表記
- Author
- TianyuCodings
- Backbone
- Qwen3-0.6B + 並列判断ヘッド
- Size
- 0.6B パラメータ
- Latency
- 推論スクリプトは CUDA 前提。Apple Silicon 経路なし
- Wire format
- 独自ハーネス。/v1/systemone サーバではない
- Install
- リポジトリ参照(中国語 README あり)
NanoJev 対 Jev、課題ごとに
プロジェクト自身のホールドアウト値です。範囲の但し書きと併せて読んでください。訓練した 4 ゲームを、そのまま評価しています。
| NanoJev 対 Jev、課題ごとに | NanoJev | Jev |
|---|---|---|
| ViZDoom Basic | 128/128 | 56/128 |
| Predict Position | 27/128 | 11/128 |
| 50x50 迷路の試行回数 | 225 | 2,738 |
| 迷路テストセット | 4/10 | 7/10 |
| Snake | 8/8 | 8/8(引き分け) |
| 適用範囲 | 訓練も評価も同じ 4 ゲーム | 汎用のホスト型モデル |
NanoJev を選ぶべきとき
判断が密な制御ループの中にあるとき——ゲームエージェント、シミュレータ、高速な分岐評価——そして全体を自分の GPU で動かしたいときに NanoJev です。狭く繰り返しサンプリングされる課題では、0.6B の専用モデルがフロンティアの判断 API を上回り得るという有用な事実を示しています。1 回あたりのレイテンシとコストが支配する領域はまさにそこです。
見送るべきとき
チケットのトリアージ、コンテンツ審査、サポートメールの振り分けに NanoJev を使わないでください。数値は訓練した 4 つのゲーム環境から出たもので、迷路テストセットでは Jev が依然勝ちます。さらに迷路ハーネスを独立に再実行した結果、「北へ 1 歩は空いているか」という単純な設問で、より大きなモデルを含めどの LLM 読み取りも多数派ラベルを超えられませんでした。Apple Silicon 経路も無く、ライセンスも明記されていません。
NanoJev 導入の 3 ステップ
# NanoJev は 1 つの state に対する複数の設問を # 1 回の順伝播で答える。これが制御ループを成立させる。 # # 公開ハーネス結果(ホールドアウトのプレイ): # ViZDoom Basic 128/128 (Jev 56/128) # Predict Position 27/128 (Jev 11/128) # 50x50 迷路 225 試行 (Jev 2,738) # 迷路テストセット 4/10 (Jev 7/10) # Snake 8/8 (引き分け) # # 訓練・評価パイプラインはリポジトリに同梱。推論は CUDA 前提。 # これらの数値を信じる前に自前の環境で評価すること。 # 4 つのゲームは訓練セットでもある。
NanoJev についてよくある質問
NanoJev は本当に Jev に勝っていますか?
プロジェクトが報告する 2 課題では勝っています。ViZDoom Basic 128/128 対 56/128、Predict Position 27/128 対 11/128 で、迷路の試行回数も大幅に少なくなります。ただし迷路テストセットでは Jev が 7/10 対 4/10 で勝ち、Snake は引き分けです。勝利は本物ですが、訓練した 4 ゲームの範囲に限られます。
汎用分類器として使えますか?
使えません。4 つのゲーム環境の 18,760 件の判断設問で訓練し、同じ 4 つで評価した 0.6B モデルです。この設定のどこもチケットのトリアージや審査、ルーティングには転移せず、プロジェクトもそのような主張をしていません。
商用利用できるライセンスですか?
不明です。リポジトリにライセンスの記載がありません。第三者の記事が MIT と書いていますが、LICENSE ファイルの存在とは別物です。社内配備の前に法務確認を行い、ブログ記事を条項の根拠にしないでください。
このベンチマーク数値は信頼できますか?
正直ですが射程は狭いです。別プロジェクトが NanoJev 自身の迷路ハーネスを再実行したところ、結果は「モデルの読み方」に強く依存しました。同じ未調整の Qwen3-0.6B が、ある読み取りでは 13/15 迷路・20,555 試行、別の読み取りでは 15/15・5,825 試行でした。これは地図理解ではなく読み取り方式の性質です。
出典
- TianyuCodings/NanoJev — リポジトリ・訓練・ベンチマーク一式
- オープンな Jev 代替の一覧 — NanoJev の節
- AnyJev ベンチマーク — NanoJev の迷路ハーネス内での独立再実行
本ページの比較数値はすべて第三者の公開値、または公開リポジトリの読解であり、当サイトの実測ではありません。当サイトは TypeSafe Jev 本体を実測しておらず、同社の契約はその出力を類似製品の開発に用いることを禁じています。