Jev の代替

Laya

19.3k スターの 421M エンコーダ — そして微調整して使うべきモデル

結論

Laya は「自前のラベル数百件で微調整する高速・CPU 向けのベース」として使い、Jev のゼロショット代替品としては扱わないでください。ベースチェックポイントの typed decisions は 0.362(ランダム基线 0.318)に留まり、順序尺度の `score` には明確な位置バイアスがあります。日本語 300 件の検証では、先頭に置いた選択肢が一度も選ばれませんでした。

Laya は Jev のオープン再現の本命です。421M の ModernBERT-large に判断ヘッドを載せ、100 言語以上をカバーする 322M の多言語チェックポイントも用意されています。pip 一発で入り、1 回の順伝播で choice / score / noul に答え、CPU でも動きます。同時に、自分自身の弱点を最も率直に書いているプロジェクトでもあります。

Train a decision model

A small non-autoregressive encoder with decision heads. No text generation at all — the classic classifier shape, rebuilt for natural-language options.

検索別名

layaLaya-MLXlaya-typed-decisionslaya-multilingualconvaiinnovations/laya

主要スペック

Licence
Apache-2.0
Author
Convai Innovations
Backbone
ModernBERT-large(421M)· mmBERT-base(322M・多言語)
Latency
T4 で 32.8〜39.5ms/設問 · 10 設問バッチで 7.2ms · RTX 5090 で 22ms · M3 Pro の CPU で 3 設問 66ms
Languages
多言語チェックポイントで 100 言語以上
Wire format
laya-serve が POST /v1/systemone を提供
Install
pip install laya

Laya 対 Jev:Laya 自身が公開した数値で比較する

すべて第三者の公開値であり、当サイトの実測ではありません。TypeSafe の Master Customer Agreement 2.3(b) は同サービスとその出力を類似製品の開発に使うことを禁じているため、クリーンな head-to-head はほとんど存在せず、本表の数値も第三者の主張として読んでください。

Laya 対 Jev:Laya 自身が公開した数値で比較するLayaJev
ベースモデル・ゼロショット0.362 / 0.342(多数派基线 0.461 を下回る)この分割は未公開
ベンチマークの訓練分割で微調整後0.7660.727(公開値)
1 設問に 77 選択肢(Banking77)0.4250.870
アーキテクチャエンコーダ 421Mクローズドなホスト型
レイテンシ数十ミリ秒。自分の CPU / GPU 上でネットワーク越しに 70〜500ms
1 呼び出しのコストハードウェア以外はゼロ入力 $0.042/MTok

Laya を選ぶべきとき

ラベル付き事例が数百件あり、課題がルーティングやモデレーションの形をしていて、手持ちのハードウェアで動かしたいなら Laya です。非常に小さく、100 言語以上を扱え、多言語 Router は 1ms 未満で適切なチェックポイントを選び、`laya-serve` は同じ `/v1/systemone` 契約を出すので公式 TypeSafe SDK をそのまま向けられます。自前データで微調整すれば十分に競争力があります。ただし正直な注意点として、よく引用される華やかな数値は、そのベンチマーク自身の訓練分割で微調整したものです。

見送るべきとき

ゼロショットで本番投入しないこと。自前データで位置バイアスを測らずに順序尺度の `score` を使わないこと。選択肢が数十個ある設問に使わないこと(選択肢は 192〜256 トークンの固定予算を共有し、ラベル 1 つあたり 3〜4 トークンしかありません)。報告される確率もそのまま信じないでください。日本語の業務メールでは `noul` が「常にいいえ」を下回り、公式モデルカードは 51 言語のマクロ平均 0.227、クメール語に至っては信頼度 0.952 で精度 0.000 と記しています。

Laya 導入の 3 ステップ

01導入と読み込み:`pip install laya` のあと `laya.load("convaiinnovations/laya")`。v0.3.7 以降、ノート PC で読み込みは約 4 秒です。
02自前のラベルで微調整する。ランダム同然のベースを使える水準に変えるのはこの工程です。クラスあたり数百件で足ります。
03ホールドアウトで温度を再フィットし、内蔵 Router で言語ごとに振り分ける。非ラテン文字を多言語チェックポイントへ送り、黙って失敗するのを避けます。
python / 1 回の順伝播で 3 設問
import laya

agent = laya.load("convaiinnovations/laya")

state = {
    "subject": "請求の重複:請求書 #4411",
    "body": "3 月分を二重に請求されています。本日返金がなければ解約します。",
}

questions = {
    "department": {
        "type": "choice",
        "instructions": "どのチームが対応すべきか?",
        "criteria": {
            "billing": "請求書・支払い・返金",
            "technical": "不具合・障害・システムエラー",
            "sales": "価格・新規契約",
        },
    },
    "urgency": {
        "type": "score",
        "instructions": "緊急度は?",
        "criteria": ["急がない", "早めに", "業務が止まっている"],
    },
    "churn_risk": {
        "type": "noul",
        "instructions": "解約を示唆しているか?",
    },
}

answers = agent.predict(state, questions)["answers"]
print(answers["department"]["choice"], answers["department"]["confidence"])
print(answers["urgency"]["score"], answers["churn_risk"]["noul"])
3 設問を 1 回の順伝播で。自前のホールドアウトで温度を再フィットするまでは、出力される confidence を事実ではなく仮説として扱ってください。

Laya についてよくある質問

Laya は Jev のそのままの代替になりますか?

インターフェースは互換でアーキテクチャの考え方も同じですが、精度の代替にはなりません。README 自身が、ベースチェックポイントの typed decisions は 0.362 と 0.342、ランダム 0.318、多数派 0.461 だと記しています。自前ラベルで微調整すれば競争力が出ますが、箱から出したままでは足りません。

なぜ Laya の看板スコアは Jev の公開値を上回るのですか?

0.766 は `laya-typed-decisions`、つまり評価対象ベンチマークの訓練分割で微調整したチェックポイントの値で、Jev の 0.727 はゼロショットです。同じレースではなく別の実験です。独立 49 タスクではオープンなエンコーダは大きく後れ、Laya 0.583 に対して Jev 0.966 です。

Laya は日本語で使えますか?

一部は使えます。日本語の業務メール 300 件の実測で `laya-multilingual` は 4 分類ルーティングで 0.747 を出し、実用範囲です。同じ実測で `score` の RPS は 0.232(多数派基线より悪い)、`noul` は 0.543 で「常にいいえ」の 0.703 を下回りました。原因は選択肢の位置バイアスで、5 通りに言い換え・逆順にしても先頭の選択肢は 300 件中 0〜1 回しか選ばれませんでした。最下位ラベルを末尾に置くか、順序尺度には使わないでください。

温度較正で確率は直りますか?

直るのは較正誤差だけです。(設問タイプ, 選択肢数)ごとに温度を 1 つフィットすると ECE は 0.148 から 0.087 へ、`noul` は 0.352 から 0.012 へ改善しますが、精度は 1 ポイントも動きません。温度スケーリングは分布の鋭さを変えるだけで順位は変えないため、位置バイアスは治せません。

Laya 以外には何を使えばよいですか?

同じアーキテクチャでより高速・高較正が欲しいなら、Laya から微調整された cbjev があります。選択肢の並べ替えで答えが変わる割合は 0.2%(Laya は 7.8%)ですが、ライセンスは GPL-3.0 です。GPU が無いなら Von が 395M エンコーダを CPU で 15ms 未満で動かします。すでにオープン LLM をホストしていて訓練を一切したくないなら、SemIf や AnyJev がロジット直読みの路線です。

出典

本ページの比較数値はすべて第三者の公開値、または公開リポジトリの読解であり、当サイトの実測ではありません。当サイトは TypeSafe Jev 本体を実測しておらず、同社の契約はその出力を類似製品の開発に用いることを禁じています。