Jev Recipe / ベンダー比較

Jev vs Clef 比較:Cloudflare の決定モデルを正面から

Cloudflare がオープンソースの Clef で Jev に応えました。出典付きのスコアカードを比較します。BFCL と When2Call の割れ方、38.8ms のホスト型レイテンシ、Apache 2.0 の重み、そして「fully Jev-API compatible」という表明が実際に何を約束しているか。

決定モデルを選ぶ前の 6 つのチェック

01両者のスコアカードを出典ごと読みます。Cloudflare 公表の評価では、Clef-Flash が BFCL 98.76 対 95.75、BANKING77 macro-F1 94.20 対 79.74 でリード。一方 Jev は When2Call 80.97 対 65.58 と BRIGHT・PhishNChips を守りました。ベンチマークごとに測っている能力が違います。フォーマット正確な関数呼び出しと銀行ドメインの分類精度は Clef に、ツール選択と「辞めるべきときに辞める」判断は Jev に分がありました。これは公開週(2026-10-01)のベンダー評価です。強みの地図であって、デプロイの判決ではありません。
02出力契約をリスクモデルに合わせます。Jev の決定ヘッドは型付き回答(Choice/Score/Noul)と RLCD 較正済み確率を返します。生成なしで。ホスト型 Clef も同じく prefill 並列で許可された選択肢をスコアリングします。しかしオープンウェイトのローカル量子化経路は別物です。コミュニティの Q4_K_M 量子化パッケージを調べると backbone テンソル 427 個・schema head の一致ゼロで、Ollama の回答は 21〜30 生成トークンを JSON として解析したもので、ネイティブの確率は出てきません。
03両方の料金を実際の量で試算します。Jev は公開価格で入力 100 万トークンあたり $0.042・出力無料——10 万判断で数セント。Clef の重みは Apache 2.0 なのでセルフホストは無料(GPU コストは自己負担)。Workers AI ホスティングの単価は執筆時点で確認できる情報源では未公開でした。「価格未公開」は、Luna プレビューのときと同じく移行リスクとして扱います。
04デプロイとモダリティの境界を正直に確認します。Clef は Cloudflare エコシステムのネイティブです。Workers AI ホスティング、ビジョンエンコーダ、64k コンテキスト(Jev は 32k)。Jev は TypeSafe ホスト型 API + SDK、テキスト state、OpenJev エコシステムによるローカル経路。判断に今日から画像入力が必要なら、それは Jev が持っていない Clef の能力で、比較の枠組みではこの行を変えられません。
05互換表明は信仰ではなく安い A/B として使います。Clef は公式に「fully Jev-API compatible」と自称しており、同じリクエスト形状で両エンドポイントを叩けるはずです。ただしこれはベンダーの自己申告で、当サイトはエンドポイントごとには検証していません。呼び出しを 1 つのインターフェースに包み、自動実行の前に自分のラベル付きサンプル約 100 件で再検証してください。成功スクリーンショット 1 枚は評価ではありません。同じ障害プロンプトの温度ゼロ再実行は、team の答えを technical から billing へひっくり返しました。
06混在構成を初日から設計します。両モデルを 1 つの決定インターフェースの背後に置き、信頼度ゲート付きフォールバックチェーンでどちらのベンダーの低信頼トラフィックも同じレビュー待ち行列へ送ります。そしてこのページの数字は毎月見直してください。上記はすべて公開週のベンダーデータで、公開週の数字は動きます。
schema / 型付きマルチ質問契約
{
  "routing": {
    "type": "choice",
    "instructions": "Which queue should this ticket go to?",
    "criteria": {
      "billing": "Payment, invoice or refund issue",
      "technical": "Product malfunction or bug",
      "sales": "Buying or upgrade question",
      "abuse": "Safety or abuse report"
    }
  },
  "needs_safety_escalation": {
    "type": "noul",
    "instructions": "Does this ticket require a safety escalation regardless of queue?"
  },
  "urgency": {
    "type": "score",
    "instructions": "Rate how urgent a human reply is, 1 (routine) to 5 (business-stopping)"
  }
}
このスキーマは Jev 契約の深さを 1 画面にまとめたものです。Playground で 3 質問同時評価と較正済み信頼度を確認できます。

決定モデルのスコアカード:TypeSafe Jev vs Cloudflare Clef(公開週・各セルに出典を明記)

METRIC
Jev
Cloudflare Clef
出力契約
ネイティブ決定ヘッド——型付き回答(Choice/Score/Noul)と RLCD 較正済み確率。生成なし
ホスト型 Clef:許可された選択肢を prefill 並列でスコアリング——モデルカード上はネイティブ確率。ローカル GGUF 量子化経路は JSON を生成(Q4_K_M 検査:backbone テンソル 427 個・schema head 一致ゼロ)
1 判断あたりのレイテンシ(出典明記)
単一パスの evaluate は典型的に ~70〜100ms——Cloudflare のホスト型評価での Jev 計測は実施回により ~205〜524ms の幅。当サイトの 49 タスク P95 シリーズは /benchmarks で公開
Clef-Flash ~38.8ms / Clef ~209.3ms 中央値(Cloudflare 公表値、Workers AI)——ローカル Q4_K_M の 1 リクエスト ~1.4〜2 秒とは別の測定
価格(2026 年 10 月)
公開:入力 100 万トークンあたり $0.042、出力無料——10 万判断で数セント
重みは Apache 2.0 で Hugging Face に公開——セルフホストは無料(GPU コストは自己負担)。Workers AI ホスティングの価格は執筆時点で確認可能な情報源では未公開
デプロイとモダリティ
TypeSafe ホスト型 API + SDK——テキスト state、32k コンテキスト、複数質問を 1 呼び出しで。OpenJev エコシステムがローカル経路を提供
Cloudflare ネイティブ:Workers AI ホスティング、ビジョンエンコーダ、64k コンテキスト。オープンウェイトでセルフホスト可能(ネイティブヘッドにはそれを実際にロードするランタイムが必要)
較正の物語
RLCD 学習済みの確率——0.85 のしきい値は精度の契約として振る舞う。ECE の手法は当サイトのベンチマークページで公開
「Calibrated Decisions」(RLCD)を名前と学習に掲げ、同名のファインチューニングサービスも提供——ホスト型の信頼度セマンティクスはベンダー文書の口径で、較正はやはり自分のラベルでの検証が必要
ライセンスとエコシステム
TypeSafe のホスト型契約 + SDK——ローカル推論はサードパーティの OpenJev クローン経由。GA 以来 API は変更なし
Apache 2.0 のオープンウェイト——公開から数日でコミュニティ GGUF 量子化とワンコマンドの Ollama インストールが出現

コード対照:Jev 型付き呼び出し vs Clef ローカル実行と A/B 切替

python / jev 型付きマルチ質問 evaluate
import requests

JEV_ENDPOINT = "https://api.typesafe.ai/v1/jev/evaluate"
AUTO_ROUTE_CONFIDENCE = 0.85

QUESTIONS = {
    "routing": {
        "type": "choice",
        "instructions": "Which queue should this ticket go to?",
        "criteria": {
            "billing": "Payment, invoice or refund issue",
            "technical": "Product malfunction or bug",
            "sales": "Buying or upgrade question",
            "abuse": "Safety or abuse report",
        },
    },
    "needs_safety_escalation": {
        "type": "noul",
        "instructions": "Does this ticket require a safety escalation regardless of queue?",
    },
    "urgency": {
        "type": "score",
        "instructions": "Rate how urgent a human reply is, 1 (routine) to 5 (business-stopping)",
    },
}

resp = requests.post(
    JEV_ENDPOINT,
    json={"state": {"ticket": "..."}, "questions": QUESTIONS},
    timeout=5,
)
resp.raise_for_status()
data = resp.json()

route = data["routing"]  # 型付き回答 + 較正済み信頼度、生成なし
if (
    route["confidence"] >= AUTO_ROUTE_CONFIDENCE
    and not data["needs_safety_escalation"]["answer"]
):
    lane = f"auto:{route['answer']}"  # 単一パス、入力トークンのみ課金
else:
    lane = "review"  # 0.60〜0.85 帯またはセーフティフラグ
python / Ollama で Clef-Flash をローカル実行(Q4_K_M、schema 制約)
import json

import requests

# 当サイトの Clef-Flash 装機テストで検証済みのローカル経路:
# bartowski Q4_K_M GGUF、Ollama 0.35、8GB ノート PC、2048 コンテキスト。
# メカニズム注記:この経路は JSON を「生成」します(21〜30 トークン)。
# 公式の joint schema head はロードされておらず(backbone テンソル
# 427 個・schema head 一致ゼロ)、ネイティブ確率は出てきません。
OLLAMA_CHAT = "http://localhost:11434/api/chat"

SCHEMA = {
    "type": "object",
    "properties": {
        "urgent": {"type": "boolean"},
        "team": {"enum": ["billing", "technical", "sales"]},
        "severity": {"enum": ["minor", "major", "critical"]},
    },
    "required": ["urgent", "team", "severity"],
}

resp = requests.post(
    OLLAMA_CHAT,
    json={
        "model": "hf.co/bartowski/Cloudflare_clef-flash-GGUF:Q4_K_M",
        "messages": [{
            "role": "user",
            "content": "Ticket: Checkout has been failing for every "
            "customer for the last hour. Reply with urgent, team, "
            "severity as JSON.",
        }],
        "format": SCHEMA,  # ランタイム層の制約が固定するのは「フォーマット」で、
        "options": {"temperature": 0, "num_ctx": 2048},  # 「正しさ」ではありません
    },
    timeout=60,
)
reply = json.loads(resp.json()["message"]["content"])

# ウォーム リクエストは約 1.4〜2 秒。検証では、同じ障害プロンプトの
# 温度ゼロ再実行が team を technical から billing へひっくり返しました。
# ルーティングの評価はラベル付きセットで行うべきで、成功スクリーン
# ショット 1 枚では不十分です。
typescript / jev 型付きマルチ質問呼び出し
const JEV_ENDPOINT = "https://api.typesafe.ai/v1/jev/evaluate";
const AUTO_ROUTE_CONFIDENCE = 0.85;

const QUESTIONS = {
  routing: {
    type: "choice",
    instructions: "Which queue should this ticket go to?",
    criteria: {
      billing: "Payment, invoice or refund issue",
      technical: "Product malfunction or bug",
      sales: "Buying or upgrade question",
      abuse: "Safety or abuse report",
    },
  },
  needs_safety_escalation: {
    type: "noul",
    instructions:
      "Does this ticket require a safety escalation regardless of queue?",
  },
  urgency: {
    type: "score",
    instructions:
      "Rate how urgent a human reply is, 1 (routine) to 5 (business-stopping)",
  },
} as const;

const resp = await fetch(JEV_ENDPOINT, {
  method: "POST",
  headers: { "Content-Type": "application/json" },
  body: JSON.stringify({ state: { ticket: "..." }, questions: QUESTIONS }),
});
const data = await resp.json();

const lane =
  data.routing.confidence >= AUTO_ROUTE_CONFIDENCE &&
  !data.needs_safety_escalation.answer
    ? `auto:${data.routing.answer}`
    : "review";
typescript / 1 ゲート・2 バックエンド(互換性 A/B)
// Clef は公式に "fully Jev-API compatible" と自称しています。あなたの
// 呼び出しに対してそれが成立するなら、ベンダー交代はこの定数の変更だけ。
// 留保:これは Cloudflare の自己申告であり、当サイトはエンドポイント
// ごとには検証していません。対象はホスト型モデルで、ローカル量子化経路は
// ネイティブヘッドなしの JSON 生成です。両バックエンドを 1 つのインター
// フェースの背後に置き、信頼度での自動実行の前に約 100 件のラベル付き
// サンプルで切り替えを検証してください。
const JEV_ENDPOINT = "https://api.typesafe.ai/v1/jev/evaluate";

const DECISION_ENDPOINT =
  process.env.DECISION_BACKEND === "clef"
    ? process.env.CLEF_ENDPOINT! // あなたの Workers AI / セルフホスト Clef エンドポイント
    : JEV_ENDPOINT;

const QUESTIONS = {
  routing: {
    type: "choice",
    instructions: "Which queue should this ticket go to?",
    criteria: {
      billing: "Payment, invoice or refund issue",
      technical: "Product malfunction or bug",
      sales: "Buying or upgrade question",
      abuse: "Safety or abuse report",
    },
  },
} as const;

export async function routeTicket(ticket: string) {
  const resp = await fetch(DECISION_ENDPOINT, {
    method: "POST",
    headers: { "Content-Type": "application/json" },
    body: JSON.stringify({ state: { ticket }, questions: QUESTIONS }),
  });
  if (!resp.ok) throw new Error("decision call failed");
  const data = await resp.json();

  // 信頼度のセマンティクスはバックエンドごとに異なり得ます。自動実行の
  // ゲートは「数字が存在すること」ではなく「ベンダーごとに検証された
  // 較正」の上に置いてください。
  return data.routing as { answer: string; confidence: number };
}

Jev vs Clef よくある質問

Clef とは何ですか?Jev とどう関係しますか?

Cloudflare が 2026-10-01 に公開したオープンウェイト決定モデルファミリーです。Clef(27B)と Clef-Flash(9B)の 2 モデルで、凍結した Qwen3 バックボーンに rank-256 LoRA を足してファインチューニングされ、Apache 2.0 ライセンスで Hugging Face に公開、Workers AI でもホストされています。TypeSafe の Jev と同じく非生成型で、1 回の prefill 並列パスで事前定義された選択肢をスコアリングし、公式に「fully Jev-API compatible」と自称します。公開当日の Hacker News では 625 ポイントを記録し、当サイトの監視史上最大のスレッドになりました。「Jev 互換」がコミュニティの再現から大手ベンダーの製品戦略に昇格した瞬間です。

「Jev-API compatible」とは実際何を意味しますか?

Cloudflare の発表上は、Clef エンドポイントが同じリクエスト形状——コンテキスト + questions + 事前定義された回答セット——を受け付け、回答と信頼度を返すので、Jev から Clef への置き換えはリライトではなくエンドポイント変更で済む、という意味です。ただし 2 つの留保があります。これはベンダーの自己申告で、当サイトはエンドポイントごとには検証していません。また対象はホスト型モデルです。ローカル量子化経路は別のメカニズム(JSON 生成・ネイティブヘッドなし)で動くため、形状の互換と信頼度セマンティクスの互換は別物です。

どちらを選ぶべきですか?

スコアボードではなくシーンで選びます。Clef を先に見るケース:Cloudflare エコシステム前提、今日から必要な画像入力、セルフホスト可能なオープンウェイト、BFCL/BANKING77 のリード(フォーマット正確な関数呼び出し・銀行ドメイン精度)と ~38.8ms のホスト型レイテンシ。Jev を先に見るケース:信頼度しきい値での自動実行、RLCD 較正済み確率、出力無料の入力のみ課金、複数質問の 1 呼び出し、When2Call 80.97 対 65.58 のプロファイル(辞め時を含むツール選択)。どちらでも、自動実行の前に自分のラベル付きサンプル約 100 件をゲートに通してください。公開週のベンダー数字が答えるのは選定偵察の質問であって、デプロイの質問ではありません。

Clef はローカルで動きますか?

動きますが、メカニズムの注意付きです。bartowski の Clef-Flash Q4_K_M GGUF は 8GB RTX 4060 ノート PC の Ollama 0.35 で、ウォーム リクエスト約 1.4〜2 秒。検証では画像入力も受け付けました。ただし検査した量子化パッケージは backbone テンソル 427 個・schema head 一致ゼロで、Ollama の回答は生成された JSON(21〜30 トークン)であり、公式 joint schema head のネイティブ確率ではありません。ネイティブの決定インターフェースは cloudflare/clef-webcam リポジトリ(Apple Silicon・メモリ 32GB 以上)が参考経路です。経験則:ランタイムを確認する——モデル名はどのメカニズムが動いているか教えてくれません。

Clef は無料ですか?ライセンスは?

重みは Apache 2.0 で Hugging Face に公開されているため、ダウンロードとセルフホストは無料です。コストは GPU 側に発生します。Cloudflare の Workers AI ホスティングは有料製品で、そのトークン単価は執筆時点(2026-10-05)で確認できる情報源では未公開でした。「無料」ではなく「未公開」と記録してください。Jev の対照点は公開済みの入力 100 万トークンあたり $0.042・出力無料です。

割れたベンチマーク結果はどう読めばいいですか?

各ベンチマークが何を測るかから聞きます。BFCL(98.76 対 95.75)と API-Bank(93.11 対 88.19)はフォーマット正確な関数呼び出しを評価——Clef-Flash のリード。BANKING77 macro-F1(94.20 対 79.74)は細粒度の銀行ドメイン分類精度——Clef が最も差を開けた枠。When2Call(80.97 対 65.58)は正しいツールの選択または辞める判断を評価——Jev が最もリードした枠で、ワークフローレベルのスコアも概ねこれに従います(請求書処理 61.8 対 57.1、agent traces 71.6 対 69.8、カスタマーサービスは 77 対 76 のコインフリップ)。これらはすべて Cloudflare 公表の評価で、Jev の独立数値は当サイトのベンチマークページにあります。割れ方こそが結論です。この 2 つのモデルは異なる仕事が得意です。

Clef クラスタをさらに深める