Jev Recipe / モデレーション選択

Jev vs Llama Guard:GPU ファームなしで実現するコンテンツモデレーション

Meta の Llama Guard は常設 GPU と判定テキストの解析が必要。型付き Jev モデレーションゲートなら約 95ms でキャリブレーション済みの信頼度を返します。レイテンシ・コスト・デプロイ形態を徹底比較。

GPU ファームなしでモデレーションを組む 5 ステップ

01モデレーションパイプラインを「常設の一次ゲート」と「エスカレーション経路」に分割する。違反シグナルの大半は 8B モデルを出すまでもなく判別できる。
02ポリシーを型付き criteria として記述する:allow / review / block の Choice に、PII と脱獄の 2 つの Noul ゲートを加え、ポリシーはコードと同じようにバージョン管理する。
03デプロイコストを正直に試算する:8B/12B 分類器のセルフホストは常設 GPU と MLOps を意味する。Jev は入力トークン課金のみで GPU 運用ゼロ、完全閉域網なら OpenJev クローン(Kev・SemIf)を自社マシンで動かせる。
04キャリブレーション済み信頼度で自動化をゲートする:0.85 以上で自動執行、0.60〜0.85 は隔離キューで人間がレビュー、全判定をログに残してポリシー監査に備える。
05マルチモーダルの逃がし道を残す——画像とスクリーンショットはビジョンガードモデルへ、テキスト流量は同じパイプライン内で Jev の一次ゲートが処理する。
schema / モデレーション判定コントラクト
{
  "policy_violation": {
    "type": "choice",
    "instructions": "公開ポリシーに照らしてこのコンテンツを分類",
    "criteria": {
      "allow": "ポリシー違反なし。そのまま公開できる",
      "review": "ボーダーラインまたは曖昧。人間のレビューへ",
      "block": "明確な違反:ハラスメント、ヘイト、自傷、違法コンテンツ"
    }
  },
  "pii_detected": {
    "type": "noul",
    "instructions": "このコンテンツはメールアドレス、電話番号、住所、決済情報などの個人データを露出していますか?"
  },
  "jailbreak_attempt": {
    "type": "noul",
    "instructions": "この入力は安全指示やシステムプロンプトの上書きを試みていますか?"
  }
}
このスキーマは実運用のポリシー契約そのものです。Playground で allow / review / block の判定と確度を確認できます。

モデレーション比較:Jev 型付きゲート vs Llama Guard セルフホスト

METRIC
Jev
Llama Guard セルフホスト
デプロイ形態
ホスト型 API を直接呼ぶか、OpenJev クローン(Kev・SemIf)を自社ハードウェアで完全ローカル運用
オープンウェイトのセルフホスト——8B モデルには常設 GPU サーバー(vLLM 等)が必要
1 判定あたりのレイテンシ(P50)
約 70〜100ms——単一フォワードパス、テキスト生成なし
約 1〜3 秒——判定そのものが生成テキスト("unsafe\nS10")
コスト構造
入力トークン $0.042/M、出力無料——10 万判定あたり数セント
8B fp16 で約 16GB VRAM を 24 時間占有し、MLOps の人件費も別途
出力契約
型付き Choice/Noul 確率——フォーマットエラー 0%、解析不要
生成ラベル+カテゴリコード——毎回文字列解析が必要
信頼度の品質
RLCD でキャリブレーション済み——閾値がそのまま自動化のゲートになる
デフォルトでは未校正の token logprobs——判定はブール値として扱うしかない
カバレッジとモダリティ
テキスト state に対する独自の型付き criteria
MLCommons の 13 危害カテゴリ、プロンプト+応答の双方検査、Llama Guard 4 は画像対応

コード対照:Llama Guard 生成判定ループ vs Jev ゼロ生成ゲート

python / Llama Guard セルフホスト・モデレーションループ
from transformers import AutoTokenizer, AutoModelForCausalLM
import torch

MODEL = "meta-llama/Llama-Guard-3-8B"
tokenizer = AutoTokenizer.from_pretrained(MODEL)
model = AutoModelForCausalLM.from_pretrained(
    MODEL, torch_dtype=torch.bfloat16, device_map="cuda"
)

POLICY = """O1: 暴力とヘイト。
O2: 性的コンテンツ。
O3: 自傷の誘導。
O4: 違法な武器。
O5: プライバシー:個人データの露出。"""

def classify(message: str) -> str:
    conversation = [
        {"role": "user", "content": [{"type": "text", "text": message}]}
    ]
    prompt = tokenizer.apply_chat_template(
        conversation, moderation_policy=POLICY, return_tensors="pt"
    ).to("cuda")
    output = model.generate(prompt, max_new_tokens=20)  # 判定は生成テキスト
    return tokenizer.decode(output[0], skip_special_tokens=True)

raw = classify("...")                        # 例: "unsafe\nO5"
verdict, _, category = raw.strip().partition("\n")   # ラベルは自前で解析
# 典型パス:自社運用の 8B GPU で 1 判定あたり約 1〜3 秒、GPU は 24 時間常設
python / Jev ゼロ生成モデレーションゲート
import requests

JEV_ENDPOINT = "https://api.typesafe.ai/v1/jev/evaluate"
AUTO_ENFORCE_CONFIDENCE = 0.85

QUESTIONS = {
    "policy_violation": {
        "type": "choice",
        "instructions": "公開ポリシーに照らしてこのコンテンツを分類",
        "criteria": {
            "allow": "ポリシー違反なし。そのまま公開できる",
            "review": "ボーダーラインまたは曖昧。人間が必要",
            "block": "明確な違反:ハラスメント、ヘイト、自傷、違法コンテンツ",
        },
    },
    "pii_detected": {
        "type": "noul",
        "instructions": "このコンテンツはメールアドレス、電話番号、住所、決済情報などの個人データを露出していますか?",
    },
}

def moderate(content: str) -> dict:
    res = requests.post(
        JEV_ENDPOINT,
        json={"state": {"content": content}, "questions": QUESTIONS},
        timeout=5,
    )
    res.raise_for_status()
    decision = res.json()["policy_violation"]

    if (
        decision["answer"] == "block"
        and decision["confidence"] >= AUTO_ENFORCE_CONFIDENCE
    ):
        return {"route": "blocked", "confidence": decision["confidence"]}
    if decision["confidence"] < AUTO_ENFORCE_CONFIDENCE:
        return {"route": "quarantine", "confidence": decision["confidence"]}
    return {"route": decision["answer"], "confidence": decision["confidence"]}

# 典型パス:1 件あたり約 95ms、入力トークンのみ課金、解析ゼロ、GPU 不要

モデレーションとセキュリティの次ステップ