优先选择输入已经结构化的任务
批量分类、客服工单、线索评分和离线评测很适合用 Python 起步,因为数据从哪里来、结果交给谁通常都比较清楚,方便建立人工对照。
Schema 和样本都要进版本控制
instructions、criteria、模型 ID 和测试样本应该跟代码一起评审。之后更新模型或调整标准时,才有办法知道效果变化来自哪里。
超时和判断不确定不是一回事
网络超时、鉴权失败需要处理调用可靠性;confidence 太低、输出落在错误类别需要改任务和 fallback。日志里把两类失败分开,排查会快很多。
Python / requests
import requests
response = requests.post(
"https://your-app.example/api/jev/evaluate",
json={"state": ticket, "questions": questions},
timeout=20,
)
response.raise_for_status()
decision = response.json()