OpenRouter 发布教程,介绍如何用独立的裁判模型按自定评分标准为 AI 智能体输出打分,覆盖确定性测试无法检查的开放式回答质量。教程给出点式、成对与参考式三种评分模式,说明自增强、位置与冗长等已知偏差,并演示用 Ori Eval 编写评估、跨模型对比以及用人工标注校准裁判模型的方法。
OpenRouter 发布教程:用 LLM-as-a-judge 自动评估智能体输出