# AI評価の採点基準を校正する方法｜LLM-as-a-judgeと人手評価のずれを減らす手順

> AI評価の採点基準は、代表サンプルを人が独立評価し、意見の不一致を裁定してから自動採点と比較します。校正用データとholdoutを分け、偽合格・偽不合格を分母付きで確認し、モデル・採点プロンプト・データ版を固定して変更後に再検証します。

## メタ情報

- URL (HTML): https://funnel-ai.jp/media/ai-evaluation-grader-calibration/
- 公開日: 2026-09-28
- テーマ: Funnel Ai Media -AI- (https://funnel-ai.jp/media/ai/)
- カテゴリ: AIエージェント (https://funnel-ai.jp/media/ai-agents/)
- 編集: ファネルAi編集部 (https://funnel-ai.jp/company/funnelai-editorial/)
- 監修: ファネルAi監修チーム (https://funnel-ai.jp/company/funnelai-review/)
- 出典メディア: Funnel Ai Media (https://funnel-ai.jp/media/)

## 本記事のポイント

- 自動採点を信頼する前に、人手の基準を具体例でそろえ、意見が割れた回答は理由を記録して裁定します。
- 校正に使った回答と合否を最後に確認するholdoutを分け、偽合格・偽不合格を分母付きで比較します。
- 提示順・文章量・採点モデルやプロンプトの版を固定し、変更後は独立データで再検証します。

## 想定質問

- LLM-as-a-judgeの採点基準はどう作りますか？
- 自動採点と人手評価のずれをどう測りますか？
- 提示順や文章量の評価バイアスをどう確認しますか？
- 採点モデルを変更するとき何を再検証しますか？

---

本文（HTML）は https://funnel-ai.jp/media/ai-evaluation-grader-calibration/ を参照してください。
