# AI評価データの漏えい防止｜開発用と合否判定用を分けて改善効果を測る方法

> プロンプト調整やFew-shotサンプルの選定にテストデータを流用すると、評価スコアが過大になり本番で失敗します。開発用・検証用・合否判定用の3層にデータを分離し、合否判定セットの直接閲覧を制限したうえで、ハッシュと埋め込みコサイン類似度で意味的重複を排除し、定期的なローテーションで評価の健全性を維持します。

## メタ情報

- URL (HTML): https://funnel-ai.jp/media/ai-evaluation-dataset-leakage-control/
- 公開日: 2026-09-19
- テーマ: Funnel Ai Media -AI- (https://funnel-ai.jp/media/ai/)
- カテゴリ: AIエージェント (https://funnel-ai.jp/media/ai-agents/)
- 編集: ファネルAi編集部 (https://funnel-ai.jp/company/funnelai-editorial/)
- 監修: ファネルAi監修チーム (https://funnel-ai.jp/company/funnelai-review/)
- 出典メディア: Funnel Ai Media (https://funnel-ai.jp/media/)

## 本記事のポイント

- 開発用データと合否判定用データを物理的・権限的に分離し、プロンプト調整やFew-shotへのテストケース混入を防ぐ。
- 文字列の完全一致だけでなく、埋め込み類似度や言い換えパターンで評価セット間の意味的重複を検知・排除する。
- 合否判定セットの閲覧を制限し、改善サイクルごとに独立評価の版を更新してテストへの過剰適合を防ぐ。

## 想定質問

- 開発用データと合否判定用データをなぜ分けますか？
- 同じ質問の言い換えによるデータ混入をどう点検しますか？
- 評価セットの閲覧権限と版をどう管理しますか？
- 評価結果を見て改善した場合はいつ新しい独立評価を用意しますか？

---

本文（HTML）は https://funnel-ai.jp/media/ai-evaluation-dataset-leakage-control/ を参照してください。
