生成AIの回答を評価する方法|正解例と失敗例で確認する

生成AIの回答を業務で評価・正解例と失敗例を用意する

「AIの回答は読みやすいが、業務で使えるか判断できない。」

「担当者ごとに合格の基準が違ってしまう。」

生成AIの回答を評価するときは、使う仕事と完成物を決め、正しく処理したい例と失敗しやすい例を用意します。事実、必須項目、禁止事項、確認の手間を別々に照合してください。平均的に良い回答が出ることだけで、重大な誤りを許可しません。採用・修正・保留の条件と、何を評価していないかを記録します。

この記事で確認すること

  1. 業務の完成条件から評価項目を選ぶ
  2. 正解例と失敗例を用意する
  3. 回答と確認工数を別々に記録する
  4. 変更後の再評価と運用条件を決める
  5. 相談前の準備
  6. よくある疑問

業務の完成条件から評価項目を選ぶ

文章の印象を採点する前に、仕事に必要な条件へ戻します。

出力を使う相手と場面を固定する

社内メモ、顧客向けの返信案、公開用の商品説明では必要な確認が違います。誰が何に使う出力なのか、元資料のどの範囲を使うのか、最終判断をする担当は誰かを決めてください。一つの回答を見てAI全体が使えると判断せず、対象の業務と入力条件を固定します。資料が不足する場合の出力も完成条件へ含めます。答えを作らず確認事項として返すことが正しい場面を、空欄や低品質として誤って減点しないようにします。

許容できない誤りを先に決める

金額、期限、担当、契約条件など、誤ると相手への約束が変わる項目を区別します。表現の好みと重大な事実誤りを同じ点数へまとめると、読みやすさで誤りが隠れます。必要な情報の欠落、根拠のない追加、未確認事項の断定、対象外の回答を別々に記録してください。NISTのAIリスク管理資料は、利用目的や状況に合う測定と許容範囲を考えることを示しています。本文の評価表は業務用の整理例で、NISTへの適合認証やすべてのリスクを測る仕組みではありません。

業務を固定する → 期待条件を書く → 失敗例を加える → 資料と照合する。本文の確認手順の例。
本文の確認順序を示す図解。
業務を固定する → 期待条件を書く → 失敗例を加える → 資料と照合する。本文の確認手順の例。
本文の確認順序を示す図解。

正解例と失敗例を用意する

通常の入力だけでなく、条件が欠ける入力も試します。

期待する答えと根拠を一組にする

公開情報や利用許可のある資料から試験用の入力を作ります。唯一の言い回しを正解にせず、残すべき事実、必須の説明、回答してはいけない項目、確認へ戻す条件を示してください。正解例には根拠となる資料と確認した版を付けます。AIが作った回答をそのまま正解として使うと、同じ誤りを通してしまう場合があります。担当者が期待条件を確かめ、資料が変わったときは正解例も更新します。実際の秘密情報を試験のために入力する必要はありません。

欠落と矛盾がある例を加える

期限が書かれていない、二つの資料の価格が違う、質問が対象業務の外にあるなど、保留が必要な例を作ります。AIが不足を埋めず、確認すべき項目を返すかを見てください。通常例だけで合格しても、境界条件を確認したことにはなりません。過去に起きた失敗を試験へ追加する場合は、資料の利用許可と対象が分からない形を確認します。例の数だけを増やすのではなく、どの失敗を見つけるための入力かを記録すると、重複した試験を減らせます。

回答と確認工数を別々に記録する

修正後に使える回答と、そのまま使える回答を区別します。

資料へ照合して採用・修正・保留に分ける

事実、必須項目、禁止事項を元資料と比べます。根拠が見つからない断定は、もっともらしい文章でも採用しません。軽い表現調整で使えるのか、条件を再確認する必要があるのか、対象外として保留するのかを分けてください。合格率を記録するときは試験の件数と対象の種類を残します。少数の例で得た割合をすべての仕事の精度として紹介しないようにします。一件の重大な誤りが見つかった場合は、平均点だけで継続せず、その条件の扱いを見直します。

入力準備と修正の時間も測る

回答が出るまでの時間だけでなく、資料の準備、指示の作成、照合、修正にかかった時間を記録します。従来手順と比べる場合は、同じ完成条件で確認してください。速く見える下書きでも、事実の修正が増えるなら業務全体の効果は別です。作業者の経験や資料の状態を記録し、条件が違う試験を単純に比較しません。時間を測っていない場合は、短縮できたという結論を出さず、回答品質のみ確認したと明記します。測定していない項目を成果へ足さないことが大切です。

表が画面に収まらない場合は、左右に動かして確認できます。

評価する項目期待する状態記録する結果
事実金額・日付・対象が元資料と一致一致/相違と根拠
必須項目回答に必要な条件が残る欠落した項目
境界条件不足・矛盾を確認へ戻す断定した箇所と保留
表現相手と用途に合う修正内容
工数準備・照合・修正を含める測った範囲と未測定
本文の判断に使う記入例。条件は個別に確認します。

架空の評価例です。納期が書かれていない資料から作った返信案で、AIが金曜日の納品を約束しました。この回答は文章が自然でも採用せず、納期を確認する回答を期待条件へ加えます。修正後は同じ入力で未確認事項を断定しないか再確認します。実際の合格率や性能を示す例ではありません。

変更後の再評価と運用条件を決める

試験の合格を、無条件の自動運用へ広げません。

指示や資料が変わったら同じ例で比べる

入力テンプレート、参照資料、利用する環境を変更した場合は、以前の試験例で比較します。直したかった失敗が減ったかと、別の項目が悪化していないかを確認してください。変更前後の版と回答を残せば、担当者が交代しても判断の理由を追えます。良い回答だけを残して失敗を消すと、運用時の注意点が伝わりません。試験例を変更した場合も理由を記録し、以前と同じ指標名でも比較条件が変わっていることを明示します。

人が確認する範囲を運用へ残す

試験で合格しても、顧客への送信、金額の決定、公開の承認までAIへ渡したことにはしません。業務で使う範囲、確認担当、保留条件、問題を報告する窓口を決めます。Libera Worksへ相談する場合は、対象業務、入力資料の種類、期待する完成物、失敗例、現在の確認作業を用意してください。入力テンプレートと評価項目を一緒に整理し、小さな試験から見直します。特定の回答例が通ったことだけで、誤りがなくなる、時間が必ず減ると説明しません。

結果を分ける → 工数を記録する → 変更後に再評価 → 確認範囲を残す。本文の確認手順の例。
本文の確認順序を示す図解。
結果を分ける → 工数を記録する → 変更後に再評価 → 確認範囲を残す。本文の確認手順の例。
本文の確認順序を示す図解。

対象業務と確認手順を整理してAI活用を相談する

Libera Worksでは対象業務と入力資料の種類、利用環境、確認担当を伺い、AIの使い方、入力テンプレート、確認項目、講座や定着支援の必要な範囲を整理します。情報の利用許可と料金・対応条件は着手前に確認してください。具体的な業務で試し、結果を見て手順を見直します。

【Q&A】AI活用支援を依頼する前の疑問

Q.読みやすい回答なら合格ですか?

読みやすさと事実の正確性は別です。必須項目、禁止事項、未確認事項の扱いを元資料へ照合します。

Q.一度合格した指示は評価不要ですか?

資料や指示、利用環境が変わった場合は再確認します。以前の試験例と変更理由を残すと比較できます。

まとめ:業務の完成条件から評価項目を選ぶ

使う業務と完成条件を固定し、期待する答えと失敗しやすい入力を用意します。事実、必須項目、禁止事項、確認の手間を別々に記録してください。重大な誤りを平均点で隠さず、採用・修正・保留に分けます。変更後も同じ例で再評価し、人が確認する範囲を運用へ残します。

参考情報

評価表と試験例は編集上の提案です。性能、合格率、工数削減やNISTへの適合を示す実績ではありません。

Libera Works「AI活用支援」(対象業務・利用条件・講座と定着支援の範囲。2026年10月2日確認)

NIST「AI RMF Playbook: Measure」(Measure 1.1と2.1の利用目的に合う測定・許容範囲・試験の記録に関する参考。本文の表は独自の業務整理例。2026年10月2日確認)