AI の出力を読み、評価する
AI の応答の関連性、正確性、完全性を判断する基準を学びます。
「AI の出力を読み、評価する」はCoddyKit上の無料AI Prompt Engineeringレッスンです。 これはレッスン1/4です。 下記で完全なレッスンを無料で読むことができます。その後、ブラウザ内の組み込みコードエディタと24時間対応のAIチューターでハンズオン演習できます。 これはAI Prompt Engineering学習パスの一部であり、ウェブとCoddyKitアプリ全体で進捗が同期されます。 AI Prompt Engineeringコースには全4レッスンが含まれています。
評価が重要な理由
AIから回答を得ることは、作業の半分にすぎません。残りの半分は、その回答が本当に良いものかを判断することです。
明確な評価フレームワークがなければ、見栄えはよいものの質問に答えていない回答を受け入れてしまうことがあります。反対に、期待した形式になっていないという理由だけで、本当に役立つ回答を却下することもあります。
AIの出力品質を正確に見極める力を身につけることは、プロンプトエンジニアリングにおける最も実践的なスキルの1つです。
4つの評価基準
AIの回答を読むときは、次の4つの観点で評価してください。
- 関連性 — 実際に尋ねた質問に答えていますか
- 正確性 — 情報は事実として正しいですか
- 完全性 — リクエストのすべての部分を扱っていますか
- 形式 — 必要な形式で構成されていますか
3つの基準で高い評価でも、残りの1つで失敗することがあります。各基準はそれぞれ独立して重要です。
評価基準1:関連性
関連性とは、モデルが実際に尋ねた質問に答えたか、それとも関連はあるものの別の質問に答えたかを確認する基準です。
例として、「医療分野でLLMを利用するリスクは何ですか?」と尋ねたのに、モデルがLLMの仕組みについて一般的な説明を返したとします。その回答は正確かもしれませんが、関連性はありません。質問の要点を外しているためです。
関連性を確認するには、元のプロンプトを読み返し、「回答は私の質問に直接答えているか?」と考えてみてください。
評価基準2:正確性
正確性とは、回答に含まれる事実、数値、主張が正しいかを確認する基準です。
AIモデルはハルシネーションを起こすことがあり、実際には誤っていることを自信たっぷりに述べる場合があります。よくある正確性の問題には、次のようなものがあります。
- 誤った統計や日付
- 出典を誤って atribuir した引用
- 古い情報を最新情報として提示すること
- 架空の参考資料や引用
事実に関する内容では、出力を利用する前に、重要な主張を必ず信頼できる情報源で確認してください。
評価基準3:完全性
完全性とは、回答が依頼した内容のすべての部分を扱っているかを確認する基準です。
プロンプトに「Xを説明し、3つの例を挙げ、次のステップを提案してください」のように複数の依頼が含まれている場合、モデルが最初の依頼だけでなく、3つすべてに答えているかを確認してください。
特にプロンプトが長い場合、モデルは複数の依頼の最後の部分を省略することがあります。プロンプトと回答を項目ごとに照らし合わせて読むことが、完全性を確認する最も確実な方法です。
評価基準4:形式
形式とは、回答が必要な構成になっているかを確認する基準です。
どれほど正確で完全な回答でも、形式が適切でなければ使いにくいことがあります。よくある形式の不一致には、次のようなものがあります。
- 箇条書きが必要なのに文章形式になっている
- 要約が必要なのに長いエッセイになっている
- ナビゲーションに役立つ見出しがない
- 説明のないコード、またはコードのない説明
形式の問題は、多くの場合、追加プロンプトで最も簡単に修正できます。
シンプルな評価チェックリスト
AIの回答を受け取ったら、次のチェックリストを頭の中で確認してください。
- 関連性:実際の質問に答えていますか?
- 正確性:事実を信頼できますか?何を確認する必要がありますか?
- 完全性:依頼した内容のすべての部分を扱っていますか?
- 形式:利用しやすい構成になっていますか?
いずれかの基準を満たしていなければ、どのような追加プロンプトを書けばよいかが明確に分かります。それぞれの基準は、具体的な修正方法を示しています。
コードで評価する:回答をスコアリングする
Pythonでは、2回目のLLM呼び出しを使って各基準に基づき回答を採点する、軽量な評価ラッパーを構築できます。
import openai
client = openai.OpenAI(api_key='sk-...')
def evaluate_response(original_prompt, response_text):
eval_prompt = f'''You are an evaluator. Score the following AI response on a scale of 1-5 for each criterion.
Original prompt: {original_prompt}
AI response: {response_text}
Score each:
- Relevance (1-5): Did it answer the actual question?
- Accuracy (1-5): Are the facts correct? (flag any concerns)
- Completeness (1-5): Did it cover all parts of the request?
- Format (1-5): Is it structured appropriately?
Return your scores as: Relevance: X, Accuracy: X, Completeness: X, Format: X
Then a one-sentence note for any score below 4.'''
result = client.chat.completions.create(
model='gpt-4o-mini',
messages=[{'role': 'user', 'content': eval_prompt}]
)
return result.choices[0].message.content関連性の失敗:よくあるパターン
関連性の失敗には、決まったパターンが見られることが多くあります。パターンを認識できると、評価をすばやく行えます。
- 話題の逸脱 — モデルは最初は正しく答えますが、関連する別の話題へ脱線します
- 質問のすり替え — モデルは質問を簡単にしたり、答えやすくしたりしたものに回答します
- 過度の一般化 — 特定のケースについて尋ねたのに、モデルは一般的なケースについて回答します
- 制約の無視 — 「初心者向け」などの文脈を指定したのに、モデルがそれを無視します
それぞれのパターンから、追加プロンプトで行うべき具体的な修正が分かります。
注意すべき正確性の危険信号
主張をすぐに検証できない場合でも、正確性が低い可能性を示す兆候があります。
- 出典を示さずに非常に具体的な数値を挙げている
- 都合がよすぎたり、質問に完璧に合いすぎたりする主張
- タイトルや著者名を挙げて研究、論文、書籍に言及している
- 日付やバージョン番号(頻繁に変わる情報)
- 法律、医療、金融に関する具体的な内容
これらは誤りの証拠ではありませんが、重大な判断が関わる場面で出力を使う前に、再確認する価値のある項目です。
評価を活用してよりよい追加プロンプトを書く
評価の本当の価値は、基準を満たしていない箇所ごとに、追加プロンプトの種類が直接対応することです。
- 関連性の失敗 → 「Xについて回答していますが、私が尋ねたのはYです。Yに集中してください。」
- 正確性への懸念 → 「Zについての主張を再確認し、根拠を示してください。」
- 完全性の失敗 → 「質問の3つ目の部分に答えていません。そこも追加してください。」
- 形式の失敗 → 「これを箇条書きに書き直し、冒頭に1行の要約を付けてください。」
評価と追加プロンプトは、フィードバックループとして機能します。
理解度チェック:評価基準
モデルに「Pythonの主要なWebフレームワークを上位5つ挙げ、それぞれを1文で説明してください。」と尋ねたとします。モデルは、Pythonの歴史とWeb開発における発展についてよく書かれたエッセイを返し、FlaskとDjangoには少し触れていますが、5つのフレームワークを列挙していません。
この回答が最も重大に満たしていない基準はどれですか?
振り返り:AI出力の読み方と評価
優れたプロンプト作成は、プロンプトを作成することと、回答を評価することの2段階で行います。
4つの基準である関連性、正確性、完全性、形式を使うと、あらゆるAI出力を体系的に評価できます。満たされていない基準ごとに、どのような追加プロンプトを書けばよいかが明確に分かります。
次のレッスンでは、特定の失敗を修正するための追加プロンプトを書く練習をします。
よくある質問
「AI の出力を読み、評価する」レッスンは無料ですか?
はい。「AI の出力を読み、評価する」の完全なテキストはこのウェブで無料で読めます。インタラクティブに演習し(組み込みコードエディタと24時間対応のAIチューター)、AI Prompt Engineeringコースの残りをアンロックするには、CoddyKit PROにアップグレードしてください。 AI Prompt Engineeringコースには全4レッスンが含まれています。
「AI の出力を読み、評価する」で何を学びますか?
AI の応答の関連性、正確性、完全性を判断する基準を学びます。 ブラウザで直接実行するハンズオンコードでAI Prompt Engineeringを演習し、24時間対応のAIチューターがレッスンを進める中での質問に答えます。
AI Prompt Engineeringを始めるのに経験は必要ですか?
事前経験は必要ありません。CoddyKitのAI Prompt Engineeringは初級者から上級者向けに構成されているため、ここから始めるか最初から始めて、自分のペースで進むことができます。 これはレッスン1/4です。
「AI の出力を読み、評価する」レッスンにはどのくらい時間がかかりますか?
ほとんどのCoddyKitレッスンは約5~10分かかります。各レッスンはコンパクトでインタラクティブなので、着実に進歩し、ウェブとアプリ全体で正確に前回の場所から再開できます。
このAI Prompt Engineeringレッスンでコードを書いて実行できますか?
はい。すべてのAI Prompt Engineeringレッスンに組み込みコードエディタが含まれているため、ブラウザでリアルコードを書いて実行し、即座のAIフィードバックを取得できます。ローカル設定は不要です。
このコースのすべてのレッスン
- AI の出力を読み、評価する
- 効果的なフォローアッププロンプトを書く
- 過去の応答を踏まえて発展させる
- 改善を続けるか、新しく始めるか