モダリティをまたぐグラウンディング
テキスト内で視覚的な根拠を参照します。
「モダリティをまたぐグラウンディング」はCoddyKit上の無料AI Prompt Engineeringレッスンです。 これはレッスン2/4です。 下記で完全なレッスンを無料で読むことができます。その後、ブラウザ内の組み込みコードエディタと24時間対応のAIチューターでハンズオン演習できます。 これはAI Prompt Engineering学習パスの一部であり、ウェブとCoddyKitアプリ全体で進捗が同期されます。 AI Prompt Engineeringコースには全4レッスンが含まれています。
グラウンディングの意味
グラウンディングとは、すべてのテキストによる主張を、別のモダリティにある具体的な証拠まで追跡できるようにすることです。グラウンディングされていないマルチモーダル回答は流暢な推測にすぎません。グラウンディングされた回答は、その主張を裏付けるピクセル(または音声フレーム)への参照を備えた、根拠のある主張です。
- グラウンディングによって、不透明な出力が監査可能な出力になります。
- これは、自信に満ちた視覚的幻覚に対して最も効果的な対策です。
証拠を先に導出する推論順序
結論を出す前に、モデルに証拠を抽出させてください。先に結論を生成すると、「証拠」は、たとえ誤っている可能性がある回答に合うよう後付けで作られた合理化になってしまいます。
観察した領域を最初に、解釈を次に、最終回答を最後に配置するよう、応答を構成してください。
schema = {
'observations': '[{region: str, text_read: str}]',
'inference': 'str — reasoning over observations only',
'answer': 'str'
}
# Order in the prompt enforces order in generation.バウンディングボックスと領域による引用
各視覚的主張について、おおよその正規化座標を出力するようモデルに求めてください。不完全なボックスでも価値があります。後続のシステムで切り抜いて再検証できますし、大きく外れたボックスは幻覚をすぐに露呈させます。
- 解像度に左右されないよう、0..1の範囲で正規化した [x0,y0,x1,y1] を使用してください。
- ボックスは位置特定の手がかりであり、ピクセル単位で完全に正確な検出結果ではないと考えてください。
instruction = (
'For each extracted field, return '
'{"field": str, "value": str, "box": [x0,y0,x1,y1]}. '
'Coordinates normalized 0..1. If you cannot locate it, omit the field.'
)ピクセル引用による検証
画像内に見えるテキストについては、モデルが読み取った内容を逐語的に引用させてください。逐語的な引用は検証可能です。OCRで抜き取り確認できますし、モデルは値を正確に書き起こす必要があるため、値を捏造する可能性が大幅に下がります。
この『読み返させる』制約は低コストでありながら、文書、グラフ、標識に対して非常に効果的です。
モダリティ間の一貫性チェック
同じ事実が2つのモダリティ(スライド画像と、その音声による説明など)に現れる場合は、モデルに相互チェックを行わせてください。一致すれば信頼度が高まり、不一致も表面化させる価値のあるシグナルになります。
- 『図のキャプションは、グラフが示している内容と一致していますか。』
- 『ナレーションは画面上の数値と一致していますか。』
prompt = (
'You have a slide image and its transcript. '
'For each numeric claim, state: value_on_slide, value_in_transcript, agree(bool). '
'Flag any disagreement explicitly.'
)グラウンディングの結果としての拒否
グラウンディングされたシステムは、『見えません』と答えられなければなりません。明示的な逃げ道がないと、モデルは空白をもっともらしい捏造で埋めてしまいます。逃げ道を用意し、それを正しい出力として評価してください。
次のように指示します。『証拠が存在しない、または判読できない場合は、推測せずにNOT_FOUNDを返してください。』そのうえで、パイプライン内でNOT_FOUNDを独立した、ペナルティを受けない出力として扱います。
空間的関係のグラウンディング
『バルブはゲージの左にある』のような関係に関する主張は、物体の存在よりもグラウンディングが困難です。両方の参照対象をそれぞれボックスでグラウンディングさせ、関係を直接主張するのではなく、座標から導出するようモデルに求めてください。
この分解により、壊れやすい関係判断が、2つの単純な位置特定タスクと算術処理に置き換わります。
# Derive relation from grounded boxes, not from vibes
# left_of(a, b) := a.x1 < b.x0
def left_of(a, b):
return a['box'][2] < b['box'][0]音声と時間のグラウンディング
グラウンディングは画像以外にも適用できます。音声や動画では、証拠としてタイムスタンプを要求してください。『これが発言された時点を [mm:ss] で示してください』のように指定します。時間的な参照により、主張を元の区間と照合できます。
- タイムスタンプは、文字起こしや話者分離に関する主張の基準になります。
- 実際に発言された内容から逸脱した要約を明らかにできます。
テキストによる上書きの罠
テキストチャネルにある自信のある主張は、正しい視覚的証拠を抑制することがあります。モデルが与えられた事前情報を優先するためです。コンテキストに『請求書の合計は$400です』と書かれていて、画像には$450と表示されている場合、グラウンディングされていないモデルは$400をそのまま繰り返す可能性があります。
対策として、まず画像だけから導出し、その後で提供されたテキストと比較し、黙って整合させるのではなく不一致を報告するようモデルに指示してください。
下流でのグラウンディング検証
グラウンディングは、それを活用して初めて役に立ちます。構造化された証拠を受け取る検証器を構築してください。
- 各ボックスを再度切り抜き、引用されたテキストを再びOCRにかけます。不一致なら拒否します。
- 指定されたタイムスタンプを、2回目のASR処理にかけます。
- NOT_FOUNDと競合フラグは、人によるレビューに回すためのシグナルとして扱います。
プロンプトが証拠を生成し、システムがそれを強制します。
def verify(field):
crop = image.crop(field['box'])
read = ocr(crop)
return similar(read, field['value']) > 0.9グラウンディング契約のテンプレート
再利用可能なグラウンディング契約には、すべての手法がまとめられています。
- 結論より先に観察を置きます。
- 主張ごとにボックスと逐語的な引用を付けます。
- 推測はせず、NOT_FOUNDを逃げ道として使用します。
- まず画像から導出し、その後で提供されたテキストと照合して競合を報告します。
- 音声や動画に関する主張にはタイムスタンプを付けます。
一度ルール化し、すべてのマルチモーダルタスクで再利用してください。
クイックチェック
コンテキストのメタデータには合計金額が$400と記載されていますが、スキャン画像では異なる可能性があると考えています。
振り返り:モダリティをまたぐグラウンディング
グラウンディングによって、マルチモーダル出力が監査可能になります。具体的には、結論より先に観察を置くこと、主張ごとにボックスと逐語的な引用を付けること、音声や動画にはタイムスタンプを付けること、NOT_FOUNDという逃げ道を用意すること、そして提供されたテキストとの競合を報告する画像優先の導出を行うことです。グラウンディング契約を、切り抜き、再読み取り、フラグのレビュー回付を行う下流の検証器と組み合わせてください。プロンプトに証拠を置き、システムでそれを強制することで、自信に満ちた幻覚を無効化できます。
よくある質問
「モダリティをまたぐグラウンディング」レッスンは無料ですか?
はい。「モダリティをまたぐグラウンディング」の完全なテキストはこのウェブで無料で読めます。インタラクティブに演習し(組み込みコードエディタと24時間対応のAIチューター)、AI Prompt Engineeringコースの残りをアンロックするには、CoddyKit PROにアップグレードしてください。 AI Prompt Engineeringコースには全4レッスンが含まれています。
「モダリティをまたぐグラウンディング」で何を学びますか?
テキスト内で視覚的な根拠を参照します。 ブラウザで直接実行するハンズオンコードでAI Prompt Engineeringを演習し、24時間対応のAIチューターがレッスンを進める中での質問に答えます。
AI Prompt Engineeringを始めるのに経験は必要ですか?
事前経験は必要ありません。CoddyKitのAI Prompt Engineeringは初級者から上級者向けに構成されているため、ここから始めるか最初から始めて、自分のペースで進むことができます。 これはレッスン2/4です。
「モダリティをまたぐグラウンディング」レッスンにはどのくらい時間がかかりますか?
ほとんどのCoddyKitレッスンは約5~10分かかります。各レッスンはコンパクトでインタラクティブなので、着実に進歩し、ウェブとアプリ全体で正確に前回の場所から再開できます。
このAI Prompt Engineeringレッスンでコードを書いて実行できますか?
はい。すべてのAI Prompt Engineeringレッスンに組み込みコードエディタが含まれているため、ブラウザでリアルコードを書いて実行し、即座のAIフィードバックを取得できます。ローカル設定は不要です。
このコースのすべてのレッスン
- テキストと画像の組み合わせ
- モダリティをまたぐグラウンディング
- 音声、テキスト、画像の統合
- マルチモーダル出力の制御