0Pricing
AI Prompt Engineering · レッスン

音声、テキスト、画像の統合

複数の入力を連携させます。

「音声、テキスト、画像の統合」はCoddyKit上の無料AI Prompt Engineeringレッスンです。 これはレッスン3/4です。 下記で完全なレッスンを無料で読むことができます。その後、ブラウザ内の組み込みコードエディタと24時間対応のAIチューターでハンズオン演習できます。 これはAI Prompt Engineering学習パスの一部であり、ウェブとCoddyKitアプリ全体で進捗が同期されます。 AI Prompt Engineeringコースには全4レッスンが含まれています。

3つのチャネル、1つのコンテキスト

音声、テキスト、視覚を連携させるには、3つの入力ストリームを1つの一貫したコンテキストにまとめる必要があります。各モダリティには異なるトークンコスト、情報の忠実度、失敗モードがあります。それでもモデルは、それらを1つのアテンション空間に融合します。

  • 音声:時間的で順序性があり、圧縮によって情報が失われます。
  • 視覚:空間的で、タイル予算の制約を受け、細部に弱い性質があります。
  • テキスト:正確で低コストですが、他のモダリティを上書きする可能性があります。

重要なのは、各モダリティが他をかき消すのではなく、互いに補強するよう順序付けることです。

モダリティの混在ではなく役割の明確化

プロンプト内で各入力に明確な役割を割り当ててください。どのチャネルを正しい情報源とするかが曖昧だと、実行するたびに回答が一貫しなくなります。

  • 視覚 = 表示されている内容の正解情報
  • 音声の文字起こし = それについて発言された内容
  • テキストの指示 = タスクの契約と優先順位のルール

最初に役割を明示し、競合時にどの情報源を優先するかをモデルに知らせてください。

header = (
  'INPUTS: (1) a video frame [authoritative for visible state], '
  '(2) an audio transcript [authoritative for spoken intent], '
  '(3) this instruction [defines the task]. '
  'On conflict, prefer the frame for state and the transcript for intent.'
)

音声とフレームのアラインメント

音声と視覚情報は時間的に整列させる必要があります。そうしないと、モデルは誤った言葉を誤った画像に関連付けてしまいます。明示的なアラインメントを提供してください。文字起こしとフレームの両方にタイムスタンプを付け、時刻をキーにモデルが対応付けられるようにします。

アラインメントのメタデータがない場合、モデルは対応関係を推測します。大まかなタスクなら問題ありませんが、同期分析では致命的です。

payload = {
  'frames': [{'t': 0.0, 'image': f0}, {'t': 2.5, 'image': f1}],
  'transcript': [
    {'start': 0.0, 'end': 2.4, 'text': 'Now I tighten the bolt.'},
    {'start': 2.5, 'end': 5.0, 'text': 'It is fully seated.'}
  ]
}

事前文字起こしか生音声か

ネイティブ音声モデルに生音声を渡すことも、専用のASRステップで事前に文字起こしを行い、そのテキストを渡すこともできます。それぞれにトレードオフがあります。

  • 生音声:韻律、声の調子、重なった発話を保持できますが、より多くのトークンを消費し、グラウンディングも困難になります。
  • 事前に文字起こししたテキスト:低コストで、タイムスタンプによる引用が可能ですが、非語彙的な手がかり(皮肉、緊急性など)は失われます。

タスクに応じて選択してください。感情や意図の分析には生音声、事実の抽出には文字起こしを使用します。

交互配置の順序

チャネルを配置する順序によって、アテンションの向きが変わります。分析タスクでは、次の順序が堅牢なデフォルトです。

  1. タスクの契約と役割(テキスト)。
  2. 視覚的証拠(フレーム)。それぞれにラベルとタイムスタンプを付けます。
  3. 音声の文字起こし。タイムスタンプを付けます。
  4. 具体的な質問(テキスト)。ラベルと時刻を参照します。

質問を最後に置くと、それまでにエンコードされたすべての情報にアテンションを向けられます。

トークン予算のトリアージ

1つのコンテキストウィンドウを3つのチャネルで奪い合います。コストが最も大きいのは映像で、次に大きいのが未圧縮音声です。送信前にトリアージします。

  • すべてのフレームではなく、タスクに必要な頻度でフレームをサンプリングします。
  • フレームをアクションが起きている領域にクロップします。
  • 音声を関連する区間に分割し、無音部分を除外します。

答えが存在する場所に予算を使います。

def select_frames(frames, fps_target, src_fps):
    step = max(1, round(src_fps / fps_target))
    return frames[::step]

クロスモーダル相互検証

マルチ入力プロンプティングの最大の効果は相互検証です。同じ事実を2つのチャネルから独立して導き出せる場合、一致は強い証拠となり、不一致は危険信号となります。

1つに融合した答えにまとめて信頼した情報源を隠すのではなく、各チャネルからそれぞれ重要な事実を導き出し、一致しているかを報告するようモデルに指示します。

ask = (
  'For each claim report: from_vision, from_audio, agree(bool). '
  'If only one channel supports it, say which and lower confidence.'
)

欠落または劣化したチャネルへの対処

現実の入力は劣化します。音がこもったクリップ、ぼやけたフレーム、途中で切れた文字起こしなどです。欠落したチャネルについてモデルが勝手に作り話をするのではなく、不完全な証拠でどう進めるかを指示します。

  • 'ある区間で音声が聞き取れない場合は、[INAUDIBLE] と記録してください。'
  • 'フレームがぼやけすぎて読み取れない場合は、そのフィールドに NOT_LEGIBLE を返してください。'

何も言わずに創作するより、適切に劣化させるほうが優れています。

話者とオブジェクトの共参照

難しいマルチモーダルタスクでは、誰が話しているか(音声の話者ダイアライゼーション)と、誰が映っているか(映像)を関連付ける必要があります。共参照を明示し、タイミングと、唇の動きやジェスチャーなどの視覚的な手がかりを使って、話者ラベルを画面上の人物に対応付けるようモデルに求めます。

各対応付けについて、タイムスタンプと視覚的な手がかりの両方で根拠を示すよう要求します。

binding = {
  'speaker': 'S1', 'person_box': [0.1,0.2,0.4,0.9],
  'evidence': 'lips move during 3.2-4.1s; gestures while speaking'
}

出力:融合されていても追跡可能な回答

最終回答は読みやすさのために融合しつつ、その下層ではチャネルごとの追跡可能性を維持する必要があります。構造化オブジェクトとして、統合した結論に加え、各モダリティを裏付ける証拠とそのタイムスタンプまたはボックスを出力します。

これにより、人間は便利な要約を受け入れながら、個々の主張を元のチャネルまでさかのぼって監査できます。

out = {
  'summary': 'The technician seated the bolt correctly.',
  'evidence': [
    {'modality': 'vision', 'box': [0.3,0.4,0.6,0.7], 't': 2.5},
    {'modality': 'audio', 'quote': 'It is fully seated.', 't': 3.0}
  ]
}

オーケストレーションのチェックリスト

3モーダルの呼び出しを行う前に、次の項目を確認します。

  • 役割と優先順位が明記されている。
  • フレームと文字起こしにタイムスタンプが付いており、位置が揃っている。
  • 予算に収まるよう各チャネルがトリアージされている。
  • 相互検証と不一致のフラグ付けが要求されている。
  • 劣化を示すトークン(INAUDIBLE、NOT_LEGIBLE)が定義されている。
  • 出力が融合されているが、証拠を追跡できる。

各項目は、マルチ入力融合における特定の障害要因を1つ解消します。

クイックチェック

チュートリアル動画を分析しており、各ステップでナレーターの発言が画面上のアクションと一致しているかを確認する必要があります。

まとめ:複数の入力の調整

3モーダルプロンプティングは、チャネルの役割と優先順位を明示し、タイムスタンプで音声とフレームを揃え、予算に収まるよう各チャネルをトリアージし、欠落した証拠には劣化トークンを使いながらチャネルごとの相互検証を要求すると成功します。韻律が重要かどうかで、生音声を使うか事前に文字起こしするかを決めます。すべての主張をボックスまたはタイムスタンプまで追跡できる融合要約を提供します。読みやすく、監査も可能な形式です。

よくある質問

「音声、テキスト、画像の統合」レッスンは無料ですか?

はい。「音声、テキスト、画像の統合」の完全なテキストはこのウェブで無料で読めます。インタラクティブに演習し(組み込みコードエディタと24時間対応のAIチューター)、AI Prompt Engineeringコースの残りをアンロックするには、CoddyKit PROにアップグレードしてください。 AI Prompt Engineeringコースには全4レッスンが含まれています。

「音声、テキスト、画像の統合」で何を学びますか?

複数の入力を連携させます。 ブラウザで直接実行するハンズオンコードでAI Prompt Engineeringを演習し、24時間対応のAIチューターがレッスンを進める中での質問に答えます。

AI Prompt Engineeringを始めるのに経験は必要ですか?

事前経験は必要ありません。CoddyKitのAI Prompt Engineeringは初級者から上級者向けに構成されているため、ここから始めるか最初から始めて、自分のペースで進むことができます。 これはレッスン3/4です。

「音声、テキスト、画像の統合」レッスンにはどのくらい時間がかかりますか?

ほとんどのCoddyKitレッスンは約5~10分かかります。各レッスンはコンパクトでインタラクティブなので、着実に進歩し、ウェブとアプリ全体で正確に前回の場所から再開できます。

このAI Prompt Engineeringレッスンでコードを書いて実行できますか?

はい。すべてのAI Prompt Engineeringレッスンに組み込みコードエディタが含まれているため、ブラウザでリアルコードを書いて実行し、即座のAIフィードバックを取得できます。ローカル設定は不要です。

このコースのすべてのレッスン

  1. テキストと画像の組み合わせ
  2. モダリティをまたぐグラウンディング
  3. 音声、テキスト、画像の統合
  4. マルチモーダル出力の制御
← AI Prompt Engineeringに戻る