AI Agents · レッスン

チューニング済みモデルとベースモデルの評価

評価セットでベースモデルとA/B比較します — ファインチューニングが改善よりも悪化を招く場合もあります。

レッスン 4/415 ステップ

「チューニング済みモデルとベースモデルの評価」はCoddyKit上の無料AI Agentsレッスンです。 これはレッスン4/4です。 下記で完全なレッスンを無料で読むことができます。その後、ブラウザ内の組み込みコードエディタと24時間対応のAIチューターでハンズオン演習できます。 これはAI Agents学習パスの一部であり、ウェブとCoddyKitアプリ全体で進捗が同期されます。 AI Agentsコースには全4レッスンが含まれています。

このレッスンの一部はまだ翻訳されておらず、英語で表示されています。

トレーニング損失を過信しない

トレーニング損失が低くても、本番環境で優れているとは限りません。モデルが過学習したり、汎用的な能力を失ったり、未知のタスクに悪影響を及ぼしたりする可能性があります。

必ず、チューニング済みモデルを未使用の評価セットで評価してください。

必須の3つの評価分割

  1. トレーニング — ファインチューニングに使用します
  2. 検証 — 最適なチェックポイントの選択に使用します
  3. テスト — トレーニング中には一度も使用せず、最終評価にのみ使用します

A/B Against Base

results_base = run_eval(base_model, eval_set)
results_tuned = run_eval(tuned_model, eval_set)
print(f'Base: {results_base.score}')
print(f'Tuned: {results_tuned.score}')
print(f'Delta: {results_tuned.score - results_base.score:+.2f}')

壊滅的忘却に注意する

限定的なデータでファインチューニングすると、モデルが他のタスクで不得意になることがあります。新しい専門分野だけでなく、幅広い評価セットでもテストしてください。

カテゴリ別レポート

評価セットにタグを付け、カテゴリごとにスコアを報告します。

Category 'extraction': base 0.78 -> tuned 0.91  (+0.13)
Category 'reasoning':  base 0.85 -> tuned 0.78  (-0.07)   <-- regression
Category 'chat':       base 0.82 -> tuned 0.83  (+0.01)

キャリブレーション

チューニング済みモデルは、過度に自信を持つようになることがあります。正解する確率の予測値と実際の確率を比較し、必要に応じてキャリブレーションしてください。

長さとスタイルのドリフト

チューニング済みモデルは、トレーニングデータの分布に近づくように変化します。トレーニングデータが短ければ、出力も短くなります。望ましい場合もあれば、そうでない場合もあります。

実環境でのA/Bテスト

オフライン評価に加えて、本番環境でもA/Bテストを行います。

if user.bucket == 'tuned':
    response = tuned_model.run(...)
else:
    response = base_model.run(...)

log_metric('thumbs_up', response.feedback)

品質とコストの比較

チューニング済みモデルは、より小型で低コストになる可能性があります。コストと品質の合計を比較します。

  • ベースのGPT-4o:1回の呼び出しにつき$X、品質Y
  • チューニング済みLlama 8B(セルフホスト):1回の呼び出しにつき$X/10、品質0.9Y
  • Yが十分に高く保たれるなら、おそらくこちらが優位です

隠れた失敗要因

敵対的な入力を試してください。

  • ガードレールの回避を試みるプロンプト
  • 分布外の入力
  • エッジケースのプロンプト

ファインチューニングによって安全性が弱まることもあるため、リリース前に検証してください。

LLM-as-Judgeの注意点

LLMを評価者として使う場合は、チューニング済みモデルとは異なるモデルファミリーを使用してください。同じモデルファミリーを使うと、評価者が偏って高いスコアを付けてしまいます。

データセットを反復改善するタイミング

評価によって特定のカテゴリの性能低下が分かった場合:

  1. 本番トレースから類似の例を見つける
  2. それらをトレーニングセットに追加する
  3. 再トレーニングする
  4. 再評価する

ロールバックしてもよい

チューニングの性能が下回った場合は、破棄して再度試してください。埋没費用は、より悪いモデルをリリースする理由にはなりません。

壊滅的忘却

ファインチューニングにおける壊滅的忘却とは何でしょうか。

まとめ

ご自身の正解データセットで、チューニング済みモデルをベースモデルと比較して評価します。カテゴリごとの性能低下に注意してください。本番環境でA/Bテストを行い、性能が失われたらロールバックします。一部しか改善しなければ、データセットを反復改善してください。

無料で開始

AI チューターと学ぶ AI Agents — 無料

ブラウザでリアルコードを書いて実行し、24/7 の AI チューターから瞬時にサポートを受け、ウェブまたはアプリで続きから学習できます。

コース
60
レッスン
239

よくある質問

「チューニング済みモデルとベースモデルの評価」レッスンは無料ですか?

はい。「チューニング済みモデルとベースモデルの評価」の完全なテキストはこのウェブで無料で読めます。インタラクティブに演習し(組み込みコードエディタと24時間対応のAIチューター)、AI Agentsコースの残りをアンロックするには、CoddyKit PROにアップグレードしてください。 AI Agentsコースには全4レッスンが含まれています。

「チューニング済みモデルとベースモデルの評価」で何を学びますか?

評価セットでベースモデルとA/B比較します — ファインチューニングが改善よりも悪化を招く場合もあります。 ブラウザで直接実行するハンズオンコードでAI Agentsを演習し、24時間対応のAIチューターがレッスンを進める中での質問に答えます。

AI Agentsを始めるのに経験は必要ですか?

事前経験は必要ありません。CoddyKitのAI Agentsは初級者から上級者向けに構成されているため、ここから始めるか最初から始めて、自分のペースで進むことができます。 これはレッスン4/4です。

「チューニング済みモデルとベースモデルの評価」レッスンにはどのくらい時間がかかりますか?

ほとんどのCoddyKitレッスンは約5~10分かかります。各レッスンはコンパクトでインタラクティブなので、着実に進歩し、ウェブとアプリ全体で正確に前回の場所から再開できます。

このAI Agentsレッスンでコードを書いて実行できますか?

はい。すべてのAI Agentsレッスンに組み込みコードエディタが含まれているため、ブラウザでリアルコードを書いて実行し、即座のAIフィードバックを取得できます。ローカル設定は不要です。

このコースのすべてのレッスン

  1. プロンプトよりファインチューニングが有効な場合
  2. データ収集:軌跡とトレースの再生
  3. コスト効率の高いチューニングのためのLoRAとQLoRA
  4. チューニング済みモデルとベースモデルの評価
← AI Agentsに戻る