チューニング済みモデルとベースモデルの評価
評価セットでベースモデルとA/B比較します — ファインチューニングが改善よりも悪化を招く場合もあります。
「チューニング済みモデルとベースモデルの評価」はCoddyKit上の無料AI Agentsレッスンです。 これはレッスン4/4です。 下記で完全なレッスンを無料で読むことができます。その後、ブラウザ内の組み込みコードエディタと24時間対応のAIチューターでハンズオン演習できます。 これはAI Agents学習パスの一部であり、ウェブとCoddyKitアプリ全体で進捗が同期されます。 AI Agentsコースには全4レッスンが含まれています。
このレッスンの一部はまだ翻訳されておらず、英語で表示されています。
トレーニング損失を過信しない
トレーニング損失が低くても、本番環境で優れているとは限りません。モデルが過学習したり、汎用的な能力を失ったり、未知のタスクに悪影響を及ぼしたりする可能性があります。
必ず、チューニング済みモデルを未使用の評価セットで評価してください。
必須の3つの評価分割
- トレーニング — ファインチューニングに使用します
- 検証 — 最適なチェックポイントの選択に使用します
- テスト — トレーニング中には一度も使用せず、最終評価にのみ使用します
A/B Against Base
results_base = run_eval(base_model, eval_set)
results_tuned = run_eval(tuned_model, eval_set)
print(f'Base: {results_base.score}')
print(f'Tuned: {results_tuned.score}')
print(f'Delta: {results_tuned.score - results_base.score:+.2f}')壊滅的忘却に注意する
限定的なデータでファインチューニングすると、モデルが他のタスクで不得意になることがあります。新しい専門分野だけでなく、幅広い評価セットでもテストしてください。
カテゴリ別レポート
評価セットにタグを付け、カテゴリごとにスコアを報告します。
Category 'extraction': base 0.78 -> tuned 0.91 (+0.13)
Category 'reasoning': base 0.85 -> tuned 0.78 (-0.07) <-- regression
Category 'chat': base 0.82 -> tuned 0.83 (+0.01)キャリブレーション
チューニング済みモデルは、過度に自信を持つようになることがあります。正解する確率の予測値と実際の確率を比較し、必要に応じてキャリブレーションしてください。
長さとスタイルのドリフト
チューニング済みモデルは、トレーニングデータの分布に近づくように変化します。トレーニングデータが短ければ、出力も短くなります。望ましい場合もあれば、そうでない場合もあります。
実環境でのA/Bテスト
オフライン評価に加えて、本番環境でもA/Bテストを行います。
if user.bucket == 'tuned':
response = tuned_model.run(...)
else:
response = base_model.run(...)
log_metric('thumbs_up', response.feedback)品質とコストの比較
チューニング済みモデルは、より小型で低コストになる可能性があります。コストと品質の合計を比較します。
- ベースのGPT-4o:1回の呼び出しにつき$X、品質Y
- チューニング済みLlama 8B(セルフホスト):1回の呼び出しにつき$X/10、品質0.9Y
- Yが十分に高く保たれるなら、おそらくこちらが優位です
隠れた失敗要因
敵対的な入力を試してください。
- ガードレールの回避を試みるプロンプト
- 分布外の入力
- エッジケースのプロンプト
ファインチューニングによって安全性が弱まることもあるため、リリース前に検証してください。
LLM-as-Judgeの注意点
LLMを評価者として使う場合は、チューニング済みモデルとは異なるモデルファミリーを使用してください。同じモデルファミリーを使うと、評価者が偏って高いスコアを付けてしまいます。
データセットを反復改善するタイミング
評価によって特定のカテゴリの性能低下が分かった場合:
- 本番トレースから類似の例を見つける
- それらをトレーニングセットに追加する
- 再トレーニングする
- 再評価する
ロールバックしてもよい
チューニングの性能が下回った場合は、破棄して再度試してください。埋没費用は、より悪いモデルをリリースする理由にはなりません。
壊滅的忘却
ファインチューニングにおける壊滅的忘却とは何でしょうか。
まとめ
ご自身の正解データセットで、チューニング済みモデルをベースモデルと比較して評価します。カテゴリごとの性能低下に注意してください。本番環境でA/Bテストを行い、性能が失われたらロールバックします。一部しか改善しなければ、データセットを反復改善してください。
AI チューターと学ぶ AI Agents — 無料
ブラウザでリアルコードを書いて実行し、24/7 の AI チューターから瞬時にサポートを受け、ウェブまたはアプリで続きから学習できます。
- コース
- 60
- レッスン
- 239
よくある質問
「チューニング済みモデルとベースモデルの評価」レッスンは無料ですか?
はい。「チューニング済みモデルとベースモデルの評価」の完全なテキストはこのウェブで無料で読めます。インタラクティブに演習し(組み込みコードエディタと24時間対応のAIチューター)、AI Agentsコースの残りをアンロックするには、CoddyKit PROにアップグレードしてください。 AI Agentsコースには全4レッスンが含まれています。
「チューニング済みモデルとベースモデルの評価」で何を学びますか?
評価セットでベースモデルとA/B比較します — ファインチューニングが改善よりも悪化を招く場合もあります。 ブラウザで直接実行するハンズオンコードでAI Agentsを演習し、24時間対応のAIチューターがレッスンを進める中での質問に答えます。
AI Agentsを始めるのに経験は必要ですか?
事前経験は必要ありません。CoddyKitのAI Agentsは初級者から上級者向けに構成されているため、ここから始めるか最初から始めて、自分のペースで進むことができます。 これはレッスン4/4です。
「チューニング済みモデルとベースモデルの評価」レッスンにはどのくらい時間がかかりますか?
ほとんどのCoddyKitレッスンは約5~10分かかります。各レッスンはコンパクトでインタラクティブなので、着実に進歩し、ウェブとアプリ全体で正確に前回の場所から再開できます。
このAI Agentsレッスンでコードを書いて実行できますか?
はい。すべてのAI Agentsレッスンに組み込みコードエディタが含まれているため、ブラウザでリアルコードを書いて実行し、即座のAIフィードバックを取得できます。ローカル設定は不要です。
このコースのすべてのレッスン
- プロンプトよりファインチューニングが有効な場合
- データ収集:軌跡とトレースの再生
- コスト効率の高いチューニングのためのLoRAとQLoRA
- チューニング済みモデルとベースモデルの評価