0Pricing
AI Agents · Lektion

Getunte Modelle mit dem Basismodell vergleichen

Vergleichen Sie das Modell auf Ihrem Evaluationsdatensatz per A/B-Test mit dem Basismodell — manchmal schadet Fine-Tuning mehr, als es nützt.

Getunte Modelle mit dem Basismodell vergleichen ist eine kostenlose AI Agents-Lektion auf CoddyKit. Dies ist Lektion 4 von 4. Du kannst die komplette Lektion unten kostenlos lesen – dann übst du sie direkt im Browser mit einem integrierten Code-Editor und einem KI-Tutor rund um die Uhr. Sie ist Teil des AI Agents-Lernpfads, und dein Fortschritt wird über Web und CoddyKit-App synchronisiert. Der AI Agents-Kurs umfasst insgesamt 4 Lektionen.

Teile dieser Lektion wurden noch nicht übersetzt und werden auf Englisch angezeigt.

Vertrauen Sie nicht auf den Trainingsverlust

Ein niedriger Trainingsverlust bedeutet nicht, dass das Modell in der Produktion besser ist. Das Modell kann überfitten, allgemeine Fähigkeiten verlieren oder bei unbekannten Aufgaben schlechter abschneiden.

Evaluieren Sie das getunte Modell immer anhand eines zurückgehaltenen Eval-Sets.

Drei unverzichtbare Eval-Splits

  1. Training – beim Fine-Tuning verwendet
  2. Validierung – zur Auswahl des besten Checkpoints verwendet
  3. Test – während des Trainings nie gesehen; NUR für die abschließende Evaluation

A/B Against Base

results_base = run_eval(base_model, eval_set)
results_tuned = run_eval(tuned_model, eval_set)
print(f'Base: {results_base.score}')
print(f'Tuned: {results_tuned.score}')
print(f'Delta: {results_tuned.score - results_base.score:+.2f}')

Achten Sie auf katastrophales Vergessen

Fine-Tuning mit eng gefassten Daten kann das Modell bei ANDEREN Aufgaben schlechter machen. Testen Sie zusätzlich anhand eines breit gefassten Eval-Sets – nicht nur anhand Ihrer neuen Spezialisierung.

Berichte pro Kategorie

Markieren Sie Ihr Eval-Set und berichten Sie die Ergebnisse pro Kategorie:

Category 'extraction': base 0.78 -> tuned 0.91  (+0.13)
Category 'reasoning':  base 0.85 -> tuned 0.78  (-0.07)   <-- regression
Category 'chat':       base 0.82 -> tuned 0.83  (+0.01)

Kalibrierung

Getunte Modelle werden oft übermäßig selbstsicher. Vergleichen Sie die vorhergesagte mit der tatsächlichen Wahrscheinlichkeit für eine korrekte Antwort – kalibrieren Sie das Modell bei Bedarf.

Drift bei Länge und Stil

Getunte Modelle driften in Richtung der Trainingsverteilung. Wenn die Trainingsdaten kürzer sind, werden auch die Ausgaben kürzer. Manchmal ist das wünschenswert, manchmal nicht.

A/B-Test in der Praxis

Führen Sie zusätzlich zu Offline-Evaluationen A/B-Tests in der Produktion durch:

if user.bucket == 'tuned':
    response = tuned_model.run(...)
else:
    response = base_model.run(...)

log_metric('thumbs_up', response.feedback)

Qualität und Kosten vergleichen

Das getunte Modell ist möglicherweise kleiner und günstiger. Gesamtes Verhältnis von Kosten und Qualität:

  • Basis: GPT-4o: X $ pro Aufruf, Qualität Y
  • Getuntes Llama 8B (selbst gehostet): X/10 $ pro Aufruf, Qualität 0,9Y
  • Wahrscheinlich die bessere Wahl, wenn Y hoch genug bleibt

Verdeckte Fehlerbilder

Probieren Sie adversariale Eingaben aus:

  • Prompts, die versuchen, Schutzmechanismen zu umgehen
  • Eingaben außerhalb der Verteilung
  • Prompts für Randfälle

Manchmal schwächen Fine-Tunings die Sicherheit. Überprüfen Sie das vor dem Deployment.

Einschränkung bei LLM-as-Judge

Wenn Sie einen LLM-Judge verwenden, nehmen Sie eine ANDERE Modellfamilie als für Ihr getuntes Modell. Andernfalls vergibt der Judge voreingenommene, zu hohe Bewertungen.

Wann Sie den Datensatz iterieren sollten

Wenn die Evaluation Regressionen in bestimmten Kategorien zeigt:

  1. Finden Sie ähnliche Beispiele in Produktions-Traces
  2. Fügen Sie sie zum Trainingsset hinzu
  3. Trainieren Sie das Modell erneut
  4. Evaluieren Sie es erneut

Zurückrollen ist in Ordnung

Wenn das Fine-Tuning schlechter abschneidet, verwerfen Sie es und versuchen Sie es erneut. Bereits entstandene Kosten sind kein Grund, ein schlechteres Modell auszuliefern.

Katastrophales Vergessen

Was bedeutet katastrophales Vergessen beim Fine-Tuning?

Zusammenfassung

Evaluieren Sie das getunte Modell anhand IHRES Gold-Sets gegen das Basismodell. Achten Sie auf Regressionen pro Kategorie. Führen Sie A/B-Tests in der Produktion durch. Rollen Sie zurück, wenn das Modell schlechter abschneidet; iterieren Sie den Datensatz, wenn es nur teilweise überzeugt.

Häufig gestellte Fragen

Ist die Lektion „Getunte Modelle mit dem Basismodell vergleichen“ kostenlos?

Ja — der vollständige Text von „Getunte Modelle mit dem Basismodell vergleichen“ ist hier im Web kostenlos zu lesen. Um sie interaktiv zu üben (integrierter Code-Editor und 24/7 KI-Tutor) und den Rest des AI Agents-Kurses freizuschalten, upgrade auf CoddyKit PRO. Der AI Agents-Kurs umfasst insgesamt 4 Lektionen.

Was lerne ich in „Getunte Modelle mit dem Basismodell vergleichen“?

Vergleichen Sie das Modell auf Ihrem Evaluationsdatensatz per A/B-Test mit dem Basismodell — manchmal schadet Fine-Tuning mehr, als es nützt. Du übst AI Agents mit praktischem Code, den du direkt im Browser ausführst, und ein 24/7 KI-Tutor beantwortet deine Fragen während du die Lektion bearbeitest.

Brauche ich Erfahrung, um AI Agents zu starten?

Keine Vorkenntnisse erforderlich. AI Agents auf CoddyKit ist für Anfänger bis fortgeschrittene Lernende strukturiert, sodass du hier starten oder von Anfang an beginnen und in deinem eigenen Tempo voranschreiten kannst. Dies ist Lektion 4 von 4.

Wie lange dauert die Lektion „Getunte Modelle mit dem Basismodell vergleichen“?

Die meisten CoddyKit-Lektionen dauern etwa 5–10 Minuten. Jede ist kompakt und interaktiv, sodass du stetig Fortschritte machst und genau dort weitermachst, wo du aufgehört hast – im Web und in der App.

Kann ich in dieser AI Agents-Lektion Code schreiben und ausführen?

Ja. Jede AI Agents-Lektion enthält einen integrierten Code-Editor, sodass du echten Code direkt in deinem Browser schreibst und ausführst und sofort KI-Feedback erhältst — ohne lokale Einrichtung erforderlich.

Alle Lektionen in diesem Kurs

  1. Wann Fine-Tuning besser ist als Prompting
  2. Datensammlung: Trajektorien und Trace-Replay
  3. LoRA und QLoRA für kostengünstiges Tuning
  4. Getunte Modelle mit dem Basismodell vergleichen
← Zurück zu AI Agents