KI-Ausgaben lesen und bewerten
Kriterien zur Beurteilung der Relevanz, Genauigkeit und Vollständigkeit von KI-Antworten
KI-Ausgaben lesen und bewerten ist eine kostenlose AI Prompt Engineering-Lektion auf CoddyKit. Dies ist Lektion 1 von 4. Du kannst die komplette Lektion unten kostenlos lesen – dann übst du sie direkt im Browser mit einem integrierten Code-Editor und einem KI-Tutor rund um die Uhr. Sie ist Teil des AI Prompt Engineering-Lernpfads, und dein Fortschritt wird über Web und CoddyKit-App synchronisiert. Der AI Prompt Engineering-Kurs umfasst insgesamt 4 Lektionen.
Warum Bewertung wichtig ist
Eine KI-Antwort zu erhalten, ist nur die halbe Aufgabe. Die andere Hälfte besteht darin, zu beurteilen, ob diese Antwort tatsächlich gut ist.
Ohne ein klares Bewertungsframework akzeptieren Sie möglicherweise eine ausgefeilt wirkende Antwort, die die falsche Frage beantwortet, oder Sie lehnen eine wirklich nützliche Antwort ab, weil sie nicht so formatiert ist, wie Sie es erwartet haben.
Einen verlässlichen Blick für die Qualität von KI-Ausgaben zu entwickeln, ist eine der praktischsten Fähigkeiten im Prompt Engineering.
Die vier Bewertungskriterien
Wenn Sie eine KI-Antwort lesen, beurteilen Sie sie anhand von vier Dimensionen:
- Relevanz — Hat sie die tatsächlich gestellte Frage beantwortet?
- Genauigkeit — Sind die Informationen sachlich korrekt?
- Vollständigkeit — Deckt sie alle Teile der Anfrage ab?
- Format — Ist sie so strukturiert, wie Sie sie benötigen?
Eine Antwort kann in drei Bereichen gut abschneiden und im vierten versagen. Jedes Kriterium ist unabhängig von den anderen wichtig.
Kriterium 1: Relevanz
Relevanz bedeutet: Hat das Modell tatsächlich die Frage beantwortet, die Sie gestellt haben, oder eine verwandte, aber andere Frage?
Beispiel: Sie fragen „Welche Risiken birgt der Einsatz von LLMs im Gesundheitswesen?“, und das Modell antwortet mit einem allgemeinen Überblick darüber, wie LLMs funktionieren. Die Antwort kann zwar korrekt sein, ist aber nicht relevant – sie geht am eigentlichen Punkt vorbei.
Um die Relevanz zu prüfen, lesen Sie Ihren ursprünglichen Prompt noch einmal und fragen Sie sich: Geht die Antwort direkt auf meine Frage ein?
Kriterium 2: Genauigkeit
Genauigkeit bedeutet: Sind die Fakten, Zahlen und Aussagen in der Antwort korrekt?
KI-Modelle können halluzinieren – sie können Dinge selbstbewusst behaupten, die schlicht falsch sind. Häufige Genauigkeitsprobleme sind:
- Falsche Statistiken oder Datumsangaben
- Falsch zugeschriebene Zitate
- Veraltete Informationen, die als aktuell dargestellt werden
- Erfundene Referenzen oder Quellenangaben
Bei faktischen Themen sollten Sie wichtige Aussagen immer anhand einer vertrauenswürdigen Quelle überprüfen, bevor Sie die Ausgabe verwenden.
Kriterium 3: Vollständigkeit
Vollständigkeit bedeutet: Hat die Antwort alle Teile Ihrer Anfrage abgedeckt?
Wenn Ihr Prompt mehrere Teile enthielt – „Erklären Sie X, nennen Sie drei Beispiele und schlagen Sie einen nächsten Schritt vor“ –, prüfen Sie, ob das Modell auf alle drei Punkte eingegangen ist und nicht nur auf den ersten.
Modelle lassen manchmal den letzten Teil einer mehrteiligen Anfrage aus, insbesondere wenn der Prompt lang ist. Am zuverlässigsten prüfen Sie die Vollständigkeit, indem Sie die Antwort Punkt für Punkt mit Ihrem Prompt vergleichen.
Kriterium 4: Format
Format bedeutet: Ist die Antwort so strukturiert, wie Sie sie benötigen?
Selbst eine vollkommen korrekte und vollständige Antwort kann schwer nutzbar sein, wenn das Format nicht stimmt. Häufige Formatabweichungen sind:
- Fließtext, obwohl Sie Aufzählungspunkte benötigen
- Ein langer Aufsatz, obwohl Sie eine Zusammenfassung benötigen
- Fehlende Überschriften, die die Navigation erleichtern würden
- Code ohne Erklärungen oder Erklärungen ohne Code
Formatprobleme lassen sich oft am einfachsten mit einem Folgeprompt beheben.
Eine einfache Bewertungs-Checkliste
Gehen Sie nach jeder KI-Antwort diese Checkliste im Kopf durch:
- Relevanz: Beantwortet die Antwort meine eigentliche Frage?
- Genauigkeit: Kann ich den Fakten vertrauen? Was müsste ich überprüfen?
- Vollständigkeit: Wurden alle Teile meiner Anfrage abgedeckt?
- Format: Ist die Antwort so strukturiert, dass ich sie verwenden kann?
Wenn ein Kriterium nicht erfüllt ist, wissen Sie genau, welche Art von Folgeprompt Sie schreiben müssen. Jedes Kriterium weist auf eine bestimmte Art der Korrektur hin.
Evaluieren im Code: Eine Antwort bewerten
Sie können in Python einen schlanken Bewertungs-Wrapper erstellen, der eine Antwort anhand jedes Kriteriums bewertet, indem er einen zweiten LLM-Aufruf verwendet:
import openai
client = openai.OpenAI(api_key='sk-...')
def evaluate_response(original_prompt, response_text):
eval_prompt = f'''You are an evaluator. Score the following AI response on a scale of 1-5 for each criterion.
Original prompt: {original_prompt}
AI response: {response_text}
Score each:
- Relevance (1-5): Did it answer the actual question?
- Accuracy (1-5): Are the facts correct? (flag any concerns)
- Completeness (1-5): Did it cover all parts of the request?
- Format (1-5): Is it structured appropriately?
Return your scores as: Relevance: X, Accuracy: X, Completeness: X, Format: X
Then a one-sentence note for any score below 4.'''
result = client.chat.completions.create(
model='gpt-4o-mini',
messages=[{'role': 'user', 'content': eval_prompt}]
)
return result.choices[0].message.contentRelevanzprobleme: Häufige Muster
Relevanzprobleme folgen meist vorhersehbaren Mustern. Wenn Sie diese erkennen, können Sie Ihre Bewertung schneller durchführen:
- Themenabweichung – Das Modell beginnt richtig und wechselt dann zu einem verwandten Thema
- Fragenwechsel – Das Modell beantwortet eine einfachere Version Ihrer Frage
- Übergeneralisierung – Sie fragen nach einem konkreten Fall, aber das Modell beantwortet den allgemeinen Fall
- Ignorieren von Vorgaben – Sie haben einen Kontext angegeben (z. B. „für Anfänger“), aber das Modell ignoriert ihn
Jedes Muster legt eine bestimmte Korrektur in Ihrem Folgeprompt nahe.
Warnsignale für mangelnde Genauigkeit
Auch wenn Sie eine Aussage nicht sofort überprüfen können, deuten bestimmte Signale auf eine geringere Genauigkeit hin:
- Sehr genaue Zahlenangaben ohne Quellenangabe
- Aussagen, die zu praktisch oder perfekt passend wirken
- Verweise auf Studien, Fachartikel oder Bücher mit Titel und Autor
- Datumsangaben und Versionsnummern (diese ändern sich häufig)
- Konkrete rechtliche, medizinische oder finanzielle Angaben
Das sind keine Beweise für einen Fehler. Es handelt sich jedoch um Angaben, die Sie vor der Verwendung der Ausgabe in einem Kontext mit hohen Risiken genauer überprüfen sollten.
Mit Bewertungen bessere Folgeprompts schreiben
Der eigentliche Wert einer Bewertung besteht darin, dass jedes nicht erfüllte Kriterium direkt auf eine bestimmte Art von Folgeprompt hinweist:
- Relevanzproblem → „Sie haben X beantwortet, aber ich habe nach Y gefragt. Bitte konzentrieren Sie sich auf Y.“
- Genauigkeitsbedenken → „Bitte überprüfen Sie die Aussage zu Z noch einmal und nennen Sie die Grundlage dafür.“
- Vollständigkeitsproblem → „Sie sind nicht auf den dritten Teil meiner Frage eingegangen. Bitte ergänzen Sie diesen.“
- Formatproblem → „Formulieren Sie dies als Aufzählungspunkte mit einer einzeiligen Zusammenfassung am Anfang um.“
Bewertung und Folgeprompting funktionieren als Feedbackschleife.
Wissenscheck: Bewertungskriterien
Sie bitten das Modell: „Nennen Sie die fünf wichtigsten Python-Webframeworks und beschreiben Sie jedes in einem Satz.“ Das Modell antwortet mit einem gut geschriebenen Aufsatz über die Geschichte von Python und seinen Aufstieg in der Webentwicklung. Flask und Django werden kurz erwähnt, aber fünf Frameworks werden nicht aufgelistet.
Welches Kriterium erfüllt diese Antwort am deutlichsten nicht?
Rückblick: KI-Ausgaben lesen und bewerten
Gutes Prompting besteht aus zwei Schritten: dem Formulieren des Prompts und dem Bewerten der Antwort.
Die vier Kriterien – Relevanz, Genauigkeit, Vollständigkeit und Format – bieten Ihnen eine systematische Möglichkeit, jede KI-Ausgabe zu beurteilen. Jedes nicht erfüllte Kriterium zeigt Ihnen genau, welche Art von Folgeprompt Sie schreiben sollten.
In der nächsten Lektion üben Sie, Folgeprompts zu schreiben, mit denen Sie bestimmte Arten von Problemen beheben.
Lerne AI Prompt Engineering mit einem KI-Tutor — kostenlos
Schreibe und führe echten Code in deinem Browser aus, bekomme sofortige Hilfe von einem 24/7 KI-Tutor und setze dein Lernen im Web oder in der App fort.
- Kurse
- 53
- Lektionen
- 199
Häufig gestellte Fragen
Ist die Lektion „KI-Ausgaben lesen und bewerten“ kostenlos?
Ja — der vollständige Text von „KI-Ausgaben lesen und bewerten“ ist hier im Web kostenlos zu lesen. Um sie interaktiv zu üben (integrierter Code-Editor und 24/7 KI-Tutor) und den Rest des AI Prompt Engineering-Kurses freizuschalten, upgrade auf CoddyKit PRO. Der AI Prompt Engineering-Kurs umfasst insgesamt 4 Lektionen.
Was lerne ich in „KI-Ausgaben lesen und bewerten“?
Kriterien zur Beurteilung der Relevanz, Genauigkeit und Vollständigkeit von KI-Antworten Du übst AI Prompt Engineering mit praktischem Code, den du direkt im Browser ausführst, und ein 24/7 KI-Tutor beantwortet deine Fragen während du die Lektion bearbeitest.
Brauche ich Erfahrung, um AI Prompt Engineering zu starten?
Keine Vorkenntnisse erforderlich. AI Prompt Engineering auf CoddyKit ist für Anfänger bis fortgeschrittene Lernende strukturiert, sodass du hier starten oder von Anfang an beginnen und in deinem eigenen Tempo voranschreiten kannst. Dies ist Lektion 1 von 4.
Wie lange dauert die Lektion „KI-Ausgaben lesen und bewerten“?
Die meisten CoddyKit-Lektionen dauern etwa 5–10 Minuten. Jede ist kompakt und interaktiv, sodass du stetig Fortschritte machst und genau dort weitermachst, wo du aufgehört hast – im Web und in der App.
Kann ich in dieser AI Prompt Engineering-Lektion Code schreiben und ausführen?
Ja. Jede AI Prompt Engineering-Lektion enthält einen integrierten Code-Editor, sodass du echten Code direkt in deinem Browser schreibst und ausführst und sofort KI-Feedback erhältst — ohne lokale Einrichtung erforderlich.
Alle Lektionen in diesem Kurs
- KI-Ausgaben lesen und bewerten
- Wirksame Folgeprompts schreiben
- Auf vorherigen Antworten aufbauen
- Überarbeiten oder neu beginnen