Selbstverbessernde Prompt-Systeme
Schleifen aus Feedback → Kritik → Neufassung, die Prompts automatisch optimieren.
Selbstverbessernde Prompt-Systeme ist eine kostenlose AI Prompt Engineering-Lektion auf CoddyKit. Dies ist Lektion 3 von 4. Du kannst die komplette Lektion unten kostenlos lesen – dann übst du sie direkt im Browser mit einem integrierten Code-Editor und einem KI-Tutor rund um die Uhr. Sie ist Teil des AI Prompt Engineering-Lernpfads, und dein Fortschritt wird über Web und CoddyKit-App synchronisiert. Der AI Prompt Engineering-Kurs umfasst insgesamt 4 Lektionen.
Die Selbstverbesserungsschleife
Ein sich selbst verbesserndes Prompt-System erzeugt eine Feedbackschleife: Führen Sie den Prompt anhand von Testfällen aus, bewerten Sie die Ausgaben, kritisieren Sie den Prompt, schreiben Sie ihn neu und wiederholen Sie den Vorgang. Jede Iteration sollte messbar bessere Ergebnisse liefern. Dabei handelt es sich um eine automatisierte Prompt-Optimierung, bei der nicht in jeder Schleife ein Mensch eingreifen muss.
Überblick über die Schleifenarchitektur
Die Selbstverbesserungsschleife besteht aus fünf Komponenten: Executor (führt den Prompt aus), Evaluator (bewertet Ausgaben), Critic (ermittelt Schwächen des Prompts), Rewriter (verbessert den Prompt) und History (verfolgt alle Iterationen). Jede Komponente wird als LLM-Aufruf implementiert.
import anthropic
client = anthropic.Anthropic(api_key='YOUR_API_KEY')
class SelfImprovingPromptSystem:
def __init__(self, initial_prompt, test_cases, eval_fn, max_iterations=5):
self.current_prompt = initial_prompt
self.test_cases = test_cases
self.eval_fn = eval_fn
self.max_iterations = max_iterations
self.history = [] # [(iteration, prompt, score, critique)]
def run(self):
for i in range(self.max_iterations):
print(f'=== Iteration {i+1}/{self.max_iterations} ===')
score = self._evaluate_prompt()
print(f'Score: {score:.2f}')
self.history.append((i, self.current_prompt, score))
if score >= 0.95:
print('Target score reached. Stopping.')
break
critique = self._critique_prompt(score)
self.current_prompt = self._rewrite_prompt(critique)
return self.best_prompt()
def best_prompt(self):
return max(self.history, key=lambda x: x[2])[1]Der Executor: Den Prompt ausführen
Der Executor wendet den aktuellen Prompt auf jeden Testfall an und sammelt die Ausgaben. Dies ist eine gewöhnliche LLM-Aufrufschleife – daran ist nichts Besonderes, aber es ist unerlässlich zu erfassen, welcher Testfall welche Ausgabe erzeugt hat.
def _execute_prompt(self, prompt):
outputs = []
for case in self.test_cases:
response = client.messages.create(
model='claude-haiku-4-5', # use cheaper model for execution
max_tokens=500,
messages=[
{'role': 'user', 'content': prompt + '\n\nInput: ' + case['input']}
]
)
outputs.append({
'case_id': case['id'],
'input': case['input'],
'expected': case['expected'],
'actual': response.content[0].text
})
return outputs
# Bind method to class (demonstration)
SelfImprovingPromptSystem._execute = _execute_prompt
# Sample test cases
test_cases = [
{'id': 1, 'input': 'The meeting was cancelled.', 'expected': 'negative'},
{'id': 2, 'input': 'Great product, love it!', 'expected': 'positive'},
{'id': 3, 'input': 'It arrived on time.', 'expected': 'neutral'},
]
print(f'Test suite: {len(test_cases)} cases')Der Evaluator: Ausgaben bewerten
Der Evaluator bewertet die Ausgaben des Executors anhand erwarteter Antworten. Dafür kann er bei offenen Aufgaben einen exakten Abgleich, einen unscharfen Abgleich oder einen separaten LLM-Judge verwenden.
def _evaluate_prompt(self):
outputs = self._execute(self.current_prompt)
correct = 0
failed_cases = []
for out in outputs:
# Exact match for classification tasks
if out['expected'].lower() in out['actual'].lower():
correct += 1
else:
failed_cases.append(out)
score = correct / len(outputs)
self._last_failed_cases = failed_cases
return score
# For open-ended tasks: LLM-as-judge evaluator
JUDGE_PROMPT = '''Rate the quality of this AI response (1-5).
Task: {task_description}
Input: {input}
Expected approach: {expected}
Actual response: {actual}
Return only the integer score (1-5). No explanation.'''
def llm_judge_score(task_desc, input_text, expected, actual):
response = client.messages.create(
model='claude-haiku-4-5', max_tokens=5,
messages=[{'role': 'user', 'content':
JUDGE_PROMPT.format(
task_description=task_desc, input=input_text,
expected=expected, actual=actual
)}]
)
try:
return int(response.content[0].text.strip()) / 5.0
except ValueError:
return 0.5Der Critic: Schwächen des Prompts ermitteln
Der Critic analysiert fehlgeschlagene Testfälle und den aktuellen Prompt, um konkrete Schwächen zu ermitteln. Dies ist der zentrale Schritt des Meta-Promptings – das Modell kritisiert seinen eigenen Prompt.
CRITIC_PROMPT = '''You are a prompt engineering expert analyzing why a prompt fails.
Current prompt:
{current_prompt}
Failed test cases (where the prompt gave wrong outputs):
{failed_cases}
For each failure, explain:
1. What went wrong in the output
2. Which part of the prompt caused or failed to prevent this
3. A specific, actionable fix
End with a prioritized list of the top 3 prompt improvements to make.
Be specific — quote the relevant prompt section and suggest the exact replacement.'''
def _critique_prompt(self, score):
failed_json = '\n'.join(
f'Input: {c["input"]}\nExpected: {c["expected"]}\nActual: {c["actual"]}'
for c in self._last_failed_cases[:5]
)
response = client.messages.create(
model='claude-opus-4-5', max_tokens=1000,
messages=[{'role': 'user', 'content':
CRITIC_PROMPT.format(
current_prompt=self.current_prompt,
failed_cases=failed_json
)}]
)
return response.content[0].textDer Rewriter: Den Prompt verbessern
Der Rewriter verwendet die Analyse des Critics, um eine verbesserte Version des Prompts zu erstellen. Die zentrale Einschränkung: Es sollte sich um eine gezielte Verbesserung und nicht um eine vollständige Neufassung handeln.
REWRITER_PROMPT = '''You are a prompt engineer. Improve the prompt based on the critique below.
Current prompt:
{current_prompt}
Critique and suggested improvements:
{critique}
Rules for rewriting:
1. Make TARGETED changes based on the critique — do not rewrite everything
2. Keep all parts of the prompt that were working well
3. Apply all prioritized fixes from the critique
4. Do not add unnecessary verbosity — conciseness is a quality
5. Output ONLY the improved prompt, no explanation
Improved prompt:'''
def _rewrite_prompt(self, critique):
response = client.messages.create(
model='claude-opus-4-5', max_tokens=1000,
messages=[{'role': 'user', 'content':
REWRITER_PROMPT.format(
current_prompt=self.current_prompt,
critique=critique
)}]
)
new_prompt = response.content[0].text.strip()
print(f'Prompt updated. Length: {len(new_prompt)} chars '
f'(was {len(self.current_prompt)} chars)')
return new_promptDie vollständige Schleife: Alles zusammenführen
Hier sehen Sie die vollständige Selbstverbesserungsschleife mit allen miteinander verbundenen Komponenten und einer grundlegenden Konvergenzerkennung.
def run_improvement_loop(initial_prompt, test_cases, max_iterations=5,
target_score=0.90):
history = []
current_prompt = initial_prompt
last_failed_cases = []
for i in range(max_iterations):
print(f'\n--- Iteration {i+1} ---')
# Execute
outputs = execute_prompt(current_prompt, test_cases)
# Evaluate
score, failed_cases = evaluate_outputs(outputs)
last_failed_cases = failed_cases
print(f'Score: {score:.2f} ({len(failed_cases)} failures)')
history.append({'iteration': i, 'prompt': current_prompt, 'score': score})
if score >= target_score:
print(f'Target score {target_score} reached!')
break
if not failed_cases:
print('No failures to learn from. Stopping.')
break
# Critique and rewrite
critique = critique_prompt(current_prompt, failed_cases)
current_prompt = rewrite_prompt(current_prompt, critique)
best = max(history, key=lambda x: x['score'])
print(f'\nBest prompt at iteration {best["iteration"]+1} with score {best["score"]:.2f}')
return best['prompt'], historyKostenmanagement in Selbstverbesserungsschleifen
Selbstverbesserungsschleifen können teuer sein – jede Iteration führt mehrere API-Aufrufe aus. Kostenmanagement-Strategien halten die Schleife bezahlbar.
# Cost optimization strategies
# 1. Use cheap model for execution, expensive model for critique/rewrite
def execute_prompt(prompt, test_cases):
# Use cheapest capable model
model = 'claude-haiku-4-5'
# ... execute ...
pass
def critique_prompt(prompt, failed_cases):
# Use best model for reasoning about why the prompt fails
model = 'claude-opus-4-5'
# ... critique ...
pass
# 2. Limit test suite size (sample from larger set)
import random
def get_evaluation_sample(full_test_suite, sample_size=20):
if len(full_test_suite) <= sample_size:
return full_test_suite
return random.sample(full_test_suite, sample_size)
# 3. Early stopping: stop if score doesn't improve
def has_converged(history, patience=2, min_delta=0.02):
if len(history) < patience + 1:
return False
recent_scores = [h['score'] for h in history[-patience:]]
best_recent = max(recent_scores)
baseline = history[-(patience+1)]['score']
return (best_recent - baseline) < min_delta
print('Cost optimization: cheap model for execution, expensive for critique')Die Prompt-Herkunft nachverfolgen
In einer Selbstverbesserungsschleife sollte jede Prompt-Version auf die Fehleranalyse zurückführbar sein, durch die sie ausgelöst wurde. Diese Herkunft erleichtert die Untersuchung unerwarteter Regressionen und unterstützt die menschliche Überprüfung.
class PromptLineage:
def __init__(self):
self.lineage = []
def record(self, iteration, prompt, score, critique=None,
failed_case_ids=None):
self.lineage.append({
'iteration': iteration,
'prompt': prompt,
'score': score,
'critique_summary': critique[:100] if critique else None,
'failed_case_ids': failed_case_ids or [],
'prompt_length': len(prompt.split())
})
def print_history(self):
print('Prompt improvement history:')
for entry in self.lineage:
print(
f' Iter {entry["iteration"]}: '
f'score={entry["score"]:.2f} '
f'words={entry["prompt_length"]} '
f'failures={len(entry["failed_case_ids"])}'
)
def get_best(self):
return max(self.lineage, key=lambda x: x['score'])
lineage = PromptLineage()
lineage.record(0, 'Initial simple prompt', 0.60)
lineage.record(1, 'Improved with examples', 0.75, 'Missing edge cases')
lineage.record(2, 'Added edge case handling', 0.92, 'Minor format issue')
lineage.print_history()Visualisierung des Prompt-Versionsverlaufs
Die Visualisierung des Bewertungsverlaufs über mehrere Iterationen hinweg hilft zu erkennen, ob die Schleife konvergiert und wie schnell dies geschieht. Ein einfaches Textdiagramm macht Trends sofort sichtbar, ohne eine Grafikbibliothek zu benötigen.
def visualize_improvement_history(history):
'''
history: list of (iteration, prompt, score)
Prints an ASCII chart of score progression.
'''
if not history:
print('No history to visualize.')
return
max_score = 1.0
bar_width = 40
print('\nScore Progression:')
print('-' * (bar_width + 20))
for iteration, prompt, score in history:
filled = int(score * bar_width)
bar = '#' * filled + '-' * (bar_width - filled)
marker = ' <-- BEST' if score == max(h[2] for h in history) else ''
print(f'Iter {iteration:2d}: [{bar}] {score:.3f}{marker}')
final_score = history[-1][2]
best_score = max(h[2] for h in history)
gain = best_score - history[0][2]
print('-' * (bar_width + 20))
print(f'Initial: {history[0][2]:.3f} -> Best: {best_score:.3f} (gain: +{gain:.3f})')
# Example
sample_history = [
(0, 'v0', 0.60),
(1, 'v1', 0.72),
(2, 'v2', 0.78),
(3, 'v3', 0.77),
(4, 'v4', 0.85)
]
visualize_improvement_history(sample_history)Regressionserkennung
Ein neu geschriebener Prompt kann einige Fehler beheben und gleichzeitig zuvor bestandene Testfälle beschädigen – das ist eine Regression. Prüfen Sie daher nach jeder Iteration auf Regressionen, indem Sie vergleichen, bei welchen konkreten Testfällen sich der Status geändert hat.
def detect_regressions(old_outputs, new_outputs):
old_results = {o['case_id']: o['correct'] for o in old_outputs}
new_results = {o['case_id']: o['correct'] for o in new_outputs}
regressions = []
improvements = []
for case_id in old_results:
was_correct = old_results[case_id]
is_correct = new_results.get(case_id, False)
if was_correct and not is_correct:
regressions.append(case_id)
elif not was_correct and is_correct:
improvements.append(case_id)
print(f'Fixed: {len(improvements)} cases. Regressed: {len(regressions)} cases.')
if regressions:
print(f'WARNING: Regression on cases: {regressions}')
print('Consider reverting to previous prompt version.')
return regressions, improvements
# Example
old = [{'case_id': 1, 'correct': True}, {'case_id': 2, 'correct': False}]
new = [{'case_id': 1, 'correct': False}, {'case_id': 2, 'correct': True}]
detect_regressions(old, new) # Fixed: 1, Regressed: 1Schnelltest
Welche Aufgabe hat die Critic-Komponente in einer sich selbst verbessernden Prompt-Schleife?
Zusammenfassung: Sich selbst verbessernde Prompt-Systeme
Sich selbst verbessernde Prompt-Systeme automatisieren den Zyklus der Prompt-Optimierung:
- Schleifenstruktur: Ausführen → Bewerten → Kritisieren → Neuschreiben → wiederholen
- Executor: Führt den Prompt für Testfälle aus (verwenden Sie ein kostengünstiges Modell)
- Evaluator: Bewertet Ausgaben per exaktem Abgleich oder mit einem LLM-Judge
- Critic: Meta-Prompt, der anhand von Fehlern konkrete Schwächen des Prompts ermittelt
- Rewriter: Gezielte Verbesserung auf Grundlage der Kritik (verwenden Sie das beste Modell)
- Konvergenz: Stoppt beim Zielwert oder wenn sich die Bewertung nicht mehr verbessert
- Regressionserkennung: Prüft immer, dass Verbesserungen keine zuvor bestandenen Testfälle beschädigen
Häufig gestellte Fragen
Ist die Lektion „Selbstverbessernde Prompt-Systeme“ kostenlos?
Ja — der vollständige Text von „Selbstverbessernde Prompt-Systeme“ ist hier im Web kostenlos zu lesen. Um sie interaktiv zu üben (integrierter Code-Editor und 24/7 KI-Tutor) und den Rest des AI Prompt Engineering-Kurses freizuschalten, upgrade auf CoddyKit PRO. Der AI Prompt Engineering-Kurs umfasst insgesamt 4 Lektionen.
Was lerne ich in „Selbstverbessernde Prompt-Systeme“?
Schleifen aus Feedback → Kritik → Neufassung, die Prompts automatisch optimieren. Du übst AI Prompt Engineering mit praktischem Code, den du direkt im Browser ausführst, und ein 24/7 KI-Tutor beantwortet deine Fragen während du die Lektion bearbeitest.
Brauche ich Erfahrung, um AI Prompt Engineering zu starten?
Keine Vorkenntnisse erforderlich. AI Prompt Engineering auf CoddyKit ist für Anfänger bis fortgeschrittene Lernende strukturiert, sodass du hier starten oder von Anfang an beginnen und in deinem eigenen Tempo voranschreiten kannst. Dies ist Lektion 3 von 4.
Wie lange dauert die Lektion „Selbstverbessernde Prompt-Systeme“?
Die meisten CoddyKit-Lektionen dauern etwa 5–10 Minuten. Jede ist kompakt und interaktiv, sodass du stetig Fortschritte machst und genau dort weitermachst, wo du aufgehört hast – im Web und in der App.
Kann ich in dieser AI Prompt Engineering-Lektion Code schreiben und ausführen?
Ja. Jede AI Prompt Engineering-Lektion enthält einen integrierten Code-Editor, sodass du echten Code direkt in deinem Browser schreibst und ausführst und sofort KI-Feedback erhältst — ohne lokale Einrichtung erforderlich.
Alle Lektionen in diesem Kurs
- Was ist Meta-Prompting?
- Prompts, die Prompts generieren
- Selbstverbessernde Prompt-Systeme
- Bewertung und Auswahl bei der Selbstverbesserung