Prompt Engineering für produktive LLM-Apps
Design von System-Prompts, Few-Shot-Beispiele, Ausgabeformatierung, Retry-Logik, Kostenoptimierung.
Prompt Engineering für produktive LLM-Apps ist eine kostenlose Learn AI with Python-Lektion auf CoddyKit. Dies ist Lektion 4 von 4. Du kannst die komplette Lektion unten kostenlos lesen – dann übst du sie direkt im Browser mit einem integrierten Code-Editor und einem KI-Tutor rund um die Uhr. Sie ist Teil des Learn AI with Python-Lernpfads, und dein Fortschritt wird über Web und CoddyKit-App synchronisiert. Der Learn AI with Python-Kurs umfasst insgesamt 4 Lektionen.
Prompting im Produktivbetrieb
In echten Anwendungen sind Prompts Code: Sie brauchen Struktur, Tests und Zuverlässigkeit. Gutes Prompt Engineering reduziert Halluzinationen, erzwingt ein Ausgabeformat und kontrolliert die Kosten. Diese Lektion behandelt die Techniken, die im Produktivbetrieb wichtig sind.
System-Prompt-Design
Der System-Prompt legt die Rolle, den Ton, die Einschränkungen und die Regeln des Modells fest. Seien Sie konkret: Beschreiben Sie, was der Assistent ist, was er tun muss und nicht tun darf und in welchem Format er antworten soll. Ein klarer System-Prompt ist Ihr wichtigstes Steuerungsinstrument.
system = (
"You are a support agent for an e-commerce store. "
"Answer only questions about orders and shipping. "
"If asked anything else, politely decline. "
"Keep replies under 3 sentences."
)Few-Shot-Beispiele
Few-Shot-Prompting bedeutet, dem Modell Beispielpaare aus Eingabe und Ausgabe zu zeigen, damit es das Muster lernt. Platzieren Sie diese als abwechselnde Nachrichten des Benutzers und des Assistenten vor der eigentlichen Anfrage.
messages = [
{"role": "system", "content": system},
{"role": "user", "content": "Classify: I love this!"},
{"role": "assistant", "content": "positive"},
{"role": "user", "content": "Classify: This broke instantly."},
{"role": "assistant", "content": "negative"},
{"role": "user", "content": "Classify: It is okay I guess."}
]Warum Few-Shot funktioniert
Beispiele machen Ihre Absicht eindeutiger als Anweisungen allein. Sie legen den genauen Ausgabestil fest (ein Wort, JSON oder ein Label) und verbessern die Konsistenz bei Klassifizierungs-, Extraktions- und Formatierungsaufgaben erheblich.
JSON-Ausgabe erzwingen
Fordern Sie für maschinenlesbare Antworten den JSON-Modus mit response_format an. Mit {"type": "json_object"} wird das Modell auf die Ausgabe von gültigem JSON beschränkt, das Sie anschließend sicher analysieren können.
response = client.chat.completions.create(
model="gpt-4o",
messages=messages,
response_format={"type": "json_object"}
)
import json
data = json.loads(response.choices[0].message.content)Tokens mit tiktoken zählen
Kosten und Kontextlimits werden in Tokens gemessen. Die Bibliothek tiktoken zählt Tokens lokal, sodass Sie Ihr Budget vor dem Senden planen können. Installieren Sie sie mit pip install tiktoken.
import tiktoken
enc = tiktoken.encoding_for_model("gpt-4o")
tokens = enc.encode("Hello, how are you?")
print(len(tokens))Warum das Zählen von Tokens wichtig ist
Jedes Modell verfügt über ein Kontextfenster (eine maximale Token-Anzahl), und Sie zahlen pro Token. Wenn Sie im Voraus zählen, können Sie den Verlauf kürzen, zu große Eingaben ablehnen und die Kosten vorhersagen, bevor der Aufruf Ihren Server überhaupt verlässt.
def cost_estimate(text, price_per_1k=0.005):
enc = tiktoken.encoding_for_model("gpt-4o")
n = len(enc.encode(text))
return n, n / 1000 * price_per_1kMit Rate Limits umgehen
Im Produktivbetrieb stoßen Sie auf Rate Limits (HTTP 429) und vorübergehende Fehler. Lassen Sie die Anwendung nicht abstürzen, sondern wiederholen Sie den Aufruf mit exponentiellem Backoff. Die Bibliothek tenacity macht daraus einen Decorator in einer Zeile.
pip install tenacity
from tenacity import retry, wait_exponential, stop_after_attemptMit tenacity wiederholen
Versehen Sie Ihren API-Aufruf mit dem Decorator @retry. Verwenden Sie wait_exponential, um die Wartezeit zwischen den Versuchen zu erhöhen, und stop_after_attempt, um die Gesamtzahl der Versuche zu begrenzen. So übersteht Ihre Anwendung vorübergehende Ausfälle zuverlässig.
@retry(wait=wait_exponential(min=1, max=30), stop=stop_after_attempt(5))
def ask(prompt):
return client.chat.completions.create(
model="gpt-4o",
messages=[{"role": "user", "content": prompt}]
)Ein JSON Schema für die Ausgabe definieren
Wenn Sie den JSON-Modus erzwingen, beschreiben Sie im Prompt immer genau die gewünschte Struktur, damit die Schlüssel vorhersehbar sind. Wenn Sie das Schema in Klartext angeben und zusätzlich den JSON-Modus verwenden, erhalten Sie jedes Mal analysierbare und validierbare Ergebnisse.
system = (
"Return ONLY JSON with this shape: "
"{\"sentiment\": \"positive|negative|neutral\", "
"\"confidence\": number between 0 and 1}"
)Alles zusammenführen
Eine Prompt-Pipeline für den Produktivbetrieb: Entwerfen Sie einen strikten System-Prompt, fügen Sie Few-Shot-Beispiele hinzu, erzwingen Sie bei Bedarf eine JSON-Ausgabe, zählen Sie Tokens, um Kosten und Kontext zu verwalten, und umschließen Sie Aufrufe mit einer Retry-Logik. Zusammen machen diese Maßnahmen LLM-Funktionen zuverlässig.
Kurze Überprüfung
Testen Sie Ihr Wissen über Prompting im Produktivbetrieb.
Zusammenfassung: Prompting für den Produktiveinsatz
Sie haben gelernt, strikte System-Prompts zu formulieren, das Verhalten mit Few-Shot-Beispielen zu steuern und mithilfe des JSON-Modus von response_format strukturierte Antworten zu garantieren. Sie haben mit tiktoken Tokens gezählt, um Kontext und Kosten zu verwalten, und mit tenacity-Retries für Rate Limits die Robustheit erhöht.
Häufig gestellte Fragen
Ist die Lektion „Prompt Engineering für produktive LLM-Apps“ kostenlos?
Ja — der vollständige Text von „Prompt Engineering für produktive LLM-Apps“ ist hier im Web kostenlos zu lesen. Um sie interaktiv zu üben (integrierter Code-Editor und 24/7 KI-Tutor) und den Rest des Learn AI with Python-Kurses freizuschalten, upgrade auf CoddyKit PRO. Der Learn AI with Python-Kurs umfasst insgesamt 4 Lektionen.
Was lerne ich in „Prompt Engineering für produktive LLM-Apps“?
Design von System-Prompts, Few-Shot-Beispiele, Ausgabeformatierung, Retry-Logik, Kostenoptimierung. Du übst Learn AI with Python mit praktischem Code, den du direkt im Browser ausführst, und ein 24/7 KI-Tutor beantwortet deine Fragen während du die Lektion bearbeitest.
Brauche ich Erfahrung, um Learn AI with Python zu starten?
Keine Vorkenntnisse erforderlich. Learn AI with Python auf CoddyKit ist für Anfänger bis fortgeschrittene Lernende strukturiert, sodass du hier starten oder von Anfang an beginnen und in deinem eigenen Tempo voranschreiten kannst. Dies ist Lektion 4 von 4.
Wie lange dauert die Lektion „Prompt Engineering für produktive LLM-Apps“?
Die meisten CoddyKit-Lektionen dauern etwa 5–10 Minuten. Jede ist kompakt und interaktiv, sodass du stetig Fortschritte machst und genau dort weitermachst, wo du aufgehört hast – im Web und in der App.
Kann ich in dieser Learn AI with Python-Lektion Code schreiben und ausführen?
Ja. Jede Learn AI with Python-Lektion enthält einen integrierten Code-Editor, sodass du echten Code direkt in deinem Browser schreibst und ausführst und sofort KI-Feedback erhältst — ohne lokale Einrichtung erforderlich.
Alle Lektionen in diesem Kurs
- OpenAI API: chat.completions und Streaming
- Anthropic Claude API in Python
- Function Calling und Tool-Nutzung mit LLMs
- Prompt Engineering für produktive LLM-Apps