Wie KI Antworten erzeugt
Tokenvorhersage, Wahrscheinlichkeiten und warum KI nicht wie Menschen „denkt“
Wie KI Antworten erzeugt ist eine kostenlose AI Prompt Engineering-Lektion auf CoddyKit. Dies ist Lektion 3 von 4. Du kannst die komplette Lektion unten kostenlos lesen – dann übst du sie direkt im Browser mit einem integrierten Code-Editor und einem KI-Tutor rund um die Uhr. Sie ist Teil des AI Prompt Engineering-Lernpfads, und dein Fortschritt wird über Web und CoddyKit-App synchronisiert. Der AI Prompt Engineering-Kurs umfasst insgesamt 4 Lektionen.
Text als Wahrscheinlichkeitsproblem
Im Kern tut ein Sprachmodell nur eines: Es sagt das nächste Token voraus, wenn alle vorhergehenden Tokens gegeben sind.
Ein Token ist eine kleine Texteinheit – ungefähr ein Wort oder Wortfragment. Das Modell weist jedem Token in seinem Vokabular eine Wahrscheinlichkeit zu und wählt eines aus. Anschließend wiederholt es den Vorgang Token für Token, bis es eine vollständige Antwort erzeugt.
Was ist ein Token?
Tokens sind die Grundbausteine der Textverarbeitung von LLMs. Englischer Text wird ungefähr wie folgt tokenisiert:
- Häufige Wörter → jeweils 1 Token (
the,run) - Seltener vorkommende Wörter → in 2–3 Tokens aufgeteilt (
running→run+ning) - Satzzeichen und Leerzeichen → häufig eigene Tokens
Modelle wie GPT-4o und Claude verwenden Tokenizer, die mehr als 100.000 Vokabulareinträge verarbeiten, einschließlich Subwords aus vielen Sprachen.
import tiktoken
encoding = tiktoken.encoding_for_model('gpt-4o')
sentence = 'The temperature parameter controls randomness in token selection.'
tokens = encoding.encode(sentence)
token_strings = [encoding.decode([t]) for t in tokens]
print(f'Sentence: {sentence}')
print(f'Token count: {len(tokens)}')
print(f'Tokens: {token_strings}')Autoregressive Generierung
Die Generierung ist autoregressiv: Vor der Vorhersage des nächsten Tokens wird jedes neue Token an die Eingabe angehängt.
Bei der Generierung von „Der Himmel ist blau“ geht das Modell so vor:
- Es sieht „Der“ → sagt „Himmel“ voraus
- Es sieht „Der Himmel“ → sagt „ist“ voraus
- Es sieht „Der Himmel ist“ → sagt „blau“ voraus
- Es sieht „Der Himmel ist blau“ → sagt das Sequenzende voraus
Deshalb wird die Generierung bei sehr langen Ausgaben langsamer – jedes Token erfordert einen vollständigen Forward-Pass.
# Simulated autoregressive token-by-token output via streaming
import openai
client = openai.OpenAI(api_key='sk-your-key-here')
stream = client.chat.completions.create(
model='gpt-4o',
stream=True, # receive tokens as they are generated
messages=[{'role': 'user', 'content': 'Name five planets in our solar system.'}]
)
print('Tokens arriving one by one:')
for chunk in stream:
delta = chunk.choices[0].delta.content
if delta:
print(delta, end='', flush=True)
print() # newline at endTemperatur: Zufälligkeit steuern
Temperatur ist eine Zahl zwischen 0 und 2, die die Wahrscheinlichkeitsverteilung vor dem Sampling skaliert:
- Temperatur 0: immer das wahrscheinlichste Token auswählen – deterministisch, repetitiv
- Temperatur 1: gemäß den Rohwahrscheinlichkeiten sampeln – ausgewogen
- Temperatur 2: Wahrscheinlichkeiten abflachen – sehr zufällig, manchmal nicht schlüssig
Verwenden Sie eine niedrige Temperatur für faktische Aufgaben und eine höhere für kreative Arbeit.
import openai
client = openai.OpenAI(api_key='sk-your-key-here')
prompt = 'Continue this sentence with one word: The ocean is'
for temp in [0.0, 0.7, 1.5]:
response = client.chat.completions.create(
model='gpt-4o',
temperature=temp,
max_tokens=5,
messages=[{'role': 'user', 'content': prompt}]
)
word = response.choices[0].message.content.strip()
print(f'Temperature {temp}: "{word}"')Warum Antworten zwischen Ausführungen variieren
Selbst mit demselben Prompt können zwei Ausführungen desselben Modells unterschiedliche Ausgaben erzeugen. Das geschieht, weil:
- Sampling probabilistisch ist – das Modell zieht aus einer Verteilung statt aus einer Nachschlagetabelle
- sich kleine numerische Unterschiede bei Gleitkommaoperationen fortpflanzen können
- Hardware-Parallelität Nichtdeterminismus einführt
Setzen Sie temperature=0 und seed (falls unterstützt), um die Reproduzierbarkeit zu maximieren.
import openai
client = openai.OpenAI(api_key='sk-your-key-here')
prompt = 'Give me a one-word color that feels calm.'
for run in range(3):
response = client.chat.completions.create(
model='gpt-4o',
temperature=1.0, # randomness ON
max_tokens=5,
messages=[{'role': 'user', 'content': prompt}]
)
print(f'Run {run + 1}: {response.choices[0].message.content.strip()}')
# For reproducible outputs use seed + temperature=0
response = client.chat.completions.create(
model='gpt-4o',
temperature=0,
seed=42,
max_tokens=5,
messages=[{'role': 'user', 'content': prompt}]
)
print(f'Deterministic: {response.choices[0].message.content.strip()}')Top-p-Sampling
Top-p (Nucleus-Sampling) ist eine weitere Möglichkeit, Zufälligkeit zu steuern. Statt alle Wahrscheinlichkeiten zu skalieren, beschränkt es das Sampling auf die kleinste Menge von Tokens, deren kumulative Wahrscheinlichkeit p überschreitet.
top_p=0.1: nur die wahrscheinlichsten Tokens (konservativ)top_p=0.9: größeres Auswahlfeld (kreativ)top_p=1.0: alle Tokens (gesamte Verteilung)
In der Praxis justieren die meisten Teams die Temperatur und lassen Top-p auf 1.0.
import openai
client = openai.OpenAI(api_key='sk-your-key-here')
# Conservative generation: top_p=0.1 restricts to high-confidence tokens
response_conservative = client.chat.completions.create(
model='gpt-4o',
top_p=0.1,
max_tokens=30,
messages=[{'role': 'user', 'content': 'What is the capital of Japan?'}]
)
# Creative generation: top_p=0.95 allows broader token pool
response_creative = client.chat.completions.create(
model='gpt-4o',
top_p=0.95,
max_tokens=30,
messages=[{'role': 'user', 'content': 'Write a poetic one-liner about the moon.'}]
)
print('Conservative:', response_conservative.choices[0].message.content)
print('Creative: ', response_creative.choices[0].message.content)Kein echtes Verständnis – Pattern Matching
LLMs verstehen Sprache nicht so wie Menschen. Sie sind äußerst ausgefeilte Mustererkenner, die mit riesigen Textkorpora trainiert wurden.
Wenn das Modell die Frage „Was ist Photosynthese?“ beantwortet, ruft es keinen gespeicherten Fakt ab – es generiert die Tokenfolge, die statistisch auf dieses Fragemuster folgt, weil es während des Trainings Millionen ähnlicher Dokumente gesehen hat.
# Demonstration: the model can produce plausible-sounding but wrong answers
import anthropic
client = anthropic.Anthropic(api_key='sk-ant-your-key-here')
# Asking about something nonsensical — model may still try to answer
response = client.messages.create(
model='claude-opus-4-5',
max_tokens=128,
messages=[{
'role': 'user',
'content': (
'What is the boiling point of happiness in degrees Celsius? '
'Please just say "I cannot answer this" if the question makes no sense.'
)
}]
)
print(response.content[0].text)Training vs. Inference
Das „Wissen“ des Modells wurde beim Training mit einem großen Textkorpus eingefroren. Bei der Inference (wenn Sie einen Prompt senden) generiert das Modell Text auf Grundlage dieses eingefrorenen Wissens – es lernt nicht und durchsucht auch nicht das Internet.
Das bedeutet, dass es nichts über Ereignisse nach dem Trainingsstichtag wissen, auf URLs nicht zugreifen und nicht überprüfen kann, ob sich ein Fakt seit dem Training geändert hat.
import anthropic
client = anthropic.Anthropic(api_key='sk-ant-your-key-here')
# Asking the model about its own knowledge cutoff
response = client.messages.create(
model='claude-opus-4-5',
max_tokens=128,
messages=[{
'role': 'user',
'content': (
'What is your knowledge cutoff date? '
'And can you access the internet right now to look up today\'s news?'
)
}]
)
print(response.content[0].text)Was bei einem Forward Pass passiert
Auf hoher Ebene umfasst jede Token-Vorhersage folgende Schritte:
- Alle Eingabetoken werden in numerische Embeddings umgewandelt
- Sie werden durch viele Transformer-Schichten geleitet (Attention + Feed-Forward)
- Es wird eine Wahrscheinlichkeitsverteilung über das gesamte Vokabular erzeugt
- Aus dieser Verteilung wird ein Token per Sampling ausgewählt
Moderne Modelle verfügen über Milliarden von Parametern, die diese Transformation steuern – alle wurden während des Trainings anhand menschlicher Texte gelernt.
# You can inspect logprobs (token probabilities) to see the model's confidence
import openai
client = openai.OpenAI(api_key='sk-your-key-here')
response = client.chat.completions.create(
model='gpt-4o',
max_tokens=5,
logprobs=True,
top_logprobs=3,
messages=[{'role': 'user', 'content': 'The opposite of hot is'}]
)
for token_info in response.choices[0].logprobs.content:
print(f'Chosen token: "{token_info.token}"')
for alt in token_info.top_logprobs:
import math
prob = round(math.exp(alt.logprob) * 100, 1)
print(f' Option "{alt.token}": {prob}% probability')Stop-Sequenzen
Stop-Sequenzen weisen das Modell an, die Generierung zu beenden, sobald es eine bestimmte Zeichenkette erzeugt. Das ist nützlich, um:
- zu verhindern, dass das Modell in einer Liste mehr als eine Antwort generiert
- die Ausgabe an einem Trennzeichen wie
###oder---END---zu stoppen - einzeilige Ausgaben zu erzwingen
Ohne Stop-Sequenzen generiert das Modell weiter, bis es max_tokens erreicht oder ein End-of-Sequence-Token vorhersagt.
import openai
client = openai.OpenAI(api_key='sk-your-key-here')
# Stop after the first item in a numbered list
response = client.chat.completions.create(
model='gpt-4o',
max_tokens=64,
stop=['2.'], # halt as soon as '2.' appears
messages=[{
'role': 'user',
'content': 'List 5 programming languages, numbered 1 through 5.'
}]
)
print(response.choices[0].message.content)
print('Stop reason:', response.choices[0].finish_reason)Praktische Auswirkungen für Prompt-Autoren
Wenn Sie die Mechanik der Textgenerierung verstehen, können Sie bessere Prompts schreiben:
- Verwenden Sie Temperatur 0 für Aufgaben, die konsistente, faktisch korrekte Ausgaben erfordern
- Verwenden Sie Temperatur 0.7–1.0 für kreatives Schreiben
- Überprüfen Sie Fakten – das Modell generiert plausible Texte, aber keine garantiert wahren Aussagen
- Verwenden Sie Stop-Sequenzen, um die Ausgabelänge präzise zu steuern
- Kurze Prompts → kreativere, aber weniger kontrollierte Ausgaben
- Detaillierte Prompts → stärker eingeschränkte und fokussierte Ausgaben
import anthropic
client = anthropic.Anthropic(api_key='sk-ant-your-key-here')
# Low temperature for factual classification
fact_response = client.messages.create(
model='claude-opus-4-5',
max_tokens=8,
temperature=0, # deterministic
messages=[{'role': 'user', 'content': 'Is Paris the capital of France? Answer YES or NO only.'}]
)
print('Factual (temp=0):', fact_response.content[0].text.strip())
# Higher temperature for creative tasks
creative_response = client.messages.create(
model='claude-opus-4-5',
max_tokens=64,
temperature=1.0,
messages=[{'role': 'user', 'content': 'Write a surprising one-line poem about code.'}]
)
print('Creative (temp=1):', creative_response.content[0].text.strip())Wissensüberprüfung
Sie haben gelernt, wie LLMs Text Token für Token generieren. Überprüfen wir nun Ihr Verständnis der Temperatur.
Ein Entwickler erstellt einen Kundenservice-Chatbot, der konsistente und korrekte Antworten auf Fragen zur Abrechnung geben muss. Welche Temperatureinstellung ist am besten geeignet?
Wie KI Antworten generiert – Zusammenfassung
Sie verstehen nun die Mechanik hinter jeder KI-Antwort:
- Modelle sagen das nächste Token jeweils einzeln voraus – autoregressive Generierung
- Die Temperatur steuert, wie viel Zufälligkeit in die Token-Auswahl einfließt
- Top-p beschränkt das Sampling auf einen Kernbereich von Token mit hoher Wahrscheinlichkeit
- Das Modell versteht nicht – es gleicht Muster in riesigem Umfang ab
- Das Wissen ist beim Training eingefroren – keine Echtzeitdaten, kein Internetzugriff
- Mit Stop-Sequenzen können Sie genau steuern, wo die Ausgabe endet
Lerne AI Prompt Engineering mit einem KI-Tutor — kostenlos
Schreibe und führe echten Code in deinem Browser aus, bekomme sofortige Hilfe von einem 24/7 KI-Tutor und setze dein Lernen im Web oder in der App fort.
- Kurse
- 53
- Lektionen
- 199
Häufig gestellte Fragen
Ist die Lektion „Wie KI Antworten erzeugt“ kostenlos?
Ja — der vollständige Text von „Wie KI Antworten erzeugt“ ist hier im Web kostenlos zu lesen. Um sie interaktiv zu üben (integrierter Code-Editor und 24/7 KI-Tutor) und den Rest des AI Prompt Engineering-Kurses freizuschalten, upgrade auf CoddyKit PRO. Der AI Prompt Engineering-Kurs umfasst insgesamt 4 Lektionen.
Was lerne ich in „Wie KI Antworten erzeugt“?
Tokenvorhersage, Wahrscheinlichkeiten und warum KI nicht wie Menschen „denkt“ Du übst AI Prompt Engineering mit praktischem Code, den du direkt im Browser ausführst, und ein 24/7 KI-Tutor beantwortet deine Fragen während du die Lektion bearbeitest.
Brauche ich Erfahrung, um AI Prompt Engineering zu starten?
Keine Vorkenntnisse erforderlich. AI Prompt Engineering auf CoddyKit ist für Anfänger bis fortgeschrittene Lernende strukturiert, sodass du hier starten oder von Anfang an beginnen und in deinem eigenen Tempo voranschreiten kannst. Dies ist Lektion 3 von 4.
Wie lange dauert die Lektion „Wie KI Antworten erzeugt“?
Die meisten CoddyKit-Lektionen dauern etwa 5–10 Minuten. Jede ist kompakt und interaktiv, sodass du stetig Fortschritte machst und genau dort weitermachst, wo du aufgehört hast – im Web und in der App.
Kann ich in dieser AI Prompt Engineering-Lektion Code schreiben und ausführen?
Ja. Jede AI Prompt Engineering-Lektion enthält einen integrierten Code-Editor, sodass du echten Code direkt in deinem Browser schreibst und ausführst und sofort KI-Feedback erhältst — ohne lokale Einrichtung erforderlich.
Alle Lektionen in diesem Kurs
- Die Chat-Oberfläche verstehen
- Arten von Anfragen, die KI bearbeiten kann
- Wie KI Antworten erzeugt
- Was KI nicht kann