0Pricing
AI Prompt Engineering · Lektion

TTS-Prompt-Muster für natürliche Sprache

Satzbau, Zeichensetzung und Hinweise zum Sprechtempo, die die TTS-Ausgabe verbessern.

TTS-Prompt-Muster für natürliche Sprache ist eine kostenlose AI Prompt Engineering-Lektion auf CoddyKit. Dies ist Lektion 1 von 4. Du kannst die komplette Lektion unten kostenlos lesen – dann übst du sie direkt im Browser mit einem integrierten Code-Editor und einem KI-Tutor rund um die Uhr. Sie ist Teil des AI Prompt Engineering-Lernpfads, und dein Fortschritt wird über Web und CoddyKit-App synchronisiert. Der AI Prompt Engineering-Kurs umfasst insgesamt 4 Lektionen.

Warum sich TTS-Prompting unterscheidet

Text-to-Speech-Systeme wandeln Ihren Text buchstäblich in Audio um. Anders als bei visuellem Text, bei dem Leser verwirrende Stellen erneut lesen können, erleben Zuhörer Audio linear und können nicht einfach anhalten, um einen mehrdeutigen Satz zu entschlüsseln.

Für TTS zu schreiben bedeutet, darüber nachzudenken, wie Wörter klingen: über Rhythmus, Satzlänge, mehrdeutige Aussprache und das Fehlen visueller Formatierung wie Fettdruck oder Aufzählungspunkten.

Satzlänge: Kürzer ist besser

Lange, komplexe Sätze mit mehreren Nebensätzen sind in Audio schwer zu verfolgen. TTS-Systeme unterbrechen den Rhythmus häufig an grammatikalisch korrekten, akustisch aber ungeschickten Stellen. Streben Sie für natürlich klingende Sprache Sätze mit 10 bis 20 Wörtern an.

# Prompt a model to generate TTS-optimized text
TTS_SYSTEM_PROMPT = (
    'You are writing text that will be read aloud by a text-to-speech system.\n\n'
    'Rules:\n'
    '- Use short, clear sentences (10-20 words each).\n'
    '- Avoid complex nested clauses.\n'
    '- End each sentence with a period for clear pause signals.\n'
    '- Avoid parenthetical asides in the middle of sentences.\n'
    '- Use conversational vocabulary — write as you would speak.\n'
    '- Never use bullet points, headers, or markdown formatting.'
)

# Bad (long, nested):
BAD = (
    'The transformer architecture, which was introduced in the landmark 2017 paper '
    '"Attention is All You Need" by Vaswani et al. at Google, fundamentally changed '
    'natural language processing by replacing recurrence with self-attention.'
)

# Good (TTS-friendly):
GOOD = (
    'The transformer architecture changed natural language processing. '
    'It was introduced in 2017 by researchers at Google. '
    'Their key innovation was replacing recurrence with self-attention.'
)

Interpunktion als Audiohinweise

TTS-Engines verwenden die Interpunktion zur Steuerung des Sprechtempos:

  • Punkt (.): Vollständiger Satzabschluss, längere Pause
  • Komma (,): Kurze Pause
  • Fragezeichen (?): Steigende Intonation
  • Ausrufezeichen (!): Betonung und Energie
  • Semikolon (;): Das Verhalten variiert je nach Engine und wird oft ignoriert
  • Gedankenstrich (—): Verursacht oft unnatürliche Pausen und sollte vermieden werden

Verwenden Sie zur zuverlässigen Steuerung des Sprechtempos explizite Punkte statt Gedankenstrichen oder Semikolons.

TTS_PUNCTUATION_PROMPT = (
    'Write the following content for text-to-speech narration. '
    'Use only periods, commas, and question marks for punctuation. '
    'Avoid em dashes, semicolons, colons, and parentheses. '
    'Break complex thoughts into multiple short sentences.\n\n'
    'Content to rewrite: {content}'
)

# Example transformation
original = (
    'There are three main factors to consider: cost, quality, and speed — '
    'and often, you can only optimize for two of them (this is sometimes '
    'called the project management triangle).'
)

for_tts = (
    'There are three main factors to consider. The first is cost. '
    'The second is quality. The third is speed. '
    'Usually, you can only optimize for two of these at once. '
    'This is sometimes called the project management triangle.'
)
print(for_tts)

Mehrdeutige Abkürzungen vermeiden

Abkürzungen, die Leser visuell entschlüsseln, werden zu Fallen für die falsche TTS-Aussprache. Verschiedene TTS-Engines behandeln Abkürzungen uneinheitlich.

  • Dr. → sagt möglicherweise „Doktor“ oder „Drive“
  • St. → „Sankt“ oder „Straße“?
  • vs. → „versus“ oder „vs.“?
  • etc. → „et cetera“ oder „etzee“?

Schreiben Sie Abkürzungen im TTS-Text aus, um eine korrekte Aussprache sicherzustellen.

TTS_ABBREVIATION_RULES = (
    'When writing for text-to-speech:\n'
    '- Write "Doctor" not "Dr."\n'
    '- Write "Street" or "Saint" not "St."\n'
    '- Write "versus" not "vs."\n'
    '- Write "et cetera" not "etc."\n'
    '- Write "for example" not "e.g."\n'
    '- Write "that is" not "i.e."\n'
    '- Write out years: "twenty twenty-five" not "2025" when narrated in prose\n'
    '- Write out numbers under 10: "three" not "3" in conversational text\n'
    '- Spell out acronyms on first use: '
    '"Application Programming Interface, or API"\n'
)
print(TTS_ABBREVIATION_RULES)

Wörter, die zu falscher Aussprache führen

Bestimmte Wörter oder Muster bringen TTS-Engines regelmäßig aus dem Takt. Kennen Sie diese und verwenden Sie Alternativen:

  • Homographe: „read“ im Präsens gegenüber der Vergangenheit, „lead“ im Sinne von Metall gegenüber „führen“, „wind“ – TTS wählt eine der Aussprachen
  • Seltene Eigennamen: Fachbegriffe, Markennamen, Wörter aus Fremdsprachen
  • Zahlen in ungewöhnlichen Kontexten: API-Versionen, Datumsformate, Maßeinheiten
# Prompting LLM to detect and fix TTS pronunciation issues
TTS_REVIEW_PROMPT = (
    'Review the following text for text-to-speech pronunciation issues.\n'
    'Identify words that might be mispronounced by a TTS engine because they:\n'
    '1. Are homographs with multiple pronunciations\n'
    '2. Are technical terms, brand names, or foreign words\n'
    '3. Are abbreviations or acronyms\n'
    '4. Are numbers in unusual formats\n\n'
    'For each issue, provide the original text and a TTS-safe replacement.\n\n'
    'Text to review: {text}'
)

# Example issues and fixes
ISSUES = {
    'She read the docs': 'She read (past tense - ambiguous) -> She finished reading the docs',
    'Lead developer': 'Lead (metal or guide?) -> Lead (rhymes with feed) developer',
    'API v2.3.1': 'v2.3.1 -> version 2 point 3 point 1',
    'The .env file': 'dot E N V file (may say .env) -> the environment config file',
    'Re-init': 'may say Ray-in-it -> reinitialize',
}
for problem, fix in ISSUES.items():
    print(f'Issue: {problem}\nFix: {fix}\n')

Zahlen und Datumsangaben für TTS

Zahlen sind eine der häufigsten Ursachen für eine unnatürliche TTS-Ausgabe. Schreiben Sie sie so, dass eindeutig ist, wie sie ausgesprochen werden sollen.

NUMBER_TTS_RULES = (
    'When writing numbers for TTS narration:\n'
    '- Dates: write "January fifteenth, 2025" not "01/15/2025"\n'
    '- Time: write "3 in the afternoon" not "15:00" in casual speech\n'
    '- Percentages: write "forty-five percent" not "45%" in narration\n'
    '- Large numbers: write "one point two million" not "1.2M"\n'
    '- Phone numbers: spell with hyphens "555-123-4567" (TTS reads each digit)\n'
    '- Currency: write "twelve dollars and fifty cents" not "$12.50" in speech\n'
    '- Fractions: write "three quarters" not "3/4"\n'
    '- Ordinals: write "first" not "1st" (TTS may say "one S T")\n'
)

# Apply when prompting the LLM to generate TTS scripts
TTS_SCRIPT_PROMPT = (
    'Write a 30-second product announcement for text-to-speech.\n'
    'Product: TaskFlow Pro, $49/month, 10,000 users worldwide, '
    'launched January 2025.\n\n'
    + NUMBER_TTS_RULES
)

Visuelle Formatierung entfernen

Markdown- und HTML-Formatierung ist für das Auge unsichtbar, wird von manchen TTS-Engines aber vorgelesen. Sternchen, Rautezeichen und spitze Klammern müssen entfernt oder durch gesprochene Entsprechungen ersetzt werden.

TTS_FORMAT_CONVERSION_PROMPT = (
    'Convert the following markdown text into plain prose suitable '
    'for text-to-speech narration.\n\n'
    'Rules:\n'
    '- Remove all markdown formatting (**, *, #, -, etc.)\n'
    '- Convert bullet lists into spoken sequences '
    '("First... Second... Third...")\n'
    '- Convert headers into topic introduction sentences\n'
    '- Remove any hyperlinks or URLs\n'
    '- Convert code snippets into descriptions '
    '("a Python function that...")\n\n'
    'Markdown text:\n'
    '{markdown_text}'
)

EXAMPLE_MARKDOWN = (
    '## Getting Started\n'
    '- Install the package with 'pip install mylib'\n'
    '- Set your **API key** in '.env'\n'
    '- Run 'python main.py' to start\n'
)

EXAMPLE_TTS = (
    'To get started, install the package using pip. '
    'Next, set your API key in your environment configuration file. '
    'Finally, run the main Python script to start.'
)
print(EXAMPLE_TTS)

Sprechtempo mit Überleitungsphrasen steuern

In geschriebenem Text hilft visuelle Struktur wie Absätze und Überschriften den Lesern. In TTS-Audio benötigen Sie verbale Überleitungsphrasen, damit die Zuhörer der Struktur folgen können.

TRANSITION_PHRASES = {
    'starting_new_topic':    ['Let us now talk about', 'Moving on to', 'Next,'],
    'adding_information':    ['Additionally,', 'Also worth noting,', 'Furthermore,'],
    'contrasting':           ['However,', 'On the other hand,', 'That said,'],
    'concluding':            ['To summarize,', 'In short,', 'To wrap up,'],
    'sequencing':            ['First,', 'Second,', 'Then,', 'Finally,'],
    'emphasizing':           ['Importantly,', 'Keep in mind that', 'Note that'],
}

TTS_STRUCTURE_PROMPT = (
    'Write a two-minute explainer on {topic} for text-to-speech narration.\n'
    'Use verbal transition phrases to guide listeners through each point. '
    'Avoid headers or bullet points. '
    'Structure the content with clear spoken signposts '
    '("First...", "Moving on...", "To summarize...").'
)

print('Available transitions:')
for category, phrases in TRANSITION_PHRASES.items():
    print(f'  {category}: {phrases[0]}')

Ihren TTS-Text testen

Der einzige zuverlässige Test für die TTS-Qualität besteht darin, den Text anzuhören. Richten Sie eine Test-und-Hör-Schleife ein: Text generieren → an die TTS-API senden → anhören → iterieren. Verlassen Sie sich nicht darauf, den Text nur visuell zu lesen.

import openai
import pathlib

client = openai.OpenAI(api_key='sk-...')

def generate_and_test_tts(text, output_file='test_audio.mp3'):
    """Generate TTS audio from text for auditory review."""
    response = client.audio.speech.create(
        model='tts-1-hd',
        voice='alloy',   # alloy, echo, fable, onyx, nova, shimmer
        input=text,
        speed=1.0        # 0.25 to 4.0
    )

    audio_path = pathlib.Path(output_file)
    response.stream_to_file(audio_path)
    print(f'Audio saved to {audio_path}')
    print(f'Text length: {len(text)} chars, {len(text.split())} words')
    return audio_path

# Generate and listen before shipping
tts_text = (
    'Welcome to our weekly update. '
    'This week, the engineering team shipped three major features. '
    'First, we improved search speed by forty percent. '
    'Second, we added support for twelve new languages. '
    'Third, we launched our new mobile application.'
)
path = generate_and_test_tts(tts_text)

Stimmauswahl und Prompt-Abstimmung

Verschiedene TTS-Stimmen haben unterschiedliche Stärken. Stimmen Sie die Stimme auf den Ton Ihres Inhalts ab:

  • Warm/narrativ: Geschichten, Bildungsinhalte
  • Professionell/neutral: Geschäftsberichte, technische Dokumentation
  • Energiegeladen/hell: Marketing, Produktvorführungen, Benachrichtigungen

Fordern Sie das LLM auf, Inhalte zu schreiben, die zum natürlichen Register der Stimme passen.

VOICE_SPECIFIC_PROMPTS = {
    'professional': (
        'Write in a clear, neutral, professional tone. '
        'Use complete sentences. Avoid contractions. '
        'Suitable for business reports and documentation.'
    ),
    'warm_narrative': (
        'Write in a warm, engaging, conversational tone. '
        'Use contractions naturally. '
        'Speak directly to the listener using "you" and "we". '
        'Suitable for educational content and storytelling.'
    ),
    'energetic': (
        'Write in an upbeat, enthusiastic tone. '
        'Use shorter sentences for impact. '
        'Include emphasis words like "amazing", "incredible", "now". '
        'Suitable for marketing and product announcements.'
    ),
}

# Select based on use case
use_case = 'warm_narrative'
print(VOICE_SPECIFIC_PROMPTS[use_case])

LLM-zu-TTS-Pipeline entwerfen

In einer Produktionspipeline generiert ein LLM Text, der anschließend an eine TTS-Engine übergeben wird. Die beiden Komponenten müssen aufeinander abgestimmt sein: Das LLM muss wissen, dass es Text für TTS generiert und nicht zum Lesen, und jeder System-Prompt oder jede Nachbearbeitung muss TTS-freundliche Regeln durchsetzen, bevor der Text die TTS-API erreicht.

Fügen Sie zwischen der LLM-Ausgabe und der TTS-Eingabe einen schlanken Nachbearbeitungsschritt ein: Entfernen Sie durchgerutschtes Markdown, schreiben Sie Abkürzungen aus und prüfen Sie die Satzlänge. So werden Formatierungsfehler des LLM abgefangen, bevor sie zu Audioartefakten werden.

Wissensprüfung: Satzstruktur für TTS

Welcher der folgenden Texte ist am besten für eine Text-to-Speech-Erzählung formatiert?

Zusammenfassung: TTS-Prompt-Muster für natürliche Sprache

TTS-Texte müssen für das Ohr und nicht für das Auge geschrieben werden. Die wichtigsten Regeln: Halten Sie Sätze auf 10 bis 20 Wörter begrenzt, verwenden Sie für das Sprechtempo nur Punkte und Kommas, schreiben Sie alle Abkürzungen und Zahlen aus, entfernen Sie sämtliches Markdown und alle visuelle Formatierung und verwenden Sie verbale Überleitungsphrasen anstelle visueller Struktur. Homographe, technische Begriffe und ungewöhnliche Zahlenformate können zu falscher Aussprache führen. Erkennen und ersetzen Sie sie. Testen Sie immer durch Anhören der erzeugten Audiodatei und nicht durch Lesen des Textes.

Häufig gestellte Fragen

Ist die Lektion „TTS-Prompt-Muster für natürliche Sprache“ kostenlos?

Ja — der vollständige Text von „TTS-Prompt-Muster für natürliche Sprache“ ist hier im Web kostenlos zu lesen. Um sie interaktiv zu üben (integrierter Code-Editor und 24/7 KI-Tutor) und den Rest des AI Prompt Engineering-Kurses freizuschalten, upgrade auf CoddyKit PRO. Der AI Prompt Engineering-Kurs umfasst insgesamt 4 Lektionen.

Was lerne ich in „TTS-Prompt-Muster für natürliche Sprache“?

Satzbau, Zeichensetzung und Hinweise zum Sprechtempo, die die TTS-Ausgabe verbessern. Du übst AI Prompt Engineering mit praktischem Code, den du direkt im Browser ausführst, und ein 24/7 KI-Tutor beantwortet deine Fragen während du die Lektion bearbeitest.

Brauche ich Erfahrung, um AI Prompt Engineering zu starten?

Keine Vorkenntnisse erforderlich. AI Prompt Engineering auf CoddyKit ist für Anfänger bis fortgeschrittene Lernende strukturiert, sodass du hier starten oder von Anfang an beginnen und in deinem eigenen Tempo voranschreiten kannst. Dies ist Lektion 1 von 4.

Wie lange dauert die Lektion „TTS-Prompt-Muster für natürliche Sprache“?

Die meisten CoddyKit-Lektionen dauern etwa 5–10 Minuten. Jede ist kompakt und interaktiv, sodass du stetig Fortschritte machst und genau dort weitermachst, wo du aufgehört hast – im Web und in der App.

Kann ich in dieser AI Prompt Engineering-Lektion Code schreiben und ausführen?

Ja. Jede AI Prompt Engineering-Lektion enthält einen integrierten Code-Editor, sodass du echten Code direkt in deinem Browser schreibst und ausführst und sofort KI-Feedback erhältst — ohne lokale Einrichtung erforderlich.

Alle Lektionen in diesem Kurs

  1. TTS-Prompt-Muster für natürliche Sprache
  2. SSML- und Prosodie-Steuerung
  3. Persona-Design für Voice AI
  4. Multimodale Sprach- und Textagenten
← Zurück zu AI Prompt Engineering