0Pricing
AI Prompt Engineering · Lección

Diseño de personalidades para IA de voz

Cree personalidades de voz coherentes: tono, estilo de habla y personalidad.

Diseño de personalidades para IA de voz es una lección gratuita de AI Prompt Engineering en CoddyKit. Esta es la lección 3 de 4. Puedes leer la lección completa abajo gratuitamente — luego la practicas en el navegador con un editor de código integrado y un tutor de IA 24/7. Forma parte de la ruta de aprendizaje de AI Prompt Engineering, y tu progreso se sincroniza en la web y la app de CoddyKit. El curso de AI Prompt Engineering incluye 4 lecciones en total.

¿Qué es una persona de voz con IA?

Una persona de voz con IA es el personaje coherente que un sistema de IA de voz presenta a los usuarios. Es mucho más que elegir una voz de TTS: es la combinación del tono, el vocabulario, el ritmo del habla, los rasgos de personalidad y los comportamientos coherentes que hacen que la IA parezca una entidad diferenciada.

Las personas bien diseñadas generan confianza en los usuarios y hacen que las interacciones resulten naturales. Las mal diseñadas parecen robóticas, incoherentes o inquietantes.

Las cuatro dimensiones de la persona de voz

Una persona de voz se define en cuatro dimensiones:

  • Tono: Registro emocional (cálido, profesional, desenfadado, serio)
  • Nivel de vocabulario: Sencillo y conversacional frente a técnico y formal
  • Ritmo del habla: La velocidad a la que la persona habla de forma natural y hace pausas
  • Rasgos de personalidad: Comportamientos específicos (empático, conciso, curioso)

Las cuatro dimensiones deben ser coherentes: un tono cálido con jerga técnica genera disonancia.

Definición del tono en los prompts del sistema

El prompt del sistema es donde se codifica la persona de voz. Sea específico sobre el tono: instrucciones vagas como «sea amable» producen resultados incoherentes. Nombre las emociones, proporcione ejemplos y describa lo que la persona NO hace.

WARM_PROFESSIONAL_VOICE = (
    'You are Aria, a voice assistant for a healthcare platform.\n\n'
    'Tone:\n'
    '- Warm but professional: convey care without being overly casual.\n'
    '- Never alarmist: deliver health information calmly and clearly.\n'
    '- Empathetic: acknowledge emotions before jumping to information.\n'
    '  Example: "That sounds stressful. Let me help you find an answer."\n\n'
    'NOT: cold, clinical, robotic, condescending, or dismissive.\n\n'
    'Vocabulary:\n'
    '- Use plain language. Explain medical terms when you use them.\n'
    '- Avoid jargon unless the user introduced it first.\n\n'
    'Speech style:\n'
    '- Short sentences. One idea per sentence.\n'
    '- Never use bullet points or lists. Speak in connected prose.\n'
    '- Use contractions naturally: say "you are" as "you are" when formal, '
    '  "you are" as "you are" in casual moments.'
)
print(WARM_PROFESSIONAL_VOICE[:300])

Calibración del nivel de vocabulario

El nivel de vocabulario determina hasta qué punto su IA de voz resulta accesible para los usuarios. Defínalo explícitamente en el prompt del sistema con ejemplos concretos y contraejemplos.

# Three vocabulary level examples:

SIMPLE_VOCABULARY = (
    'Use simple, everyday words. '
    'If you need to use a complex word, explain it right away.\n'
    'Say "heart" not "cardiac". '
    'Say "get worse" not "deteriorate". '
    'Say "check" not "verify". '
    'Target a reading level of grade 8.'
)

MEDIUM_VOCABULARY = (
    'Use professional but accessible language. '
    'Technical terms are acceptable if they are widely known in the field.\n'
    'Assume the user has basic familiarity with the domain. '
    'Define specialized jargon on first use.'
)

TECHNICAL_VOCABULARY = (
    'Use precise technical language appropriate for domain experts.\n'
    'Assume the user is a professional with years of experience.\n'
    'Do not over-explain concepts that any expert would know.'
)

print('Level selection is critical for user trust and comprehension')

Frases distintivas y patrones verbales

Los patrones verbales coherentes refuerzan la identidad de la persona. Las frases distintivas, las fórmulas de saludo y las frases de transición hacen que la voz parezca la de un personaje real en lugar de un sistema genérico.

# Voice persona with consistent verbal patterns
PERSONA_PATTERNS = {
    'name': 'Sage',
    'role': 'Learning assistant for a coding education platform',
    'greeting': 'Hello! Ready to learn something new today?',
    'encouragement': [
        'Great question.',
        'You are on the right track.',
        'Let us work through this together.',
    ],
    'transition': [
        'Here is the key idea.',
        'Think of it this way.',
        'Let me break that down.',
    ],
    'closing': 'Give it a try, and come back if you get stuck.',
    'correction': 'Not quite, but you are close. Let me clarify.',
}

SAGE_SYSTEM = (
    f'You are {PERSONA_PATTERNS["name"]}, {PERSONA_PATTERNS["role"]}.\n\n'
    f'Greeting style: "{PERSONA_PATTERNS["greeting"]}"\n'
    f'When praising: use phrases like "{PERSONA_PATTERNS["encouragement"][0]}"\n'
    f'When transitioning: use phrases like "{PERSONA_PATTERNS["transition"][0]}"\n'
    f'When closing: say "{PERSONA_PATTERNS["closing"]}"\n'
    f'When correcting: say "{PERSONA_PATTERNS["correction"]}"'
)
print(SAGE_SYSTEM[:300])

Ritmo del habla en los prompts del sistema

No puede controlar directamente la velocidad de TTS mediante un prompt del sistema, pero sí puede influir en ella controlando la longitud de las frases, el número de pausas (mediante indicaciones SSML) y la densidad del texto. Indique al LLM que escriba contenido que, al convertirlo mediante TTS, produzca el ritmo deseado.

# Slow, deliberate persona (for complex educational content)
SLOW_PACE_PROMPT = (
    'When explaining concepts:\n'
    '- Use short sentences. Maximum 12 words each.\n'
    '- State each idea, then pause (use a period).\n'
    '- After each main point, add a brief rhetorical pause by ending with '
    '  an ellipsis: "Take a moment to consider that..."\n'
    '- Repeat key terms twice when they are first introduced.\n'
    '- Never rush through lists. Introduce each item separately.'
)

# Fast, energetic persona (for notifications or quick answers)
FAST_PACE_PROMPT = (
    'Answer questions directly and concisely.\n'
    'Lead with the answer, then add context only if essential.\n'
    'Limit responses to 2-3 sentences.\n'
    'Use active voice. Start sentences with the subject.\n'
    'Avoid preambles like "Great question" or "Certainly".'
)
print('Pace is shaped by sentence structure, not just words per minute')

Coherencia de la persona entre temas

La parte más difícil del diseño de una persona es mantener la coherencia cuando la conversación cambia de tema. La persona debe sonar como el mismo personaje tanto al hablar de un error técnico como de una consulta de facturación.

import anthropic

client = anthropic.Anthropic(api_key='sk-ant-...')

PERSONA_SYSTEM = (
    'You are Nova, a voice assistant for a software development tool.\n\n'
    'Core personality: Precise, calm, slightly playful. '
    'You enjoy problem-solving. You never show frustration.\n\n'
    'Consistent behaviors regardless of topic:\n'
    '- Always use "we" when referring to things done together with the user.\n'
    '- When you do not know something, say "I do not have that information right now."\n'
    '  Never say "I cannot help with that."\n'
    '- When something is complex, say "Let us take this one step at a time."\n'
    '- Close long explanations with "Does that make sense?"'
)

def ask_nova(question):
    r = client.messages.create(
        model='claude-opus-4-5',
        max_tokens=300,
        system=PERSONA_SYSTEM,
        messages=[{'role': 'user', 'content': question}]
    )
    return r.content[0].text

print(ask_nova('Why is my build failing?')[:200])
print(ask_nova('How do I update my credit card?')[:200])

Registro emocional: gestión de momentos difíciles

Las personas de IA de voz necesitan instrucciones explícitas para las interacciones con una fuerte carga emocional: usuarios frustrados, temas delicados y situaciones de error. La persona debe responder con una inteligencia emocional adecuada.

EMOTIONAL_INTELLIGENCE_PROMPT = (
    'When a user expresses frustration, confusion, or distress:\n\n'
    '1. ACKNOWLEDGE first: Validate the emotion before giving information.\n'
    '   Example: "I understand this is frustrating. Let us fix it together."\n\n'
    '2. SLOW DOWN: Use shorter, clearer sentences than usual.\n\n'
    '3. AVOID jargon when the user is already confused.\n\n'
    '4. OFFER agency: Give the user a clear next step they can take.\n'
    '   Example: "Here is what you can do right now."\n\n'
    '5. CLOSE with reassurance: End with a positive, forward-looking statement.\n'
    '   Example: "You have got this. I am here if you need more help."\n\n'
    'NEVER: rush the user, use technical jargon, or give multiple options '
    'simultaneously when they are overwhelmed.'
)
print(EMOTIONAL_INTELLIGENCE_PROMPT[:300])

Persona de voz para distintos canales

Es posible que la misma persona deba adaptarse a distintos canales de implementación: un sistema telefónico IVR, un altavoz inteligente, un asistente de voz integrado en una aplicación o un bot de centro de llamadas. Cada canal tiene propiedades acústicas y expectativas de los usuarios diferentes.

# Channel-specific persona adjustments

IVR_ADJUSTMENTS = (
    'You are speaking to a caller on a phone IVR system.\n'
    '- Callers cannot see any text. Speak clearly and slowly.\n'
    '- Always offer numbered options for key decisions: '
    '"Say one for billing, say two for technical support."\n'
    '- Confirm actions before executing: "You said billing. Is that correct?"\n'
    '- Speak phone numbers and reference codes digit by digit.'
)

SMART_SPEAKER_ADJUSTMENTS = (
    'You are speaking through a smart speaker in a home environment.\n'
    '- Users may be across the room. Speak clearly at a moderate pace.\n'
    '- Keep answers short — under 30 seconds of speech.\n'
    '- Offer to continue: "Would you like more details?"\n'
    '- Avoid visual references: never say "see the chart" or "tap here".'
)

print('IVR:', IVR_ADJUSTMENTS[:100])
print('Smart speaker:', SMART_SPEAKER_ADJUSTMENTS[:100])

Pruebas de coherencia de la persona

Realice una prueba de coherencia de la persona: formule al mismo sistema de IA un conjunto diverso de preguntas y compruebe si el tono, el vocabulario y la personalidad parecen corresponder al mismo personaje en todas las respuestas.

import anthropic

client = anthropic.Anthropic(api_key='sk-ant-...')

TEST_QUESTIONS = [
    'Hello, who are you?',
    'My account is locked and I am frustrated.',
    'Can you explain what an API is?',
    'What is the weather like today?',  # Out of scope question
    'Thank you, you were very helpful!',
]

def persona_consistency_test(system_prompt):
    print('=== Persona Consistency Test ===')
    for q in TEST_QUESTIONS:
        r = client.messages.create(
            model='claude-opus-4-5',
            max_tokens=150,
            system=system_prompt,
            messages=[{'role': 'user', 'content': q}]
        )
        answer = r.content[0].text
        print(f'Q: {q}')
        print(f'A: {answer[:100]}\n')
        # Review manually: same tone? same vocabulary level? same personality?

persona_consistency_test(PERSONA_SYSTEM)

Límites de la persona y solicitudes fuera de personaje

Las personas de voz deben gestionar con naturalidad las solicitudes que quedan fuera de su ámbito definido. Cuando un usuario pregunta a su asistente de cocina sobre compraventa de acciones, la persona debe rechazar la solicitud sin dejar de actuar como el personaje ni sonar robótica.

Defina explícitamente las respuestas para solicitudes fuera de personaje en el prompt del sistema: reconozca la solicitud con amabilidad, explique brevemente el ámbito de la persona y redirija la conversación hacia aquello en lo que la persona puede ayudar. El tono del rechazo es tan importante como su contenido.

Comprobación de conocimientos: dimensión de la persona de voz

¿Qué elemento es MÁS importante para que una persona de IA de voz parezca coherente en distintos temas de conversación?

Resumen: diseño de personas de IA de voz

Una persona de IA de voz se define mediante cuatro dimensiones: tono (registro emocional), nivel de vocabulario, ritmo del habla y rasgos de personalidad coherentes. Las cuatro deben estar alineadas: un tono cálido con jerga técnica genera disonancia. Codifique la persona en el prompt del sistema con ejemplos específicos y contraejemplos. Las frases distintivas y los patrones verbales (saludos, transiciones y despedidas) refuerzan la identidad. Incluya instrucciones de inteligencia emocional para usuarios frustrados o confundidos. Adapte la persona al canal de implementación (IVR, altavoz inteligente o aplicación). Compruebe la coherencia formulando preguntas diversas y revisando si las respuestas suenan como las de un mismo personaje.

Preguntas frecuentes

¿La lección «Diseño de personalidades para IA de voz» es gratis?

Sí — el texto completo de «Diseño de personalidades para IA de voz» es gratis para leer aquí en la web. Para practicarla de forma interactiva (editor de código integrado y tutor de IA 24/7) y desbloquear el resto del curso de AI Prompt Engineering, actualiza a CoddyKit PRO. El curso de AI Prompt Engineering incluye 4 lecciones en total.

¿Qué aprenderé en «Diseño de personalidades para IA de voz»?

Cree personalidades de voz coherentes: tono, estilo de habla y personalidad. Practicas AI Prompt Engineering con código real que ejecutas directamente en el navegador, y un tutor de IA 24/7 responde tus preguntas mientras trabajas en la lección.

¿Necesito experiencia previa para empezar AI Prompt Engineering?

No se requiere experiencia previa. AI Prompt Engineering en CoddyKit está estructurado para principiantes hasta estudiantes avanzados, así que puedes empezar aquí o desde el inicio y avanzar a tu ritmo. Esta es la lección 3 de 4.

¿Cuánto tiempo toma la lección «Diseño de personalidades para IA de voz»?

La mayoría de las lecciones de CoddyKit toman alrededor de 5–10 minutos. Cada una es compacta e interactiva, así que avanzas constantemente y retomas exactamente por donde dejaste en la web y la app.

¿Puedo escribir y ejecutar código en esta lección de AI Prompt Engineering?

Sí. Cada lección de AI Prompt Engineering incluye un editor de código integrado, así que escribes y ejecutas código real directamente en tu navegador y obtienes retroalimentación instantánea de IA — sin configuración local necesaria.

Todas las lecciones de este curso

  1. Patrones de prompts TTS para un habla natural
  2. SSML y control de la prosodia
  3. Diseño de personalidades para IA de voz
  4. Agentes de voz y texto multimodales
← Volver a AI Prompt Engineering