Progettazione della persona per la Voice AI
Creazione di persone vocali coerenti: tono, stile espressivo e personalità
Progettazione della persona per la Voice AI è una lezione AI Prompt Engineering gratuita su CoddyKit. Questa è la lezione 3 di 4. Puoi leggere la lezione completa qui gratuitamente — poi esercitati direttamente nel browser con un editor di codice integrato e un tutor IA disponibile 24/7. Fa parte del percorso di apprendimento AI Prompt Engineering, e i tuoi progressi si sincronizzano tra il web e l'app CoddyKit. Il corso AI Prompt Engineering include 4 lezioni in totale.
Che cos'è una persona di IA vocale?
Una persona di IA vocale è il personaggio coerente che un sistema di IA vocale presenta agli utenti. È qualcosa di più della scelta di una voce TTS: è l'intersezione tra tono, vocabolario, velocità del parlato, tratti della personalità e comportamenti coerenti che fanno percepire l'IA come un'entità distinta.
Le personas ben progettate rafforzano la fiducia degli utenti e rendono naturali le interazioni. Quelle progettate male sembrano robotiche, incoerenti o inquietanti.
Le quattro dimensioni della persona vocale
Una persona vocale si definisce in base a quattro dimensioni:
- Tono: registro emotivo (caloroso, professionale, giocoso, serio)
- Livello del vocabolario: semplice e colloquiale oppure tecnico e formale
- Ritmo del parlato: la velocità con cui la persona parla naturalmente e le pause che fa
- Tratti della personalità: comportamenti specifici (empatica, concisa, curiosa)
Tutte e quattro devono essere coerenti: un tono caloroso abbinato a un gergo tecnico crea dissonanza.
Definire il tono nei prompt di sistema
Il prompt di sistema è il punto in cui si codifica la persona vocale. Sia specifico nel definire il tono: istruzioni vaghe come “sii amichevole” producono risultati incoerenti. Indichi le emozioni, fornisca esempi e descriva ciò che la persona NON fa.
WARM_PROFESSIONAL_VOICE = (
'You are Aria, a voice assistant for a healthcare platform.\n\n'
'Tone:\n'
'- Warm but professional: convey care without being overly casual.\n'
'- Never alarmist: deliver health information calmly and clearly.\n'
'- Empathetic: acknowledge emotions before jumping to information.\n'
' Example: "That sounds stressful. Let me help you find an answer."\n\n'
'NOT: cold, clinical, robotic, condescending, or dismissive.\n\n'
'Vocabulary:\n'
'- Use plain language. Explain medical terms when you use them.\n'
'- Avoid jargon unless the user introduced it first.\n\n'
'Speech style:\n'
'- Short sentences. One idea per sentence.\n'
'- Never use bullet points or lists. Speak in connected prose.\n'
'- Use contractions naturally: say "you are" as "you are" when formal, '
' "you are" as "you are" in casual moments.'
)
print(WARM_PROFESSIONAL_VOICE[:300])Calibrare il livello del vocabolario
Il livello del vocabolario determina quanto la voce della Sua IA risulti accessibile alle diverse persone. Lo definisca esplicitamente nel prompt di sistema, con esempi concreti ed esempi di ciò che va evitato.
# Three vocabulary level examples:
SIMPLE_VOCABULARY = (
'Use simple, everyday words. '
'If you need to use a complex word, explain it right away.\n'
'Say "heart" not "cardiac". '
'Say "get worse" not "deteriorate". '
'Say "check" not "verify". '
'Target a reading level of grade 8.'
)
MEDIUM_VOCABULARY = (
'Use professional but accessible language. '
'Technical terms are acceptable if they are widely known in the field.\n'
'Assume the user has basic familiarity with the domain. '
'Define specialized jargon on first use.'
)
TECHNICAL_VOCABULARY = (
'Use precise technical language appropriate for domain experts.\n'
'Assume the user is a professional with years of experience.\n'
'Do not over-explain concepts that any expert would know.'
)
print('Level selection is critical for user trust and comprehension')Frasi ricorrenti e modelli verbali
Modelli verbali coerenti rafforzano l'identità della persona. Frasi ricorrenti, formule di saluto e frasi di transizione fanno sembrare la voce quella di un personaggio reale, anziché di un sistema generico.
# Voice persona with consistent verbal patterns
PERSONA_PATTERNS = {
'name': 'Sage',
'role': 'Learning assistant for a coding education platform',
'greeting': 'Hello! Ready to learn something new today?',
'encouragement': [
'Great question.',
'You are on the right track.',
'Let us work through this together.',
],
'transition': [
'Here is the key idea.',
'Think of it this way.',
'Let me break that down.',
],
'closing': 'Give it a try, and come back if you get stuck.',
'correction': 'Not quite, but you are close. Let me clarify.',
}
SAGE_SYSTEM = (
f'You are {PERSONA_PATTERNS["name"]}, {PERSONA_PATTERNS["role"]}.\n\n'
f'Greeting style: "{PERSONA_PATTERNS["greeting"]}"\n'
f'When praising: use phrases like "{PERSONA_PATTERNS["encouragement"][0]}"\n'
f'When transitioning: use phrases like "{PERSONA_PATTERNS["transition"][0]}"\n'
f'When closing: say "{PERSONA_PATTERNS["closing"]}"\n'
f'When correcting: say "{PERSONA_PATTERNS["correction"]}"'
)
print(SAGE_SYSTEM[:300])Il ritmo del parlato nei prompt di sistema
Non è possibile controllare direttamente la velocità del TTS tramite un prompt di sistema, ma si può influenzare controllando la lunghezza delle frasi, il numero di pause (tramite indicazioni SSML) e la densità del testo. Indichi all'LLM di scrivere contenuti che, una volta convertiti dal TTS, producano il ritmo desiderato.
# Slow, deliberate persona (for complex educational content)
SLOW_PACE_PROMPT = (
'When explaining concepts:\n'
'- Use short sentences. Maximum 12 words each.\n'
'- State each idea, then pause (use a period).\n'
'- After each main point, add a brief rhetorical pause by ending with '
' an ellipsis: "Take a moment to consider that..."\n'
'- Repeat key terms twice when they are first introduced.\n'
'- Never rush through lists. Introduce each item separately.'
)
# Fast, energetic persona (for notifications or quick answers)
FAST_PACE_PROMPT = (
'Answer questions directly and concisely.\n'
'Lead with the answer, then add context only if essential.\n'
'Limit responses to 2-3 sentences.\n'
'Use active voice. Start sentences with the subject.\n'
'Avoid preambles like "Great question" or "Certainly".'
)
print('Pace is shaped by sentence structure, not just words per minute')Coerenza della persona tra argomenti diversi
La parte più difficile della progettazione di una persona consiste nel mantenerne la coerenza quando la conversazione cambia argomento. La persona dovrebbe sembrare lo stesso personaggio sia quando discute di un bug tecnico, sia quando risponde a una domanda sulla fatturazione.
import anthropic
client = anthropic.Anthropic(api_key='sk-ant-...')
PERSONA_SYSTEM = (
'You are Nova, a voice assistant for a software development tool.\n\n'
'Core personality: Precise, calm, slightly playful. '
'You enjoy problem-solving. You never show frustration.\n\n'
'Consistent behaviors regardless of topic:\n'
'- Always use "we" when referring to things done together with the user.\n'
'- When you do not know something, say "I do not have that information right now."\n'
' Never say "I cannot help with that."\n'
'- When something is complex, say "Let us take this one step at a time."\n'
'- Close long explanations with "Does that make sense?"'
)
def ask_nova(question):
r = client.messages.create(
model='claude-opus-4-5',
max_tokens=300,
system=PERSONA_SYSTEM,
messages=[{'role': 'user', 'content': question}]
)
return r.content[0].text
print(ask_nova('Why is my build failing?')[:200])
print(ask_nova('How do I update my credit card?')[:200])Registro emotivo: gestire i momenti difficili
Le persone dell'IA vocale hanno bisogno di indicazioni esplicite per le interazioni emotivamente impegnative, come utenti frustrati, argomenti delicati e scenari di errore. La persona dovrebbe rispondere con un'adeguata intelligenza emotiva.
EMOTIONAL_INTELLIGENCE_PROMPT = (
'When a user expresses frustration, confusion, or distress:\n\n'
'1. ACKNOWLEDGE first: Validate the emotion before giving information.\n'
' Example: "I understand this is frustrating. Let us fix it together."\n\n'
'2. SLOW DOWN: Use shorter, clearer sentences than usual.\n\n'
'3. AVOID jargon when the user is already confused.\n\n'
'4. OFFER agency: Give the user a clear next step they can take.\n'
' Example: "Here is what you can do right now."\n\n'
'5. CLOSE with reassurance: End with a positive, forward-looking statement.\n'
' Example: "You have got this. I am here if you need more help."\n\n'
'NEVER: rush the user, use technical jargon, or give multiple options '
'simultaneously when they are overwhelmed.'
)
print(EMOTIONAL_INTELLIGENCE_PROMPT[:300])La persona vocale per canali diversi
La stessa persona potrebbe dover essere adattata a diversi canali di distribuzione: sistema telefonico IVR, smart speaker, assistente vocale integrato nell'app o bot per call center. Ogni canale presenta proprietà acustiche e aspettative degli utenti differenti.
# Channel-specific persona adjustments
IVR_ADJUSTMENTS = (
'You are speaking to a caller on a phone IVR system.\n'
'- Callers cannot see any text. Speak clearly and slowly.\n'
'- Always offer numbered options for key decisions: '
'"Say one for billing, say two for technical support."\n'
'- Confirm actions before executing: "You said billing. Is that correct?"\n'
'- Speak phone numbers and reference codes digit by digit.'
)
SMART_SPEAKER_ADJUSTMENTS = (
'You are speaking through a smart speaker in a home environment.\n'
'- Users may be across the room. Speak clearly at a moderate pace.\n'
'- Keep answers short — under 30 seconds of speech.\n'
'- Offer to continue: "Would you like more details?"\n'
'- Avoid visual references: never say "see the chart" or "tap here".'
)
print('IVR:', IVR_ADJUSTMENTS[:100])
print('Smart speaker:', SMART_SPEAKER_ADJUSTMENTS[:100])Testare la coerenza della persona
Esegua un test di coerenza della persona: ponga alla stessa IA una serie di domande diverse e verifichi se il tono, il vocabolario e la personalità sembrano appartenere allo stesso personaggio in tutte le risposte.
import anthropic
client = anthropic.Anthropic(api_key='sk-ant-...')
TEST_QUESTIONS = [
'Hello, who are you?',
'My account is locked and I am frustrated.',
'Can you explain what an API is?',
'What is the weather like today?', # Out of scope question
'Thank you, you were very helpful!',
]
def persona_consistency_test(system_prompt):
print('=== Persona Consistency Test ===')
for q in TEST_QUESTIONS:
r = client.messages.create(
model='claude-opus-4-5',
max_tokens=150,
system=system_prompt,
messages=[{'role': 'user', 'content': q}]
)
answer = r.content[0].text
print(f'Q: {q}')
print(f'A: {answer[:100]}\n')
# Review manually: same tone? same vocabulary level? same personality?
persona_consistency_test(PERSONA_SYSTEM)Limiti della persona e richieste fuori personaggio
Le persone vocali devono gestire con naturalezza le richieste che esulano dal loro ambito definito. Quando un utente chiede al Suo assistente di cucina informazioni sul trading azionario, la persona deve rifiutare senza uscire dal personaggio né sembrare robotica.
Definisca esplicitamente le risposte alle richieste fuori persona nel prompt di sistema: riconosca la richiesta con cordialità, spieghi brevemente l'ambito della persona e reindirizzi la conversazione verso ciò su cui la persona può aiutare. Il tono del rifiuto è importante quanto il contenuto.
Verifica delle conoscenze: dimensione della persona vocale
Quale elemento è PIÙ importante per far percepire come coerente una persona dell'IA vocale tra argomenti diversi della conversazione?
Riepilogo: progettare una persona per l'IA vocale
Una persona dell'IA vocale è definita da quattro dimensioni: tono (registro emotivo), livello del vocabolario, ritmo del parlato e tratti della personalità coerenti. Tutte e quattro devono essere allineate: un tono caloroso abbinato a un gergo tecnico crea dissonanza. Codifichi la persona nel prompt di sistema con esempi specifici ed esempi di ciò che va evitato. Frasi ricorrenti e modelli verbali (saluti, transizioni, formule di chiusura) ne rafforzano l'identità. Includa indicazioni sull'intelligenza emotiva per gestire utenti frustrati o confusi. Adatti la persona al canale di distribuzione (IVR, smart speaker, app). Verifichi la coerenza ponendo domande diverse e controllando se le risposte sembrano provenire dallo stesso personaggio.
Domande Frequenti
La lezione «Progettazione della persona per la Voice AI» è gratuita?
Sì — il testo completo di «Progettazione della persona per la Voice AI» è gratuito qui sul web. Per esercitarvi in modo interattivo (un editor di codice integrato e un tutor IA 24/7) e sbloccare il resto del corso AI Prompt Engineering, passa a CoddyKit PRO. Il corso AI Prompt Engineering include 4 lezioni in totale.
Cosa imparerò in «Progettazione della persona per la Voice AI»?
Creazione di persone vocali coerenti: tono, stile espressivo e personalità Eserciti AI Prompt Engineering con codice pratico che esegui direttamente nel browser, e un tutor IA 24/7 risponde alle tue domande mentre lavori sulla lezione.
Ho bisogno di esperienza per iniziare AI Prompt Engineering?
Non è richiesta alcuna esperienza precedente. AI Prompt Engineering su CoddyKit è strutturato per principianti e studenti avanzati, quindi puoi iniziare da qui o dall'inizio e procedere al tuo ritmo. Questa è la lezione 3 di 4.
Quanto tempo richiede la lezione «Progettazione della persona per la Voice AI»?
La maggior parte delle lezioni CoddyKit richiede circa 5–10 minuti. Ogni lezione è breve e interattiva, quindi fai progressi costanti e riprendi esattamente da dove hai lasciato su web e app.
Posso scrivere ed eseguire codice in questa lezione AI Prompt Engineering?
Sì. Ogni lezione AI Prompt Engineering include un editor di codice integrato, quindi scrivi ed esegui codice reale direttamente nel tuo browser e ricevi feedback istantaneo dall'IA — nessuna configurazione locale necessaria.
Tutte le lezioni di questo corso
- Pattern di prompt TTS per un parlato naturale
- SSML e controllo della prosodia
- Progettazione della persona per la Voice AI
- Agenti vocali e testuali multimodali