AI Prompt Engineering · Урок

Проектирование персоны голосового искусственного интеллекта

Создание последовательных голосовых персон: тон, манера речи и характер.

Урок 3 из 413 шагов

«Проектирование персоны голосового искусственного интеллекта» — бесплатный урок AI Prompt Engineering на CoddyKit. Это урок 3 из 4. Ты можешь прочитать весь урок бесплатно ниже — а потом практиковать его прямо в браузере с встроенным редактором кода и ИИ-репетитором 24/7. Это часть пути обучения AI Prompt Engineering, и твой прогресс синхронизируется между веб-версией и приложением CoddyKit. Курс AI Prompt Engineering содержит 4 уроков всего.

Что такое персона голосового ИИ

Персона голосового ИИ — это целостный образ, который система голосового ИИ представляет пользователям. Речь идёт не только о выборе голоса TTS: персона объединяет тональность, словарный запас, темп речи, личностные черты и последовательное поведение, благодаря которым ИИ воспринимается как самостоятельная сущность.

Хорошо продуманные персоны укрепляют доверие пользователей и делают взаимодействие естественным. Плохо продуманные кажутся роботизированными, непоследовательными или жутковатыми.

Четыре измерения голосовой персоны

Голосовая персона определяется через четыре измерения:

  • Тон: Эмоциональная окраска (тёплая, профессиональная, игривая, серьёзная)
  • Уровень лексики: Простая разговорная речь или техническая и формальная
  • Темп речи: Естественная скорость речи персоны и паузы
  • Черты характера: Конкретные особенности поведения (эмпатичная, лаконичная, любознательная)

Все четыре измерения должны быть согласованы — тёплый тон в сочетании с техническим jargon создаёт диссонанс.

Определение тона в системных инструкциях

Системная инструкция — это место, где Вы задаёте голосовую персону. Конкретно опишите тон: расплывчатые указания вроде «будьте дружелюбны» дают непоследовательные результаты. Назовите эмоции, приведите примеры и опишите, что персона NOT делает.

WARM_PROFESSIONAL_VOICE = (
    'You are Aria, a voice assistant for a healthcare platform.\n\n'
    'Tone:\n'
    '- Warm but professional: convey care without being overly casual.\n'
    '- Never alarmist: deliver health information calmly and clearly.\n'
    '- Empathetic: acknowledge emotions before jumping to information.\n'
    '  Example: "That sounds stressful. Let me help you find an answer."\n\n'
    'NOT: cold, clinical, robotic, condescending, or dismissive.\n\n'
    'Vocabulary:\n'
    '- Use plain language. Explain medical terms when you use them.\n'
    '- Avoid jargon unless the user introduced it first.\n\n'
    'Speech style:\n'
    '- Short sentences. One idea per sentence.\n'
    '- Never use bullet points or lists. Speak in connected prose.\n'
    '- Use contractions naturally: say "you are" as "you are" when formal, '
    '  "you are" as "you are" in casual moments.'
)
print(WARM_PROFESSIONAL_VOICE[:300])

Настройка уровня лексики

Уровень лексики определяет, насколько доступным Ваш голосовой ИИ кажется разным пользователям. Явно задайте его в системной инструкции с помощью конкретных примеров и контрпримеров.

# Three vocabulary level examples:

SIMPLE_VOCABULARY = (
    'Use simple, everyday words. '
    'If you need to use a complex word, explain it right away.\n'
    'Say "heart" not "cardiac". '
    'Say "get worse" not "deteriorate". '
    'Say "check" not "verify". '
    'Target a reading level of grade 8.'
)

MEDIUM_VOCABULARY = (
    'Use professional but accessible language. '
    'Technical terms are acceptable if they are widely known in the field.\n'
    'Assume the user has basic familiarity with the domain. '
    'Define specialized jargon on first use.'
)

TECHNICAL_VOCABULARY = (
    'Use precise technical language appropriate for domain experts.\n'
    'Assume the user is a professional with years of experience.\n'
    'Do not over-explain concepts that any expert would know.'
)

print('Level selection is critical for user trust and comprehension')

Фразы и речевые шаблоны

Последовательные речевые шаблоны укрепляют идентичность персоны. Фирменные фразы, формулы приветствия и переходные фразы помогают воспринимать голос как настоящего персонажа, а не как безликую систему.

# Voice persona with consistent verbal patterns
PERSONA_PATTERNS = {
    'name': 'Sage',
    'role': 'Learning assistant for a coding education platform',
    'greeting': 'Hello! Ready to learn something new today?',
    'encouragement': [
        'Great question.',
        'You are on the right track.',
        'Let us work through this together.',
    ],
    'transition': [
        'Here is the key idea.',
        'Think of it this way.',
        'Let me break that down.',
    ],
    'closing': 'Give it a try, and come back if you get stuck.',
    'correction': 'Not quite, but you are close. Let me clarify.',
}

SAGE_SYSTEM = (
    f'You are {PERSONA_PATTERNS["name"]}, {PERSONA_PATTERNS["role"]}.\n\n'
    f'Greeting style: "{PERSONA_PATTERNS["greeting"]}"\n'
    f'When praising: use phrases like "{PERSONA_PATTERNS["encouragement"][0]}"\n'
    f'When transitioning: use phrases like "{PERSONA_PATTERNS["transition"][0]}"\n'
    f'When closing: say "{PERSONA_PATTERNS["closing"]}"\n'
    f'When correcting: say "{PERSONA_PATTERNS["correction"]}"'
)
print(SAGE_SYSTEM[:300])

Темп речи в системных инструкциях

В системной инструкции нельзя напрямую управлять скоростью TTS, но можно влиять на неё, контролируя длину предложений, количество пауз (с помощью подсказок SSML) и плотность текста. Дайте LLM указание писать материал так, чтобы при озвучивании с помощью TTS получался нужный темп.

# Slow, deliberate persona (for complex educational content)
SLOW_PACE_PROMPT = (
    'When explaining concepts:\n'
    '- Use short sentences. Maximum 12 words each.\n'
    '- State each idea, then pause (use a period).\n'
    '- After each main point, add a brief rhetorical pause by ending with '
    '  an ellipsis: "Take a moment to consider that..."\n'
    '- Repeat key terms twice when they are first introduced.\n'
    '- Never rush through lists. Introduce each item separately.'
)

# Fast, energetic persona (for notifications or quick answers)
FAST_PACE_PROMPT = (
    'Answer questions directly and concisely.\n'
    'Lead with the answer, then add context only if essential.\n'
    'Limit responses to 2-3 sentences.\n'
    'Use active voice. Start sentences with the subject.\n'
    'Avoid preambles like "Great question" or "Certainly".'
)
print('Pace is shaped by sentence structure, not just words per minute')

Согласованность персоны в разных темах

Самая сложная часть разработки персоны — сохранять согласованность, когда разговор переходит с одной темы на другую. Персона должна звучать как один и тот же герой и при обсуждении технической ошибки, и при ответе на вопрос о платеже.

import anthropic

client = anthropic.Anthropic(api_key='sk-ant-...')

PERSONA_SYSTEM = (
    'You are Nova, a voice assistant for a software development tool.\n\n'
    'Core personality: Precise, calm, slightly playful. '
    'You enjoy problem-solving. You never show frustration.\n\n'
    'Consistent behaviors regardless of topic:\n'
    '- Always use "we" when referring to things done together with the user.\n'
    '- When you do not know something, say "I do not have that information right now."\n'
    '  Never say "I cannot help with that."\n'
    '- When something is complex, say "Let us take this one step at a time."\n'
    '- Close long explanations with "Does that make sense?"'
)

def ask_nova(question):
    r = client.messages.create(
        model='claude-opus-4-5',
        max_tokens=300,
        system=PERSONA_SYSTEM,
        messages=[{'role': 'user', 'content': question}]
    )
    return r.content[0].text

print(ask_nova('Why is my build failing?')[:200])
print(ask_nova('How do I update my credit card?')[:200])

Эмоциональная окраска: сложные моменты

Голосовым персонам нужны явные указания для эмоционально напряжённых взаимодействий — общения с раздражёнными пользователями, чувствительных тем и сценариев с ошибками. Персона должна отвечать с должной эмоциональной чуткостью.

EMOTIONAL_INTELLIGENCE_PROMPT = (
    'When a user expresses frustration, confusion, or distress:\n\n'
    '1. ACKNOWLEDGE first: Validate the emotion before giving information.\n'
    '   Example: "I understand this is frustrating. Let us fix it together."\n\n'
    '2. SLOW DOWN: Use shorter, clearer sentences than usual.\n\n'
    '3. AVOID jargon when the user is already confused.\n\n'
    '4. OFFER agency: Give the user a clear next step they can take.\n'
    '   Example: "Here is what you can do right now."\n\n'
    '5. CLOSE with reassurance: End with a positive, forward-looking statement.\n'
    '   Example: "You have got this. I am here if you need more help."\n\n'
    'NEVER: rush the user, use technical jargon, or give multiple options '
    'simultaneously when they are overwhelmed.'
)
print(EMOTIONAL_INTELLIGENCE_PROMPT[:300])

Голосовая персона для разных каналов

Одной и той же персоне может потребоваться адаптация для разных каналов развертывания: телефонной системы IVR, умной колонки, голосового помощника в приложении или бота колл-центра. У каждого канала свои акустические характеристики и ожидания пользователей.

# Channel-specific persona adjustments

IVR_ADJUSTMENTS = (
    'You are speaking to a caller on a phone IVR system.\n'
    '- Callers cannot see any text. Speak clearly and slowly.\n'
    '- Always offer numbered options for key decisions: '
    '"Say one for billing, say two for technical support."\n'
    '- Confirm actions before executing: "You said billing. Is that correct?"\n'
    '- Speak phone numbers and reference codes digit by digit.'
)

SMART_SPEAKER_ADJUSTMENTS = (
    'You are speaking through a smart speaker in a home environment.\n'
    '- Users may be across the room. Speak clearly at a moderate pace.\n'
    '- Keep answers short — under 30 seconds of speech.\n'
    '- Offer to continue: "Would you like more details?"\n'
    '- Avoid visual references: never say "see the chart" or "tap here".'
)

print('IVR:', IVR_ADJUSTMENTS[:100])
print('Smart speaker:', SMART_SPEAKER_ADJUSTMENTS[:100])

Проверка согласованности персоны

Проведите тест согласованности персоны: задайте одному и тому же ИИ набор разнообразных вопросов и проверьте, воспринимаются ли тон, лексика и характер как принадлежащие одному и тому же герою во всех ответах.

import anthropic

client = anthropic.Anthropic(api_key='sk-ant-...')

TEST_QUESTIONS = [
    'Hello, who are you?',
    'My account is locked and I am frustrated.',
    'Can you explain what an API is?',
    'What is the weather like today?',  # Out of scope question
    'Thank you, you were very helpful!',
]

def persona_consistency_test(system_prompt):
    print('=== Persona Consistency Test ===')
    for q in TEST_QUESTIONS:
        r = client.messages.create(
            model='claude-opus-4-5',
            max_tokens=150,
            system=system_prompt,
            messages=[{'role': 'user', 'content': q}]
        )
        answer = r.content[0].text
        print(f'Q: {q}')
        print(f'A: {answer[:100]}\n')
        # Review manually: same tone? same vocabulary level? same personality?

persona_consistency_test(PERSONA_SYSTEM)

Границы персоны и запросы вне её образа

Голосовые персоны должны корректно обрабатывать запросы, выходящие за пределы их определённой области применения. Если пользователь спрашивает кулинарного помощника о торговле акциями, персона должна вежливо отказать, не выходя из образа и не звуча механически.

Явно задайте ответы на запросы вне образа в системной инструкции: тепло признайте запрос, кратко объясните область применения персоны и переведите разговор к тому, с чем персона может помочь. Тон отказа не менее важен, чем его содержание.

Проверка знаний: измерение голосовой персоны

Какой элемент является MOST важным, чтобы голосовая персона ИИ сохраняла согласованность в разных темах разговора?

Итоги: разработка персоны голосового ИИ

Голосовая персона ИИ определяется четырьмя измерениями: тоном (эмоциональной окраской), уровнем лексики, темпом речи и согласованными чертами характера. Все четыре должны сочетаться — тёплый тон в сочетании с техническим jargon создаёт диссонанс. Задайте персону в системной инструкции с помощью конкретных примеров и контрпримеров. Фирменные фразы и речевые шаблоны (приветствия, переходы, завершения) укрепляют её идентичность. Добавьте указания по эмоциональной чуткости при общении с раздражёнными или растерянными пользователями. Адаптируйте персону к каналу развертывания (IVR, умная колонка, приложение). Проверяйте согласованность, задавая разнообразные вопросы и оценивая, звучат ли ответы как речь одного и того же героя.

Можно начать бесплатно

Изучай AI Prompt Engineering с ИИ-репетитором — бесплатно

Пиши и запускай код прямо в браузере, получай мгновенную помощь от ИИ-репетитора 24/7 и продолжи учиться на сайте или в приложении.

Курсы
53
Уроки
199

Часто задаваемые вопросы

Урок «Проектирование персоны голосового искусственного интеллекта» бесплатный?

Да — полный текст урока «Проектирование персоны голосового искусственного интеллекта» бесплатно доступен здесь в веб-версии. Чтобы практиковать его интерактивно (встроенный редактор кода и ИИ-репетитор 24/7) и разблокировать остальной курс AI Prompt Engineering, подпишись на CoddyKit PRO. Курс AI Prompt Engineering содержит 4 уроков всего.

Чему я научусь в уроке «Проектирование персоны голосового искусственного интеллекта»?

Создание последовательных голосовых персон: тон, манера речи и характер. Ты практикуешь AI Prompt Engineering с помощью реального кода, который запускаешь прямо в браузере, и ИИ-репетитор 24/7 отвечает на твои вопросы во время урока.

Нужен ли мне опыт, чтобы начать AI Prompt Engineering?

Предыдущий опыт не требуется. AI Prompt Engineering на CoddyKit структурирован для всех уровней — от новичков до продвинутых, поэтому ты можешь начать отсюда или с самого начала и учиться в своем темпе. Это урок 3 из 4.

Сколько времени занимает урок «Проектирование персоны голосового искусственного интеллекта»?

Большинство уроков CoddyKit занимают около 5–10 минут. Каждый из них компактный и интерактивный, поэтому ты постоянно делаешь прогресс и продолжаешь с того же места в веб-версии и приложении.

Можно ли писать и запускать код в этом уроке AI Prompt Engineering?

Да. Каждый урок AI Prompt Engineering включает встроенный редактор кода, поэтому ты пишешь и запускаешь реальный код прямо в браузере и получаешь моментальную обратную связь от AI — локальная установка не требуется.

Все уроки этого курса

  1. Шаблоны запросов TTS для естественной речи
  2. SSML и управление просодикой
  3. Проектирование персоны голосового искусственного интеллекта
  4. Мультимодальные голосовые и текстовые агенты
← Назад к AI Prompt Engineering