0Pricing
AI Prompt Engineering · Урок

Чтение и оценка результатов искусственного интеллекта

Критерии оценки релевантности, точности и полноты ответов искусственного интеллекта.

«Чтение и оценка результатов искусственного интеллекта» — бесплатный урок AI Prompt Engineering на CoddyKit. Это урок 1 из 4. Ты можешь прочитать весь урок бесплатно ниже — а потом практиковать его прямо в браузере с встроенным редактором кода и ИИ-репетитором 24/7. Это часть пути обучения AI Prompt Engineering, и твой прогресс синхронизируется между веб-версией и приложением CoddyKit. Курс AI Prompt Engineering содержит 4 уроков всего.

Почему важна оценка

Получить ответ искусственного интеллекта — только половина работы. Вторая половина — оценить, действительно ли этот ответ хорош.

Без чёткой системы оценки Вы можете принять ответ, который выглядит безупречно, но отвечает не на тот вопрос, или отклонить действительно полезный ответ, потому что он оформлен не так, как Вы ожидали.

Развитие надёжного навыка оценки качества ответов искусственного интеллекта — один из самых практичных навыков при разработке запросов.

Четыре критерия оценки

Оценивая ответ искусственного интеллекта, проверьте четыре аспекта:

  • Соответствие — отвечает ли он на Ваш фактический вопрос?
  • Точность — соответствует ли информация фактам?
  • Полнота — охватывает ли ответ все части запроса?
  • Формат — структурирован ли он так, как Вам нужно?

Ответ может получить высокую оценку по трём критериям и не пройти по четвёртому. Каждый критерий важен независимо от остальных.

Критерий 1: Релевантность

Релевантность показывает, ответила ли модель именно на заданный Вами вопрос или на связанный, но другой вопрос.

Пример: Вы спрашиваете "Каковы риски использования LLM в здравоохранении?", а модель отвечает общим обзором принципов работы LLM. Такой ответ может быть точным, но он нерелевантен — модель упустила суть вопроса.

Чтобы проверить релевантность, перечитайте исходный запрос и спросите себя: отвечает ли этот ответ непосредственно на мой вопрос?

Критерий 2: Точность

Точность показывает, верны ли факты, цифры и утверждения в ответе.

Модели ИИ могут галлюцинировать — они могут уверенно сообщать то, что на самом деле неверно. К распространённым проблемам с точностью относятся:

  • Неверная статистика или даты
  • Ошибочно приписанные цитаты
  • Устаревшая информация, представленная как актуальная
  • Вымышленные источники или ссылки

В случае фактических тем всегда проверяйте ключевые утверждения по надёжному источнику, прежде чем использовать результат.

Критерий 3: Полнота

Полнота показывает, охватил ли ответ все части Вашего запроса.

Если Ваш запрос состоял из нескольких частей — "Объясните X, приведите три примера и предложите следующий шаг", — проверьте, что модель ответила на все три части, а не только на первую.

Модели иногда пропускают последнюю часть многочастного запроса, особенно если запрос длинный. Сопоставить ответ с запросом по пунктам — самый надёжный способ проверить полноту.

Критерий 4: Формат

Формат показывает, структурирован ли ответ нужным Вам образом.

Даже идеально точный и полный ответ может быть неудобен для использования, если его формат не подходит. Распространённые несоответствия формата:

  • Связный текст вместо маркированного списка
  • Длинное эссе вместо краткого изложения
  • Отсутствующие заголовки, которые помогли бы с навигацией
  • Код без объяснений или объяснения без кода

Проблемы с форматом часто проще всего исправить с помощью уточняющего запроса.

Простой контрольный список для оценки

Получив любой ответ ИИ, мысленно пройдите этот контрольный список:

  • Релевантность: Отвечает ли он на мой фактический вопрос?
  • Точность: Могу ли я доверять этим фактам? Что мне нужно проверить?
  • Полнота: Охватил ли ответ все части моего запроса?
  • Формат: Структурирован ли он так, чтобы я мог его использовать?

Если какой-либо критерий не выполнен, это точно подсказывает, какой уточняющий запрос следует написать. Каждый критерий points на конкретный тип коррекции.

Оценка в коде: подсчёт баллов за ответ

В Python можно создать лёгкую обёртку для оценки, которая выставляет ответу баллы по каждому критерию с помощью второго вызова LLM:

import openai

client = openai.OpenAI(api_key='sk-...')

def evaluate_response(original_prompt, response_text):
    eval_prompt = f'''You are an evaluator. Score the following AI response on a scale of 1-5 for each criterion.

Original prompt: {original_prompt}

AI response: {response_text}

Score each:
- Relevance (1-5): Did it answer the actual question?
- Accuracy (1-5): Are the facts correct? (flag any concerns)
- Completeness (1-5): Did it cover all parts of the request?
- Format (1-5): Is it structured appropriately?

Return your scores as: Relevance: X, Accuracy: X, Completeness: X, Format: X
Then a one-sentence note for any score below 4.'''

    result = client.chat.completions.create(
        model='gpt-4o-mini',
        messages=[{'role': 'user', 'content': eval_prompt}]
    )
    return result.choices[0].message.content

Сбои релевантности: распространённые закономерности

Сбои релевантности обычно проявляются в предсказуемых формах. Если научиться их распознавать, оценка будет проходить быстрее:

  • Уход от темы — модель начинает правильно, а затем переходит к связанной теме
  • Подмена вопроса — модель отвечает на более простой или лёгкий вариант Вашего вопроса
  • Чрезмерное обобщение — Вы спрашиваете о конкретном случае, а модель отвечает в общем виде
  • Игнорирование ограничения — Вы указали контекст, например «для начинающих», а модель его проигнорировала

Каждая закономерность подсказывает конкретное исправление для следующего уточняющего запроса.

Тревожные признаки неточности

Даже если Вы не можете сразу проверить утверждение, некоторые признаки указывают на более низкую точность:

  • Очень конкретные числа, приведённые без источника
  • Утверждения, которые кажутся слишком удобными или идеально соответствующими теме
  • Ссылки на исследования, научные статьи или книги с указанием названия и автора
  • Даты и номера версий, которые часто меняются
  • Конкретные сведения юридического, медицинского или финансового характера

Это не доказывает наличие ошибки, но именно такие сведения стоит перепроверить, прежде чем использовать результат в ситуации с высокими последствиями.

Как использовать оценку для написания более эффективных уточняющих запросов

Главная ценность оценки заключается в том, что каждому невыполненному критерию напрямую соответствует определённый тип уточняющего запроса:

  • Сбой релевантности → "Вы ответили на вопрос X, но я спрашивал о Y. Сосредоточьтесь на Y."
  • Сомнение в точности → "Пожалуйста, перепроверьте утверждение о Z и укажите, на чём оно основано."
  • Сбой полноты → "Вы не ответили на третью часть моего вопроса. Пожалуйста, добавьте её."
  • Сбой формата → "Перепишите это в виде маркированного списка, добавив краткое резюме в одну строку в начале."

Оценка и написание уточняющих запросов работают как замкнутый цикл обратной связи.

Проверка знаний: критерии оценки

Вы просите модель: "Перечислите 5 лучших веб-фреймворков Python и дайте од sentencesное описание каждого." Модель отвечает хорошо написанным эссе об истории Python и его развитии в веб-разработке, кратко упоминает Flask и Django, но не перечисляет 5 фреймворков.

Какой критерий этот ответ нарушает наиболее существенно?

Повторение: чтение и оценка результатов работы ИИ

Умение составлять хорошие запросы состоит из двух этапов: формулировки запроса и оценки ответа.

Четыре критерия — релевантность, точность, полнота и формат — дают Вам системный способ оценить любой результат ИИ. Каждый невыполненный критерий точно подсказывает, какой уточняющий запрос следует написать.

На следующем уроке Вы потренируетесь писать такие уточняющие запросы, чтобы исправлять конкретные типы ошибок.

Часто задаваемые вопросы

Урок «Чтение и оценка результатов искусственного интеллекта» бесплатный?

Да — полный текст урока «Чтение и оценка результатов искусственного интеллекта» бесплатно доступен здесь в веб-версии. Чтобы практиковать его интерактивно (встроенный редактор кода и ИИ-репетитор 24/7) и разблокировать остальной курс AI Prompt Engineering, подпишись на CoddyKit PRO. Курс AI Prompt Engineering содержит 4 уроков всего.

Чему я научусь в уроке «Чтение и оценка результатов искусственного интеллекта»?

Критерии оценки релевантности, точности и полноты ответов искусственного интеллекта. Ты практикуешь AI Prompt Engineering с помощью реального кода, который запускаешь прямо в браузере, и ИИ-репетитор 24/7 отвечает на твои вопросы во время урока.

Нужен ли мне опыт, чтобы начать AI Prompt Engineering?

Предыдущий опыт не требуется. AI Prompt Engineering на CoddyKit структурирован для всех уровней — от новичков до продвинутых, поэтому ты можешь начать отсюда или с самого начала и учиться в своем темпе. Это урок 1 из 4.

Сколько времени занимает урок «Чтение и оценка результатов искусственного интеллекта»?

Большинство уроков CoddyKit занимают около 5–10 минут. Каждый из них компактный и интерактивный, поэтому ты постоянно делаешь прогресс и продолжаешь с того же места в веб-версии и приложении.

Можно ли писать и запускать код в этом уроке AI Prompt Engineering?

Да. Каждый урок AI Prompt Engineering включает встроенный редактор кода, поэтому ты пишешь и запускаешь реальный код прямо в браузере и получаешь моментальную обратную связь от AI — локальная установка не требуется.

Все уроки этого курса

  1. Чтение и оценка результатов искусственного интеллекта
  2. Написание эффективных уточняющих запросов
  3. Развитие предыдущих ответов
  4. Когда уточнять, а когда начинать заново
← Назад к AI Prompt Engineering