0Pricing
AI Agents · Урок

Разработка агентов на основе оценивания

Напишите оценивание до выпуска агента — это единственный способ развивать его без регрессий.

«Разработка агентов на основе оценивания» — бесплатный урок AI Agents на CoddyKit. Это урок 1 из 4. Ты можешь прочитать весь урок бесплатно ниже — а потом практиковать его прямо в браузере с встроенным редактором кода и ИИ-репетитором 24/7. Это часть пути обучения AI Agents, и твой прогресс синхронизируется между веб-версией и приложением CoddyKit. Курс AI Agents содержит 4 уроков всего.

Части этого урока еще не переведены и отображаются на английском.

Оценки — это тесты для ИИ

Вы бы не выпускали код без тестов. Та же логика применима к агентам на основе LLM: без оценок каждое изменение превращается в подбрасывание монетки.

Разработка на основе оценок (EDD) означает, что оценку нужно написать BEFORE выпуска изменения.

Цикл EDD

  1. Напишите неудачную оценку: входные данные + ожидаемое поведение
  2. Улучшайте агента, пока оценка не пройдёт
  3. Добавьте оценку в свой набор
  4. Запускайте её при каждом изменении

Что оценивать

Для агента проводите оценивание на нескольких уровнях:

  • Компонент — возвращает ли средство поиска нужные фрагменты?
  • Шаг — выбирает ли LLM правильный инструмент?
  • От начала до конца — создаёт ли агент правильный итоговый ответ?

Данные для оценивания

Каждая строка оценки содержит как минимум:

eval_example = {
    'input': 'What is our return policy?',
    'expected_output': 'mentions 30-day window',
    'expected_tool_calls': ['retrieve'],
    'metadata': {'tags': ['policy', 'common']}
}
for k, v in eval_example.items():
    print(f"{k}: {v}")

Run an Eval Suite

def run_evals(suite, agent):
    results = []
    for case in suite:
        actual = agent.run(case['input'])
        scores = [
            score_correctness(actual, case['expected_output']),
            score_tool_calls(actual.tool_calls, case['expected_tool_calls'])
        ]
        results.append({'case': case, 'actual': actual, 'scores': scores})
    return results

Интеграция с CI

Запускайте оценки при каждом PR. Если качество падает ниже порога, блокируйте слияние:

# .github/workflows/evals.yml
on: pull_request
jobs:
  evals:
    runs-on: ubuntu-latest
    steps:
      - run: python -m evals.run --fail-below 0.85

Периодичность оценивания

  • Оценки компонентов — каждый PR
  • Оценки от начала до конца — каждый PR (на выборке) + каждую ночь (полностью)
  • Рабочие трассировки -> набор оценок — еженедельно

Конвейер от рабочей среды к оценкам

Извлекайте реальные трассировки. Неудачные результаты становятся оценками на завтра:

for trace in production_traces_with_thumbs_down():
    add_to_eval_suite(trace.input, expected=trace.fixed_output_from_human)

Оценивание в LangSmith / Langfuse

Оба инструмента имеют встроенную поддержку оценивания: версионирование наборов данных, функции оценки и представления для сравнения.

Ручные выборочные проверки

Автоматические оценки не замечают стиль и нюансы. Периодически вручную читайте 20 случайных трассировок — так обнаруживаются проблемы, которые пропускают оценки.

Антипаттерн: запоминание набора оценок

Если вы настраиваете агента, пока он не пройдёт вашу оценку, а сама оценка мала, вы переобучаете его. Постоянно расширяйте оценки и меняйте разбиение на наборы для тестирования и обучения.

Поддержка набора оценок

Оценки меняются по мере развития продукта. Добавляйте случаи для новых функций и удаляйте случаи для функций, от которых отказались.

Определение EDD

Что означает разработка на основе оценок?

Итоги

Разработка на основе оценок обязательна для серьёзных агентов. Пишите оценки на каждом уровне, запускайте их в CI и расширяйте свой набор на основе рабочих трассировок.

Часто задаваемые вопросы

Урок «Разработка агентов на основе оценивания» бесплатный?

Да — полный текст урока «Разработка агентов на основе оценивания» бесплатно доступен здесь в веб-версии. Чтобы практиковать его интерактивно (встроенный редактор кода и ИИ-репетитор 24/7) и разблокировать остальной курс AI Agents, подпишись на CoddyKit PRO. Курс AI Agents содержит 4 уроков всего.

Чему я научусь в уроке «Разработка агентов на основе оценивания»?

Напишите оценивание до выпуска агента — это единственный способ развивать его без регрессий. Ты практикуешь AI Agents с помощью реального кода, который запускаешь прямо в браузере, и ИИ-репетитор 24/7 отвечает на твои вопросы во время урока.

Нужен ли мне опыт, чтобы начать AI Agents?

Предыдущий опыт не требуется. AI Agents на CoddyKit структурирован для всех уровней — от новичков до продвинутых, поэтому ты можешь начать отсюда или с самого начала и учиться в своем темпе. Это урок 1 из 4.

Сколько времени занимает урок «Разработка агентов на основе оценивания»?

Большинство уроков CoddyKit занимают около 5–10 минут. Каждый из них компактный и интерактивный, поэтому ты постоянно делаешь прогресс и продолжаешь с того же места в веб-версии и приложении.

Можно ли писать и запускать код в этом уроке AI Agents?

Да. Каждый урок AI Agents включает встроенный редактор кода, поэтому ты пишешь и запускаешь реальный код прямо в браузере и получаешь моментальную обратную связь от AI — локальная установка не требуется.

Все уроки этого курса

  1. Разработка агентов на основе оценивания
  2. Создание эталонного набора тестов
  3. Недостатки оценки с помощью LLM-судьи
  4. Наборы сравнительных тестов: SWE-Bench, GAIA, ToolBench
← Назад к AI Agents