0Pricing
AI Agents · Урок

Модели мира и прогнозирование на несколько шагов

Предсказывайте результат действия до его выполнения и выбирайте действие с наилучшим прогнозируемым исходом

«Модели мира и прогнозирование на несколько шагов» — бесплатный урок AI Agents на CoddyKit. Это урок 3 из 4. Ты можешь прочитать весь урок бесплатно ниже — а потом практиковать его прямо в браузере с встроенным редактором кода и ИИ-репетитором 24/7. Это часть пути обучения AI Agents, и твой прогресс синхронизируется между веб-версией и приложением CoddyKit. Курс AI Agents содержит 4 уроков всего.

Части этого урока еще не переведены и отображаются на английском.

Предсказывайте перед действием

Лучшие агенты не просто пробуют разные варианты — сначала предсказывают результаты, выбирают лучший вариант и только потом действуют. Это та же идея, что и расчет на несколько ходов вперед в шахматах.

Что такое модель мира

Модель мира предсказывает: каково следующее состояние S' при состоянии S, обозначенном как current, и действии A?

Для агента на базе LLM сама LLM может быть моделью мира:

prediction_prompt = '''
Current state: {state}
Proposed action: {action}
What is the most likely outcome? Return JSON: {new_state, success_probability}.
'''

Зачем нужен просмотр вперед

Некоторые действия необратимы (отправка электронного письма, удаление данных). Предварительное прогнозирование помогает избежать дорогостоящих ошибок.

Результаты других действий неясны. Прогнозирование заставляет агента думать о последствиях.

Simple 1-Step Lookahead

candidates = [a1, a2, a3]
predictions = [predict(state, a) for a in candidates]
best = max(zip(predictions, candidates), key=lambda p: p[0].success_probability)[1]
act(best)

Многошаговый просмотр вперед (поиск по дереву)

Разверните несколько шагов вперед. Для каждого кандидата предскажите результаты, а затем предскажите результаты этих результатов:

def search(state, depth=2):
    if depth == 0:
        return value(state)
    actions = candidate_actions(state)
    best_score = -math.inf
    for a in actions:
        next_state = predict(state, a)
        score = search(next_state, depth - 1)
        best_score = max(best_score, score)
    return best_score

Дерево мыслей

Yao и другие, 2023 год — расширение CoT до дерева. Агент создает несколько «путей рассуждений», оценивает каждый и разворачивает наиболее перспективный:

import random

def continue_thought(question):
    return question + ' -> idea' + str(random.randint(1, 100))

def score(t):
    return len(t)

def expand_top_k(thoughts, scores, k):
    ranked = sorted(zip(thoughts, scores), key=lambda x: -x[1])
    return [t for t, s in ranked[:k]]

def ToT(question):
    thoughts = [continue_thought(question) for _ in range(5)]
    for depth in range(2):
        scores = [score(t) for t in thoughts]
        thoughts = expand_top_k(thoughts, scores, k=3)
    return thoughts

result = ToT('How to reduce agent latency?')
print('Top thoughts:', result)

Поиск по дереву методом Монте-Карло (MCTS)

Для очень больших деревьев поиска: выбирайте случайные пути, оценивайте результаты с помощью score и передавайте оценки вверх по дереву, чтобы влиять на будущий выбор. Этот метод широко применяется в игровом ИИ и начинает использоваться в исследованиях агентов.

Стоимость просмотра вперед

Каждое предсказанное действие — это вызов LLM. Просмотр вперед с глубиной 2 и ветвлением 3 требует 9 вызовов только для выбора ONE действия. Используйте просмотр вперед только для решений с высокими последствиями.

Эвристическое отсечение

Пропускайте прогнозирование заведомо плохих действий. Предварительно отфильтруйте возможные действия с помощью недорогого классификатора или правила.

Калибруйте прогнозы

Прогнозы LLM несовершенны. Выполняйте калибровку, время от времени сравнивая предсказанные и фактические результаты:

for trace in recent_traces:
    predicted = trace.predicted_outcome
    actual = trace.actual_outcome
    log.info('prediction-accuracy', match=(predicted == actual))

Когда NOT следует использовать просмотр вперед

  • Дешевые обратимые действия — просто выполните их
  • Участки, критичные по задержке
  • Задачи с очевидными результатами

Когда TO следует использовать просмотр вперед

  • Необратимые действия (финансовые операции, коммуникация)
  • Многошаговые планы, в которых ошибки накапливаются
  • Сферы с высокими рисками (медицина, право)
  • Состязательные задачи (игры, дебаты)

Внутренний просмотр вперед в стиле o1

Модели рассуждений OpenAI o1 / o3 автоматически выполняют внутренний просмотр вперед на этапе «размышления». Они исследуют множество продолжений, прежде чем принять решение. Вам не нужно реализовывать это отдельно.

Компромисс при просмотре вперед

Какова главная стоимость многошагового просмотра вперед?

Повторение

Предсказывайте перед действием. Просмотр на один шаг вперед дешев и полезен; поиск по дереву дорог, но эффективен. Модели рассуждений (o1, o3) автоматизируют этот процесс. Используйте его умеренно.

Часто задаваемые вопросы

Урок «Модели мира и прогнозирование на несколько шагов» бесплатный?

Да — полный текст урока «Модели мира и прогнозирование на несколько шагов» бесплатно доступен здесь в веб-версии. Чтобы практиковать его интерактивно (встроенный редактор кода и ИИ-репетитор 24/7) и разблокировать остальной курс AI Agents, подпишись на CoddyKit PRO. Курс AI Agents содержит 4 уроков всего.

Чему я научусь в уроке «Модели мира и прогнозирование на несколько шагов»?

Предсказывайте результат действия до его выполнения и выбирайте действие с наилучшим прогнозируемым исходом Ты практикуешь AI Agents с помощью реального кода, который запускаешь прямо в браузере, и ИИ-репетитор 24/7 отвечает на твои вопросы во время урока.

Нужен ли мне опыт, чтобы начать AI Agents?

Предыдущий опыт не требуется. AI Agents на CoddyKit структурирован для всех уровней — от новичков до продвинутых, поэтому ты можешь начать отсюда или с самого начала и учиться в своем темпе. Это урок 3 из 4.

Сколько времени занимает урок «Модели мира и прогнозирование на несколько шагов»?

Большинство уроков CoddyKit занимают около 5–10 минут. Каждый из них компактный и интерактивный, поэтому ты постоянно делаешь прогресс и продолжаешь с того же места в веб-версии и приложении.

Можно ли писать и запускать код в этом уроке AI Agents?

Да. Каждый урок AI Agents включает встроенный редактор кода, поэтому ты пишешь и запускаешь реальный код прямо в браузере и получаешь моментальную обратную связь от AI — локальная установка не требуется.

Все уроки этого курса

  1. Иерархическая декомпозиция задач
  2. Стек целей и возврат назад
  3. Модели мира и прогнозирование на несколько шагов
  4. Циклы рефлексии и самокритики
← Назад к AI Agents