Агентное рассуждение (o1, o3, модели рассуждений)
Модели, которые «думают» перед ответом: внутренние цепочки рассуждений, вычисления во время тестирования и самокорректирование
«Агентное рассуждение (o1, o3, модели рассуждений)» — бесплатный урок AI Agents на CoddyKit. Это урок 1 из 4. Ты можешь прочитать весь урок бесплатно ниже — а потом практиковать его прямо в браузере с встроенным редактором кода и ИИ-репетитором 24/7. Это часть пути обучения AI Agents, и твой прогресс синхронизируется между веб-версией и приложением CoddyKit. Курс AI Agents содержит 4 уроков всего.
Части этого урока еще не переведены и отображаются на английском.
Новый класс моделей
OpenAI o1 (сентябрь 2024 года) представила «модели рассуждений» — LLM, которые явно рассуждают шаг за шагом, прежде чем выдать видимый ответ. К их преемникам относятся o3, DeepSeek R1, Claude с расширенным мышлением, Gemini 2.5 thinking и многие другие.
Как они работают
Вместо немедленной генерации ответа модель:
- Создаёт длинную внутреннюю последовательность «рассуждений» в стиле CoT
- Рассматривает несколько подходов
- Исправляет собственные ошибки
- Затем выдаёт окончательный видимый ответ
Вычисления во время тестирования
Вы можете выбирать, сколько «рассуждений» выполняет модель. Больше токенов, потраченных на рассуждения, — лучшие ответы на сложные задачи. Компромисс заключается в увеличении задержки и стоимости.
OpenAI o-Series API
response = client.chat.completions.create(
model='o3-mini',
messages=[{'role': 'user', 'content': 'Solve this puzzle...'}],
reasoning_effort='high' # low / medium / high
)
print(response.choices[0].message.content)
print(response.usage.reasoning_tokens) # how many 'thinking' tokens were usedAnthropic Extended Thinking
response = client.messages.create(
model='claude-sonnet-4-5',
max_tokens=8192,
thinking={'type': 'enabled', 'budget_tokens': 4096},
messages=[{'role': 'user', 'content': 'Hard reasoning problem'}]
)
# response.content includes 'thinking' blocks + 'text' final answerКогда модели рассуждений особенно эффективны
- Многошаговая математика
- Генерация кода со сложной логикой
- Правовые и научные рассуждения
- Планирование, требующее учёта будущих шагов
Результаты тестов: o3 набирает более 90% в AIME и показывает высокие результаты в GPQA — намного превосходя модели без рассуждений.
Когда стандартные модели лучше
- Простой чат или вопросы и ответы — рассуждения избыточны
- Критически важная задержка — рассуждения добавляют секунды
- Массовая обработка при ограниченном бюджете — рассуждения многократно увеличивают стоимость
- Задачи на стиль или форматирование — преимуществ нет
Структура расходов
Токены рассуждений учитываются в стоимости. o3-mini при высокой интенсивности рассуждений может использовать от 10 000 до 100 000 таких токенов на один вопрос. Для более крупных моделей рассуждений это может означать от 0,10 до 1 доллара за вопрос.
Внутри циклов агента
Использование модели рассуждений в качестве планировщика внутри более крупного агента:
- Модель рассуждений: планирует, принимает решения и оценивает
- Стандартная модель: выполняет шаги
- Вызовы инструментов: выполняются обычным образом
Вы получаете лучшее из двух подходов: глубокие рассуждения там, где они важны, и недорогое выполнение в остальных случаях.
Не навязывайте CoT дополнительно
С моделями рассуждений больше не нужны инструкции вроде «давайте подумаем шаг за шагом» — они и так выполняют CoT внутри себя. Добавление такой инструкции может даже ухудшить результат.
Рассуждения в моделях с открытыми весами
DeepSeek R1, R1-Distill и другие модели привносят рассуждения в модели с открытыми весами. Они доступны на HuggingFace, Together AI и других платформах.
Передний край исследований
- Настройка рефлексии — обучение моделей самостоятельной критике
- Вывод с использованием поиска — Tree-of-Thoughts и MCTS во время вывода
- Обучение во время тестирования — адаптация весов для каждого запроса
Оговорка: рассуждения как чёрный ящик
«Мысли» модели рассуждений обычно скрыты от Вас (OpenAI) или представлены в виде краткого изложения (Anthropic). Ограниченная прозрачность усложняет отладку, поэтому вместо этого полагайтесь на оценку входных и выходных данных.
Когда использовать модели рассуждений
Для какой задачи модель рассуждений наиболее оправдывает дополнительные расходы?
Итоги
Модели рассуждений (o1, o3, R1, Claude с расширенным мышлением) обменивают время и стоимость на качество при решении сложных задач. Используйте их как планировщика или судью внутри агентов. Для простого чата они не нужны.
Часто задаваемые вопросы
Урок «Агентное рассуждение (o1, o3, модели рассуждений)» бесплатный?
Да — полный текст урока «Агентное рассуждение (o1, o3, модели рассуждений)» бесплатно доступен здесь в веб-версии. Чтобы практиковать его интерактивно (встроенный редактор кода и ИИ-репетитор 24/7) и разблокировать остальной курс AI Agents, подпишись на CoddyKit PRO. Курс AI Agents содержит 4 уроков всего.
Чему я научусь в уроке «Агентное рассуждение (o1, o3, модели рассуждений)»?
Модели, которые «думают» перед ответом: внутренние цепочки рассуждений, вычисления во время тестирования и самокорректирование Ты практикуешь AI Agents с помощью реального кода, который запускаешь прямо в браузере, и ИИ-репетитор 24/7 отвечает на твои вопросы во время урока.
Нужен ли мне опыт, чтобы начать AI Agents?
Предыдущий опыт не требуется. AI Agents на CoddyKit структурирован для всех уровней — от новичков до продвинутых, поэтому ты можешь начать отсюда или с самого начала и учиться в своем темпе. Это урок 1 из 4.
Сколько времени занимает урок «Агентное рассуждение (o1, o3, модели рассуждений)»?
Большинство уроков CoddyKit занимают около 5–10 минут. Каждый из них компактный и интерактивный, поэтому ты постоянно делаешь прогресс и продолжаешь с того же места в веб-версии и приложении.
Можно ли писать и запускать код в этом уроке AI Agents?
Да. Каждый урок AI Agents включает встроенный редактор кода, поэтому ты пишешь и запускаешь реальный код прямо в браузере и получаешь моментальную обратную связь от AI — локальная установка не требуется.
Все уроки этого курса
- Агентное рассуждение (o1, o3, модели рассуждений)
- Гибридные символические и нейронные агенты
- Мультимодальные агенты (зрение, голос и действие)
- Открытые проблемы: устойчивость, согласованность, долговременная память