Бюджеты токенов на каждый шаг
Ограничивайте число токенов на входе и выходе каждого узла, чтобы зациклившийся процесс не разорил вас
«Бюджеты токенов на каждый шаг» — бесплатный урок AI Agents на CoddyKit. Это урок 1 из 4. Ты можешь прочитать весь урок бесплатно ниже — а потом практиковать его прямо в браузере с встроенным редактором кода и ИИ-репетитором 24/7. Это часть пути обучения AI Agents, и твой прогресс синхронизируется между веб-версией и приложением CoddyKit. Курс AI Agents содержит 4 уроков всего.
Токены стоят денег
Каждый отправленный или полученный токен требует денег и времени. Производственные агенты отслеживают использование токенов на каждом шаге и устанавливают ограничения.
Ограничивайте максимальное число токенов повсюду
Всегда задавайте максимальное число токенов при каждом вызове. Без этого ошибочный промпт может привести к созданию ответов длиной 10 000 токенов:
response = client.chat.completions.create(
model='gpt-4o-mini',
messages=messages,
max_tokens=1024, # cap per response
)Ограничения для каждого шага цикла агента
Для разных шагов нужны разные бюджеты:
STEP_BUDGETS = {
'planner': 512,
'classifier': 64,
'final_synthesis': 2048,
'tool_call': 256
}
response = client.chat.completions.create(
model=model,
messages=messages,
max_tokens=STEP_BUDGETS[step_name]
)Сокращайте входные токены
Входные токены тоже стоят денег. Агрессивно сокращайте их объём:
import tiktoken
enc = tiktoken.encoding_for_model('gpt-4o-mini')
def trim_to_budget(text, max_tokens=4000):
toks = enc.encode(text)
if len(toks) > max_tokens:
return enc.decode(toks[:max_tokens])
return textОбщий бюджет одного запуска
Суммируйте входные и выходные токены на всех шагах и прерывайте выполнение при превышении лимита:
MAX_TOKENS_PER_RUN = 50_000
total = 0
for step in agent_steps:
r = call_step(step)
total += r.usage.total_tokens
if total > MAX_TOKENS_PER_RUN:
return 'Budget exhausted; partial result'Ограничения стоимости в долларах
Иногда бюджет в долларах оказывается более наглядным:
PRICES = {'gpt-4o-mini': {'in': 0.15e-6, 'out': 0.60e-6}}
for step in agent_steps:
r = call_step(step)
cost = r.usage.prompt_tokens * PRICES[model]['in'] + r.usage.completion_tokens * PRICES[model]['out']
total_cost += cost
if total_cost > MAX_COST_PER_RUN:
breakАдаптивные бюджеты
Тратьте больше токенов на самые сложные шаги:
if step_difficulty == 'easy':
max_tokens = 256
elif step_difficulty == 'hard':
max_tokens = 2048Оценка длины вывода
Иногда спрашивайте модель, какой должна быть длина ответа:
preview = llm.invoke(f'How many tokens (approx) does {question} need to answer?').content
budget = parse_int(preview, default=512)
final = llm.invoke(question, max_tokens=budget)Сокращайте результаты инструментов
Большие результаты инструментов (HTML, журналы) раздувают контекст. Сокращайте их перед отправкой модели:
tool_result = run_tool(...)
text = json.dumps(tool_result)
if len(text) > 4000:
text = text[:4000] + '\n...[truncated]'Сжимайте историю
В длинных беседах суммируйте старые сообщения, чтобы экономить токены:
if total_message_tokens(messages) > 8000:
messages = compact(messages)Формат вывода влияет на число токенов
JSON многословен. Для коротких структурированных ответов рассмотрите:
- Один аргумент вызова инструмента
- Список, разделённый запятыми
- Компактный пользовательский формат
Отслеживайте распределение токенов
Гистограммы по шагам показывают, какие шаги следует оптимизировать:
metrics.observe('step.planner.tokens', r.usage.total_tokens, tags={'agent': 'qa'})Зачем задавать максимальное число токенов?
Зачем задавать максимальное число токенов при каждом вызове LLM?
Итоги
Ограничивайте максимальное число токенов при каждом вызове. Сокращайте входные данные. Устанавливайте бюджеты для каждого шага. Задавайте общие ограничения для запуска. Отслеживайте распределения. Сжимайте историю.
Часто задаваемые вопросы
Урок «Бюджеты токенов на каждый шаг» бесплатный?
Да — полный текст урока «Бюджеты токенов на каждый шаг» бесплатно доступен здесь в веб-версии. Чтобы практиковать его интерактивно (встроенный редактор кода и ИИ-репетитор 24/7) и разблокировать остальной курс AI Agents, подпишись на CoddyKit PRO. Курс AI Agents содержит 4 уроков всего.
Чему я научусь в уроке «Бюджеты токенов на каждый шаг»?
Ограничивайте число токенов на входе и выходе каждого узла, чтобы зациклившийся процесс не разорил вас Ты практикуешь AI Agents с помощью реального кода, который запускаешь прямо в браузере, и ИИ-репетитор 24/7 отвечает на твои вопросы во время урока.
Нужен ли мне опыт, чтобы начать AI Agents?
Предыдущий опыт не требуется. AI Agents на CoddyKit структурирован для всех уровней — от новичков до продвинутых, поэтому ты можешь начать отсюда или с самого начала и учиться в своем темпе. Это урок 1 из 4.
Сколько времени занимает урок «Бюджеты токенов на каждый шаг»?
Большинство уроков CoddyKit занимают около 5–10 минут. Каждый из них компактный и интерактивный, поэтому ты постоянно делаешь прогресс и продолжаешь с того же места в веб-версии и приложении.
Можно ли писать и запускать код в этом уроке AI Agents?
Да. Каждый урок AI Agents включает встроенный редактор кода, поэтому ты пишешь и запускаешь реальный код прямо в браузере и получаешь моментальную обратную связь от AI — локальная установка не требуется.
Все уроки этого курса
- Бюджеты токенов на каждый шаг
- Маршрутизация моделей (от дешёвых к дорогим)
- Кэширование подсказок и результатов (Anthropic, Vertex)
- Квантизация и спекулятивное декодирование