0Pricing
AI Agents · Lezione

Budget di token per passaggio

Limiti i token di input e output per ogni nodo, così un ciclo incontrollato non potrà prosciugare il budget

Budget di token per passaggio è una lezione AI Agents gratuita su CoddyKit. Questa è la lezione 1 di 4. Puoi leggere la lezione completa qui gratuitamente — poi esercitati direttamente nel browser con un editor di codice integrato e un tutor IA disponibile 24/7. Fa parte del percorso di apprendimento AI Agents, e i tuoi progressi si sincronizzano tra il web e l'app CoddyKit. Il corso AI Agents include 4 lezioni in totale.

I token hanno un costo

Ogni token inviato o ricevuto costa denaro e tempo. Gli agenti in produzione monitorano l'utilizzo dei token a ogni passaggio e impongono dei limiti.

Impostare max_tokens ovunque

Impostate sempre max_tokens in ogni chiamata. Senza questo limite, un prompt difettoso può produrre risposte di 10.000 token:

response = client.chat.completions.create(
    model='gpt-4o-mini',
    messages=messages,
    max_tokens=1024,   # cap per response
)

Limiti per passaggio in un ciclo dell'agente

Passaggi diversi richiedono budget diversi:

STEP_BUDGETS = {
    'planner': 512,
    'classifier': 64,
    'final_synthesis': 2048,
    'tool_call': 256
}

response = client.chat.completions.create(
    model=model,
    messages=messages,
    max_tokens=STEP_BUDGETS[step_name]
)

Ridurre i token di input

Anche i token di input hanno un costo. Riduceteli in modo deciso:

import tiktoken
enc = tiktoken.encoding_for_model('gpt-4o-mini')

def trim_to_budget(text, max_tokens=4000):
    toks = enc.encode(text)
    if len(toks) > max_tokens:
        return enc.decode(toks[:max_tokens])
    return text

Budget totale per esecuzione

Sommatе input e output di tutti i passaggi; interrompete l'esecuzione se il limite viene superato:

MAX_TOKENS_PER_RUN = 50_000
total = 0
for step in agent_steps:
    r = call_step(step)
    total += r.usage.total_tokens
    if total > MAX_TOKENS_PER_RUN:
        return 'Budget exhausted; partial result'

Limiti di costo in dollari

A volte è più utile definire il budget in dollari:

PRICES = {'gpt-4o-mini': {'in': 0.15e-6, 'out': 0.60e-6}}

for step in agent_steps:
    r = call_step(step)
    cost = r.usage.prompt_tokens * PRICES[model]['in'] + r.usage.completion_tokens * PRICES[model]['out']
    total_cost += cost
    if total_cost > MAX_COST_PER_RUN:
        break

Budget adattivi

Dedicate più token ai passaggi più difficili:

if step_difficulty == 'easy':
    max_tokens = 256
elif step_difficulty == 'hard':
    max_tokens = 2048

Stima della lunghezza dell'output

A volte chiedete al modello quanto dovrebbe essere lunga la risposta:

preview = llm.invoke(f'How many tokens (approx) does {question} need to answer?').content
budget = parse_int(preview, default=512)
final = llm.invoke(question, max_tokens=budget)

Troncare gli output degli strumenti

Gli output voluminosi degli strumenti (HTML, log) appesantiscono il contesto. Troncateli prima di inviarli al modello:

tool_result = run_tool(...)
text = json.dumps(tool_result)
if len(text) > 4000:
    text = text[:4000] + '\n...[truncated]'

Comprimere la cronologia

Per le conversazioni lunghe, riassumete i turni più vecchi per risparmiare token:

if total_message_tokens(messages) > 8000:
    messages = compact(messages)

Il formato dell'output influisce sui token

JSON è prolisso. Per risposte strutturate brevi, valutate:

  • Un singolo argomento di chiamata allo strumento
  • Un elenco separato da virgole
  • Un formato personalizzato compatto

Monitorare la distribuzione dei token

Gli istogrammi per passaggio rivelano quali passaggi ottimizzare:

metrics.observe('step.planner.tokens', r.usage.total_tokens, tags={'agent': 'qa'})

Perché max_tokens?

Perché impostare max_tokens in ogni chiamata a un LLM?

Riepilogo

Impostate un limite max_tokens in ogni chiamata. Riducete gli input. Definite budget per passaggio. Impostate limiti totali per esecuzione. Monitorate le distribuzioni. Comprimete la cronologia.

Domande Frequenti

La lezione «Budget di token per passaggio» è gratuita?

Sì — il testo completo di «Budget di token per passaggio» è gratuito qui sul web. Per esercitarvi in modo interattivo (un editor di codice integrato e un tutor IA 24/7) e sbloccare il resto del corso AI Agents, passa a CoddyKit PRO. Il corso AI Agents include 4 lezioni in totale.

Cosa imparerò in «Budget di token per passaggio»?

Limiti i token di input e output per ogni nodo, così un ciclo incontrollato non potrà prosciugare il budget Eserciti AI Agents con codice pratico che esegui direttamente nel browser, e un tutor IA 24/7 risponde alle tue domande mentre lavori sulla lezione.

Ho bisogno di esperienza per iniziare AI Agents?

Non è richiesta alcuna esperienza precedente. AI Agents su CoddyKit è strutturato per principianti e studenti avanzati, quindi puoi iniziare da qui o dall'inizio e procedere al tuo ritmo. Questa è la lezione 1 di 4.

Quanto tempo richiede la lezione «Budget di token per passaggio»?

La maggior parte delle lezioni CoddyKit richiede circa 5–10 minuti. Ogni lezione è breve e interattiva, quindi fai progressi costanti e riprendi esattamente da dove hai lasciato su web e app.

Posso scrivere ed eseguire codice in questa lezione AI Agents?

Sì. Ogni lezione AI Agents include un editor di codice integrato, quindi scrivi ed esegui codice reale direttamente nel tuo browser e ricevi feedback istantaneo dall'IA — nessuna configurazione locale necessaria.

Tutte le lezioni di questo corso

  1. Budget di token per passaggio
  2. Instradamento dei modelli (da economico a costoso)
  3. Caching di prompt e risultati (Anthropic, Vertex)
  4. Quantizzazione e decodifica speculativa
← Torna a AI Agents