AI Agents · Lezione

Compromessi: latenza, costi e capacità

I modelli open-weight riducono i costi ma richiedono più ore di lavoro tecnico: esegua benchmark prima di impegnarsi.

Lezione 4 di 414 passaggi

Compromessi: latenza, costi e capacità è una lezione AI Agents gratuita su CoddyKit. Questa è la lezione 4 di 4. Puoi leggere la lezione completa qui gratuitamente — poi esercitati direttamente nel browser con un editor di codice integrato e un tutor IA disponibile 24/7. Fa parte del percorso di apprendimento AI Agents, e i tuoi progressi si sincronizzano tra il web e l'app CoddyKit. Il corso AI Agents include 4 lezioni in totale.

Tre dimensioni, ne scelga due

Ogni scelta del modello richiede compromessi tra:

  • Latenza — tempo per risposta
  • Costo — per milione di token
  • Capacità — qualità nelle attività complesse

Nessun modello è il migliore in tutte e tre.

Panorama delle capacità

Fascia altaFascia mediaFascia piccola
ChiusiGPT-4o, Claude Sonnet 4.5GPT-4o-mini, Haiku—
OpenLlama 3.1 405BLlama 3.1 70B, Qwen 2.5 72BLlama 3.1 8B, Phi-3

Panorama della latenza

Latenza p50 approssimativa per un turno tipico di un agente:

  • Groq Llama 3.1 70B: ~200 ms (rapidissimo)
  • gpt-4o-mini: ~600 ms
  • gpt-4o: ~1500 ms
  • Llama 70B in self-hosting su 1xH100: ~800 ms
  • Llama 8B in self-hosting su RTX 4090: ~200 ms

Costo per milione di token (approssimativo)

Stima indicativa a metà del 2025, input/output:

  • GPT-4o: $2.50 / $10
  • GPT-4o-mini: $0.15 / $0.60
  • Claude Sonnet 4.5: $3 / $15
  • Claude Haiku: $0.80 / $4
  • Together Llama 70B: $0.88 / $0.88
  • Groq Llama 70B: $0.59 / $0.79
  • Self-hosted (la propria GPU): in pratica gratuito per token

Calcoli il punto di pareggio

Il self-hosting consente di risparmiare solo oltre una determinata soglia di volume. Stima approssimativa:

GPU_COST_PER_HOUR = 1.5
GPU_TOKENS_PER_SECOND = 50
TOKENS_PER_HOUR = GPU_TOKENS_PER_SECOND * 3600
# 180,000 tokens/hour
print(f"Tokens per hour: {TOKENS_PER_HOUR:,}")
breakeven_tokens = GPU_COST_PER_HOUR / 0.6e-6
print(f"Breakeven vs $0.60/1M closed-model price: {breakeven_tokens:,.0f} tokens/hour")
print("Far above typical small-app traffic")

Routing dei modelli

Utilizzi i modelli economici come impostazione predefinita e ricorra a quelli costosi solo quando necessario:

def answer(query):
    cheap = call_model('gpt-4o-mini', query)
    if confidence(cheap) > 0.8:
        return cheap
    return call_model('gpt-4o', query)

Routing per fase

All'interno di un agente, esegua il routing per ogni fase:

  • Pianifichi con GPT-4o (ragionamento complesso)
  • Esegua le ricerche con Llama 8B (cicli economici)
  • Sintetizzi con Claude (qualità della scrittura)

Percorsi sensibili alla latenza

Per la voce o le chat in tempo reale:

  • Utilizzi Groq, SambaNova o Cerebras per ottenere meno di 200 ms
  • Esegua lo streaming dei token in modo aggressivo
  • Eviti gli agenti a più fasi nel percorso critico

Percorsi sensibili alla qualità

Per le risposte finali e le attività ad alto rischio:

  • Utilizzi il modello migliore che possa permettersi
  • Aggiunga una revisione incrociata tra modelli (GPT-4 scrive, Claude revisiona)
  • Aggiunga la verifica (esegua il codice, controlli i fatti)

Costo totale di proprietà

Il costo del self-hosting include:

  • Affitto della GPU o investimento iniziale
  • Tempo degli ingegneri per gestire l'infrastruttura
  • Monitoraggio e reperibilità
  • Throughput inferiore rispetto ai servizi in hosting

Per la maggior parte dei team, le API in hosting hanno un TCO più basso fino a volumi molto elevati.

Quando pagare per i grandi modelli closed-source

  • Risposte finali destinate agli utenti
  • Ragionamento all'avanguardia
  • Multimodalità
  • Contesto di oltre 200k token

Esegua il benchmark sulla propria attività

I benchmark pubblici raccontano solo una parte della storia. Crei un set di valutazione di 50 domande sui propri dati reali e misuri ogni modello candidato su quel set. Scelga il modello meno costoso che raggiunge la qualità richiesta.

Strategia di routing

Qual è la strategia di routing dei modelli meno costosa che consente comunque di raggiungere la qualità richiesta?

Riepilogo

Latenza, costo, capacità: ne scelga due. Utilizzi i modelli economici come impostazione predefinita e ricorra a modelli più costosi quando necessario. Le API in hosting per modelli open (Groq, Together) spesso superano entrambi gli estremi.

Gratis per iniziare

Impara AI Agents con un tutor IA — gratis

Scrivi ed esegui vero codice nel tuo browser, ricevi aiuto istantaneo da un tutor IA disponibile 24/7, e riprendi da dove hai lasciato sul web o nell'app.

Corsi
60
Lezioni
239

Domande Frequenti

La lezione «Compromessi: latenza, costi e capacità» è gratuita?

Sì — il testo completo di «Compromessi: latenza, costi e capacità» è gratuito qui sul web. Per esercitarvi in modo interattivo (un editor di codice integrato e un tutor IA 24/7) e sbloccare il resto del corso AI Agents, passa a CoddyKit PRO. Il corso AI Agents include 4 lezioni in totale.

Cosa imparerò in «Compromessi: latenza, costi e capacità»?

I modelli open-weight riducono i costi ma richiedono più ore di lavoro tecnico: esegua benchmark prima di impegnarsi. Eserciti AI Agents con codice pratico che esegui direttamente nel browser, e un tutor IA 24/7 risponde alle tue domande mentre lavori sulla lezione.

Ho bisogno di esperienza per iniziare AI Agents?

Non è richiesta alcuna esperienza precedente. AI Agents su CoddyKit è strutturato per principianti e studenti avanzati, quindi puoi iniziare da qui o dall'inizio e procedere al tuo ritmo. Questa è la lezione 4 di 4.

Quanto tempo richiede la lezione «Compromessi: latenza, costi e capacità»?

La maggior parte delle lezioni CoddyKit richiede circa 5–10 minuti. Ogni lezione è breve e interattiva, quindi fai progressi costanti e riprendi esattamente da dove hai lasciato su web e app.

Posso scrivere ed eseguire codice in questa lezione AI Agents?

Sì. Ogni lezione AI Agents include un editor di codice integrato, quindi scrivi ed esegui codice reale direttamente nel tuo browser e ricevi feedback istantaneo dall'IA — nessuna configurazione locale necessaria.

Tutte le lezioni di questo corso

  1. Panoramica su Llama, Mistral e Qwen
  2. Eseguire modelli locali con Ollama e llama.cpp
  3. Function calling con modelli open (Hermes, Functionary)
  4. Compromessi: latenza, costi e capacità
← Torna a AI Agents