0Pricing
AI Agents · Lezione

Panoramica su Llama, Mistral e Qwen

Le tre principali famiglie di modelli open-weight: licenze, dimensioni e punti di forza di ciascuna.

Panoramica su Llama, Mistral e Qwen è una lezione AI Agents gratuita su CoddyKit. Questa è la lezione 1 di 4. Puoi leggere la lezione completa qui gratuitamente — poi esercitati direttamente nel browser con un editor di codice integrato e un tutor IA disponibile 24/7. Fa parte del percorso di apprendimento AI Agents, e i tuoi progressi si sincronizzano tra il web e l'app CoddyKit. Il corso AI Agents include 4 lezioni in totale.

Parti di questa lezione non sono ancora state tradotte e vengono mostrate in inglese.

Perché l'open source?

I modelli open-weight offrono:

  • Nessun costo API per token
  • Privacy dei dati: il modello viene eseguito sul proprio hardware
  • Personalizzazione (fine-tuning) a qualsiasi scala
  • Nessun vincolo verso un fornitore

Il costo consiste nelle ore di lavoro degli ingegneri, nei costi delle GPU e, in genere, in una qualità peggiore rispetto ai modelli frontier.

Famiglia Llama (Meta)

  • Rilasciata tra il 2023 e il 2025, con dimensioni da 1B a 405B
  • Llama 3.x è molto potente; il modello 8B compete con i modelli chiusi di fascia media
  • Licenza Community (consente l'uso commerciale a determinate condizioni)
  • Enorme ecosistema; la maggior parte dei fine-tuning deriva da Llama

Famiglia Mistral (Mistral AI)

  • Mistral 7B Instruct — modello piccolo ma potente
  • Mixtral 8x7B — Mixture-of-Experts, veloce e potente
  • Mistral Large / Medium — con pesi chiusi, disponibile tramite API
  • Licenza Apache 2.0 per le varianti open

Famiglia Qwen (Alibaba)

  • Qwen 2.5 — modello open-weight di riferimento per il ragionamento (2024)
  • Supporto multilingue eccellente, soprattutto per il cinese
  • Dimensioni da 0.5B a 72B
  • Apache 2.0

Altri modelli degni di nota

  • Gemma (Google) — piccolo e rifinito
  • Phi (Microsoft) — minuscolo ma capace
  • DeepSeek — ottime capacità di ragionamento a un costo inferiore
  • Yi — solide capacità multilingue

Scelta della dimensione

DimensioneCaso d'uso
1-3BDispositivi edge, dispositivi mobili, classificazione
7-8BUna singola GPU, agenti semplici
13-30BUna GPU più grande o 2-4 GPU piccole, agenti reali
70B+Più GPU, qualità di fascia frontier

Benchmark importanti

  • MMLU — conoscenza generale
  • GSM8K — matematica
  • HumanEval — codice
  • MT-Bench — qualità della chat
  • HELM / LMSYS Chatbot Arena — preferenza umana

Scelga benchmark in linea con il SUO compito.

Il divario con i modelli frontier si riduce

I modelli chiusi di fascia frontier (GPT-4o, Claude Sonnet 4.5) sono ancora in vantaggio nei benchmark più difficili. Tuttavia, i modelli open da 70B raggiungono i modelli chiusi di fascia media nella maggior parte delle attività degli agenti.

Considerazioni sulle licenze

Verifichi la licenza di ogni modello:

  • Apache 2.0 — completamente permissiva
  • Licenza Llama Community — impone restrizioni ai servizi su scala enorme e a determinati casi d'uso
  • Alcune licenze "solo per la ricerca" — non consentono la distribuzione commerciale

In hosting o self-hosted

Può usare modelli open tramite API in hosting (Together AI, Anyscale, Groq, Fireworks) senza gestire l'infrastruttura, spesso a un costo inferiore rispetto a OpenAI per una qualità equivalente.

Hosted Open Models on Groq

from openai import OpenAI
client = OpenAI(
    base_url='https://api.groq.com/openai/v1',
    api_key=GROQ_KEY
)
response = client.chat.completions.create(
    model='llama-3.1-70b-versatile',
    messages=[{'role': 'user', 'content': 'Hello'}]
)

Quando conviene l'OSS

  • Privacy fondamentale: ambito medico, legale o della difesa
  • Volumi molto elevati: il costo di pochi centesimi per chiamata è importante
  • Personalizzazione intensa: fine-tuning per un dominio specifico
  • Contesti multilingue in cui i provider chiusi sono deboli

Quando convengono i modelli chiusi

  • Ragionamento di fascia frontier
  • Multimodalità (visione, voce)
  • Contesto lungo: Claude / Gemini sono ancora in testa
  • Prototipazione rapida

Il modello più piccolo capace

Per un semplice agente interno eseguito su una singola GPU, quale intervallo di dimensioni è tipico?

Riepilogo

Llama, Mistral e Qwen sono i tre principali. Scelga la dimensione minima che soddisfa i requisiti di qualità. I provider in hosting (Groq, Together) consentono di evitare la gestione dell'infrastruttura.

Domande Frequenti

La lezione «Panoramica su Llama, Mistral e Qwen» è gratuita?

Sì — il testo completo di «Panoramica su Llama, Mistral e Qwen» è gratuito qui sul web. Per esercitarvi in modo interattivo (un editor di codice integrato e un tutor IA 24/7) e sbloccare il resto del corso AI Agents, passa a CoddyKit PRO. Il corso AI Agents include 4 lezioni in totale.

Cosa imparerò in «Panoramica su Llama, Mistral e Qwen»?

Le tre principali famiglie di modelli open-weight: licenze, dimensioni e punti di forza di ciascuna. Eserciti AI Agents con codice pratico che esegui direttamente nel browser, e un tutor IA 24/7 risponde alle tue domande mentre lavori sulla lezione.

Ho bisogno di esperienza per iniziare AI Agents?

Non è richiesta alcuna esperienza precedente. AI Agents su CoddyKit è strutturato per principianti e studenti avanzati, quindi puoi iniziare da qui o dall'inizio e procedere al tuo ritmo. Questa è la lezione 1 di 4.

Quanto tempo richiede la lezione «Panoramica su Llama, Mistral e Qwen»?

La maggior parte delle lezioni CoddyKit richiede circa 5–10 minuti. Ogni lezione è breve e interattiva, quindi fai progressi costanti e riprendi esattamente da dove hai lasciato su web e app.

Posso scrivere ed eseguire codice in questa lezione AI Agents?

Sì. Ogni lezione AI Agents include un editor di codice integrato, quindi scrivi ed esegui codice reale direttamente nel tuo browser e ricevi feedback istantaneo dall'IA — nessuna configurazione locale necessaria.

Tutte le lezioni di questo corso

  1. Panoramica su Llama, Mistral e Qwen
  2. Eseguire modelli locali con Ollama e llama.cpp
  3. Function calling con modelli open (Hermes, Functionary)
  4. Compromessi: latenza, costi e capacità
← Torna a AI Agents