0Pricing
AI Agents · Aula

Visão geral de Llama, Mistral e Qwen

As três grandes famílias de modelos com pesos abertos: licenças, tamanhos e aquilo em que cada uma é melhor.

Visão geral de Llama, Mistral e Qwen é uma aula grátis de AI Agents no CoddyKit. Esta é a aula 1 de 4. Você pode ler a aula completa abaixo gratuitamente — depois pratica ao vivo no navegador com um editor de código integrado e um tutor de IA 24/7. Faz parte do caminho de aprendizado de AI Agents, e seu progresso é sincronizado entre a web e o app CoddyKit. O curso de AI Agents inclui 4 aulas no total.

Partes desta aula ainda não foram traduzidas e aparecem em inglês.

Por que Código Aberto?

Modelos de pesos abertos oferecem:

  • Nenhum custo de API por token
  • Privacidade dos dados — o modelo é executado no seu hardware
  • Personalização (ajuste fino) em qualquer escala
  • Nenhuma dependência de fornecedor

Custo: horas de engenharia, contas de GPU e, geralmente, qualidade inferior na fronteira.

Família Llama (Meta)

  • Lançada de 2023 a 2025, em tamanhos de 1B a 405B
  • Llama 3.x é altamente capaz; o modelo 8B compete com modelos proprietários intermediários
  • Licença comunitária (permite uso comercial sob determinadas condições)
  • Ecossistema enorme; a maioria dos ajustes finos deriva de Llama

Família Mistral (Mistral AI)

  • Mistral 7B Instruct — modelo pequeno e forte
  • Mixtral 8x7B — mistura de especialistas, rápida e capaz
  • Mistral Large / Medium — pesos fechados, disponíveis por meio de API
  • Licença Apache 2.0 nas variantes abertas

Família Qwen (Alibaba)

  • Qwen 2.5 — principal modelo aberto de raciocínio (2024)
  • Excelente suporte multilíngue, especialmente para chinês
  • Tamanhos de 0.5B a 72B
  • Apache 2.0

Outros Destaques

  • Gemma (Google) — pequeno e refinado
  • Phi (Microsoft) — minúsculo, mas capaz
  • DeepSeek — raciocínio forte a um custo menor
  • Yi — forte suporte multilíngue

Escolhendo um Tamanho

TamanhoCaso de uso
1-3BDispositivos de borda, dispositivos móveis, classificação
7-8BUma única GPU, agentes simples
13-30BGPU maior ou 2-4 GPUs pequenas, agentes reais
70B+Várias GPUs, qualidade de fronteira

Avaliações de Referência Relevantes

  • MMLU — conhecimento geral
  • GSM8K — matemática
  • HumanEval — código
  • MT-Bench — qualidade de conversa
  • HELM / LMSYS Chatbot Arena — preferência humana

Escolha avaliações de referência alinhadas à sua tarefa.

A Diferença para a Fronteira Está Diminuindo

Os modelos proprietários de fronteira (GPT-4o, Claude Sonnet 4.5) ainda estão à frente nas avaliações de referência mais difíceis. Porém, os modelos abertos de 70B igualam os modelos proprietários intermediários na maioria das tarefas de agentes.

Considerações sobre Licenças

Verifique a licença de cada modelo:

  • Apache 2.0 — totalmente permissiva
  • Licença Comunitária do Llama — restrições para serviços em escala muito grande e determinados casos de uso
  • Algumas licenças "somente para pesquisa" — não podem ser implantadas comercialmente

Hospedado versus Auto-Hospedado

Você pode usar modelos abertos por meio de APIs hospedadas (Together AI, Anyscale, Groq, Fireworks) sem executar uma infraestrutura — muitas vezes por um custo menor que o da OpenAI para a mesma qualidade.

Hosted Open Models on Groq

from openai import OpenAI
client = OpenAI(
    base_url='https://api.groq.com/openai/v1',
    api_key=GROQ_KEY
)
response = client.chat.completions.create(
    model='llama-3.1-70b-versatile',
    messages=[{'role': 'user', 'content': 'Hello'}]
)

Quando o Código Aberto Vence

  • Privacidade crítica: medicina, área jurídica, defesa
  • Volume muito alto: centavos por chamada fazem diferença
  • Personalização intensa: ajustes finos para um domínio específico
  • Uso multilíngue em que os provedores proprietários são fracos

Quando os Modelos Fechados Vencem

  • Raciocínio de fronteira
  • Multimodalidade (visão, voz)
  • Contexto longo: Claude / Gemini ainda lideram
  • Prototipagem rápida

Menor Modelo Capaz

Para um agente interno simples executado em uma única GPU, qual faixa de tamanho é típica?

Recapitulação

Llama, Mistral e Qwen são os três grandes. Escolha o menor tamanho que atenda à qualidade necessária. Provedores hospedados (Groq, Together) permitem evitar a infraestrutura.

Perguntas Frequentes

A aula “Visão geral de Llama, Mistral e Qwen” é grátis?

Sim — o texto completo de “Visão geral de Llama, Mistral e Qwen” é grátis para ler aqui na web. Para praticá-la interativamente (um editor de código integrado e um tutor de IA 24/7) e desbloquear o restante do curso de AI Agents, atualize para CoddyKit PRO. O curso de AI Agents inclui 4 aulas no total.

O que vou aprender em “Visão geral de Llama, Mistral e Qwen”?

As três grandes famílias de modelos com pesos abertos: licenças, tamanhos e aquilo em que cada uma é melhor. Você pratica AI Agents com código prático que executa diretamente no navegador, e um tutor de IA 24/7 responde suas dúvidas enquanto trabalha na aula.

Preciso ter experiência prévia para começar AI Agents?

Nenhuma experiência prévia é necessária. AI Agents no CoddyKit é estruturado para alunos iniciantes até avançados, então você pode começar aqui ou desde o início e aprender no seu ritmo. Esta é a aula 1 de 4.

Quanto tempo leva a aula “Visão geral de Llama, Mistral e Qwen”?

A maioria das aulas CoddyKit leva cerca de 5–10 minutos. Cada uma é compacta e interativa, então você faz progresso constante e retoma exatamente de onde parou entre web e app.

Posso escrever e executar código nesta aula de AI Agents?

Sim. Cada aula de AI Agents inclui um editor de código integrado, então você escreve e executa código real direto no navegador e recebe feedback de IA instantaneamente — nenhuma configuração local necessária.

Todas as aulas deste curso

  1. Visão geral de Llama, Mistral e Qwen
  2. Executando modelos locais com Ollama e llama.cpp
  3. Modelos abertos com chamada de funções (Hermes, Functionary)
  4. Compromissos: latência, custo e capacidade
← Voltar para AI Agents