Visão geral de Llama, Mistral e Qwen
As três grandes famílias de modelos com pesos abertos: licenças, tamanhos e aquilo em que cada uma é melhor.
Visão geral de Llama, Mistral e Qwen é uma aula grátis de AI Agents no CoddyKit. Esta é a aula 1 de 4. Você pode ler a aula completa abaixo gratuitamente — depois pratica ao vivo no navegador com um editor de código integrado e um tutor de IA 24/7. Faz parte do caminho de aprendizado de AI Agents, e seu progresso é sincronizado entre a web e o app CoddyKit. O curso de AI Agents inclui 4 aulas no total.
Partes desta aula ainda não foram traduzidas e aparecem em inglês.
Por que Código Aberto?
Modelos de pesos abertos oferecem:
- Nenhum custo de API por token
- Privacidade dos dados — o modelo é executado no seu hardware
- Personalização (ajuste fino) em qualquer escala
- Nenhuma dependência de fornecedor
Custo: horas de engenharia, contas de GPU e, geralmente, qualidade inferior na fronteira.
Família Llama (Meta)
- Lançada de 2023 a 2025, em tamanhos de 1B a 405B
- Llama 3.x é altamente capaz; o modelo 8B compete com modelos proprietários intermediários
- Licença comunitária (permite uso comercial sob determinadas condições)
- Ecossistema enorme; a maioria dos ajustes finos deriva de Llama
Família Mistral (Mistral AI)
- Mistral 7B Instruct — modelo pequeno e forte
- Mixtral 8x7B — mistura de especialistas, rápida e capaz
- Mistral Large / Medium — pesos fechados, disponíveis por meio de API
- Licença Apache 2.0 nas variantes abertas
Família Qwen (Alibaba)
- Qwen 2.5 — principal modelo aberto de raciocínio (2024)
- Excelente suporte multilíngue, especialmente para chinês
- Tamanhos de 0.5B a 72B
- Apache 2.0
Outros Destaques
- Gemma (Google) — pequeno e refinado
- Phi (Microsoft) — minúsculo, mas capaz
- DeepSeek — raciocínio forte a um custo menor
- Yi — forte suporte multilíngue
Escolhendo um Tamanho
| Tamanho | Caso de uso |
|---|---|
| 1-3B | Dispositivos de borda, dispositivos móveis, classificação |
| 7-8B | Uma única GPU, agentes simples |
| 13-30B | GPU maior ou 2-4 GPUs pequenas, agentes reais |
| 70B+ | Várias GPUs, qualidade de fronteira |
Avaliações de Referência Relevantes
- MMLU — conhecimento geral
- GSM8K — matemática
- HumanEval — código
- MT-Bench — qualidade de conversa
- HELM / LMSYS Chatbot Arena — preferência humana
Escolha avaliações de referência alinhadas à sua tarefa.
A Diferença para a Fronteira Está Diminuindo
Os modelos proprietários de fronteira (GPT-4o, Claude Sonnet 4.5) ainda estão à frente nas avaliações de referência mais difíceis. Porém, os modelos abertos de 70B igualam os modelos proprietários intermediários na maioria das tarefas de agentes.
Considerações sobre Licenças
Verifique a licença de cada modelo:
- Apache 2.0 — totalmente permissiva
- Licença Comunitária do Llama — restrições para serviços em escala muito grande e determinados casos de uso
- Algumas licenças "somente para pesquisa" — não podem ser implantadas comercialmente
Hospedado versus Auto-Hospedado
Você pode usar modelos abertos por meio de APIs hospedadas (Together AI, Anyscale, Groq, Fireworks) sem executar uma infraestrutura — muitas vezes por um custo menor que o da OpenAI para a mesma qualidade.
Hosted Open Models on Groq
from openai import OpenAI
client = OpenAI(
base_url='https://api.groq.com/openai/v1',
api_key=GROQ_KEY
)
response = client.chat.completions.create(
model='llama-3.1-70b-versatile',
messages=[{'role': 'user', 'content': 'Hello'}]
)Quando o Código Aberto Vence
- Privacidade crítica: medicina, área jurídica, defesa
- Volume muito alto: centavos por chamada fazem diferença
- Personalização intensa: ajustes finos para um domínio específico
- Uso multilíngue em que os provedores proprietários são fracos
Quando os Modelos Fechados Vencem
- Raciocínio de fronteira
- Multimodalidade (visão, voz)
- Contexto longo: Claude / Gemini ainda lideram
- Prototipagem rápida
Menor Modelo Capaz
Para um agente interno simples executado em uma única GPU, qual faixa de tamanho é típica?
Recapitulação
Llama, Mistral e Qwen são os três grandes. Escolha o menor tamanho que atenda à qualidade necessária. Provedores hospedados (Groq, Together) permitem evitar a infraestrutura.
Perguntas Frequentes
A aula “Visão geral de Llama, Mistral e Qwen” é grátis?
Sim — o texto completo de “Visão geral de Llama, Mistral e Qwen” é grátis para ler aqui na web. Para praticá-la interativamente (um editor de código integrado e um tutor de IA 24/7) e desbloquear o restante do curso de AI Agents, atualize para CoddyKit PRO. O curso de AI Agents inclui 4 aulas no total.
O que vou aprender em “Visão geral de Llama, Mistral e Qwen”?
As três grandes famílias de modelos com pesos abertos: licenças, tamanhos e aquilo em que cada uma é melhor. Você pratica AI Agents com código prático que executa diretamente no navegador, e um tutor de IA 24/7 responde suas dúvidas enquanto trabalha na aula.
Preciso ter experiência prévia para começar AI Agents?
Nenhuma experiência prévia é necessária. AI Agents no CoddyKit é estruturado para alunos iniciantes até avançados, então você pode começar aqui ou desde o início e aprender no seu ritmo. Esta é a aula 1 de 4.
Quanto tempo leva a aula “Visão geral de Llama, Mistral e Qwen”?
A maioria das aulas CoddyKit leva cerca de 5–10 minutos. Cada uma é compacta e interativa, então você faz progresso constante e retoma exatamente de onde parou entre web e app.
Posso escrever e executar código nesta aula de AI Agents?
Sim. Cada aula de AI Agents inclui um editor de código integrado, então você escreve e executa código real direto no navegador e recebe feedback de IA instantaneamente — nenhuma configuração local necessária.
Todas as aulas deste curso
- Visão geral de Llama, Mistral e Qwen
- Executando modelos locais com Ollama e llama.cpp
- Modelos abertos com chamada de funções (Hermes, Functionary)
- Compromissos: latência, custo e capacidade