Introducción a Llama, Mistral y Qwen
Las tres grandes familias de modelos con pesos abiertos: licencias, tamaños y especialidad de cada una.
Introducción a Llama, Mistral y Qwen es una lección gratuita de AI Agents en CoddyKit. Esta es la lección 1 de 4. Puedes leer la lección completa abajo gratuitamente — luego la practicas en el navegador con un editor de código integrado y un tutor de IA 24/7. Forma parte de la ruta de aprendizaje de AI Agents, y tu progreso se sincroniza en la web y la app de CoddyKit. El curso de AI Agents incluye 4 lecciones en total.
Partes de esta lección aún no han sido traducidas y se muestran en inglés.
¿Por qué el código abierto?
Los modelos de pesos abiertos le ofrecen:
- Ningún coste por token
- Privacidad de los datos: el modelo se ejecuta en su hardware
- Personalización (fine-tuning) a cualquier escala
- Sin dependencia de un proveedor
Coste: horas de ingeniería, facturas de GPU y, normalmente, una calidad inferior a la de los modelos de vanguardia.
Familia Llama (Meta)
- Publicada entre 2023 y 2025, con tamaños de 1B a 405B
- Llama 3.x ofrece una gran capacidad; el modelo 8B compite con modelos cerrados de gama media
- Licencia comunitaria (permite el uso comercial bajo ciertas condiciones)
- Ecosistema enorme; la mayoría de los fine-tunes derivan de Llama
Familia Mistral (Mistral AI)
- Mistral 7B Instruct: modelo pequeño de gran rendimiento
- Mixtral 8x7B: Mixture-of-Experts, rápido y capaz
- Mistral Large / Medium: pesos cerrados, disponibles mediante API
- Licencia Apache 2.0 en las variantes abiertas
Familia Qwen (Alibaba)
- Qwen 2.5: uno de los mejores modelos de razonamiento de pesos abiertos (2024)
- Excelente compatibilidad multilingüe, especialmente con el chino
- Tamaños de 0.5B a 72B
- Apache 2.0
Otros modelos destacados
- Gemma (Google): pequeño y pulido
- Phi (Microsoft): diminuto, pero capaz
- DeepSeek: gran capacidad de razonamiento a menor coste
- Yi: gran capacidad multilingüe
Elegir un tamaño
| Tamaño | Caso de uso |
|---|---|
| 1-3B | Dispositivos periféricos, móviles y clasificación |
| 7-8B | Una sola GPU, agentes sencillos |
| 13-30B | Una GPU más grande o de 2 a 4 GPU pequeñas, agentes reales |
| 70B+ | Varias GPU, calidad de vanguardia |
Benchmarks importantes
- MMLU: conocimientos generales
- GSM8K: matemáticas
- HumanEval: código
- MT-Bench: calidad de conversación
- HELM / LMSYS Chatbot Arena: preferencia humana
Elija benchmarks que se ajusten a SU tarea.
La brecha con la vanguardia se reduce
Los modelos cerrados de vanguardia (GPT-4o, Claude Sonnet 4.5) siguen por delante en los benchmarks más difíciles. Sin embargo, los modelos abiertos de 70B igualan a los modelos cerrados de gama media en la mayoría de las tareas de agentes.
Consideraciones sobre las licencias
Compruebe la licencia de cada modelo:
- Apache 2.0: totalmente permisiva
- Licencia comunitaria de Llama: restricciones para servicios de escala enorme y ciertos casos de uso
- Algunas licencias «solo para investigación»: no permiten la implementación comercial
Alojado frente a autoalojado
Puede usar modelos abiertos mediante APIs alojadas (Together AI, Anyscale, Groq, Fireworks) sin ejecutar infraestructura; a menudo son más baratos que OpenAI con una calidad similar.
Hosted Open Models on Groq
from openai import OpenAI
client = OpenAI(
base_url='https://api.groq.com/openai/v1',
api_key=GROQ_KEY
)
response = client.chat.completions.create(
model='llama-3.1-70b-versatile',
messages=[{'role': 'user', 'content': 'Hello'}]
)Cuándo gana el OSS
- Privacidad crítica: medicina, derecho y defensa
- Volumen muy alto: cada céntimo por llamada cuenta
- Personalización intensiva: fine-tunes para un dominio específico
- Situaciones multilingües en las que los proveedores cerrados son débiles
Cuándo ganan los modelos cerrados
- Razonamiento de vanguardia
- Multimodalidad (visión y voz)
- Contexto largo: Claude / Gemini siguen liderando
- Prototipado rápido
El modelo capaz más pequeño
Para un agente interno sencillo que se ejecuta en una sola GPU, ¿qué intervalo de tamaño es habitual?
Resumen
Llama, Mistral y Qwen son los tres grandes. Elija el tamaño más pequeño que cumpla los requisitos de calidad. Los proveedores alojados (Groq, Together) le permiten evitar la infraestructura.
Preguntas frecuentes
¿La lección «Introducción a Llama, Mistral y Qwen» es gratis?
Sí — el texto completo de «Introducción a Llama, Mistral y Qwen» es gratis para leer aquí en la web. Para practicarla de forma interactiva (editor de código integrado y tutor de IA 24/7) y desbloquear el resto del curso de AI Agents, actualiza a CoddyKit PRO. El curso de AI Agents incluye 4 lecciones en total.
¿Qué aprenderé en «Introducción a Llama, Mistral y Qwen»?
Las tres grandes familias de modelos con pesos abiertos: licencias, tamaños y especialidad de cada una. Practicas AI Agents con código real que ejecutas directamente en el navegador, y un tutor de IA 24/7 responde tus preguntas mientras trabajas en la lección.
¿Necesito experiencia previa para empezar AI Agents?
No se requiere experiencia previa. AI Agents en CoddyKit está estructurado para principiantes hasta estudiantes avanzados, así que puedes empezar aquí o desde el inicio y avanzar a tu ritmo. Esta es la lección 1 de 4.
¿Cuánto tiempo toma la lección «Introducción a Llama, Mistral y Qwen»?
La mayoría de las lecciones de CoddyKit toman alrededor de 5–10 minutos. Cada una es compacta e interactiva, así que avanzas constantemente y retomas exactamente por donde dejaste en la web y la app.
¿Puedo escribir y ejecutar código en esta lección de AI Agents?
Sí. Cada lección de AI Agents incluye un editor de código integrado, así que escribes y ejecutas código real directamente en tu navegador y obtienes retroalimentación instantánea de IA — sin configuración local necesaria.
Todas las lecciones de este curso
- Introducción a Llama, Mistral y Qwen
- Ejecutar modelos locales con Ollama y llama.cpp
- Modelos abiertos con llamadas a funciones (Hermes, Functionary)
- Compromisos: latencia, coste y capacidad