0Pricing
AI Agents · Lección

Ejecutar modelos locales con Ollama y llama.cpp

Ollama convierte la ejecución de LLM en algo parecido a «docker run»; llama.cpp profundiza con cuantización y control directo desde C++.

Ejecutar modelos locales con Ollama y llama.cpp es una lección gratuita de AI Agents en CoddyKit. Esta es la lección 2 de 4. Puedes leer la lección completa abajo gratuitamente — luego la practicas en el navegador con un editor de código integrado y un tutor de IA 24/7. Forma parte de la ruta de aprendizaje de AI Agents, y tu progreso se sincroniza en la web y la app de CoddyKit. El curso de AI Agents incluye 4 lecciones en total.

Partes de esta lección aún no han sido traducidas y se muestran en inglés.

Dos opciones sencillas

Para autoalojar modelos abiertos en una estación de trabajo o un servidor:

  • Ollama: la opción más sencilla, con una experiencia de uso similar a Docker para LLM
  • llama.cpp: más cercano al hardware, con mayor control y una huella menor

Ollama Quick Start

# Install (macOS):
brew install ollama

# Pull a model:
ollama pull llama3.1:8b

# Run interactively:
ollama run llama3.1:8b 'Hello'

# Serve via HTTP (OpenAI-compatible):
ollama serve

Calling Ollama Via SDK

from openai import OpenAI
client = OpenAI(base_url='http://localhost:11434/v1', api_key='ollama')

response = client.chat.completions.create(
    model='llama3.1:8b',
    messages=[{'role': 'user', 'content': 'Hello'}]
)
print(response.choices[0].message.content)

Llamadas a herramientas con Ollama

Ollama admite llamadas a herramientas para modelos compatibles (Llama 3.1+, Mistral, Qwen 2.5):

tools = [{'type': 'function', 'function': {...}}]
response = client.chat.completions.create(
    model='llama3.1:8b',
    messages=messages,
    tools=tools
)

Conceptos básicos de llama.cpp

llama.cpp es una implementación en C++ que ejecuta CUALQUIER modelo en formato GGUF en CPU, GPU o Metal (Apple Silicon):

# Build (or install pre-built):
git clone https://github.com/ggerganov/llama.cpp
cd llama.cpp && make

# Run a quantized model:
./llama-cli -m models/llama-3.1-8b-instruct.Q4_K_M.gguf -p 'Hello'

Server Mode

./llama-server -m models/llama-3.1-8b-instruct.Q4_K_M.gguf --port 8080

# Now OpenAI-compatible endpoint at http://localhost:8080/v1

Cuantización

La cuantización de 4 bits (Q4_K_M) permite ejecutar un modelo de «16 GB» con unos 5 GB de RAM y una pérdida de calidad marginal. Pruebe primero Q4; use valores superiores (Q5, Q6, Q8) para tareas críticas para la calidad.

Requisitos de hardware

ModeloRAM Q4VRAM Q4
7-8B~6 GB~6 GB
13B~10 GB~10 GB
70B~40 GB~40 GB

La memoria unificada de Apple Silicon hace que los modelos locales grandes sean sorprendentemente utilizables.

vLLM para obtener rendimiento

Para servir modelos en producción con alta concurrencia, use vLLM (PagedAttention, batching continuo):

# pip install vllm
from vllm import LLM, SamplingParams
llm = LLM(model='meta-llama/Llama-3.1-8B-Instruct')

params = SamplingParams(temperature=0.2, max_tokens=512)
result = llm.generate(['Hello world'], params)

Text Generation Inference (TGI)

HuggingFace TGI es otro servidor de producción. Ofrece una sólida compatibilidad con el uso de herramientas.

Comparación de servidores

  • Ollama: la mejor experiencia de uso, CLI/HTTP sencillo, ideal para desarrollo
  • llama.cpp: el más ligero, funciona en cualquier lugar
  • vLLM: el mayor rendimiento, solo con GPU
  • TGI: integración con HuggingFace y monitorización

Cuándo autoalojar

  • Privacidad estricta
  • Volumen muy alto (el punto de equilibrio del coste está en unos 10 millones de tokens al día)
  • Modelos ajustados mediante fine-tuning
  • Situaciones periféricas o sin conexión

Cuándo NO autoalojar

  • Proyectos secundarios de poco volumen (el servicio alojado es más barato)
  • Se necesita calidad de razonamiento de vanguardia
  • Tareas multimodales

Endpoint compatible con OpenAI

¿Por qué resulta útil la convención de endpoints compatibles con OpenAI para los modelos locales?

Resumen

Ollama para simplificar el desarrollo, llama.cpp para la portabilidad y vLLM para el rendimiento en producción. Todos ofrecen APIs con el formato de OpenAI, por lo que puede cambiarlos sin modificar el código.

Preguntas frecuentes

¿La lección «Ejecutar modelos locales con Ollama y llama.cpp» es gratis?

Sí — el texto completo de «Ejecutar modelos locales con Ollama y llama.cpp» es gratis para leer aquí en la web. Para practicarla de forma interactiva (editor de código integrado y tutor de IA 24/7) y desbloquear el resto del curso de AI Agents, actualiza a CoddyKit PRO. El curso de AI Agents incluye 4 lecciones en total.

¿Qué aprenderé en «Ejecutar modelos locales con Ollama y llama.cpp»?

Ollama convierte la ejecución de LLM en algo parecido a «docker run»; llama.cpp profundiza con cuantización y control directo desde C++. Practicas AI Agents con código real que ejecutas directamente en el navegador, y un tutor de IA 24/7 responde tus preguntas mientras trabajas en la lección.

¿Necesito experiencia previa para empezar AI Agents?

No se requiere experiencia previa. AI Agents en CoddyKit está estructurado para principiantes hasta estudiantes avanzados, así que puedes empezar aquí o desde el inicio y avanzar a tu ritmo. Esta es la lección 2 de 4.

¿Cuánto tiempo toma la lección «Ejecutar modelos locales con Ollama y llama.cpp»?

La mayoría de las lecciones de CoddyKit toman alrededor de 5–10 minutos. Cada una es compacta e interactiva, así que avanzas constantemente y retomas exactamente por donde dejaste en la web y la app.

¿Puedo escribir y ejecutar código en esta lección de AI Agents?

Sí. Cada lección de AI Agents incluye un editor de código integrado, así que escribes y ejecutas código real directamente en tu navegador y obtienes retroalimentación instantánea de IA — sin configuración local necesaria.

Todas las lecciones de este curso

  1. Introducción a Llama, Mistral y Qwen
  2. Ejecutar modelos locales con Ollama y llama.cpp
  3. Modelos abiertos con llamadas a funciones (Hermes, Functionary)
  4. Compromisos: latencia, coste y capacidad
← Volver a AI Agents