Lokale Modelle mit Ollama und llama.cpp ausführen
Ollama macht aus LLMs ein „docker run“; llama.cpp geht mit Quantisierung und direkter C++-Steuerung tiefer.
Lokale Modelle mit Ollama und llama.cpp ausführen ist eine kostenlose AI Agents-Lektion auf CoddyKit. Dies ist Lektion 2 von 4. Du kannst die komplette Lektion unten kostenlos lesen – dann übst du sie direkt im Browser mit einem integrierten Code-Editor und einem KI-Tutor rund um die Uhr. Sie ist Teil des AI Agents-Lernpfads, und dein Fortschritt wird über Web und CoddyKit-App synchronisiert. Der AI Agents-Kurs umfasst insgesamt 4 Lektionen.
Teile dieser Lektion wurden noch nicht übersetzt und werden auf Englisch angezeigt.
Zwei einfache Wege
Für das Self-Hosting offener Modelle auf einer Workstation oder einem Server:
- Ollama – besonders einfach, Docker-ähnliche Benutzererfahrung für LLMs
- llama.cpp – näher an der Hardware, mehr Kontrolle, geringerer Ressourcenbedarf
Ollama Quick Start
# Install (macOS):
brew install ollama
# Pull a model:
ollama pull llama3.1:8b
# Run interactively:
ollama run llama3.1:8b 'Hello'
# Serve via HTTP (OpenAI-compatible):
ollama serveCalling Ollama Via SDK
from openai import OpenAI
client = OpenAI(base_url='http://localhost:11434/v1', api_key='ollama')
response = client.chat.completions.create(
model='llama3.1:8b',
messages=[{'role': 'user', 'content': 'Hello'}]
)
print(response.choices[0].message.content)Tool-Aufrufe mit Ollama
Ollama unterstützt Tool-Aufrufe für kompatible Modelle (Llama 3.1+, Mistral, Qwen 2.5):
tools = [{'type': 'function', 'function': {...}}]
response = client.chat.completions.create(
model='llama3.1:8b',
messages=messages,
tools=tools
)Grundlagen von llama.cpp
llama.cpp ist eine C++-Implementierung, die JEDES Modell im GGUF-Format auf CPU, GPU oder Metal (Apple Silicon) ausführt:
# Build (or install pre-built):
git clone https://github.com/ggerganov/llama.cpp
cd llama.cpp && make
# Run a quantized model:
./llama-cli -m models/llama-3.1-8b-instruct.Q4_K_M.gguf -p 'Hello'Server Mode
./llama-server -m models/llama-3.1-8b-instruct.Q4_K_M.gguf --port 8080
# Now OpenAI-compatible endpoint at http://localhost:8080/v1Quantisierung
Mit der 4-Bit-Quantisierung (Q4_K_M) können Sie ein „16-GB“-Modell mit etwa 5 GB RAM ausführen, bei nur geringfügigem Qualitätsverlust. Probieren Sie zuerst Q4; wählen Sie für qualitätskritische Aufgaben eine höhere Stufe (Q5, Q6, Q8).
Hardwareanforderungen
| Modell | RAM Q4 | VRAM Q4 |
|---|---|---|
| 7-8B | ~6 GB | ~6 GB |
| 13B | ~10 GB | ~10 GB |
| 70B | ~40 GB | ~40 GB |
Der gemeinsame Speicher von Apple Silicon macht große lokale Modelle überraschend gut nutzbar.
vLLM für hohen Durchsatz
Verwenden Sie für den produktiven Betrieb mit hoher Nebenläufigkeit vLLM (PagedAttention, Continuous Batching):
# pip install vllm
from vllm import LLM, SamplingParams
llm = LLM(model='meta-llama/Llama-3.1-8B-Instruct')
params = SamplingParams(temperature=0.2, max_tokens=512)
result = llm.generate(['Hello world'], params)Text Generation Inference (TGI)
HuggingFace TGI ist ein weiterer Produktionsserver. Starke Unterstützung für Tool-Nutzung.
Server vergleichen
- Ollama – beste Benutzererfahrung, einfache CLI/HTTP-Schnittstelle, gut für die Entwicklung
- llama.cpp – am leichtesten, läuft überall
- vLLM – höchster Durchsatz, nur für GPUs
- TGI – HuggingFace-Integration, Monitoring
Wann sollten Sie selbst hosten?
- Strenger Datenschutz
- Sehr hohes Volumen (Kostengleichheit bei etwa 10 Mio. Tokens pro Tag)
- Fine-getunte Modelle
- Edge- oder Offline-Szenarien
Wann sollten Sie NICHT selbst hosten?
- Kleine Nebenprojekte mit geringem Volumen (Hosting ist günstiger)
- Reasoning-Qualität an der Leistungsspitze erforderlich
- Multimodale Aufgaben
OpenAI-kompatibler Endpunkt
Warum ist die Konvention eines OpenAI-kompatiblen Endpunkts für lokale Modelle praktisch?
Zusammenfassung
Ollama für eine einfache Entwicklung, llama.cpp für Portabilität und vLLM für hohen Produktionsdurchsatz. Alle verwenden OpenAI-ähnliche APIs, sodass Sie ohne Codeänderungen wechseln können.
Lerne AI Agents mit einem KI-Tutor — kostenlos
Schreibe und führe echten Code in deinem Browser aus, bekomme sofortige Hilfe von einem 24/7 KI-Tutor und setze dein Lernen im Web oder in der App fort.
- Kurse
- 60
- Lektionen
- 239
Häufig gestellte Fragen
Ist die Lektion „Lokale Modelle mit Ollama und llama.cpp ausführen“ kostenlos?
Ja — der vollständige Text von „Lokale Modelle mit Ollama und llama.cpp ausführen“ ist hier im Web kostenlos zu lesen. Um sie interaktiv zu üben (integrierter Code-Editor und 24/7 KI-Tutor) und den Rest des AI Agents-Kurses freizuschalten, upgrade auf CoddyKit PRO. Der AI Agents-Kurs umfasst insgesamt 4 Lektionen.
Was lerne ich in „Lokale Modelle mit Ollama und llama.cpp ausführen“?
Ollama macht aus LLMs ein „docker run“; llama.cpp geht mit Quantisierung und direkter C++-Steuerung tiefer. Du übst AI Agents mit praktischem Code, den du direkt im Browser ausführst, und ein 24/7 KI-Tutor beantwortet deine Fragen während du die Lektion bearbeitest.
Brauche ich Erfahrung, um AI Agents zu starten?
Keine Vorkenntnisse erforderlich. AI Agents auf CoddyKit ist für Anfänger bis fortgeschrittene Lernende strukturiert, sodass du hier starten oder von Anfang an beginnen und in deinem eigenen Tempo voranschreiten kannst. Dies ist Lektion 2 von 4.
Wie lange dauert die Lektion „Lokale Modelle mit Ollama und llama.cpp ausführen“?
Die meisten CoddyKit-Lektionen dauern etwa 5–10 Minuten. Jede ist kompakt und interaktiv, sodass du stetig Fortschritte machst und genau dort weitermachst, wo du aufgehört hast – im Web und in der App.
Kann ich in dieser AI Agents-Lektion Code schreiben und ausführen?
Ja. Jede AI Agents-Lektion enthält einen integrierten Code-Editor, sodass du echten Code direkt in deinem Browser schreibst und ausführst und sofort KI-Feedback erhältst — ohne lokale Einrichtung erforderlich.
Alle Lektionen in diesem Kurs
- Überblick über Llama, Mistral und Qwen
- Lokale Modelle mit Ollama und llama.cpp ausführen
- Open Models mit Function Calling (Hermes, Functionary)
- Abwägungen: Latenz, Kosten, Fähigkeiten