0Pricing
AI Agents · Lektion

Überblick über Llama, Mistral und Qwen

Die drei großen Open-Weight-Modellfamilien: Lizenzen, Größen und die jeweiligen Stärken.

Überblick über Llama, Mistral und Qwen ist eine kostenlose AI Agents-Lektion auf CoddyKit. Dies ist Lektion 1 von 4. Du kannst die komplette Lektion unten kostenlos lesen – dann übst du sie direkt im Browser mit einem integrierten Code-Editor und einem KI-Tutor rund um die Uhr. Sie ist Teil des AI Agents-Lernpfads, und dein Fortschritt wird über Web und CoddyKit-App synchronisiert. Der AI Agents-Kurs umfasst insgesamt 4 Lektionen.

Teile dieser Lektion wurden noch nicht übersetzt und werden auf Englisch angezeigt.

Warum Open Source?

Open-Weight-Modelle bieten Ihnen:

  • Keine tokenabhängigen API-Kosten
  • Datenschutz – das Modell läuft auf Ihrer Hardware
  • Anpassbarkeit (Fine-Tuning) in jeder Größenordnung
  • Keine Abhängigkeit von einem Anbieter

Kosten: Arbeitszeit für Entwickler, GPU-Kosten und in der Regel eine geringere Qualität an der Leistungsspitze.

Llama-Familie (Meta)

  • 2023–2025 in Größen von 1B bis 405B veröffentlicht
  • Llama 3.x ist sehr leistungsfähig; 8B konkurriert mit geschlossenen Modellen der mittleren Leistungsklasse
  • Community-Lizenz (erlaubt kommerzielle Nutzung unter bestimmten Bedingungen)
  • Riesiges Ökosystem; die meisten Fine-Tunings basieren auf Llama

Mistral-Familie (Mistral AI)

  • Mistral 7B Instruct – starkes kleines Modell
  • Mixtral 8x7B – Mixture-of-Experts, schnell und leistungsfähig
  • Mistral Large / Medium – geschlossene Gewichte, über eine API verfügbar
  • Apache-2.0-Lizenz für offene Varianten

Qwen-Familie (Alibaba)

  • Qwen 2.5 – führendes Open-Weight-Reasoning-Modell (2024)
  • Hervorragende mehrsprachige Unterstützung, insbesondere für Chinesisch
  • Größen von 0.5B bis 72B
  • Apache 2.0

Weitere bemerkenswerte Modelle

  • Gemma (Google) – klein und ausgereift
  • Phi (Microsoft) – winzig, aber leistungsfähig
  • DeepSeek – starkes Reasoning zu geringeren Kosten
  • Yi – starke Mehrsprachigkeit

Die richtige Größe auswählen

GrößeAnwendungsfall
1-3BEdge-Geräte, Mobilgeräte, Klassifikation
7-8BEine einzelne GPU, einfache Agenten
13-30BGrößere GPU oder 2–4 kleine GPUs, echte Agenten
70B+Mehrere GPUs, Qualität an der Leistungsspitze

Relevante Benchmarks

  • MMLU – Allgemeinwissen
  • GSM8K – Mathematik
  • HumanEval – Code
  • MT-Bench – Chatqualität
  • HELM / LMSYS Chatbot Arena – menschliche Präferenzen

Wählen Sie Benchmarks, die zu IHREM Anwendungsfall passen.

Der Abstand zur Leistungsspitze schließt sich

Geschlossene Modelle an der Leistungsspitze (GPT-4o, Claude Sonnet 4.5) liegen bei den schwierigsten Benchmarks weiterhin vorn. Offene 70B-Modelle erreichen bei den meisten Agentenaufgaben jedoch das Niveau geschlossener Modelle der mittleren Leistungsklasse.

Überlegungen zur Lizenz

Prüfen Sie die Lizenz jedes Modells:

  • Apache 2.0 – vollständig freizügig
  • Llama Community License – Einschränkungen für Dienste in sehr großem Maßstab und bestimmte Anwendungsfälle
  • Einige „research only“-Lizenzen – kommerzieller Einsatz ist nicht zulässig

Gehostet oder selbst gehostet

Sie können offene Modelle über gehostete APIs (Together AI, Anyscale, Groq, Fireworks) nutzen, ohne Infrastruktur zu betreiben – oft günstiger als OpenAI bei vergleichbarer Qualität.

Hosted Open Models on Groq

from openai import OpenAI
client = OpenAI(
    base_url='https://api.groq.com/openai/v1',
    api_key=GROQ_KEY
)
response = client.chat.completions.create(
    model='llama-3.1-70b-versatile',
    messages=[{'role': 'user', 'content': 'Hello'}]
)

Wann Open Source gewinnt

  • Wenn Datenschutz entscheidend ist: Medizin, Recht und Verteidigung
  • Bei sehr hohem Volumen: Kosten im Centbereich pro Aufruf sind relevant
  • Bei starker Anpassung: Fine-Tuning für eine bestimmte Domäne
  • Bei Mehrsprachigkeit, wenn geschlossene Anbieter schwach sind

Wann geschlossene Modelle gewinnen

  • Reasoning an der Leistungsspitze
  • Multimodalität (Bildverarbeitung, Sprache)
  • Langer Kontext: Claude / Gemini liegen weiterhin vorn
  • Schnelles Prototyping

Kleinstes leistungsfähiges Modell

Welche Größenordnung ist typisch für einen einfachen internen Agenten, der auf einer einzelnen GPU läuft?

Zusammenfassung

Llama, Mistral und Qwen sind die drei großen Familien. Wählen Sie die kleinste Größe, die die Qualitätsanforderungen erfüllt. Gehostete Anbieter (Groq, Together) ersparen Ihnen den Betrieb eigener Infrastruktur.

Häufig gestellte Fragen

Ist die Lektion „Überblick über Llama, Mistral und Qwen“ kostenlos?

Ja — der vollständige Text von „Überblick über Llama, Mistral und Qwen“ ist hier im Web kostenlos zu lesen. Um sie interaktiv zu üben (integrierter Code-Editor und 24/7 KI-Tutor) und den Rest des AI Agents-Kurses freizuschalten, upgrade auf CoddyKit PRO. Der AI Agents-Kurs umfasst insgesamt 4 Lektionen.

Was lerne ich in „Überblick über Llama, Mistral und Qwen“?

Die drei großen Open-Weight-Modellfamilien: Lizenzen, Größen und die jeweiligen Stärken. Du übst AI Agents mit praktischem Code, den du direkt im Browser ausführst, und ein 24/7 KI-Tutor beantwortet deine Fragen während du die Lektion bearbeitest.

Brauche ich Erfahrung, um AI Agents zu starten?

Keine Vorkenntnisse erforderlich. AI Agents auf CoddyKit ist für Anfänger bis fortgeschrittene Lernende strukturiert, sodass du hier starten oder von Anfang an beginnen und in deinem eigenen Tempo voranschreiten kannst. Dies ist Lektion 1 von 4.

Wie lange dauert die Lektion „Überblick über Llama, Mistral und Qwen“?

Die meisten CoddyKit-Lektionen dauern etwa 5–10 Minuten. Jede ist kompakt und interaktiv, sodass du stetig Fortschritte machst und genau dort weitermachst, wo du aufgehört hast – im Web und in der App.

Kann ich in dieser AI Agents-Lektion Code schreiben und ausführen?

Ja. Jede AI Agents-Lektion enthält einen integrierten Code-Editor, sodass du echten Code direkt in deinem Browser schreibst und ausführst und sofort KI-Feedback erhältst — ohne lokale Einrichtung erforderlich.

Alle Lektionen in diesem Kurs

  1. Überblick über Llama, Mistral und Qwen
  2. Lokale Modelle mit Ollama und llama.cpp ausführen
  3. Open Models mit Function Calling (Hermes, Functionary)
  4. Abwägungen: Latenz, Kosten, Fähigkeiten
← Zurück zu AI Agents