Open Models mit Function Calling (Hermes, Functionary)
Die meisten grundlegenden Open Models können Tools nicht zuverlässig aufrufen – Hermes und Functionary wurden dafür feinabgestimmt.
Open Models mit Function Calling (Hermes, Functionary) ist eine kostenlose AI Agents-Lektion auf CoddyKit. Dies ist Lektion 3 von 4. Du kannst die komplette Lektion unten kostenlos lesen – dann übst du sie direkt im Browser mit einem integrierten Code-Editor und einem KI-Tutor rund um die Uhr. Sie ist Teil des AI Agents-Lernpfads, und dein Fortschritt wird über Web und CoddyKit-App synchronisiert. Der AI Agents-Kurs umfasst insgesamt 4 Lektionen.
Basismodelle können Tool-Aufrufe nicht zuverlässig ausführen
Unveränderte Basismodelle wie Llama, Mistral oder Qwen können per Prompt angewiesen werden, „JSON wie {...} zurückzugeben“, erzeugen aber oft fehlerhafte Ausgaben, lassen Argumente aus oder halluzinieren Tools.
Fine-Tunings für Function Calling lösen dieses Problem.
Hermes-Familie
Die Hermes-Modelle von NousResearch gehören zu den besten Fine-Tunings für Function Calling:
- Hermes 3 Llama 3.1 8B / 70B
- Hohe Genauigkeit bei Tool-Aufrufen
- Freizügige Lizenz nach Apache-Vorbild
Functionary
Die Functionary-Modelle von MeetKai wurden ausdrücklich für OpenAI-kompatibles Function Calling trainiert:
- Functionary v3 (basierend auf Llama 3.1)
- Unterstützt parallele Tool-Aufrufe
- Auf HuggingFace und Together AI verfügbar
Native Tool-Nutzung ab Llama 3.1+
Aktuelle Instruct-Varianten von Llama 3.1, Llama 3.3 und Llama 4 verfügen über integrierte Fähigkeiten für Tool-Aufrufe. Für viele Aufgaben reichen sie aus; für schwierige Fälle verwenden Sie Hermes / Functionary.
Tool-Nutzung mit Qwen 2.5
Qwen 2.5 bietet starke native Unterstützung für Tool-Aufrufe und kann mit geschlossenen Modellen konkurrieren. Für selbst gehostete mehrsprachige Agenten ist es oft die Standardwahl.
Tool-fähige offene Modelle aufrufen
Jeder OpenAI-kompatible Server (Ollama, vLLM, Together AI) akzeptiert denselben tools-Parameter:
from openai import OpenAI
client = OpenAI(base_url='http://localhost:11434/v1', api_key='ollama')
tools = [{'type': 'function', 'function': {
'name': 'get_weather',
'description': 'Current weather',
'parameters': {'type': 'object', 'properties': {'city': {'type': 'string'}}, 'required': ['city']}
}}]
response = client.chat.completions.create(
model='hermes3:8b',
messages=[{'role': 'user', 'content': 'Weather in Paris?'}],
tools=tools
)Validieren Sie Ausgaben sorgfältig
Tool-Aufrufe schlagen bei offenen Modellen häufiger fehl als bei geschlossenen Modellen. Gehen Sie immer wie folgt vor:
- Parsen Sie JSON in einem try/except-Block
- Validieren Sie mit Pydantic
- Fügen Sie eine Reparaturschleife hinzu
Tool-Aufrufe mit Outlines erzwingen
Verwenden Sie für garantierte strukturierte Ausgaben bei offenen Modellen Outlines zur grammatikbeschränkten Dekodierung:
import outlines
model = outlines.models.transformers('meta-llama/Llama-3.1-8B-Instruct')
generator = outlines.generate.json(model, ToolCall)
result = generator(prompt)Tool-Nutzung mit Hugging Face TGI
TGI unterstützt bei vielen offenen Modellen eine OpenAI-ähnliche Tool-Nutzung – als direkter Ersatz.
Qualität der Tool-Nutzung benchmarken
Tool Calling wird anhand folgender Benchmarks bewertet:
- Berkeley Function Calling Leaderboard (BFCL) – maßgebliches Ranking
- ToolBench – breitere Abdeckung
- API-Bank – Szenarien mit mehreren Tools
Eine sinnvolle Standardauswahl
Auf diese Kombination einigen sich die meisten Teams:
- Llama 3.1 8B Instruct für allgemeine Agentenaufgaben
- Qwen 2.5 Coder für Code-Agenten
- Hermes 3 für Agenten mit intensiver Tool-Nutzung
- Outlines oder Instructor für garantierte strukturierte Ausgaben
Über einen gehosteten Anbieter ausführen
Für den Betrieb ohne eigene Infrastruktur hosten Together AI, Fireworks und Anyscale Hermes, Functionary, Llama und Qwen über OpenAI-kompatible APIs. Bei vergleichbarer Qualität ist das günstiger als OpenAI.
Beispiel für einen Kostenvergleich
Ungefähre Kosten pro einer Million Tokens (Mitte 2025):
- GPT-4o: 2,50 $ Eingabe, 10 $ Ausgabe
- Llama 3.1 70B (Together AI): 0,88 $ Eingabe, 0,88 $ Ausgabe
- Selbst gehostetes Llama 8B: 0 $ (nur Ihre Stromkosten)
Warum Fine-Tunings für Function Calling verwenden?
Warum sollten Sie für Tool-Aufrufe Hermes oder Functionary statt eines Llama-Basismodells verwenden?
Zusammenfassung
Aktuelle Llama- und Qwen-Modelle bieten eine brauchbare native Tool-Nutzung. Für höhere Zuverlässigkeit verwenden Sie Hermes oder Functionary. Kombinieren Sie diese mit Outlines/Instructor für garantiert strukturierte Ausgaben.
Häufig gestellte Fragen
Ist die Lektion „Open Models mit Function Calling (Hermes, Functionary)“ kostenlos?
Ja — der vollständige Text von „Open Models mit Function Calling (Hermes, Functionary)“ ist hier im Web kostenlos zu lesen. Um sie interaktiv zu üben (integrierter Code-Editor und 24/7 KI-Tutor) und den Rest des AI Agents-Kurses freizuschalten, upgrade auf CoddyKit PRO. Der AI Agents-Kurs umfasst insgesamt 4 Lektionen.
Was lerne ich in „Open Models mit Function Calling (Hermes, Functionary)“?
Die meisten grundlegenden Open Models können Tools nicht zuverlässig aufrufen – Hermes und Functionary wurden dafür feinabgestimmt. Du übst AI Agents mit praktischem Code, den du direkt im Browser ausführst, und ein 24/7 KI-Tutor beantwortet deine Fragen während du die Lektion bearbeitest.
Brauche ich Erfahrung, um AI Agents zu starten?
Keine Vorkenntnisse erforderlich. AI Agents auf CoddyKit ist für Anfänger bis fortgeschrittene Lernende strukturiert, sodass du hier starten oder von Anfang an beginnen und in deinem eigenen Tempo voranschreiten kannst. Dies ist Lektion 3 von 4.
Wie lange dauert die Lektion „Open Models mit Function Calling (Hermes, Functionary)“?
Die meisten CoddyKit-Lektionen dauern etwa 5–10 Minuten. Jede ist kompakt und interaktiv, sodass du stetig Fortschritte machst und genau dort weitermachst, wo du aufgehört hast – im Web und in der App.
Kann ich in dieser AI Agents-Lektion Code schreiben und ausführen?
Ja. Jede AI Agents-Lektion enthält einen integrierten Code-Editor, sodass du echten Code direkt in deinem Browser schreibst und ausführst und sofort KI-Feedback erhältst — ohne lokale Einrichtung erforderlich.
Alle Lektionen in diesem Kurs
- Überblick über Llama, Mistral und Qwen
- Lokale Modelle mit Ollama und llama.cpp ausführen
- Open Models mit Function Calling (Hermes, Functionary)
- Abwägungen: Latenz, Kosten, Fähigkeiten