Przegląd modeli Llama, Mistral i Qwen
Poznaj trzy najważniejsze rodziny modeli z otwartymi wagami: licencje, rozmiary i zastosowania każdego z nich.
Przegląd modeli Llama, Mistral i Qwen to bezpłatna lekcja AI Agents na CoddyKit. To lekcja 1 z 4. Możesz przeczytać całą lekcję poniżej za darmo — a potem ćwiczyć ją interaktywnie w przeglądarce z wbudowanym edytorem kodu i tutorem AI dostępnym 24/7. To część ścieżki edukacyjnej AI Agents, a Twój postęp synchronizuje się między webem a aplikacją CoddyKit. Kurs AI Agents zawiera 4 lekcji w sumie.
Części tej lekcji nie zostały jeszcze przetłumaczone i są wyświetlane po angielsku.
Dlaczego open source?
Modele z otwartymi wagami zapewniają:
- brak opłat API za poszczególne tokeny
- prywatność danych — model działa na własnym sprzęcie
- możliwość dostosowania (fine-tuning) na dowolną skalę
- brak uzależnienia od dostawcy
Koszt: czas inżynierów, rachunki za GPU i zwykle niższa jakość niż w przypadku najlepszych modeli.
Rodzina Llama (Meta)
- Wydawana w latach 2023–2025 w rozmiarach od 1B do 405B
- Llama 3.x oferuje bardzo wysokie możliwości; model 8B konkuruje ze średniej klasy modelami zamkniętymi
- Licencja społecznościowa (zezwala na użycie komercyjne pod określonymi warunkami)
- Ogromny ekosystem; większość dostrojeń bazuje na modelach Llama
Rodzina Mistral (Mistral AI)
- Mistral 7B Instruct — mocny mały model
- Mixtral 8x7B — architektura Mixture-of-Experts, szybkość i wysokie możliwości
- Mistral Large / Medium — zamknięte wagi, dostępne za pośrednictwem API
- Licencja Apache 2.0 dla otwartych wariantów
Rodzina Qwen (Alibaba)
- Qwen 2.5 — czołowy model rozumowania z otwartymi wagami (2024)
- Doskonała obsługa wielu języków, szczególnie chińskiego
- Rozmiary od 0.5B do 72B
- Apache 2.0
Inne warte uwagi modele
- Gemma (Google) — mały i dopracowany
- Phi (Microsoft) — niewielki, ale wydajny
- DeepSeek — silne rozumowanie przy niższym koszcie
- Yi — dobra obsługa wielu języków
Wybór rozmiaru
| Rozmiar | Zastosowanie |
|---|---|
| 1-3B | Urządzenia brzegowe, urządzenia mobilne, klasyfikacja |
| 7-8B | Pojedyncze GPU, prości agenci |
| 13-30B | Większe GPU lub 2–4 małe GPU, rzeczywiste zastosowania agentowe |
| 70B+ | Wiele GPU, jakość zbliżona do najlepszych modeli |
Istotne benchmarki
- MMLU — wiedza ogólna
- GSM8K — matematyka
- HumanEval — kod
- MT-Bench — jakość rozmowy
- HELM / LMSYS Chatbot Arena — preferencje użytkowników
Należy dobierać benchmarki odpowiednie dla własnego zadania.
Zmniejsza się przewaga modeli frontier
Zamknięte modele frontier (GPT-4o, Claude Sonnet 4.5) nadal wyprzedzają inne modele w najtrudniejszych benchmarkach. Jednak otwarte modele 70B dorównują zamkniętym modelom średniej klasy w większości zadań agentowych.
Kwestie licencyjne
Należy sprawdzić licencję każdego modelu:
- Apache 2.0 — w pełni permisywna
- Llama Community License — ograniczenia dotyczące usług na ogromną skalę i określonych zastosowań
- Niektóre licencje „tylko do celów badawczych” — uniemożliwiają wdrożenie komercyjne
Usługi hostowane a własny hosting
Można korzystać z otwartych modeli za pośrednictwem hostowanych API (Together AI, Anyscale, Groq, Fireworks) bez uruchamiania własnej infrastruktury — często jest to tańsze niż OpenAI przy tej samej jakości.
Hosted Open Models on Groq
from openai import OpenAI
client = OpenAI(
base_url='https://api.groq.com/openai/v1',
api_key=GROQ_KEY
)
response = client.chat.completions.create(
model='llama-3.1-70b-versatile',
messages=[{'role': 'user', 'content': 'Hello'}]
)Kiedy wygrywa OSS
- Krytyczne znaczenie prywatności: medycyna, prawo, obronność
- Bardzo duży wolumen: koszt pojedynczego wywołania ma znaczenie
- Duże możliwości dostosowania: dostrojenia dla konkretnej dziedziny
- Wielojęzyczność, gdy zamknięci dostawcy są słabsi
Kiedy wygrywają modele zamknięte
- Rozumowanie na najwyższym poziomie
- Obsługa wielu modalności (obraz, głos)
- Długi kontekst: Claude / Gemini nadal prowadzą
- Szybkie prototypowanie
Najmniejszy wystarczająco wydajny model
Jaki zakres rozmiarów jest typowy dla prostego wewnętrznego agenta działającego na pojedynczym GPU?
Podsumowanie
Llama, Mistral i Qwen to wielka trójka. Należy wybrać najmniejszy rozmiar spełniający wymagania jakościowe. Dostawcy hostingu (Groq, Together) pozwalają uniknąć zarządzania infrastrukturą.
Często zadawane pytania
Czy lekcja „Przegląd modeli Llama, Mistral i Qwen” jest bezpłatna?
Tak — pełny tekst „Przegląd modeli Llama, Mistral i Qwen” jest dostępny za darmo tutaj w sieci. Aby ćwiczyć ją interaktywnie (wbudowany edytor kodu i tutor AI dostępny 24/7) i odblokować resztę kursu AI Agents, przejdź na CoddyKit PRO. Kurs AI Agents zawiera 4 lekcji w sumie.
Co nauczysz się w „Przegląd modeli Llama, Mistral i Qwen”?
Poznaj trzy najważniejsze rodziny modeli z otwartymi wagami: licencje, rozmiary i zastosowania każdego z nich. Ćwiczysz AI Agents z praktycznym kodem, który uruchamiasz bezpośrednio w przeglądarce, a tutor AI dostępny 24/7 odpowiada na Twoje pytania podczas pracy nad lekcją.
Czy potrzebuję doświadczenia, aby zacząć AI Agents?
Nie wymagamy żadnego doświadczenia. AI Agents w CoddyKit jest strukturyzowany dla początkujących i zaawansowanych użytkowników, więc możesz zacząć tutaj lub od początku i uczyć się w swoim tempie. To lekcja 1 z 4.
Ile czasu zajmuje lekcja „Przegląd modeli Llama, Mistral i Qwen”?
Większość lekcji CoddyKit trwa około 5–10 minut. Każda lekcja to mały, interaktywny krok, dzięki czemu robisz systematyczne postępy i zawsze wracasz dokładnie do tego samego miejsca — na webie i w aplikacji.
Czy mogę pisać i uruchamiać kod w tej lekcji AI Agents?
Tak. Każda lekcja AI Agents zawiera wbudowany edytor kodu, więc piszesz i uruchamiasz prawdziwy kod bezpośrednio w przeglądarce i od razu otrzymujesz sprzężenie zwrotne od AI — bez konfiguracji na komputerze.
Wszystkie lekcje w tym kursie
- Przegląd modeli Llama, Mistral i Qwen
- Uruchamianie modeli lokalnych za pomocą Ollama i llama.cpp
- Wywoływanie funkcji w modelach otwartych (Hermes, Functionary)
- Kompromisy: opóźnienie, koszt, możliwości