Ollama ve llama.cpp ile Yerel Modelleri Çalıştırma
Ollama, LLM'ler için 'docker run' komutunu kolaylaştırır; llama.cpp ise niceleme ve doğrudan C++ denetimiyle daha derine iner.
Ollama ve llama.cpp ile Yerel Modelleri Çalıştırma, CoddyKit'te ücretsiz bir AI Agents dersidir. Bu, 4 dersinin 2. dersidir. Aşağıdan dersin tamamını ücretsiz okuyabilir, sonra tarayıcıda yerleşik kod editörü ve 7/24 yapay zeka koçu ile uygulamalı olarak pratik yapabilirsin. Bu, AI Agents öğrenme yolunun bir parçasıdır ve ilerlemeniz web ve CoddyKit uygulaması arasında senkronize olur. AI Agents kursu toplamda 4 dersten oluşur.
Bu dersin bazı bölümleri henüz çevrilmemiş olup İngilizce olarak gösterilmektedir.
İki Kolay Yol
Açık modelleri bir iş istasyonunda veya sunucuda kendi sunucunuzda barındırmak için:
- Ollama — en basit seçenek, LLM'ler için Docker benzeri kullanıcı deneyimi
- llama.cpp — donanıma daha yakın, daha fazla denetim ve daha küçük ayak izi
Ollama Quick Start
# Install (macOS):
brew install ollama
# Pull a model:
ollama pull llama3.1:8b
# Run interactively:
ollama run llama3.1:8b 'Hello'
# Serve via HTTP (OpenAI-compatible):
ollama serveCalling Ollama Via SDK
from openai import OpenAI
client = OpenAI(base_url='http://localhost:11434/v1', api_key='ollama')
response = client.chat.completions.create(
model='llama3.1:8b',
messages=[{'role': 'user', 'content': 'Hello'}]
)
print(response.choices[0].message.content)Ollama ile Araç Çağırma
Ollama, uyumlu modeller için araç çağırmayı destekler (Llama 3.1+, Mistral, Qwen 2.5):
tools = [{'type': 'function', 'function': {...}}]
response = client.chat.completions.create(
model='llama3.1:8b',
messages=messages,
tools=tools
)llama.cpp Temelleri
llama.cpp, ANY GGUF biçimli modeli CPU, GPU veya Metal (Apple Silicon) üzerinde çalıştıran bir C++ uygulamasıdır:
# Build (or install pre-built):
git clone https://github.com/ggerganov/llama.cpp
cd llama.cpp && make
# Run a quantized model:
./llama-cli -m models/llama-3.1-8b-instruct.Q4_K_M.gguf -p 'Hello'Server Mode
./llama-server -m models/llama-3.1-8b-instruct.Q4_K_M.gguf --port 8080
# Now OpenAI-compatible endpoint at http://localhost:8080/v1Nicemleme
4 bitlik nicemleme (Q4_K_M), "16 GB"lık bir modeli yaklaşık 5 GB RAM ile, önemsiz bir kalite kaybıyla çalıştırmanızı sağlar. Önce Q4'ü deneyin; kalite açısından kritik görevler için daha yüksek bir düzeye (Q5, Q6, Q8) geçin.
Donanım Gereksinimleri
| Model | Q4 RAM | Q4 VRAM |
|---|---|---|
| 7-8B | ~6 GB | ~6 GB |
| 13B | ~10 GB | ~10 GB |
| 70B | ~40 GB | ~40 GB |
Apple Silicon'ın birleşik belleği, büyük yerel modelleri şaşırtıcı derecede kullanılabilir hâle getirir.
İş Hacmi için vLLM
Yüksek eşzamanlılıkla üretim ortamında hizmet sunmak için vLLM kullanın (PagedAttention, sürekli toplu işleme):
# pip install vllm
from vllm import LLM, SamplingParams
llm = LLM(model='meta-llama/Llama-3.1-8B-Instruct')
params = SamplingParams(temperature=0.2, max_tokens=512)
result = llm.generate(['Hello world'], params)Metin Üretimi Çıkarımı (TGI)
HuggingFace TGI — başka bir üretim sunucusudur. Güçlü araç kullanımı desteği sunar.
Sunucuları Karşılaştırma
- Ollama — en iyi kullanıcı deneyimi, basit CLI/HTTP, geliştirme için iyi
- llama.cpp — en hafif seçenek, her yerde çalışır
- vLLM — en yüksek iş hacmi, yalnızca GPU
- TGI — HuggingFace entegrasyonu ve izleme
Ne Zaman Kendi Sunucunuzda Barındırmalısınız?
- Sıkı gizlilik gereksinimleri
- Çok yüksek hacim (maliyet dengesi günde yaklaşık 10 milyon belirteçte değişir)
- İnce ayarlanmış modeller
- Uç cihaz veya çevrimdışı senaryolar
Ne Zaman Kendi Sunucunuzda Barındırmamalısınız?
- Düşük hacimli yan projeler (barındırılan seçenek daha ucuzdur)
- En ileri düzey akıl yürütme kalitesi gereksinimi
- Çok kipli görevler
OpenAI Uyumlu Uç Nokta
OpenAI uyumlu uç nokta kuralı yerel modeller için neden kullanışlıdır?
Özet
Geliştirme kolaylığı için Ollama, taşınabilirlik için llama.cpp, üretim iş hacmi için vLLM kullanın. Hepsi OpenAI biçimli API'lerle çalışır; böylece kodu değiştirmeden geçiş yapabilirsiniz.
Sıkça Sorulan Sorular
“Ollama ve llama.cpp ile Yerel Modelleri Çalıştırma” dersi ücretsiz mi?
Evet — “Ollama ve llama.cpp ile Yerel Modelleri Çalıştırma” dersin tüm metni burada web'de ücretsiz olarak okunabilir. Etkileşimli olarak pratik yapmak (yerleşik kod editörü ve 7/24 yapay zeka koçu) ve AI Agents kursunun geri kalanını açmak için CoddyKit PRO'ya yükselt. AI Agents kursu toplamda 4 dersten oluşur.
“Ollama ve llama.cpp ile Yerel Modelleri Çalıştırma” dersinde ne öğreneceğim?
Ollama, LLM'ler için 'docker run' komutunu kolaylaştırır; llama.cpp ise niceleme ve doğrudan C++ denetimiyle daha derine iner. AI Agents ile uygulamalı kodu tarayıcıda doğrudan çalıştırarak pratik yaparsın ve 7/24 yapay zeka koçu dersi çalışırken sorularını yanıtlar.
AI Agents öğrenmeye başlamak için deneyim gerekli mi?
Önceden deneyim gerekmez. CoddyKit'te AI Agents, başlangıçtan ileri seviyeye kadar yapılandırıldığı için buradan başlayabilir veya başından başlayıp kendi hızında ilerleme yapabilirsin. Bu, 4 dersinin 2. dersidir.
“Ollama ve llama.cpp ile Yerel Modelleri Çalıştırma” dersi ne kadar sürer?
Çoğu CoddyKit dersi yaklaşık 5–10 dakika sürer. Her biri kısa ve etkileşimli olduğu için sabit ilerleme yaparsın ve web ile uygulama arasında tam olarak bıraktığın yerden devam edebilirsin.
Bu AI Agents dersinde kod yazıp çalıştırabilir miyim?
Evet. Her AI Agents dersi yerleşik bir kod editörü içerir, bu sayede tarayıcıda gerçek kod yazıp çalıştırabilir ve anlık yapay zeka geri bildirimi alırsın — yerel kurulum gerekli değildir.
Bu kursun tüm dersleri
- Llama, Mistral ve Qwen'e Genel Bakış
- Ollama ve llama.cpp ile Yerel Modelleri Çalıştırma
- Açık Modellerde İşlev Çağırma (Hermes, Functionary)
- Ödünleşimler: Gecikme, Maliyet, Yetenek