Menjalankan Model Lokal dengan Ollama dan llama.cpp
Ollama menjadikan LLM semudah 'docker run'; llama.cpp menawarkan kendali lebih mendalam melalui kuantisasi dan kendali C++ langsung.
Menjalankan Model Lokal dengan Ollama dan llama.cpp adalah pelajaran AI Agents gratis di CoddyKit. Ini adalah pelajaran 2 dari 4. Kamu bisa membaca pelajaran lengkapnya di bawah secara gratis — lalu praktikkan langsung di browser dengan editor kode bawaan dan tutor AI 24/7. Ini adalah bagian dari jalur belajar AI Agents, dan progresmu tersinkronisasi di web dan aplikasi CoddyKit. Kursus AI Agents mencakup 4 pelajaran total.
Bagian dari pelajaran ini belum diterjemahkan dan ditampilkan dalam bahasa Inggris.
Dua Jalur Mudah
Untuk menjalankan model terbuka sendiri di stasiun kerja atau peladen:
- Ollama—yang paling sederhana, dengan pengalaman penggunaan mirip Docker untuk model bahasa besar
- llama.cpp—lebih dekat ke perangkat keras, lebih banyak kendali, dan jejak penggunaan yang lebih kecil
Ollama Quick Start
# Install (macOS):
brew install ollama
# Pull a model:
ollama pull llama3.1:8b
# Run interactively:
ollama run llama3.1:8b 'Hello'
# Serve via HTTP (OpenAI-compatible):
ollama serveCalling Ollama Via SDK
from openai import OpenAI
client = OpenAI(base_url='http://localhost:11434/v1', api_key='ollama')
response = client.chat.completions.create(
model='llama3.1:8b',
messages=[{'role': 'user', 'content': 'Hello'}]
)
print(response.choices[0].message.content)Pemanggilan Alat Ollama
Ollama mendukung pemanggilan alat untuk model yang kompatibel (Llama 3.1+, Mistral, Qwen 2.5):
tools = [{'type': 'function', 'function': {...}}]
response = client.chat.completions.create(
model='llama3.1:8b',
messages=messages,
tools=tools
)Dasar-Dasar llama.cpp
llama.cpp adalah implementasi C++ yang menjalankan model berformat GGUF apa pun pada CPU, GPU, atau Metal (Apple Silicon):
# Build (or install pre-built):
git clone https://github.com/ggerganov/llama.cpp
cd llama.cpp && make
# Run a quantized model:
./llama-cli -m models/llama-3.1-8b-instruct.Q4_K_M.gguf -p 'Hello'Server Mode
./llama-server -m models/llama-3.1-8b-instruct.Q4_K_M.gguf --port 8080
# Now OpenAI-compatible endpoint at http://localhost:8080/v1Kuantisasi
Kuantisasi 4-bit (Q4_K_M) memungkinkan Anda menjalankan model "16GB" dalam RAM sekitar 5GB dengan sedikit kehilangan kualitas. Cobalah Q4 terlebih dahulu; gunakan tingkat yang lebih tinggi (Q5, Q6, Q8) untuk tugas yang sangat mengutamakan kualitas.
Persyaratan Perangkat Keras
| Model | RAM Q4 | VRAM Q4 |
|---|---|---|
| 7-8B | ~6 GB | ~6 GB |
| 13B | ~10 GB | ~10 GB |
| 70B | ~40 GB | ~40 GB |
Memori terpadu Apple Silicon membuat model lokal berukuran besar ternyata dapat digunakan dengan baik.
vLLM untuk Laju Pemrosesan
Untuk penyajian produksi dengan konkurensi tinggi, gunakan vLLM (PagedAttention, pengelompokan batch berkelanjutan):
# pip install vllm
from vllm import LLM, SamplingParams
llm = LLM(model='meta-llama/Llama-3.1-8B-Instruct')
params = SamplingParams(temperature=0.2, max_tokens=512)
result = llm.generate(['Hello world'], params)Inferensi Pembuatan Teks (TGI)
HuggingFace TGI adalah peladen produksi lainnya. Dukungan penggunaan alatnya kuat.
Membandingkan Peladen
- Ollama—pengalaman penggunaan terbaik, CLI/HTTP sederhana, baik untuk pengembangan
- llama.cpp—paling ringan, berjalan di mana saja
- vLLM—laju pemrosesan tertinggi, hanya GPU
- TGI—integrasi HuggingFace, pemantauan
Kapan Menjalankan Sendiri
- Privasi ketat
- Volume sangat tinggi (titik peralihan biaya sekitar 10 juta token/hari)
- Model yang disetel halus
- Skenario perangkat tepi atau luring
Kapan NOT Menjalankan Sendiri
- Proyek sampingan dengan volume kecil (layanan terkelola lebih murah)
- Diperlukan kualitas penalaran terdepan
- Tugas multimodal
Titik Akhir yang Kompatibel dengan OpenAI
Mengapa konvensi titik akhir yang kompatibel dengan OpenAI bagus untuk model lokal?
Rangkuman
Ollama untuk kesederhanaan pengembangan, llama.cpp untuk portabilitas, dan vLLM untuk laju pemrosesan produksi. Semuanya menggunakan API berbentuk OpenAI sehingga Anda dapat menggantinya tanpa perubahan kode.
Pertanyaan yang Sering Diajukan
Apakah pelajaran “Menjalankan Model Lokal dengan Ollama dan llama.cpp” gratis?
Ya — teks lengkap “Menjalankan Model Lokal dengan Ollama dan llama.cpp” gratis dibaca di sini di web. Untuk praktiknya secara interaktif (editor kode bawaan dan tutor AI 24/7) dan buka sisa kursus AI Agents, upgrade ke CoddyKit PRO. Kursus AI Agents mencakup 4 pelajaran total.
Apa yang akan aku pelajari di “Menjalankan Model Lokal dengan Ollama dan llama.cpp”?
Ollama menjadikan LLM semudah 'docker run'; llama.cpp menawarkan kendali lebih mendalam melalui kuantisasi dan kendali C++ langsung. Kamu berlatih AI Agents dengan kode praktik yang langsung kamu jalankan di browser, dan tutor AI 24/7 menjawab pertanyaanmu saat kamu mengerjakan pelajaran ini.
Apakah aku perlu pengalaman untuk memulai AI Agents?
Tidak diperlukan pengalaman sebelumnya. AI Agents di CoddyKit dirancang untuk pemula hingga pelajar tingkat lanjut, jadi kamu bisa memulai di sini atau dari awal dan belajar sesuai kecepatan kamu sendiri. Ini adalah pelajaran 2 dari 4.
Berapa lama pelajaran “Menjalankan Model Lokal dengan Ollama dan llama.cpp” memakan waktu?
Sebagian besar pelajaran CoddyKit memakan waktu sekitar 5–10 menit. Setiap pelajaran ringkas dan interaktif, jadi kamu membuat kemajuan stabil dan melanjutkan dari tempat kamu tinggalkan di web dan aplikasi.
Bisakah aku menulis dan menjalankan kode dalam pelajaran AI Agents ini?
Ya. Setiap pelajaran AI Agents menyertakan editor kode bawaan, jadi kamu menulis dan menjalankan kode nyata langsung di browser dan mendapatkan umpan balik AI instan — tidak diperlukan penyiapan lokal.
Semua pelajaran dalam kursus ini
- Ikhtisar Llama, Mistral, dan Qwen
- Menjalankan Model Lokal dengan Ollama dan llama.cpp
- Model Terbuka dengan Pemanggilan Fungsi (Hermes, Functionary)
- Pertukaran: Latensi, Biaya, Kemampuan