0Pricing
AI Prompt Engineering · Pelajaran

Perbedaan Model Penalaran

Rantai pemikiran internal dibandingkan model standar: hal-hal yang berubah bagi penulis prompt.

Perbedaan Model Penalaran adalah pelajaran AI Prompt Engineering gratis di CoddyKit. Ini adalah pelajaran 1 dari 4. Kamu bisa membaca pelajaran lengkapnya di bawah secara gratis — lalu praktikkan langsung di browser dengan editor kode bawaan dan tutor AI 24/7. Ini adalah bagian dari jalur belajar AI Prompt Engineering, dan progresmu tersinkronisasi di web dan aplikasi CoddyKit. Kursus AI Prompt Engineering mencakup 4 pelajaran total.

Apa Itu Model Penalaran?

Model penalaran adalah LLM yang secara khusus dilatih dan dikonfigurasi untuk melakukan pertimbangan internal yang panjang sebelum menghasilkan respons. Contohnya mencakup seri o1/o3/o4 milik OpenAI dan Claude milik Anthropic dengan pemikiran diperluas yang diaktifkan.

Berbeda dari model standar yang langsung menghasilkan teks token demi token dari perintah Anda, model penalaran terlebih dahulu menghasilkan rantai pemikiran internal yang panjang, lalu merangkumnya menjadi jawaban akhir.

Standar vs Penalaran: Hal yang Anda Lihat

Dari sudut pandang pengguna API, perbedaannya adalah:

  • Model standar: Input → Output (cepat, langsung)
  • Model penalaran: Input → [Pemikiran internal, tersembunyi atau dialirkan] → Output (lebih lambat, lebih akurat untuk masalah sulit)

Proses berpikir tersebut merupakan kertas coretan pribadi model. Isinya dapat mencakup langkah yang keliru, koreksi mandiri, dan perhitungan sementara yang tidak pernah muncul dalam jawaban akhir.

Seri OpenAI o: Perilaku API

Model o1/o3/o4 milik OpenAI menangani pemikiran secara internal—secara bawaan, Anda tidak dapat melihat token penalarannya. Anda dapat mengamati jumlah token pemikiran dalam metadata penggunaan, tetapi tidak dapat melihat isinya.

import openai

client = openai.OpenAI(api_key='sk-...')

# o3 — reasoning happens internally
response = client.chat.completions.create(
    model='o3',
    messages=[
        {'role': 'user', 'content': 'Solve: A train leaves Chicago at 9am going 60mph. Another leaves NYC at 10am going 80mph. If the distance is 790 miles, when do they meet?'}
    ],
    # reasoning_effort='high'  # Optional: 'low', 'medium', 'high'
)

print(response.choices[0].message.content)
# Check how many tokens were used for thinking:
print('Input tokens:', response.usage.prompt_tokens)
print('Output tokens:', response.usage.completion_tokens)

Pemikiran Diperluas Claude: Perilaku API

Claude milik Anthropic mengekspos token pemikiran diperluas melalui API. Anda dapat mengalirkan dan mengamati proses penalaran model secara waktu nyata. Konten pemikiran muncul sebelum respons akhir.

import anthropic

client = anthropic.Anthropic(api_key='sk-ant-...')

# Enable extended thinking
response = client.messages.create(
    model='claude-opus-4-5',
    max_tokens=16000,
    thinking={
        'type': 'enabled',
        'budget_tokens': 10000  # Max tokens for thinking
    },
    messages=[{
        'role': 'user',
        'content': 'What is the 100th prime number?'
    }]
)

# Response contains both thinking blocks and text blocks
for block in response.content:
    if block.type == 'thinking':
        print('THINKING:', block.thinking[:200], '...')
    elif block.type == 'text':
        print('ANSWER:', block.text)

Mengalirkan Token Pemikiran

Anda dapat mengalirkan pemikiran diperluas secara waktu nyata dan melihat penalaran model saat berlangsung. Hal ini berguna untuk UX—menampilkan animasi "berpikir" atau memungkinkan pengguna tingkat lanjut mengamati proses penalaran.

import anthropic

client = anthropic.Anthropic(api_key='sk-ant-...')

def stream_with_thinking(question):
    with client.messages.stream(
        model='claude-opus-4-5',
        max_tokens=16000,
        thinking={'type': 'enabled', 'budget_tokens': 8000},
        messages=[{'role': 'user', 'content': question}]
    ) as stream:
        current_block_type = None
        for event in stream:
            # Track which block type we're in
            if hasattr(event, 'type'):
                if 'thinking' in str(event.type):
                    current_block_type = 'thinking'
                elif 'text' in str(event.type):
                    current_block_type = 'text'
            # Print text delta
            if hasattr(event, 'delta') and hasattr(event.delta, 'text'):
                prefix = '[THINK] ' if current_block_type == 'thinking' else '[ANS] '
                print(prefix + event.delta.text, end='', flush=True)

stream_with_thinking('Explain why P != NP is unproven.')

Hal yang Terjadi Secara Internal: Kertas Coretan

Pemikiran internal model merupakan kertas coretan yang dapat digunakan untuk:

  • Menjelajahi beberapa pendekatan sebelum menentukan pilihan
  • Melakukan perhitungan dan memverifikasinya
  • Mengidentifikasi kesalahannya sendiri dan menelusuri kembali langkahnya
  • Mempertimbangkan kasus tepi
  • Merencanakan solusi multi-langkah

Pertimbangan internal inilah yang membuat model penalaran jauh mengungguli model standar dalam matematika, pengodean, dan perencanaan strategis yang sulit—pada dasarnya, model tersebut melakukan tinjauan pustaka sebelum menulis.

budget_tokens: Mengendalikan Kedalaman Pemikiran

budget_tokens (Claude) atau reasoning_effort (OpenAI) mengendalikan seberapa banyak model berpikir. Semakin banyak proses berpikir, semakin akurat hasilnya untuk masalah sulit, tetapi biaya dan latensinya juga semakin tinggi.

import anthropic

client = anthropic.Anthropic(api_key='sk-ant-...')

def ask_with_budget(question, budget):
    r = client.messages.create(
        model='claude-opus-4-5',
        max_tokens=budget + 2048,  # must exceed budget_tokens
        thinking={'type': 'enabled', 'budget_tokens': budget},
        messages=[{'role': 'user', 'content': question}]
    )
    thinking_tokens = sum(
        len(b.thinking.split()) * 1.3  # rough estimate
        for b in r.content if b.type == 'thinking'
    )
    answer = next(b.text for b in r.content if b.type == 'text')
    return answer, int(thinking_tokens)

# Same hard question with different budgets
q = 'Prove that the square root of 2 is irrational.'
ans_small, tok_small = ask_with_budget(q, 1024)
ans_large, tok_large = ask_with_budget(q, 8000)
print(f'Small budget ({tok_small} thinking tokens): {ans_small[:100]}')
print(f'Large budget ({tok_large} thinking tokens): {ans_large[:100]}')

Temperature dan Model Penalaran

Model penalaran berperilaku berbeda saat menggunakan pengaturan temperature:

  • Untuk rangkaian model o OpenAI: temperature secara default bernilai 1 dan tidak selalu dapat diubah
  • Untuk extended thinking Claude: temperature biasanya ditetapkan ke 1 selama proses berpikir

Jangan mencoba menggunakan temperature untuk mengendalikan perilaku model penalaran — gunakan budget_tokens atau reasoning_effort sebagai gantinya.

import anthropic

client = anthropic.Anthropic(api_key='sk-ant-...')

# For Claude with extended thinking, temperature=1 is the default
# and best practice
response = client.messages.create(
    model='claude-opus-4-5',
    max_tokens=10000,
    temperature=1,  # Required to be 1 when extended thinking is enabled
    thinking={
        'type': 'enabled',
        'budget_tokens': 5000
    },
    messages=[{
        'role': 'user',
        'content': 'Write a Python function to find all prime numbers up to N.'
    }]
)
print(response.content[-1].text[:300])

Tolok Ukur Kinerja: Keunggulan Penalaran

Model penalaran paling unggul dibandingkan model standar pada:

  • Matematika kompetisi: AIME, AMC (o3 mendekati tingkat pakar manusia)
  • Pemrograman kompleks: Pemrograman kompetitif (Codeforces)
  • Penalaran ilmiah: GPQA (sains tingkat pascasarjana)
  • Logika multilangkah: Masalah yang memerlukan deduksi berurutan

Untuk tugas sederhana (tata bahasa, peringkasan, tanya jawab faktual), model standar memiliki kinerja yang sama baiknya dengan biaya 10–100 kali lebih rendah.

Kenyataan tentang Latensi

Model penalaran bekerja lambat. Masalah sulit dengan tingkat upaya penalaran tinggi dapat memerlukan waktu 30–60 detik. Rencanakan pengalaman pengguna Anda dengan tepat:

  • Tampilkan indikator kemajuan "sedang berpikir..."
  • Gunakan streaming untuk menampilkan hasil sebagian saat tersedia
  • Jangan gunakan model penalaran untuk obrolan waktu nyata yang membutuhkan latensi rendah
  • Hitung terlebih dahulu keluaran model penalaran untuk pertanyaan sulit yang sudah diketahui
import time
import anthropic

client = anthropic.Anthropic(api_key='sk-ant-...')

def timed_reasoning_call(question, budget):
    start = time.time()
    response = client.messages.create(
        model='claude-opus-4-5',
        max_tokens=budget + 2000,
        thinking={'type': 'enabled', 'budget_tokens': budget},
        messages=[{'role': 'user', 'content': question}]
    )
    elapsed = time.time() - start
    answer = next(b.text for b in response.content if b.type == 'text')
    print(f'Latency: {elapsed:.1f}s | Answer: {answer[:100]}')
    return answer

# Hard problem — expect 20-45 seconds
timed_reasoning_call(
    'Design a database schema for a multi-tenant SaaS billing system.',
    budget=8000
)

Model Penalaran dan Prompt Sistem

Model penalaran merespons prompt sistem secara berbeda dari model standar. Karena model ini melakukan penalaran internal sebelum menjawab, model ini dapat mengikuti instruksi kompleks multilangkah dalam prompt sistem dengan lebih andal.

Namun, prompt sistem yang sangat panjang dan membatasi dapat bertentangan dengan penalaran internal. Praktik terbaiknya adalah menjaga prompt sistem tetap ringkas untuk model penalaran — tentukan peran dan format keluaran, lalu biarkan penalaran internal model menangani strateginya.

Uji Pemahaman: Proses Berpikir Model Penalaran

Apa perbedaan utama antara hal yang diberikan oleh penulis prompt dan hal yang terjadi secara internal dalam model penalaran?

Ringkasan: Perbedaan Model Penalaran

Model penalaran seperti o1/o3 dan Claude dengan extended thinking menjalankan rantai pemikiran internal sebelum merespons. Penulis prompt memberikan masalah; model melakukan penalaran secara internal, mengeksplorasi berbagai pendekatan dan memperbaiki kesalahan sendiri, lalu menghasilkan jawaban akhir. Anda mengendalikan kedalaman berpikir dengan budget_tokens (Claude) atau reasoning_effort (OpenAI). Model penalaran unggul dalam matematika kompleks, pemrograman, dan logika multilangkah, tetapi biayanya 10–100 kali lebih mahal dan kecepatannya 10–100 kali lebih lambat daripada model standar. Gunakan streaming dan indikator kemajuan untuk mengelola latensi dalam pengalaman pengguna Anda.

Pertanyaan yang Sering Diajukan

Apakah pelajaran “Perbedaan Model Penalaran” gratis?

Ya — teks lengkap “Perbedaan Model Penalaran” gratis dibaca di sini di web. Untuk praktiknya secara interaktif (editor kode bawaan dan tutor AI 24/7) dan buka sisa kursus AI Prompt Engineering, upgrade ke CoddyKit PRO. Kursus AI Prompt Engineering mencakup 4 pelajaran total.

Apa yang akan aku pelajari di “Perbedaan Model Penalaran”?

Rantai pemikiran internal dibandingkan model standar: hal-hal yang berubah bagi penulis prompt. Kamu berlatih AI Prompt Engineering dengan kode praktik yang langsung kamu jalankan di browser, dan tutor AI 24/7 menjawab pertanyaanmu saat kamu mengerjakan pelajaran ini.

Apakah aku perlu pengalaman untuk memulai AI Prompt Engineering?

Tidak diperlukan pengalaman sebelumnya. AI Prompt Engineering di CoddyKit dirancang untuk pemula hingga pelajar tingkat lanjut, jadi kamu bisa memulai di sini atau dari awal dan belajar sesuai kecepatan kamu sendiri. Ini adalah pelajaran 1 dari 4.

Berapa lama pelajaran “Perbedaan Model Penalaran” memakan waktu?

Sebagian besar pelajaran CoddyKit memakan waktu sekitar 5–10 menit. Setiap pelajaran ringkas dan interaktif, jadi kamu membuat kemajuan stabil dan melanjutkan dari tempat kamu tinggalkan di web dan aplikasi.

Bisakah aku menulis dan menjalankan kode dalam pelajaran AI Prompt Engineering ini?

Ya. Setiap pelajaran AI Prompt Engineering menyertakan editor kode bawaan, jadi kamu menulis dan menjalankan kode nyata langsung di browser dan mendapatkan umpan balik AI instan — tidak diperlukan penyiapan lokal.

Semua pelajaran dalam kursus ini

  1. Perbedaan Model Penalaran
  2. Prompt Efektif untuk Penalaran Panjang
  3. Kapan Menggunakan Model Penalaran atau Standar
  4. Kompromi Biaya dan Latensi
← Kembali ke AI Prompt Engineering