0Pricing
AI Agents · Pelajaran

Model Dunia dan Prediksi Langkah Berikutnya

Prediksi hasil suatu tindakan sebelum melakukannya; pilih tindakan dengan hasil yang diprediksi paling baik.

Model Dunia dan Prediksi Langkah Berikutnya adalah pelajaran AI Agents gratis di CoddyKit. Ini adalah pelajaran 3 dari 4. Kamu bisa membaca pelajaran lengkapnya di bawah secara gratis — lalu praktikkan langsung di browser dengan editor kode bawaan dan tutor AI 24/7. Ini adalah bagian dari jalur belajar AI Agents, dan progresmu tersinkronisasi di web dan aplikasi CoddyKit. Kursus AI Agents mencakup 4 pelajaran total.

Bagian dari pelajaran ini belum diterjemahkan dan ditampilkan dalam bahasa Inggris.

Prediksi Sebelum Bertindak

Agen terbaik tidak sekadar mencoba berbagai hal — agen tersebut terlebih dahulu memprediksi hasil, memilih yang terbaik, lalu bertindak. Ini merupakan gagasan yang sama dengan mencari beberapa langkah ke depan dalam catur.

Apa Itu Model Dunia?

Model dunia memprediksi: jika diberikan keadaan current S dan tindakan A, apa keadaan berikutnya S'?

Untuk agen LLM, LLM itu sendiri dapat menjadi model dunia:

prediction_prompt = '''
Current state: {state}
Proposed action: {action}
What is the most likely outcome? Return JSON: {new_state, success_probability}.
'''

Mengapa Pandangan ke Depan Membantu

Beberapa tindakan tidak dapat dibatalkan (mengirim surel, menghapus data). Melakukan prediksi terlebih dahulu dapat menghindari kesalahan yang mahal.

Tindakan lainnya memiliki hasil yang tidak jelas. Prediksi memaksa agen untuk memikirkan konsekuensinya.

Simple 1-Step Lookahead

candidates = [a1, a2, a3]
predictions = [predict(state, a) for a in candidates]
best = max(zip(predictions, candidates), key=lambda p: p[0].success_probability)[1]
act(best)

Pandangan ke Depan Multilangkah (Pencarian Pohon)

Kembangkan beberapa langkah ke depan. Untuk setiap kandidat, prediksi hasilnya, lalu prediksi hasil dari hasil tersebut:

def search(state, depth=2):
    if depth == 0:
        return value(state)
    actions = candidate_actions(state)
    best_score = -math.inf
    for a in actions:
        next_state = predict(state, a)
        score = search(next_state, depth - 1)
        best_score = max(best_score, score)
    return best_score

Pohon Pemikiran

Yao dan rekan-rekan, 2023 — memperluas CoT menjadi sebuah pohon. Agen menghasilkan beberapa "jalur pemikiran", mengevaluasi masing-masing, lalu mengembangkan jalur yang paling menjanjikan:

import random

def continue_thought(question):
    return question + ' -> idea' + str(random.randint(1, 100))

def score(t):
    return len(t)

def expand_top_k(thoughts, scores, k):
    ranked = sorted(zip(thoughts, scores), key=lambda x: -x[1])
    return [t for t, s in ranked[:k]]

def ToT(question):
    thoughts = [continue_thought(question) for _ in range(5)]
    for depth in range(2):
        scores = [score(t) for t in thoughts]
        thoughts = expand_top_k(thoughts, scores, k=3)
    return thoughts

result = ToT('How to reduce agent latency?')
print('Top thoughts:', result)

Pencarian Pohon Monte Carlo (MCTS)

Untuk pohon pencarian yang sangat besar: ambil sampel jalur, beri score pada hasil, dan propagasikan score kembali ke atas untuk membantu pemilihan berikutnya. Banyak digunakan dalam AI permainan; mulai berkembang dalam penelitian agen.

Biaya Pandangan ke Depan

Setiap tindakan yang diprediksi adalah satu pemanggilan LLM. Pandangan ke depan dengan depth=2 dan branch=3 memerlukan 9 pemanggilan hanya untuk menentukan satu tindakan ONE. Gunakan pandangan ke depan hanya untuk keputusan berisiko tinggi.

Pemangkasan Heuristik

Lewati prediksi untuk tindakan yang jelas-jelas buruk. Saring terlebih dahulu tindakan kandidat dengan pengklasifikasi atau aturan murah.

Kalibrasi Prediksi

Prediksi LLM tidak sempurna. Lakukan kalibrasi dengan sesekali membandingkan hasil yang diprediksi dan hasil aktual:

for trace in recent_traces:
    predicted = trace.predicted_outcome
    actual = trace.actual_outcome
    log.info('prediction-accuracy', match=(predicted == actual))

Kapan NOT Menggunakan Pandangan ke Depan

  • Tindakan murah dan dapat dibatalkan — langsung coba saja
  • Jalur yang kritis terhadap latensi
  • Tugas dengan hasil yang sudah jelas

Kapan TO Menggunakan Pandangan ke Depan

  • Tindakan yang tidak dapat dibatalkan (keuangan, komunikasi)
  • Rencana multilangkah yang kesalahannya saling terakumulasi
  • Ranah berisiko tinggi (medis, hukum)
  • Tugas adversarial (permainan, debat)

Pandangan ke Depan Internal Bergaya o1

Model penalaran OpenAI o1 / o3 secara otomatis melakukan pandangan ke depan internal selama fase "berpikir". Model-model tersebut mengeksplorasi banyak kelanjutan sebelum berkomitmen. Anda tidak perlu mengimplementasikannya secara eksternal.

Pertukaran Pandangan ke Depan

Apa biaya utama dari pandangan ke depan multilangkah?

Ringkasan

Prediksikan sebelum bertindak. Pandangan ke depan satu langkah murah dan berguna; pencarian pohon mahal tetapi kuat. Model penalaran (o1, o3) mengotomatiskan hal ini. Gunakan seperlunya.

Pertanyaan yang Sering Diajukan

Apakah pelajaran “Model Dunia dan Prediksi Langkah Berikutnya” gratis?

Ya — teks lengkap “Model Dunia dan Prediksi Langkah Berikutnya” gratis dibaca di sini di web. Untuk praktiknya secara interaktif (editor kode bawaan dan tutor AI 24/7) dan buka sisa kursus AI Agents, upgrade ke CoddyKit PRO. Kursus AI Agents mencakup 4 pelajaran total.

Apa yang akan aku pelajari di “Model Dunia dan Prediksi Langkah Berikutnya”?

Prediksi hasil suatu tindakan sebelum melakukannya; pilih tindakan dengan hasil yang diprediksi paling baik. Kamu berlatih AI Agents dengan kode praktik yang langsung kamu jalankan di browser, dan tutor AI 24/7 menjawab pertanyaanmu saat kamu mengerjakan pelajaran ini.

Apakah aku perlu pengalaman untuk memulai AI Agents?

Tidak diperlukan pengalaman sebelumnya. AI Agents di CoddyKit dirancang untuk pemula hingga pelajar tingkat lanjut, jadi kamu bisa memulai di sini atau dari awal dan belajar sesuai kecepatan kamu sendiri. Ini adalah pelajaran 3 dari 4.

Berapa lama pelajaran “Model Dunia dan Prediksi Langkah Berikutnya” memakan waktu?

Sebagian besar pelajaran CoddyKit memakan waktu sekitar 5–10 menit. Setiap pelajaran ringkas dan interaktif, jadi kamu membuat kemajuan stabil dan melanjutkan dari tempat kamu tinggalkan di web dan aplikasi.

Bisakah aku menulis dan menjalankan kode dalam pelajaran AI Agents ini?

Ya. Setiap pelajaran AI Agents menyertakan editor kode bawaan, jadi kamu menulis dan menjalankan kode nyata langsung di browser dan mendapatkan umpan balik AI instan — tidak diperlukan penyiapan lokal.

Semua pelajaran dalam kursus ini

  1. Dekomposisi Tugas Hierarkis
  2. Tumpukan Tujuan dan Pelacakan Mundur
  3. Model Dunia dan Prediksi Langkah Berikutnya
  4. Siklus Refleksi dan Kritik Mandiri
← Kembali ke AI Agents