Garis Depan Riset: AGI dan Selanjutnya
Masalah terbuka dalam ketangguhan agen, memori cakrawala panjang, dan koordinasi multiagen.
Garis Depan Riset: AGI dan Selanjutnya adalah pelajaran AI Agents gratis di CoddyKit. Ini adalah pelajaran 4 dari 4. Kamu bisa membaca pelajaran lengkapnya di bawah secara gratis — lalu praktikkan langsung di browser dengan editor kode bawaan dan tutor AI 24/7. Ini adalah bagian dari jalur belajar AI Agents, dan progresmu tersinkronisasi di web dan aplikasi CoddyKit. Kursus AI Agents mencakup 4 pelajaran total.
Kondisi Agen Kecerdasan Buatan pada 2025
Pada 2025, agen kecerdasan buatan yang didukung model bahasa besar dapat menyelesaikan tugas kompleks dengan banyak langkah secara andal, menggunakan alat, menalar lintas modalitas, dan beroperasi dengan pengawasan terbatas. Namun, beberapa tantangan mendasar masih belum terpecahkan sebelum agen mencapai kemampuan umum yang sesungguhnya.
Pelajaran ini membahas garis depan riset terbuka yang menentukan generasi kecerdasan buatan berikutnya.
Masalah Terbuka 1: Memori Jangka Panjang
LLM saat ini memiliki jendela konteks sebesar 128K–1M token — mengesankan, tetapi masih terbatas untuk tugas yang berlangsung selama berbulan-bulan. Masalah terbukanya adalah bagaimana secara andal memadatkan, mengambil kembali, dan menalar menggunakan memori dengan rentang waktu yang benar-benar panjang tanpa kehilangan detail penting atau menimbulkan halusinasi.
# Illustration of long-horizon memory challenges:
LONG_HORIZON_CHALLENGES = {
'compression': {
'problem': 'Summarising months of interactions loses nuance',
'current_approach': 'Hierarchical summarisation (recent detail, old summary)',
'limitation': 'Important details get compressed away; hallucination risk in summaries'
},
'retrieval': {
'problem': 'Finding the relevant memory among millions of entries',
'current_approach': 'Embedding-based similarity search (vector databases)',
'limitation': 'Semantic similarity does not always match relevance; false negatives'
},
'reasoning_over_time': {
'problem': 'Connecting observations from 6 months apart',
'current_approach': 'Temporal indexing + LLM reasoning',
'limitation': 'LLMs struggle with precise temporal ordering of distant events'
}
}
for challenge, details in LONG_HORIZON_CHALLENGES.items():
print(f'{challenge}: {details["limitation"][:80]}')Masalah Terbuka 2: Ketangguhan Lintas Ranah
Agen saat ini rapuh: agen yang disetel halus untuk dukungan pelanggan mungkin gagal pada tugas serupa di ranah baru (medis, hukum, atau teknis). Ketangguhan yang sesungguhnya berarti bekerja dengan baik pada tugas dan ranah yang tidak pernah dilatihkan secara khusus kepada agen — persyaratan utama untuk AGI.
# Measuring domain robustness
import statistics
def measure_domain_robustness(agent_fn, test_suite: dict) -> dict:
"""
test_suite: {domain: [(input, expected_output)]}
Returns per-domain accuracy and overall robustness score.
"""
domain_scores = {}
for domain, cases in test_suite.items():
correct = 0
for inp, expected in cases:
result = agent_fn(inp)
# Simplified scoring: check if expected phrase is in result
if expected.lower() in result.lower():
correct += 1
domain_scores[domain] = round(correct / len(cases), 3)
scores = list(domain_scores.values())
return {
'domain_scores': domain_scores,
'mean_accuracy': round(statistics.mean(scores), 3),
'min_accuracy': min(scores), # robustness = performance on worst domain
'variance': round(statistics.variance(scores), 4)
}
# High variance = brittle (good at some domains, bad at others)
# Low variance + high mean = robust
if __name__ == '__main__':
def toy_agent(inp):
return {
'2+2': 'The answer is 4',
'capital of France': 'Paris is the capital'
}.get(inp, 'I do not know')
test_suite = {
'math': [('2+2', '4')],
'geography': [('capital of France', 'paris')],
}
result = measure_domain_robustness(toy_agent, test_suite)
print('Domain scores:', result['domain_scores'])
print('Mean accuracy:', result['mean_accuracy'])
Masalah Terbuka 3: Koordinasi Multiagen
Jaringan agen khusus dapat menangani tugas yang melampaui kemampuan satu agen. Namun, mengoordinasikannya sulit: agen harus berkomunikasi secara efisien, menghindari pengulangan pekerjaan, menyelesaikan konflik, dan berbagi kemajuan tanpa hambatan dari satu titik pusat.
import anthropic
import json
client = anthropic.Anthropic(api_key='YOUR_API_KEY')
# Simple task negotiation between two agents
def negotiate_task_division(
task: str,
agent1_capabilities: list,
agent2_capabilities: list
) -> dict:
prompt = (
f'Task: {task}\n\n'
f'Agent A capabilities: {agent1_capabilities}\n'
f'Agent B capabilities: {agent2_capabilities}\n\n'
'How should this task be divided between Agent A and Agent B?\n'
'Minimise handoffs. Assign subtasks to the best-suited agent.\n'
'Return JSON: {"agent_a_tasks": [str], "agent_b_tasks": [str], '
'"shared_tasks": [str], "handoffs": int}'
)
response = client.messages.create(
model='claude-opus-4-5', max_tokens=512,
messages=[{'role': 'user', 'content': prompt}]
)
return json.loads(response.content[0].text)
# Open research challenge:
# How do agents coordinate without a central planner
# when each has only partial information?Masalah Terbuka 4: Interpretabilitas
Kita belum dapat menjelaskan secara andal mengapa jaringan saraf besar mengambil keputusan tertentu. Riset interpretabilitas bertujuan mengidentifikasi rangkaian, konsep, dan pola penalaran di dalam model. Tanpa interpretabilitas, penyelarasan dan keamanan sepenuhnya bergantung pada pengujian perilaku — yang tidak dapat menangkap semua cara kegagalan.
# Practical interpretability techniques available today:
INTERPRETABILITY_TECHNIQUES = {
'chain_of_thought': {
'description': 'Ask model to show reasoning steps',
'limitation': 'CoT may not reflect true internal computation',
'example': 'Q: Why did you choose action X? A: Because...'
},
'attention_visualisation': {
'description': 'Show which input tokens the model attended to most',
'limitation': 'Attention != causation; incomplete explanation',
'example': 'Highlight most attended tokens in a response'
},
'logit_lens': {
'description': 'Read out predictions at each transformer layer',
'limitation': 'Requires model internals access (not API-accessible)',
'example': 'Prediction at layer 12 vs layer 24'
},
'activation_patching': {
'description': 'Intervene on specific neurons to find causal circuits',
'limitation': 'Research technique, not yet practical in production',
'example': 'Anthropic mechanistic interpretability research'
}
}
for technique, info in INTERPRETABILITY_TECHNIQUES.items():
print(f'{technique}: {info["limitation"][:80]}')Kondisi Saat Ini: Kemampuan Model pada 2025
Model terdepan pada 2025 (GPT-4o, Claude Opus 4, Gemini 1.5 Pro) menunjukkan: penalaran multi-langkah pada konteks panjang, penggunaan alat yang andal, pemahaman visual dan audio, kinerja yang mendekati manusia pada banyak tolok ukur profesional, serta kemampuan pembuatan dan penelusuran kesalahan kode yang masih terbatas tetapi nyata.
CAPABILITY_MAP_2025 = {
'strengths': [
'Multi-step reasoning (GSM8K, MATH near human performance)',
'Code generation (HumanEval >90%)',
'Instruction following (complex multi-part prompts)',
'Tool use (reliable function calling)',
'Vision understanding (OCR, chart analysis, scene description)',
'Context: 128K-1M tokens',
'Multi-agent orchestration (AutoGen, CrewAI frameworks)'
],
'limitations': [
'Long-horizon planning (>20 steps degrades significantly)',
'Reliable factual grounding without hallucination',
'Consistent reasoning in out-of-distribution domains',
'True causal reasoning (vs pattern matching)',
'Self-knowledge of own uncertainty',
'Physical world understanding without embodiment'
]
}
print('Strengths:', len(CAPABILITY_MAP_2025['strengths']))
print('Active limitations:', len(CAPABILITY_MAP_2025['limitations']))Jalan Menuju AGI: Bidang Riset Utama
Para peneliti secara umum sepakat mengenai kemampuan yang diperlukan suatu sistem agar memenuhi syarat sebagai Kecerdasan Umum Buatan: sistem tersebut harus belajar secara efisien dari sedikit contoh, melakukan generalisasi secara luas lintas ranah, menalar secara kausal dan bukan hanya korelasional, serta beroperasi dengan tangguh di lingkungan terbuka.
AGI_RESEARCH_AREAS = {
'sample_efficiency': {
'question': 'How to learn from 10 examples what LLMs need 10M for?',
'approaches': ['meta-learning', 'few-shot learning', 'in-context learning']
},
'causal_reasoning': {
'question': 'How to distinguish correlation from causation reliably?',
'approaches': ['causal graphs', 'do-calculus integration', 'intervention-based training']
},
'open_world_operation': {
'question': 'How to act effectively in environments not seen during training?',
'approaches': ['world models', 'imagination-based planning', 'transfer learning']
},
'recursive_self_improvement': {
'question': 'Can an agent improve its own architecture safely?',
'approaches': ['neural architecture search', 'prompt optimisation', 'constrained self-modification']
}
}
for area, info in AGI_RESEARCH_AREAS.items():
print(f'{area}: {info["question"][:70]}')Implikasi Praktis bagi Pengembang Agen
Memahami garis depan riset membantu Anda mengambil keputusan rekayasa yang lebih baik: gunakan rantai pemikiran agar penalaran dapat diperiksa, rancang agen yang gagal secara terkendali di ranah baru, sertakan pengawasan manusia untuk tugas jangka panjang, dan utamakan arsitektur yang lebih sederhana jika memungkinkan — sistem yang lebih sederhana gagal dengan cara yang lebih mudah diprediksi.
ENGINEERING_PRINCIPLES_FROM_RESEARCH = {
'long_horizon_memory': (
'Use hierarchical summaries + vector retrieval. '
'Set a hard context age limit and revalidate critical facts. '
'Never trust old memories without verification.'
),
'domain_robustness': (
'Evaluate your agent on held-out domains before production. '
'Monitor domain distribution of production inputs. '
'Fall back to human when input is out-of-distribution.'
),
'multi_agent': (
'Minimise inter-agent communication. '
'Use shared state (not message passing) where possible. '
'Assign clear non-overlapping scopes to each agent.'
),
'interpretability': (
'Always request chain-of-thought for high-stakes decisions. '
'Log all tool calls and intermediate reasoning steps. '
'Build anomaly detection on the CoT stream, not just final output.'
)
}
for principle, guidance in ENGINEERING_PRINCIPLES_FROM_RESEARCH.items():
print(f'{principle}: {guidance[:80]}...')Kemampuan yang Muncul dan Kejutan
Kemampuan yang muncul adalah kemampuan yang tampil secara tidak terduga pada model yang lebih besar tanpa dilatih secara khusus untuk itu. Contohnya adalah pembelajaran dalam konteks, aritmetika, dan penalaran rantai pemikiran. Hal ini menyulitkan peramalan kemampuan — terobosan berikutnya mungkin mengejutkan semua orang.
# Historical emergent capability timeline (approximate):
EMERGENCE_TIMELINE = [
{'year': 2020, 'scale': 'GPT-3 (175B)',
'emergent': 'Few-shot in-context learning without fine-tuning'},
{'year': 2022, 'scale': 'PaLM (540B)',
'emergent': 'Chain-of-thought reasoning with step-by-step prompts'},
{'year': 2023, 'scale': 'GPT-4',
'emergent': 'Reliable code generation, bar exam performance'},
{'year': 2024, 'scale': 'Claude 3 Opus, GPT-4o',
'emergent': 'Reliable multi-step tool use, vision-language integration'},
{'year': 2025, 'scale': 'Claude Opus 4, GPT-4o class',
'emergent': 'Extended multi-agent task delegation, agentic autonomy'}
]
for entry in EMERGENCE_TIMELINE:
print(f'{entry["year"]} ({entry["scale"]}): {entry["emergent"]}')
print('\nKey insight: capabilities can appear suddenly as scale increases — '
'current limitations may not be permanent.')Lanskap Riset Keamanan
Riset keamanan berjalan secara paralel dengan riset kemampuan. Bidang aktif utama meliputi: pengawasan yang dapat diskalakan (cara mengawasi agen yang lebih cerdas daripada kita), debat (dua agen berargumen dan manusia menjadi juri), amplifikasi (menggunakan kecerdasan buatan secara rekursif untuk membantu manusia mengevaluasi kecerdasan buatan), serta interpretabilitas (memahami apa yang dilakukan model secara internal).
SAFETY_RESEARCH_AREAS = {
'scalable_oversight': (
'Challenge: how do humans supervise agents that are better than us at the task?\n'
'Approach: break tasks into verifiable sub-problems humans can check\n'
'Status: active research at Anthropic, DeepMind, OpenAI'
),
'debate': (
'Challenge: finding truth when the agent is more capable than the evaluator\n'
'Approach: two AI agents argue for different answers; human judges quality of argument\n'
'Status: theoretical framework, limited empirical results'
),
'weak_to_strong_generalization': (
'Challenge: a weak supervisor training a stronger model\n'
'Approach: show strong model responses can be elicited by weak supervision\n'
'Status: OpenAI 2024 paper showed promising early results'
),
'interpretability': (
'Challenge: understanding neural network internals\n'
'Approach: mechanistic interp, sparse autoencoders, circuit analysis\n'
'Status: Anthropic found emotion-like representations in Claude'
)
}
for area, desc in SAFETY_RESEARCH_AREAS.items():
print(f'{area}:')
print(f' {desc.split(chr(10))[0]}')Langkah Anda Selanjutnya sebagai Pengembang Agen
Lanskap agen kecerdasan buatan berkembang dengan cepat. Pengembang yang berhasil adalah mereka yang: mengikuti perkembangan riset, membangun secara bertanggung jawab dengan mempertimbangkan pengawasan dan penyelarasan, merancang penurunan kinerja yang tetap terkendali, serta memperlakukan agen sebagai sistem sosio-teknis — bukan sekadar perangkat lunak.
DEVELOPER_ROADMAP = {
'immediate': [
'Master prompt engineering + few-shot design',
'Build reliable tool-use agents with retry + error handling',
'Implement proper logging, monitoring, and human oversight',
'Study agent frameworks: LangChain, AutoGen, CrewAI'
],
'next_6_months': [
'Build multi-agent systems with clear agent scopes',
'Implement vector memory + episodic reflection',
'Contribute to open-source agent tooling',
'Run proper evals: domain robustness, alignment red-teaming'
],
'long_term': [
'Follow interpretability research (Anthropic, DeepMind papers)',
'Engage with alignment research community',
'Build agents that remain human-overseen as capability grows',
'Contribute to safety-conscious deployment standards'
]
}
for horizon, items in DEVELOPER_ROADMAP.items():
print(f'{horizon}:')
for item in items:
print(f' - {item}')Uji Pemahaman
Apa arti istilah kemampuan yang muncul dalam konteks model bahasa besar?
Rangkuman: Garis Depan Riset, AGI, dan Seterusnya
Selamat karena telah menyelesaikan seluruh rangkaian kursus Agen Kecerdasan Buatan! Hal-hal penting terakhir dari pelajaran ini:
- Masalah terbuka: memori jangka panjang, ketangguhan ranah, koordinasi multiagen, dan interpretabilitas
- Kekuatan saat ini (2025): penggunaan alat, penglihatan, penalaran, dan konteks 1 juta token
- Jalan menuju AGI: efisiensi sampel, penalaran kausal, dan operasi di dunia terbuka
- Riset keamanan: pengawasan yang dapat diskalakan, debat, generalisasi lemah-ke-kuat, dan interpretabilitas
- Peran Anda: membangun secara bertanggung jawab, memantau secara berkelanjutan, dan merancang pengawasan manusia di setiap tingkatan
Terima kasih telah menyelesaikan kurikulum Agen Kecerdasan Buatan. Kini Anda telah dibekali untuk membangun sistem agen yang canggih, aman, dan mumpuni.
Belajar AI Agents dengan tutor AI — gratis
Tulis dan jalankan kode asli di browser kamu, dapatkan bantuan instan dari tutor AI 24/7, dan lanjutkan di mana kamu tinggalkan di web atau aplikasi.
- Kursus
- 60
- Pelajaran
- 239
Pertanyaan yang Sering Diajukan
Apakah pelajaran “Garis Depan Riset: AGI dan Selanjutnya” gratis?
Ya — teks lengkap “Garis Depan Riset: AGI dan Selanjutnya” gratis dibaca di sini di web. Untuk praktiknya secara interaktif (editor kode bawaan dan tutor AI 24/7) dan buka sisa kursus AI Agents, upgrade ke CoddyKit PRO. Kursus AI Agents mencakup 4 pelajaran total.
Apa yang akan aku pelajari di “Garis Depan Riset: AGI dan Selanjutnya”?
Masalah terbuka dalam ketangguhan agen, memori cakrawala panjang, dan koordinasi multiagen. Kamu berlatih AI Agents dengan kode praktik yang langsung kamu jalankan di browser, dan tutor AI 24/7 menjawab pertanyaanmu saat kamu mengerjakan pelajaran ini.
Apakah aku perlu pengalaman untuk memulai AI Agents?
Tidak diperlukan pengalaman sebelumnya. AI Agents di CoddyKit dirancang untuk pemula hingga pelajar tingkat lanjut, jadi kamu bisa memulai di sini atau dari awal dan belajar sesuai kecepatan kamu sendiri. Ini adalah pelajaran 4 dari 4.
Berapa lama pelajaran “Garis Depan Riset: AGI dan Selanjutnya” memakan waktu?
Sebagian besar pelajaran CoddyKit memakan waktu sekitar 5–10 menit. Setiap pelajaran ringkas dan interaktif, jadi kamu membuat kemajuan stabil dan melanjutkan dari tempat kamu tinggalkan di web dan aplikasi.
Bisakah aku menulis dan menjalankan kode dalam pelajaran AI Agents ini?
Ya. Setiap pelajaran AI Agents menyertakan editor kode bawaan, jadi kamu menulis dan menjalankan kode nyata langsung di browser dan mendapatkan umpan balik AI instan — tidak diperlukan penyiapan lokal.
Semua pelajaran dalam kursus ini
- Dari Asisten Menjadi Agen Otonom
- Model Dunia dan Perencanaan Prediktif
- Tantangan Penyelarasan pada Agen Otonom
- Garis Depan Riset: AGI dan Selanjutnya