0Pricing
AI Agents · Ders

Araştırmanın Sınırları: AGI ve Ötesi

Aracı sağlamlığı, uzun ufuklu bellek ve çok aracılı koordinasyondaki açık sorunlar.

Araştırmanın Sınırları: AGI ve Ötesi, CoddyKit'te ücretsiz bir AI Agents dersidir. Bu, 4 dersinin 4. dersidir. Aşağıdan dersin tamamını ücretsiz okuyabilir, sonra tarayıcıda yerleşik kod editörü ve 7/24 yapay zeka koçu ile uygulamalı olarak pratik yapabilirsin. Bu, AI Agents öğrenme yolunun bir parçasıdır ve ilerlemeniz web ve CoddyKit uygulaması arasında senkronize olur. AI Agents kursu toplamda 4 dersten oluşur.

Yapay Zekâ Ajanlarının 2025'teki Durumu

2025 itibarıyla, büyük dil modelleriyle güçlendirilen yapay zekâ ajanları karmaşık çok adımlı görevleri güvenilir biçimde tamamlayabilir, araçları kullanabilir, farklı kipler arasında akıl yürütebilir ve sınırlı gözetimle çalışabilir. Ancak ajanların gerçek bir genel yetkinliğe ulaşmasından önce çözülmesi gereken bazı temel sorunlar hâlâ vardır.

Bu derste, yapay zekânın gelecek neslini şekillendiren çözülememiş araştırma alanları incelenmektedir.

Çözülmemiş Problem 1: Uzun Erimli Bellek

Günümüzdeki LLM'lerin 128K–1M belirteçlik bağlam pencereleri vardır — etkileyici olsalar da aylar süren görevler için hâlâ sınırlıdırlar. Çözülmemiş problem şudur: kritik ayrıntıları kaybetmeden veya sanrılar üretmeden gerçekten uzun erimli belleği güvenilir biçimde sıkıştırmak, geri getirmek ve üzerinde akıl yürütmek.

# Illustration of long-horizon memory challenges:

LONG_HORIZON_CHALLENGES = {
    'compression': {
        'problem': 'Summarising months of interactions loses nuance',
        'current_approach': 'Hierarchical summarisation (recent detail, old summary)',
        'limitation': 'Important details get compressed away; hallucination risk in summaries'
    },
    'retrieval': {
        'problem': 'Finding the relevant memory among millions of entries',
        'current_approach': 'Embedding-based similarity search (vector databases)',
        'limitation': 'Semantic similarity does not always match relevance; false negatives'
    },
    'reasoning_over_time': {
        'problem': 'Connecting observations from 6 months apart',
        'current_approach': 'Temporal indexing + LLM reasoning',
        'limitation': 'LLMs struggle with precise temporal ordering of distant events'
    }
}

for challenge, details in LONG_HORIZON_CHALLENGES.items():
    print(f'{challenge}: {details["limitation"][:80]}')

Çözülmemiş Problem 2: Alanlar Arası Sağlamlık

Günümüzdeki ajanlar kırılgandır: müşteri desteği için ince ayarlanmış bir ajan, yeni bir alandaki benzer bir görevde başarısız olabilir (tıbbi, hukuki veya teknik). Gerçek sağlamlık, ajanın açıkça eğitilmediği görev ve alanlarda iyi performans göstermek anlamına gelir — bu, AGI için temel bir gerekliliktir.

# Measuring domain robustness
import statistics

def measure_domain_robustness(agent_fn, test_suite: dict) -> dict:
    """
    test_suite: {domain: [(input, expected_output)]}
    Returns per-domain accuracy and overall robustness score.
    """
    domain_scores = {}
    for domain, cases in test_suite.items():
        correct = 0
        for inp, expected in cases:
            result = agent_fn(inp)
            # Simplified scoring: check if expected phrase is in result
            if expected.lower() in result.lower():
                correct += 1
        domain_scores[domain] = round(correct / len(cases), 3)

    scores = list(domain_scores.values())
    return {
        'domain_scores': domain_scores,
        'mean_accuracy': round(statistics.mean(scores), 3),
        'min_accuracy': min(scores),  # robustness = performance on worst domain
        'variance': round(statistics.variance(scores), 4)
    }

# High variance = brittle (good at some domains, bad at others)
# Low variance + high mean = robust

if __name__ == '__main__':
    def toy_agent(inp):
        return {
            '2+2': 'The answer is 4',
            'capital of France': 'Paris is the capital'
        }.get(inp, 'I do not know')

    test_suite = {
        'math': [('2+2', '4')],
        'geography': [('capital of France', 'paris')],
    }
    result = measure_domain_robustness(toy_agent, test_suite)
    print('Domain scores:', result['domain_scores'])
    print('Mean accuracy:', result['mean_accuracy'])

Çözülmemiş Problem 3: Çoklu Ajan Koordinasyonu

Uzmanlaşmış ajan ağları, tek bir ajanın yeteneklerini aşan görevlerin üstesinden gelebilir. Ancak bunları koordine etmek zordur: ajanlar verimli iletişim kurmalı, aynı çabayı yinelemekten kaçınmalı, anlaşmazlıkları çözmeli ve merkezi bir darboğaz olmadan ilerlemeyi paylaşmalıdır.

import anthropic
import json

client = anthropic.Anthropic(api_key='YOUR_API_KEY')

# Simple task negotiation between two agents
def negotiate_task_division(
    task: str,
    agent1_capabilities: list,
    agent2_capabilities: list
) -> dict:
    prompt = (
        f'Task: {task}\n\n'
        f'Agent A capabilities: {agent1_capabilities}\n'
        f'Agent B capabilities: {agent2_capabilities}\n\n'
        'How should this task be divided between Agent A and Agent B?\n'
        'Minimise handoffs. Assign subtasks to the best-suited agent.\n'
        'Return JSON: {"agent_a_tasks": [str], "agent_b_tasks": [str], '
        '"shared_tasks": [str], "handoffs": int}'
    )
    response = client.messages.create(
        model='claude-opus-4-5', max_tokens=512,
        messages=[{'role': 'user', 'content': prompt}]
    )
    return json.loads(response.content[0].text)

# Open research challenge:
# How do agents coordinate without a central planner
# when each has only partial information?

Çözülmemiş Problem 4: Yorumlanabilirlik

Büyük bir sinir ağının belirli bir kararı neden verdiğini henüz güvenilir biçimde açıklayamıyoruz. Yorumlanabilirlik araştırmaları, modellerin içindeki devreleri, kavramları ve akıl yürütme örüntülerini belirlemeyi amaçlar. Yorumlanabilirlik olmadan hizalama ve güvenlik, tamamen davranışsal sınamalara dayanır — bunlar tüm hata biçimlerini yakalayamaz.

# Practical interpretability techniques available today:

INTERPRETABILITY_TECHNIQUES = {
    'chain_of_thought': {
        'description': 'Ask model to show reasoning steps',
        'limitation': 'CoT may not reflect true internal computation',
        'example': 'Q: Why did you choose action X? A: Because...'
    },
    'attention_visualisation': {
        'description': 'Show which input tokens the model attended to most',
        'limitation': 'Attention != causation; incomplete explanation',
        'example': 'Highlight most attended tokens in a response'
    },
    'logit_lens': {
        'description': 'Read out predictions at each transformer layer',
        'limitation': 'Requires model internals access (not API-accessible)',
        'example': 'Prediction at layer 12 vs layer 24'
    },
    'activation_patching': {
        'description': 'Intervene on specific neurons to find causal circuits',
        'limitation': 'Research technique, not yet practical in production',
        'example': 'Anthropic mechanistic interpretability research'
    }
}

for technique, info in INTERPRETABILITY_TECHNIQUES.items():
    print(f'{technique}: {info["limitation"][:80]}')

Mevcut Durum: Modeller 2025'te Neler Yapabiliyor

2025'in öncü modelleri (GPT-4o, Claude Opus 4, Gemini 1.5 Pro) şunları sergilemektedir: uzun bağlamlar üzerinde çok adımlı akıl yürütme, güvenilir araç kullanımı, görme ve ses anlama, birçok mesleki kıyaslama ölçütünde insana yakın performans ve sınırlı ama gerçek kod üretimi ile hata ayıklama.

CAPABILITY_MAP_2025 = {
    'strengths': [
        'Multi-step reasoning (GSM8K, MATH near human performance)',
        'Code generation (HumanEval >90%)',
        'Instruction following (complex multi-part prompts)',
        'Tool use (reliable function calling)',
        'Vision understanding (OCR, chart analysis, scene description)',
        'Context: 128K-1M tokens',
        'Multi-agent orchestration (AutoGen, CrewAI frameworks)'
    ],
    'limitations': [
        'Long-horizon planning (>20 steps degrades significantly)',
        'Reliable factual grounding without hallucination',
        'Consistent reasoning in out-of-distribution domains',
        'True causal reasoning (vs pattern matching)',
        'Self-knowledge of own uncertainty',
        'Physical world understanding without embodiment'
    ]
}

print('Strengths:', len(CAPABILITY_MAP_2025['strengths']))
print('Active limitations:', len(CAPABILITY_MAP_2025['limitations']))

AGI'ye Giden Yol: Temel Araştırma Alanları

Araştırmacılar, bir sistemin Genel Yapay Zekâ olarak nitelendirilebilmesi için gereken yetenekler konusunda genel olarak hemfikirdir: sistem az sayıda örnekten verimli öğrenmeli, alanlar arasında geniş ölçüde genelleme yapmalı, yalnızca ilişkilere dayalı değil nedensel akıl yürütmeli ve açık uçlu ortamlarda sağlam biçimde çalışmalıdır.

AGI_RESEARCH_AREAS = {
    'sample_efficiency': {
        'question': 'How to learn from 10 examples what LLMs need 10M for?',
        'approaches': ['meta-learning', 'few-shot learning', 'in-context learning']
    },
    'causal_reasoning': {
        'question': 'How to distinguish correlation from causation reliably?',
        'approaches': ['causal graphs', 'do-calculus integration', 'intervention-based training']
    },
    'open_world_operation': {
        'question': 'How to act effectively in environments not seen during training?',
        'approaches': ['world models', 'imagination-based planning', 'transfer learning']
    },
    'recursive_self_improvement': {
        'question': 'Can an agent improve its own architecture safely?',
        'approaches': ['neural architecture search', 'prompt optimisation', 'constrained self-modification']
    }
}

for area, info in AGI_RESEARCH_AREAS.items():
    print(f'{area}: {info["question"][:70]}')

Ajan Geliştiricileri İçin Pratik Çıkarımlar

Araştırmanın öncü alanlarını anlamak, daha iyi mühendislik kararları vermenize yardımcı olur: akıl yürütmeyi incelenebilir hâle getirmek için düşünce zincirini kullanın, yeni alanlarda kontrollü biçimde başarısız olacak ajanlar tasarlayın, uzun erimli görevlerde insan gözetimini dâhil edin ve mümkün olduğunda daha basit mimarileri tercih edin — daha basit sistemler daha öngörülebilir biçimlerde başarısız olur.

ENGINEERING_PRINCIPLES_FROM_RESEARCH = {
    'long_horizon_memory': (
        'Use hierarchical summaries + vector retrieval. '
        'Set a hard context age limit and revalidate critical facts. '
        'Never trust old memories without verification.'
    ),
    'domain_robustness': (
        'Evaluate your agent on held-out domains before production. '
        'Monitor domain distribution of production inputs. '
        'Fall back to human when input is out-of-distribution.'
    ),
    'multi_agent': (
        'Minimise inter-agent communication. '
        'Use shared state (not message passing) where possible. '
        'Assign clear non-overlapping scopes to each agent.'
    ),
    'interpretability': (
        'Always request chain-of-thought for high-stakes decisions. '
        'Log all tool calls and intermediate reasoning steps. '
        'Build anomaly detection on the CoT stream, not just final output.'
    )
}

for principle, guidance in ENGINEERING_PRINCIPLES_FROM_RESEARCH.items():
    print(f'{principle}: {guidance[:80]}...')

Ortaya Çıkan Yetenekler ve Sürprizler

Ortaya çıkan yetenekler, açıkça eğitilmemiş olmalarına rağmen daha büyük modellerde beklenmedik şekilde beliren becerilerdir. Örnekler: bağlam içi öğrenme, aritmetik ve düşünce zinciriyle akıl yürütme. Bunlar yetenekleri öngörmeyi zorlaştırır — bir sonraki atılım herkesi şaşırtabilir.

# Historical emergent capability timeline (approximate):
EMERGENCE_TIMELINE = [
    {'year': 2020, 'scale': 'GPT-3 (175B)',
     'emergent': 'Few-shot in-context learning without fine-tuning'},
    {'year': 2022, 'scale': 'PaLM (540B)',
     'emergent': 'Chain-of-thought reasoning with step-by-step prompts'},
    {'year': 2023, 'scale': 'GPT-4',
     'emergent': 'Reliable code generation, bar exam performance'},
    {'year': 2024, 'scale': 'Claude 3 Opus, GPT-4o',
     'emergent': 'Reliable multi-step tool use, vision-language integration'},
    {'year': 2025, 'scale': 'Claude Opus 4, GPT-4o class',
     'emergent': 'Extended multi-agent task delegation, agentic autonomy'}
]

for entry in EMERGENCE_TIMELINE:
    print(f'{entry["year"]} ({entry["scale"]}): {entry["emergent"]}')

print('\nKey insight: capabilities can appear suddenly as scale increases — '
      'current limitations may not be permanent.')

Güvenlik Araştırmalarının Görünümü

Güvenlik araştırmaları, yetenek araştırmalarıyla paralel yürütülür. Etkin durumdaki temel alanlar şunlardır: ölçeklenebilir gözetim (bizden daha akıllı ajanların nasıl denetleneceği), tartışma (iki ajan tartışır; insan hakemlik yapar), güçlendirme (insanların yapay zekâyı değerlendirmesine yardımcı olmak için yapay zekâdan özyinelemeli biçimde yararlanma) ve yorumlanabilirlik (modellerin içsel olarak ne yaptığını anlama).

SAFETY_RESEARCH_AREAS = {
    'scalable_oversight': (
        'Challenge: how do humans supervise agents that are better than us at the task?\n'
        'Approach: break tasks into verifiable sub-problems humans can check\n'
        'Status: active research at Anthropic, DeepMind, OpenAI'
    ),
    'debate': (
        'Challenge: finding truth when the agent is more capable than the evaluator\n'
        'Approach: two AI agents argue for different answers; human judges quality of argument\n'
        'Status: theoretical framework, limited empirical results'
    ),
    'weak_to_strong_generalization': (
        'Challenge: a weak supervisor training a stronger model\n'
        'Approach: show strong model responses can be elicited by weak supervision\n'
        'Status: OpenAI 2024 paper showed promising early results'
    ),
    'interpretability': (
        'Challenge: understanding neural network internals\n'
        'Approach: mechanistic interp, sparse autoencoders, circuit analysis\n'
        'Status: Anthropic found emotion-like representations in Claude'
    )
}

for area, desc in SAFETY_RESEARCH_AREAS.items():
    print(f'{area}:')
    print(f'  {desc.split(chr(10))[0]}')

Ajan Geliştiricisi Olarak İlerleme Yolunuz

Yapay zekâ ajanları alanı hızla gelişiyor. Başarılı olacak geliştiriciler, araştırmaları güncel olarak takip eden, gözetim ve hizalamayı göz önünde bulundurarak sorumlu biçimde geliştiren, kontrollü performans düşüşü için tasarım yapan ve ajanları yalnızca yazılım olarak değil, sosyoteknik sistemler olarak ele alan kişiler olacaktır.

DEVELOPER_ROADMAP = {
    'immediate': [
        'Master prompt engineering + few-shot design',
        'Build reliable tool-use agents with retry + error handling',
        'Implement proper logging, monitoring, and human oversight',
        'Study agent frameworks: LangChain, AutoGen, CrewAI'
    ],
    'next_6_months': [
        'Build multi-agent systems with clear agent scopes',
        'Implement vector memory + episodic reflection',
        'Contribute to open-source agent tooling',
        'Run proper evals: domain robustness, alignment red-teaming'
    ],
    'long_term': [
        'Follow interpretability research (Anthropic, DeepMind papers)',
        'Engage with alignment research community',
        'Build agents that remain human-overseen as capability grows',
        'Contribute to safety-conscious deployment standards'
    ]
}

for horizon, items in DEVELOPER_ROADMAP.items():
    print(f'{horizon}:')
    for item in items:
        print(f'  - {item}')

Bilgi Kontrolü

Büyük dil modelleri bağlamında ortaya çıkan yetenek terimi ne anlama gelir?

Özet: Araştırmanın Öncü Alanları, AGI ve Ötesi

Yapay Zekâ Ajanları ders dizisinin tamamını bitirdiğiniz için tebrikler! Bu dersten son çıkarımlar:

  • Çözülmemiş problemler: uzun erimli bellek, alanlar arası sağlamlık, çoklu ajan koordinasyonu, yorumlanabilirlik
  • Mevcut güçlü yönler (2025): araç kullanımı, görsel anlama, akıl yürütme, 1M belirteçlik bağlamlar
  • AGI'ye giden yol: örnek verimliliği, nedensel akıl yürütme, açık dünya ortamlarında çalışma
  • Güvenlik araştırmaları: ölçeklenebilir gözetim, tartışma, zayıftan güçlüye genelleme, yorumlanabilirlik
  • Rolünüz: sorumlu biçimde geliştirin, sürekli izleyin ve her düzeyde insan gözetimi için tasarım yapın

Yapay Zekâ Ajanları müfredatını tamamladığınız için teşekkür ederiz. Artık gelişmiş, güvenli ve yetenekli ajan sistemleri geliştirmek için gereken donanıma sahipsiniz.

Sıkça Sorulan Sorular

“Araştırmanın Sınırları: AGI ve Ötesi” dersi ücretsiz mi?

Evet — “Araştırmanın Sınırları: AGI ve Ötesi” dersin tüm metni burada web'de ücretsiz olarak okunabilir. Etkileşimli olarak pratik yapmak (yerleşik kod editörü ve 7/24 yapay zeka koçu) ve AI Agents kursunun geri kalanını açmak için CoddyKit PRO'ya yükselt. AI Agents kursu toplamda 4 dersten oluşur.

“Araştırmanın Sınırları: AGI ve Ötesi” dersinde ne öğreneceğim?

Aracı sağlamlığı, uzun ufuklu bellek ve çok aracılı koordinasyondaki açık sorunlar. AI Agents ile uygulamalı kodu tarayıcıda doğrudan çalıştırarak pratik yaparsın ve 7/24 yapay zeka koçu dersi çalışırken sorularını yanıtlar.

AI Agents öğrenmeye başlamak için deneyim gerekli mi?

Önceden deneyim gerekmez. CoddyKit'te AI Agents, başlangıçtan ileri seviyeye kadar yapılandırıldığı için buradan başlayabilir veya başından başlayıp kendi hızında ilerleme yapabilirsin. Bu, 4 dersinin 4. dersidir.

“Araştırmanın Sınırları: AGI ve Ötesi” dersi ne kadar sürer?

Çoğu CoddyKit dersi yaklaşık 5–10 dakika sürer. Her biri kısa ve etkileşimli olduğu için sabit ilerleme yaparsın ve web ile uygulama arasında tam olarak bıraktığın yerden devam edebilirsin.

Bu AI Agents dersinde kod yazıp çalıştırabilir miyim?

Evet. Her AI Agents dersi yerleşik bir kod editörü içerir, bu sayede tarayıcıda gerçek kod yazıp çalıştırabilir ve anlık yapay zeka geri bildirimi alırsın — yerel kurulum gerekli değildir.

Bu kursun tüm dersleri

  1. Yardımcıdan Özerk Aracıya
  2. Dünya Modelleri ve Öngörücü Planlama
  3. Özerk Aracılarda Hizalama Zorlukları
  4. Araştırmanın Sınırları: AGI ve Ötesi
← AI Agents Sayfasına Dön