AI Agents · Leçon

Frontières de la recherche : AGI et au-delà

Questions ouvertes sur la robustesse des agents, la mémoire à long horizon et la coordination multi-agents.

Leçon 4 sur 413 étapes

Frontières de la recherche : AGI et au-delà est une leçon AI Agents gratuite sur CoddyKit. Ceci est la leçon 4 sur 4. Tu peux lire la leçon complète ci-dessous gratuitement — puis la pratiquer en direct dans le navigateur avec un éditeur de code intégré et un tuteur IA 24/7. Elle fait partie du parcours d'apprentissage AI Agents, et ta progression se synchronise sur le web et l'application CoddyKit. Le cours AI Agents comprend 4 leçons au total.

L’état des agents d’IA en 2025

En 2025, les agents d’IA alimentés par de grands modèles de langage peuvent accomplir de manière fiable des tâches complexes en plusieurs étapes, utiliser des outils, raisonner sur plusieurs modalités et fonctionner avec une supervision limitée. Pourtant, plusieurs difficultés fondamentales restent à résoudre avant que les agents n’atteignent une véritable capacité générale.

Cette leçon présente les frontières de la recherche qui façonneront la prochaine génération d’IA.

Problème ouvert 1 : mémoire à très long horizon

Les LLM actuels disposent de fenêtres de contexte de 128 K à 1 M de jetons — une capacité impressionnante, mais encore limitée pour les tâches qui s’étendent sur plusieurs mois. La question ouverte est la suivante : comment compresser, récupérer et exploiter de manière fiable une mémoire couvrant un horizon réellement long, sans perdre de détails essentiels ni introduire d’hallucinations ?

# Illustration of long-horizon memory challenges:

LONG_HORIZON_CHALLENGES = {
    'compression': {
        'problem': 'Summarising months of interactions loses nuance',
        'current_approach': 'Hierarchical summarisation (recent detail, old summary)',
        'limitation': 'Important details get compressed away; hallucination risk in summaries'
    },
    'retrieval': {
        'problem': 'Finding the relevant memory among millions of entries',
        'current_approach': 'Embedding-based similarity search (vector databases)',
        'limitation': 'Semantic similarity does not always match relevance; false negatives'
    },
    'reasoning_over_time': {
        'problem': 'Connecting observations from 6 months apart',
        'current_approach': 'Temporal indexing + LLM reasoning',
        'limitation': 'LLMs struggle with precise temporal ordering of distant events'
    }
}

for challenge, details in LONG_HORIZON_CHALLENGES.items():
    print(f'{challenge}: {details["limitation"][:80]}')

Problème ouvert 2 : robustesse dans différents domaines

Les agents actuels sont fragiles : un agent réglé finement pour l’assistance client peut échouer face à une tâche similaire dans un nouveau domaine (médical, juridique ou technique). Une véritable robustesse signifie réussir des tâches et dans des domaines pour lesquels l’agent n’a jamais été explicitement entraîné — une exigence essentielle pour l’AGI.

# Measuring domain robustness
import statistics

def measure_domain_robustness(agent_fn, test_suite: dict) -> dict:
    """
    test_suite: {domain: [(input, expected_output)]}
    Returns per-domain accuracy and overall robustness score.
    """
    domain_scores = {}
    for domain, cases in test_suite.items():
        correct = 0
        for inp, expected in cases:
            result = agent_fn(inp)
            # Simplified scoring: check if expected phrase is in result
            if expected.lower() in result.lower():
                correct += 1
        domain_scores[domain] = round(correct / len(cases), 3)

    scores = list(domain_scores.values())
    return {
        'domain_scores': domain_scores,
        'mean_accuracy': round(statistics.mean(scores), 3),
        'min_accuracy': min(scores),  # robustness = performance on worst domain
        'variance': round(statistics.variance(scores), 4)
    }

# High variance = brittle (good at some domains, bad at others)
# Low variance + high mean = robust

if __name__ == '__main__':
    def toy_agent(inp):
        return {
            '2+2': 'The answer is 4',
            'capital of France': 'Paris is the capital'
        }.get(inp, 'I do not know')

    test_suite = {
        'math': [('2+2', '4')],
        'geography': [('capital of France', 'paris')],
    }
    result = measure_domain_robustness(toy_agent, test_suite)
    print('Domain scores:', result['domain_scores'])
    print('Mean accuracy:', result['mean_accuracy'])

Problème ouvert 3 : coordination multi-agents

Des réseaux d’agents spécialisés peuvent s’attaquer à des tâches qui dépassent les capacités d’un seul agent. Mais leur coordination est difficile : les agents doivent communiquer efficacement, éviter de faire deux fois le même travail, résoudre les conflits et partager leur progression sans créer de goulot d’étranglement centralisé.

import anthropic
import json

client = anthropic.Anthropic(api_key='YOUR_API_KEY')

# Simple task negotiation between two agents
def negotiate_task_division(
    task: str,
    agent1_capabilities: list,
    agent2_capabilities: list
) -> dict:
    prompt = (
        f'Task: {task}\n\n'
        f'Agent A capabilities: {agent1_capabilities}\n'
        f'Agent B capabilities: {agent2_capabilities}\n\n'
        'How should this task be divided between Agent A and Agent B?\n'
        'Minimise handoffs. Assign subtasks to the best-suited agent.\n'
        'Return JSON: {"agent_a_tasks": [str], "agent_b_tasks": [str], '
        '"shared_tasks": [str], "handoffs": int}'
    )
    response = client.messages.create(
        model='claude-opus-4-5', max_tokens=512,
        messages=[{'role': 'user', 'content': prompt}]
    )
    return json.loads(response.content[0].text)

# Open research challenge:
# How do agents coordinate without a central planner
# when each has only partial information?

Problème ouvert 4 : interprétabilité

Nous ne savons pas encore expliquer de manière fiable pourquoi un grand réseau neuronal prend une décision précise. La recherche en interprétabilité vise à identifier les circuits, les concepts et les schémas de raisonnement présents à l’intérieur des modèles. Sans interprétabilité, l’alignement et la sécurité reposent entièrement sur des tests comportementaux, qui ne peuvent pas détecter tous les modes de défaillance.

# Practical interpretability techniques available today:

INTERPRETABILITY_TECHNIQUES = {
    'chain_of_thought': {
        'description': 'Ask model to show reasoning steps',
        'limitation': 'CoT may not reflect true internal computation',
        'example': 'Q: Why did you choose action X? A: Because...'
    },
    'attention_visualisation': {
        'description': 'Show which input tokens the model attended to most',
        'limitation': 'Attention != causation; incomplete explanation',
        'example': 'Highlight most attended tokens in a response'
    },
    'logit_lens': {
        'description': 'Read out predictions at each transformer layer',
        'limitation': 'Requires model internals access (not API-accessible)',
        'example': 'Prediction at layer 12 vs layer 24'
    },
    'activation_patching': {
        'description': 'Intervene on specific neurons to find causal circuits',
        'limitation': 'Research technique, not yet practical in production',
        'example': 'Anthropic mechanistic interpretability research'
    }
}

for technique, info in INTERPRETABILITY_TECHNIQUES.items():
    print(f'{technique}: {info["limitation"][:80]}')

État actuel : ce que les modèles peuvent faire en 2025

Les modèles de pointe de 2025 (GPT-4o, Claude Opus 4, Gemini 1.5 Pro) démontrent les capacités suivantes : raisonnement en plusieurs étapes sur de longs contextes, utilisation fiable d’outils, compréhension de la vision et de l’audio, performances proches de celles des humains sur de nombreuses évaluations de référence professionnelles, ainsi que des capacités limitées mais réelles de génération et de débogage de code.

CAPABILITY_MAP_2025 = {
    'strengths': [
        'Multi-step reasoning (GSM8K, MATH near human performance)',
        'Code generation (HumanEval >90%)',
        'Instruction following (complex multi-part prompts)',
        'Tool use (reliable function calling)',
        'Vision understanding (OCR, chart analysis, scene description)',
        'Context: 128K-1M tokens',
        'Multi-agent orchestration (AutoGen, CrewAI frameworks)'
    ],
    'limitations': [
        'Long-horizon planning (>20 steps degrades significantly)',
        'Reliable factual grounding without hallucination',
        'Consistent reasoning in out-of-distribution domains',
        'True causal reasoning (vs pattern matching)',
        'Self-knowledge of own uncertainty',
        'Physical world understanding without embodiment'
    ]
}

print('Strengths:', len(CAPABILITY_MAP_2025['strengths']))
print('Active limitations:', len(CAPABILITY_MAP_2025['limitations']))

La voie vers l’AGI : principaux domaines de recherche

Les chercheurs s’accordent largement sur les capacités dont un système aurait besoin pour être considéré comme une intelligence artificielle générale : il doit apprendre efficacement à partir de quelques exemples, généraliser largement entre les domaines, raisonner de manière causale et non seulement par corrélation, et fonctionner de manière robuste dans des environnements ouverts.

AGI_RESEARCH_AREAS = {
    'sample_efficiency': {
        'question': 'How to learn from 10 examples what LLMs need 10M for?',
        'approaches': ['meta-learning', 'few-shot learning', 'in-context learning']
    },
    'causal_reasoning': {
        'question': 'How to distinguish correlation from causation reliably?',
        'approaches': ['causal graphs', 'do-calculus integration', 'intervention-based training']
    },
    'open_world_operation': {
        'question': 'How to act effectively in environments not seen during training?',
        'approaches': ['world models', 'imagination-based planning', 'transfer learning']
    },
    'recursive_self_improvement': {
        'question': 'Can an agent improve its own architecture safely?',
        'approaches': ['neural architecture search', 'prompt optimisation', 'constrained self-modification']
    }
}

for area, info in AGI_RESEARCH_AREAS.items():
    print(f'{area}: {info["question"][:70]}')

Conséquences pratiques pour les développeurs d’agents

Comprendre les frontières de la recherche vous aide à prendre de meilleures décisions d’ingénierie : utilisez le raisonnement étape par étape pour rendre le raisonnement inspectable, concevez des agents capables d’échouer proprement dans des domaines nouveaux, intégrez une supervision humaine pour les tâches à long horizon et privilégiez autant que possible des architectures plus simples — les systèmes simples échouent de manière plus prévisible.

ENGINEERING_PRINCIPLES_FROM_RESEARCH = {
    'long_horizon_memory': (
        'Use hierarchical summaries + vector retrieval. '
        'Set a hard context age limit and revalidate critical facts. '
        'Never trust old memories without verification.'
    ),
    'domain_robustness': (
        'Evaluate your agent on held-out domains before production. '
        'Monitor domain distribution of production inputs. '
        'Fall back to human when input is out-of-distribution.'
    ),
    'multi_agent': (
        'Minimise inter-agent communication. '
        'Use shared state (not message passing) where possible. '
        'Assign clear non-overlapping scopes to each agent.'
    ),
    'interpretability': (
        'Always request chain-of-thought for high-stakes decisions. '
        'Log all tool calls and intermediate reasoning steps. '
        'Build anomaly detection on the CoT stream, not just final output.'
    )
}

for principle, guidance in ENGINEERING_PRINCIPLES_FROM_RESEARCH.items():
    print(f'{principle}: {guidance[:80]}...')

Capacités émergentes et surprises

Les capacités émergentes sont des aptitudes qui apparaissent de manière inattendue dans des modèles plus grands, sans avoir été explicitement enseignées. Exemples : l’apprentissage en contexte, l’arithmétique et le raisonnement étape par étape. Ces capacités rendent les prévisions difficiles — la prochaine avancée majeure pourrait surprendre tout le monde.

# Historical emergent capability timeline (approximate):
EMERGENCE_TIMELINE = [
    {'year': 2020, 'scale': 'GPT-3 (175B)',
     'emergent': 'Few-shot in-context learning without fine-tuning'},
    {'year': 2022, 'scale': 'PaLM (540B)',
     'emergent': 'Chain-of-thought reasoning with step-by-step prompts'},
    {'year': 2023, 'scale': 'GPT-4',
     'emergent': 'Reliable code generation, bar exam performance'},
    {'year': 2024, 'scale': 'Claude 3 Opus, GPT-4o',
     'emergent': 'Reliable multi-step tool use, vision-language integration'},
    {'year': 2025, 'scale': 'Claude Opus 4, GPT-4o class',
     'emergent': 'Extended multi-agent task delegation, agentic autonomy'}
]

for entry in EMERGENCE_TIMELINE:
    print(f'{entry["year"]} ({entry["scale"]}): {entry["emergent"]}')

print('\nKey insight: capabilities can appear suddenly as scale increases — '
      'current limitations may not be permanent.')

Panorama de la recherche en sécurité

La recherche en sécurité progresse en parallèle de la recherche sur les capacités. Parmi les principaux domaines actifs : la supervision évolutive (comment superviser des agents plus intelligents que nous), le débat (deux agents argumentent et un humain juge), l’amplification (utiliser l’IA de manière récursive pour aider les humains à évaluer l’IA) et l’interprétabilité (comprendre ce que les modèles font en interne).

SAFETY_RESEARCH_AREAS = {
    'scalable_oversight': (
        'Challenge: how do humans supervise agents that are better than us at the task?\n'
        'Approach: break tasks into verifiable sub-problems humans can check\n'
        'Status: active research at Anthropic, DeepMind, OpenAI'
    ),
    'debate': (
        'Challenge: finding truth when the agent is more capable than the evaluator\n'
        'Approach: two AI agents argue for different answers; human judges quality of argument\n'
        'Status: theoretical framework, limited empirical results'
    ),
    'weak_to_strong_generalization': (
        'Challenge: a weak supervisor training a stronger model\n'
        'Approach: show strong model responses can be elicited by weak supervision\n'
        'Status: OpenAI 2024 paper showed promising early results'
    ),
    'interpretability': (
        'Challenge: understanding neural network internals\n'
        'Approach: mechanistic interp, sparse autoencoders, circuit analysis\n'
        'Status: Anthropic found emotion-like representations in Claude'
    )
}

for area, desc in SAFETY_RESEARCH_AREAS.items():
    print(f'{area}:')
    print(f'  {desc.split(chr(10))[0]}')

Votre avenir en tant que développeur d’agents

Le domaine des agents d’IA évolue rapidement. Les développeurs qui réussiront seront ceux qui se tiennent au courant de la recherche, développent de manière responsable en tenant compte de la supervision et de l’alignement, conçoivent des systèmes capables de se dégrader proprement et considèrent les agents comme des systèmes sociotechniques, et non comme de simples logiciels.

DEVELOPER_ROADMAP = {
    'immediate': [
        'Master prompt engineering + few-shot design',
        'Build reliable tool-use agents with retry + error handling',
        'Implement proper logging, monitoring, and human oversight',
        'Study agent frameworks: LangChain, AutoGen, CrewAI'
    ],
    'next_6_months': [
        'Build multi-agent systems with clear agent scopes',
        'Implement vector memory + episodic reflection',
        'Contribute to open-source agent tooling',
        'Run proper evals: domain robustness, alignment red-teaming'
    ],
    'long_term': [
        'Follow interpretability research (Anthropic, DeepMind papers)',
        'Engage with alignment research community',
        'Build agents that remain human-overseen as capability grows',
        'Contribute to safety-conscious deployment standards'
    ]
}

for horizon, items in DEVELOPER_ROADMAP.items():
    print(f'{horizon}:')
    for item in items:
        print(f'  - {item}')

Vérification des connaissances

Que signifie le terme capacité émergente dans le contexte des grands modèles de langage ?

Récapitulatif : frontières de la recherche, AGI et perspectives

Félicitations pour avoir terminé toute la série de cours sur les agents d’IA ! Points essentiels à retenir de cette leçon :

  • Problèmes ouverts : mémoire à très long horizon, robustesse dans différents domaines, coordination multi-agents et interprétabilité
  • Points forts actuels (2025) : utilisation d’outils, vision, raisonnement et contextes d’un million de jetons
  • Voie vers l’AGI : efficacité d’apprentissage avec peu d’exemples, raisonnement causal et fonctionnement en monde ouvert
  • Recherche en sécurité : supervision évolutive, débat, généralisation du faible vers le fort et interprétabilité
  • Votre rôle : développer de manière responsable, surveiller en continu et concevoir une supervision humaine à tous les niveaux

Merci d’avoir terminé le programme sur les agents d’IA. Vous disposez désormais des connaissances nécessaires pour créer des systèmes d’agents sophistiqués, sûrs et performants.

Gratuit pour commencer

Apprends AI Agents avec un tuteur IA — gratuit

Écris et exécute du vrai code dans ton navigateur, obtiens de l'aide instantanée d'un tuteur IA disponible 24h/24, et reprends là où tu t'es arrêté sur le web ou dans l'app.

Cours
60
Leçons
239

Questions Fréquemment Posées

La leçon « Frontières de la recherche : AGI et au-delà » est-elle gratuite ?

Oui — le texte complet de « Frontières de la recherche : AGI et au-delà » est gratuit à lire ici sur le web. Pour la pratiquer de manière interactive (un éditeur de code intégré et un tuteur IA 24/7) et déverrouiller le reste du cours AI Agents, passe à CoddyKit PRO. Le cours AI Agents comprend 4 leçons au total.

Qu'est-ce que j'apprendrai dans « Frontières de la recherche : AGI et au-delà » ?

Questions ouvertes sur la robustesse des agents, la mémoire à long horizon et la coordination multi-agents. Tu pratiques AI Agents avec du code pratique que tu exécutes directement dans le navigateur, et un tuteur IA 24/7 répond à tes questions au fur et à mesure que tu avances dans la leçon.

Dois-je avoir de l'expérience pour commencer AI Agents ?

Aucune expérience préalable n'est requise. AI Agents sur CoddyKit est structuré pour les débutants jusqu'aux apprenants avancés, donc tu peux commencer ici ou depuis le début et avancer à ton rythme. Ceci est la leçon 4 sur 4.

Combien de temps prend la leçon « Frontières de la recherche : AGI et au-delà » ?

La plupart des leçons CoddyKit prennent environ 5–10 minutes. Chacune est courte et interactive, tu progresses régulièrement et tu repiques exactement où tu t'es arrêté sur le web et l'app.

Peux-tu écrire et exécuter du code dans cette leçon AI Agents ?

Oui. Chaque leçon AI Agents inclut un éditeur de code intégré, tu écris et exécutes du vrai code directement dans ton navigateur et tu reçois des retours IA instantanés — aucune configuration locale requise.

Toutes les leçons de ce cours

  1. De l’assistant à l’agent autonome
  2. Modèles du monde et planification prédictive
  3. Défis d’alignement des agents autonomes
  4. Frontières de la recherche : AGI et au-delà
← Retour à AI Agents