AI Agents · Aula

Fronteiras da pesquisa: AGI e além

Problemas em aberto de robustez de agentes, memória de longo horizonte e coordenação multiagente.

Aula 4 de 413 etapas

Fronteiras da pesquisa: AGI e além é uma aula grátis de AI Agents no CoddyKit. Esta é a aula 4 de 4. Você pode ler a aula completa abaixo gratuitamente — depois pratica ao vivo no navegador com um editor de código integrado e um tutor de IA 24/7. Faz parte do caminho de aprendizado de AI Agents, e seu progresso é sincronizado entre a web e o app CoddyKit. O curso de AI Agents inclui 4 aulas no total.

O estado dos agentes de IA em 2025

Em 2025, agentes de IA baseados em grandes modelos de linguagem conseguem concluir com confiabilidade tarefas complexas de várias etapas, usar ferramentas, raciocinar entre modalidades e operar com supervisão limitada. Ainda assim, vários desafios fundamentais continuam sem solução antes que os agentes alcancem uma capacidade verdadeiramente geral.

Esta lição apresenta as fronteiras de pesquisa em aberto que definem a próxima geração de IA.

Problema em aberto 1: memória de longo horizonte

Os LLMs atuais têm janelas de contexto de 128 mil a 1 milhão de unidades de texto — algo impressionante, mas ainda limitado para tarefas que se estendem por meses de trabalho. O problema em aberto é como comprimir, recuperar e raciocinar de forma confiável sobre uma memória de horizonte realmente longo, sem perder detalhes críticos nem introduzir alucinações.

# Illustration of long-horizon memory challenges:

LONG_HORIZON_CHALLENGES = {
    'compression': {
        'problem': 'Summarising months of interactions loses nuance',
        'current_approach': 'Hierarchical summarisation (recent detail, old summary)',
        'limitation': 'Important details get compressed away; hallucination risk in summaries'
    },
    'retrieval': {
        'problem': 'Finding the relevant memory among millions of entries',
        'current_approach': 'Embedding-based similarity search (vector databases)',
        'limitation': 'Semantic similarity does not always match relevance; false negatives'
    },
    'reasoning_over_time': {
        'problem': 'Connecting observations from 6 months apart',
        'current_approach': 'Temporal indexing + LLM reasoning',
        'limitation': 'LLMs struggle with precise temporal ordering of distant events'
    }
}

for challenge, details in LONG_HORIZON_CHALLENGES.items():
    print(f'{challenge}: {details["limitation"][:80]}')

Problema em aberto 2: robustez entre domínios

Os agentes atuais são frágeis: um agente ajustado para atendimento ao cliente pode falhar em uma tarefa semelhante em um novo domínio (médico, jurídico ou técnico). A verdadeira robustez significa ter bom desempenho em tarefas e domínios para os quais o agente nunca foi treinado explicitamente — um requisito fundamental para a AGI.

# Measuring domain robustness
import statistics

def measure_domain_robustness(agent_fn, test_suite: dict) -> dict:
    """
    test_suite: {domain: [(input, expected_output)]}
    Returns per-domain accuracy and overall robustness score.
    """
    domain_scores = {}
    for domain, cases in test_suite.items():
        correct = 0
        for inp, expected in cases:
            result = agent_fn(inp)
            # Simplified scoring: check if expected phrase is in result
            if expected.lower() in result.lower():
                correct += 1
        domain_scores[domain] = round(correct / len(cases), 3)

    scores = list(domain_scores.values())
    return {
        'domain_scores': domain_scores,
        'mean_accuracy': round(statistics.mean(scores), 3),
        'min_accuracy': min(scores),  # robustness = performance on worst domain
        'variance': round(statistics.variance(scores), 4)
    }

# High variance = brittle (good at some domains, bad at others)
# Low variance + high mean = robust

if __name__ == '__main__':
    def toy_agent(inp):
        return {
            '2+2': 'The answer is 4',
            'capital of France': 'Paris is the capital'
        }.get(inp, 'I do not know')

    test_suite = {
        'math': [('2+2', '4')],
        'geography': [('capital of France', 'paris')],
    }
    result = measure_domain_robustness(toy_agent, test_suite)
    print('Domain scores:', result['domain_scores'])
    print('Mean accuracy:', result['mean_accuracy'])

Problema em aberto 3: coordenação entre vários agentes

Redes de agentes especializados podem lidar com tarefas que estão além da capacidade de qualquer agente individual. Porém, coordená-los é difícil: os agentes precisam se comunicar de forma eficiente, evitar duplicar esforços, resolver conflitos e compartilhar o progresso sem um gargalo centralizado.

import anthropic
import json

client = anthropic.Anthropic(api_key='YOUR_API_KEY')

# Simple task negotiation between two agents
def negotiate_task_division(
    task: str,
    agent1_capabilities: list,
    agent2_capabilities: list
) -> dict:
    prompt = (
        f'Task: {task}\n\n'
        f'Agent A capabilities: {agent1_capabilities}\n'
        f'Agent B capabilities: {agent2_capabilities}\n\n'
        'How should this task be divided between Agent A and Agent B?\n'
        'Minimise handoffs. Assign subtasks to the best-suited agent.\n'
        'Return JSON: {"agent_a_tasks": [str], "agent_b_tasks": [str], '
        '"shared_tasks": [str], "handoffs": int}'
    )
    response = client.messages.create(
        model='claude-opus-4-5', max_tokens=512,
        messages=[{'role': 'user', 'content': prompt}]
    )
    return json.loads(response.content[0].text)

# Open research challenge:
# How do agents coordinate without a central planner
# when each has only partial information?

Problema em aberto 4: interpretabilidade

Ainda não conseguimos explicar com confiabilidade por que uma grande rede neural toma uma decisão específica. A pesquisa em interpretabilidade busca identificar os circuitos, conceitos e padrões de raciocínio dentro dos modelos. Sem interpretabilidade, o alinhamento e a segurança dependem inteiramente de testes comportamentais — que não conseguem detectar todos os modos de falha.

# Practical interpretability techniques available today:

INTERPRETABILITY_TECHNIQUES = {
    'chain_of_thought': {
        'description': 'Ask model to show reasoning steps',
        'limitation': 'CoT may not reflect true internal computation',
        'example': 'Q: Why did you choose action X? A: Because...'
    },
    'attention_visualisation': {
        'description': 'Show which input tokens the model attended to most',
        'limitation': 'Attention != causation; incomplete explanation',
        'example': 'Highlight most attended tokens in a response'
    },
    'logit_lens': {
        'description': 'Read out predictions at each transformer layer',
        'limitation': 'Requires model internals access (not API-accessible)',
        'example': 'Prediction at layer 12 vs layer 24'
    },
    'activation_patching': {
        'description': 'Intervene on specific neurons to find causal circuits',
        'limitation': 'Research technique, not yet practical in production',
        'example': 'Anthropic mechanistic interpretability research'
    }
}

for technique, info in INTERPRETABILITY_TECHNIQUES.items():
    print(f'{technique}: {info["limitation"][:80]}')

Estado atual: o que os modelos conseguem fazer em 2025

Os modelos de fronteira de 2025 (GPT-4o, Claude Opus 4, Gemini 1.5 Pro) demonstram: raciocínio em várias etapas sobre contextos longos, uso confiável de ferramentas, compreensão de visão e áudio, desempenho próximo ao humano em muitas avaliações profissionais e capacidade limitada, mas real, de gerar e depurar código.

CAPABILITY_MAP_2025 = {
    'strengths': [
        'Multi-step reasoning (GSM8K, MATH near human performance)',
        'Code generation (HumanEval >90%)',
        'Instruction following (complex multi-part prompts)',
        'Tool use (reliable function calling)',
        'Vision understanding (OCR, chart analysis, scene description)',
        'Context: 128K-1M tokens',
        'Multi-agent orchestration (AutoGen, CrewAI frameworks)'
    ],
    'limitations': [
        'Long-horizon planning (>20 steps degrades significantly)',
        'Reliable factual grounding without hallucination',
        'Consistent reasoning in out-of-distribution domains',
        'True causal reasoning (vs pattern matching)',
        'Self-knowledge of own uncertainty',
        'Physical world understanding without embodiment'
    ]
}

print('Strengths:', len(CAPABILITY_MAP_2025['strengths']))
print('Active limitations:', len(CAPABILITY_MAP_2025['limitations']))

O caminho até a AGI: principais áreas de pesquisa

Os pesquisadores concordam, em linhas gerais, sobre quais capacidades um sistema precisaria ter para ser considerado Inteligência Artificial Geral: ele deve aprender com eficiência a partir de poucos exemplos, generalizar amplamente entre domínios, raciocinar de forma causal, não apenas correlacional, e operar com robustez em ambientes abertos.

AGI_RESEARCH_AREAS = {
    'sample_efficiency': {
        'question': 'How to learn from 10 examples what LLMs need 10M for?',
        'approaches': ['meta-learning', 'few-shot learning', 'in-context learning']
    },
    'causal_reasoning': {
        'question': 'How to distinguish correlation from causation reliably?',
        'approaches': ['causal graphs', 'do-calculus integration', 'intervention-based training']
    },
    'open_world_operation': {
        'question': 'How to act effectively in environments not seen during training?',
        'approaches': ['world models', 'imagination-based planning', 'transfer learning']
    },
    'recursive_self_improvement': {
        'question': 'Can an agent improve its own architecture safely?',
        'approaches': ['neural architecture search', 'prompt optimisation', 'constrained self-modification']
    }
}

for area, info in AGI_RESEARCH_AREAS.items():
    print(f'{area}: {info["question"][:70]}')

Implicações práticas para desenvolvedores de agentes

Compreender as fronteiras da pesquisa ajuda você a tomar decisões de engenharia melhores: use a cadeia de pensamento para tornar o raciocínio inspecionável, projete agentes que falhem de forma controlada em domínios novos, inclua supervisão humana em tarefas de longo horizonte e prefira arquiteturas mais simples quando possível — sistemas mais simples falham de maneiras mais previsíveis.

ENGINEERING_PRINCIPLES_FROM_RESEARCH = {
    'long_horizon_memory': (
        'Use hierarchical summaries + vector retrieval. '
        'Set a hard context age limit and revalidate critical facts. '
        'Never trust old memories without verification.'
    ),
    'domain_robustness': (
        'Evaluate your agent on held-out domains before production. '
        'Monitor domain distribution of production inputs. '
        'Fall back to human when input is out-of-distribution.'
    ),
    'multi_agent': (
        'Minimise inter-agent communication. '
        'Use shared state (not message passing) where possible. '
        'Assign clear non-overlapping scopes to each agent.'
    ),
    'interpretability': (
        'Always request chain-of-thought for high-stakes decisions. '
        'Log all tool calls and intermediate reasoning steps. '
        'Build anomaly detection on the CoT stream, not just final output.'
    )
}

for principle, guidance in ENGINEERING_PRINCIPLES_FROM_RESEARCH.items():
    print(f'{principle}: {guidance[:80]}...')

Capacidades emergentes e surpresas

Capacidades emergentes são habilidades que surgem inesperadamente em modelos maiores sem terem sido treinadas explicitamente. Exemplos: aprendizado em contexto, aritmética e raciocínio por cadeia de pensamento. Isso torna difícil prever capacidades — a próxima grande descoberta pode surpreender a todos.

# Historical emergent capability timeline (approximate):
EMERGENCE_TIMELINE = [
    {'year': 2020, 'scale': 'GPT-3 (175B)',
     'emergent': 'Few-shot in-context learning without fine-tuning'},
    {'year': 2022, 'scale': 'PaLM (540B)',
     'emergent': 'Chain-of-thought reasoning with step-by-step prompts'},
    {'year': 2023, 'scale': 'GPT-4',
     'emergent': 'Reliable code generation, bar exam performance'},
    {'year': 2024, 'scale': 'Claude 3 Opus, GPT-4o',
     'emergent': 'Reliable multi-step tool use, vision-language integration'},
    {'year': 2025, 'scale': 'Claude Opus 4, GPT-4o class',
     'emergent': 'Extended multi-agent task delegation, agentic autonomy'}
]

for entry in EMERGENCE_TIMELINE:
    print(f'{entry["year"]} ({entry["scale"]}): {entry["emergent"]}')

print('\nKey insight: capabilities can appear suddenly as scale increases — '
      'current limitations may not be permanent.')

Panorama da pesquisa de segurança

A pesquisa de segurança avança em paralelo à pesquisa de capacidades. Principais áreas ativas: supervisão escalável (como supervisionar agentes mais inteligentes do que nós), debate (dois agentes discutem; um ser humano julga), amplificação (usar IA recursivamente para ajudar seres humanos a avaliar IA) e interpretabilidade (entender o que os modelos estão fazendo internamente).

SAFETY_RESEARCH_AREAS = {
    'scalable_oversight': (
        'Challenge: how do humans supervise agents that are better than us at the task?\n'
        'Approach: break tasks into verifiable sub-problems humans can check\n'
        'Status: active research at Anthropic, DeepMind, OpenAI'
    ),
    'debate': (
        'Challenge: finding truth when the agent is more capable than the evaluator\n'
        'Approach: two AI agents argue for different answers; human judges quality of argument\n'
        'Status: theoretical framework, limited empirical results'
    ),
    'weak_to_strong_generalization': (
        'Challenge: a weak supervisor training a stronger model\n'
        'Approach: show strong model responses can be elicited by weak supervision\n'
        'Status: OpenAI 2024 paper showed promising early results'
    ),
    'interpretability': (
        'Challenge: understanding neural network internals\n'
        'Approach: mechanistic interp, sparse autoencoders, circuit analysis\n'
        'Status: Anthropic found emotion-like representations in Claude'
    )
}

for area, desc in SAFETY_RESEARCH_AREAS.items():
    print(f'{area}:')
    print(f'  {desc.split(chr(10))[0]}')

Seu caminho como desenvolvedor de agentes

O cenário dos agentes de IA está evoluindo rapidamente. Os desenvolvedores que prosperarem serão aqueles que: se mantiverem atualizados com a pesquisa, desenvolverem de forma responsável, tendo em mente a supervisão e o alinhamento, projetarem para uma degradação controlada e tratarem os agentes como sistemas sociotécnicos — não apenas como software.

DEVELOPER_ROADMAP = {
    'immediate': [
        'Master prompt engineering + few-shot design',
        'Build reliable tool-use agents with retry + error handling',
        'Implement proper logging, monitoring, and human oversight',
        'Study agent frameworks: LangChain, AutoGen, CrewAI'
    ],
    'next_6_months': [
        'Build multi-agent systems with clear agent scopes',
        'Implement vector memory + episodic reflection',
        'Contribute to open-source agent tooling',
        'Run proper evals: domain robustness, alignment red-teaming'
    ],
    'long_term': [
        'Follow interpretability research (Anthropic, DeepMind papers)',
        'Engage with alignment research community',
        'Build agents that remain human-overseen as capability grows',
        'Contribute to safety-conscious deployment standards'
    ]
}

for horizon, items in DEVELOPER_ROADMAP.items():
    print(f'{horizon}:')
    for item in items:
        print(f'  - {item}')

Verificação de conhecimento

O que significa o termo capacidade emergente no contexto dos grandes modelos de linguagem?

Recapitulação: fronteiras da pesquisa, AGI e além

Parabéns por concluir toda a série do curso sobre agentes de IA! Principais aprendizados finais desta lição:

  • Problemas em aberto: memória de longo horizonte, robustez entre domínios, coordenação entre vários agentes e interpretabilidade
  • Pontos fortes atuais (2025): uso de ferramentas, visão, raciocínio e contextos de 1 milhão de unidades
  • Caminho até a AGI: eficiência de aprendizado a partir de exemplos, raciocínio causal e operação em um mundo aberto
  • Pesquisa de segurança: supervisão escalável, debate, generalização do fraco ao forte e interpretabilidade
  • Seu papel: desenvolva de forma responsável, monitore continuamente e projete para supervisão humana em todos os níveis

Agradecemos por concluir o currículo de agentes de IA. Agora você está preparado para criar sistemas de agentes sofisticados, seguros e capazes.

Grátis para começar

Aprenda AI Agents com um tutor de IA — grátis

Escreva e execute código real no seu navegador, obtenha ajuda instantânea de um tutor de IA 24/7 e continue de onde parou na web ou no app.

Cursos
60
Aulas
239

Perguntas Frequentes

A aula “Fronteiras da pesquisa: AGI e além” é grátis?

Sim — o texto completo de “Fronteiras da pesquisa: AGI e além” é grátis para ler aqui na web. Para praticá-la interativamente (um editor de código integrado e um tutor de IA 24/7) e desbloquear o restante do curso de AI Agents, atualize para CoddyKit PRO. O curso de AI Agents inclui 4 aulas no total.

O que vou aprender em “Fronteiras da pesquisa: AGI e além”?

Problemas em aberto de robustez de agentes, memória de longo horizonte e coordenação multiagente. Você pratica AI Agents com código prático que executa diretamente no navegador, e um tutor de IA 24/7 responde suas dúvidas enquanto trabalha na aula.

Preciso ter experiência prévia para começar AI Agents?

Nenhuma experiência prévia é necessária. AI Agents no CoddyKit é estruturado para alunos iniciantes até avançados, então você pode começar aqui ou desde o início e aprender no seu ritmo. Esta é a aula 4 de 4.

Quanto tempo leva a aula “Fronteiras da pesquisa: AGI e além”?

A maioria das aulas CoddyKit leva cerca de 5–10 minutos. Cada uma é compacta e interativa, então você faz progresso constante e retoma exatamente de onde parou entre web e app.

Posso escrever e executar código nesta aula de AI Agents?

Sim. Cada aula de AI Agents inclui um editor de código integrado, então você escreve e executa código real direto no navegador e recebe feedback de IA instantaneamente — nenhuma configuração local necessária.

Todas as aulas deste curso

  1. De assistente a agente autônomo
  2. Modelos do mundo e planejamento preditivo
  3. Desafios de alinhamento em agentes autônomos
  4. Fronteiras da pesquisa: AGI e além
← Voltar para AI Agents