Raciocínio agêntico (o1, o3, modelos de raciocínio)
Modelos que “pensam” antes de responder — cadeias internas de pensamento, computação no momento do teste e autocorreção.
Raciocínio agêntico (o1, o3, modelos de raciocínio) é uma aula grátis de AI Agents no CoddyKit. Esta é a aula 1 de 4. Você pode ler a aula completa abaixo gratuitamente — depois pratica ao vivo no navegador com um editor de código integrado e um tutor de IA 24/7. Faz parte do caminho de aprendizado de AI Agents, e seu progresso é sincronizado entre a web e o app CoddyKit. O curso de AI Agents inclui 4 aulas no total.
Partes desta aula ainda não foram traduzidas e aparecem em inglês.
Uma nova classe de modelos
O OpenAI o1 (set. de 2024) introduziu os "modelos de raciocínio" — LLMs que raciocinam explicitamente passo a passo antes de produzir a resposta visível. Entre os sucessores estão o3, DeepSeek R1, Claude com raciocínio estendido, Gemini 2.5 com raciocínio e muitos outros.
Como funcionam
Em vez de gerar a resposta imediatamente, o modelo:
- Produz uma longa sequência interna de "raciocínio" (no estilo CoT)
- Explora várias abordagens
- Corrige os próprios erros
- Depois emite a resposta final visível
Computação no momento do teste
Você pode escolher quanto "raciocínio" o modelo realiza. Mais tokens gastos em raciocínio resultam em respostas melhores para problemas difíceis. O compromisso é entre latência e custo.
OpenAI o-Series API
response = client.chat.completions.create(
model='o3-mini',
messages=[{'role': 'user', 'content': 'Solve this puzzle...'}],
reasoning_effort='high' # low / medium / high
)
print(response.choices[0].message.content)
print(response.usage.reasoning_tokens) # how many 'thinking' tokens were usedAnthropic Extended Thinking
response = client.messages.create(
model='claude-sonnet-4-5',
max_tokens=8192,
thinking={'type': 'enabled', 'budget_tokens': 4096},
messages=[{'role': 'user', 'content': 'Hard reasoning problem'}]
)
# response.content includes 'thinking' blocks + 'text' final answerQuando os modelos de raciocínio se destacam
- Matemática com várias etapas
- Geração de código com lógica complexa
- Raciocínio jurídico / científico
- Planejamento que exige antecipação
Na avaliação: o3 alcança mais de 90% na AIME e pontua alto na GPQA — muito acima dos modelos sem raciocínio.
Quando os modelos padrão são melhores
- Chat / perguntas e respostas simples — o raciocínio é desperdiçado
- Caminhos críticos para a latência — o raciocínio acrescenta segundos
- Trabalho em massa sensível a custos — o raciocínio multiplica o custo
- Tarefas de estilo / formatação — não há benefício
Perfil de custos
Os tokens de raciocínio entram no cálculo do preço. O o3-mini, com alto esforço, pode usar de 10 mil a 100 mil tokens de raciocínio por pergunta. Isso pode custar de US$ 0,10 a US$ 1 por pergunta nos modelos de raciocínio maiores.
Dentro dos loops de agentes
Usando um modelo de raciocínio como planejador dentro de um agente maior:
- Modelo de raciocínio: planejar / decidir / avaliar
- Modelo padrão: executar etapas
- Chamadas de ferramentas: executar normalmente
O melhor dos dois: raciocínio profundo onde importa e execução barata no restante.
Não force CoT por cima
Você não precisa mais de instruções como "vamos pensar passo a passo" com modelos de raciocínio — eles já fazem CoT internamente. Adicionar isso pode, na verdade, prejudicar o resultado.
Raciocínio de código aberto
DeepSeek R1, R1-Distill e outros levam o raciocínio a modelos com pesos abertos. Disponíveis no HuggingFace, Together AI etc.
Fronteira da pesquisa
- Ajuste por reflexão — treinar modelos para criticarem a si mesmos
- Inferência baseada em busca — Árvore de Pensamentos, MCTS durante a inferência
- Treinamento no momento do teste — adaptar os pesos por consulta
Ressalva: raciocínio de caixa-preta
Os "pensamentos" dos modelos de raciocínio geralmente ficam ocultos para você (OpenAI) ou são resumidos (Anthropic). A transparência limitada dificulta a depuração; em vez disso, baseie-se em avaliações de entradas e saídas.
Quando usar modelos de raciocínio
Para qual tarefa um modelo de raciocínio vale mais o custo adicional?
Recapitulação
Os modelos de raciocínio (o1, o3, R1, Claude com raciocínio estendido) trocam tempo e custo por qualidade em tarefas difíceis. Use-os como planejador ou avaliador dentro de agentes. Evite-os para chats simples.
Perguntas Frequentes
A aula “Raciocínio agêntico (o1, o3, modelos de raciocínio)” é grátis?
Sim — o texto completo de “Raciocínio agêntico (o1, o3, modelos de raciocínio)” é grátis para ler aqui na web. Para praticá-la interativamente (um editor de código integrado e um tutor de IA 24/7) e desbloquear o restante do curso de AI Agents, atualize para CoddyKit PRO. O curso de AI Agents inclui 4 aulas no total.
O que vou aprender em “Raciocínio agêntico (o1, o3, modelos de raciocínio)”?
Modelos que “pensam” antes de responder — cadeias internas de pensamento, computação no momento do teste e autocorreção. Você pratica AI Agents com código prático que executa diretamente no navegador, e um tutor de IA 24/7 responde suas dúvidas enquanto trabalha na aula.
Preciso ter experiência prévia para começar AI Agents?
Nenhuma experiência prévia é necessária. AI Agents no CoddyKit é estruturado para alunos iniciantes até avançados, então você pode começar aqui ou desde o início e aprender no seu ritmo. Esta é a aula 1 de 4.
Quanto tempo leva a aula “Raciocínio agêntico (o1, o3, modelos de raciocínio)”?
A maioria das aulas CoddyKit leva cerca de 5–10 minutos. Cada uma é compacta e interativa, então você faz progresso constante e retoma exatamente de onde parou entre web e app.
Posso escrever e executar código nesta aula de AI Agents?
Sim. Cada aula de AI Agents inclui um editor de código integrado, então você escreve e executa código real direto no navegador e recebe feedback de IA instantaneamente — nenhuma configuração local necessária.
Todas as aulas deste curso
- Raciocínio agêntico (o1, o3, modelos de raciocínio)
- Agentes híbridos simbólicos e neurais
- Agentes multimodais (visão + voz + ação)
- Problemas em aberto: robustez, alinhamento e memória de longo prazo