Agentic推論(o1、o3、Reasoning Models)
回答前に「考える」モデルを扱います — 内部のchain-of-thought、推論時計算、自己修正について学びます。
「Agentic推論(o1、o3、Reasoning Models)」はCoddyKit上の無料AI Agentsレッスンです。 これはレッスン1/4です。 下記で完全なレッスンを無料で読むことができます。その後、ブラウザ内の組み込みコードエディタと24時間対応のAIチューターでハンズオン演習できます。 これはAI Agents学習パスの一部であり、ウェブとCoddyKitアプリ全体で進捗が同期されます。 AI Agentsコースには全4レッスンが含まれています。
このレッスンの一部はまだ翻訳されておらず、英語で表示されています。
新しい種類のモデル
OpenAI o1(2024年9月)は、目に見える回答を生成する前に明示的にステップごとの推論を行うLLM、「reasoning model」を導入しました。後継モデルにはo3、DeepSeek R1、extended thinkingを備えたClaude、Gemini 2.5 thinkingなど、数多くのモデルがあります。
仕組み
モデルはすぐに回答を生成するのではなく、次の処理を行います:
- 長い内部の「思考」シーケンス(CoT形式)を生成します
- 複数のアプローチを検討します
- 自己修正します
- その後、最終的に目に見える回答を出力します
テスト時コンピュート
モデルにどれだけ「思考」させるかを選べます。思考に使うトークンを増やすほど、難しい問題に対する回答は良くなります。その代わり、レイテンシーとコストが増加します。
OpenAI o-Series API
response = client.chat.completions.create(
model='o3-mini',
messages=[{'role': 'user', 'content': 'Solve this puzzle...'}],
reasoning_effort='high' # low / medium / high
)
print(response.choices[0].message.content)
print(response.usage.reasoning_tokens) # how many 'thinking' tokens were usedAnthropic Extended Thinking
response = client.messages.create(
model='claude-sonnet-4-5',
max_tokens=8192,
thinking={'type': 'enabled', 'budget_tokens': 4096},
messages=[{'role': 'user', 'content': 'Hard reasoning problem'}]
)
# response.content includes 'thinking' blocks + 'text' final answer推論モデルが力を発揮する場面
- 複数ステップの数学
- 複雑なロジックを含むコード生成
- 法律・科学分野の推論
- 先読みが必要な計画
ベンチマークでは、o3はAIMEで90%を超え、GPQAでも高いスコアを獲得しており、非推論モデルを大幅に上回ります。
標準モデルのほうが適している場面
- 単純なチャット/Q&A — 推論が無駄になります
- レイテンシーが重要な処理 — 推論によって数秒かかります
- コスト重視の大量処理 — 推論によってコストが何倍にもなります
- スタイルや書式のタスク — 効果がありません
コストの特徴
推論トークンも料金に含まれます。o3-miniを高い推論強度で使うと、1問あたり10k~100kの思考トークンを使用することがあります。大規模な推論モデルでは、1問あたり$0.10~$1になる可能性があります。
エージェントループ内での利用
大規模なエージェント内のプランナーとして推論モデルを使います:
- 推論モデル: 計画/意思決定/評価
- 標準モデル: ステップの実行
- ツール呼び出し: 通常どおり実行
重要な部分では深い推論を行い、それ以外では低コストで実行するという、両方の利点を得られます。
CoTを上乗せして強制しない
推論モデルでは、もう「ステップごとに考えてください」というプロンプトは必要ありません。モデルはすでに内部でCoTを実行しています。追加すると、かえって性能を損なうことがあります。
オープンソースの推論
DeepSeek R1、R1-Distillなどによって、オープンウェイトでも推論を利用できるようになっています。HuggingFace、Together AIなどで利用できます。
研究の最前線
- Reflection-tuning — モデルが自分自身を批評するように学習させます
- Search-based inference — 推論時にTree-of-ThoughtsやMCTSを使います
- Test-time training — クエリごとに重みを適応させます
注意点:ブラックボックスの思考
推論モデルの「思考」は通常、OpenAIでは非表示にされ、Anthropicでは要約されます。透明性が限られるためデバッグは難しくなります。その代わり、入出力の評価に頼ってください。
推論モデルを使う場面
追加コストを払う価値が最も高いのは、どのようなタスクでしょうか。
まとめ
推論モデル(o1、o3、R1、Claude extended thinking)は、難しいタスクでの品質と引き換えに時間とコストが増加します。エージェント内ではプランナーや評価役として使ってください。単純なチャットでは不要です。
よくある質問
「Agentic推論(o1、o3、Reasoning Models)」レッスンは無料ですか?
はい。「Agentic推論(o1、o3、Reasoning Models)」の完全なテキストはこのウェブで無料で読めます。インタラクティブに演習し(組み込みコードエディタと24時間対応のAIチューター)、AI Agentsコースの残りをアンロックするには、CoddyKit PROにアップグレードしてください。 AI Agentsコースには全4レッスンが含まれています。
「Agentic推論(o1、o3、Reasoning Models)」で何を学びますか?
回答前に「考える」モデルを扱います — 内部のchain-of-thought、推論時計算、自己修正について学びます。 ブラウザで直接実行するハンズオンコードでAI Agentsを演習し、24時間対応のAIチューターがレッスンを進める中での質問に答えます。
AI Agentsを始めるのに経験は必要ですか?
事前経験は必要ありません。CoddyKitのAI Agentsは初級者から上級者向けに構成されているため、ここから始めるか最初から始めて、自分のペースで進むことができます。 これはレッスン1/4です。
「Agentic推論(o1、o3、Reasoning Models)」レッスンにはどのくらい時間がかかりますか?
ほとんどのCoddyKitレッスンは約5~10分かかります。各レッスンはコンパクトでインタラクティブなので、着実に進歩し、ウェブとアプリ全体で正確に前回の場所から再開できます。
このAI Agentsレッスンでコードを書いて実行できますか?
はい。すべてのAI Agentsレッスンに組み込みコードエディタが含まれているため、ブラウザでリアルコードを書いて実行し、即座のAIフィードバックを取得できます。ローカル設定は不要です。
このコースのすべてのレッスン
- Agentic推論(o1、o3、Reasoning Models)
- シンボリックAIとニューラルエージェントの融合
- マルチモーダルエージェント(Vision + Voice + Action)
- 未解決の課題:堅牢性、アラインメント、長期記憶