エージェントの意思決定をバックテストする
過去データ上でエージェントの戦略をシミュレーションし、性能を検証します。
「エージェントの意思決定をバックテストする」はCoddyKit上の無料AI Agentsレッスンです。 これはレッスン4/4です。 下記で完全なレッスンを無料で読むことができます。その後、ブラウザ内の組み込みコードエディタと24時間対応のAIチューターでハンズオン演習できます。 これはAI Agents学習パスの一部であり、ウェブとCoddyKitアプリ全体で進捗が同期されます。 AI Agentsコースには全4レッスンが含まれています。
エージェントの判断をバックテストする理由
過去のデータに対してテストしなければ、金融エージェントが適切な推奨を生成しているかどうかは分かりません。バックテストでは、過去の市場環境をエージェントの判断ロジックに再現させ、その判断がどのような結果になっていたかを測定します。
これは、実運用にデプロイする前に戦略の品質を検証するための主要な手段です。
先読みバイアスの罠
先読みバイアスは、バックテストで最も一般的かつ危険なエラーです。これは、「過去」の判断を行うために将来のデータを使用することです。たとえば、同じ日の寄り付きで買うかどうかを判断する際に、その日の終値を使用するケースが該当します。
過去の各判断では、シミュレーション上の判断時点までに利用可能だったデータだけを使用する必要があります。
import pandas as pd
import yfinance as yf
# WRONG — uses today's close to decide today's trade
def bad_signal(history: pd.DataFrame, date: str) -> str:
today_close = history.loc[date, 'Close'] # look-ahead!
if today_close > history['Close'].mean():
return 'BUY'
return 'HOLD'
# CORRECT — uses only data available BEFORE the decision date
def good_signal(history: pd.DataFrame, date: str) -> str:
past_data = history.loc[:date].iloc[:-1] # exclude today
if past_data.empty:
return 'HOLD'
today_open = history.loc[date, 'Open'] # open price known at market open
if today_open > past_data['Close'].mean():
return 'BUY'
return 'HOLD'過去データ再生ループの構築
過去の各日付を順番に処理します。各ステップで、エージェントにはその時点までに利用可能なデータだけが見えるようにします。判断を記録してから次の日付に進み、結果を確認します。
import yfinance as yf
import pandas as pd
def backtest_simple(ticker: str, start: str, end: str) -> list[dict]:
hist = yf.Ticker(ticker).history(start=start, end=end)
results = []
for i in range(20, len(hist)): # need 20 days of history for signals
window = hist.iloc[:i] # data available on day i
today = hist.iloc[i]
decision = good_signal(window, str(hist.index[i].date()))
results.append({
'date': str(hist.index[i].date()),
'decision': decision,
'open': float(today['Open']),
'close': float(today['Close']),
'next_day_return': None # filled in next iteration
})
return results各ステップでエージェントのロジックをシミュレーションする
より現実的なバックテストを行うには、各日付でエージェントのツール呼び出し全体をシミュレーションします。これには、プロンプトの構築、LLMの呼び出し、判断の解析が含まれます。これにより、シグナルロジックだけでなくシステム全体をテストできます。
import openai, json
import yfinance as yf
client = openai.OpenAI(api_key='YOUR_OPENAI_KEY')
def agent_decision_at_date(ticker: str, hist_up_to: pd.DataFrame) -> str:
recent = hist_up_to.tail(20)
closes = recent['Close'].tolist()
returns = [round((closes[i] - closes[i-1]) / closes[i-1], 4)
for i in range(1, len(closes))]
prompt = (
f'Ticker: {ticker}\n'
f'Last 20 closing prices: {closes}\n'
f'Daily returns: {returns}\n'
f'Based on this data, recommend: BUY, SELL, or HOLD.\n'
f'Return JSON: {{"action": "BUY/SELL/HOLD", "reason": "..."}}'
)
resp = client.chat.completions.create(
model='gpt-4o-mini',
messages=[{'role': 'user', 'content': prompt}],
response_format={'type': 'json_object'}
)
return json.loads(resp.choices[0].message.content).get('action', 'HOLD')的中率の計算
的中率は、BUY判断のうち、翌日のリターンがプラスになった割合を表します。的中率が50%を超えていれば、エージェントは偶然よりも高い確率で方向を正しく予測していることになります。
def compute_hit_rate(results: list[dict]) -> dict:
buy_decisions = [r for r in results if r['decision'] == 'BUY'
and r.get('next_day_return') is not None]
if not buy_decisions:
return {'hit_rate': None, 'sample_size': 0}
correct = sum(1 for r in buy_decisions if r['next_day_return'] > 0)
return {
'hit_rate': round(correct / len(buy_decisions), 4),
'sample_size': len(buy_decisions),
'correct': correct,
'interpretation': 'above_chance' if correct / len(buy_decisions) > 0.52 else 'at_or_below_chance'
}
if __name__ == '__main__':
results = [
{'decision': 'BUY', 'next_day_return': 0.012},
{'decision': 'BUY', 'next_day_return': -0.004},
{'decision': 'HOLD', 'next_day_return': None},
{'decision': 'BUY', 'next_day_return': 0.007},
]
print('Hit rate:', compute_hit_rate(results))
ベンチマークに対するリターンの計算
戦略のリターンを、バイ・アンド・ホールドのベンチマークと比較します。エージェントが単にインデックスを保有するだけの運用を下回るのであれば、その複雑さは正当化できません。
def compare_to_benchmark(results: list[dict], ticker: str, period: str = '1y') -> dict:
import yfinance as yf
# Strategy return: only invested on BUY days
buy_days = [r for r in results if r['decision'] == 'BUY'
and r.get('next_day_return') is not None]
strategy_return = sum(r['next_day_return'] for r in buy_days)
# Benchmark: buy-and-hold
hist = yf.Ticker(ticker).history(period=period)['Close']
bh_return = float((hist.iloc[-1] - hist.iloc[0]) / hist.iloc[0])
return {
'strategy_return_pct': round(strategy_return * 100, 2),
'benchmark_return_pct': round(bh_return * 100, 2),
'outperformed': strategy_return > bh_return,
'alpha_pct': round((strategy_return - bh_return) * 100, 2)
}取引コストの影響
取引コスト(手数料、スプレッド、スリッページ)を考慮しないと、戦略は利益を生むように見えても、実際には運用で損失が発生する可能性があります。1回の取引につきわずか0.1%のコストでも、多数の取引を重ねると大きな影響になります。
COMMISSION_PCT = 0.001 # 0.1% per trade (buy + sell)
SLIPPAGE_PCT = 0.0005 # 0.05% per trade
def returns_after_costs(decisions: list[dict]) -> dict:
total_return = 0.0
total_cost = 0.0
for d in decisions:
if d['decision'] == 'BUY' and d.get('next_day_return') is not None:
gross = d['next_day_return']
cost = COMMISSION_PCT + SLIPPAGE_PCT
net = gross - cost
total_return += net
total_cost += cost
return {
'gross_return_pct': round((total_return + total_cost) * 100, 2),
'net_return_pct': round(total_return * 100, 2),
'total_costs_pct': round(total_cost * 100, 2),
'num_trades': sum(1 for d in decisions if d['decision'] == 'BUY')
}
if __name__ == '__main__':
decisions = [
{'decision': 'BUY', 'next_day_return': 0.012},
{'decision': 'BUY', 'next_day_return': -0.004},
{'decision': 'HOLD', 'next_day_return': None},
]
print('Returns after trading costs:', returns_after_costs(decisions))
ウォークフォワード検証
同じ期間で学習とテストを行うインサンプル最適化は、過学習を招きます。ウォークフォワード検証では、移動する学習期間の後に新しいテスト期間を設定します。これは実際の運用と同じ方法です。
def walk_forward_test(ticker: str, total_years: int = 3,
train_months: int = 12, test_months: int = 3) -> list[dict]:
import yfinance as yf
from dateutil.relativedelta import relativedelta
from datetime import date
results = []
start = date(date.today().year - total_years, 1, 1)
end = date.today()
window_start = start
while True:
train_end = window_start + relativedelta(months=train_months)
test_end = train_end + relativedelta(months=test_months)
if test_end > end:
break
# In practice: train your signal on window_start->train_end
# then evaluate on train_end->test_end
results.append({
'train_period': f'{window_start} to {train_end}',
'test_period': f'{train_end} to {test_end}'
})
window_start += relativedelta(months=test_months)
return resultsバックテストレポート
バックテストの結果を、的中率、ベンチマークに対する総リターン、アルファ、シャープレシオ、最大ドローダウン、取引回数、コスト控除後のリターンを含む構造化されたレポートにまとめます。
def backtest_report(ticker: str, results: list[dict]) -> dict:
hit = compute_hit_rate(results)
benchmark = compare_to_benchmark(results, ticker)
costs = returns_after_costs(results)
return {
'ticker': ticker,
'total_decisions': len(results),
'buy_signals': costs['num_trades'],
'hit_rate': hit.get('hit_rate'),
'strategy_return_gross': f'{costs["gross_return_pct"]}%',
'strategy_return_net': f'{costs["net_return_pct"]}%',
'benchmark_return': f'{benchmark["benchmark_return_pct"]}%',
'alpha': f'{benchmark["alpha_pct"]}%',
'outperformed_benchmark': benchmark['outperformed'],
'transaction_costs': f'{costs["total_costs_pct"]}%'
}バックテスト結果の解釈
良好なバックテスト結果が将来のパフォーマンスを保証するわけではありませんが、悪い結果はデプロイすべきでない戦略を特定する手がかりになります。主な警告サインは、50%未満の的中率、コスト控除後の負のアルファ、0.5未満のシャープレシオ、またはリスク許容度を超える最大ドローダウンです。
def interpret_backtest(report: dict) -> list[str]:
warnings = []
hit_rate = report.get('hit_rate')
if hit_rate and hit_rate < 0.50:
warnings.append(f'Hit rate {hit_rate:.1%} is below chance — strategy predicts direction poorly')
alpha_str = report.get('alpha', '0%')
alpha = float(alpha_str.replace('%', '')) / 100
if alpha < 0:
warnings.append(f'Negative alpha {alpha_str}: strategy underperforms buy-and-hold')
if not warnings:
return ['Backtest results look acceptable — proceed with paper trading before live deployment']
return warnings
if __name__ == '__main__':
report = {'hit_rate': 0.45, 'alpha': '-1.2%'}
for warning in interpret_backtest(report):
print('-', warning)
堅牢性を検証するモンテカルロシミュレーション
1回のバックテストは、選択した特定の期間に左右されます。モンテカルロシミュレーションでは、過去のリターンの順序をランダム化し、異なる順序でもパフォーマンスが維持されるかをテストします。これにより、戦略が堅牢なのか、単に運が良かっただけなのかを明らかにできます。
import numpy as np
def monte_carlo_backtest(daily_returns: list[float],
simulations: int = 1000) -> dict:
returns_arr = np.array(daily_returns)
final_returns = []
for _ in range(simulations):
shuffled = np.random.choice(returns_arr, size=len(returns_arr), replace=True)
cumulative = float((1 + shuffled).prod() - 1)
final_returns.append(cumulative)
final_returns = sorted(final_returns)
return {
'median_return': round(float(np.median(final_returns)) * 100, 2),
'percentile_5': round(float(np.percentile(final_returns, 5)) * 100, 2),
'percentile_95': round(float(np.percentile(final_returns, 95)) * 100, 2),
'prob_positive': round(sum(1 for r in final_returns if r > 0) / simulations, 3)
}バックテストにおける先読みバイアスとは
先読みバイアスは、バックテストのパフォーマンスを意図せず過大評価する最も一般的な原因です。正確な定義を理解することで、壊れたバックテストを構築するのを防げます。
エージェントの判断のバックテストまとめ
適切なバックテストには、先読みバイアスを避けること(判断では過去のデータだけを使用)、各過去時点で現実的なエージェントロジックをシミュレーションすること、的中率とベンチマークに対するアルファを測定すること、取引コストを考慮すること、および過学習を検出するためにウォークフォワード分割で検証することが必要です。
よくある質問
「エージェントの意思決定をバックテストする」レッスンは無料ですか?
はい。「エージェントの意思決定をバックテストする」の完全なテキストはこのウェブで無料で読めます。インタラクティブに演習し(組み込みコードエディタと24時間対応のAIチューター)、AI Agentsコースの残りをアンロックするには、CoddyKit PROにアップグレードしてください。 AI Agentsコースには全4レッスンが含まれています。
「エージェントの意思決定をバックテストする」で何を学びますか?
過去データ上でエージェントの戦略をシミュレーションし、性能を検証します。 ブラウザで直接実行するハンズオンコードでAI Agentsを演習し、24時間対応のAIチューターがレッスンを進める中での質問に答えます。
AI Agentsを始めるのに経験は必要ですか?
事前経験は必要ありません。CoddyKitのAI Agentsは初級者から上級者向けに構成されているため、ここから始めるか最初から始めて、自分のペースで進むことができます。 これはレッスン4/4です。
「エージェントの意思決定をバックテストする」レッスンにはどのくらい時間がかかりますか?
ほとんどのCoddyKitレッスンは約5~10分かかります。各レッスンはコンパクトでインタラクティブなので、着実に進歩し、ウェブとアプリ全体で正確に前回の場所から再開できます。
このAI Agentsレッスンでコードを書いて実行できますか?
はい。すべてのAI Agentsレッスンに組み込みコードエディタが含まれているため、ブラウザでリアルコードを書いて実行し、即座のAIフィードバックを取得できます。ローカル設定は不要です。
このコースのすべてのレッスン
- 市場データ API 連携
- ポートフォリオ分析エージェントツール
- リスクとコンプライアンスのガードレール
- エージェントの意思決定をバックテストする