0Pricing
AI Agents · Aula

Padrão de interpretador de código para análise de dados

Execução isolada de Python: execução de pandas/matplotlib em ferramentas de agentes.

Padrão de interpretador de código para análise de dados é uma aula grátis de AI Agents no CoddyKit. Esta é a aula 1 de 4. Você pode ler a aula completa abaixo gratuitamente — depois pratica ao vivo no navegador com um editor de código integrado e um tutor de IA 24/7. Faz parte do caminho de aprendizado de AI Agents, e seu progresso é sincronizado entre a web e o app CoddyKit. O curso de AI Agents inclui 4 aulas no total.

O padrão de interpretação de código

O padrão de interpretação de código permite que um agente gere código Python para responder a perguntas de análise de dados, execute esse código em um ambiente isolado, capture a saída e interprete os resultados.

Em vez de codificar rigidamente cada operação de análise, o agente escreve um código personalizado para cada pergunta, tornando-se extremamente flexível para tarefas de dados.

Ciclo principal: gerar → executar → interpretar

O padrão tem três etapas que podem se repetir:

  1. Gerar — o LLM escreve código Python para responder à pergunta
  2. Executar — execute o código em um ambiente isolado e capture a saída padrão e os arquivos
  3. Interpretar — passe a saída de volta ao LLM para explicar os resultados
def code_interpreter_agent(question, data_path):
    # Step 1: Generate code
    code = generate_analysis_code(question, data_path)
    print('Generated code:', code[:200])

    # Step 2: Execute in sandbox
    result = execute_in_sandbox(code)

    if result['error']:
        # Try to fix the error
        fixed_code = fix_code(code, result['error'])
        result = execute_in_sandbox(fixed_code)

    # Step 3: Interpret output
    return interpret_output(question, result)

print(code_interpreter_agent(
    'What is the average order value by customer segment?',
    'data/orders.csv'
))

Prompt de geração de código

O prompt de geração de código deve incluir: o caminho ou esquema dos dados, a pergunta e as restrições (sem interfaces de programação externas, use pandas e salve os gráficos em arquivos).

CODE_GEN_PROMPT = """You are a Python data analyst. Write Python code to answer the question.
Data available at: {data_path}
Question: {question}
Write ONLY Python code (no markdown, no explanation):"""

def llm_call(prompt):
    return "```python\nprint('df.describe() results')\n```"

def generate_analysis_code(question, data_path):
    response = llm_call(CODE_GEN_PROMPT.format(question=question, data_path=data_path))
    code = response.strip()
    if code.startswith('```'):
        code = code.split('```')[1]
        if code.startswith('python'):
            code = code[6:]
    return code.strip()

print(generate_analysis_code('What is the average price?', 'data.csv'))

Execução em ambiente isolado com subprocesso

O ambiente isolado mais simples consiste em executar o código em um subprocesso separado com um tempo limite. Isso fornece isolamento de processos — se o código falhar, ele não derrubará o agente.

import subprocess
import tempfile
import os

def execute_in_sandbox(code, timeout=30):
    # Write code to temp file
    with tempfile.NamedTemporaryFile(suffix='.py', mode='w', delete=False) as f:
        f.write(code)
        script_path = f.name

    try:
        result = subprocess.run(
            ['python3', script_path],
            capture_output=True,
            text=True,
            timeout=timeout,
            env={**os.environ, 'MPLBACKEND': 'Agg'}  # non-interactive matplotlib
        )
        return {
            'stdout': result.stdout,
            'stderr': result.stderr,
            'returncode': result.returncode,
            'error': result.stderr if result.returncode != 0 else None
        }
    except subprocess.TimeoutExpired:
        return {'stdout': '', 'stderr': 'Timeout', 'returncode': -1, 'error': 'Code timed out'}
    finally:
        os.unlink(script_path)

if __name__ == '__main__':
    result = execute_in_sandbox('print(2 + 2)')
    print('Sandbox stdout:', result['stdout'].strip())
    print('Return code   :', result['returncode'])

Ambiente isolado na nuvem E2B

E2B fornece um ambiente isolado gerenciado na nuvem para execução segura de código — mais seguro que um subprocesso. Ele executa o código em um contêiner isolado com acesso ao sistema de arquivos.

Instale com pip install e2b-code-interpreter.

from e2b_code_interpreter import Sandbox
import os

def execute_with_e2b(code, data_bytes=None):
    with Sandbox(api_key=os.getenv('E2B_API_KEY')) as sandbox:
        # Upload data file if provided
        if data_bytes:
            sandbox.files.write('/home/user/data.csv', data_bytes)

        # Execute code
        execution = sandbox.run_code(code)

        result = {
            'stdout': '\n'.join(execution.logs.stdout),
            'stderr': '\n'.join(execution.logs.stderr),
            'error': None
        }

        # Check for errors
        if execution.error:
            result['error'] = str(execution.error)

        # Download any generated files
        result['files'] = []
        for output in execution.results:
            if hasattr(output, 'png'):
                result['files'].append({
                    'type': 'image/png',
                    'data': output.png  # base64 encoded
                })

    return result

Captura de arquivos gerados

O código pode gerar gráficos, exportações em CSV ou outros arquivos. Capture esses arquivos no sistema de arquivos do ambiente isolado e devolva-os ao agente para interpretação ou exibição.

import os
import glob
import base64

OUTPUT_DIR = '/tmp/chart_output'

def execute_and_capture(code, timeout=30):
    # Create output dir
    os.makedirs(OUTPUT_DIR, exist_ok=True)

    result = execute_in_sandbox(code, timeout=timeout)

    # Capture any generated image files
    generated_files = []
    for filepath in glob.glob(os.path.join(OUTPUT_DIR, '*.png')):
        with open(filepath, 'rb') as f:
            encoded = base64.b64encode(f.read()).decode('utf-8')
        generated_files.append({
            'filename': os.path.basename(filepath),
            'type': 'image/png',
            'base64': encoded
        })
        os.unlink(filepath)  # clean up

    result['generated_files'] = generated_files
    print(f'Captured {len(generated_files)} file(s) from sandbox')
    return result

Ciclo de recuperação de erros

O código gerado frequentemente apresenta erros na primeira execução. Implemente um ciclo de recuperação: envie o erro ao LLM junto com o código original e peça uma correção. Limite a 2 a 3 novas tentativas.

FIX_PROMPT = '''The following Python code raised an error. Fix it.

Original code:
{code}

Error:
{error}

Return ONLY the fixed Python code (no explanation, no markdown):'''

def fix_code(code, error):
    return llm_call(FIX_PROMPT.format(code=code, error=error)).strip()

def execute_with_retry(code, max_retries=2):
    for attempt in range(max_retries + 1):
        result = execute_and_capture(code)
        if not result['error']:
            return result
        print(f'Attempt {attempt + 1} failed: {result["error"][:100]}')
        if attempt < max_retries:
            code = fix_code(code, result['error'])
    return result  # return last result even if errored

Interpretação da saída do código

A saída bruta do código (números, tabelas) precisa ser convertida novamente em uma resposta em linguagem natural. Passe a saída padrão ao LLM e peça que explique os resultados no contexto da pergunta original.

INTERPRET_PROMPT = '''A Python script was executed to answer a data analysis question.
Explain the results in clear, non-technical language.

Original question: {question}

Code output (stdout):
{output}

Provide a clear, concise answer that directly addresses the question.
Highlight the most important numbers or findings.
Answer:'''

def interpret_output(question, execution_result):
    stdout = execution_result.get('stdout', '').strip()
    error = execution_result.get('error')

    if error and not stdout:
        return f'The analysis failed with error: {error}'

    if not stdout:
        return 'The code ran successfully but produced no output.'

    return llm_call(INTERPRET_PROMPT.format(
        question=question,
        output=stdout[:3000]  # truncate very long outputs
    ))

Restrições de segurança na geração de código

O código gerado não deve fazer chamadas de rede, acessar arquivos sensíveis nem executar comandos do sistema. Faça cumprir isso tanto no prompt quanto com restrições do ambiente isolado.

BLOCKED_IMPORTS = ['requests', 'httpx', 'urllib', 'socket', 'subprocess', 'os.system']

def pre_validate_code(code):
    errors = []
    for blocked in BLOCKED_IMPORTS:
        if f'import {blocked}' in code or f'from {blocked}' in code:
            errors.append(f'Blocked import: {blocked}')

    # Block shell execution
    import re
    if re.search(r'os\.system|subprocess\.run|subprocess\.call|eval\(|exec\(', code):
        errors.append('Blocked: shell execution or eval/exec')

    # Block reading outside allowed paths
    if re.search(r'open\([^)]*\.\./|open\([^)]*\/etc\/', code):
        errors.append('Blocked: unauthorized file access')

    if errors:
        raise ValueError('Security check failed:\n' + '\n'.join(errors))

    return True

if __name__ == '__main__':
    try:
        pre_validate_code('import requests\nrequests.get("http://x")')
    except ValueError as e:
        print('Rejected:', e)
    print('Safe code passed:', pre_validate_code('print(1 + 1)'))

Inclusão do esquema de dados

O LLM gera código melhor quando conhece antecipadamente o esquema dos dados — nomes das colunas, tipos e linhas de exemplo. Inclua uma descrição do esquema no prompt de geração de código.

import pandas as pd

def get_data_schema(data_path):
    df = pd.read_csv(data_path, nrows=5)
    schema_lines = []
    for col in df.columns:
        dtype = str(df[col].dtype)
        sample = df[col].dropna().iloc[0] if len(df[col].dropna()) > 0 else 'N/A'
        schema_lines.append(f'  - {col} ({dtype}): sample={sample!r}')
    schema_text = '\n'.join(schema_lines)
    return f'CSV columns:\n{schema_text}\nTotal rows: {len(pd.read_csv(data_path))}'

ENHANCED_PROMPT = CODE_GEN_PROMPT + '\n\nData schema:\n{schema}'

def generate_analysis_code_with_schema(question, data_path):
    schema = get_data_schema(data_path)
    response = llm_call(ENHANCED_PROMPT.format(
        question=question, data_path=data_path, schema=schema
    ))
    return response.strip()

Rastreamento do histórico de execução

Mantenha um registro de todas as execuções de código em uma sessão. Isso permite que o agente faça referência a resultados anteriores, dê continuidade a cálculos anteriores e explique ao usuário as etapas de sua análise.

from datetime import datetime

execution_history = []

def record_execution(question, code, result):
    execution_history.append({
        'timestamp': datetime.now().isoformat(),
        'question': question,
        'code_lines': len(code.splitlines()),
        'stdout_preview': result.get('stdout', '')[:200],
        'success': result.get('error') is None,
        'generated_files': len(result.get('generated_files', []))
    })

def get_session_summary():
    total = len(execution_history)
    successful = sum(1 for e in execution_history if e['success'])
    return {
        'total_executions': total,
        'successful': successful,
        'failed': total - successful,
        'success_rate': f'{successful/max(total,1)*100:.0f}%',
        'questions_answered': [e['question'][:60] for e in execution_history]
    }

# Usage in agent loop
def code_interpreter_agent_tracked(question, data_path):
    code = generate_analysis_code_with_schema(question, data_path)
    result = execute_with_retry(code)
    record_execution(question, code, result)
    return interpret_output(question, result)

Verificação de conhecimentos

Qual é a principal vantagem de usar o padrão de interpretador de código em vez de codificar diretamente operações específicas de análise de dados como ferramentas do agente?

Recapitulação: padrão de interpretador de código para análise de dados

O padrão de interpretador de código: gerar código Python (com contexto do esquema e restrições de segurança) → executar em um ambiente isolado (subprocesso ou E2B) → capturar a saída padrão e os arquivos → repetir em caso de erros → interpretar os resultados em linguagem natural.

Principais considerações: inclua o esquema dos dados para melhorar a geração de código, faça a pré-validação do código em busca de importações bloqueadas e comandos do terminal, use um tempo limite no subprocesso para impedir execuções intermináveis e capture os gráficos gerados como base64 para exibição.

Perguntas Frequentes

A aula “Padrão de interpretador de código para análise de dados” é grátis?

Sim — o texto completo de “Padrão de interpretador de código para análise de dados” é grátis para ler aqui na web. Para praticá-la interativamente (um editor de código integrado e um tutor de IA 24/7) e desbloquear o restante do curso de AI Agents, atualize para CoddyKit PRO. O curso de AI Agents inclui 4 aulas no total.

O que vou aprender em “Padrão de interpretador de código para análise de dados”?

Execução isolada de Python: execução de pandas/matplotlib em ferramentas de agentes. Você pratica AI Agents com código prático que executa diretamente no navegador, e um tutor de IA 24/7 responde suas dúvidas enquanto trabalha na aula.

Preciso ter experiência prévia para começar AI Agents?

Nenhuma experiência prévia é necessária. AI Agents no CoddyKit é estruturado para alunos iniciantes até avançados, então você pode começar aqui ou desde o início e aprender no seu ritmo. Esta é a aula 1 de 4.

Quanto tempo leva a aula “Padrão de interpretador de código para análise de dados”?

A maioria das aulas CoddyKit leva cerca de 5–10 minutos. Cada uma é compacta e interativa, então você faz progresso constante e retoma exatamente de onde parou entre web e app.

Posso escrever e executar código nesta aula de AI Agents?

Sim. Cada aula de AI Agents inclui um editor de código integrado, então você escreve e executa código real direto no navegador e recebe feedback de IA instantaneamente — nenhuma configuração local necessária.

Todas as aulas deste curso

  1. Padrão de interpretador de código para análise de dados
  2. Ferramentas de agentes orientadas por Pandas
  3. Geração automatizada de gráficos e visualizações
  4. Agentes de resumo estatístico
← Voltar para AI Agents