AI Prompt Engineering · Leçon

Invites d’OCR et d’analyse de documents

Extrayez le texte, les tableaux et la structure d’images de documents.

Leçon 4 sur 413 étapes

Invites d’OCR et d’analyse de documents est une leçon AI Prompt Engineering gratuite sur CoddyKit. Ceci est la leçon 4 sur 4. Tu peux lire la leçon complète ci-dessous gratuitement — puis la pratiquer en direct dans le navigateur avec un éditeur de code intégré et un tuteur IA 24/7. Elle fait partie du parcours d'apprentissage AI Prompt Engineering, et ta progression se synchronise sur le web et l'application CoddyKit. Le cours AI Prompt Engineering comprend 4 leçons au total.

Les LLM comme lecteurs de documents

L’OCR (reconnaissance optique de caractères) nécessitait traditionnellement des logiciels spécialisés pour extraire du texte à partir d’images. Les LLM de vision peuvent désormais lire le texte présent dans les images et aussi en comprendre le contenu — non seulement extraire les caractères, mais aussi analyser la structure, les tableaux, l’écriture manuscrite et le contexte.

Tâches courantes d’analyse de documents :

  • Extraire du texte de documents numérisés
  • Lire des reçus, des factures et des formulaires
  • Analyser des tableaux et des graphiques
  • Transcrire des notes manuscrites
  • Lire des étiquettes et des panneaux imprimés

Instruction d’extraction de texte de base

Pour une extraction simple de texte à partir de l’image d’un document :

import anthropic, base64

client = anthropic.Anthropic(api_key='YOUR_API_KEY')

def extract_text(image_path, extraction_prompt):
    with open(image_path, 'rb') as f:
        img_b64 = base64.standard_b64encode(f.read()).decode('utf-8')

    r = client.messages.create(
        model='claude-opus-4-5', max_tokens=1000,
        messages=[{'role': 'user', 'content': [
            {'type': 'image', 'source': {'type': 'base64', 'media_type': 'image/jpeg', 'data': img_b64}},
            {'type': 'text', 'text': extraction_prompt}
        ]}]
    )
    return r.content[0].text

# Basic extraction
basic_prompt = 'Extract all text from this document image exactly as it appears. Preserve line breaks.'

# Structure-preserving extraction
structured_prompt = 'Extract all text from this document image. Preserve: paragraph structure, line breaks, and any visible formatting. Do not add any text not present in the image.'

print('Text extraction functions defined.')

Préserver la structure des tableaux

Lorsqu’un document contient un tableau, l’extraire sous forme de texte plat fait perdre sa structure. Utilisez des instructions qui préservent explicitement le format du tableau :

table_prompt = '''
Extract all text from this document image.
If the document contains any tables, preserve the table structure using markdown table format:
| Column 1 | Column 2 | Column 3 |
|----------|----------|----------|
| Value    | Value    | Value    |

For any text outside tables, use plain text preserving paragraph structure.
Do not invent or infer any data not visible in the image.
'''

# For structured output:
table_json_prompt = '''
Extract the table from this image.
Return JSON:
{
  "headers": ["column name"],
  "rows": [["cell value", "cell value"]],
  "caption": "table caption if present or null"
}
If a cell is empty or illegible, use null.
'''

print('Table extraction prompts defined.')

Détail des articles d’un reçu

Les reçus ont une structure précise — en-tête (commerçant), articles et totaux. Une instruction dédiée aux reçus extrait cette structure de manière fiable :

import json

receipt_prompt = '''
Extract all information from this receipt image.
Return JSON:
{
  "merchant": {
    "name": str,
    "address": str or null,
    "phone": str or null
  },
  "transaction": {
    "date": "YYYY-MM-DD or as written",
    "time": "HH:MM or as written or null",
    "receipt_number": str or null,
    "payment_method": str or null
  },
  "items": [
    {"description": str, "quantity": number or null, "unit_price": number or null, "total": number}
  ],
  "subtotal": number or null,
  "tax": number or null,
  "tip": number or null,
  "total": number,
  "currency": "3-letter ISO code"
}
For any field not visible, use null. For numbers, use numeric type (not string).
'''

def extract_receipt(image_path):
    text = extract_text(image_path, receipt_prompt)
    return json.loads(text)

print('Receipt extraction function defined.')

Transcription d’une note manuscrite

La transcription d’un contenu manuscrit nécessite des instructions qui tiennent compte des difficultés — mots illisibles, texte barré, abréviations :

handwriting_prompt = '''
Transcribe the handwritten text in this image as accurately as possible.

Handling rules:
- If a word is illegible, write [ILLEGIBLE]
- If a word is partially legible, write [PARTIAL: best_guess]
- If text is crossed out, include it with strikethrough notation: ~~crossed out text~~
- Preserve line breaks as they appear
- If there are arrows, circles, or annotations, note them in brackets: [arrow pointing right]
- Do not correct spelling or grammar

After transcription, estimate overall legibility: high (>90% readable) | medium (70-90%) | low (<70%)

Format:
TRANSCRIPTION:
[transcribed text here]

LEGIBILITY: [rating]
'''

print(handwriting_prompt)

Extraction des champs d’un formulaire

Les formulaires imprimés comportent des champs étiquetés et des valeurs saisies. Une instruction d’extraction de formulaire associe les étiquettes aux valeurs :

form_prompt = '''
Extract all form fields and their values from this document image.

For each field:
- Field label: the printed label (e.g., "First Name:", "Date of Birth:")
- Field value: the filled-in value (handwritten or typed)
- Filled: whether the field has been filled in (true/false)

Return JSON:
{
  "form_title": str or null,
  "fields": [
    {
      "label": str,
      "value": str or null,
      "filled": true | false
    }
  ],
  "signature_present": true | false,
  "date_signed": str or null
}

If the value is illegible, use "[ILLEGIBLE]".
If the field is blank, value should be null and filled should be false.
'''

print('Form field extraction prompt defined.')
print('Handles: printed forms, questionnaires, applications.')

Classification du document avant extraction

Enchaînez une étape de classification avant l’extraction afin d’appliquer le schéma d’extraction approprié à chaque type de document :

import json

DOC_SCHEMAS = {
    'receipt': receipt_prompt,
    'form': form_prompt,
    'table': table_json_prompt,
    'letter': 'Extract all text preserving paragraph structure. Identify: sender, recipient, date, subject, body.',
    'label': 'Extract all text from this label. Include: product name, ingredients/contents, weight, expiry date, barcode numbers.'
}

def classify_and_extract(image_path):
    # Step 1: Classify document type
    classify_prompt = 'What type of document is this? Return JSON: {"type": "receipt|form|table|letter|label|other", "confidence": "high|medium|low"}'
    classification_text = extract_text(image_path, classify_prompt)
    doc_type = json.loads(classification_text)['type']

    # Step 2: Apply correct schema
    schema = DOC_SCHEMAS.get(doc_type, 'Extract all visible text from this document.')
    extracted = extract_text(image_path, schema)

    return {'type': doc_type, 'data': extracted}

print('Document classify-then-extract pipeline defined.')

Gérer les images de mauvaise qualité

Les images de documents ne sont pas toutes nettes. Les instructions doivent gérer les images dégradées avec discernement :

low_quality_prompt = '''
Extract text from this document image. The image may be low quality, blurry, or poorly lit.

Extraction guidelines:
- Extract all text you can read with reasonable confidence
- For unclear sections, use [UNCLEAR] as a placeholder
- For completely unreadable sections, use [UNREADABLE: approximately N words]
- Do not guess or hallucinate words you cannot see clearly
- Note image quality issues at the end: "Image quality: [good/fair/poor]. Issues: [description]"

Be conservative — it is better to mark something as unclear than to guess incorrectly.
'''

print(low_quality_prompt)
print('\nConservative approach: unclear beats hallucinated.')

Résumé d’un document de plusieurs pages

Pour les documents de plusieurs pages envoyés sous forme de plusieurs images, combinez l’extraction page par page avec une étape de synthèse :

def extract_multi_page_document(image_paths):
    # Step 1: Extract text from each page
    page_texts = []
    for i, path in enumerate(image_paths):
        page_text = extract_text(path, f'Extract all text from page {i+1} of this document. Preserve structure.')
        page_texts.append(f'=== PAGE {i+1} ===\n{page_text}')

    full_text = '\n\n'.join(page_texts)

    # Step 2: Synthesize summary and key information
    r = client.messages.create(
        model='claude-opus-4-5', max_tokens=500,
        messages=[{'role': 'user', 'content': f'''
Here is the extracted text from a {len(image_paths)}-page document:\n\n{full_text}\n\n
Provide:
1. Document type and title
2. 3-sentence summary
3. Key data points extracted
Return JSON: {{"type": str, "title": str, "summary": str, "key_data": [str]}}
'''}]
    )
    return json.loads(r.content[0].text)

print('Multi-page document pipeline defined.')

Validation après extraction par OCR

Les résultats de l’OCR doivent être validés avant leur utilisation dans les systèmes en aval. Contrôles de validation courants :

import re
from datetime import datetime

def validate_receipt_extraction(data):
    errors = []

    # Validate total is present and numeric
    if data.get('total') is None:
        errors.append('total is missing')
    elif not isinstance(data['total'], (int, float)):
        errors.append(f'total is not numeric: {data["total"]}')

    # Validate date format
    if data.get('transaction', {}).get('date'):
        date_str = data['transaction']['date']
        try:
            datetime.strptime(date_str, '%Y-%m-%d')
        except ValueError:
            errors.append(f'date format invalid: {date_str}')

    # Validate line items total approximately equals subtotal
    if data.get('items') and data.get('subtotal'):
        items_total = sum(item.get('total', 0) for item in data['items'] if item.get('total'))
        if abs(items_total - data['subtotal']) > 0.05:
            errors.append(f'Items total {items_total} does not match subtotal {data["subtotal"]}')

    return errors

print('Receipt validation function defined.')

Extraire des données structurées de graphiques et de diagrammes

Les graphiques et les diagrammes présents dans les images de documents contiennent des données invisibles pour l’OCR traditionnel, mais lisibles par les LLM de vision. Une instruction d’extraction de graphique demande au modèle de lire les valeurs de données sous-jacentes :

chart_prompt = '''
Extract the data from this chart or graph image.

Identify:
1. Chart type (bar, line, pie, scatter, table)
2. Title and axis labels
3. All data series names
4. All data points with their labels/values
5. Any notable trend or pattern

Return JSON:
{
  "chart_type": str,
  "title": str or null,
  "x_axis_label": str or null,
  "y_axis_label": str or null,
  "data_series": [
    {"name": str, "values": [{"label": str, "value": number}]}
  ],
  "key_insight": str
}

If exact values are not readable, provide best estimates with a note.
'''

print(chart_prompt)

Vérification rapide

Lors de la transcription d’un contenu manuscrit à partir d’une image, quelle est l’approche recommandée pour les mots illisibles ?

OCR et analyse de documents — Points clés

Les LLM de vision offrent une analyse flexible des documents qui va au-delà de la reconnaissance des caractères :

  • Extraction de base : préservez les sauts de ligne et la structure des paragraphes ; indiquez-le explicitement
  • Tableaux : utilisez le format de tableau Markdown ou un schéma JSON composé de lignes et d’en-têtes pour préserver la structure
  • Reçus : utilisez un schéma dédié comportant les champs du commerçant, des articles et des totaux
  • Écriture manuscrite : indiquez [ILLEGIBLE] pour les éléments illisibles et [PARTIAL] pour ceux qui sont partiellement lisibles — ne devinez jamais
  • Formulaires : associez les paires étiquette-valeur ; indiquez pour chaque champ s’il est rempli ou non
  • Commencez par classer le type de document, puis appliquez le schéma d’extraction approprié
  • Validez les données extraites par programmation : champs obligatoires, types numériques, formats de date, contrôles arithmétiques
  • Images de mauvaise qualité : une extraction prudente vaut mieux qu’une hallucination formulée avec assurance
Gratuit pour commencer

Apprends AI Prompt Engineering avec un tuteur IA — gratuit

Écris et exécute du vrai code dans ton navigateur, obtiens de l'aide instantanée d'un tuteur IA disponible 24h/24, et reprends là où tu t'es arrêté sur le web ou dans l'app.

Cours
53
Leçons
199

Questions Fréquemment Posées

La leçon « Invites d’OCR et d’analyse de documents » est-elle gratuite ?

Oui — le texte complet de « Invites d’OCR et d’analyse de documents » est gratuit à lire ici sur le web. Pour la pratiquer de manière interactive (un éditeur de code intégré et un tuteur IA 24/7) et déverrouiller le reste du cours AI Prompt Engineering, passe à CoddyKit PRO. Le cours AI Prompt Engineering comprend 4 leçons au total.

Qu'est-ce que j'apprendrai dans « Invites d’OCR et d’analyse de documents » ?

Extrayez le texte, les tableaux et la structure d’images de documents. Tu pratiques AI Prompt Engineering avec du code pratique que tu exécutes directement dans le navigateur, et un tuteur IA 24/7 répond à tes questions au fur et à mesure que tu avances dans la leçon.

Dois-je avoir de l'expérience pour commencer AI Prompt Engineering ?

Aucune expérience préalable n'est requise. AI Prompt Engineering sur CoddyKit est structuré pour les débutants jusqu'aux apprenants avancés, donc tu peux commencer ici ou depuis le début et avancer à ton rythme. Ceci est la leçon 4 sur 4.

Combien de temps prend la leçon « Invites d’OCR et d’analyse de documents » ?

La plupart des leçons CoddyKit prennent environ 5–10 minutes. Chacune est courte et interactive, tu progresses régulièrement et tu repiques exactement où tu t'es arrêté sur le web et l'app.

Peux-tu écrire et exécuter du code dans cette leçon AI Prompt Engineering ?

Oui. Chaque leçon AI Prompt Engineering inclut un éditeur de code intégré, tu écris et exécutes du vrai code directement dans ton navigateur et tu reçois des retours IA instantanés — aucune configuration locale requise.

Toutes les leçons de ce cours

  1. Invites de description et de légendage d’images
  2. Réponses aux questions visuelles
  3. Invites de comparaison de plusieurs images
  4. Invites d’OCR et d’analyse de documents
← Retour à AI Prompt Engineering