AI Prompt Engineering · Pelajaran

Perintah OCR dan Analisis Dokumen

Ekstrak teks, tabel, dan struktur dari gambar dokumen.

Pelajaran 4 dari 413 langkah

Perintah OCR dan Analisis Dokumen adalah pelajaran AI Prompt Engineering gratis di CoddyKit. Ini adalah pelajaran 4 dari 4. Kamu bisa membaca pelajaran lengkapnya di bawah secara gratis — lalu praktikkan langsung di browser dengan editor kode bawaan dan tutor AI 24/7. Ini adalah bagian dari jalur belajar AI Prompt Engineering, dan progresmu tersinkronisasi di web dan aplikasi CoddyKit. Kursus AI Prompt Engineering mencakup 4 pelajaran total.

LLM sebagai Pembaca Dokumen

OCR (Pengenalan Karakter Optik) secara tradisional memerlukan perangkat lunak khusus untuk mengekstrak teks dari gambar. LLM visi kini dapat membaca teks dari gambar sekaligus memahami isinya — bukan hanya mengekstrak karakter, tetapi juga mengurai struktur, tabel, tulisan tangan, dan konteks.

Tugas umum analisis dokumen:

  • Mengekstrak teks dari dokumen hasil pemindaian
  • Membaca tanda terima, faktur, dan formulir
  • Mengurai tabel dan grafik
  • Mentranskripsikan catatan tulisan tangan
  • Membaca label dan tanda tercetak

Prompt Ekstraksi Teks Dasar

Untuk ekstraksi teks sederhana dari gambar dokumen:

import anthropic, base64

client = anthropic.Anthropic(api_key='YOUR_API_KEY')

def extract_text(image_path, extraction_prompt):
    with open(image_path, 'rb') as f:
        img_b64 = base64.standard_b64encode(f.read()).decode('utf-8')

    r = client.messages.create(
        model='claude-opus-4-5', max_tokens=1000,
        messages=[{'role': 'user', 'content': [
            {'type': 'image', 'source': {'type': 'base64', 'media_type': 'image/jpeg', 'data': img_b64}},
            {'type': 'text', 'text': extraction_prompt}
        ]}]
    )
    return r.content[0].text

# Basic extraction
basic_prompt = 'Extract all text from this document image exactly as it appears. Preserve line breaks.'

# Structure-preserving extraction
structured_prompt = 'Extract all text from this document image. Preserve: paragraph structure, line breaks, and any visible formatting. Do not add any text not present in the image.'

print('Text extraction functions defined.')

Mempertahankan Struktur Tabel

Ketika dokumen berisi tabel, mengekstraknya sebagai teks datar akan menghilangkan strukturnya. Gunakan prompt yang secara eksplisit mempertahankan format tabel:

table_prompt = '''
Extract all text from this document image.
If the document contains any tables, preserve the table structure using markdown table format:
| Column 1 | Column 2 | Column 3 |
|----------|----------|----------|
| Value    | Value    | Value    |

For any text outside tables, use plain text preserving paragraph structure.
Do not invent or infer any data not visible in the image.
'''

# For structured output:
table_json_prompt = '''
Extract the table from this image.
Return JSON:
{
  "headers": ["column name"],
  "rows": [["cell value", "cell value"]],
  "caption": "table caption if present or null"
}
If a cell is empty or illegible, use null.
'''

print('Table extraction prompts defined.')

Perincian Item Tanda Terima

Tanda terima memiliki struktur tertentu — tajuk (pedagang), item per baris, dan total. Prompt khusus tanda terima mengekstrak struktur ini secara andal:

import json

receipt_prompt = '''
Extract all information from this receipt image.
Return JSON:
{
  "merchant": {
    "name": str,
    "address": str or null,
    "phone": str or null
  },
  "transaction": {
    "date": "YYYY-MM-DD or as written",
    "time": "HH:MM or as written or null",
    "receipt_number": str or null,
    "payment_method": str or null
  },
  "items": [
    {"description": str, "quantity": number or null, "unit_price": number or null, "total": number}
  ],
  "subtotal": number or null,
  "tax": number or null,
  "tip": number or null,
  "total": number,
  "currency": "3-letter ISO code"
}
For any field not visible, use null. For numbers, use numeric type (not string).
'''

def extract_receipt(image_path):
    text = extract_text(image_path, receipt_prompt)
    return json.loads(text)

print('Receipt extraction function defined.')

Transkripsi Catatan Tulisan Tangan

Mentranskripsikan konten tulisan tangan memerlukan prompt yang mengakui tantangannya — kata yang tidak terbaca, teks yang dicoret, dan singkatan:

handwriting_prompt = '''
Transcribe the handwritten text in this image as accurately as possible.

Handling rules:
- If a word is illegible, write [ILLEGIBLE]
- If a word is partially legible, write [PARTIAL: best_guess]
- If text is crossed out, include it with strikethrough notation: ~~crossed out text~~
- Preserve line breaks as they appear
- If there are arrows, circles, or annotations, note them in brackets: [arrow pointing right]
- Do not correct spelling or grammar

After transcription, estimate overall legibility: high (>90% readable) | medium (70-90%) | low (<70%)

Format:
TRANSCRIPTION:
[transcribed text here]

LEGIBILITY: [rating]
'''

print(handwriting_prompt)

Ekstraksi Isian Formulir

Formulir tercetak memiliki bidang berlabel dan nilai yang diisikan. Prompt ekstraksi formulir memetakan label ke nilai:

form_prompt = '''
Extract all form fields and their values from this document image.

For each field:
- Field label: the printed label (e.g., "First Name:", "Date of Birth:")
- Field value: the filled-in value (handwritten or typed)
- Filled: whether the field has been filled in (true/false)

Return JSON:
{
  "form_title": str or null,
  "fields": [
    {
      "label": str,
      "value": str or null,
      "filled": true | false
    }
  ],
  "signature_present": true | false,
  "date_signed": str or null
}

If the value is illegible, use "[ILLEGIBLE]".
If the field is blank, value should be null and filled should be false.
'''

print('Form field extraction prompt defined.')
print('Handles: printed forms, questionnaires, applications.')

Klasifikasi Dokumen Sebelum Ekstraksi

Rangkaikan langkah klasifikasi sebelum ekstraksi untuk menerapkan skema ekstraksi yang tepat bagi setiap jenis dokumen:

import json

DOC_SCHEMAS = {
    'receipt': receipt_prompt,
    'form': form_prompt,
    'table': table_json_prompt,
    'letter': 'Extract all text preserving paragraph structure. Identify: sender, recipient, date, subject, body.',
    'label': 'Extract all text from this label. Include: product name, ingredients/contents, weight, expiry date, barcode numbers.'
}

def classify_and_extract(image_path):
    # Step 1: Classify document type
    classify_prompt = 'What type of document is this? Return JSON: {"type": "receipt|form|table|letter|label|other", "confidence": "high|medium|low"}'
    classification_text = extract_text(image_path, classify_prompt)
    doc_type = json.loads(classification_text)['type']

    # Step 2: Apply correct schema
    schema = DOC_SCHEMAS.get(doc_type, 'Extract all visible text from this document.')
    extracted = extract_text(image_path, schema)

    return {'type': doc_type, 'data': extracted}

print('Document classify-then-extract pipeline defined.')

Menangani Gambar Berkualitas Rendah

Tidak semua gambar dokumen terlihat jelas. Prompt harus menangani gambar yang kualitasnya menurun dengan baik:

low_quality_prompt = '''
Extract text from this document image. The image may be low quality, blurry, or poorly lit.

Extraction guidelines:
- Extract all text you can read with reasonable confidence
- For unclear sections, use [UNCLEAR] as a placeholder
- For completely unreadable sections, use [UNREADABLE: approximately N words]
- Do not guess or hallucinate words you cannot see clearly
- Note image quality issues at the end: "Image quality: [good/fair/poor]. Issues: [description]"

Be conservative — it is better to mark something as unclear than to guess incorrectly.
'''

print(low_quality_prompt)
print('\nConservative approach: unclear beats hallucinated.')

Ringkasan Dokumen Multi-Halaman

Untuk dokumen multi-halaman yang dikirim sebagai beberapa gambar, gabungkan ekstraksi halaman demi halaman dengan langkah sintesis:

def extract_multi_page_document(image_paths):
    # Step 1: Extract text from each page
    page_texts = []
    for i, path in enumerate(image_paths):
        page_text = extract_text(path, f'Extract all text from page {i+1} of this document. Preserve structure.')
        page_texts.append(f'=== PAGE {i+1} ===\n{page_text}')

    full_text = '\n\n'.join(page_texts)

    # Step 2: Synthesize summary and key information
    r = client.messages.create(
        model='claude-opus-4-5', max_tokens=500,
        messages=[{'role': 'user', 'content': f'''
Here is the extracted text from a {len(image_paths)}-page document:\n\n{full_text}\n\n
Provide:
1. Document type and title
2. 3-sentence summary
3. Key data points extracted
Return JSON: {{"type": str, "title": str, "summary": str, "key_data": [str]}}
'''}]
    )
    return json.loads(r.content[0].text)

print('Multi-page document pipeline defined.')

Validasi Setelah Ekstraksi OCR

Output OCR harus divalidasi sebelum digunakan dalam sistem lanjutan. Pemeriksaan validasi umum:

import re
from datetime import datetime

def validate_receipt_extraction(data):
    errors = []

    # Validate total is present and numeric
    if data.get('total') is None:
        errors.append('total is missing')
    elif not isinstance(data['total'], (int, float)):
        errors.append(f'total is not numeric: {data["total"]}')

    # Validate date format
    if data.get('transaction', {}).get('date'):
        date_str = data['transaction']['date']
        try:
            datetime.strptime(date_str, '%Y-%m-%d')
        except ValueError:
            errors.append(f'date format invalid: {date_str}')

    # Validate line items total approximately equals subtotal
    if data.get('items') and data.get('subtotal'):
        items_total = sum(item.get('total', 0) for item in data['items'] if item.get('total'))
        if abs(items_total - data['subtotal']) > 0.05:
            errors.append(f'Items total {items_total} does not match subtotal {data["subtotal"]}')

    return errors

print('Receipt validation function defined.')

Mengekstrak Data Terstruktur dari Bagan dan Grafik

Bagan dan grafik dalam gambar dokumen berisi data yang tidak terlihat oleh OCR tradisional, tetapi dapat dibaca oleh LLM visi. Prompt ekstraksi bagan meminta model membaca nilai data yang mendasarinya:

chart_prompt = '''
Extract the data from this chart or graph image.

Identify:
1. Chart type (bar, line, pie, scatter, table)
2. Title and axis labels
3. All data series names
4. All data points with their labels/values
5. Any notable trend or pattern

Return JSON:
{
  "chart_type": str,
  "title": str or null,
  "x_axis_label": str or null,
  "y_axis_label": str or null,
  "data_series": [
    {"name": str, "values": [{"label": str, "value": number}]}
  ],
  "key_insight": str
}

If exact values are not readable, provide best estimates with a note.
'''

print(chart_prompt)

Pemeriksaan Singkat

Saat mentranskripsikan konten tulisan tangan dari gambar, pendekatan apa yang disarankan untuk kata-kata yang tidak terbaca?

OCR dan Analisis Dokumen — Poin-Poin Utama

LLM visi menyediakan analisis dokumen yang fleksibel dan melampaui pengenalan karakter:

  • Ekstraksi dasar: pertahankan jeda baris dan struktur paragraf; tentukan hal ini secara eksplisit
  • Tabel: gunakan format tabel markdown atau skema baris/header JSON untuk mempertahankan struktur
  • Tanda terima: gunakan skema khusus dengan bidang pedagang, item, dan total
  • Tulisan tangan: instruksikan penggunaan [ILLEGIBLE] untuk teks yang tidak terbaca dan [PARTIAL] untuk teks yang terbaca sebagian — jangan pernah menebak
  • Formulir: petakan pasangan label-ke-nilai; sertakan status terisi/belum terisi untuk setiap bidang
  • Klasifikasikan jenis dokumen terlebih dahulu, lalu terapkan skema ekstraksi yang sesuai
  • Validasi data yang diekstrak secara terprogram: bidang wajib, jenis numerik, format tanggal, pemeriksaan perhitungan
  • Gambar berkualitas rendah: ekstraksi yang berhati-hati lebih baik daripada halusinasi yang meyakinkan
Gratis untuk memulai

Belajar AI Prompt Engineering dengan tutor AI — gratis

Tulis dan jalankan kode asli di browser kamu, dapatkan bantuan instan dari tutor AI 24/7, dan lanjutkan di mana kamu tinggalkan di web atau aplikasi.

Kursus
53
Pelajaran
199

Pertanyaan yang Sering Diajukan

Apakah pelajaran “Perintah OCR dan Analisis Dokumen” gratis?

Ya — teks lengkap “Perintah OCR dan Analisis Dokumen” gratis dibaca di sini di web. Untuk praktiknya secara interaktif (editor kode bawaan dan tutor AI 24/7) dan buka sisa kursus AI Prompt Engineering, upgrade ke CoddyKit PRO. Kursus AI Prompt Engineering mencakup 4 pelajaran total.

Apa yang akan aku pelajari di “Perintah OCR dan Analisis Dokumen”?

Ekstrak teks, tabel, dan struktur dari gambar dokumen. Kamu berlatih AI Prompt Engineering dengan kode praktik yang langsung kamu jalankan di browser, dan tutor AI 24/7 menjawab pertanyaanmu saat kamu mengerjakan pelajaran ini.

Apakah aku perlu pengalaman untuk memulai AI Prompt Engineering?

Tidak diperlukan pengalaman sebelumnya. AI Prompt Engineering di CoddyKit dirancang untuk pemula hingga pelajar tingkat lanjut, jadi kamu bisa memulai di sini atau dari awal dan belajar sesuai kecepatan kamu sendiri. Ini adalah pelajaran 4 dari 4.

Berapa lama pelajaran “Perintah OCR dan Analisis Dokumen” memakan waktu?

Sebagian besar pelajaran CoddyKit memakan waktu sekitar 5–10 menit. Setiap pelajaran ringkas dan interaktif, jadi kamu membuat kemajuan stabil dan melanjutkan dari tempat kamu tinggalkan di web dan aplikasi.

Bisakah aku menulis dan menjalankan kode dalam pelajaran AI Prompt Engineering ini?

Ya. Setiap pelajaran AI Prompt Engineering menyertakan editor kode bawaan, jadi kamu menulis dan menjalankan kode nyata langsung di browser dan mendapatkan umpan balik AI instan — tidak diperlukan penyiapan lokal.

Semua pelajaran dalam kursus ini

  1. Perintah Deskripsi dan Pemberian Keterangan Gambar
  2. Penjawaban Pertanyaan Visual
  3. Perintah Perbandingan Banyak Gambar
  4. Perintah OCR dan Analisis Dokumen
← Kembali ke AI Prompt Engineering