0Pricing
AI Agents · Урок

OCR для отсканированных документов

Tesseract через pytesseract, предварительная обработка изображений и повышение точности.

«OCR для отсканированных документов» — бесплатный урок AI Agents на CoddyKit. Это урок 2 из 4. Ты можешь прочитать весь урок бесплатно ниже — а потом практиковать его прямо в браузере с встроенным редактором кода и ИИ-репетитором 24/7. Это часть пути обучения AI Agents, и твой прогресс синхронизируется между веб-версией и приложением CoddyKit. Курс AI Agents содержит 4 уроков всего.

Когда необходимо распознавание текста

Не все документы представляют собой изначально цифровые файлы PDF. Для отсканированных документов, фотографий текста, рукописных заметок и PDF на основе изображений требуется оптическое распознавание символов (OCR) для извлечения текста.

OCR преобразует изображения текста, состоящие из пикселей, в распознаваемые компьютером символы. Две ведущие библиотеки Python: pytesseract (Google Tesseract) и EasyOCR (глубокое обучение, поддержка многих языков).

Основы pytesseract

pytesseract — это оболочка Python для движка OCR Tesseract от Google. Сначала установите Tesseract (на уровне ОС), затем выполните pip install pytesseract Pillow.

import pytesseract
from PIL import Image

# Simple text extraction
image = Image.open('scanned_document.png')
text = pytesseract.image_to_string(image)
print(text)

# Specify language (default: English)
text_fr = pytesseract.image_to_string(
    Image.open('french_doc.png'),
    lang='fra'
)

# Get detailed output with bounding boxes
data = pytesseract.image_to_data(
    image,
    output_type=pytesseract.Output.DICT
)
for i, word in enumerate(data['text']):
    if word.strip():
        conf = data['conf'][i]
        print(f'Word: {word!r:20} Confidence: {conf}')

Предварительная обработка изображений: оттенки серого

Точность OCR во многом зависит от качества изображения. Первый шаг предварительной обработки — преобразование в оттенки серого: цвет добавляет шум, не помогая распознавать символы.

Для предварительной обработки используйте Pillow или OpenCV. Оттенки серого уменьшают шум и улучшают обнаружение границ символов в Tesseract.

from PIL import Image, ImageOps
import numpy as np

def preprocess_grayscale(image_path):
    img = Image.open(image_path)

    # Convert to grayscale
    img = img.convert('L')  # 'L' = 8-bit grayscale

    # Optionally resize for better OCR (Tesseract works best at ~300 DPI)
    # Scale up small images
    width, height = img.size
    if width < 800:
        scale = 800 / width
        new_size = (int(width * scale), int(height * scale))
        img = img.resize(new_size, Image.LANCZOS)

    return img

img = preprocess_grayscale('scan.jpg')
text = pytesseract.image_to_string(img)
print(text[:300])

Предварительная обработка изображений: пороговая обработка

Пороговая обработка преобразует изображение в оттенках серого в чистое чёрно-белое изображение. Это устраняет серые тени, неравномерное освещение и фоновый шум, благодаря чему текст становится чётко различимым для OCR.

from PIL import Image, ImageFilter
import numpy as np

def apply_threshold(img):
    # Method 1: Simple fixed threshold
    img_array = np.array(img)
    threshold = 128
    binary = np.where(img_array > threshold, 255, 0).astype(np.uint8)
    return Image.fromarray(binary)

def adaptive_threshold(img):
    # Method 2: Otsu's method via OpenCV (better for uneven lighting)
    try:
        import cv2
        img_array = np.array(img)
        _, binary = cv2.threshold(
            img_array, 0, 255,
            cv2.THRESH_BINARY + cv2.THRESH_OTSU
        )
        return Image.fromarray(binary)
    except ImportError:
        return apply_threshold(img)

img = preprocess_grayscale('uneven_scan.png')
img_clean = adaptive_threshold(img)
text = pytesseract.image_to_string(img_clean)
print(text[:300])

Предварительная обработка изображений: устранение перекоса

Отсканированные документы часто немного повёрнуты. Даже наклон на 2 градуса значительно снижает точность OCR. Устранение перекоса обнаруживает и исправляет угол поворота перед передачей изображения движку OCR.

import numpy as np
from PIL import Image

def deskew(img):
    try:
        import cv2
        img_array = np.array(img)

        # Find rotation angle using Hough line transform
        edges = cv2.Canny(img_array, 50, 150, apertureSize=3)
        lines = cv2.HoughLines(edges, 1, np.pi/180, threshold=100)

        if lines is None:
            return img  # no lines detected, return unchanged

        angles = []
        for line in lines:
            rho, theta = line[0]
            angle = np.degrees(theta) - 90
            if -45 < angle < 45:
                angles.append(angle)

        if not angles:
            return img

        median_angle = np.median(angles)
        if abs(median_angle) > 0.5:  # only deskew if significant tilt
            print(f'Deskewing by {median_angle:.2f} degrees')
            return img.rotate(-median_angle, expand=True, fillcolor=255)
        return img
    except ImportError:
        return img  # OpenCV not available — skip deskew

Языковые параметры Tesseract

Tesseract поддерживает более 100 языков. Загружайте языковые пакеты с помощью менеджера пакетов ОС. Для многоязычных документов указывайте несколько языков, разделяя их символом +.

import pytesseract
from PIL import Image

# List available languages
import subprocess
result = subprocess.run(['tesseract', '--list-langs'], capture_output=True, text=True)
print('Available languages:')
print(result.stdout)

# Single language
text_en = pytesseract.image_to_string(Image.open('doc.png'), lang='eng')

# Multiple languages (auto-detect best match)
text_multi = pytesseract.image_to_string(
    Image.open('doc.png'),
    lang='eng+fra+deu'  # English + French + German
)

# Tesseract config options for better accuracy
custom_config = r'--oem 3 --psm 6'  # OEM 3=LSTM, PSM 6=assume uniform block of text
text_tuned = pytesseract.image_to_string(
    Image.open('doc.png'),
    config=custom_config
)

EasyOCR: на основе глубокого обучения

EasyOCR использует модели глубокого обучения и превосходит Tesseract на изображениях низкого качества, при распознавании изогнутого текста и нелатинских письменностей. Установка на уровне ОС не требуется.

Установите библиотеку с помощью pip install easyocr. При первом запуске загружаются веса модели (около 200 МБ).

import easyocr

# Initialize reader (downloads model on first run)
reader = easyocr.Reader(
    ['en', 'tr'],  # list of languages
    gpu=False       # set True if CUDA available
)

# Read text from image
results = reader.readtext('scanned_page.png')

for (bbox, text, confidence) in results:
    print(f'Text: {text!r:30} Confidence: {confidence:.2f}')
    # bbox = [[x1,y1],[x2,y2],[x3,y3],[x4,y4]] (four corners)

# Get plain text only
text_only = ' '.join(result[1] for result in results)
print('Full text:', text_only[:300])

EasyOCR для многоязычных документов

EasyOCR хорошо обрабатывает документы со смешанными языками — это полезно для международных договоров, научных статей с подписями на нескольких языках и документов с техническими терминами в другой письменности.

import easyocr

# For Arabic-English mixed document
reader_ar = easyocr.Reader(['ar', 'en'], gpu=False)
results = reader_ar.readtext('arabic_contract.png')

# For CJK languages
reader_cjk = easyocr.Reader(['ch_sim', 'en'], gpu=False)  # Simplified Chinese + English
results_cjk = reader_cjk.readtext('chinese_report.png')

# Filter by confidence threshold
HIGH_CONFIDENCE = 0.7
def filter_confident_results(results, threshold=HIGH_CONFIDENCE):
    return [
        (bbox, text, conf)
        for bbox, text, conf in results
        if conf >= threshold
    ]

Полный конвейер предварительной обработки

Объедините все этапы предварительной обработки — преобразование в оттенки серого, пороговую обработку и устранение перекоса — в одну функцию конвейера. Запустите OCR для очищенного изображения и верните как текст, так и показатели уверенности.

import pytesseract
from PIL import Image

def ocr_pipeline(image_path, lang='eng', engine='tesseract'):
    print(f'Processing: {image_path}')

    # 1. Load
    img = Image.open(image_path)

    # 2. Preprocess
    img = img.convert('L')         # grayscale
    img = adaptive_threshold(img)  # binarize
    img = deskew(img)              # correct rotation

    # 3. OCR
    if engine == 'easyocr':
        reader = easyocr.Reader([lang], gpu=False)
        results = reader.readtext(image_path)
        text = ' '.join(r[1] for r in results if r[2] > 0.5)
    else:
        config = f'--oem 3 --psm 6 -l {lang}'
        text = pytesseract.image_to_string(img, config=config)

    # 4. Clean
    text = '\n'.join(
        line.strip() for line in text.splitlines()
        if line.strip()
    )
    return text

text = ocr_pipeline('invoice_scan.jpg')
print(text[:500])

Обработка PDF на основе изображений

Некоторые файлы PDF содержат отсканированные страницы, сохранённые как изображения внутри контейнера PDF. Обнаруживайте такие «графические PDF» и применяйте OCR к каждой странице, используя PyMuPDF для предварительного извлечения изображений.

import fitz
from PIL import Image
import io
import pytesseract

def is_image_pdf(doc):
    # Check if first page has very little extractable text
    text = doc[0].get_text().strip()
    return len(text) < 50

def ocr_pdf(filepath):
    doc = fitz.open(filepath)
    if not is_image_pdf(doc):
        # Native text — no OCR needed
        return '\n'.join(doc[i].get_text() for i in range(len(doc)))

    print('Image PDF detected — running OCR')
    all_text = []

    for page_num in range(len(doc)):
        page = doc[page_num]
        # Render page as image at 300 DPI
        mat = fitz.Matrix(300/72, 300/72)  # scale to 300 DPI
        pix = page.get_pixmap(matrix=mat)
        img = Image.open(io.BytesIO(pix.tobytes('png')))
        text = pytesseract.image_to_string(img)
        all_text.append(f'--- Page {page_num+1} ---\n{text}')

    doc.close()
    return '\n'.join(all_text)

Фильтрация по уверенности и постобработка

Результаты OCR содержат ошибки, особенно на изображениях низкого качества. Выполняйте постобработку текста: отфильтровывайте слова с низкой уверенностью, исправляйте распространённые ошибки OCR (0 вместо O, 1 вместо l) и нормализуйте пробелы.

import re

COMMON_OCR_ERRORS = {
    r'\b0([a-z])\b': r'O\1',
    r'\bl([0-9])\b': r'1\1',
    r'\|': 'I',
    r'  +': ' ',
}

def post_process_ocr(text):
    for pattern, replacement in COMMON_OCR_ERRORS.items():
        text = re.sub(pattern, replacement, text)
    lines = [line.strip() for line in text.splitlines()]
    return '\n'.join(line for line in lines if line)

def high_confidence_ocr(words_with_conf, min_confidence=60):
    words = [w for w, conf in words_with_conf if w.strip() and conf >= min_confidence]
    return post_process_ocr(' '.join(words))

fake_ocr_output = [('0range', 90), ('|s', 40), ('l5', 85), ('good', 95)]
print(high_confidence_ocr(fake_ocr_output))

Проверка знаний

Какова цель применения пороговой обработки (бинаризации) к изображению перед OCR?

Итоги: OCR для отсканированных документов

OCR преобразует отсканированные изображения в распознаваемый компьютером текст. pytesseract предоставляет оболочку для Google Tesseract — быстрого и зрелого решения с более чем 100 языковыми пакетами. EasyOCR использует глубокое обучение и лучше обрабатывает изображения низкого качества и многоязычный текст.

Всегда выполняйте предварительную обработку: преобразуйте изображение в оттенки серого, применяйте пороговую обработку Отсу для бинаризации и устраняйте перекос, чтобы исправить поворот. Для PDF на основе изображений преобразуйте страницы в изображения с высоким DPI с помощью PyMuPDF, а затем запустите OCR. Отфильтровывайте результаты по порогу уверенности, чтобы исключить шум.

Часто задаваемые вопросы

Урок «OCR для отсканированных документов» бесплатный?

Да — полный текст урока «OCR для отсканированных документов» бесплатно доступен здесь в веб-версии. Чтобы практиковать его интерактивно (встроенный редактор кода и ИИ-репетитор 24/7) и разблокировать остальной курс AI Agents, подпишись на CoddyKit PRO. Курс AI Agents содержит 4 уроков всего.

Чему я научусь в уроке «OCR для отсканированных документов»?

Tesseract через pytesseract, предварительная обработка изображений и повышение точности. Ты практикуешь AI Agents с помощью реального кода, который запускаешь прямо в браузере, и ИИ-репетитор 24/7 отвечает на твои вопросы во время урока.

Нужен ли мне опыт, чтобы начать AI Agents?

Предыдущий опыт не требуется. AI Agents на CoddyKit структурирован для всех уровней — от новичков до продвинутых, поэтому ты можешь начать отсюда или с самого начала и учиться в своем темпе. Это урок 2 из 4.

Сколько времени занимает урок «OCR для отсканированных документов»?

Большинство уроков CoddyKit занимают около 5–10 минут. Каждый из них компактный и интерактивный, поэтому ты постоянно делаешь прогресс и продолжаешь с того же места в веб-версии и приложении.

Можно ли писать и запускать код в этом уроке AI Agents?

Да. Каждый урок AI Agents включает встроенный редактор кода, поэтому ты пишешь и запускаешь реальный код прямо в браузере и получаешь моментальную обратную связь от AI — локальная установка не требуется.

Все уроки этого курса

  1. Разбор PDF с помощью PyMuPDF и pdfplumber
  2. OCR для отсканированных документов
  3. Агенты для вопросов и ответов по нескольким документам
  4. Классификация и маршрутизация документов
← Назад к AI Agents