0Pricing
Web Scraping & Bots · Leçon

Extraire des données de tableaux HTML

Apprenez à analyser de manière fiable les données tabulaires HTML, à gérer rowspan et colspan et à convertir des tableaux désordonnés en lignes structurées et propres.

Extraire des données de tableaux HTML est une leçon Web Scraping & Bots gratuite sur CoddyKit. Ceci est la leçon 4 sur 4. Tu peux lire la leçon complète ci-dessous gratuitement — puis la pratiquer en direct dans le navigateur avec un éditeur de code intégré et un tuteur IA 24/7. Elle fait partie du parcours d'apprentissage Web Scraping & Bots, et ta progression se synchronise sur le web et l'application CoddyKit. Le cours Web Scraping & Bots comprend 4 leçons au total.

Certaines parties de cette leçon n'ont pas encore été traduites et s'affichent en anglais.

Why Tables Are Tricky

HTML <table> elements look simple but are one of the most error-prone targets in scraping. Rows can merge cells, headers can repeat, and layout tables masquerade as data tables.

  • Data tables hold real records you want.
  • Layout tables only control visual structure.

This lesson focuses on extracting clean rows from genuine data tables.

Anatomy of a Table

A table is built from a few key tags:

  • <thead> / <tbody> group header and body rows.
  • <tr> is a single row.
  • <th> is a header cell, <td> is a data cell.

Knowing these landmarks lets you target rows precisely instead of grabbing raw text.

<table>
  <thead><tr><th>Name</th><th>Price</th></tr></thead>
  <tbody>
    <tr><td>Widget</td><td>$9.99</td></tr>
    <tr><td>Gadget</td><td>$14.50</td></tr>
  </tbody>
</table>

Selecting Rows

With a parser like BeautifulSoup you first find the table, then iterate its rows. Always scope your selection to tbody when present so the header row does not contaminate your data.

from bs4 import BeautifulSoup

soup = BeautifulSoup(html, 'html.parser')
table = soup.select_one('table')
rows = table.select('tbody tr')
print(len(rows), 'data rows found')

Reading Cell Values

For each row, collect the cell text. Use get_text(strip=True) to drop surrounding whitespace and nested tag noise.

for row in rows:
    cells = [c.get_text(strip=True) for c in row.select('td')]
    print(cells)

Mapping Headers to Values

Raw lists of cells are fragile. Pair each value with its column header so your output is self-describing and column-order changes do not break downstream code.

headers = [h.get_text(strip=True) for h in table.select('thead th')]
records = []
for row in rows:
    cells = [c.get_text(strip=True) for c in row.select('td')]
    records.append(dict(zip(headers, cells)))
print(records[0])

Handling colspan

A cell with colspan="2" visually spans two columns. If you ignore it, every following cell shifts left and misaligns with its header. Read the attribute and pad accordingly.

span = int(cell.get('colspan', 1))
values.extend([text] * span)

Handling rowspan

rowspan is harder: a cell carries down into rows below it. Track a buffer of pending values keyed by column index and inject them into subsequent rows until the span is exhausted.

pending = {}
for r_idx, row in enumerate(rows):
    col = 0
    for cell in row.select('td'):
        while col in pending and pending[col][1] > 0:
            col += 1
        rs = int(cell.get('rowspan', 1))
        if rs > 1:
            pending[col] = [cell.get_text(strip=True), rs]
        col += 1

Cleaning Extracted Values

Cells often contain currency symbols, thousands separators, or stray unicode. Normalize before storing:

  • Strip $, , and whitespace.
  • Cast numeric strings to numbers.
  • Replace non-breaking spaces.
def clean_price(text):
    text = text.replace('$', '').replace(',', '').strip()
    return float(text) if text else None

print(clean_price('$1,299.00'))

Pandas read_html Shortcut

For well-formed tables, pandas.read_html parses every table on a page into DataFrames in one call. Use it for quick wins, then fall back to manual parsing for tables with merged cells.

import pandas as pd
tables = pd.read_html(html)
df = tables[0]
print(df.head())

Detecting Layout vs Data Tables

Before extracting, confirm the table holds real data. Heuristics:

  • Has a <thead> or repeated <th> cells.
  • Multiple rows with consistent column counts.
  • No nested tables used purely for spacing.

Skip tables that fail these checks.

Putting It Together

A robust table extractor: locate the data table, read headers, walk rows while resolving spans, clean each value, and emit a list of dictionaries. This pipeline survives most real-world markup.

def extract_table(table):
    headers = [h.get_text(strip=True) for h in table.select('thead th')]
    out = []
    for row in table.select('tbody tr'):
        vals = [c.get_text(strip=True) for c in row.select('td')]
        out.append(dict(zip(headers, vals)))
    return out

Quick Check

Test your understanding of table parsing.

Recap

You learned to extract clean records from HTML tables: scope to tbody, map headers to values, resolve colspan and rowspan, clean cell text, and use pandas.read_html for simple cases.

With these skills you can turn even messy tabular markup into reliable structured data.

Questions Fréquemment Posées

La leçon « Extraire des données de tableaux HTML » est-elle gratuite ?

Oui — le texte complet de « Extraire des données de tableaux HTML » est gratuit à lire ici sur le web. Pour la pratiquer de manière interactive (un éditeur de code intégré et un tuteur IA 24/7) et déverrouiller le reste du cours Web Scraping & Bots, passe à CoddyKit PRO. Le cours Web Scraping & Bots comprend 4 leçons au total.

Qu'est-ce que j'apprendrai dans « Extraire des données de tableaux HTML » ?

Apprenez à analyser de manière fiable les données tabulaires HTML, à gérer rowspan et colspan et à convertir des tableaux désordonnés en lignes structurées et propres. Tu pratiques Web Scraping & Bots avec du code pratique que tu exécutes directement dans le navigateur, et un tuteur IA 24/7 répond à tes questions au fur et à mesure que tu avances dans la leçon.

Dois-je avoir de l'expérience pour commencer Web Scraping & Bots ?

Aucune expérience préalable n'est requise. Web Scraping & Bots sur CoddyKit est structuré pour les débutants jusqu'aux apprenants avancés, donc tu peux commencer ici ou depuis le début et avancer à ton rythme. Ceci est la leçon 4 sur 4.

Combien de temps prend la leçon « Extraire des données de tableaux HTML » ?

La plupart des leçons CoddyKit prennent environ 5–10 minutes. Chacune est courte et interactive, tu progresses régulièrement et tu repiques exactement où tu t'es arrêté sur le web et l'app.

Peux-tu écrire et exécuter du code dans cette leçon Web Scraping & Bots ?

Oui. Chaque leçon Web Scraping & Bots inclut un éditeur de code intégré, tu écris et exécutes du vrai code directement dans ton navigateur et tu reçois des retours IA instantanés — aucune configuration locale requise.

Toutes les leçons de ce cours

  1. Parcourir des structures HTML complexes
  2. Sélecteurs CSS pour une extraction précise
  3. XPath pour une sélection robuste
  4. Extraire des données de tableaux HTML
← Retour à Web Scraping & Bots