HTML Academy · Lezione

URL canonici e meta robots

Controllare il crawling ed evitare contenuti duplicati con i meta tag

Lezione 3 di 413 passaggi

URL canonici e meta robots è una lezione HTML Academy gratuita su CoddyKit. Questa è la lezione 3 di 4. Puoi leggere la lezione completa qui gratuitamente — poi esercitati direttamente nel browser con un editor di codice integrato e un tutor IA disponibile 24/7. Fa parte del percorso di apprendimento HTML Academy, e i tuoi progressi si sincronizzano tra il web e l'app CoddyKit. Il corso HTML Academy include 4 lezioni in totale.

Il problema dei contenuti duplicati

I motori di ricerca possono trovare la pagina a più URL:

  • http://example.com/page
  • https://example.com/page
  • https://www.example.com/page
  • https://example.com/page/ (slash finale)
  • https://example.com/page?utm_source=newsletter

Google deve decidere quale URL indicizzare e potrebbe penalizzare i contenuti duplicati.

Il tag link canonical

Indichi ai motori di ricerca l'URL preferito con rel="canonical":

<head>
  <!-- This is the canonical URL for this content: -->
  <link rel="canonical" href="https://example.com/blog/html5-guide">
</head>
<!-- No matter which URL the page is accessed from,
     this tag signals to Google which URL to index -->
<!-- Link equity is consolidated at the canonical URL -->

Regole per l'URL canonical

Buone pratiche per l'URL canonical:

  • Utilizzi l'URL assoluto completo (incluso il protocollo)
  • Utilizzi HTTPS se il sito lo supporta
  • Sia coerente: utilizzi sempre lo slash finale oppure non lo utilizzi mai
  • Ogni pagina dovrebbe avere un tag canonical, anche quando l'URL è quello della pagina stessa
<link rel="canonical" href="https://example.com/blog/html5-guide">
<!-- NOT: -->
<!-- <link rel="canonical" href="/blog/html5-guide"> relative = bad -->
<!-- <link rel="canonical" href="http://..."> HTTP on HTTPS site = bad -->

Paginazione e canonical

Per i contenuti paginati, canonical può puntare alla prima pagina o alla pagina stessa:

<!-- Page 2 of a blog listing: -->
<link rel="canonical" href="https://example.com/blog?page=2">
<!-- Or: consolidate all pages to the first -->
<link rel="canonical" href="https://example.com/blog">
<!-- Also useful: rel="prev" and rel="next" for paginated series -->

Valori di meta robots

Controlli il comportamento dei motori di ricerca per ogni pagina:

<meta name="robots" content="index, follow">
<!-- Default: include in index and follow links -->

<meta name="robots" content="noindex">
<!-- Don't index this page -->

<meta name="robots" content="nofollow">
<!-- Don't follow links on this page -->

<meta name="robots" content="noindex, nofollow">
<!-- Don't index AND don't follow -->

<meta name="robots" content="noarchive">
<!-- Don't show cached version in search results -->

Direttive specifiche per Googlebot

Indirizzi crawler specifici con direttive specifiche:

<meta name="googlebot" content="noindex">
<!-- Only affects Google's crawler -->

<meta name="bingbot" content="noindex">
<!-- Only affects Bing's crawler -->

<!-- Other values: -->
<meta name="robots" content="max-snippet:50">
<!-- Limit snippet length in search results to 50 characters -->

<meta name="robots" content="max-image-preview:large">
<!-- Allow full-size image previews in Google results -->

Intestazione HTTP X-Robots-Tag

Canonical e robots possono essere impostati anche tramite intestazioni HTTP (a livello di server):

# Apache .htaccess:
Header add Link "<https://example.com/page>; rel=canonical"
Header add X-Robots-Tag "noindex"

# This is more powerful because it applies to non-HTML files too
# (PDFs, images, etc.) which can't have meta tags

robots.txt e meta robots

Due strumenti per controllare i crawler, con scopi diversi:

  • robots.txt — controlla quali pagine i crawler possono accedere (controllo degli accessi)
  • meta robots — controlla cosa fanno i crawler con le pagine a cui hanno avuto accesso (controllo dell'indicizzazione)

Una pagina non consentita in robots.txt può comunque essere indicizzata se è collegata da un'altra pagina. Una pagina con noindex non verrà certamente indicizzata.

Sitemap e canonical

La sitemap dovrebbe elencare solo gli URL canonical:

<!-- sitemap.xml should list canonical URLs only: -->
<!-- https://example.com/blog/html5-guide (canonical) -->
<!-- NOT: https://www.example.com/blog/html5-guide -->
<!-- NOT: https://example.com/blog/html5-guide/ (trailing slash variant) -->

Canonical autoreferenziale

Ogni pagina dovrebbe avere un canonical autoreferenziale, anche la pagina principale:

<!-- On https://example.com/about (the canonical URL itself): -->
<link rel="canonical" href="https://example.com/about">
<!-- This confirms: this IS the canonical URL -->
<!-- Prevents issues if the page is embedded in an iframe or scraped -->

Canonical nell'e-commerce

Strutture canonical per prodotti con varianti nell'e-commerce:

<!-- Product page with color filter: -->
<!-- URL: /products/widget?color=blue -->
<link rel="canonical" href="https://example.com/products/widget">
<!-- All color variants point to the main product page -->
<!-- Avoids duplicate content penalty for parameter variants -->

Verifica rapida

Quale dovrebbe essere il valore di href di un tag link canonical?

Riepilogo: canonical e robots

Elementi essenziali di canonical e robots:

  • <link rel="canonical" href="full-url"> — dichiara l'URL preferito
  • Utilizzi URL assoluti nel canonical, sempre in HTTPS
  • meta robots noindex — esclude dall'indice di ricerca
  • meta robots nofollow — non segue i link
  • robots.txt = controllo degli accessi; meta robots = controllo dell'indicizzazione
Gratis per iniziare

Impara HTML con un tutor IA — gratis

Scrivi ed esegui vero codice nel tuo browser, ricevi aiuto istantaneo da un tutor IA disponibile 24/7, e riprendi da dove hai lasciato sul web o nell'app.

Corsi
40
Lezioni
159

Domande Frequenti

La lezione «URL canonici e meta robots» è gratuita?

Sì — il testo completo di «URL canonici e meta robots» è gratuito qui sul web. Per esercitarvi in modo interattivo (un editor di codice integrato e un tutor IA 24/7) e sbloccare il resto del corso HTML Academy, passa a CoddyKit PRO. Il corso HTML Academy include 4 lezioni in totale.

Cosa imparerò in «URL canonici e meta robots»?

Controllare il crawling ed evitare contenuti duplicati con i meta tag Eserciti HTML Academy con codice pratico che esegui direttamente nel browser, e un tutor IA 24/7 risponde alle tue domande mentre lavori sulla lezione.

Ho bisogno di esperienza per iniziare HTML Academy?

Non è richiesta alcuna esperienza precedente. HTML Academy su CoddyKit è strutturato per principianti e studenti avanzati, quindi puoi iniziare da qui o dall'inizio e procedere al tuo ritmo. Questa è la lezione 3 di 4.

Quanto tempo richiede la lezione «URL canonici e meta robots»?

La maggior parte delle lezioni CoddyKit richiede circa 5–10 minuti. Ogni lezione è breve e interattiva, quindi fai progressi costanti e riprendi esattamente da dove hai lasciato su web e app.

Posso scrivere ed eseguire codice in questa lezione HTML Academy?

Sì. Ogni lezione HTML Academy include un editor di codice integrato, quindi scrivi ed esegui codice reale direttamente nel tuo browser e ricevi feedback istantaneo dall'IA — nessuna configurazione locale necessaria.

Tutte le lezioni di questo corso

  1. title e il suo ruolo nella SEO
  2. meta charset viewport author e description
  3. URL canonici e meta robots
  4. Favicon e Apple Touch Icon
← Torna a HTML Academy