Un sitemap elenca gli URL di un sito in un file strutturato destinato ai motori di ricerca. Sapere che esiste non è sufficiente: la vera domanda è misurare ciò che cambia concretamente tra un sito che dichiara un sitemap pulito e un sito che ne fa a meno, in particolare sulla velocità di indicizzazione e sulla copertura delle pagine nei risultati di Google.
Sitemap XML, sitemap HTML e crawl budget: cosa modifica ogni formato
| Criterio | Sitemap XML | Sitemap HTML | Nessun sitemap |
|---|---|---|---|
| Destinatario principale | Robot di indicizzazione (Googlebot, Bingbot) | Visitatori umani | – |
| Formato | File .xml nella radice del sito | Pagina web classica con link cliccabili | – |
| Impatto sull’indicizzazione | Segnala tutti gli URL da esplorare, con data dell’ultima modifica | Nessun effetto diretto sui robot | I robot scoprono le pagine solo tramite il linking interno e i link esterni |
| Impatto sulla navigazione utente | Nessuno (file illeggibile per un umano) | Pianta del sito consultabile, riduce il numero di clic | Navigazione limitata al menu e al linking interno |
| Effetto sul crawl budget | Orientano i robot verso le pagine prioritarie | Trascurabile | I robot possono sprecare crawl budget su pagine secondarie |
Il sitemap XML agisce sull’indicizzazione, il sitemap HTML agisce sull’esperienza di navigazione. I due formati rispondono a esigenze distinte, e combinarli copre entrambi gli aspetti: SEO tecnico ed ergonomia.
Per osservare come questi due formati coesistono su un sito reale, la pagina sitemap di The Web Brains illustra un layout orientato alla navigazione che completa il file XML dichiarato ai motori.
Dichiarazione del sitemap dopo la fine del ping Google: robots.txt e Search Console
Da fine 2023, Google non supporta più gli endpoint di ping del sitemap. Inviare una richiesta HTTP a Google per segnalare l’aggiornamento di un sitemap non produce più alcun effetto. Questa rimozione ha reso obsoleti diversi plugin e script automatizzati che si basavano su questo meccanismo.
Le due sole metodologie riconosciute da Google per dichiarare un sitemap sono ora:
- La sottomissione tramite il rapporto Sitemaps di Google Search Console, che consente anche di verificare gli errori di lettura e il numero di URL indicizzati rispetto al numero di URL sottomesse.
- La direttiva Sitemap: nel file robots.txt, posizionata nella radice del sito. Questa riga indica ai robot l’esatta posizione del file XML senza passare attraverso un’interfaccia.
Un sito che continua a pingare Google senza utilizzare una di queste due metodologie corre il rischio che le sue nuove pagine rimangano invisibili più a lungo.

Recrawl su larga scala: il sitemap come leva per i siti voluminosi
La documentazione Google Search Central aggiornata a fine 2025 precisa un punto che la maggior parte delle guide trascura. Per i siti con un grande volume di URL, la sottomissione di un sitemap pulito è il metodo privilegiato per richiedere un recrawl su larga scala. Lo strumento di ispezione URL in Search Console funziona caso per caso, il che lo rende impraticabile quando diverse centinaia di pagine sono state modificate simultaneamente.
Un sitemap “pulito” significa qui un file che contiene solo gli URL canonici, senza pagine con errore 404, senza reindirizzamenti e senza URL bloccati da robots.txt. Ogni URL inutile nel sitemap diluisce il segnale inviato ai robot e consuma crawl budget senza ritorno.
Tag lastmod e priorità reale degli URL
Il tag lastmod nel sitemap XML indica la data dell’ultima modifica di una pagina. I robot di Google utilizzano queste informazioni per decidere quali pagine recrawlare con priorità. Tuttavia, se la data non riflette una modifica reale del contenuto, Googlebot finisce per ignorare il segnale.
Il tag priority, spesso configurato per impostazione predefinita nei plugin SEO, non ha alcun effetto sul comportamento di Google. Non è più preso in considerazione da diversi anni. Gerarchizzarlo manualmente nel file XML non cambia nulla nel crawl.
Errori di sitemap che frenano il SEO invece di migliorarlo
Un sitemap mal configurato può produrre l’effetto opposto rispetto a quello desiderato. Tre errori tecnici ricorrono frequentemente negli audit SEO.
- Includere URL che restituiscono un codice HTTP 404 o 410. I robot li crawlano, constatano l’errore e il rapporto di copertura in Search Console accumula avvertimenti che nascondono i veri problemi.
- Elencare URL non canonici (pagine con parametri di ordinamento, versioni con e senza slash finale, versioni HTTP e HTTPS). Il sitemap deve riflettere esattamente la versione canonica di ogni pagina.
- Non aggiornare mai il file dopo un redesign o una rimozione di contenuto. Un sitemap obsoleto invia i robot verso pagine che non esistono più, il che spreca il crawl budget e ritarda l’indicizzazione delle nuove pagine.
Controllare regolarmente il rapporto Sitemaps in Google Search Console consente di rilevare queste incoerenze. Il rapporto mostra il numero di URL sottomesse, il numero di URL indicizzate e segnala gli errori di lettura del file.

Sitemap HTML e navigazione utente: un complemento sottovalutato
Il sitemap HTML non modifica il comportamento dei robot di indicizzazione. Il suo ruolo è diverso: offre ai visitatori una vista ad albero dell’intero sito, accessibile con un clic dal piè di pagina.
Su un sito con diverse decine di pagine, questa vista d’insieme riduce il numero di clic necessari per raggiungere una pagina profonda. Per i siti e-commerce o i portali editoriali, il sitemap HTML diventa un collegamento a categorie o articoli che il menu principale non mette in evidenza.
Il beneficio indiretto per il SEO esiste: ogni link del sitemap HTML rinforza il linking interno e distribuisce PageRank verso le pagine profonde. Non è un sostituto del sitemap XML, ma un complemento che serve sia all’utente che alla struttura di link del sito.
Il file XML dichiara gli URL ai robot, il sitemap HTML li rende accessibili ai visitatori, e il robots.txt punta al file XML. Questi tre elementi formano un dispositivo tecnico coerente. Rimuovere uno di essi equivale a lasciare un angolo morto, sia per i motori di ricerca, sia per gli utenti che cercano una pagina senza passare per il menu.



