Cos'è il crawl budget
Il crawl budget è il numero di pagine che Googlebot — il robot di Google che esplora il web — è disposto a scansionare sul tuo sito in un determinato arco di tempo. Non è un numero fisso e universale: dipende dall'autorità del sito, dalla velocità del server e dalla qualità complessiva dei contenuti. Se il tuo sito ha molte più pagine rispetto a quelle che Google è disposto a visitare, alcune potrebbero non essere mai indicizzate.
Perché esiste un limite
Google ha risorse di scansione limitate e deve distribuirle tra miliardi di pagine web. Assegna un budget di crawl a ciascun sito in base a due fattori principali: la crawl rate limit (quante richieste il server riesce a gestire senza rallentarsi) e la crawl demand (quanto Google ritiene preziose e aggiornate le tue pagine). Un sito lento o con molti errori consuma il budget senza portare benefici reali.
Cosa influenza il crawl budget
- Dimensione del sito: un sito con migliaia di pagine ha più probabilità di incontrare problemi di crawl budget rispetto a uno con cento pagine.
- Velocità del server: tempi di risposta lenti spingono Googlebot a rallentare la scansione per non sovraccaricare il server.
- Contenuto duplicato: pagine quasi identiche (generate da parametri URL, sessioni, filtri di categoria) sprecano quote preziose di scansione.
- Errori 4xx e 5xx: pagine che restituiscono errori costringono Googlebot a consumare budget su URL inutili.
- Sitemap XML: una sitemap aggiornata e accurata aiuta Google a prioritizzare le pagine più importanti.
È un problema per le PMI?
Per un sito PMI di piccole dimensioni (meno di mille pagine), il crawl budget raramente è un problema critico. Diventa rilevante quando il sito cresce con categorie di prodotti, blog esteso, filtri di e-commerce o quando si generano molti URL con parametri di tracciamento. In questi casi, una cattiva gestione può lasciare fuori dall'indice le pagine più importanti.
Come ottimizzare il crawl budget
- Blocca con robots.txt le pagine inutili: aree di amministrazione, pagine di ricerca interna, URL con parametri di sessione.
- Usa il tag canonical per indicare la versione preferita delle pagine duplicate.
- Mantieni la sitemap XML aggiornata e sincronizzata con i contenuti effettivamente pubblicati.
- Migliora la velocità del server: hosting performante e caching efficace aumentano la crawl rate consentita.
- Correggi i link interni che puntano a pagine 404 o reindirizzate in catena.
Domande frequenti
Come posso sapere quante pagine scansiona Google sul mio sito?
Google Search Console mostra le statistiche di scansione nella sezione «Impostazioni» → «Statistiche di scansione». Puoi vedere quante pagine vengono visitate al giorno e quali risposte restituiscono.
Il crawl budget influenza direttamente il ranking?
Non direttamente, ma se una pagina non viene scansionata non può essere indicizzata, e se non è indicizzata non può posizionarsi. L'ottimizzazione del crawl budget è quindi un prerequisito per la visibilità organica.
Per approfondire la SEO tecnica del tuo sito, leggi la nostra guida: SEO tecnica: guida completa per PMI.