Crawl budget: cum controlezi ce indexează Google pe site-ul tău

Crawl budget: cum controlezi ce indexează Google pe site-ul tău

Crawl budget este un concept fundamental în SEO tehnic pentru site-urile de dimensiuni medii și mari, dar este adesea ignorat pe site-urile mici și frecvent înțeles greșit pe toate tipurile de site-uri. Pe scurt: Googlebot are o capacitate limitată de crawlare per site, determinată de autoritatea domeniului și de comportamentul serverului. Dacă site-ul are mii de URL-uri inutile, Googlebot le consumă pe acelea în detrimentul paginilor importante.

Problema este relevantă în mod special pentru magazine WooCommerce cu URL-uri de filtrare, site-uri cu paginare extinsă, WordPress-uri cu tag-uri și categorii neoptimizte sau orice site care a acumulat URL-uri inutile de-a lungul timpului.

Crawl budget: cum controlezi ce indexează Google pe site-ul tău

Google definește crawl budget prin doi factori: crawl rate limit (frecvența maximă cu care Googlebot accesează site-ul fără a-l suprasolicita) și crawl demand (cât de mult vrea Google să crawleze site-ul, determinat de popularitate și actualizare frecventă). Crawl budget-ul efectiv este produsul acestor doi factori.

Ce irosește crawl budget-ul

Înainte de a optimiza, identifică sursele de irosire. Cel mai frecvent pe site-urile WordPress și WooCommerce:

  • URL-uri de filtrare și sortare. Parametrii ?orderby=price, ?filter_color=blue sau ?paged=3 generează URL-uri unice pentru fiecare combinație. Un magazin cu 10 filtre poate genera mii de URL-uri din câteva zeci de produse.
  • Pagini de arhivă WordPress. Arhive de tag-uri, arhive de autor pe bloguri multi-autor, arhive de dată (/2019/03/) sunt rareori valoroase din perspectiva SEO dar consumă crawl budget.
  • Pagini de coș, cont și checkout WooCommerce. Acestea nu trebuie indexate niciodată și consumă inutil din crawl budget dacă nu sunt excluse.
  • URL-uri duplicate. Variante cu și fără www, cu și fără trailing slash, versiunile HTTP și HTTPS neconsolidate.
  • Pagini de paginare profundă. /category/produse/page/500/ are valoare SEO zero și consumă crawl budget.

Instrumentele de control al crawl budget

Există trei instrumente principale pentru a controla ce crawlează și indexează Google: robots.txt (blochează crawlarea), meta noindex (permite crawlarea dar blochează indexarea) și tag canonical (indică versiunea preferată). Fiecare are cazul său de utilizare corect.

Robots.txt: blocarea crawlării

Robots.txt blochează Googlebot de la accesarea URL-urilor specificate. Folosit corect pentru URL-urile care nu trebuie accesate deloc: panoul de administrare, directoarele cu fișiere temporare sau URL-urile de filtrare cu parametri.

# Exemplu robots.txt pentru WordPress/WooCommerce
User-agent: *
Disallow: /wp-admin/
Disallow: /wp-includes/
Disallow: /cart/
Disallow: /checkout/
Disallow: /my-account/

# Blocheaza URL-urile cu parametri de filtrare
Disallow: /*?orderby=
Disallow: /*?filter_
Disallow: /*?paged=

Allow: /wp-admin/admin-ajax.php
Sitemap: https://site-tau.ro/sitemap.xml

Atenție: robots.txt blochează crawlarea dar nu indexarea. O pagină blocată prin robots.txt poate apărea în index dacă are linkuri externe spre ea (Google știe că există dar nu îi cunoaște conținutul). Pentru a bloca indexarea, folosește noindex.

Meta noindex: blocarea indexării

Tag-ul noindex permite crawlarea paginii dar spune Google să nu o includă în index. Folosit pentru paginile care trebuie accesate de Googlebot (pentru a vedea linkurile de pe ele) dar nu trebuie să apară în rezultate.

<!-- In head-ul paginilor care nu trebuie indexate -->
<meta name="robots" content="noindex, follow">

<!-- noindex + nofollow: nu indexa si nu urmari linkurile -->
<meta name="robots" content="noindex, nofollow">

In WordPress, plugin-urile SEO (Yoast, Rank Math) permit setarea noindex per tip de pagina: arhive tag, arhive autor, arhive data, pagini de rezultate cautare interna.

Tag canonical: consolidarea paginilor duplicate

Canonicalul indică Google care este versiunea principală dintr-un set de pagini similare. Paginile canonicalizate spre alta URL sunt crawlate mai rar, iar autoritatea lor este consolidată spre pagina principală.

<!-- In head-ul paginii de paginare (page/2, page/3 etc.) -->
<link rel="canonical" href="https://site-tau.ro/categorie/" />

<!-- Paginile filtrate canonicalizate spre pagina de categorie -->
<link rel="canonical" href="https://site-tau.ro/categorie/pantofi/" />

Sitemap XML: ghidarea crawl-ului

Un sitemap XML cuprinde toate URL-urile pe care vrei să le indexeze Google, cu prioritate și frecvență de actualizare. Sitemapul nu garantează indexarea dar ghidează Googlebot spre paginile importante.

Principii pentru sitemap-uri eficiente: include numai URL-urile care sunt indexabile (fără noindex), actualizează prioritățile pentru a reflecta importanța reală (nu setă totul pe prioritate 1.0), și trimite sitemap-ul în Search Console pentru a-l face cunoscut rapid.

Monitorizarea crawl budget în Search Console

# In Google Search Console:
# Settings > Crawl Stats
# - Grafic de crawlare in timp
# - Raspunsuri: 200, 301, 404, 500
# - Tipuri de fisiere crawlate

# Raportul Coverage arata:
# - Pagini indexate
# - Pagini excluse (si motivul)
# - Erori de crawlare (404, 500)

# URL Inspection Tool:
# Testeaza cum vede Google o pagina specifica
# "Test Live URL" verifica versiunea curenta

Concluzie

Optimizarea crawl budget-ului este o formă de igienă SEO tehnică esențială pentru site-urile cu sute sau mii de URL-uri. Elimină URL-urile inutile prin robots.txt și noindex, consolidează duplicatele prin canonicale, menține un sitemap curat și monitorizează în Search Console. Rezultatul: Googlebot petrece mai mult timp indexând paginile care contează și mai puțin pe cele care nu au nicio valoare SEO.

Despre autor

Dorel Tănase este specialist în optimizarea site-urilor pentru motoarele de căutare. Lucrează în online din 1997 și în SEO din 2007, iar activitatea se desfășoară prin GO SEO MARKETING S.R.L. din Alba Iulia. Se ocupă de audit tehnic, arhitectura site-urilor, conținut și construirea legăturilor.

Dorel Tănase este specialist în optimizarea site-urilor pentru motoarele de căutare. Lucrează în online din 1997 și în SEO din 2007, iar activitatea se desfășoară prin GO SEO MARKETING S.R.L. din Alba Iulia. Se ocupă de audit tehnic, arhitectura site-urilor, conținut și construirea legăturilor.

Crawl budget: cum controlezi ce indexează Google pe site-ul tău

Crawl budget: cum controlezi ce indexează Google pe site-ul tău

Crawl budget este un concept fundamental în SEO tehnic pentru site-urile de dimensiuni medii și mari, dar este adesea ignorat…

Backup-uri automate pe cPanel/WHM: configurare, stocare externă și testare

Backup-uri automate pe cPanel/WHM: configurare, stocare externă și testare

Un server cPanel fără backup-uri off-site corespunzătoare este o bombă cu ceas. Backup-urile stocate pe același server pe care îl…

Înapoi sus
[aipkit_chatbot id=813]