Robots.txt e un fișier text simplu, aflat mereu la aceeași adresă: domeniultau.ro/robots.txt. În el le spui roboților motoarelor de căutare pe unde au voie să umble pe site-ul tău.

E cel mai mic fișier de pe un site și, proporțional, cel care face cel mai mult rău când e greșit. Un singur rând scris prost poate scoate un site întreg din Google, iar semnul se vede abia peste săptămâni, când scad telefoanele.

Verifică-l acum, durează treizeci de secunde

Scrie în browser adresa site-ului tău urmată de /robots.txt. Ce vezi acolo e ce văd și motoarele de căutare.

Un fișier normal pentru un site de firmă arată cam așa: un rând care spune că regulile se aplică tuturor roboților, un rând care permite accesul peste tot, eventual câteva rânduri care blochează zonele de administrare, și un rând cu adresa sitemap-ului.

Ce trebuie să te îngrijoreze e un rând care interzice accesul la tot site-ul. În limbajul fișierului, asta e o linie de interdicție urmată doar de o bară oblică. Dacă o vezi acolo pe un site care ar trebui să fie public, ai găsit motivul pentru care nu apari în Google.

Cum ajunge acolo, deși nimeni n-a vrut

Aproape întotdeauna la fel. În timpul construcției, site-ul e închis intenționat, ca versiunea nefinalizată să nu ajungă în rezultate. E corect așa. Doar că la lansare cineva uită să deschidă, iar site-ul pornește invizibil.

Pe unele platforme lucrul ăsta e o singură bifă dintr-un panou de setări, cu un nume blând, gen descurajează motoarele de căutare. Se bifează la început și rămâne bifată.

De asta primul lucru de verificat pe orice site nou lansat e robots.txt. E gratuit, durează o jumătate de minut, și prinde una dintre cele mai scumpe greșeli posibile.

Confuzia care costă cel mai mult

Robots.txt nu ascunde o pagină din Google. Asta e neînțelegerea de bază, și din ea ies cele mai multe probleme.

Fișierul spune doar nu intra și nu citi. Nu spune nu arăta. Dacă o pagină e blocată în robots.txt dar are linkuri către ea, Google poate să o afișeze totuși în rezultate, fără descriere, cu o notă în care scrie că nu a putut citi conținutul. Adică exact ce nu voiai, plus un rezultat urât.

Mai rău: blocarea în robots.txt împiedică Google să citească pagina, deci împiedică și citirea unei eventuale instrucțiuni de pe pagină prin care ceri să nu fie indexată. Cele două mijloace se anulează reciproc dacă sunt folosite împreună.

Regula corectă:

  • Vrei ca o pagină să nu apară în rezultate: las-o accesibilă în robots.txt și pune pe ea instrucțiunea de neindexare. Google trebuie să poată intra, ca să vadă că i-ai cerut să plece.
  • Vrei doar să nu se piardă vremea prin zone fără rost, ca panoul de administrare sau căutarea internă: acolo e locul lui robots.txt.
  • Vrei ca ceva să fie cu adevărat privat: nici robots.txt, nici neindexarea nu sunt securitate. Fișierul e public, oricine îl citește, iar o adresă scrisă acolo e practic o hartă către ce ai vrut să ascunzi. Ce e privat se protejează cu parolă.

Ce nu trebuie blocat niciodată

O greșeală mai veche, dar încă întâlnită pe site-uri refăcute peste unele vechi: blocarea fișierelor de stil și a scripturilor, pe motiv că nu sunt conținut.

Google construiește pagina ca un browser, ca să vadă cum arată pentru un om. Dacă nu are acces la stiluri și scripturi, o vede ca pe un text dezordonat și poate concluziona că nu e potrivită pentru telefon. Pierzi fără să ai nicio problemă reală.

La fel, nu bloca folderul cu imagini dacă vrei ca pozele tale să apară în căutarea de imagini. Pentru unele domenii, căutarea de imagini aduce trafic real.

Cum îl testezi corect

Google Search Console are o unealtă în care introduci o adresă și îți spune dacă e blocată și de care rând anume. E singura verificare care contează, pentru că ea folosește exact interpretarea lui Google, nu părerea ta despre cum ar trebui citit fișierul.

Tot în Search Console, raportul de Indexare are o categorie pentru paginile blocate de robots.txt. Dacă acolo apar pagini importante, ai găsit problema fără să cauți.

Și e important de știut că modificarea are efect lent: Google recitește fișierul periodic, nu instantaneu. Poate dura de la câteva ore la câteva zile până când o deblocare se vede în rezultate, iar reindexarea paginilor eliberate durează în plus. Deci cu cât se prinde mai repede, cu atât mai bine.

Unde se leagă de restul

Robots.txt, sitemap-ul și instrucțiunile de indexare de pe pagini sunt trei mecanisme diferite care se ating între ele. Sitemap-ul spune uite ce am. Robots.txt spune pe unde ai voie. Instrucțiunea de pe pagină spune arată sau nu arăta.

Contradicțiile între ele sunt printre cele mai frecvente cauze pentru care un site nu apare în Google deși totul pare în regulă. O pagină trimisă prin sitemap dar blocată în robots.txt e exact o astfel de contradicție. Restul verificărilor, în ordine, le-am pus în articolul despre optimizarea unui site.

Pe scurt

  • Deschide acum domeniul tău urmat de /robots.txt și uită-te ce scrie.
  • O interdicție pe tot site-ul, rămasă din perioada de construcție, e cea mai frecventă cauză de invizibilitate.
  • Robots.txt nu ascunde pagini din rezultate. Pentru asta e instrucțiunea de neindexare, care cere ca pagina să fie accesibilă.
  • Nu bloca niciodată stilurile și scripturile.
  • Nimic din robots.txt nu e securitate. Fișierul e public.
  • Testează în Search Console, nu din ochi. Și verifică-l la fiecare lansare.