Tester robots.txt

Kontrola robots.txt online

Jeden špatný řádek v robots.txt umí schovat celý web před Googlem. Zadejte adresu a SEO Radar soubor stáhne, přečte jako vyhledávač a řekne, co v něm nesedí.

202 kontrol 22 kategorií výsledek za 30 s bez registrace
Robots.txt: časté chyby vs. minimální funkční soubor Nejčastější chyby v robots.txt proti minimálnímu souboru o třech řádcích, který skutečně funguje. ✕ Chyby, které vidíme nejčastěji ✓ Minimální robots.txt, který funguje ✕ Disallow: / z testovací verze ✕ Blokované /assets/ se styly ✕ Sitemap s http:// místo https:// ✕ Wildcard, který zakáže víc ✓ User-agent: * pro všechny roboty ✓ Zakázaná jen administrace a vyhledávání ✓ Sitemap https:// na vlastní doméně Sitemap direktiva platí pro celý soubor, ne pro jednu skupinu User-agent.
Robots.txt: časté chyby vs. minimální funkční soubor

Co zjistíte

  • Jestli je robots.txt na doméně vůbec dostupný a vrací obsah, ne prázdnou odpověď nebo chybu serveru.
  • Crawl-delay nebo Request-rate direktivu v souboru — Google žádnou z nich nepodporuje, ale SeznamBot se Request-rate řídí, Request-rate test jen zobrazí, u Crawl-delay upozorní, když hodnota přesáhne deset sekund a zbytečně brzdí indexaci.
  • Jestli řádek Disallow: / omylem blokuje procházení celého webu, ať už pro všechny roboty, nebo jen pro Googlebota.
  • Zda pravidla nezakazují přístup ke složkám se styly a skripty, bez kterých Google stránku správně nevykreslí.
  • Jestli soubor obsahuje řádek Sitemap a jestli míří na vlastní doménu, ne na cizí.
  • Jaká pravidla robots.txt nastavuje pro AI roboty jako GPTBot nebo ClaudeBot — tohle je informace, ne chyba, protože žádné nastavení tu není samo o sobě špatně.

Co robots.txt umí a co ne

Robots.txt řídí procházení, ne indexaci. Ten rozdíl láká k mylným závěrům o tom, co soubor doopravdy dělá. Když robotovi zakážete vstup na adresu, zabráníte mu ji stáhnout a přečíst. Nezabráníte mu ale vědět, že adresa existuje — pokud na ni vede odkaz odjinud, do výsledků vyhledávání se přesto dostat může, jen bez popisku a náhledu, protože obsah stránky Google nikdy neviděl.

Syntaxe souboru stojí na čtyřech direktivách. User-agent určuje, pro kterého robota skupina pravidel platí — hvězdička znamená všechny. Disallow zakazuje cestu, Allow ji naopak výslovně povoluje, což se hodí, chcete-li odemknout jednu podsložku uvnitř jinak zakázaného adresáře. Sitemap ukazuje, kde robot najde seznam stránek k procházení, a na rozdíl od ostatních direktiv nepatří pod žádnou konkrétní skupinu User-agent — platí pro celý soubor najednou.

Co v robots.txt nefunguje, je řádek Noindex. Google ho dřív tiše respektoval, ale od září 2019 ho oficiálně ignoruje — do standardu nikdy nepatřil a jeho podpora zůstávala jen zvykem, který firma zrušila. Kdo chce stránku vyřadit z indexu, potřebuje meta tag robots s hodnotou noindex přímo na stránce. A tady je ten háček: aby ho Google vůbec uviděl, stránka nesmí být zároveň blokovaná v robots.txt. Zakázaný Disallow robotovi zabrání se na ni podívat, takže meta noindex zůstane nepřečtený a stránka v indexu klidně zůstane dál.

Pět chyb, které vidíme nejčastěji

  1. Zapomenuté Disallow: / z testovací verze webu. Vývojář ho přidá, aby se staging neindexoval, a po nasazení na ostrou verzi ho zapomene smazat. Web pak z výsledků vyhledávání mizí celé týdny, než si toho někdo všimne.
  2. Blokovaný adresář se styly nebo skripty, typicky /assets/ nebo /static/, přidaný kdysi kvůli šetření kapacity serveru pro roboty. Dnes to jen kazí, jak Google stránku vykreslí a vyhodnotí.
  3. Sitemap s http:// místo https:// — soubor po přechodu na zabezpečený protokol nikdo neaktualizoval, a robot tak dostane odkaz přes zbytečné přesměrování místo přímé cesty k datům.
  4. Wildcard, který zakáže víc, než měl. Disallow: /*produkt* vypadá jako rozumný způsob, jak schovat filtrované varianty, ale stejně tak zasáhne i hlavní produktové stránky s tím slovem v cestě.
  5. Soubor vrácený jako HTML stránka s chybou 404, přestože server odpoví stavovým kódem 200. Test ho vezme jako existující, ale nenajde v něm žádnou platnou direktivu — navenek se to projeví stejně jako chybějící řádek Sitemap nebo žádná pravidla pro procházení.

Jak to má vypadat

Minimální funkční robots.txt nepotřebuje víc než tři řádky:

User-agent: *
Disallow: /admin/
Sitemap: https://www.vase-domena.cz/sitemap.xml

Konkrétní zakázané cesty se web od webu liší podle toho, co má schovávat — třeba administraci nebo interní vyhledávání. Shoptet, WooCommerce, WordPress i PrestaShop mají vlastní výchozí soubor, který tyhle cesty většinou řeší sám, takže ho stačí zkontrolovat, ne psát od nuly. Potíž nastává až ve chvíli, kdy do něj někdo zasáhne ručně a nechá tam pravidlo, které tam nepatří.

Kontrola není jednorázová

Robots.txt se sám od sebe mění málokdy, ale spolehlivě se mění spolu se vším kolem něj. Migrace na nový redakční systém typicky přepíše celý soubor výchozí šablonou nového systému, a ta nemusí obsahovat Vaše původní výjimky. Nová agentura, která zdědí přístup k FTP nebo administraci, soubor občas upraví bez konzultace s předchozím dodavatelem. Přejmenování domény nebo přechod na nový CDN dokáže rozbít odkaz na sitemapu, pokud ho nikdo ručně nezkontroluje po dokončení.

Po každé takové změně stačí spustit kontrolu znovu — nic tím nezaplatíte navíc. Opravu ověříte hned: na výsledkovce vlastní kontroly je tlačítko Spustit znovu, které uloženou kontrolu obejde a soubor stáhne načisto. Komu jste odkaz na výsledek poslali, ten uloženou verzi vidí dál — tlačítko patří zadavateli kontroly. Kdo chce vidět celý postup krok za krokem, včetně toho, jak spolu robots.txt a sitemapa fungují dohromady, najde ho v článku Robots.txt a Sitemap.xml: Jak je správně nastavit.

Co robots.txt umí a co ne Disallow řídí, kam robot smí; o zařazení do indexu rozhoduje až meta tag robots noindex na navštívené stránce. 1 Robot dorazí na adresu 2 Robots.txt řekne, kam smí řídí procházení, ne indexaci 3 Stránka se stáhne a přečte 4 Meta robots noindex rozhodne o vyřazení stránky z indexu Disallow zakazuje jen procházení, ne indexaci.
Co robots.txt umí a co ne

Co kontrola prověří

Robots.txt (7 kontrol)

  • Dostupnost — Kontrola dostupnosti robots.txt
  • Direktiva Sitemap — Kontrola direktivy Sitemap
  • Blokace webu — Kontrola blokace celého webu
  • Blokace CSS/JS — Kontrola blokace CSS a JS souborů
  • Crawl-delay — Kontrola crawl-delay direktivy
  • Request-rate — Kontrola Request-rate direktivy (Seznam)
  • Direktivy pro AI roboty — Kontrola direktiv pro AI roboty

Možná se ptáte

Nic dramatického. Vyhledávače berou chybějící soubor jako povolení procházet vše. Přijdete ale o možnost odkázat na sitemapu a schovat administraci nebo interní vyhledávání. Test chybějící soubor označí jako varování, ne chybu.

Ne. Disallow jen zakazuje procházení. Když na stránku vede odkaz odjinud, Google ji může zaindexovat i bez obsahu. Pro vyřazení z indexu slouží meta robots noindex, a ta musí být na stránce, kterou robot smí navštívit.

Test soubor přečte a v pravidlech Disallow hledá cesty, které míří na styly nebo skripty (.css, .js). Zablokované styly a skripty Google vyhodnotí tak, že stránku nedokáže vykreslit, a to se promítne do hodnocení mobilní verze i rychlosti.

Kontrola vždy stahuje robots.txt z kořene hostitele zadané adresy, tedy přesně ten, který pro danou stránku platí. Subdoména má vlastní soubor a testuje se zadáním její adresy.

Řešíte i soulad se zákonem?

SEO Radar prověří i právní stránku webu a řekne, jestli jsme na něčem narazili. Podrobný rozbor, návod na opravu i pravidelné hlídání nabízí Certito — najdete ho na certito.cz.

SEO Radar

Auditujeme Váš web

0%
Stahování
Technika & indexace
Obsah, rychlost & AI
Vyhodnocení
Připravuji audit...
Audit dokončen!