
Robots.txt je jednoduchý textový soubor umístěný v kořeni webu, kterým dáváš robotům vyhledávačů pokyny, kam na webu smějí a kam ne. Je to taková vrátnice na vstupu. Robot, který dorazí, se do ní nejdřív podívá a podle pravidel se zařídí. Používá se hlavně k tomu, aby roboti neztráceli čas a takzvaný crawl budget na nedůležitých částech webu, jako je administrace, koš nebo interní vyhledávání nebo příliš komplikované (překombinované) filtry.
Přes svou jednoduchost je robots.txt jedním z nejcitlivějších souborů na webu, protože jediný špatný řádek dokáže před vyhledávačem schovat celý web.
Odkud se slovo bere
Název je složený z robot a přípony txt, tedy prostý textový soubor pro roboty. Známou zajímavostí je, že samotné slovo robot je český výtvor. Poprvé ho použil Karel Čapek ve hře R.U.R. z roku 1920 a odvodil ho jeho bratr Josef od slova robota, tedy těžká, nucená práce.
Krátká historie
Robots.txt vznikl v roce 1994 z praktické nouze. Nizozemský vývojář Martijn Koster hledal způsob, jak zabránit robotům, aby zahltili servery a lezli, kam nemají. Navrhl jednoduchý protokol, kterému se začalo říkat Robots Exclusion Protocol. Nešlo o oficiální normu, ale o dobrovolnou dohodu, kterou „slušní“ roboti respektovali. Fungovalo to tak dobře, že se z ní stal de facto standard, který drží dodnes. Teprve v roce 2022 byl protokol oficiálně kodifikován jako internetový standard RFC 9309. Skoro třicet let tedy jeden z pilířů webu držel jen na tom, že se ho všichni dobrovolně drželi.
Jak robots.txt funguje z pohledu SEO
Soubor obsahuje jednoduchá pravidla. Řádek User-agent určuje, pro kterého robota pravidla platí, Disallow zakazuje přístup k dané cestě a Allow ho naopak povoluje. Nejčastěji se do robots.txt uvádí i odkaz na sitemapu, kde vlastně máme uložené všechny url, které chceme do indexu vyhledávačů.
Zásadní je pochopit jednu věc, na které pohoří spousta lidí. Robots.txt řídí procházení, nikoli indexaci. Když stránku zakážeš v robots.txt, robot ji sice neprojde, ale pokud na ni vedou odkazy, může se i tak objevit v indexu, jen bez popisku. K vyřazení z indexu slouží jiný nástroj, značka noindex.

Proč na robots.txt záleží
Správně nastavený robots.txt pomáhá vyhledávači soustředit se na to podstatné. Důležité je, že toto platí hlavně u opravdu velkých webů. U velkých webů, kde robot nemá čas projít úplně vše, je nasměrování crawl budgetu na hodnotné stránky velká výhoda. Zároveň je to ale nástroj, se kterým se musí zacházet opatrně. Nejznámější katastrofa v SEO je řádek, který omylem zakáže celý web, což se stává hlavně při přechodu z testovací verze do ostrého provozu. Proto obsah robots.txt kontroluji na začátku každého SEO auditu. U WordPressu ho navíc často spravuje SEO plugin, takže je dobré vědět, co v něm je.
Kam to sahá dál
Robots.txt je krásný příklad toho, že internet drží pohromadě spíš na dohodách a důvěře než na tvrdých pravidlech. Skoro třicet let stačilo, že se slušní roboti dobrovolně řídili prostým textovým souborem, který jim nic vynutit nemohl. Kdo chtěl, mohl ho ignorovat. Tahle křehká rovnováha ale dostává trhliny právě teď. Řada robotů, kteří sbírají data pro umělou inteligenci, si totiž pravidla vykládá po svém, nebo je rovnou obchází. Boj o to, kdo smí na tvůj obsah a co s ním udělá, se tím vrací na začátek. A robots.txt, ta stará vrátnice, se najednou stává jedním z bojišť éry AI.
Nejčastější chyby
- Řádek Disallow lomítko, který omylem zakáže celý web, typicky po spuštění z testu.
- Blokace stránky v robots.txt ve víře, že ji tím vyřadíš z indexu. K tomu slouží noindex.
- Zablokování složek s obrázky nebo skripty, které vyhledávač potřebuje k vykreslení stránky.
- Chybějící odkaz na mapu webu, kterou je vhodné v robots.txt uvést.
Otázky kolem robots.txt
Co je robots.txt?
Textový soubor v kořeni webu, kterým dáváš robotům vyhledávačů pravidla, kam na webu smějí a kam ne.
Blokuje robots.txt indexaci?
Ne. Robots.txt řídí procházení, ne indexaci. Zakázaná stránka se může do indexu dostat i tak, pokud na ni vedou odkazy. K vyřazení slouží značka noindex.
Kde robots.txt najdu?
Vždy v kořeni domény na adrese lomítko robots.txt. U WordPressu ho obvykle spravuje SEO plugin.

