Slovníček
Robots.txt
Stručně
Textový soubor v kořeni webu, kterým se robotům říká, kam smí a kam ne. Neřeší indexaci, jen procházení.
Kde je a jak vypadá
Vždy v kořeni domény, tedy na adrese vasedomena.cz/robots.txt. Jinde ho robot nehledá. Obsahuje bloky pravidel pro jednotlivé roboty a odkaz na sitemapu.
Co se v něm nejčastěji pokazí
- Řádek
Disallow: /bez dalšího upřesnění. Zakáže celý web. Přenáší se z testovací verze. - Zakázané adresáře se soubory stylů a skriptů. Robot pak stránku nedokáže vykreslit a hodnotí ji jako rozbitou.
- Chybějící odkaz na sitemapu.
- Soubor vracející chybu 500. Robot to bere jako dočasný zákaz celého webu.
Roboti jazykových modelů
Přes robots.txt se rozhoduje i o přístupu robotů, kteří sbírají obsah pro jazykové modely. Rozlišují se dvě skupiny: ti, kteří staví index pro odpovědi a přivádějí návštěvy, a ti, kteří sbírají data pro trénink. Zakázat jde každý zvlášť.
Časté dotazy
Skryje robots.txt stránku před lidmi?
Ne. Soubor je veřejný a kdokoliv si ho může přečíst na adrese s lomítkem robots.txt. Zápisem v něm naopak upozorníte na to, kde máte něco, co nechcete ukazovat. Na skrývání slouží přihlášení nebo heslo, ne robots.txt.
Vypadne zakázaná stránka z výsledků?
Nemusí. Když na ni vedou odkazy z jiných webů, může se v indexu objevit bez popisku, jen s adresou. Na vyřazení slouží noindex, který ale robot uvidí jen tehdy, když stránku smí stáhnout.
Návody k tomuhle tématu
Bezpečnostní hlavičky: které nastavit a v jakém pořadí
Hlavičky se nastavují na serveru a chrání návštěvníka před tím, co se do stránky vloudí. Čtyři z nich jde zapnout bez rizika hned.
JavaScript a SEO: kdy robot obsah uvidí a kdy ne
Google JavaScript spustí, ale s odkladem a ne vždycky. Seznam s ním pracuje omezeně. Obsah, na kterém závisí návštěvnost, patří do HTML.
XML sitemapa prakticky: co do ní patří a co ne
Sitemapa plná přesměrování a filtrů škodí víc, než pomáhá. Co do ní patří, proč Google ignoruje priority a jak poznáte, že je zaneřáděná.
Obsah pro AI vyhledávání: jak vás začnou citovat modely
AI přehledy, ChatGPT i Perplexity citují jen to, co si najdou a ověří. Poradím, které roboty pustit, jak psát odstavce k citaci a co s llms.txt.
Z blogu
Proč kontrola jedné stránky nestačí a co se ukáže až při procházení
Šest druhů nálezů, které z jedné stránky nezjistíte, i kdyby byla sebedůkladněji zkontrolovaná. Rozbor s čísly z reálných kontrol.
AI přehledy a prokliky: co se dá vyčíst z dat českých webů
Odpověď generovaná nad výsledky ubírá prokliky u faktických dotazů a přidává je u složitějších témat. Rozbor toho, kde se hranice láme.
Search Console: pět přehledů, které stojí za pravidelné otevření
Většina lidí se dívá jen na graf návštěvnosti. Užitečné věci jsou o dvě kliknutí dál a hledají se v nich příležitosti, ne chyby.
Týká se to vašeho webu?
Kontrola projde web a řekne, jestli tenhle problém máte. Trvá to necelou minutu.