Duplicitní obsah: kdy vadí a kdy je to jen strašák
Za duplicitní obsah vám Google nesníží pozice ani nepošle žádný trest. Žádná taková penalizace neexistuje a v jeho pravidlech proti spamu duplicita vůbec není. Co se stane doopravdy: z několika stejných adres si vyhledávač vybere jednu, tu zaindexuje a zbytek odsune stranou. Problém nastane tehdy, když si vybere jinou, než jste chtěli vy.
Penalizace za duplicitu neexistuje, ztráta ano
Mýtus o „trestu za duplicitní obsah“ drží nejmíň patnáct let a pořád ho slyším na první schůzce. Ruční postih dostane web, který je celý poskládaný z cizích textů. Ne e-shop, který má dvě adresy jedné kategorie.
Co vyhledávač dělá místo trestání: adresy se stejným nebo skoro stejným obsahem shlukne do jedné skupiny a z ní vybere jednu reprezentativní. Té přiřkne odkazy, které míří na kteroukoli verzi, tu prochází nejčastěji a tu ukazuje ve výsledcích. Ostatní zůstanou v indexu jako vedlejší, nebo z něj časem vypadnou.
Potíž je v tom, že o výběru nerozhodujete vy. Kanonická adresa je pro Google i pro Seznambota nápověda, ne příkaz. V Search Console pak najdete stav „Duplicita, Google zvolil jinou kanonickou stránku než uživatel“ a zjistíte, že se ve výsledcích ukazuje adresa s parametrem řazení místo čisté kategorie. Titulek je useknutý, popisek nesedí, prokliky jdou dolů. Tohle je ta skutečná škoda.
Druhá škoda je míň vidět. Robot má na váš web omezený čas. Když ho stráví procházením třiceti tisíc filtrovaných výpisů, na nově naskladněný produkt se dostane za týden místo za den.
Odkud se duplicity na českých webech berou?
Pořadí podle toho, jak často na to při auditech narazím:
- Doména dostupná ve více variantách. S www i bez, na http i na https. V nejhorším případě čtyři samostatně načitatelné weby.
- Parametry filtrů a řazení v e-shopu. Zdaleka největší objem duplicitních adres.
- Stránkování výpisů. Většinou špatně ošetřené, ne neošetřené.
- Převzaté popisky produktů od dodavatele. Stejný text jako u dvaceti konkurentů.
- Štítky, kategorie a archivy ve WordPressu. Jeden článek dostupný na pěti adresách.
- Tisková verze stránky. Relikt, který u starších webů pořád žije na /print/ nebo ?print=1.
- Testovací verze webu. Adresy typu test.domena.cz nebo dočasná doména od hostingu, na kterou nikdo nedal zámek.
- UTM parametry z newsletterů a ze Skliku. Obvykle neškodné, ale když na takovou adresu někdo odkáže, začne se indexovat.
U domény si to ověříte za minutu. Do prohlížeče postupně napište http://vasedomena.cz, http://www.vasedomena.cz, https://vasedomena.cz a https://www.vasedomena.cz. Tři z nich se musí přesměrovat na čtvrtou, kódem 301 a jedním skokem, ne řetězem tří přesměrování za sebou. Když se všechny čtyři načtou samostatně, máte jeden web čtyřikrát. Na Wedosu i na Forpsi to řeší pár řádků v souboru .htaccess, ve WordPressu k tomu musí sedět adresa v Nastavení, Obecné. Postup rozebírám v návodu na přesměrování 301, u přechodu na šifrované spojení pomůže text o certifikátu HTTPS a SEO.
Kolik adres umí vyrobit jeden filtr v e-shopu?
Spočítejte si to na vlastní kategorii. Pět filtrů, každý se šesti hodnotami, dává 7 776 kombinací. Vynásobte to čtyřmi způsoby řazení a jste přes třicet tisíc adres. Z jedné kategorie, ve které leží osmdesát produktů.
Typický příznak si všimnete i bez nástroje: web má podle exportu 400 stránek a Search Console v sekci Indexování stránek zná 26 tisíc adres. Ten rozdíl nejsou vaše stránky, to jsou kombinace parametrů.
Shoptet i Upgates dnes filtrované výpisy kanonizují na základní kategorii samy. Ověřte si to: otevřete filtrovaný výpis, dejte Ctrl+U a v kódu najděte rel="canonical". Má tam být adresa čisté kategorie bez parametrů. Výjimkou jsou parametrické kategorie v Shoptetu, tedy vstupní stránky typu „běžecké boty do terénu“, které mají mít vlastní titulek, vlastní text a kanonickou adresu samy na sebe. To nejsou duplicity, to jsou samostatné stránky.
Stránkování je jiný případ a dělá se na něm nejvíc chyb. Druhá strana kategorie duplicita není, protože jsou na ní jiné produkty. Přesto na ni spousta webů dá kanonickou adresu mířící na první stranu, čímž si zaindexování produktů z dalších stran zbytečně ztíží. Nechte stránkovací adresy indexovat s kanonickou adresou samy na sebe. Značky rel="next" a rel="prev" Google od jara 2019 nepoužívá, s těmi se netrapte. Podrobnosti mám v článku o stránkování a SEO.
Popisky od dodavatele: přepsat, nebo nechat být?
Google opakovaně říká, že převzatý popisek produktu není důvod k postihu, a věřím tomu. Zároveň jsem za ta léta neviděl e-shop, který by s popiskem od výrobce porazil na konkurenčním dotazu web, kde si někdo dal práci.
Reálný dopad je jinde. Vyhledávač nerad zobrazuje deset výsledků se stejným úryvkem, takže si mezi identickými popisky vybere jeden zdroj a ostatní schová. Kdo to bude? Většinou ten, kdo má silnější doménu, zboží skladem a lepší recenze. Když prodáváte totéž co Alza za podobnou cenu a máte stejný text, nemáte čím argumentovat. Na Heurece a na Zboží.cz jedete se stejným feedem jako ostatní, takže tam rozhoduje cena a hodnocení, ne text.
Praktické řešení pro e-shop s 3 000 položkami: nepřepisujte všechno, nestihnete to. Vytáhněte si z analytiky 40 až 60 produktů, které nesou tržby nebo marži, a u nich přidejte pod převzatý popisek vlastní blok. Nemusí být dlouhý. Stačí komu se produkt hodí, čím se liší od dvou nejbližších alternativ ve vašem sortimentu, na co si dát pozor při montáži nebo praní. Jde o informaci, kterou nikdo jiný nemá, ne o počet slov. Zbytek katalogu nechte být a vraťte se k němu, až budou hotové priority. Když je popisek jen jedna věta z feedu, řešíte spíš tenký obsah než duplicitu.
WordPress si část duplicit vyrábí sám
Instalace bez zásahu udělá z jednoho článku pět až sedm adres:
- samotný článek,
- výpis kategorie,
- výpis štítku, klidně i tří,
- archiv autora,
- datumový archiv,
- adresa
?p=123, - stránka přílohy u každého nahraného obrázku.
Nejhorší bývají štítky. Blog s 60 články a 140 štítky, kde na většině štítků visí jediný článek, je klasika, kterou vidím pořád. Takový výpis nemá hodnotu pro nikoho. Buď štítky prořežte na deset až patnáct, které dávají smysl jako téma, nebo jim dejte noindex a nechte indexovat jen kategorie. Kdy který zákaz použít, rozebírám v článku o značkách noindex a nofollow.
Stránky příloh a datumové archivy dnes Yoast i Rank Math ve výchozím nastavení ošetří za vás. U webů, které někdo migroval nebo které běží na deset let staré konfiguraci, to ale zkontrolujte ručně. Přílohové stránky jsou tichý zabiják, web s 900 obrázky vám udělá 900 prázdných adres.
Jak duplicitu opravit a kdy po čem sáhnout
| Situace | Řešení | Na co si dát pozor |
|---|---|---|
| Dvě adresy, jedna má zmizet natrvalo | Přesměrování 301 | Jeden skok, ne řetěz. Přepište i interní odkazy. |
| Filtrované a řazené výpisy | Kanonická adresa na základní kategorii | Nesmí mířit na přesměrování ani na chybovou stránku. |
| Interní vyhledávání, košík, porovnání produktů | noindex, follow | Nekombinovat se zákazem v robots.txt. |
| Dvě podobné stránky, obě mají návštěvnost | Sloučit do jedné, slabší přesměrovat | Vezměte z obou to lepší, ne jen tu silnější. |
| Převzatý popisek produktu | Přepsat u prioritních položek | Kanonická adresa na web dodavatele je sebevražda. |
| Stránkování výpisu | Indexovat, kanonická adresa sama na sebe | Nikdy nekanonizovat na první stranu. |
| Testovací verze webu | Heslo na úrovni serveru | Samotný robots.txt neochrání, adresa se najde z odkazů. |
Tu poznámku o robots.txt podceňuje skoro každý. Když adresu zakážete v souboru robots.txt a zároveň na ni dáte noindex, robot ji nestáhne, značku neuvidí a stránka může ve výsledcích zůstat bez popisku. Buď zákaz procházení, nebo zákaz indexování. Ne obojí najednou.
Pravidlo, kterého se držím: přesměrování tam, kde adresa nemá důvod dál existovat. Kanonická adresa tam, kde adresa musí fungovat pro návštěvníka, ale nemá se objevit ve výsledcích.
Seznam má u kanonických adres dvě specifika, která se vyplatí znát. Ignoruje kanonickou adresu mířící na přesměrování, protože si potřebuje ověřit, že jsou obě stránky opravdu podobné. A ignoruje ji taky tehdy, když cílová adresa vyžaduje cookie. Jestli vám na českém trhu záleží, mrkněte na shrnutí odlišností v textu o SEO pro Seznam.cz.
Čím duplicity najdete?
- Google Search Console, sekce Indexování stránek. Zdarma a nejpřesnější, protože ukazuje, co si myslí přímo Google. Hledejte stavy „Duplicita, Google zvolil jinou kanonickou stránku než uživatel“ a „Duplicitní stránka bez kanonické verze zvolené uživatelem“. Stav „Alternativní stránka se správnou kanonickou značkou“ je v pořádku, ten neřešte.
- Screaming Frog. Bezplatná verze projde 500 adres, což na malý web stačí. Licence stojí 199 liber ročně, podle kurzu zhruba pět až šest tisíc korun. Zajímá vás záložka Content a filtr Near Duplicates, kde si nastavíte práh podobnosti, výchozí bývá 90 procent.
- Marketing Miner. Český nástroj, technický audit odhalí duplicitní titulky a popisky rychle.
- Vyhledávač samotný. Vezměte větu z podezřelé stránky, dejte ji do uvozovek a přidejte
site:vasedomena.cz. Uvidíte, kolik vašich adres tu větu obsahuje. Bez operátoru site zjistíte, kdo vám text opsal. - Naše bezplatná SEO kontrola webu. Zkontroluje varianty domény, kanonické adresy, řetězy přesměrování a duplicitní titulky. Na první přehled, jestli problém máte, to stačí.
Nečekejte od žádného nástroje přesné procento duplicity webu. Takové číslo neexistuje, každý nástroj si podobnost počítá po svém a Google svůj práh nezveřejňuje. Berte výstup jako seznam míst k prohlédnutí, ne jako známku.
Kdy je duplicita v pořádku?
Většina duplicit, které klienti panikaří opravovat, nekazí nic:
- Obchodní podmínky, reklamační řád, zásady zpracování údajů. Napůl opsané ze vzorů a nikdo je nehledá. Nechte je být.
- Adresa, otevírací doba a kontakt v patičce. Opakují se na všech stránkách a tak to má být.
- Jazykové mutace. Česká a slovenská verze textu si jsou podobné až k nerozeznání, od toho existuje značka hreflang.
- Varianty produktu. Stejná bunda v pěti barvách nepotřebuje pět originálních textů.
- Citace v článku. Odstavec převzatý s uvedením zdroje je normální práce s informacemi.
- Zopakovaný úvodní text kategorie nad druhou a další stranou výpisu.
Jednoduchý test, jestli se duplicitou vůbec zabývat: existuje dotaz, na který by ta stránka měla přivádět lidi? Když ne, řešíte technickou hygienu, ne obsah, a stačí kanonická adresa nebo noindex. Když ano, musí být jasné, která z těch adres je ta hlavní, a ta musí dostat interní odkazy.
Časté dotazy
Penalizuje Google duplicitní obsah?
Ne. Google nemá postih za duplicitní obsah sám o sobě a duplicita není mezi jeho pravidly proti spamu. Místo trestání vybere z několika podobných adres jednu, tu zaindexuje a ostatní odsune stranou. Ruční postih hrozí jen webům, které jsou celé poskládané z cizích textů.
Mám dát na filtrované stránky v e-shopu noindex, nebo kanonickou adresu?
U běžných kombinací filtrů a řazení použijte kanonickou adresu mířící na základní kategorii. Značku noindex nechte na stránky, které ve výsledcích nemají co dělat vůbec, tedy interní vyhledávání, košík nebo porovnání produktů. Výjimkou jsou filtrované výpisy, které cíleně stavíte jako vstupní stránku, například parametrické kategorie v Shoptetu. Ty mají mít vlastní titulek, vlastní text a kanonickou adresu samy na sebe.
Musím přepsat všechny popisky produktů od dodavatele?
Nemusíte a u většího katalogu to ani není reálné. Vyberte 40 až 60 produktů, které nesou tržby, a u nich doplňte vlastní informaci, kterou konkurence nemá. Zbytek katalogu s převzatým textem vám nic nepokazí, jen s ním nevyhrajete konkurenční dotazy.
Související návody
Tenký obsah: jak poznat stránky, které webu spíš škodí
Tenká stránka není krátká stránka. Je to stránka, která na svůj dotaz neodpoví. Řešení bývá sloučení, ne dopsání odstavců.
Kolik slov má mít článek, aby se dostal na první stranu
Délka není faktor hodnocení. Odvíjí se od dotazu: u jednoduché otázky škodí, u srovnání je nutná. Měřítkem je úplnost odpovědi.
Srozumitelný text na web: co měřit a co opravit jako první
Čitelnost se dá měřit i v češtině. Rozhoduje délka vět, podíl trpného rodu a to, jestli první odstavec obsahuje odpověď.
Pojmy z tohoto textu
- JSON-LD Formát zápisu strukturovaných dat. Vkládá se jako samostatný blok a nemíchá se do značek obsahu.
- llms.txt Textový soubor v kořeni webu, který jazykovým modelům shrnuje, co na webu je a kde to najdou.
- Duplicitní obsah Tentýž nebo velmi podobný text na víc adresách. Není to postih, ale vyhledávač si vybere jednu verzi a ostatní potlačí.
- Smíšený obsah Stav, kdy se stránka načte přes HTTPS, ale některé její části se stahují přes nešifrované HTTP.
- Tenký obsah Stránka, která na svůj dotaz neodpoví. S délkou to souvisí jen volně, krátká a přesná odpověď tenká není.
- HSTS Hlavička, kterou prohlížeči nařídíte chodit na doménu výhradně přes HTTPS. Prohlížeč si to zapamatuje na zadanou dobu.
Nevíte, jestli se vás to týká?
Pusťte kontrolu na svůj web a uvidíte, jestli tenhle problém máte. Trvá to necelou minutu.