Duplicitní obsah: kdy vadí a kdy je to jen strašák

Za duplicitní obsah vám Google nesníží pozice ani nepošle žádný trest. Žádná taková penalizace neexistuje a v jeho pravidlech proti spamu duplicita vůbec není. Co se stane doopravdy: z několika stejných adres si vyhledávač vybere jednu, tu zaindexuje a zbytek odsune stranou. Problém nastane tehdy, když si vybere jinou, než jste chtěli vy.

Penalizace za duplicitu neexistuje, ztráta ano

Mýtus o „trestu za duplicitní obsah“ drží nejmíň patnáct let a pořád ho slyším na první schůzce. Ruční postih dostane web, který je celý poskládaný z cizích textů. Ne e-shop, který má dvě adresy jedné kategorie.

Co vyhledávač dělá místo trestání: adresy se stejným nebo skoro stejným obsahem shlukne do jedné skupiny a z ní vybere jednu reprezentativní. Té přiřkne odkazy, které míří na kteroukoli verzi, tu prochází nejčastěji a tu ukazuje ve výsledcích. Ostatní zůstanou v indexu jako vedlejší, nebo z něj časem vypadnou.

Potíž je v tom, že o výběru nerozhodujete vy. Kanonická adresa je pro Google i pro Seznambota nápověda, ne příkaz. V Search Console pak najdete stav „Duplicita, Google zvolil jinou kanonickou stránku než uživatel“ a zjistíte, že se ve výsledcích ukazuje adresa s parametrem řazení místo čisté kategorie. Titulek je useknutý, popisek nesedí, prokliky jdou dolů. Tohle je ta skutečná škoda.

Druhá škoda je míň vidět. Robot má na váš web omezený čas. Když ho stráví procházením třiceti tisíc filtrovaných výpisů, na nově naskladněný produkt se dostane za týden místo za den.

Odkud se duplicity na českých webech berou?

Pořadí podle toho, jak často na to při auditech narazím:

  • Doména dostupná ve více variantách. S www i bez, na http i na https. V nejhorším případě čtyři samostatně načitatelné weby.
  • Parametry filtrů a řazení v e-shopu. Zdaleka největší objem duplicitních adres.
  • Stránkování výpisů. Většinou špatně ošetřené, ne neošetřené.
  • Převzaté popisky produktů od dodavatele. Stejný text jako u dvaceti konkurentů.
  • Štítky, kategorie a archivy ve WordPressu. Jeden článek dostupný na pěti adresách.
  • Tisková verze stránky. Relikt, který u starších webů pořád žije na /print/ nebo ?print=1.
  • Testovací verze webu. Adresy typu test.domena.cz nebo dočasná doména od hostingu, na kterou nikdo nedal zámek.
  • UTM parametry z newsletterů a ze Skliku. Obvykle neškodné, ale když na takovou adresu někdo odkáže, začne se indexovat.

U domény si to ověříte za minutu. Do prohlížeče postupně napište http://vasedomena.cz, http://www.vasedomena.cz, https://vasedomena.cz a https://www.vasedomena.cz. Tři z nich se musí přesměrovat na čtvrtou, kódem 301 a jedním skokem, ne řetězem tří přesměrování za sebou. Když se všechny čtyři načtou samostatně, máte jeden web čtyřikrát. Na Wedosu i na Forpsi to řeší pár řádků v souboru .htaccess, ve WordPressu k tomu musí sedět adresa v Nastavení, Obecné. Postup rozebírám v návodu na přesměrování 301, u přechodu na šifrované spojení pomůže text o certifikátu HTTPS a SEO.

Kolik adres umí vyrobit jeden filtr v e-shopu?

Spočítejte si to na vlastní kategorii. Pět filtrů, každý se šesti hodnotami, dává 7 776 kombinací. Vynásobte to čtyřmi způsoby řazení a jste přes třicet tisíc adres. Z jedné kategorie, ve které leží osmdesát produktů.

Typický příznak si všimnete i bez nástroje: web má podle exportu 400 stránek a Search Console v sekci Indexování stránek zná 26 tisíc adres. Ten rozdíl nejsou vaše stránky, to jsou kombinace parametrů.

Shoptet i Upgates dnes filtrované výpisy kanonizují na základní kategorii samy. Ověřte si to: otevřete filtrovaný výpis, dejte Ctrl+U a v kódu najděte rel="canonical". Má tam být adresa čisté kategorie bez parametrů. Výjimkou jsou parametrické kategorie v Shoptetu, tedy vstupní stránky typu „běžecké boty do terénu“, které mají mít vlastní titulek, vlastní text a kanonickou adresu samy na sebe. To nejsou duplicity, to jsou samostatné stránky.

Stránkování je jiný případ a dělá se na něm nejvíc chyb. Druhá strana kategorie duplicita není, protože jsou na ní jiné produkty. Přesto na ni spousta webů dá kanonickou adresu mířící na první stranu, čímž si zaindexování produktů z dalších stran zbytečně ztíží. Nechte stránkovací adresy indexovat s kanonickou adresou samy na sebe. Značky rel="next"rel="prev" Google od jara 2019 nepoužívá, s těmi se netrapte. Podrobnosti mám v článku o stránkování a SEO.

Popisky od dodavatele: přepsat, nebo nechat být?

Google opakovaně říká, že převzatý popisek produktu není důvod k postihu, a věřím tomu. Zároveň jsem za ta léta neviděl e-shop, který by s popiskem od výrobce porazil na konkurenčním dotazu web, kde si někdo dal práci.

Reálný dopad je jinde. Vyhledávač nerad zobrazuje deset výsledků se stejným úryvkem, takže si mezi identickými popisky vybere jeden zdroj a ostatní schová. Kdo to bude? Většinou ten, kdo má silnější doménu, zboží skladem a lepší recenze. Když prodáváte totéž co Alza za podobnou cenu a máte stejný text, nemáte čím argumentovat. Na Heurece a na Zboží.cz jedete se stejným feedem jako ostatní, takže tam rozhoduje cena a hodnocení, ne text.

Praktické řešení pro e-shop s 3 000 položkami: nepřepisujte všechno, nestihnete to. Vytáhněte si z analytiky 40 až 60 produktů, které nesou tržby nebo marži, a u nich přidejte pod převzatý popisek vlastní blok. Nemusí být dlouhý. Stačí komu se produkt hodí, čím se liší od dvou nejbližších alternativ ve vašem sortimentu, na co si dát pozor při montáži nebo praní. Jde o informaci, kterou nikdo jiný nemá, ne o počet slov. Zbytek katalogu nechte být a vraťte se k němu, až budou hotové priority. Když je popisek jen jedna věta z feedu, řešíte spíš tenký obsah než duplicitu.

WordPress si část duplicit vyrábí sám

Instalace bez zásahu udělá z jednoho článku pět až sedm adres:

  • samotný článek,
  • výpis kategorie,
  • výpis štítku, klidně i tří,
  • archiv autora,
  • datumový archiv,
  • adresa ?p=123,
  • stránka přílohy u každého nahraného obrázku.

Nejhorší bývají štítky. Blog s 60 články a 140 štítky, kde na většině štítků visí jediný článek, je klasika, kterou vidím pořád. Takový výpis nemá hodnotu pro nikoho. Buď štítky prořežte na deset až patnáct, které dávají smysl jako téma, nebo jim dejte noindex a nechte indexovat jen kategorie. Kdy který zákaz použít, rozebírám v článku o značkách noindex a nofollow.

Stránky příloh a datumové archivy dnes Yoast i Rank Math ve výchozím nastavení ošetří za vás. U webů, které někdo migroval nebo které běží na deset let staré konfiguraci, to ale zkontrolujte ručně. Přílohové stránky jsou tichý zabiják, web s 900 obrázky vám udělá 900 prázdných adres.

Jak duplicitu opravit a kdy po čem sáhnout

Situace Řešení Na co si dát pozor
Dvě adresy, jedna má zmizet natrvalo Přesměrování 301 Jeden skok, ne řetěz. Přepište i interní odkazy.
Filtrované a řazené výpisy Kanonická adresa na základní kategorii Nesmí mířit na přesměrování ani na chybovou stránku.
Interní vyhledávání, košík, porovnání produktů noindex, follow Nekombinovat se zákazem v robots.txt.
Dvě podobné stránky, obě mají návštěvnost Sloučit do jedné, slabší přesměrovat Vezměte z obou to lepší, ne jen tu silnější.
Převzatý popisek produktu Přepsat u prioritních položek Kanonická adresa na web dodavatele je sebevražda.
Stránkování výpisu Indexovat, kanonická adresa sama na sebe Nikdy nekanonizovat na první stranu.
Testovací verze webu Heslo na úrovni serveru Samotný robots.txt neochrání, adresa se najde z odkazů.

Tu poznámku o robots.txt podceňuje skoro každý. Když adresu zakážete v souboru robots.txt a zároveň na ni dáte noindex, robot ji nestáhne, značku neuvidí a stránka může ve výsledcích zůstat bez popisku. Buď zákaz procházení, nebo zákaz indexování. Ne obojí najednou.

Pravidlo, kterého se držím: přesměrování tam, kde adresa nemá důvod dál existovat. Kanonická adresa tam, kde adresa musí fungovat pro návštěvníka, ale nemá se objevit ve výsledcích.

Seznam má u kanonických adres dvě specifika, která se vyplatí znát. Ignoruje kanonickou adresu mířící na přesměrování, protože si potřebuje ověřit, že jsou obě stránky opravdu podobné. A ignoruje ji taky tehdy, když cílová adresa vyžaduje cookie. Jestli vám na českém trhu záleží, mrkněte na shrnutí odlišností v textu o SEO pro Seznam.cz.

Čím duplicity najdete?

  • Google Search Console, sekce Indexování stránek. Zdarma a nejpřesnější, protože ukazuje, co si myslí přímo Google. Hledejte stavy „Duplicita, Google zvolil jinou kanonickou stránku než uživatel“ a „Duplicitní stránka bez kanonické verze zvolené uživatelem“. Stav „Alternativní stránka se správnou kanonickou značkou“ je v pořádku, ten neřešte.
  • Screaming Frog. Bezplatná verze projde 500 adres, což na malý web stačí. Licence stojí 199 liber ročně, podle kurzu zhruba pět až šest tisíc korun. Zajímá vás záložka Content a filtr Near Duplicates, kde si nastavíte práh podobnosti, výchozí bývá 90 procent.
  • Marketing Miner. Český nástroj, technický audit odhalí duplicitní titulky a popisky rychle.
  • Vyhledávač samotný. Vezměte větu z podezřelé stránky, dejte ji do uvozovek a přidejte site:vasedomena.cz. Uvidíte, kolik vašich adres tu větu obsahuje. Bez operátoru site zjistíte, kdo vám text opsal.
  • Naše bezplatná SEO kontrola webu. Zkontroluje varianty domény, kanonické adresy, řetězy přesměrování a duplicitní titulky. Na první přehled, jestli problém máte, to stačí.

Nečekejte od žádného nástroje přesné procento duplicity webu. Takové číslo neexistuje, každý nástroj si podobnost počítá po svém a Google svůj práh nezveřejňuje. Berte výstup jako seznam míst k prohlédnutí, ne jako známku.

Kdy je duplicita v pořádku?

Většina duplicit, které klienti panikaří opravovat, nekazí nic:

  • Obchodní podmínky, reklamační řád, zásady zpracování údajů. Napůl opsané ze vzorů a nikdo je nehledá. Nechte je být.
  • Adresa, otevírací doba a kontakt v patičce. Opakují se na všech stránkách a tak to má být.
  • Jazykové mutace. Česká a slovenská verze textu si jsou podobné až k nerozeznání, od toho existuje značka hreflang.
  • Varianty produktu. Stejná bunda v pěti barvách nepotřebuje pět originálních textů.
  • Citace v článku. Odstavec převzatý s uvedením zdroje je normální práce s informacemi.
  • Zopakovaný úvodní text kategorie nad druhou a další stranou výpisu.

Jednoduchý test, jestli se duplicitou vůbec zabývat: existuje dotaz, na který by ta stránka měla přivádět lidi? Když ne, řešíte technickou hygienu, ne obsah, a stačí kanonická adresa nebo noindex. Když ano, musí být jasné, která z těch adres je ta hlavní, a ta musí dostat interní odkazy.

Časté dotazy

Penalizuje Google duplicitní obsah?

Ne. Google nemá postih za duplicitní obsah sám o sobě a duplicita není mezi jeho pravidly proti spamu. Místo trestání vybere z několika podobných adres jednu, tu zaindexuje a ostatní odsune stranou. Ruční postih hrozí jen webům, které jsou celé poskládané z cizích textů.

Mám dát na filtrované stránky v e-shopu noindex, nebo kanonickou adresu?

U běžných kombinací filtrů a řazení použijte kanonickou adresu mířící na základní kategorii. Značku noindex nechte na stránky, které ve výsledcích nemají co dělat vůbec, tedy interní vyhledávání, košík nebo porovnání produktů. Výjimkou jsou filtrované výpisy, které cíleně stavíte jako vstupní stránku, například parametrické kategorie v Shoptetu. Ty mají mít vlastní titulek, vlastní text a kanonickou adresu samy na sebe.

Musím přepsat všechny popisky produktů od dodavatele?

Nemusíte a u většího katalogu to ani není reálné. Vyberte 40 až 60 produktů, které nesou tržby, a u nich doplňte vlastní informaci, kterou konkurence nemá. Zbytek katalogu s převzatým textem vám nic nepokazí, jen s ním nevyhrajete konkurenční dotazy.

Jakub Knytl

Patnáct let opravuji weby českým firmám a e-shopům. Většina problémů, o kterých tu píšu, mě potkala u klienta dřív, než jsem o nich napsal.

Související návody

Pojmy z tohoto textu

Nevíte, jestli se vás to týká?

Pusťte kontrolu na svůj web a uvidíte, jestli tenhle problém máte. Trvá to necelou minutu.

156 kontrol, výsledek do minuty. Bez registrace, bez karty, bez e-mailu.