
Indexace stránek je proces, při kterém vyhledávač jako Google či Seznam uloží a zpracuje obsah stránky do své obří databáze, takzvaného indexu, ze které pak sestavuje výsledky vyhledávání. Zjednodušeně: dokud stránka není v indexu Googlu (či jiného vyhledávače), pro vyhledávač prakticky neexistuje a nemá šanci se zobrazit, ať je jakkoli dobrá. Proto je indexace webu úplně první věc, kterou u každé optimalizace řeším, ještě předtím, než začnu řešit pozice nebo klíčová slova. Pokud se web dobře indexuje, tak je to dobré znamení směrem k dalším posunům.
Odkud se slovo bere
Slovo pochází z latinského index, indicis, což znamená ukazatel nebo oznamovatel. Odtud je i digitus index, tedy ukazováček, prst, kterým na něco ukazujeme. Ve významu seznam nebo rejstřík se index ustálil jako nástroj, který ukazuje, kde co najít. Indexace je pak zařazení do takového rejstříku. Už v kořeni slova je schované to nejdůležitější: index nám ukazuje cestu k obsahu.
Krátká historie indexace
Potřeba indexovat je mnohem starší než internet. Rejstříky na konci knih se rozšířily s knihtiskem v 15. a 16. století, protože čtenář najednou potřeboval v tlusté knize rychle něco najít. V 19. století přišly knihovní katalogy a s nimi Deweyho desetinné třídění z roku 1876, první velký pokus uspořádat veškeré vědění do systému.
Web tenhle problém zdědil v obřím měřítku. První vyhledávače byly ruční adresáře, kde lidé weby ručně třídili do kategorií, jako to dělal Yahoo v roce 1994. Zlom přišel s fulltextovými roboty. WebCrawler v roce 1994 jako první indexoval celý text stránek a AltaVista v roce 1995 vybudovala na svou dobu ohromný index. Google v roce 1998 přidal PageRank a indexaci povýšil na základ celého byznysu. Zásadní byl update Caffeine z roku 2010, který přinesl kontinuální, čerstvější indexaci, a přechod na takzvaný mobile-first indexing, kdy Google začal indexovat mobilní verzi webu jako tu hlavní.
Jak indexace funguje z pohledu SEO
Cesta stránky do vyhledávače má tři fáze a je klíčové je nezaměňovat. Nejdřív crawling, kdy Googlebot stránku najde a projde. Bereme příklad Googlu, ale obdobně fungují i další vyhledávače jako Seznam nebo Bing. Pak indexace, kdy se obsah zpracuje a uloží do indexu (vyhledávač se „rozhodne“, jestli je vlastně obsah tak hodnotný, že ho stojí za to uložit do indexu). Pokud se obsah dlouho indexuje nebo vůbec ne, tak je to pro mě jako pro SEO konzultanta znamení prověřit věrohodnost obsahu i technické řešení webu. Pro Google je vše přehledně vidět v Google Search Console:

A nakonec ranking, kdy se při dotazu z indexu seřadí výsledky od nejlepšího výsledku (podle kritérií Googlu a personalizovaně uživateli). Nejčastější omyl je, myslet si, že procházeno znamená indexováno. Stránka může být opakovaně procházená, a přesto neindexovaná, pokud ji Google vyhodnotí jako obsahově slabou, nepřínosnou, duplicitní nebo zablokovanou. Stav zjistíš v Google Search Console v reportu Stránky a nástrojem Kontrola URL. Zde se dá i Google postrkávat k tomu, aby obsah rychleji zaindexoval. Indexaci pomáhají i strukturovaná data, protože vyhledávači jasně řeknou, o čem stránka je.

Proč na indexaci záleží
Indexace je vstupní brána do organické návštěvnosti. Bez ní je veškerá další SEO práce zbytečná, protože stránka, která není v indexu Googlu, nemůže získat jediného návštěvníka z vyhledávání. V praxi jde o dvě věci. Zaprvé nechat spolehlivě indexovat hodnotné stránky, k čemuž slouží kvalitní obsah, interní odkazy, XML sitemapa a čistý robots.txt. Zadruhé naopak bránit indexaci balastu, jako jsou filtrové a duplicitní adresy (duplicitní obsah, h1 nebo titulky), děkovací stránky nebo koš, aby se index i takzvaný crawl budget neplýtvaly na zbytečnosti. Řízená indexace znamená čistý a silný web v očích vyhledávače. Kontrolu stavu indexace proto zařazuji do každého SEO auditu.
Kam to sahá dál
Indexace není jen technikálie, je to jedna z nejstarších lidských potřeb uspořádat svět tak, abychom v něm něco našli. Od rejstříků v knihách přes knihovní katalogy až po Google platí tvrdé pravidlo: co není v indexu, jako by neexistovalo. A právě teď se ten princip mění potřetí. Umělá inteligence totiž neindexuje klasicky, ale převádí obsah do vektorů a významů. Boj o to být nalezen tím nekončí, jen se přesouvá z Googlu do odpovědí AI, což je celé téma GEO. Zajímavá je i psychologická rovina. Díky heuristice dostupnosti považujeme za důležité to, co se nám snadno vybaví nebo najde. Index tak nenápadně určuje, co pro nás vůbec existuje. Když se jako SEO konzultant dívám na SERP (výsledky ve vyhledávači), tak se snažím rozluštit, jestli odpovídá pořadí tomu, jak to má vypadat. Jestli opravdu nejlepší značka s nejširší nabídkou je jako první nebo jestli má jen lepší SEO.
Nejčastější chyby
- Zapomenutý příkaz noindex z testovací verze, který po spuštění webu tiše blokuje indexaci. To se děje i na části webu.
- Blokace v souboru robots.txt, která brání procházení, a tím i indexaci.
- Canonical mířící na jinou adresu, takže se indexuje něco jiného, než chceš.
- Osiřelé stránky bez jediného interního odkazu, na které se Googlebot nedostane.
Otázky kolem indexace
Co je to indexace?
Proces, při kterém vyhledávač uloží a zpracuje obsah stránky do svého indexu, ze kterého pak tvoří výsledky vyhledávání.
Jaký je rozdíl mezi crawlingem a indexací?
Crawling je procházení stránky robotem, indexace je uložení jejího obsahu do databáze. Procházená stránka nemusí být indexovaná.
Jak zjistím, jestli je stránka v indexu Googlu?
V Google Search Console nástrojem Kontrola URL, nebo dotazem site dvojtečka adresa přímo ve vyhledávači.
Jak dlouho indexace trvá?
Od hodin po týdny. U nových nebo slabě prolinkovaných webů déle. Pomůže sitemapa, interní odkazy a ruční požadavek o indexaci v Search Console.

