Zaplatíte si PR výstup v médiách. Uvidia ho však aj modely AI?
Veľký prehľad slovenských webov

Zhrnutie

  • Skúmali sme, ktoré weby povoľujú alebo zakazujú prístup LLM nástrojov na svoju stránku. To totiž rozhoduje o tom, či sa tieto výstupy zobrazia v odpovediach jazykových modelov a má to priamy dopad na dosah mediálnych výstupov či blogov.
  • Robots.txt má 16 zo 17 skúmaných webov. Pravda.sk ho nemá vôbec, takže pre LLM nástroje na ňom neplatí žiadne pravidlo. LLMs.txt, čiže mapu obsahu pripravenú priamo pre jazykové modely, má z celej vzorky jediný web, a to sme.sk.
  • Najviac blokovaný je CCBot, ktorý je blokovaný na siedmich zo 17 webov, nasleduje GPTBot na šiestich a Google-Extended na piatich. Naopak, najmenej blokované sú nástroje Anthropicu ClaudeBot, anthropic-ai a Claude-Web spolu s nástrojmi Claude-User a Perplexity-User, každý z nich je blokovaný len na troch portáloch. Tieto dva prichádzajú na web až na základe zadania užívateľa.
  • Aspoň jeden zo sledovaných nástrojov blokuje sedem webov, teda sme.sk, pluska.sk, cas.sk, trend.sk, dennikn.sk, markiza.sk a refresher.sk. Zvyšných deväť webov s pravidlami nechá prejsť všetkých dvanásť sledovaných nástrojov.

Dôležitosť vyhľadávania cez AI narastá a viditeľnosť značky v jazykových modeloch je kľúčová pre komerčný úspech firmy. Preto je dôležité, či vaše mediálne výstupy na weboch uvidí aj umelá inteligencia. Prinášame veľký prehľad toho, ktoré LLM nástroje sú na jednotlivých stránkach blokované alebo povolené.

Nadväzujeme tým na našu augustovú analýzu hodnotového nastavenia jazykových modelov, v ktorej sme na slovenských témach sledovali, ako modely odpovedajú a nakoľko sú ochotné zaujať postoj. Tentoraz posúvame tú istú tému o krok ďalej, od otázky, ako jazykové modely odpovedajú, k otázke, či sa do ich odpovedí vôbec dostane obsah slovenských médií. Pre komunikáciu z toho vyplýva nový typ rizika. Nie každý zaplatený výstup pomôže tak, ako od neho čakáme. Článok môže vyjsť na správnom médiu, môže mať dobrý dosah vo vyhľadávaní aj na sociálnych sieťach, a napriek tomu zostane pre jazykové modely neviditeľný, pretože samotné médium im vstup zakázalo. Pri plánovaní výstupov a pri GEO optimalizácii preto treba pozerať aj na to, ako sa vydavateľ k LLM nástrojom stavia.

Zoznam sledovaných webov vychádza zo zoznamu IAB. Do tejto analýzy sme však vybrali len 17 relevantných portálov a 12 LLM nástrojov. Výsledky pre ďalších 47 portálov a štyri nástroje od spoločností Bytedance, Meta, Amazon a Apple máme k dispozícii na vyžiadanie.

To, či je daná stránka pre umelú inteligenciu prístupná, je dané nastaveniami súborov robots.txt a llms.txt. Súbor robots.txt špecifikuje, ktoré nástroje sú na webe povolené a ktoré sú blokované. V prípade, že webstránka tento súbor nemá, tak sú povolené všetky nástroje. Súbor llms.txt predstavuje mapu stránky, ktorá pomáha jazykovým modelom umelej inteligencie správne nájsť určitý obsah a citovať ho vo svojich odpovediach.

Ako taký zákaz vyzerá v praxi, je vidieť na denníku Čas, ktorý má blok napísaný priamo, vrátane komentára, že ide o nástroje AI, LLM a vyhľadávacích asistentov. Keď sa potom používateľ chatbota opýta na článok z takého webu, asistent ho nedokáže otvoriť a namiesto zhrnutia oznámi, že prístup na stránku bol zablokovaný.

Ukážka blokovania LLM nástrojov v súbore robots.txt webu cas.sk a chybová hláška AI asistenta

Nejde pritom o technickú prekážku. Server webu Čas odpovedá komukoľvek vrátane nástrojov jazykových modelov a článok vydá bez problémov. Blokovanie je deklarácia v súbore robots.txt, ktorú veľkí dodávatelia modelov dodržiavajú dobrovoľne, takže účinnosť takého zákazu stojí na tom, že sa nástroj správa slušne.

Kde vaše výstupy uvidí aj AI?

Výsledky pre konkrétny web v heatmape je možné interaktívne filtrovať.

Prvým záverom merania je, že väčšina webov necháva pre všetky nástroje voľný prístup. Ďalej vidíme, že pri selektívnom blokovaní sa weby do istej miery zhodujú na tom, ktoré nástroje blokovať. V celom meraní je iba jeden portál, ktorý súbor robots.txt nemá a teda žiadne pravidlá nestanovuje. Ide o web pravda.sk.

Blokujúce weby a blokované nástroje

Z celkového počtu 17 portálov povoľuje všetky nástroje deväť webov, medzi nimi napríklad hnonline.sk, aktuality.sk alebo ta3.com. Selektívne blokovanie niektorých nástrojov si zvolilo sedem webov, medzi nimi sme.sk, trend.sk alebo refresher.sk. Najmenšou kategóriou je jediný portál bez robots.txt, ktorý žiadne pravidlá nestanovuje, a to pravda.sk.

Zo skúmanej vzorky 17 webov ich iba sedem blokuje aspoň jeden nástroj. Na zdieľanom prvom mieste sa umiestnila pluska.sk, cas.sk a trend.sk, ktoré blokujú zhodne po deväť nástrojov. Na druhom mieste sa umiestnilo sme.sk, ktoré si na svojom webe nepraje sedem nástrojov, a trojicu uzatvára Denník N, ktorý blokuje šesť nástrojov.

Problematika je zaujímavá aj z pohľadu jednotlivých nástrojov. Najviac blokovaným je CCBot neziskovej organizácie Common Crawl, ktorý je blokovaný na siedmich weboch. CCBot vytvára voľne dostupný verejný archív webu, ktorý neskôr slúži ako tréningový dataset pre množstvo jazykových modelov naraz. Druhým najviac blokovaným je GPTBot spoločnosti OpenAI, ktorý zbiera obsah na trénovanie jej modelov. Blokovanie tohto nástroja má vplyv na to, aké informácie sa dostanú do tréningových dát nových modelov, na vyhľadávanie v ChatGPT však nie. O tom, či sa web zobrazí ako zdroj v odpovediach, rozhoduje samostatný OAI-SearchBot. Trojicu uzatvára Google-Extended. Nejde o nástroj, ktorý by chodil po weboch, ani nemá vlastného user agenta, je to prepínač v súbore robots.txt, ktorým web určuje, či Google smie už prehľadaný obsah použiť na trénovanie Gemini a na podkladanie odpovedí. Na crawlovanie webu ani na pozíciu v Google Search nemá vplyv.

Situácia je zaujímavá aj na opačnom konci rebríčka, kde vidíme päť nástrojov blokovaných len na troch weboch. Z tejto pätice vyčnievajú anthropic-ai a Claude-Web, keďže tieto mená už spoločnosť Anthropic, ktorá vyvíja model Claude, v aktuálnej dokumentácii neuvádza. Aktuálne sú ClaudeBot, Claude-User a Claude-SearchBot. Výsledok tak poukazuje na dôležitosť priebežnej aktualizácie súboru robots.txt, pretože tri weby blokujú nástroje, ktoré sa už nepoužívajú. V tejto skupine teda ostáva tréningový ClaudeBot v spoločnosti nástrojov Claude-User a Perplexity-User, ktoré na web prichádzajú až na zadanie užívateľa.

Blokovanie pritom z pohľadu vydavateľa nie je rozmar. Spravodajský web žije z návštevnosti a z počtu zobrazených stránok, lebo na nich predáva reklamu. Keď chatbot prevezme obsah článku a používateľovi ho zhrnie priamo v odpovedi, čitateľ už nemá dôvod na web prísť, a médium tak prichádza o návštevu stránky, teda o príjem, hoci obsah zaplatila jeho redakcia. Osobitnou kapitolou sú tréningové nástroje, pri ktorých médium odovzdá obsah do modelu bez akejkoľvek protihodnoty a bez uvedenia zdroja. Viaceré veľké vydavateľstvá preto prístup blokujú dovtedy, kým sa nedohodnú na licenčnej zmluve. Blokovanie je v tomto svetle obranou obchodného modelu, nie nepochopením technológie.

Pri nástrojoch, ktoré prichádzajú na zadanie užívateľa, treba počítať s tým, že zápis v robots.txt nemusí byť rozhodujúci. OpenAI vo svojej dokumentácii priamo uvádza, že pri akciách vyvolaných užívateľom sa pravidlá robots.txt nemusia uplatniť, keďže požiadavka neprichádza od crawlera, ale od človeka v chate. Anthropic to má nastavené inak a zakázanie nástroja Claude-User podľa firmy zabráni načítaniu obsahu v reakcii na dotaz užívateľa. Pre web z toho vyplýva, že blokovanie tejto skupiny nástrojov je najmenej spoľahlivé zo všetkých a zároveň najmenej výhodné, pretože obmedzuje práve tie návštevy, ktoré vznikajú z konkrétneho záujmu ľudského užívateľa. Ak je cieľom dosah obsahu, má logiku blokovať tréningové nástroje a vyhľadávacie aj tie na zadanie užívateľa nechať prejsť. Tréningom vydavateľ prichádza o obsah bez protihodnoty, kým citovanie v odpovediach mu privádza čitateľov.

Zhrnutie

Experti z marketingu a komunikácie už vedia, že pre ich prácu je viditeľnosť značky v odpovediach umelej inteligencie kľúčovou novou disciplínou. Odpovede, ktoré vám chatbot ponúka, však závisia aj od toho, k akým dátam má prístup, a práve preto je dôležité vedieť, na akých portáloch budú mediálne výstupy pre umelú inteligenciu neviditeľné. Všeobecným trendom na kľúčových slovenských weboch nateraz je prístup LLM nástrojov blokovať len selektívne a obmedzene. Ak sa na problém pozeráte z hľadiska vašej vlastnej značky, tak priebežné aktualizácie súborov robots.txt a llms.txt patria medzi dobré zvyky z praxe, ktoré vám pomôžu s AI viditeľnosťou vašej firmy.

Chcete dostávať naše dáta a analýzy a byť súčasťou komunity?

Získajte prístup k našim pravidelným newsletterom a unikátnym dátam. Stačí zadať váš e-mail:
MAILOVÁ ADRESA *