Zmierzyliśmy wszystkie 111 hoteli pięciogwiazdkowych w Polsce — populację bierzemy z rejestru państwowego, więc nikt nie musiał wcześniej podać nam swojej strony, żeby się w tej próbie znaleźć. Pierwsze ustalenie zapada, zanim cokolwiek pobierzemy: 29 ze 111 hoteli nie ma w rejestrze adresu, pod którym stoi tylko ten jeden podmiot. Adres własny podało 76 ze 111 i to na nich uruchomiliśmy checklistę, którą przeszły wcześniej spółki giełdowe, sklepy, software house'y i miasta. Stronę oddało 59 z nich.
Oś adresowa nie jest tłem dla checklisty. To pomiar na całej populacji, z datą, powtarzalny w tym samym rejestrze za trzy lata — i mówi o polu, które wypełnia sam hotel, nie o tym, czy hotel ma stronę.
Mierzymy warunki wstępne, nie efekt: czy silnik generatywny może dotrzeć do strony, pobrać ją, przeczytać i znaleźć na niej treść w formie nadającej się do zacytowania. Czy faktycznie cytuje — to inny pomiar i tego raport nie rozstrzyga.
Populacja jest zamknięta i policzalna, więc pierwsza rzecz, którą da się z niej zrobić, to tabela od najlepszego do najgorszego. Nie robimy tego i prosimy, żeby nie robić tego z naszych danych — powód opisuje metodologia: pozycje checklisty nie mają wspólnej wagi, „nie dotyczy" nie jest porażką, a „nie umiem rozstrzygnąć" nie jest wynikiem o nikim. Nie wystawiamy oceny końcowej ani jednej liczby na hotel — ani na tej stronie, ani w opublikowanym pliku, który niesie werdykty wiersz po wierszu właśnie po to, żeby dało się nas sprawdzić bez wiary na słowo.
Przy hotelach dochodzi powód, którego wcześniejsze edycje nie miały w tej postaci. Ranking
„widoczności w AI" czytałby się jak ranking hoteli — a to są dwie zupełnie różne rzeczy i tę
drugą ten pomiar mierzy w zerowym stopniu. Dlatego nazwy padają w tym raporcie dokładnie
w dwóch miejscach i w obu z tego samego powodu: przy adresie, który hotel sam podał państwu,
i przy jedynej stronie, która publikuje kompletną encję Organization. Oba wyniki
są binarne, publiczne i nie zakładają niczyjej intencji. Przy wadzie, której właściciel nie
widzi, nazwy nie ma nigdzie.
Populacją są wszystkie obiekty kategorii pięciogwiazdkowej w Centralnym Wykazie Obiektów
Hotelarskich (CWOH), publikowanym pod api.turystyka.gov.pl. Wybór robi sam
rejestr: bierzemy wiersze o rodzaju RODZ_HOT i kategorii
KAT_5ST_HOT, stan na 7 września 2026. Jest ich 111
i tyle samo wierszy ma opublikowany zbiór — żaden nie wypadł z próby, także te, których nie
dało się zmierzyć.
Adres bierzemy z tego samego rejestru, z pola wypełnianego przez sam obiekt, i mierzymy go
dosłownie, z przedrostkiem www. włącznie. To nie jest pedanteria:
konwencja, która po drodze poprawia cudzy adres, potrafi
wyprodukować ustalenie — w badaniu miast obcięcie www. zamieniło działające
serwisy w nieosiągalne.
Zanim cokolwiek pobierzemy, rejestr sam dzieli tę populację na cztery klasy. Adres własny znaczy dokładnie tyle, że hosta z tego pola nie dzieli z tym hotelem żaden inny podmiot rejestru. Domenę dzieloną liczymy z rejestru, a nie z listy sieci hotelowych — lista marek byłaby filtrem uznaniowym w technicznym przebraniu i zawsze byłaby o jedną sieć z tyłu. Dlatego mieści się w niej i domena rezerwacyjna wielkiej sieci, i domena dzielona z drugim obiektem tego samego właściciela: z pola adresu widać jedno i to samo — że pod tym adresem stoi serwis więcej niż jednego podmiotu, więc wynik pomiaru nie należałby do tego hotelu.
„Więcej niż jeden podmiot” liczymy po właścicielu i gminie z wpisu, a nie po liczbie wpisów, i to rozróżnienie ma swoją historię: rejestr listuje jeden hotel dwa razy, kiedy jego część nosi inną kategorię gwiazdek. Liczone po wpisach taki hotel „dzielił” domenę sam ze sobą i trafiał na naszą listę nazw jako pozbawiony własnej strony, którą ma. Liczone po podmiotach — nie trafia.
Ta oś niczego nie pobiera. Liczy, na co wskazuje adres, który każdy hotel podał państwu — i jest jedynym ustaleniem tej edycji obejmującym całą populację, bez żadnego zawężenia.
| Co pokazuje adres z rejestru | Ile hoteli |
|---|---|
| adres własny — host, którego w rejestrze nie dzieli z tym hotelem żaden inny podmiot | 76 ze 111 (68%) |
| domena dzielona — pod tym hostem rejestr trzyma wpisy więcej niż jednego podmiotu | 15 ze 111 (14%) |
| rejestr nie podaje żadnego adresu strony | 14 ze 111 (13%) |
| adres wskazuje podstronę, a nie korzeń serwisu | 6 ze 111 (5%) |
Dwie z tych klas — brak adresu i domena dzielona — wymieniamy z nazwy, razem 29 ze 111 hoteli. Regułę opisuje metodologia: nazywamy tam, gdzie wynik jest binarny, publiczny i nie zakłada niczyjej intencji. Tutaj jest binarny (pole w rejestrze jest albo go nie ma), publiczny (rejestr jest otwarty i każdy może w nim sprawdzić to samo) i jest własną deklaracją hotelu, a nie skutkiem ubocznym cudzej konfiguracji. Jest też mniejszością, a lista mniejszości mówi coś, czego lista prawie całej próby nie mówi.
To nie jest zarzut i nie jest ustaleniem o jakości serwisu. Hotel bez adresu w rejestrze może mieć znakomitą stronę — my mierzymy jedno pole w publicznym rejestrze, a nie istnienie witryny, i właśnie dlatego nie szukaliśmy tych adresów w wyszukiwarce. Hotel pod domeną sieci zwykle stoi tam z decyzji sieci, nie własnej. Lista mówi tyle: pod adresem z rejestru nie da się rozstrzygnąć, co jest stroną tego hotelu.
Do nazwy dokładamy miasto z rejestru. Sama nazwa bywa w tej populacji wspólna dla dwóch różnych hoteli, a wtedy jeden z nich jest na tej liście, drugi nie — i właściciel tego drugiego czytałby własną nazwę na liście, na której go nie ma.
Lista jest sumą obu klas, alfabetycznie, jako zbiór nieuporządkowany; nie sumujemy jej
z niczym innym. Który hotel należy do której klasy, mówi kolumna addressClass
w opublikowanym pliku.
6 ze 111 adresów kończy się segmentem ścieżki: rejestr
wskazał stronę wewnątrz serwisu, a nie jego korzeń. Nie podstawialiśmy korzenia i nie
pobieraliśmy tych adresów. Powód jest jeden i dotyczy nas, nie ich: końcówka
/pl bywa folderem językowym własnego serwisu hotelu i bywa stroną obiektu
w cudzym serwisie, a z samego adresu — bez pobrania strony — nie da się jednego odróżnić od
drugiego. Zgadnięcie byłoby naszą decyzją wpisaną w cudzy wynik. Dlatego
żadnego z tych hoteli nie nazywamy, a jedyne, co o nich mówimy, to ile ich
jest.
Zanim padną odsetki: 17 z 76 hoteli, które podały adres własny, nie oddało strony klientowi, który nie ma przeglądarki. Zostają w próbie i w opublikowanych danych — mianownik, który po cichu traci wiersz, przestaje być odtwarzalny. Wypadają natomiast z podstawy, na której liczymy ustalenia niżej, bo na niepobranej stronie nie zmierzyliśmy niczego.
Żadnego z tych hoteli nie nazywamy. Wygasły certyfikat, zapora i strona, która się nie wczytała, to wady, których właściciel serwisu zwykle nie widzi — nazwisko przy takiej pozycji przypisuje decyzję, której nikt nie podjął. Nasza sonda jest klientem ścisłym: nie dobiera brakującego ogniwa łańcucha certyfikatów i nie klika „kontynuuj mimo ostrzeżenia". Czy człowiek z przeglądarką zobaczyłby te strony, tego nie mierzyliśmy — mierzymy klienta, którym jest crawler.
Przyczyn jest 9 i każda jest w danych zapisana osobno, bo „nieosiągalne" mieści w sobie rzeczy zupełnie różne.
Na certyfikacie TLS zatrzymuje się 9 z 17: certyfikat nie obejmuje nazwy, pod którą stoi serwer (6), serwer zerwał uzgadnianie TLS własnym błędem wewnętrznym (2), certyfikat wygasł (1).
Na warstwie sieci zatrzymuje się 5 z 17: serwer odmówił połączenia (2), domena nie ma rekordu DNS (1), połączenie stanęło i sonda przestała czekać na stronę (1), serwer nie przyjął połączenia w czasie, który daje sonda (1).
Odpowiedzią odmowną kończy się 3 z 17: serwer odpowiedział 403 (2), serwer odpowiedział 404 (1).
Podstawa tej osi to 59 z 76 hoteli z adresem własnym — te, których strona wróciła. To ta sama podstawa, na której tę edycję zestawia z wcześniejszymi strona przekrojowa, i nie mieszamy jej z mianownikiem 111: klasa adresu i werdykt checklisty to dwa pomiary o dwóch różnych zbiorach.
Jedna z 7 pozycji, które ta edycja rejestruje, nie stoi w tabeli niżej, bo nie jest ustaleniem o hotelach. Pozycja o cytowaniach ma 59 z 59 i nie znaczy, że nikt tych hoteli nie cytuje — znaczy, że nie zapadł ani jeden werdykt, bo cytowania nie widać w kodzie strony. Postawiona w tabeli, z odsetkiem i paskiem obok pozostałych, wyglądałaby dokładnie jak ustalenie o mierzonych, a to są dwie przeciwne rzeczy pod tym samym zapisem. Nie pomijamy jej, bo serwis, którego tezą jest „mierzymy widoczność w AI", ma obowiązek powiedzieć, której jej części nie mierzy.
| Ustalenie | Ile hoteli |
|---|---|
| nie linkuje wiarygodnych źródeł zewnętrznych | 59 z 59 (100%) |
| nie ma na stronie wypowiedzi nazwanego człowieka | 58 z 59 (98%) |
| nie prowadzi historii zmian | 57 z 59 (97%) |
| odprawia boty AI | 5 z 59 (8%) |
| ma kompletną encję Organization | 1 z 59 (2%) |
| deklaruje typ Article w danych strukturalnych | 0 z 59 (0%) |
Dwa wiersze tej tabeli warto powiedzieć zdaniem. Wiarygodnych źródeł
zewnętrznych nie linkuje 59 z 59 stron; kompletną encję
Organization — jedno maszynowo czytelne zdanie o tym, czyj to hotel, z adresem
i telefonem — publikuje 1 z 59.
Tę jedną nazywamy z imienia, i to jest drugie z dwóch miejsc, w których w tym raporcie padają nazwy. Lista tych, którym czegoś brakuje, obejmuje tu prawie całą podstawę i nie mówi nic; coś mówi lista tych, którzy coś mają, bo dowodzi, że się da.
Organization — 1 z 59:
STRADOM HOUSE AUTOGRAPH COLLECTION BY MARRIOTT (Kraków)Werdyktów „nie umiem rozstrzygnąć" na tej pozycji jest
0 z 59, więc na pozostałych 58 stronach
kompletnej encji po prostu nie ma — nikogo nie pominęliśmy.Zanim padnie liczba: blokada bota i decyzja o blokowaniu botów to dwie różne rzeczy i tego pomiaru nie wolno czytać jako drugiej. Reguły warstwy brzegowej bywają domyślne, kupowane w pakiecie z ochroną przed nadużyciami i niewidoczne dla tego, kto zamawiał serwis. Nasz pomiar widzi wyłącznie skutek.
Boty AI odprawia 5 z 59 stron. Wpis w
robots.txt ma 0 z nich, warstwa brzegowa odrzuca żądania
w 5 przypadkach, a oba naraz — w 0.
Zostaje 5, w których
robots.txt milczy, a bot i tak dostaje odmowę — czyli tam, gdzie nikt tego nie
zapisał i gdzie właściciel serwisu może o blokadzie nie wiedzieć.
Kolejność naprawy wychodzi z tych liczb sama i zaczyna się przed stroną. Najtańsza rzecz to jedno pole w publicznym rejestrze: adres, pod którym stoi ten hotel, a nie serwis sieci. Nie wymaga projektu ani budżetu, a bez niego wszystko dalsze jest pracą nad stroną, do której nikt nie ma jak trafić z jedynego miejsca, gdzie państwo trzyma listę takich obiektów.
Potem dostęp: adres, który odpowiada, i certyfikat obejmujący nazwę, pod którą stoi serwer. Na tej osi przepada dziś 17 z 76 hoteli, które adres własny podały — czyli praca, którą ktoś już wykonał, nie dociera do czytelnika, który nie ma przeglądarki. Potem jedno maszynowo czytelne zdanie o tym, czyj to hotel. Treść na końcu, bo praca nad treścią, której nikt nie pobiera, nie daje nic.
Dla hotelu sieciowego adresat tej poprawki bywa inny niż właściciel obiektu: jeśli w rejestrze stoi domena sieci, to decyzję o tym, co pod nią widać, podejmuje sieć. Poprawka w jednym szablonie zmienia wtedy wynik kilku hoteli naraz — i to jest jedyna droga tańsza niż 111 osobnych rozmów.
Surowy przebieg jest opublikowany na licencji CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/), wiersz po wierszu, razem z regułą doboru próby, rejestrem, z którego wzięliśmy adresy, klasą adresu każdego hotelu i listą sprawdzeń, których nasz przyrząd nie rozstrzyga za nikogo: pełne dane w JSON, żeby dało się nas sprawdzić bez powtarzania pomiaru. Jeśli mierzymy Cię błędnie, napisz — poprawimy i odnotujemy w historii zmian: pz@xfaang.com. Reguły, według których dobieramy próbę, liczymy odsetki i decydujemy, kogo nazwać z imienia, są wspólne dla wszystkich edycji i opisane osobno: metodologia badań.
Pomiar: 07.09.2026 · Ostatnia aktualizacja:
Tę checklistę stosujemy też do tej strony: jak na niej wypada.