Pięć razy skierowaliśmy tę samą checklistę na inną populację polskiego internetu: 440 organizacji w pięciu próbach, dobranych z pięciu niezależnych rejestrów. Ta strona nie jest szóstym pomiarem — nie pobrano dla niej ani jednej strony. Stawia jedyne pytanie, którego żadne z pięciu badań nie mogło postawić samo: co z tych wyników jest właściwością branży, a co właściwością polskiego internetu.
Odpowiedź jest krótsza, niż się spodziewaliśmy. Na 3 z 7 zestawionych ustaleń pięć populacji mieści się w 10 punktach od siebie — spółka giełdowa, sklep, software house, urząd miasta i hotel wypadają tak samo. Odstaje jedno. A jedna pozycja nie orzekła o nikim ani razu, i to jest ustalenie o naszym przyrządzie, nie o kimkolwiek mierzonym.
Podstawa jest porównawcza, nie próbkowa, i to nie jest szczegół. Pierwsze badanie odrzucało domeny, których nie dało się pobrać; cztery następne trzymają je w próbie z werdyktem „nie da się sprawdzić". Zestawienie mianowników z próby przypisałoby młodszym populacjom różnicę wyprodukowaną przez tę niezgodność, a nie przez rynek — dlatego każda kolumna liczy organizacje, które jej własne badanie uznaje za porównywalne.
| Ustalenie | spółki z WIG20 i mWIG40 | domeny e-commerce | software house'y z SoDA | miasta na prawach powiatu | hotele pięciogwiazdkowe |
|---|---|---|---|---|---|
| czy ktoś je cytuje — pozycja, której nie da się rozstrzygnąć z kodu strony | 55 z 55 (100%) | 128 z 128 (100%) | 94 z 94 (100%) | 59 z 59 (100%) | 59 z 59 (100%) |
| nie ma na stronie wypowiedzi nazwanego człowieka | 52 z 55 (95%) | 123 z 128 (96%) | 89 z 94 (95%) | 57 z 59 (97%) | 58 z 59 (98%) |
| nie prowadzi historii zmian | 47 z 55 (85%) | 111 z 128 (87%) | 86 z 94 (91%) | 54 z 59 (92%) | 57 z 59 (97%) |
| nie linkuje wiarygodnych źródeł zewnętrznych | 53 z 55 (96%) | 121 z 128 (95%) | 85 z 94 (90%) | 20 z 59 (34%) | 59 z 59 (100%) |
| deklaruje typ Article w danych strukturalnych | 0 z 55 (0%) | 7 z 128 (5%) | 4 z 94 (4%) | 1 z 59 (2%) | 0 z 59 (0%) |
| ma kompletną encję Organization | 4 z 55 (7%) | 19 z 128 (15%) | 16 z 94 (17%) | 0 z 59 (0%) | 1 z 59 (2%) |
| odprawia boty AI | 3 z 55 (5%) | 24 z 128 (19%) | 8 z 94 (9%) | 6 z 59 (10%) | 5 z 59 (8%) |
Wikidaty w tej tabeli nie ma, choć mierzy ją każde z pięciu badań. Sonda pyta o encję
pod nazwą, którą przyrząd odczytał ze strony — a wśród miast prawie żadne nie publikuje
maszynowo czytelnej nazwy urzędu, więc nazwą stawał się pierwszy człon
<title> — dla Gdańska „Oficjalny portal miasta Gdańska", a dla nielicznych
po prostu „Strona główna". Kolumna, w której
jedna komórka znaczy co innego niż pozostałe, jest gorsza niż brak kolumny.
Najostrzej powtarza się brak nazwanego człowieka przy treści: 52 z 55 spółek, 123 z 128 sklepów, 89 z 94 software house'ów, 57 z 59 miast i 58 z 59 hoteli nie ma na stronie ani jednej wypowiedzi podpisanej imieniem i nazwiskiem. Rozpiętość między pięcioma niezależnymi próbami wynosi 3 pkt. Tuż za progiem stoi nieprowadzenie historii zmian — 85–97%, czyli brak jakiegokolwiek śladu, że treść była kiedykolwiek aktualizowana. Rozpiętość 12 pkt jest o 2 pkt ponad granicę, przy której nazywamy ustalenie powtarzalnym, więc go tak nie nazywamy: różnica między populacjami jest tu za duża, żeby mówić o jednej właściwości polskiego internetu.
Obie pozycje są tanie do naprawienia i obie są dokładnie tym, czego silnik szuka, kiedy decyduje, czy stronę zacytować: kto to napisał i kiedy. Wynik powtórzony na pięciu populacjach przestaje być cechą branży — zaczyna być cechą tego, jak w Polsce buduje się strony firmowe. Dlatego rozstrzyga próg, a nie wrażenie: policzona rozpiętość mówi, przy której z tych dwóch pozycji wolno tak powiedzieć, a przy której jeszcze nie.
Jedno ustalenie łamie schemat, i to w stronę dobrą. Przy pozycji „nie linkuje wiarygodnych źródeł zewnętrznych" cztery populacje leżą w przedziale 90–100%, a miasta na prawach powiatu — 34%. Różnica wobec najbliższej z pozostałych czterech to 56 pkt, czyli więcej niż rozpiętość wszystkich pozostałych ustaleń tej tabeli razem wziętych (51 pkt).
Wyjaśnienie jest strukturalne, nie zasługowe: urząd pisze o rzeczach, które mają podstawę prawną, więc linkuje ustawy, rozporządzenia i dzienniki urzędowe. Robi z powodów, które nie mają nic wspólnego z widocznością w AI, dokładnie to, czego ta widoczność wymaga. Firma, która chce ten wynik powtórzyć, nie potrzebuje nowego pomysłu — potrzebuje przestać pisać o swojej dziedzinie bez odsyłania do czegokolwiek poza własnym serwisem.
Pozycja „czy ktoś je cytuje — pozycja, której nie da się rozstrzygnąć z kodu strony" ma w tej tabeli 100% w każdej kolumnie, i nie znaczy to, że nikogo nie cytują. Znaczy, że na wszystkich 395 organizacjach nie zapadł ani jeden werdykt — bo tego nie widać w kodzie strony. Cytowanie dzieje się po stronie silnika, a my mierzymy warunki wstępne.
Publikujemy to zamiast pominąć, z dwóch powodów. Po pierwsze, serwis, którego tezą jest „mierzymy widoczność w AI", ma obowiązek powiedzieć, której jej części nie mierzy. Po drugie liczba 100% w kolumnie wyników wygląda identycznie jak ustalenie o mierzonych — i gdyby ktoś ją tak przeczytał, wyszedłby z przekonaniem, że nikt w Polsce nie jest cytowany. To dwie przeciwne rzeczy pod tym samym zapisem.
Ostatnia aktualizacja:
Pięć przebiegów, z których zbudowano tę stronę, jest opublikowanych w całości na licencji CC BY 4.0, wiersz po wierszu, razem z regułami doboru prób:
Samo zestawienie — siedem ustaleń na wyrównanej podstawie, rozpiętość każdego z nich i progi, które rozstrzygają, co nazywamy tu powtórzeniem, a co odstępstwem — jest osobnym plikiem, bo nie ma go w żadnym z tamtych pięciu: dane przekroju (JSON, CC BY 4.0). Cytując pojedynczą liczbę o jednej populacji, lepiej sięgnąć po jej własne badanie wyżej.
Reguły wspólne dla wszystkich edycji — dobór próby, źródła adresów, brak oceny końcowej, testowanie hipotez — opisuje metodologia badań.