Pięć populacji, jeden przyrząd

Pięć razy skierowaliśmy tę samą checklistę na inną populację polskiego internetu: 440 organizacji w pięciu próbach, dobranych z pięciu niezależnych rejestrów. Ta strona nie jest szóstym pomiarem — nie pobrano dla niej ani jednej strony. Stawia jedyne pytanie, którego żadne z pięciu badań nie mogło postawić samo: co z tych wyników jest właściwością branży, a co właściwością polskiego internetu.

Odpowiedź jest krótsza, niż się spodziewaliśmy. Na 3 z 7 zestawionych ustaleń pięć populacji mieści się w 10 punktach od siebie — spółka giełdowa, sklep, software house, urząd miasta i hotel wypadają tak samo. Odstaje jedno. A jedna pozycja nie orzekła o nikim ani razu, i to jest ustalenie o naszym przyrządzie, nie o kimkolwiek mierzonym.

Pięć prób obok siebie

Podstawa jest porównawcza, nie próbkowa, i to nie jest szczegół. Pierwsze badanie odrzucało domeny, których nie dało się pobrać; cztery następne trzymają je w próbie z werdyktem „nie da się sprawdzić". Zestawienie mianowników z próby przypisałoby młodszym populacjom różnicę wyprodukowaną przez tę niezgodność, a nie przez rynek — dlatego każda kolumna liczy organizacje, które jej własne badanie uznaje za porównywalne.

Ta sama checklista na pięciu próbach. Podstawa każdej kolumny to organizacje, które ta próba uznaje za porównywalne — razem 395 z 440 zmierzonych.
Ustaleniespółki z WIG20 i mWIG40domeny e-commercesoftware house'y z SoDAmiasta na prawach powiatuhotele pięciogwiazdkowe
czy ktoś je cytuje — pozycja, której nie da się rozstrzygnąć z kodu strony55 z 55 (100%)128 z 128 (100%)94 z 94 (100%)59 z 59 (100%)59 z 59 (100%)
nie ma na stronie wypowiedzi nazwanego człowieka52 z 55 (95%)123 z 128 (96%)89 z 94 (95%)57 z 59 (97%)58 z 59 (98%)
nie prowadzi historii zmian47 z 55 (85%)111 z 128 (87%)86 z 94 (91%)54 z 59 (92%)57 z 59 (97%)
nie linkuje wiarygodnych źródeł zewnętrznych53 z 55 (96%)121 z 128 (95%)85 z 94 (90%)20 z 59 (34%)59 z 59 (100%)
deklaruje typ Article w danych strukturalnych0 z 55 (0%)7 z 128 (5%)4 z 94 (4%)1 z 59 (2%)0 z 59 (0%)
ma kompletną encję Organization4 z 55 (7%)19 z 128 (15%)16 z 94 (17%)0 z 59 (0%)1 z 59 (2%)
odprawia boty AI3 z 55 (5%)24 z 128 (19%)8 z 94 (9%)6 z 59 (10%)5 z 59 (8%)

Wikidaty w tej tabeli nie ma, choć mierzy ją każde z pięciu badań. Sonda pyta o encję pod nazwą, którą przyrząd odczytał ze strony — a wśród miast prawie żadne nie publikuje maszynowo czytelnej nazwy urzędu, więc nazwą stawał się pierwszy człon <title> — dla Gdańska „Oficjalny portal miasta Gdańska", a dla nielicznych po prostu „Strona główna". Kolumna, w której jedna komórka znaczy co innego niż pozostałe, jest gorsza niż brak kolumny.

Co się powtarza

Najostrzej powtarza się brak nazwanego człowieka przy treści: 52 z 55 spółek, 123 z 128 sklepów, 89 z 94 software house'ów, 57 z 59 miast i 58 z 59 hoteli nie ma na stronie ani jednej wypowiedzi podpisanej imieniem i nazwiskiem. Rozpiętość między pięcioma niezależnymi próbami wynosi 3 pkt. Tuż za progiem stoi nieprowadzenie historii zmian — 85–97%, czyli brak jakiegokolwiek śladu, że treść była kiedykolwiek aktualizowana. Rozpiętość 12 pkt jest o 2 pkt ponad granicę, przy której nazywamy ustalenie powtarzalnym, więc go tak nie nazywamy: różnica między populacjami jest tu za duża, żeby mówić o jednej właściwości polskiego internetu.

Obie pozycje są tanie do naprawienia i obie są dokładnie tym, czego silnik szuka, kiedy decyduje, czy stronę zacytować: kto to napisał i kiedy. Wynik powtórzony na pięciu populacjach przestaje być cechą branży — zaczyna być cechą tego, jak w Polsce buduje się strony firmowe. Dlatego rozstrzyga próg, a nie wrażenie: policzona rozpiętość mówi, przy której z tych dwóch pozycji wolno tak powiedzieć, a przy której jeszcze nie.

Co odstaje: miasta na prawach powiatu

Jedno ustalenie łamie schemat, i to w stronę dobrą. Przy pozycji „nie linkuje wiarygodnych źródeł zewnętrznych" cztery populacje leżą w przedziale 90–100%, a miasta na prawach powiatu — 34%. Różnica wobec najbliższej z pozostałych czterech to 56 pkt, czyli więcej niż rozpiętość wszystkich pozostałych ustaleń tej tabeli razem wziętych (51 pkt).

Wyjaśnienie jest strukturalne, nie zasługowe: urząd pisze o rzeczach, które mają podstawę prawną, więc linkuje ustawy, rozporządzenia i dzienniki urzędowe. Robi z powodów, które nie mają nic wspólnego z widocznością w AI, dokładnie to, czego ta widoczność wymaga. Firma, która chce ten wynik powtórzyć, nie potrzebuje nowego pomysłu — potrzebuje przestać pisać o swojej dziedzinie bez odsyłania do czegokolwiek poza własnym serwisem.

Czego nasz przyrząd nie rozstrzygnął o nikim

Pozycja „czy ktoś je cytuje — pozycja, której nie da się rozstrzygnąć z kodu strony" ma w tej tabeli 100% w każdej kolumnie, i nie znaczy to, że nikogo nie cytują. Znaczy, że na wszystkich 395 organizacjach nie zapadł ani jeden werdykt — bo tego nie widać w kodzie strony. Cytowanie dzieje się po stronie silnika, a my mierzymy warunki wstępne.

Publikujemy to zamiast pominąć, z dwóch powodów. Po pierwsze, serwis, którego tezą jest „mierzymy widoczność w AI", ma obowiązek powiedzieć, której jej części nie mierzy. Po drugie liczba 100% w kolumnie wyników wygląda identycznie jak ustalenie o mierzonych — i gdyby ktoś ją tak przeczytał, wyszedłby z przekonaniem, że nikt w Polsce nie jest cytowany. To dwie przeciwne rzeczy pod tym samym zapisem.

Czego to zestawienie nie rozstrzyga

Ostatnia aktualizacja:

Pięć przebiegów, z których zbudowano tę stronę, jest opublikowanych w całości na licencji CC BY 4.0, wiersz po wierszu, razem z regułami doboru prób:

Samo zestawienie — siedem ustaleń na wyrównanej podstawie, rozpiętość każdego z nich i progi, które rozstrzygają, co nazywamy tu powtórzeniem, a co odstępstwem — jest osobnym plikiem, bo nie ma go w żadnym z tamtych pięciu: dane przekroju (JSON, CC BY 4.0). Cytując pojedynczą liczbę o jednej populacji, lepiej sięgnąć po jej własne badanie wyżej.

Reguły wspólne dla wszystkich edycji — dobór próby, źródła adresów, brak oceny końcowej, testowanie hipotez — opisuje metodologia badań.

Powiązane pytania

Wróć na stronę główną Visibility by Xfaang