Glicko kontra Elo: który rating pasuje do gry?

Pośrodku waga, na lewej szalce niebieskie figury szachowe, na pomarańczowej prawej ciemny skoczek, po lewej siedzi mężczyzna z laptopem, po prawej kobieta z podkładką, a za nimi wykres liniowy i tarcza do darta.

Rating 1650 może znaczyć bardzo różne rzeczy w zależności od tego, jak system do niego doszedł. Czy gracz wypracował go w setkach meczów rywalizacyjnych? Czy właśnie wrócił po długiej przerwie? A może to szybko rosnący nowicjusz, który rozegrał ledwie kilka partii? To jest prawdziwe pytanie stojące za zestawieniem Glicko kontra Elo. Oba systemy zamieniają wyniki w rating, ale Glicko dokłada kontekst, który ma znaczenie wtedy, gdy każdy rankingowy mecz backgammona ma być wyrównany.

Glicko kontra Elo: podstawowa różnica

Elo to system ratingowy, który większość graczy poznaje jako pierwszy. Zaczyna się od prostej myśli: przed meczem każdy gracz ma rating, a różnica między tymi ratingami wyznacza oczekiwany wynik. Pokonaj wyżej notowanego przeciwnika, a zyskasz więcej punktów. Przegraj z niżej notowanym, a stracisz więcej. Jeśli wynik zgadza się z oczekiwaniem, rating przesuwa się tylko nieznacznie.

To podejście jest eleganckie i łatwe do zrozumienia. Od gracza z ratingiem 1600 oczekuje się częstszych zwycięstw niż od gracza z ratingiem 1400, więc przy ich spotkaniu ten pierwszy ma więcej do stracenia. Elo sprawdza się szczególnie dobrze, gdy gracze grają często, ratingi zdążyły się ustabilizować, a system ma dość wyników, by oceniać wszystkich spójnie.

Jego ograniczeniem jest to, że sam rating nie mówi, jak bardzo system jest go pewny. Gracz z ratingiem 1600 po dziesięciu meczach i gracz z ratingiem 1600 po tysiącu meczów wyglądają w prostej tabeli Elo identycznie. Dobieranie przeciwników nie powinno ich jednak koniecznie traktować tak samo.

Glicko wypełnia tę lukę, dokładając do ratingu odchylenie ratingu, często nazywane RD. Rating szacuje umiejętności. RD szacuje, jak pewny tego oszacowania jest system. Niskie RD oznacza, że gracz ma pokaźną i świeżą historię meczów, a jego rating jest względnie stabilny. Wysokie RD oznacza większą niepewność, być może dlatego, że gracz jest nowy albo długo nie grał.

Glicko-2, czyli wersja używana w rankingowym dobieraniu przeciwników w Online Backgammon, dokłada trzeci sygnał: zmienność ratingu. Pełne omówienie tego, jak Glicko-2 ocenia gracza, przechodzi przez wszystkie trzy liczby po kolei; ten artykuł jest o tym, co realnie daje porównanie z Elo. Zmienność pomaga systemowi rozpoznać, czy wyniki gracza zmieniają się gwałtowniej, niż można było oczekiwać. To nie jest ocena, czy ktoś gra „nierówno". To matematyczny sposób, by aktualizacje ratingu reagowały odpowiednio wtedy, gdy poziom gracza może być w ruchu.

Dlaczego niepewność ma znaczenie w backgammonie

Backgammon jest grą strategiczną z realną wariancją. Dobre decyzje budują przewagę w dłuższym okresie, ale pojedynczy mecz potrafi się odwrócić przez jedno zbicie, nietrafiony strzał, kostkę w idealnym momencie albo trudne zbieranie pionków. System ratingowy nie może tej wariancji usunąć i nie powinien udawać, że każdy krótki wynik doskonale mierzy umiejętności.

Glicko-2 jest tu użyteczne, bo nie traktuje każdego gracza i każdego wyniku jako jednakowo informacyjnego. Zwycięstwo nad osadzonym przeciwnikiem blisko twojego poziomu mówi systemowi coś istotnego. Zaskakująca seria zupełnie nowego gracza też coś mówi, ale z większą początkową niepewnością wokół oszacowania.

Dla gracza, który rozwija się przez codzienne zagadki, doświadczenie meczowe i lepsze decyzje przy kostce, potrafi to być bardziej wyczulone niż system o stałym kroku aktualizacji. Wczesne wyniki szybciej ruszają rating tymczasowy albo niepewny. W miarę jak gracz buduje dorobek, rating się stabilizuje. To właściwy kompromis: najpierw miejsce na znalezienie swojego poziomu, potem ranking, który coś waży.

Ta sama zasada pomaga wracającym. Jeśli ktoś odchodzi na kilka miesięcy, jego stary rating wciąż jest użyteczną historią, ale nie powinien być traktowany jako doskonały dowód aktualnej formy. Glicko podnosi niepewność w czasie nieaktywności. Kiedy taki gracz wraca, system może szybciej uczyć się z nowych wyników, nie zakładając automatycznie, że osłabł.

Elo nie jest błędne, tylko rozwiązuje węższy problem

Nazywanie Glicko lepszym od Elo w każdych warunkach mija się z celem. Elo jest mocnym rozwiązaniem tam, gdzie priorytetem są prostota, przejrzystość i długoterminowa stabilność ratingu. Łatwiej też policzyć je w głowie. Znając różnicę ratingów i współczynnik aktualizacji, potrafisz z grubsza przewidzieć skutek wygranej albo przegranej.

Glicko jest subtelniejsze, ale ta subtelność sprawia, że pojedyncze zmiany ratingu trudniej wyjaśnić na pierwszy rzut oka. Dwaj gracze mogą wygrać tyle samo meczów i zobaczyć różny ruch, bo różnią się ich przeciwnicy, odchylenia ratingu i niedawna aktywność. Może to zaskoczyć kogoś, kto oczekuje, że każda wygrana warta jest ustaloną liczbę punktów.

Żaden z tych systemów nie jest skrótem omijającym podstawy. Wysoki rating buduje się mocniejszymi zagraniami pionkami, wiedzą, kiedy atakować, a kiedy stawiać kotwicę, zdyscyplinowanym używaniem kostki podwajającej i grą pod presją. Zadaniem systemu jest umieszczenie tych wyników w użytecznym kontekście, a nie tworzenie umiejętności, których nie ma.

Jak Glicko-2 tworzy lepsze mecze rankingowe

Najlepszy mecz rankingowy to nie po prostu mecz z najbliższym widocznym ratingiem. To mecz, w którym obaj gracze mają wiarygodną szansę się wykazać i w którym wynik poprawia rozumienie ich umiejętności przez system.

W Glicko-2 liczba, z którą gracz wchodzi do kolejki, jest już ukształtowana przez to, jak bardzo system jest jej pewny. Osadzony gracz z wąskim odchyleniem ratingu jest wielkością znaną, a jego rating porusza się wolno, bo jest blisko ustalonego werdyktu. Nowszy gracz z tą samą liczbą, ale szerszym odchyleniem, wielkością znaną jeszcze nie jest, więc jego rating porusza się szybciej. Dobieranie przeciwników łączy graczy według ratingu, więc to odchylenie decyduje o tym, jak szybko gwałtownie poprawiający się gracz zostanie przeniesiony na poziom, na którym są jego prawdziwi rywale.

Sprawia to też, że tabela wyników z czasem znaczy więcej. Rating ma odzwierciedlać osiągnięcia, ale pewność ma znaczenie przy porównywaniu graczy, którzy rozegrali bardzo różną liczbę partii. Aktywność nie jest jedyną miarą jakości, a jednak rating wypracowany w trwałej rywalizacji zasługuje na inny poziom zaufania niż zbudowany na małej próbie.

Dla poważnych graczy jest to zaleta, a nie komplikacja. Nie tylko zbierasz punkty. Budujesz rywalizacyjny dorobek przeciwko prawdziwym przeciwnikom. Każdy mecz rankingowy dokłada dowód, a z czasem system coraz trudniej poruszyć krótką dobrą passą albo chwilą pecha.

Uczciwość ratingu i uczciwość kości to dwie różne obietnice

Mądry system ratingowy nie sprawi, że nieuczciwe kości staną się do przyjęcia. Rating mierzy wyniki meczów; nie weryfikuje, jak powstały rzuty. W backgammonie online gracz potrzebuje i rywalizacyjnego dobierania przeciwników, i pewności, że sama gra nie została zmanipulowana.

Dlatego uczciwość ma dwie warstwy. Glicko-2 dba o to, by rankingi reagowały na wyniki z odpowiednią pewnością. System kości dowodliwie uczciwych zajmuje się integralnością samego zapisu meczu, pozwalając wyprowadzić rzuty zakończonego meczu na nowo z opublikowanych zapisów. Jedno chroni jakość rywalizacji w dłuższym okresie. Drugie daje graczom sposób na sprawdzenie warunków konkretnej partii.

Rozdzielanie tych pojęć ma znaczenie. Seria porażek nie dowodzi, że kości są nieuczciwe, a przejrzyste kości nie gwarantują, że każda aktualizacja ratingu będzie satysfakcjonująca. Gracz ma prawo oczekiwać systemu, który da się sprawdzić, wyjaśnić i któremu można ufać także wtedy, gdy plansza układa się nie po jego myśli.

Na co patrzeć zamiast na jedną zmianę ratingu

Pojedynczą liczbę po meczu łatwo przecenić. Po ciężkiej porażce można poczuć, że system wydał wyrok na twoje umiejętności. Nie wydał. Przetworzył jeden wynik wewnątrz większego dorobku, który obejmuje siłę przeciwnika, pewność twojego ratingu i twoją niedawną aktywność.

Patrz na dłuższy wzorzec. Czy częściej wygrywasz z graczami w okolicy twojego ratingu? Czy twoje decyzje przy kostce się poprawiają? Czy rozpoznajesz, kiedy blokada jest mocniejsza niż luźny blot i kiedy bezpieczne zagranie oddaje zbyt dużo przewagi? Rating na ogół podąża za jakością tych decyzji, choć nie po linii prostej.

Jeśli jesteś nowy, rozegraj dość meczów rankingowych, by system znalazł twój poziom. Jeśli wracasz, spodziewaj się, że pierwsze partie poniosą więcej informacji niż przed przerwą. Jeśli jesteś osadzony, nie goń każdego drobnego wahnięcia. Skup się na jakości meczu, ucz się z trudnych pozycji i pokaż swoją strategię na sensownej próbie.

Użyteczne pytanie nie brzmi, czy Glicko albo Elo potrafi przewidzieć każdy rzut, każdą niespodziankę i każdy wspaniały powrót. Brzmi ono, czy system daje uczciwym wynikom dość czasu, by ujawnił się mocniejszy gracz. Graj dalej, ucz się dalej i pozwól, by twoim dowodem stał się twój dorobek.

Zastosuj wiedzę w praktyce

Najszybszym sposobem na naukę tryktraka jest granie. Zmierz się z prawdziwymi graczami prosto w przeglądarce: za darmo, bez instalacji i bez rejestracji.

Zagraj w tryktraka za darmoW przeglądarce · bez instalacji