Glicko contra Elo: qual rating serve ao jogo?

Uma balança ao centro, peças de xadrez azuis no prato esquerdo e um cavalo escuro no prato laranja da direita, um homem com notebook sentado à esquerda, uma mulher com prancheta à direita, e um gráfico de linha e um alvo de dardos atrás.

Um rating de 1.650 pode significar coisas muito diferentes dependendo de como o sistema chegou até ele. O jogador conquistou isso ao longo de centenas de partidas competitivas? Acabou de voltar de uma longa pausa? É um novato em rápida evolução que jogou apenas um punhado de partidas? Essa é a pergunta real por trás de Glicko contra Elo. Os dois sistemas transformam resultados em rating, mas o Glicko acrescenta contexto que importa quando toda partida contada de gamão deveria parecer competitiva.

Glicko contra Elo: a diferença central

O Elo é o sistema de rating que a maioria reconhece primeiro. Ele parte de uma ideia simples: antes da partida, cada jogador tem um rating, e a diferença entre esses ratings produz um resultado esperado. Vença um adversário mais bem classificado e ganhe mais pontos. Perca para um menos classificado e perca mais. Se o resultado bate com a expectativa, o rating se move pouco.

Essa abordagem é elegante e fácil de entender. Um jogador de 1.600 deve vencer com mais frequência do que um de 1.400, então o de 1.600 tem mais a perder quando eles se encontram. O Elo funciona especialmente bem quando os jogadores competem com frequência, os ratings tiveram tempo de assentar, e o sistema tem resultados suficientes para julgar todo mundo de forma consistente.

A limitação é que o rating sozinho não revela o quanto o sistema está certo dele. Um jogador de 1.600 com dez partidas e outro de 1.600 com mil partidas podem parecer idênticos numa tabela básica de Elo. Eles não deveriam necessariamente receber o mesmo tratamento do emparelhamento.

O Glicko fecha essa lacuna combinando o rating do jogador com um desvio de rating, muitas vezes chamado de RD. O rating estima a habilidade. O RD estima a confiança do sistema nessa estimativa. Um RD baixo significa que o jogador tem um histórico recente e substancial, e que o rating dele é relativamente estável. Um RD alto significa mais incerteza, talvez porque o jogador seja novo ou tenha ficado inativo.

O Glicko-2, versão usada no emparelhamento contado por habilidade no Online Backgammon, acrescenta um terceiro sinal: a volatilidade do rating. O passo a passo completo de como o Glicko-2 avalia um jogador cobre os três números em ordem; este artigo trata do que a comparação com o Elo de fato entrega. A volatilidade ajuda o sistema a reconhecer se os resultados de um jogador estão mudando de forma mais brusca do que o esperado. Não é um julgamento sobre alguém ser "instável". É uma maneira matemática de fazer as atualizações de rating responderem de forma adequada quando o nível competitivo de um jogador pode estar se movendo.

Por que a incerteza importa no gamão

O gamão é um jogo de estratégia com variância real. Boas decisões criam vantagem ao longo do tempo, mas uma única partida pode virar por um acerto, um lance improvável perdido, um cubo na hora certa, ou uma retirada difícil. Um sistema de rating não elimina essa variância, nem deveria fingir que todo resultado curto mede a habilidade com perfeição.

O Glicko-2 é útil aqui porque não trata todo jogador e todo resultado como igualmente informativos. Vencer um adversário estabelecido perto do seu nível diz algo relevante ao sistema. Um jogador novo com uma sequência surpreendente também diz algo, mas com mais incerteza inicial em torno da estimativa.

Para quem melhora com desafios diários, experiência de partida, e decisões de cubo mais afiadas, isso pode parecer mais responsivo do que um sistema de atualização fixa. Resultados iniciais podem mover um rating provisório ou incerto mais depressa. Conforme o jogador constrói histórico, o rating fica mais estável. Essa é a troca certa: espaço para achar o seu nível, seguido de uma posição que carrega peso.

O mesmo princípio ajuda quem retorna. Se alguém se afasta por meses, o rating antigo ainda é história útil, mas não deveria ser tratado como prova perfeita da forma atual. O Glicko aumenta a incerteza durante a inatividade. Quando essa pessoa volta, o sistema aprende mais rápido com os novos resultados sem presumir automaticamente que ela piorou.

O Elo não está errado, ele resolve um problema mais estreito

Dizer que o Glicko é melhor que o Elo em todo contexto passa longe do ponto. O Elo é uma solução forte quando simplicidade, transparência, e estabilidade de rating no longo prazo são as prioridades principais. Também é mais fácil de calcular de cabeça. Sabendo a diferença de rating e o fator de atualização, dá para prever aproximadamente o efeito de uma vitória ou derrota.

O Glicko tem mais nuance, mas essa nuance torna as variações individuais mais difíceis de explicar num relance. Dois jogadores podem vencer o mesmo número de partidas e ver movimentos diferentes porque seus adversários, desvios de rating, e atividade recente são diferentes. Isso pode surpreender quem espera que toda vitória valha um número fixo de pontos.

Nenhum dos sistemas é atalho para os fundamentos. Um rating alto se constrói fazendo jogadas de pedras mais fortes, entendendo quando atacar ou ancorar, usando o cubo de duplicação com disciplina, e rendendo sob pressão. O trabalho do sistema é colocar esses resultados em contexto útil, não criar habilidade onde ela não existe.

Como o Glicko-2 cria partidas contadas melhores

A melhor partida contada não é simplesmente contra o rating visível mais próximo. É uma partida em que os dois jogadores têm chance real de provar seu valor e em que o resultado melhora a compreensão que o sistema tem da habilidade deles.

Com o Glicko-2, o número que um jogador leva para a fila já foi moldado pela certeza que o sistema tem dele. Um jogador estabelecido com desvio de rating estreito é uma grandeza conhecida, e o rating dele se move devagar porque está perto de um veredito assentado. Um jogador mais novo exibindo o mesmo número mas com desvio mais largo ainda não é uma grandeza conhecida, e o rating dele se move mais rápido. O emparelhamento junta jogadores pelo rating, então é o desvio que decide com que velocidade alguém em rápida evolução é levado até o nível a que seus adversários pertencem.

Isso também torna a tabela de classificação mais significativa com o tempo. Um rating deve refletir desempenho, mas a confiança importa ao comparar jogadores que jogaram quantidades muito diferentes. Atividade não é a única medida de qualidade, e ainda assim um rating conquistado em competição sustentada merece um nível de confiança diferente de um construído a partir de uma amostra pequena.

Para quem leva a sério, isso é uma vantagem e não uma complicação. Você não está apenas coletando pontos. Está construindo um histórico competitivo contra adversários reais. Cada partida contada acrescenta evidência, e com o tempo o sistema fica mais difícil de mover com uma boa fase breve ou uma curta maré de azar.

Justiça de rating e justiça de dados são promessas diferentes

Um sistema de rating inteligente não torna aceitáveis dados injustos. Ratings medem resultados de partidas; eles não verificam como os lançamentos foram produzidos. No gamão online, o jogador precisa de emparelhamento competitivo e da confiança de que o próprio jogo não foi manipulado.

Por isso a justiça tem duas camadas. O Glicko-2 ajuda a garantir que as classificações reajam aos resultados com a confiança adequada. Um sistema de dados comprovadamente justo cuida da integridade do registro da partida em si, permitindo que os lançamentos de partidas concluídas sejam derivados de novo a partir dos registros publicados. Um protege a qualidade da competição ao longo do tempo. O outro dá ao jogador um jeito de verificar as condições de uma partida específica.

Manter essas ideias separadas importa. Uma sequência de derrotas não prova que os dados são injustos, e dados transparentes não garantem que toda atualização de rating será satisfatória. O que o jogador deve esperar é um sistema que possa ser conferido, explicado, e confiável mesmo quando o tabuleiro não colabora.

O que observar em vez de uma única variação de rating

Um número isolado depois da partida é tentador de sobreinterpretar. Depois de uma derrota dura, parece que o sistema emitiu um veredito sobre a sua capacidade. Não emitiu. Ele processou um resultado dentro de um histórico maior que inclui a força do adversário, a sua certeza de rating, e a sua atividade recente.

Observe o padrão mais longo. Você está vencendo mais vezes contra jogadores próximos do seu rating? As suas decisões de cubo estão melhorando? Você reconhece quando um prime vale mais do que um blot solto, ou quando uma jogada segura abre mão de equidade demais? O seu rating em geral segue a qualidade dessas decisões, ainda que não em linha reta.

Se você é novo, jogue partidas contadas suficientes para o sistema achar o seu nível. Se está voltando, espere que os primeiros jogos carreguem mais informação do que carregavam antes da pausa. Se já está estabelecido, não persiga cada pequena flutuação. Foque na qualidade das partidas, aprenda com as posições difíceis, e mostre a sua estratégia ao longo de uma amostra significativa.

A pergunta útil não é se Glicko ou Elo conseguem prever cada lançamento, cada zebra, ou cada virada brilhante. É se o sistema dá aos resultados honestos tempo suficiente para revelar quem joga melhor. Continue jogando, continue aprendendo, e deixe o seu histórico virar a prova.

Coloque em prática

A forma mais rápida de aprender gamão é jogando. Enfrente jogadores reais direto no navegador: grátis, sem instalação e sem cadastro.

Jogar gamão grátisNo seu navegador · sem instalação