システム比較
エロvsグリッコ
Elo と Glicko は競技チェスの 2 つの最も重要な評価システムですが、測定問題の解決方法が異なります。伝統的な Elo では、推定強度を表す単一の数値が表示されます。 Glicko は、その数値にシステムの推定値の信頼度を明示的に測定する評価偏差 (RD) を加えて提供します。この根本的な違いは、同じレベルでプレイしている場合でも、FIDE 評価と Chess.com 評価の動作が大きく異なる理由を説明しています。
Elo: 数値は 1 つ、信頼区間なし
古典的な Elo システムでは、すべてのプレイヤーに 1 つの評価番号が割り当てられます。ゲームをプレイすると、システムは結果を予想スコアと比較し、評価を調整します。 K ファクターは、数値の移動速度を制御します。レーティングについて疑問を表明するメカニズムは組み込まれていません。500 ゲーム後に 1500 と評価されたプレーヤーは、5 試合後に 1500 と評価されたプレーヤーと同じに見えます。 違いを並べて確認するには、チェスのレーティングが異なる理由をご覧ください。
このシンプルさが Elo の最大の強みであり、最も重大な制限でもあります。この数字は理解しやすく伝えやすいですが、システムの信頼性が高いのか、まだ推測しているのかを判断することはできません。 違いを並べて確認するには、FIDE 対 US チェスのレーティングをご覧ください。
Glicko: 格付け + 格付け偏差 + ボラティリティ
Glicko (および Lichess と Chess.com で使用されているその後継の Glicko-2) は、各プレイヤーの 3 つの値、つまりレーティング、レーティング偏差 (RD)、レーティング ボラティリティを追跡します。 RD は新規プレイヤーの場合は高く始まり、ゲームがプレイされるにつれて減少します。プレーヤーがプレーをやめると、現在の強さに対する不確実性の増大を反映して、RD は徐々に再び増加します。
これは、Glicko が、固定の K ファクター バンドを必要とせずに、不確実なプレーヤーの結果に対してより積極的に反応し、確立されたプレーヤーの結果に対してより保守的に反応できることを意味します。何か月も非アクティブだった復帰プレイヤーは、同じレーティングのアクティブ プレイヤーよりも大きな変動が見られます。これは、システムが非アクティブ プレイヤーのレベルについて不確かであるためです。
実際に気づく違い
- 休憩後: Elo では、最初のゲームバックは休憩前の最後のゲームと同じように動作します。 Glicko では、非アクティブの間、システムが RD を増加させるため、最初のゲームに戻ると、レーティングの変動が大きくなります。
- 新しいアカウントの不安定性: Glicko システムは、新規アカウントに対して意図的に不安定になっており、すぐに収束します。 K=40 の Elo は、同様のことを実現しますが、あまりエレガントではありません。
- 長期にわたる安定性: 長くアクティブな Glicko プレイヤーは RD が非常に低く、レーティングが非常に安定しています。多くの場合、K=10 の Elo よりも安定しています。
- システム間の比較: RD=30 での 1500 Glicko 評価は、非常に信頼できる測定値です。 RD=200 での 1500 グリッコの評価は基本的に推測です。エロにはこの違いを表現する方法がありません。
それらの間で変換できない理由
Elo と Glicko の評価は同じ一般的なスケールで動作します (200 ポイントのアドバンテージにより、両方のシステムで同様の予想スコアが生成されます) が、母集団、更新メカニズム、および信頼度の処理により、個々のプレイヤーに実際の差異が生じます。
Lichess (Glicko-2) で非常にアクティブで、FIDE イベント (Elo) で適度にアクティブなプレイヤーは、当然ながら各システムで異なる数値を開発します。どちらも間違いではありません。同じプレーヤーを異なるレンズを通して、異なる数学的ツールを使用して異なる対戦相手に対して測定しているのです。