Doğruluk puanın platformdan platforma neden değişir
Platformlar doğruluğu nasıl hesaplar ve sayılar neden pek tutmaz
Chess.com'da bir parti oynuyorsun ve doğruluğunun %87 olduğu söyleniyor. Aynı partiyi Lichess'e aktarıyorsun, bu kez analiz bambaşka isabetsizlikler gösteriyor. Bilgisayarında Stockfish'ten geçiriyorsun, sonuç yine değişiyor. Hangisi doğru?
Yanıt şu: hiçbiri nesnel olarak "doğru" değil. Her platform kendi yöntemini, kendi motor sürümünü, kendi inceleme derinliğini ve kendi sınıflandırma ölçütlerini kullanır. Bu farkları bilmek, hiçbir zaman kesin olmak üzere tasarlanmamış sayılara takılmak yerine doğruluk ölçütlerinden verim almanı sağlar.
Doğruluk puanları nasıl hesaplanır
Temel fikir basit: her hamleni motorun en iyi hamlesiyle karşılaştır ve aradaki farkı ölç. Ama bu karşılaştırmanın ayrıntıları platformdan platforma epeyce değişir.
Kimi platformlar santipiyon kaybı modeliyle çalışır: her hamlede en iyi hamleye kıyasla ne kadar değer "kaybettiğini" ölçer ve toplamı yüzdeye çevirir. Kimileri kazanma olasılığı modelini kullanır: değerlendirmeleri kazanma şansına çevirir ve hamlenin sana kaç puan kazanma olasılığına mal olduğunu ölçer. Aynı parti için bu iki yaklaşım gözle görülür biçimde farklı sonuçlar verebilir.
Santipiyon modeli, çoktan kazanılmış pozisyonlarda daha sert cezalandırır. +5,0 önde iken değeri +3,0'a düşüren bir hamle 200 santipiyon kayıptır — bu ölçüte göre ciddi bir rakam — oysa hâlâ rahatça kazanıyorsundur. Kazanma olasılığı modeli burada daha hoşgörülüdür, çünkü +5,0 ile +3,0 arasında kazanma şansı neredeyse hiç değişmez.
Tersine, kazanma olasılığı modeli eşitlik civarında çok daha duyarlıdır. +0,3'ten -0,3'e düşmek yalnızca 60 santipiyonluk bir kayıptır ama kazanma şansında belirgin bir kayma anlamına gelir.
Derinlik sorunu
Doğruluk puanlarındaki oynamanın belki de en büyük etkeni inceleme derinliğidir. Motor değerlendirmeleri üzerine yazımızda anlattığımız gibi, bir motorun pozisyon hakkındaki kanaati 18. derinlikle 28. derinlik arasında hatırı sayılır ölçüde değişebilir.
Çoğu platform partileri orta derinliklerde, tipik olarak 18-22 aralığında inceler; çünkü her gün milyonlarca partiyi 30 ve üzeri derinlikte hesaplamak muazzam kaynak ister. Ne var ki bu orta derinliklerde motorun "en iyi hamlesi" her zaman gerçekten en iyisi değildir. "İsabetsiz" sayılan hamlen daha yüksek derinlikte üstün çıkabilir.
Bu da rahatsız edici bir gerçeği doğurur: doğruluk puanları oyununu kusurlu bir ölçüte göre tartar. 20. derinlikteki bir motor kâhin değildir; çok güçlü ama yanılabilir bir çözümleyicidir. Onun kanaatini mutlak doğru saymak, hesaba sistematik hata katar.
Sınıflandırma eşikleri
Platformlar bir hamleyi "en iyi", "mükemmel", "iyi", "isabetsizlik", "hata" ya da "Blunder" saymak için farklı eşikler kullanır. Bu eşikler bir ölçüde keyfîdir ve parti değerlendirmenin anlattığı hikâyeyi büyük ölçüde biçimlendirir.
Bir platform 50 santipiyonluk kaybı "hata" sayarken bir diğeri aynı etiket için 100 santipiyon ister. Biri "en iyi" damgasını yalnızca motorun tek bir en üst hamlesine verirken, öteki bu hamlenin 10 santipiyon altındaki her hamleyi "en iyi" kabul eder.
Bu sınıflandırma tercihleri tasarım kararlarıdır, satranç gerçekleri değil. Değerlendirmende kaç "hata" göründüğünü, hangi hamlelerin öne çıkarıldığını ve nihayetinde kendi oyununu nasıl algıladığını belirlerler. Bir platformda temiz görünen bir parti, altındaki satranç birebir aynı olsa da başka bir platformda hatalarla dolu görünebilir.
Motor sürümleri ve ağlar
İki platform da "Stockfish" kullandığını söylese bile farklı sürümleri farklı NNUE ağlarıyla çalıştırıyor olabilirler. Stockfish 15 pozisyonları Stockfish 17'den, o da Stockfish 18'den farklı değerlendirir. Bu farklar genelde küçüktür ama belirli pozisyon tiplerinde belirleyici olabilir.
Kimi platformlar kendi özel motorlarını ya da açık kaynaklı motorların değiştirilmiş sürümlerini kullanır. Bunların değerlendirme özellikleri, güçlü ve zayıf yanları standart Stockfish'ten ayrılabilir. Platform hangi motoru ve sürümü kullandığını açıklamıyorsa doğruluk karşılaştırmaları büsbütün anlamsızlaşır.
ChessOnyx'te en son kararlı sürüm olan Stockfish 18'i NNUE ile çalıştırıyoruz ve bunu açıkça söylüyoruz. Analiz özelliklerini yayınladığımızda, değerlendirmeleri hangi motorun hangi ayarlarla ürettiğini her zaman bileceksin.
Oyunlaştırma etkeni
Doğruluk puanlarının çift işlev gördüğünü kabul etmek gerek: bir yanıyla analiz aracı, bir yanıyla bağlılık özelliğidirler. Platformların, analizin ödüllendirici hissettirmesi ve kullanıcının geri dönmesi için mali bir güdüsü vardır.
Bu, ince biçimlerde kendini gösterir: oyuncuyu memnun eden cömert doğruluk puanları, akılda kalıcı anlar yaratan çarpıcı etiketler ya da oyuncuyu olduğundan güçlü gösteren performans değerleri. Bunların hiçbiri zorunlu olarak sahtekârlık değil, ama arkadaki güdüleri görmek önemli.
En değerli analiz seni en iyi hissettiren değil, nerede gelişebileceğini gösterendir. Bazen en yararlı geri bildirim rahatsız edicidir ve farkında olmadığın hata örüntülerini önüne serer.
Doğruluk puanlarından verim almanın yolu
Sınırlarına rağmen doğruluk puanları doğru yaklaşıldığında işe yarar:
Doğruluğunu tek bir platformda zaman içinde izle. Mutlak sayı pek bir şey ifade etmese de aynı sistem içindeki gidişat anlamlıdır. Aynı platformda ortalaman birkaç ay içinde %75'ten %82'ye çıkıyorsa bu gerçek bir ilerlemedir — sayıların kendisi bir ölçüde keyfî olsa bile.
Doğruluk puanlarını platformlar arasında karşılaştırma. Birindeki %85, ötekindeki %85 ile aynı şey değildir. Yalnızca aynı sistem içinde karşılaştır.
Puana değil analize odaklan. Parti sonrası incelemenin asıl değeri, nerede yanlış yola saptığını gösteren somut pozisyonları anlamak ve onlardan öğrenmektir. Yüzde değeri, açığa çıkardığından fazlasını gizleyen bir özet sayıdır.
Çok yüksek puanlara kuşkuyla bak. Bir platform sana sürekli %95 doğrulukla oynadığını söylüyorsa, gerçekten kusursuza yakın bir oyunu yansıtmak yerine cömert eşikler kullanıyor olabilir. Bunu oyununun hatasız olduğunun onayı değil, daha titiz bir analiz arama nedeni say.
Satrancı motorların değil insanların oynadığını unutma. Motor ölçütüne göre "ikinci en iyi" olan bir hamle, gerçek bir partide, özellikle zaman baskısı altında en pratik seçim olabilir. Doğruluk puanları oyunun insani yanlarını — zaman yönetimini, ruhsal baskıyı, pratik karmaşıklıkları — ölçemez; oysa bunlar salt satranç kalitesi kadar önemlidir.