← Back to Articles

정확도 점수가 플랫폼마다 다른 이유

각 플랫폼은 정확도를 어떻게 계산하며, 그 숫자들이 좀처럼 맞아떨어지지 않는 까닭

ChessOnyx·2026-03-20·6 min read

Chess.com에서 한 판을 두면 정확도가 87%라고 알려준다. 같은 기보를 Lichess로 옮기면 분석은 전혀 다른 부정확한 수들을 짚어낸다. 내 컴퓨터에서 Stockfish로 돌려보면 결과가 또 달라진다. 어느 쪽이 맞는 걸까.

답은 이렇다. 어느 것도 객관적으로 「맞다」고 할 수 없다. 플랫폼마다 계산 방식도, 엔진 버전도, 분석 깊이도, 분류 기준도 제각각이기 때문이다. 이 차이를 알아두는 것이야말로 애초에 정밀하도록 설계된 적 없는 숫자에 매달리지 않고 정확도 지표를 쓸모 있게 쓰는 출발점이다.

정확도 점수는 어떻게 계산되는가

밑바탕이 되는 발상은 단순하다. 당신이 둔 수를 하나하나 엔진의 최선수와 견주어 그 차이를 재는 것이다. 다만 그 비교를 어떻게 수행하느냐는 플랫폼마다 상당히 다르다.

어떤 곳은 센티폰 손실 모델을 쓴다. 각 수가 최선수에 비해 평가값을 얼마나 「잃었는지」 재서 백분율로 환산하는 방식이다. 다른 곳은 승률 모델을 쓴다. 평가값을 이길 확률로 바꾼 뒤, 그 확률을 얼마나 까먹었는지 재는 방식이다. 같은 한 판을 두고도 이 두 방식은 눈에 띄게 다른 결과를 내놓는다.

센티폰 손실 모델은 이미 승부가 갈린 국면에서 더 매섭게 매긴다. +5.0으로 앞선 상황에서 평가를 +3.0으로 떨어뜨리는 수를 두면 그것은 200센티폰 손실이고, 이 잣대로는 꽤 큰 수치다. 그럼에도 여전히 완승 국면이라는 사실에는 변함이 없다. 승률 모델은 여기서 훨씬 너그럽다. +5.0과 +3.0 사이에서 이길 확률은 거의 움직이지 않기 때문이다.

반대로 승률 모델은 균형점 부근의 변화에 훨씬 민감하다. +0.3에서 -0.3으로 떨어지는 것은 센티폰으로는 60에 불과하지만, 이길 확률로 따지면 상당한 이동이다.

깊이라는 문제

정확도 점수가 흔들리는 가장 큰 요인은 아마 분석 깊이일 것이다. 엔진 평가값을 다룬 글에서 짚었듯, 한 국면에 대한 엔진의 판단은 깊이 18과 깊이 28 사이에서 크게 달라질 수 있다.

대다수 플랫폼은 중간 정도의 깊이, 대개 18에서 22 사이에서 기보를 분석한다. 매일 수백만 판을 깊이 30 이상으로 돌리자면 연산 자원이 감당하기 어려울 만큼 들기 때문이다. 그런데 이 정도 깊이에서 엔진이 말하는 「최선수」가 언제나 진짜 최선수인 것은 아니다. 「부정확」하다고 판정된 당신의 수가 더 깊이 파고들면 오히려 더 나은 수로 드러나기도 한다.

여기서 불편한 사실이 나온다. 정확도 점수는 불완전한 잣대로 당신의 수를 재고 있다. 깊이 20의 엔진은 신탁이 아니라, 대단히 강하지만 틀릴 수 있는 분석가다. 그 판단을 절대적 사실로 취급하는 순간 계산에는 체계적인 오차가 끼어든다.

분류 기준선

어떤 수를 「최선」, 「훌륭함」, 「좋음」, 「부정확」, 「실수」, 「Blunder」 가운데 무엇으로 부를지, 그 기준선은 플랫폼마다 다르다. 이 선 긋기에는 임의적인 구석이 있고, 기보 리뷰가 들려주는 이야기를 크게 좌우한다.

어느 플랫폼은 50센티폰 손실을 벌써 「실수」라 부르고, 다른 곳은 같은 딱지를 붙이는 데 100센티폰을 요구한다. 엔진이 꼽은 한 수만을 「최선」으로 인정하는 곳이 있는가 하면, 그 수와 10센티폰 이내인 수는 모두 「최선」으로 치는 곳도 있다.

이런 분류는 설계상의 결정이지 체스의 진리가 아니다. 리뷰에 「실수」가 몇 개나 뜨는지, 어떤 수가 강조되는지, 그리고 끝내 당신이 자기 기력을 어떻게 받아들이는지까지 여기서 갈린다. 한 플랫폼에서 깔끔해 보이던 대국이 다른 플랫폼에서는 실수투성이로 비칠 수 있다. 반상에서 벌어진 체스는 똑같은데도 그렇다.

엔진 버전과 신경망

두 플랫폼이 나란히 「Stockfish」를 내걸고 있어도, 서로 다른 버전에 서로 다른 NNUE 신경망을 얹었을 수 있다. Stockfish 15는 Stockfish 17과 다르게 평가하고, Stockfish 17은 또 Stockfish 18과 다르다. 차이는 대개 작지만 특정한 국면 유형에서는 무시하기 어렵다.

자체 엔진을 쓰거나 오픈소스 엔진을 손본 판본을 쓰는 플랫폼도 있다. 그런 엔진은 표준 Stockfish와 견주어 평가 성향도, 강점도, 약점도 다를 수 있다. 어떤 엔진의 어떤 버전을 쓰는지 밝히지 않는 플랫폼이라면 정확도 비교는 더더욱 의미를 잃는다.

ChessOnyx는 최신 안정 버전인 Stockfish 18을 NNUE와 함께 돌리고 있으며, 이 점을 감추지 않는다. 분석 기능을 내놓을 때마다 어떤 엔진이 어떤 설정으로 평가값을 만들어내는지 언제나 알 수 있게 해둔다.

게임화라는 요소

정확도 점수가 두 가지 역할을 겸한다는 점은 인정해야 한다. 한편으로는 분석 도구이고, 다른 한편으로는 사용자를 붙드는 장치다. 분석을 뿌듯하게 느끼도록 만들고 다시 찾아오게 하는 데에는 플랫폼 쪽의 금전적 동기가 걸려 있다.

그것은 미묘한 방식으로 드러난다. 기분 좋아지게 하는 후한 정확도, 기억에 남을 순간을 만들어내는 요란한 딱지, 실제보다 강해 보이게 하는 퍼포먼스 점수 같은 것들이다. 어느 것도 곧바로 부정직하다고 할 수는 없지만, 뒤에서 작동하는 동기를 알아차리는 일은 중요하다.

가장 값진 분석은 기분을 가장 좋게 해주는 분석이 아니라 어디를 고칠 수 있는지 보여주는 분석이다. 가장 쓸모 있는 피드백이 스스로도 몰랐던 실수의 패턴을 들춰내는, 듣기 거북한 것일 때도 적지 않다.

정확도 점수를 제대로 쓰는 법

한계가 있어도 접근만 제대로 하면 정확도 점수는 쓸모가 있다.

한 플랫폼에 한정해 시간을 두고 자기 정확도를 따라가 보자. 절대적인 수치 자체는 별 의미가 없어도, 같은 체계 안에서의 흐름은 의미가 있다. 몇 달에 걸쳐 같은 플랫폼에서 평균이 75%에서 82%로 올랐다면 그것은 진짜 발전이다. 개별 숫자가 다소 임의적이라 해도 마찬가지다.

플랫폼끼리 정확도를 비교하지 말자. 이쪽의 85%와 저쪽의 85%는 같은 것이 아니다. 비교는 같은 체계 안에서만 하자.

점수가 아니라 분석 내용에 집중하자. 대국 후 복기의 진짜 가치는 어느 국면에서 어떻게 어긋났는지 구체적으로 이해하고 거기서 배우는 데 있다. 백분율은 요약된 수치일 뿐이어서 드러내는 것보다 가리는 것이 많다.

지나치게 높은 정확도는 의심해 보자. 어떤 플랫폼이 매번 95%로 두었다고 알려온다면, 정말로 완벽에 가까운 기력을 비추는 것이 아니라 기준선이 후한 것일 수 있다. 그것을 흠이 없다는 확인으로 받아들이지 말고 더 엄격한 분석을 찾아 나설 동기로 삼자.

체스를 두는 것은 엔진이 아니라 사람이라는 점도 잊지 말자. 엔진 기준으로 「차선」인 수가 실제 대국에서는, 특히 시간에 쫓길 때는 가장 실용적인 선택일 수 있다. 시간 배분, 심리적 압박, 실전에서 벌어지는 얽힘 같은 체스의 인간적인 면을 정확도 점수는 담아내지 못한다. 그런 요소들은 순수한 수의 질만큼이나 중요하다.

Further Reading

More Articles

Stockfish의 깊이를 이해하면 내 대국이 달라진다

탐색 깊이와 시간 배분, 그리고 더 깊은 분석이 실제로 의미를 갖는 순간에 대한 실용 안내

7 min read

엔진 분석을 제대로 뽑아 쓰는 법

수를 확인하는 데 그치지 않고 실제로 늘기 위해 엔진을 쓰는 방법

8 min read

체스 실력을 올리는 법

정말로 도움이 되는 것과 대체로 시간만 잡아먹는 것을 솔직하게 짚어본다

9 min read
← Back to Articles