본문 바로가기
스포츠

스포츠 데이터에서 회귀 분석의 활용: 숫자 뒤에 숨은 인과와 예측의 과학

by 알럽 2026. 7. 21.

현대 스포츠는 더 이상 감(感)과 경험만으로 운영되지 않는다. 선수의 몸에 부착된 GPS 트래커, 경기장 곳곳에 설치된 광학 추적 카메라, 그리고 매 순간 기록되는 수만 건의 이벤트 데이터가 결합되면서, 스포츠는 오늘날 가장 방대한 실측 데이터를 생산하는 분야 중 하나가 되었다. 이렇게 쏟아지는 데이터를 의미 있는 통찰로 전환하는 핵심 도구가 바로 회귀 분석(regression analysis)이다. 회귀 분석은 여러 변수 사이의 관계를 수량화하고, 특정 요인이 결과에 미치는 영향의 크기를 추정하며, 나아가 미래의 성과를 예측하는 통계적 방법이다. 이 글에서는 스포츠 데이터에서 회귀 분석이 어떤 원리로 작동하고, 어떤 방식으로 활용되며, 그 과정에서 어떤 한계와 주의가 필요한지를 체계적으로 살펴본다.

 

스포츠에서 회귀 분석이 중요한 이유는 단순하다. 승패, 득점, 부상, 연봉, 관중 수처럼 우리가 관심을 갖는 결과들은 거의 예외 없이 여러 요인이 동시에 작용한 산물이기 때문이다. 하나의 요인만 떼어내어 그것이 결과에 얼마나 기여하는지를 가늠하려면, 다른 요인들을 통제한 상태에서 그 관계를 추정해야 한다. 회귀 분석은 바로 이 작업을 가능하게 하는 통계적 프레임워크다.

 

 

 

▍ 회귀 분석이란 무엇인가: 기본 원리와 개념

 

회귀 분석의 출발점은 하나의 결과 변수(종속 변수)를 하나 또는 여러 개의 설명 변수(독립 변수)로 설명하려는 시도다. 가장 기본적인 형태인 단순 선형 회귀는 두 변수 사이에 직선 관계가 있다고 가정하고, 실제 관측된 데이터에 가장 잘 맞는 직선을 찾는다. 예컨대 야구에서 팀의 출루율과 시즌 득점 사이의 관계를 살펴본다고 하자. 출루율이 높아질수록 득점도 대체로 증가하는 경향이 관찰되며, 회귀 분석은 이 경향을 하나의 방정식으로 표현해 "출루율이 일정 수준 오를 때 득점이 평균적으로 얼마나 늘어나는가"를 수치로 제시한다.

 

현실의 스포츠 성과는 단일 요인으로 설명되는 경우가 거의 없기 때문에, 실제 분석에서는 여러 설명 변수를 동시에 투입하는 다중 회귀(multiple regression)가 훨씬 널리 쓰인다. 다중 회귀의 강력함은 '다른 조건이 동일할 때'라는 통제의 논리에 있다. 한 변수의 효과를 추정할 때 나머지 변수들의 영향을 통계적으로 고정함으로써, 순수하게 그 변수 하나가 결과에 미치는 독립적 기여를 분리해낼 수 있다. 이 통제의 개념은 스포츠 분석에서 특히 중요하다. 예를 들어 한 선수의 득점 생산성을 평가할 때, 그가 뛰는 리그의 수준, 출전 시간, 팀 동료의 기량 같은 배경 요인을 통제하지 않으면 그 선수의 진짜 실력을 과대 혹은 과소평가하기 쉽기 때문이다.

 

회귀 모델이 산출하는 결과 중 가장 자주 언급되는 것이 회귀계수와 결정계수다. 회귀계수는 각 설명 변수가 한 단위 변할 때 결과 변수가 평균적으로 얼마나 변하는지를 나타내며, 그 크기와 방향(양수인지 음수인지)이 관계의 성격을 말해준다. 결정계수(R²)는 모델이 결과 변수의 변동을 얼마나 설명하는지를 0에서 1 사이의 값으로 요약한다. 다만 결정계수가 높다고 해서 반드시 좋은 모델은 아니며, 값이 낮더라도 인간의 성과처럼 본질적으로 변동이 큰 현상을 다룰 때는 의미 있는 모델일 수 있다는 점을 유념할 필요가 있다.

 

 

 

▍ 스포츠 회귀 분석에서 다루는 데이터의 유형

 

회귀 분석의 품질은 결국 투입되는 데이터의 성격에 좌우된다. 스포츠에서 활용되는 데이터는 크게 몇 가지 유형으로 나눌 수 있으며, 각 유형은 서로 다른 분석 가능성과 제약을 지닌다.

 

첫 번째는 전통적인 박스스코어(box score) 데이터다. 득점, 리바운드, 어시스트, 안타, 실책처럼 오래전부터 기록되어 온 요약 통계가 여기 속한다. 이 데이터는 접근성이 좋고 역사가 길어 장기 추세를 분석하기에 유리하지만, 맥락 정보가 부족하다는 한계가 있다. 두 번째는 이벤트 단위의 세밀한 로그 데이터로, 매 플레이가 언제 어디서 어떤 상황에서 일어났는지를 기록한다. 세 번째는 추적(tracking) 데이터로, 선수와 공의 위치를 초당 여러 번 좌표로 기록해 움직임의 속도, 가속도, 공간 점유 같은 정보까지 담아낸다. 이 세밀한 데이터는 회귀 분석에 풍부한 설명 변수를 제공하지만, 동시에 변수 간 상관이 복잡하게 얽혀 있어 해석에 더 큰 주의가 요구된다.

 

데이터를 다룰 때 반드시 구분해야 할 개념이 상관과 인과의 차이다. 회귀 분석은 변수들 사이의 통계적 연관을 추정하지만, 그 연관이 곧 인과관계를 뜻하지는 않는다. 두 변수가 함께 움직이는 것처럼 보여도, 실제로는 관찰되지 않은 제3의 요인이 양쪽을 동시에 움직이고 있을 수 있다. 스포츠 분석에서 흔히 발생하는 함정 중 하나가 바로 이 지점이며, 뒤에서 이 문제를 다시 자세히 다룬다.

 

 

 

▍ 종목별 활용 사례: 야구, 농구, 축구

 

회귀 분석의 활용 양상은 종목의 구조에 따라 상당히 달라진다. 각 종목이 데이터를 생성하는 방식과 승부를 결정하는 요인이 다르기 때문이다.

 

야구는 회귀 분석과 통계적 사고가 가장 먼저, 그리고 가장 깊이 뿌리내린 종목이다. 야구가 이런 분석에 특히 적합한 이유는 경기가 투수와 타자의 일대일 대결이라는 이산적 단위로 분해되기 때문이다. 각 타석은 명확하게 구분되는 사건이고, 이런 반복적이고 독립성이 높은 구조는 통계 모델링에 이상적인 환경을 제공한다. 세이버메트릭스로 통칭되는 야구 통계 분석은 타자의 여러 지표가 팀 득점에 기여하는 정도를 회귀 분석으로 추정하고, 이를 바탕으로 선수의 가치를 하나의 통합 지표로 환산하는 방향으로 발전해 왔다. 선수 평가와 연봉 협상, 트레이드 판단에 이르기까지 회귀 기반 추정이 널리 쓰이고 있다.

 

농구는 야구보다 흐름이 연속적이고 선수 간 상호작용이 강한 종목이다. 한 선수의 기여는 다른 네 명의 동료, 그리고 상대 다섯 명과의 관계 속에서만 온전히 평가될 수 있다. 이런 특성 때문에 농구에서는 특정 선수가 코트에 있을 때와 없을 때 팀의 성과가 어떻게 달라지는지를 회귀 모델로 분리해내는 접근이 발전했다. 이는 함께 뛴 동료와 상대의 영향을 통제한 상태에서 개별 선수의 순수 기여를 추정하려는 시도로, 다중 회귀의 통제 논리가 실제 문제 해결에 어떻게 적용되는지를 잘 보여준다.

 

축구는 세 종목 중 가장 분석하기 까다로운 편에 속한다. 득점이 드물게 발생하고, 90분 내내 흐름이 끊이지 않으며, 하나의 골이 나오기까지 수많은 미세한 행동이 누적되기 때문이다. 이런 저득점·고연속성 구조에서는 골이라는 최종 결과만으로 선수나 팀을 평가하면 표본이 너무 적어 신뢰도가 떨어진다. 그래서 축구 분석에서는 슛이 골로 이어질 확률을 슛의 위치, 각도, 상황 같은 변수들로 추정하는 회귀 기반 지표가 개발되어, 결과의 운적 요소를 걷어내고 팀의 실질적 경기력을 평가하는 데 활용된다.

 

 

 

▍ 회귀 분석의 구체적 목적: 평가, 예측, 그리고 이해

 

스포츠에서 회귀 분석이 수행하는 역할은 목적에 따라 크게 세 갈래로 나눌 수 있으며, 각각은 서로 다른 종류의 질문에 답한다.

 

첫째는 성과 평가다. 이는 이미 일어난 일을 대상으로 "이 결과에 각 요인이 얼마나 기여했는가"를 묻는다. 선수의 실력을 배경 조건과 분리해 측정하거나, 팀의 어떤 국면이 승리에 결정적이었는지를 규명하는 작업이 여기 해당한다. 둘째는 예측이다. 과거 데이터로 학습한 모델을 미래에 적용해 앞으로의 성과를 가늠하는 것으로, 다음 시즌 선수의 기록 전망, 경기의 승패 확률 추정, 유망주의 잠재력 평가 등이 대표적이다. 셋째는 이해와 설명이다. 특정 전술이나 훈련 방식이 결과에 미치는 영향의 방향과 크기를 파악해, 의사결정의 근거를 마련하는 것이다.

 

이 세 목적은 서로 다른 요구를 가진다는 점을 이해하는 것이 중요하다. 예측이 목적일 때는 모델이 왜 그런 결과를 내놓는지보다 얼마나 정확히 맞히는지가 중요할 수 있다. 반면 이해와 설명이 목적일 때는 정확도가 다소 떨어지더라도 각 변수의 효과를 명료하게 해석할 수 있는 투명한 모델이 선호된다. 좋은 예측 모델이 반드시 좋은 설명 모델은 아니며, 그 반대도 마찬가지다. 분석의 목적을 먼저 명확히 하지 않으면, 아무리 정교한 모델을 세워도 엉뚱한 결론에 이를 수 있다.

 

 

 

▍ 회귀 분석을 신뢰하기 위한 전제 조건

 

회귀 분석은 강력한 도구이지만, 그 결과가 신뢰할 만하려면 몇 가지 통계적 가정이 충족되어야 한다. 이 가정들이 무너지면 회귀계수의 추정이 왜곡되거나 결론의 신뢰도가 크게 떨어진다.

 

선형 회귀가 전제하는 대표적 가정들을 정리하면 다음과 같다. 이 표는 각 가정이 무엇을 의미하고, 위반될 경우 어떤 문제가 생기는지를 요약한 것이다.

 

아래 표는 회귀 분석의 주요 가정과 그 위반이 초래하는 결과를 한눈에 정리한 것이다.

 

 

 

 

스포츠 데이터에서 특히 문제가 되는 것이 독립성과 다중공선성이다. 같은 선수의 여러 경기 기록은 서로 독립적이지 않고, 한 시즌 안에서 연속된 경기들은 컨디션이나 팀 상태를 공유한다. 또 스포츠 지표들은 서로 밀접하게 연관된 경우가 많아, 여러 지표를 한꺼번에 모델에 넣으면 다중공선성이 발생해 개별 계수의 의미가 불안정해진다. 이런 특성 때문에 스포츠 분석에서는 데이터의 구조를 반영한 정교한 모델링이 요구되며, 단순한 회귀식을 기계적으로 적용하는 것은 위험하다.

 

 

 

▍ 회귀 분석의 한계와 흔한 오류

 

회귀 분석이 스포츠에 가져다준 통찰은 분명하지만, 그 도구를 맹신하는 것은 또 다른 위험을 낳는다. 실무와 연구 현장에서 반복적으로 지적되는 한계들을 이해하는 것은 회귀 분석을 올바르게 활용하기 위한 필수 조건이다.

 

가장 근본적인 문제는 앞서 언급한 상관과 인과의 혼동이다. 회귀 모델이 두 변수 사이에서 강한 연관을 발견했다 하더라도, 이는 인과관계의 증거가 아니다. 예를 들어 어떤 전술 지표가 승리와 강하게 연관되어 있다고 해서, 그 전술을 도입하면 반드시 승리가 늘어난다고 결론짓는 것은 성급하다. 강한 팀이 그 전술을 쓸 여유가 있었을 뿐, 전술 자체가 승리의 원인이 아닐 수도 있기 때문이다. 인과를 주장하려면 회귀 분석만으로는 부족하며, 실험적 설계나 인과 추론의 별도 방법론이 뒷받침되어야 한다.

 

두 번째 함정은 과적합(overfitting)이다. 설명 변수를 지나치게 많이 투입하면 모델은 과거 데이터의 우연한 잡음까지 학습해버려, 정작 새로운 상황에서는 예측력이 급격히 떨어진다. 특히 추적 데이터처럼 변수가 폭발적으로 많은 환경에서는 이 위험이 커진다. 세 번째는 표본의 대표성 문제다. 특정 리그, 특정 시대, 특정 조건에서 얻은 데이터로 세운 모델을 다른 맥락에 그대로 적용하면 오류가 발생할 수 있다. 규칙이 바뀌거나 경기 스타일이 변화하면 과거 데이터로 학습한 관계가 더 이상 성립하지 않을 수 있기 때문이다.

 

네 번째로, 인간의 성과에는 본질적으로 측정하기 어려운 요소들이 존재한다는 점을 인정해야 한다. 리더십, 사기, 심리적 압박에 대한 대응력 같은 요인은 데이터로 온전히 포착되지 않으며, 이런 요소들이 결과에 영향을 미칠 때 회귀 모델은 그 부분을 설명하지 못한 채 오차로 남긴다. 따라서 회귀 분석의 결과는 의사결정의 유일한 근거가 아니라, 전문가의 관찰과 판단을 보완하는 하나의 정보원으로 다루는 것이 합리적이다. 데이터 분석과 현장의 직관은 대립하는 것이 아니라 상호 보완적이며, 양쪽의 균형을 잡는 것이 성공적인 스포츠 의사결정의 관건이라는 견해가 널리 받아들여지고 있다.

 

 

 

▍ 회귀 분석에서 진화하는 현대적 방법들

 

기본적인 선형 회귀는 스포츠 분석의 출발점일 뿐이며, 데이터의 복잡성이 커지면서 다양한 확장된 방법들이 함께 쓰이고 있다. 승패처럼 결과가 둘 중 하나로 나뉘는 상황에서는 확률을 추정하는 로지스틱 회귀가 활용되고, 득점 수처럼 셀 수 있는 결과에는 그에 맞는 회귀 모형이 적용된다. 또 선수가 팀에, 팀이 리그에 속하는 계층 구조를 반영하기 위해 다층 모델이 도입되기도 한다.

 

최근에는 전통적 회귀 분석과 머신러닝 기법이 함께 논의되는 경우가 늘고 있다. 다만 이 둘은 대체 관계라기보다 서로 다른 강점을 지닌 접근으로 볼 수 있다. 복잡한 비선형 관계를 포착하는 데는 유연한 머신러닝 기법이 유리할 수 있지만, 각 변수의 효과를 투명하게 해석하고 그 근거를 설명해야 하는 상황에서는 회귀 분석의 명료함이 여전히 큰 가치를 지닌다. 어떤 방법이 더 우월한지는 일률적으로 말하기 어렵고, 분석의 목적과 데이터의 성격, 해석 가능성에 대한 요구에 따라 달라진다고 보는 것이 타당하다.

 

 

 

▍ 결론: 도구로서의 회귀 분석, 그리고 신중한 해석

 

스포츠 데이터에서 회귀 분석은 여러 요인이 얽힌 복잡한 결과를 이해 가능한 관계로 풀어내고, 과거를 평가하며 미래를 예측하는 데 폭넓게 활용되는 핵심 도구다. 야구의 선수 가치 산정에서부터 농구의 개별 기여 분리, 축구의 경기력 지표 개발에 이르기까지, 회귀 분석은 스포츠가 감에서 근거로 이동하는 과정의 중심에 서 있었다. 그 힘은 여러 변수를 통제하며 특정 요인의 순수한 영향을 분리해낼 수 있다는 데 있다.

 

그러나 이 강력한 도구도 만능은 아니다. 상관을 인과로 오인하지 않는 신중함, 통계적 가정의 충족 여부에 대한 점검, 과적합과 표본 편향에 대한 경계, 그리고 데이터로 담기지 않는 요소에 대한 겸손이 함께할 때 회귀 분석은 비로소 신뢰할 만한 통찰을 제공한다. 결국 회귀 분석은 판단을 대신하는 것이 아니라 판단을 돕는 도구이며, 숫자가 가리키는 방향과 현장의 지혜를 함께 읽어낼 때 그 진가가 발휘된다. 스포츠 데이터가 앞으로 더 풍부하고 정밀해질수록, 그 데이터를 올바르게 해석하는 통계적 소양의 중요성 또한 함께 커질 것이다.