통계적 방법으로 경기 결과를 어떻게 예측합니까? 정직한 대답은 예언이 아닌 확률에서 시작됩니다. 축구는 점수가 낮고 변동성이 큰 스포츠이므로 단일 점수는 결코 확실하지 않습니다. 좋은 모델은 유사한 여러 경기에서 각 결과가 얼마나 자주 발생해야 하는지를 추정합니다. 홈 승리, 무승부, 원정 승리는 고전적인 1X2 가능성 시장을 형성합니다. 오버 및 언더 합계, 두 팀 모두 득점할 수 있는 점수, 정확한 점수는 동일한 목표 프로세스에 대한 다른 보기일 뿐입니다. 가장 오래된 실제 엔진은 목표에 대한 포아송 모델입니다. Michael Maher의 1982년 작업에서는 각 팀의 득점을 공격률과 수비률이 포함된 계산 프로세스로 처리했습니다. 최근 경기에서 해당 비율을 추정한 다음 홈 이점 요소를 추가합니다. 포아송 공식은 0, 1, 2 또는 그 이상의 골이 나올 확률을 제공합니다. 두 개의 독립적인 푸아송을 결합하면 0-0부터 5-4까지의 점수 표가 생성됩니다. 홈팀이 더 많은 점수를 얻은 셀을 합산하면 홈팀의 승리 확률이 나옵니다. 대각선을 합산하면 무승부가 됩니다. 남은 질량은 원정 승리입니다. Dixon과 Coles는 나중에 0-0과 1-1이 일반 포아송이 예상하는 것보다 더 자주 발생한다는 것을 보여주었습니다. 그들의 조정은 점수가 낮은 셀을 부풀리고 다른 셀은 약간 수축시킵니다. 지난 달의 양식이 10개월 전의 경기보다 더 많은 정보를 제공하므로 시간 가치 하락이 중요합니다. 지수 가중치는 기록을 버리지 않고도 최근 게임에 더 많은 목소리를 제공합니다. 리그의 강점은 팀이 여러 대회에서 만날 때도 중요합니다. 최고 수비팀을 상대로 한 골은 강등된 팀을 상대로 한 골과 동일한 증거가 아닙니다. Elo와 같은 등급은 승패 무승부 기록을 매 경기 후에 업데이트되는 단일 강도 수치로 변환합니다. FIFA 순위는 동일한 아이디어의 공개 사촌이지만 더 느리고 정치적입니다. 클럽 모델은 일반적으로 더 많은 데이터를 볼 수 있기 때문에 주말 리그 경기에 대한 전국 순위를 능가합니다. 데이터 품질은 조용한 병목 현상입니다. 누락된 부상, 잘못 코딩된 퇴장, 지연된 라인업은 우아한 수학을 해칠 것입니다. 깨끗한 설비, 깨끗한 점수, 집에 대한 명확한 정의부터 시작하세요. 그러면 통계가 말할 수 있습니다.

슛이 같지 않기 때문에 예상 골이 대화를 바꿨습니다. 6미터에서 탭인하는 것은 군중 속으로 30미터 운전하는 것이 아닙니다. xG 모델은 위치, 지원 유형, 때로는 수비수 밀도를 기반으로 각 샷에 과거 전환 확률을 할당합니다. 경기 전반에 걸쳐 슛 품질을 합산하면 팀이 받을 자격이 있는 골 수를 추정할 수 있습니다. 시즌 전반에 걸쳐 찬성과 반대의 xG는 포스트와 골키퍼를 상대로 하는 원시 골보다 더 안정적입니다. 푸아송 스타일 모델에서 xG를 공격 및 방어 입력으로 사용하면 보정이 향상되는 경우가 많습니다. 하지만 xG는 마법이 아닙니다. 단일 주말의 표본 크기는 작습니다. 팀은 2.4 xG를 게시하고 모델이 잘못되지 않은 상태에서 1-0으로 패할 수 있습니다. 모델은 기회가 만들어졌다고 말했습니다. 경기는 마무리와 세이브가 개입했다고 말했습니다. 그 격차는 차이이지 숫자를 포기할 이유가 아닙니다. 점유, 박스 안으로의 패스, 압박 강도는 상황을 추가하지만 동일한 공격 스토리를 두 배로 계산할 수 있습니다. 기능 선택은 단지 마지막 방송을 설명하는 변수가 아닌 미래 목표를 예측하는 변수를 선호해야 합니다. 지난 시즌에 대한 교차 검증은 성인이 선택할 수 있는 방법입니다. 초기에 훈련하고, 다음 해에 테스트하고, 표본 내 적합성을 축하하지 마세요. Brier 점수와 로그 손실은 과신한 확률을 처벌합니다. 가장 가능성이 높은 점수의 정확도| 1-1과 1-0은 확률 질량을 공유하기 때문에 허영 측정항목입니다. 홈 38%, 무승부 28%, 원정 34%라는 모델은 원정팀이 승리하더라도 탁월할 수 있다. 문제는 34%의 원정 승리가 실제로 약 1/3의 시간에 도달하는지 여부입니다. 교정 플롯이 그 질문에 답합니다. 선명도는 다른 축입니다. 항상 33-33-33이라고 말하는 모델은 보정되어 쓸모가 없습니다. 증거가 움직일 때 움직이는 확률을 원합니다. 선발 공격수의 부상은 공격률을 낮춰야 합니다. 주중에 혼잡하면 회전 및 늦은 목표 가능성이 약간 높아집니다. 이동 거리, 휴식일, 더비 강도는 여전히 합산되는 작은 효과입니다. 날씨와 피치 품질을 추정할 만큼 비가 오는 경기가 충분하지 않은 한 오류 항목에 속합니다. 설명할 수 있을 만큼 핵심 모델을 단순하게 유지하세요. 확인할 수 없는 복잡성은 결국 당신의 몫이 될 것입니다.

실용적인 파이프라인은 텔레비전 그래픽보다 덜 낭만적으로 보입니다. 날짜, 팀, 장소, 점수를 포함하여 완료된 경기를 수집하세요. 시간 경과에 따른 롤링 공격 및 방어 등급을 계산합니다. 리그가 신뢰할 수 있는 샷 데이터를 게시하는 경우 xG를 혼합하세요. 평점을 다음 경기의 예상 골로 변환하세요. 점수 행렬을 구축합니다. 1X2, 총계, 양팀 득점을 읽어보세요. 이러한 확률을 자신의 가능성을 대체하는 것이 아니라 온전한 점검 목적으로만 종가와 비교하십시오. 시장은 군중이다. 늦은 소식에 군중은 종종 날카로워지고 때로는 느려집니다. 당신의 우위는 일반적으로 부상 타이밍이 더 좋거나 리그별 홈 요소가 더 깔끔하다는 것입니다. 55%의 홈 승리를 약속으로 여기지 마십시오. 유사한 주택이 절반 이상 승리한다는 진술로 취급하십시오. 자금에 대한 사고는 예측과 별개인 베팅에 속합니다. 확률이 정직할 때 예측은 종료됩니다. 정직한 예측은 여전히 유명한 혼란을 놓치고 있습니다. 왜냐하면 혼란이 꼬리에 있기 때문입니다. 레드 카드, 페널티 복권, 마지막 순간의 자책골이 그 꼬리에 있습니다. 방법에 관한 좋은 기사에서는 이 말을 두 번 해야 합니다. 통계적 예측은 수정구슬이 아닙니다. 상대적 가능성을 나타내는 지도입니다. 지도는 두 가지 일반적인 팬 오류를 방지하는 데 도움이 됩니다. 첫 번째 오류는 최신 극장입니다. 4-0으로 한 번 승리해도 중간 테이블 팀이 타이틀을 가장 좋아하는 팀이 되지 않습니다. 두 번째 오류는 내러티브 캡처입니다. 유명한 클럽 이름은 등급이 아닙니다. 실적이 떨어지면 시청률도 떨어지도록 허용해야 한다. 계층적 모델은 데이터가 부족할 때 리그 전체에서 강점을 공유할 수 있습니다. 베이지안 업데이트는 이전부터 시작하여 증거를 가지고 이동하는 공식적인 방법입니다. 아이디어를 사용하기 위해 박사 학위가 필요하지 않습니다. 리그 평균 예상 골로 시작한 다음 팀의 최근 경기에 대한 추정치를 가져옵니다. 작은 표본은 평균을 향해 축소됩니다. 큰 샘플은 극단적으로 보일 수 있습니다. 이러한 축소로 인해 3경기 연속 연속 무승부에 대한 과잉 반응을 방지할 수 있습니다. 또한 거인에게 두 번 패배한 후 새로 승격된 팀을 묻어두는 것을 방지합니다. 컨텍스트는 여전히 왕입니다. 홈에서 리그 선두를 상대로 1-0으로 승리하는 것은 최하위 클럽을 상대로 3-0으로 승리하는 것보다 더 강력한 신호일 수 있습니다. 상대 조정 없는 골득실차는 무딘 도구다. 상대 조정 골득실 차이는 포아송과 엘로가 이미 포착하려고 시도한 것과 더 가깝습니다.

그렇다면 독자는 시작하기 전에 이러한 방법을 실제로 어떻게 사용해야 할까요? 먼저 질문을 숫자로 적어보세요. 가장 가능성이 높은 1X2, 점수 분포를 원하시나요, 아니면 두 팀 모두 득점하는지 여부만 원하시나요? 둘째, 마지막 세 개의 헤드라인이 아니라 각 팀에 대해 최근 30~50개의 관련 경기를 수집하세요. 셋째, 대부분의 리그에서 여전히 골의 몇 십분의 일을 추가하는 홈 이점을 조정합니다. 넷째, 리그 데이터가 부족한 경우를 제외하고 친선 경기와 컵 동점 불일치를 할인합니다. 다섯째, 0-0과 1-1에 관심이 있는 경우 Dixon-Coles 스타일 수정을 적용합니다. 여섯째, 그리드를 실제로 논의할 확률로 변환합니다. 일곱째, 부상, 출전 정지, 명백한 로테이션에 대한 건전성 점검. 여덟째, 47%를 확실한 것으로 반올림하지 마십시오. 아홉째, 확률과 실제 결과를 기록해 두십시오. 열째, 똑똑해 보였던 주말만 기억하는 대신 매달 보정을 검토하세요. FootballAlarm 스타일의 통계 페이지가 존재하는 이유는 모든 리그에 대해 이를 수동으로 수행하는 것이 지루하기 때문입니다. 자동화는 판단을 대체하지 않습니다. 복사-붙여넣기 오류를 대체합니다. 판단에 따라 새로 영입된 공격수가 11명에 포함되는지 여부가 결정됩니다. 물에 잠긴 투구가 슈팅 가치를 변화시키는지는 여전히 판단에 의해 결정됩니다. 그런 다음 모델은 해당 호출을 진동이 아닌 변경된 입력으로 흡수합니다. 바이브는 방법이 아닙니다. 방법은 감사를 받을 수 있기 때문에 당황스러운 일이 있어도 살아남습니다. 감사 추적에는 사용한 데이터 빈티지, 부패 매개변수 및 홈 요소가 포함됩니다. 이 세 가지를 말할 수 없다면 아직 통계적 예측이 없는 것입니다. 스프레드시트 의상을 입고 있다는 의견이 있습니다. 의견이 맞을 수도 있습니다. 통계적 방법은 다음 주 토요일에도 여전히 유효할 이유로 옳으려고 노력합니다. 다음 토요일에는 그리드에서 ‘가능성 없음’이라는 점수가 하나 이상 포함됩니다. 그것은 실패가 아닙니다. 그게 축구다. 축구는 우리가 경기를 유명한 로고로 동전 던지는 척하는 대신 카운트를 모델링하는 이유입니다. 동전던지기는 공격과 방어를 무시합니다. 포아송은 그렇지 않습니다. xG는 그렇지 않습니다. 엘로는 그렇지 않습니다. 겸손하게 그것들을 함께 사용하십시오. 겸손은 마지막 통계 방법이고, 한 팬은 건너뛴다. 건너뛰지 마세요. 예측하고, 기록하고, 수정하세요. 그렇다면 어쨌든 경기를 지켜보세요. 아름다움은 결코 38%가 아니었기 때문입니다. 아름다움은 미리 경고하려고 노력한 공, 미스, 숫자입니다.
따라서 경기 예측의 수명은 헤드라인이 아니라 루프입니다. 수집하고, 평가하고, 프로젝트하고, 점수를 매기고, 학습하세요. 포아송은 목표 언어를 제공합니다. Dixon-Coles는 조용한 악보를 수정합니다. xG는 어떤 기회가 실제였는지 알려줍니다. 엘로는 월요일마다 당황하지 않는 달리기 근력을 유지하고 있다. 홈 어드밴티지는 여전히 완고한 경험적 사실로 남아있습니다. 시간 붕괴는 모델을 활성 상태로 유지합니다. 교정은 모델러를 정직하게 유지합니다. 이 중 어느 것도 90분의 드라마를 제거하지 못합니다. 드라마 가격만 나오네요. 가격 드라마는 분석가들이 추측을 거부할 때 말하는 방식입니다. 추측하는 것은 저렴합니다. 견적은 작업입니다. 작업은 경기 전 그리드 모드가 1-1인 동안 5분 남았을 때 2-1로 표시될 수 있는 점수판처럼 보입니다. 둘 다 사실일 수 있습니다. 모드는 명령이 아닙니다. 최빈값은 분포의 정점입니다. 분포는 통계적 일치 예측의 핵심입니다. 한 문장만 기억난다면 그 문장을 기억하세요. 결과는 샘플입니다. 방법은 배포입니다. 확률 없이 단일 점수만 게시하는 방법은 불확실성을 숨기고 있습니다. 불확실성은 제품입니다. 게시하세요. 그러면 독자는 40%의 집이 실제로 무엇을 의미하는지 결정할 수 있습니다. 이는 이미 새겨진 트로피가 아니라 10번 중 4번의 비슷한 경기를 의미합니다. 각인은 휘파람 소리 후에 발생합니다. 통계는 이전에 발생합니다. 이 기사가 있는 곳은 이전입니다. 이후는 테이블이 업데이트되는 곳입니다. 그들 사이에는 경기가 어떻게 끝날지 대답할 수 있는 유일한 정직한 기술이 있습니다. 마음에 드는 것으로 끝날 수도 있습니다. 그렇지 않을 수도 있습니다. 숫자는 분할을 알려줍니다. 그 분할은 예측입니다. 다른 모든 것은 연극입니다. 극장이 허용됩니다. 연극은 방법이 아니다. 그 방법은 여기에, 200개의 문장으로, 다음 고정 장치가 소문 대신 그리드와 직면하도록 합니다. 그리드를 사용하세요. 꼬리를 존중하세요. 경기를 즐기세요.
리그 테이블은 롤링 xG에 비해 후행 지표입니다. 새로 승격된 클럽은 초기에 비관적인 이전 클럽보다 더 나은 성과를 내는 경우가 많습니다. 전환 중인 챔피언은 초기의 낙관적인 사전 실적보다 낮은 성과를 보이는 경우가 많습니다. 세트피스 전문가들은 작은 별도의 공격 범프를 받을 자격이 있습니다. 압박이 심한 팀은 슛 데이터가 불완전할 경우 푸아송이 슛을 놓칠 수 있는 전환 기회를 인정합니다. 골키퍼의 자질은 신비한 아우라가 아닌 수비 등급에 속합니다. 벌금율은 시끄럽습니다. 한 지점 킥 후에는 모델을 다시 작성하지 마십시오. 레드카드 주파수도 시끄럽기 때문에 리그 기반 등급이어야 합니다. 컵 대회에는 리그 모델이 부분적으로만 포착하는 동기가 혼합되어 있습니다. 인터내셔널은 클럽 리듬을 재설정하고 일부 중간 테이블 팀의 무승부 기회를 약간 부풀렸습니다. 여자 리그와 남자 리그에는 별도의 매개변수 파일이 필요합니다. Premier League 홈 이점을 다른 디비전으로 복사하는 것은 흔히 발생하는 조용한 오류입니다. 예측하고 있는 리그 내에서 홈 어드밴티지를 추정해 보세요. 승리에 대한 3점은 역사적으로 인센티브를 변경했으므로 1990년대 이전 데이터를 맹목적으로 수집하지 마십시오. 5명의 교체와 같은 규칙 변경도 게임 후반 목표 비율을 변경합니다. 정권 변화를 추적하지 않으면 붕괴 가중치가 과거와 싸울 것입니다. StatsBomb 및 유사한 프로젝트의 공개 데이터를 통해 아마추어가 xG를 재현할 수 있게 되었습니다. 재현성은 누구도 확인할 수 없는 비법 소스보다 더 가치가 있습니다. 두 모델이 일치하지 않으면 출력의 평균을 계산하기 전에 입력을 검사하십시오. 보정된 모델을 평균화하는 것이 도움이 될 수 있습니다. 이야기를 평균화하는 것은 거의 도움이 되지 않습니다. 무승부가 많은 리그는 득점이 높은 리그와는 다른 Dixon-Coles 강도가 필요합니다. 스칸디나비아의 시즌 초반 투구는 스페인의 8월이 아니다. 지리는 운명이 아니지만 공변량이다. 대륙 컵에서 시간대를 넘나드는 여행은 실제 피로 변수입니다. 주중 유럽 경기는 종종 주말 리그의 강도를 억제합니다. 대규모 선수단의 로테이션 정책은 11명의 라인업을 필수 입력으로 만듭니다.