+ (90) 0224 334 11 43
+ (90) 549 596 77 59
9:00 AM -18:30 PM
Ofis Artı Plaza, 16265 Ni̇lüfer/Bursa
Uncategorized

Matchresultaten voorspellen met statistische methoden

Hoe voorspel je een wedstrijduitslag met statistische methoden? Het eerlijke antwoord begint met waarschijnlijkheden, niet met profetie. Voetbal is een sport met weinig scores en een hoge variantie, dus een enkele score is nooit een zekerheid. Een goed model schat hoe vaak elke uitkomst zou moeten voorkomen in veel vergelijkbare wedstrijden. Thuisoverwinning, gelijkspel en uitoverwinning vormen de klassieke 1X2-markt van mogelijkheden. Over- en ondertotalen, beide teams scoren en exacte scores zijn slechts andere weergaven van hetzelfde doelpuntproces. De oudste praktische motor is een Poisson-model voor doelen. In het werk van Michael Maher uit 1982 werd de score van elk team behandeld als een telproces met een aanvalspercentage en een verdedigingspercentage. Je schat die tarieven op basis van recente wedstrijden en voegt er vervolgens een woonvoordeelfactor aan toe. De Poisson-formule geeft dan de kans op nul, één, twee of meer doelpunten. Het combineren van twee onafhankelijke Poissons levert een scoreraster op van 0-0 tot 5-4 en hoger. Het optellen van de cellen waarin de thuisploeg meer scoort, levert een thuisoverwinningskans op. Het optellen van de diagonaal levert de gelijkspel op. De resterende massa is de uitoverwinning. Dixon en Coles lieten later zien dat 0-0 en 1-1 vaker voorkomen dan een gewone Poisson verwacht. Hun aanpassing blaast die cellen met een lage score op en laat andere enigszins leeglopen. Tijdsverval is van belang omdat het formulier van vorige maand informatiever is dan een wedstrijd van tien maanden geleden. Exponentiële gewichten geven recente games meer stem zonder de geschiedenis weg te gooien. De sterkte van de competitie is ook van belang als teams elkaar in competities ontmoeten. Een doelpunt tegen een topverdediging is niet hetzelfde bewijs als een doelpunt tegen een gedegradeerde ploeg. Beoordelingen zoals Elo zetten de winst-verlies-gelijkspelgeschiedenis om in één enkel sterktegetal dat na elke wedstrijd wordt bijgewerkt. FIFA-ranglijsten zijn een publieke neef van hetzelfde idee, hoewel ze langzamer en politieker zijn. Clubmodellen verslaan doorgaans de nationale ranglijsten voor wedstrijden in de weekendcompetitie omdat ze meer gegevens zien. Datakwaliteit is het stille knelpunt. Ontbrekende blessures, verkeerd gecodeerde rode kaarten en vertraagde opstellingen zullen de elegante wiskunde vergiftigen. Begin met schone wedstrijden, zuivere scores en een duidelijke definitie van thuis. Dan kunnen de statistieken spreken.

Opstelling van de Premier League-wedstrijden — Manchester City vs. Burnley, 31 januari 2024 (CC0 / Wikimedia Commons)
Opstelling van de Premier League-wedstrijden — Manchester City vs. Burnley, 31 januari 2024 (CC0 / Wikimedia Commons)

Verwachte doelpunten veranderden het gesprek omdat schoten niet gelijk zijn. Een tik vanaf zes meter is geen dertig meter inrijden op een menigte. xG-modellen kennen aan elk schot een historische conversiekans toe op basis van locatie, type assist en soms de dichtheid van verdedigers. Door de schotkwaliteit van een wedstrijd bij elkaar op te tellen, wordt geschat hoeveel doelpunten een team verdiende. Over een seizoen zijn xG voor en tegen stabieler dan ruwe doelpunten, die op palen en keepers slingeren. Het gebruik van xG als aanvals- en verdedigingsinvoer in een Poisson-stijl model verbetert vaak de kalibratie. Toch is xG geen magie. De steekproefomvang in één weekend is klein. Een team kan 2,4 xG posten en met 1-0 verliezen zonder dat het model ongelijk heeft. Het model zei dat er kansen werden gecreëerd. De wedstrijd zei afwerking en reddingen kwamen tussenbeide. Die kloof is variantie, geen reden om cijfers achterwege te laten. Balbezit, passes in het strafschopgebied en drukintensiteit voegen context toe, maar kunnen hetzelfde aanvallende verhaal dubbel tellen. Bij de selectie van speelfilms moet de voorkeur worden gegeven aan variabelen die toekomstige doelen voorspellen, en niet aan variabelen die alleen maar de laatste uitzending beschrijven. Kruisvalidatie op voorgaande seizoenen is de volwassen manier om te kiezen. Train op eerdere jaren, test op een later jaar en weiger de fitheid in de steekproef te vieren. Brier-score en logverlies bestraffen overmoedige kansen. Nauwkeurigheid van de meest waarschijnlijke score| is een ijdelheidsmetriek omdat 1-1 en 1-0 de waarschijnlijkheidsmassa delen. Een model dat zegt: 38 procent thuis, 28 procent gelijkspel, 34 procent uit, kan uitstekend zijn, zelfs als de uitploeg wint. De vraag is of die 34 procent uitoverwinningen ook daadwerkelijk in een derde van de gevallen binnenkomen. Kalibratieplots beantwoorden die vraag. Scherpte is de andere as: een model dat altijd 33-33-33 zegt, is gekalibreerd en nutteloos. Je wilt waarschijnlijkheden die bewegen als het bewijsmateriaal beweegt. Blessures van een startende spits zouden de aanvalssnelheid moeten verlagen. Een drukke midweek zou de kans op rotatie en late doelpunten iets moeten vergroten. Reisafstand, rustdagen en derby-intensiteit zijn kleine effecten die nog steeds optellen. Het weer en de kwaliteit van het veld horen thuis in de foutterm, tenzij je voldoende regenachtige wedstrijden hebt om ze in te schatten. Houd het kernmodel eenvoudig genoeg om uit te leggen. Complexiteit die niet kan worden gecontroleerd, zal uiteindelijk tegen je liegen.

Wedstrijdscorebord in Stade Saputo, Montreal (CC BY-SA 3.0 / Wikimedia Commons)
Wedstrijdscorebord in Stade Saputo, Montreal (CC BY-SA 3.0 / Wikimedia Commons)

Een praktische pijplijn ziet er minder romantisch uit dan een televisiegraphic. Verzamel voltooide wedstrijden met datums, teams, locaties en scores. Bereken rollende aanvals- en verdedigingsbeoordelingen met tijdsverval. Voeg xG toe als de competitie betrouwbare schotgegevens publiceert. Converteer beoordelingen naar verwachte doelen voor de volgende wedstrijd. Bouw de scorematrix. Lees 1X2, totalen en beide teams die scoren. Vergelijk deze kansen alleen met de slotkoersen als controle op de gezondheid, en niet als vervanging voor uw eigen waarschijnlijkheid. Markten zijn drukte. De menigte is vaak hevig en soms traag bij laat nieuws. Je voorsprong, als je die hebt, is meestal een betere timing van blessures of een schonere competitiespecifieke thuisfactor. Beschouw een thuisoverwinning van 55 procent nooit als een belofte. Beschouw het als een verklaring dat vergelijkbare huizen iets meer dan de helft van de tijd winnen. Het bankrolldenken behoort tot het gokken, wat een aparte discipline is van het voorspellen. Het voorspellen eindigt wanneer de kansen eerlijk zijn. Eerlijke voorspellingen gaan nog steeds voorbij aan de beroemde verstoringen, omdat de verstoringen in de staart zitten. Rode kaarten, strafloterijen en eigen doelpunten op het laatste moment zitten in die staart. Een goed artikel over methoden moet dit twee keer zeggen. Statistische voorspelling is geen kristallen bol. Het is een kaart van relatieve waarschijnlijkheid. Kaarten helpen u de twee veelvoorkomende ventilatorfouten te vermijden. De eerste fout is recentheidstheater: één 4-0 overwinning maakt een middenmoot nog niet tot een titelfavoriet. De tweede fout is het verhalend vastleggen: een bekende clubnaam is geen rating. Waarderingen moeten kunnen dalen als de prestaties afnemen. Hiërarchische modellen kunnen hun kracht delen tussen divisies als de gegevens schaars zijn. Bayesiaanse actualisering is een formele manier om vanuit een eerdere situatie te vertrekken en met bewijsmateriaal verder te gaan. Je hebt geen PhD nodig om het idee te gebruiken. Begin met verwachte doelpunten die in de competitie gemiddeld zijn, en trek de schatting vervolgens in de richting van de recente wedstrijden van het team. Kleine steekproeven krimpen in de richting van het gemiddelde. Grote monsters mogen er extreem uitzien. Die krimp zorgt ervoor dat je niet overreageert op een hot streak van drie wedstrijden. Het weerhoudt je er ook van om een ​​pas gepromoveerde ploeg te begraven na twee nederlagen tegen reuzen. Context blijft koning. Een 1-0 thuis tegen de koploper kan een sterker signaal zijn dan een 3-0 tegen de onderste club. Doelsaldo zonder aanpassing van de tegenstander is een bot instrument. Het door de tegenstander aangepaste doelsaldo ligt dichter bij wat Poisson en Elo al proberen vast te leggen.

Zenit vs Spartak, Russische Premier League, 2 maart 2024 (CC BY-SA 3.0 / Wikimedia Commons)
Zenit vs Spartak, Russische Premier League, 2 maart 2024 (CC BY-SA 3.0 / Wikimedia Commons)

Dus hoe moet een lezer deze methoden eigenlijk gebruiken vóór de aftrap? Schrijf de vraag eerst in cijfers op. Wil je de meest waarschijnlijke 1X2, een scoreverdeling of alleen of beide teams scoren? Ten tweede: verzamel de laatste dertig tot vijftig relevante wedstrijden voor elke ploeg, niet de laatste drie krantenkoppen. Ten derde: pas aan voor het thuisvoordeel, dat in de meeste competities nog steeds een paar tienden van een doelpunt oplevert. Ten vierde, korting op vriendschappelijke wedstrijden en niet-matchbekerwedstrijden, tenzij je geen competitiegegevens hebt. Ten vijfde: pas een Dixon-Coles-stijlcorrectie toe als je om 0-0 en 1-1 geeft. Ten zesde: converteer het raster naar de kansen die u daadwerkelijk gaat bespreken. Ten zevende: controleer uw gezondheid op blessures, schorsingen en voor de hand liggende rotaties. In de achtste plaats: weiger 47 procent af te ronden tot iets zekers. Ten negende: houd een logboek bij van uw kansen en de werkelijke resultaten. Ten tiende: controleer de kalibratie elke maand in plaats van alleen de weekenden te onthouden waarin u er slim uitzag. Er bestaan ​​statistische pagina’s in FootballAlarm-stijl omdat het vervelend is om dit voor elke competitie handmatig te doen. Automatisering vervangt het oordeel niet. Het vervangt kopieer- en plakfouten. Het oordeel beslist nog of een nieuw aangetekende spits in de elf zit. Het oordeel bepaalt nog steeds of een doordrenkt veld de schietwaarde verandert. Het model absorbeert deze oproepen vervolgens als gewijzigde input, niet als vibraties. Vibes zijn geen methode. Methoden overleven schaamte omdat ze kunnen worden gecontroleerd. Audittrails omvatten de gegevensvintage, de vervalparameter en de thuisfactor die u hebt gebruikt. Als je die drie niet kunt benoemen, heb je nog geen statistische prognose. Je hebt een mening in een spreadsheetkostuum. Meningen kunnen juist zijn. Statistische methoden proberen gelijk te hebben om een ​​reden die komende zaterdag nog steeds zal werken. Volgende zaterdag zal minstens één score bevatten die volgens de grid onwaarschijnlijk wordt genoemd. Dat is geen mislukking. Dat is voetbal. Voetbal is de reden waarom we tellingen modelleren in plaats van te doen alsof wedstrijden muntjes zijn met beroemde logo’s. Coinflips negeren aanval en verdediging. Poisson niet. xG niet. Elo niet. Gebruik ze samen met nederigheid. Nederigheid is de laatste statistische methode, en degene die fans overslaan. Sla het niet over. Voorspellen, vastleggen, herzien. Kijk dan toch maar naar de wedstrijd, want het mooie was nooit de 38 procent. Het mooie is de bal, de misser en het nummer dat je van tevoren probeerde te waarschuwen.

De levensduur van een wedstrijdvoorspelling is daarom een ​​lus, geen kop. Verzamel, beoordeel, projecteer, scoor en leer. Poisson geeft je een doeltaal. Dixon-Coles repareert de stille partituren. xG vertelt je welke kansen reëel waren. Elo behoudt een loopkracht die niet elke maandag in paniek raakt. Thuisvoordeel blijft een hardnekkig empirisch feit. Tijdverval houdt het model wakker. Kalibratie houdt de modelbouwer eerlijk. Niets van dit alles haalt drama uit negentig minuten. Het prijst alleen maar het drama. Prijsdrama is de manier waarop analisten praten als ze weigeren te raden. Gissen is goedkoop. Schatten is werk. Werk ziet eruit als een scorebord dat met nog vijf minuten te gaan 2-1 zou kunnen zijn, terwijl je pre-match grid 1-1 als modus had. Beide kunnen waar zijn. De modus is geen opdracht. De modus is de piek van een distributie. Verdelingen vormen het hele punt van statistische wedstrijdvoorspelling. Als je je maar één zin herinnert, onthoud die dan. Een resultaat is een monster. Een methode is een verdeling. Methoden die slechts één enkele score publiceren zonder waarschijnlijkheden verbergen hun onzekerheid. Onzekerheid is het product. Publiceer het. Dan kan de lezer beslissen wat 40 procent thuis werkelijk betekent. Het betekent vier soortgelijke wedstrijden op de tien, en niet een al gegraveerde trofee. Het graveren gebeurt na het fluitsignaal. Statistieken gebeuren eerder. Vroeger is waar dit artikel leeft. Hierna wordt de tabel bijgewerkt. Tussen hen in zit het enige eerlijke instrument dat we hebben om te beantwoorden hoe een wedstrijd zou kunnen eindigen. Het zou kunnen eindigen als de favoriet. Misschien niet. De cijfers vertelden je de splitsing. Die splitsing is de voorspelling. Al het andere is theater. Theater is toegestaan. Theater is geen methode. De methode staat hier, in tweehonderd zinnen, zodat de volgende wedstrijd met een raster wordt geconfronteerd in plaats van met een gerucht. Gebruik het raster. Respecteer de staart. Geniet van de wedstrijd.

Competitietabellen zijn achterblijvende indicatoren vergeleken met voortschrijdende xG. Een pas gepromoveerde club presteert vaak beter dan vroege pessimistische voorgangers. Een kampioen in transitie presteert vaak slechter dan vroege, optimistische voorgangers. Set-stukspecialisten verdienen een kleine, aparte aanvalshobbel. Teams met een hoge pers geven overgangskansen toe die Poisson bij schoten kan missen als de schotgegevens onvolledig zijn. De kwaliteit van de keeper hoort thuis in de verdedigingsrating, niet in een mystieke uitstraling. De straftarieven zijn luidruchtig; bouw een model niet opnieuw op na één strafschop. Rode kaartfrequenties zijn ook luidruchtig en moeten op basis van de competitie worden beoordeeld. Bekercompetities combineren motivaties die competitiemodellen slechts gedeeltelijk weerspiegelen. Internationale breaks resetten het clubritme en vergroten de gelijkspelkansen voor sommige middenmoot-ploegen enigszins. Damescompetities en herencompetities hebben afzonderlijke parameterbestanden nodig. Het kopiëren van het thuisvoordeel van de Premier League naar een andere divisie is een veel voorkomende stille fout. Schat het thuisvoordeel in de competitie die u verwacht. Drie punten voor een overwinning veranderden historisch gezien de prikkels, dus verzamel de gegevens van vóór de jaren negentig niet blindelings. Regelwijzigingen, zoals vijf wissels, veranderen ook de doelpuntenpercentages in de late wedstrijd. Volg die regimeverschuivingen, anders zullen je vervalgewichten het verleden bestrijden. Open data van StatsBomb en soortgelijke projecten maakten xG reproduceerbaar voor amateurs. Reproduceerbaarheid is waardevoller dan een geheime saus die niemand kan controleren. Als twee modellen het niet eens zijn, inspecteer dan de inputs voordat u de outputs gaat middelen. Het middelen van gekalibreerde modellen kan helpen; het middelen van verhalen helpt zelden. Een competitie met veel gelijkspel heeft een andere Dixon-Coles-intensiteit nodig dan een competitie met hoge scores. Scandinavische vroegseizoenplaatsen zijn in Spanje niet augustus. Geografie is geen lot, maar het is een covariaat. Reizen door tijdzones in continentale cups is een echte vermoeidheidsvariabele. Europese midweekwedstrijden onderdrukken vaak de intensiteit van de weekendcompetitie. Door het rotatiebeleid van grote squadrons zijn opstellingen met elf namen een vereiste input.

Uncategorized

Come prevedere i risultati delle partite con metodi statistici

Come si prevede il risultato di una partita con metodi statistici? La risposta onesta inizia con le probabilità, non con la profezia. Il calcio è uno sport con punteggi bassi e varianza elevata, quindi un singolo punteggio non è mai una certezza. Un buon modello stima la frequenza con cui ogni risultato dovrebbe verificarsi in molte partite simili. La vittoria in casa, il pareggio e la vittoria in trasferta costituiscono il classico mercato di possibilità 1X2. I totali sopra e sotto, entrambe le squadre che segnano e i punteggi esatti sono solo altre visualizzazioni dello stesso processo di goal. Il motore pratico più antico è un modello di Poisson per obiettivi. Il lavoro di Michael Maher del 1982 trattava il punteggio di ciascuna squadra come un processo di conteggio con un tasso di attacco e un tasso di difesa. Stimi tali tassi dalle partite recenti, quindi aggiungi un fattore di vantaggio della casa. La formula di Poisson dà quindi la possibilità di zero, uno, due o più gol. La combinazione di due Poisson indipendenti produce una griglia di punteggio da 0-0 a 5-4 e oltre. Sommando le celle in cui la squadra di casa segna di più si ottiene una probabilità di vittoria in casa. Sommando la diagonale si ottiene il pareggio. La massa rimanente è la vittoria in trasferta. Dixon e Coles hanno poi dimostrato che lo 0-0 e l’1-1 accadono più spesso di quanto un semplice Poisson si aspetti. La loro regolazione gonfia le celle con punteggio basso e sgonfia leggermente le altre. Il decadimento temporale è importante perché la forma del mese scorso è più informativa di una partita di dieci mesi fa. I pesi esponenziali danno più voce ai giochi recenti senza buttare via la storia. La forza del campionato conta anche quando le squadre si incontrano nelle competizioni. Un gol contro una difesa di vertice non è la stessa prova di un gol contro una squadra retrocessa. Valutazioni come Elo convertono la cronologia di vittorie-sconfitte-pareggi in un unico numero di forza che si aggiorna dopo ogni partita. Le classifiche FIFA sono cugine pubbliche della stessa idea, sebbene siano più lente e più politiche. I modelli di club di solito battono le classifiche nazionali per le partite della lega del fine settimana perché vedono più dati. La qualità dei dati è il collo di bottiglia silenzioso. Infortuni mancati, cartellini rossi codificati erroneamente e formazioni ritardate avveleneranno la matematica elegante. Inizia con partite pulite, punteggi puliti e una chiara definizione di casa. Poi potranno parlare le statistiche.

Formazione delle partite della Premier League — Manchester City vs Burnley, 31 gennaio 2024 (CC0 / Wikimedia Commons)
Formazione delle partite della Premier League — Manchester City vs Burnley, 31 gennaio 2024 (CC0 / Wikimedia Commons)

I gol attesi hanno cambiato la conversazione perché i tiri non sono uguali. Un tap-in da sei metri non è un tiro di trenta metri in mezzo alla folla. I modelli xG assegnano a ogni tiro una probabilità di conversione storica in base alla posizione, al tipo di assist e talvolta alla densità del difensore. Sommando la qualità del tiro durante una partita si stima quanti gol avrebbe meritato una squadra. Nel corso di una stagione, gli xG a favore e contro sono più stabili dei gol grezzi, che oscillano su pali e portieri. L’uso di xG come input di attacco e difesa in un modello in stile Poisson spesso migliora la calibrazione. Tuttavia, xG non è magico. La dimensione del campione in un singolo fine settimana è piccola. Una squadra può postare 2,4 xG e perdere 1-0 senza che il modello sia sbagliato. Il modello diceva che le occasioni venivano create. La partita ha detto rifinitura e sono intervenute le parate. Questo divario è una varianza, non un motivo per abbandonare i numeri. Il possesso palla, i passaggi in area e l’intensità del pressing aggiungono contesto ma possono raddoppiare la stessa storia offensiva. La selezione delle funzionalità dovrebbe preferire variabili che predicono obiettivi futuri, non variabili che descrivono semplicemente l’ultima trasmissione. La convalida incrociata delle stagioni passate è il modo adulto di scegliere. Allenarsi negli anni precedenti, testare l’anno successivo e rifiutarsi di celebrare l’adattamento del campione. Il punteggio Brier e la perdita del log puniscono le probabilità troppo sicure. Precisione del punteggio più probabile| è una metrica di vanità perché 1-1 e 1-0 condividono la massa di probabilità. Un modello che dice 38% in casa, 28% pareggio, 34% in trasferta può essere eccellente anche quando vince la squadra in trasferta. La domanda è se quel 34% di vittorie esterne arriva effettivamente circa un terzo delle volte. I grafici di calibrazione rispondono a questa domanda. La nitidezza è l’altro asse: un modello che dice sempre 33-33-33 è calibrato e inutile. Vuoi che le probabilità si muovano quando si muovono le prove. Gli infortuni a un attaccante titolare dovrebbero abbassare la velocità di attacco. Un infrasettimanale congestionato dovrebbe aumentare leggermente la possibilità di rotazione e gol nel finale. La distanza percorsa, i giorni di riposo e l’intensità del derby sono piccoli effetti che si sommano ancora. Il tempo e la qualità del campo rientrano nel termine di errore a meno che tu non abbia abbastanza partite piovose per stimarli. Mantieni il modello principale abbastanza semplice da spiegare. La complessità che non può essere controllata alla fine ti mentirà.

Tabellone segnapunti della partita allo Stade Saputo, Montreal (CC BY-SA 3.0 / Wikimedia Commons)
Tabellone segnapunti della partita allo Stade Saputo, Montreal (CC BY-SA 3.0 / Wikimedia Commons)

Una pipeline pratica sembra meno romantica di una grafica televisiva. Raccogli le partite finite con date, squadre, luoghi e punteggi. Calcola le valutazioni di attacco e difesa a rotazione con decadimento temporale. Aggiungi xG se la lega pubblica dati affidabili sui tiri. Converti le valutazioni in obiettivi attesi per la prossima partita. Costruisci la matrice dei punteggi. Leggi 1X2, i totali ed entrambe le squadre che segnano. Confronta queste probabilità con i prezzi di mercato di chiusura solo come controllo di integrità, non come sostituto della tua probabilità. I mercati sono folle. La folla è spesso acuta e talvolta lenta con le ultime notizie. Il tuo vantaggio, se ne hai uno, di solito è un miglior tempismo degli infortuni o un fattore casalingo specifico del campionato più pulito. Non considerare mai una vittoria casalinga al 55% come una promessa. Consideratelo come un’affermazione che case simili vincono poco più della metà delle volte. Il pensiero sul bankroll appartiene alle scommesse, che è una disciplina separata dalle previsioni. La previsione termina quando le probabilità sono oneste. Le previsioni oneste continuano a non cogliere gli sconvolgimenti famosi, perché gli sconvolgimenti sono nella coda. Cartellini rossi, lotterie di rigori e autogol dell’ultimo minuto vivono in quella coda. Un buon articolo sui metodi deve dirlo due volte. La previsione statistica non è una sfera di cristallo. È una mappa di relativa verosimiglianza. Le mappe ti aiutano a evitare i due errori comuni dei fan. Il primo errore è dovuto al teatro dell’attualità: una vittoria per 4-0 non rende una squadra a metà classifica una favorita per il titolo. Il secondo errore è la cattura narrativa: il nome di un club famoso non è un rating. Bisognerebbe permettere che i rating scendano quando le performance calano. I modelli gerarchici possono condividere la forza tra i campionati quando i dati sono scarsi. L’aggiornamento bayesiano è un modo formale per partire da un dato precedente e procedere con l’evidenza. Non è necessario un dottorato di ricerca per utilizzare l’idea. Inizia con la media dei gol attesi del campionato, quindi sposta la stima sulle partite recenti della squadra. I campioni piccoli si restringono verso la media. I campioni di grandi dimensioni possono sembrare estremi. Questa contrazione ti evita di reagire in modo eccessivo a una serie di tre partite consecutive. Ti impedisce anche di seppellire una squadra neopromossa dopo due sconfitte contro i giganti. Il contesto resta re. Un 1-0 in casa contro la capolista può essere un segnale più forte di un 3-0 contro l’ultima squadra. La differenza reti senza aggiustamenti da parte dell’avversario è uno strumento contundente. La differenza reti corretta dagli avversari è più vicina a ciò che Poisson ed Elo cercano già di catturare.

Zenit vs Spartak, Premier League russa, 2 marzo 2024 (CC BY-SA 3.0 / Wikimedia Commons)
Zenit vs Spartak, Premier League russa, 2 marzo 2024 (CC BY-SA 3.0 / Wikimedia Commons)

Quindi, come dovrebbe effettivamente un lettore utilizzare questi metodi prima del calcio d’inizio? Innanzitutto, scrivi la domanda in numeri. Vuoi l’1X2 più probabile, una distribuzione del punteggio o solo se entrambe le squadre segnano? In secondo luogo, raccogli le ultime trenta-cinquanta partite rilevanti per ciascuna squadra, non gli ultimi tre titoli. In terzo luogo, adeguarsi al vantaggio casalingo, che nella maggior parte dei campionati aggiunge ancora qualche decimo di goal. In quarto luogo, scontate le amichevoli e le partite di coppa non corrispondenti, a meno che non vi manchino i dati del campionato. In quinto luogo, applica una correzione in stile Dixon-Coles se ti interessa lo 0-0 e l’1-1. Sesto, converti la griglia nelle probabilità di cui parlerai effettivamente. Settimo, controllo di integrità per infortuni, sospensioni e rotazioni evidenti. Ottavo: rifiutarsi di arrotondare il 47% a una cosa sicura. Nono, tieni un registro delle tue probabilità e dei risultati reali. Decimo: rivedi la calibrazione ogni mese invece di ricordare solo i fine settimana in cui sei sembrato intelligente. Esistono pagine statistiche in stile FootballAlarm perché farlo manualmente per ogni campionato è noioso. L’automazione non sostituisce il giudizio. Sostituisce gli errori di copia-incolla. Il giudizio deciderà ancora se un attaccante appena ingaggiato sarà negli undici. Il giudizio decide comunque se un campo impregnato d’acqua cambia il valore del tiro. Il modello quindi assorbe quelle chiamate come input modificati, non come vibrazioni. Le vibrazioni non sono un metodo. I metodi sopravvivono all’imbarazzo perché possono essere controllati. Le tracce di controllo includono l’annata dei dati, il parametro di decadimento e il fattore home utilizzato. Se non puoi indicare questi tre, non hai ancora una previsione statistica. Hai un’opinione indossando un costume da foglio di calcolo. Le opinioni possono essere giuste. I metodi statistici cercano di essere corretti per una ragione che funzionerà anche sabato prossimo. Sabato prossimo conterrà almeno un punteggio definito improbabile dalla griglia. Questo non è un fallimento. Questo è il calcio. Il calcio è il motivo per cui modelliamo i conteggi invece di fingere che le partite siano lanci di monete con loghi famosi. Il lancio della moneta ignora l’attacco e la difesa. Poisson no. xG no. Elo no. Usateli insieme con umiltà. L’umiltà è l’ultimo metodo statistico e quello che i tifosi saltano. Non saltarlo. Prevedere, registrare, rivedere. Poi guardatevi comunque la partita, perché il bello non è mai stato il 38 per cento. Il bello è la palla, la mancanza e il numero che ha cercato di avvisarti in anticipo.

La vita di un pronostico di una partita è quindi un loop, non un titolo. Raccogli, valuta, progetta, valuta e impara. Poisson ti dà una lingua obiettivo. Dixon-Coles ripara i conti tranquilli. xG ti dice quali possibilità erano reali. Elo mantiene una forza di corsa che non fa prendere dal panico ogni lunedì. Il vantaggio della casa rimane un fatto empirico ostinato. Il decadimento temporale mantiene sveglio il modello. La calibrazione mantiene il modellista onesto. Niente di tutto ciò rimuove il dramma da novanta minuti. Valuta solo il dramma. Il dramma dei prezzi è il modo in cui parlano gli analisti quando si rifiutano di indovinare. Indovinare è economico. Fare stime è un lavoro. Il lavoro assomiglia a un tabellone segnapunti che potrebbe leggere 2-1 a cinque minuti dalla fine mentre la tua griglia pre-partita aveva 1-1 come modalità. Entrambi possono essere veri. La modalità non è un comando. La moda è il picco di una distribuzione. Le distribuzioni sono il punto centrale della previsione statistica della corrispondenza. Se ricordi solo una frase, ricordala. Un risultato è un campione. Un metodo è una distribuzione. I metodi che pubblicano un solo punteggio senza probabilità nascondono la loro incertezza. L’incertezza è il prodotto. Pubblicalo. Quindi il lettore potrà decidere cosa significa veramente 40% di casa. Vuol dire quattro partite simili su dieci, non un trofeo già inciso. L’incisione avviene dopo il fischio. Le statistiche accadono prima. Prima è dove risiede questo articolo. Dopo è dove la tabella viene aggiornata. Tra di loro c’è l’unica tecnica onesta che abbiamo per rispondere a come potrebbe finire una partita. Potrebbe finire favorito. Potrebbe non esserlo. I numeri raccontavano la divisione. Quella divisione è la previsione. Tutto il resto è teatro. Il teatro è consentito. Il teatro non è un metodo. Il metodo è qui, in duecento frasi, affinché il prossimo appuntamento venga affrontato con una griglia invece che con una voce. Usa la griglia. Rispetta la coda. Godetevi la partita.

Le classifiche sono indicatori ritardati rispetto al xG mobile. Un club neopromosso spesso supera i precedenti pessimisti. Un campione in transizione spesso sottoperforma i primi ottimisti precedenti. Gli specialisti dei calci piazzati meritano un piccolo vantaggio offensivo separato. Le squadre ad alta pressione concedono possibilità di transizione che Poisson sui tiri potrebbe perdere se i dati sui tiri sono incompleti. La qualità del portiere appartiene alla valutazione della difesa, non ad un’aura mistica. I tassi di penalità sono rumorosi; non ricostruire un modello dopo un calcio di rigore. Anche le frequenze dei cartellini rossi sono rumorose e dovrebbero essere valutate in base alla lega. Le competizioni di coppa mescolano motivazioni che i modelli di campionato catturano solo in parte. Le pause per le Nazionali ripristinano il ritmo del club e aumentano leggermente le possibilità di pareggio per alcune squadre a metà classifica. I campionati femminili e quelli maschili necessitano di file di parametri separati. Copiare il vantaggio casalingo della Premier League in un’altra divisione è un errore silenzioso comune. Stima il vantaggio casalingo nel campionato che stai prevedendo. Tre punti per una vittoria hanno cambiato storicamente gli incentivi, quindi non raggruppare ciecamente i dati precedenti agli anni ’90. Le modifiche alle regole come cinque sostituzioni modificano anche i tassi di goal a fine partita. Tieni traccia di questi cambiamenti di regime o i tuoi pesi in decadimento combatteranno il passato. I dati aperti di StatsBomb e progetti simili hanno reso xG riproducibile per i dilettanti. La riproducibilità è più preziosa di una salsa segreta che nessuno può controllare. Se due modelli non sono d’accordo, ispezionare gli input prima di calcolare la media degli output. La media dei modelli calibrati può aiutare; fare la media delle storie raramente aiuta. Un campionato ricco di pareggi ha bisogno di un’intensità Dixon-Coles diversa rispetto a un campionato ad alto punteggio. I tiri scandinavi di inizio stagione non sono agosto in Spagna. La geografia non è il destino, ma è una covariata. Viaggiare attraverso i fusi orari nelle coppe continentali è una vera variabile di fatica. Le partite europee infrasettimanali spesso sopprimono l’intensità del campionato del fine settimana. Le politiche di rotazione delle squadre numerose rendono obbligatorie le formazioni con undici nomi.

Uncategorized

통계적 방법으로 일치 결과를 예측하는 방법

통계적 방법으로 경기 결과를 어떻게 예측합니까? 정직한 대답은 예언이 아닌 확률에서 시작됩니다. 축구는 점수가 낮고 변동성이 큰 스포츠이므로 단일 점수는 결코 확실하지 않습니다. 좋은 모델은 유사한 여러 경기에서 각 결과가 얼마나 자주 발생해야 하는지를 추정합니다. 홈 승리, 무승부, 원정 승리는 고전적인 1X2 가능성 시장을 형성합니다. 오버 및 언더 합계, 두 팀 모두 득점할 수 있는 점수, 정확한 점수는 동일한 목표 프로세스에 대한 다른 보기일 뿐입니다. 가장 오래된 실제 엔진은 목표에 대한 포아송 모델입니다. Michael Maher의 1982년 작업에서는 각 팀의 득점을 공격률과 수비률이 포함된 계산 프로세스로 처리했습니다. 최근 경기에서 해당 비율을 추정한 다음 홈 이점 요소를 추가합니다. 포아송 공식은 0, 1, 2 또는 그 이상의 골이 나올 확률을 제공합니다. 두 개의 독립적인 푸아송을 결합하면 0-0부터 5-4까지의 점수 표가 생성됩니다. 홈팀이 더 많은 점수를 얻은 셀을 합산하면 홈팀의 승리 확률이 나옵니다. 대각선을 합산하면 무승부가 됩니다. 남은 질량은 원정 승리입니다. Dixon과 Coles는 나중에 0-0과 1-1이 일반 포아송이 예상하는 것보다 더 자주 발생한다는 것을 보여주었습니다. 그들의 조정은 점수가 낮은 셀을 부풀리고 다른 셀은 약간 수축시킵니다. 지난 달의 양식이 10개월 전의 경기보다 더 많은 정보를 제공하므로 시간 가치 하락이 중요합니다. 지수 가중치는 기록을 버리지 않고도 최근 게임에 더 많은 목소리를 제공합니다. 리그의 강점은 팀이 여러 대회에서 만날 때도 중요합니다. 최고 수비팀을 상대로 한 골은 강등된 팀을 상대로 한 골과 동일한 증거가 아닙니다. Elo와 같은 등급은 승패 무승부 기록을 매 경기 후에 업데이트되는 단일 강도 수치로 변환합니다. FIFA 순위는 동일한 아이디어의 공개 사촌이지만 더 느리고 정치적입니다. 클럽 모델은 일반적으로 더 많은 데이터를 볼 수 있기 때문에 주말 리그 경기에 대한 전국 순위를 능가합니다. 데이터 품질은 조용한 병목 현상입니다. 누락된 부상, 잘못 코딩된 퇴장, 지연된 라인업은 우아한 수학을 해칠 것입니다. 깨끗한 설비, 깨끗한 점수, 집에 대한 명확한 정의부터 시작하세요. 그러면 통계가 말할 수 있습니다.

프리미어 리그 경기 라인업 — 맨체스터 시티 대 번리, 2024년 1월 31일(CC0 / Wikimedia Commons)
프리미어 리그 경기 라인업 — 맨체스터 시티 대 번리, 2024년 1월 31일(CC0 / Wikimedia Commons)

슛이 같지 않기 때문에 예상 골이 대화를 바꿨습니다. 6미터에서 탭인하는 것은 군중 속으로 30미터 운전하는 것이 아닙니다. xG 모델은 위치, 지원 유형, 때로는 수비수 밀도를 기반으로 각 샷에 과거 전환 확률을 할당합니다. 경기 전반에 걸쳐 슛 품질을 합산하면 팀이 받을 자격이 있는 골 수를 추정할 수 있습니다. 시즌 전반에 걸쳐 찬성과 반대의 xG는 포스트와 골키퍼를 상대로 하는 원시 골보다 더 안정적입니다. 푸아송 스타일 모델에서 xG를 공격 및 방어 입력으로 사용하면 보정이 향상되는 경우가 많습니다. 하지만 xG는 마법이 아닙니다. 단일 주말의 표본 크기는 작습니다. 팀은 2.4 xG를 게시하고 모델이 잘못되지 않은 상태에서 1-0으로 패할 수 있습니다. 모델은 기회가 만들어졌다고 말했습니다. 경기는 마무리와 세이브가 개입했다고 말했습니다. 그 격차는 차이이지 숫자를 포기할 이유가 아닙니다. 점유, 박스 안으로의 패스, 압박 강도는 상황을 추가하지만 동일한 공격 스토리를 두 ​​배로 계산할 수 있습니다. 기능 선택은 단지 마지막 방송을 설명하는 변수가 아닌 미래 목표를 예측하는 변수를 선호해야 합니다. 지난 시즌에 대한 교차 검증은 성인이 선택할 수 있는 방법입니다. 초기에 훈련하고, 다음 해에 테스트하고, 표본 내 적합성을 축하하지 마세요. Brier 점수와 로그 손실은 과신한 확률을 처벌합니다. 가장 가능성이 높은 점수의 정확도| 1-1과 1-0은 확률 질량을 공유하기 때문에 허영 측정항목입니다. 홈 38%, 무승부 28%, 원정 34%라는 모델은 원정팀이 승리하더라도 탁월할 수 있다. 문제는 34%의 원정 승리가 실제로 약 1/3의 시간에 도달하는지 여부입니다. 교정 플롯이 그 질문에 답합니다. 선명도는 다른 축입니다. 항상 33-33-33이라고 말하는 모델은 보정되어 쓸모가 없습니다. 증거가 움직일 때 움직이는 확률을 원합니다. 선발 공격수의 부상은 공격률을 낮춰야 합니다. 주중에 혼잡하면 회전 및 늦은 목표 가능성이 약간 높아집니다. 이동 거리, 휴식일, 더비 강도는 여전히 합산되는 작은 효과입니다. 날씨와 피치 품질을 추정할 만큼 비가 오는 경기가 충분하지 않은 한 오류 항목에 속합니다. 설명할 수 있을 만큼 핵심 모델을 단순하게 유지하세요. 확인할 수 없는 복잡성은 결국 당신의 몫이 될 것입니다.

몬트리올 Stade Saputo의 경기 점수판(CC BY-SA 3.0 / Wikimedia Commons)
몬트리올 Stade Saputo의 경기 점수판(CC BY-SA 3.0 / Wikimedia Commons)

실용적인 파이프라인은 텔레비전 그래픽보다 덜 낭만적으로 보입니다. 날짜, 팀, 장소, 점수를 포함하여 완료된 경기를 수집하세요. 시간 경과에 따른 롤링 공격 및 방어 등급을 계산합니다. 리그가 신뢰할 수 있는 샷 데이터를 게시하는 경우 xG를 혼합하세요. 평점을 다음 경기의 예상 골로 변환하세요. 점수 행렬을 구축합니다. 1X2, 총계, 양팀 득점을 읽어보세요. 이러한 확률을 자신의 가능성을 대체하는 것이 아니라 온전한 점검 목적으로만 종가와 비교하십시오. 시장은 군중이다. 늦은 소식에 군중은 종종 날카로워지고 때로는 느려집니다. 당신의 우위는 일반적으로 부상 타이밍이 더 좋거나 리그별 홈 요소가 더 깔끔하다는 것입니다. 55%의 홈 승리를 약속으로 여기지 마십시오. 유사한 주택이 절반 이상 승리한다는 진술로 취급하십시오. 자금에 대한 사고는 예측과 별개인 베팅에 속합니다. 확률이 정직할 때 예측은 종료됩니다. 정직한 예측은 여전히 ​​유명한 혼란을 놓치고 있습니다. 왜냐하면 혼란이 꼬리에 있기 때문입니다. 레드 카드, 페널티 복권, 마지막 순간의 자책골이 그 꼬리에 있습니다. 방법에 관한 좋은 기사에서는 이 말을 두 번 해야 합니다. 통계적 예측은 수정구슬이 아닙니다. 상대적 가능성을 나타내는 지도입니다. 지도는 두 가지 일반적인 팬 오류를 방지하는 데 도움이 됩니다. 첫 번째 오류는 최신 극장입니다. 4-0으로 한 번 승리해도 중간 테이블 팀이 타이틀을 가장 좋아하는 팀이 되지 않습니다. 두 번째 오류는 내러티브 캡처입니다. 유명한 클럽 이름은 등급이 아닙니다. 실적이 떨어지면 시청률도 떨어지도록 허용해야 한다. 계층적 모델은 데이터가 부족할 때 리그 전체에서 강점을 공유할 수 있습니다. 베이지안 업데이트는 이전부터 시작하여 증거를 가지고 이동하는 공식적인 방법입니다. 아이디어를 사용하기 위해 박사 학위가 필요하지 않습니다. 리그 평균 예상 골로 시작한 다음 팀의 최근 경기에 대한 추정치를 가져옵니다. 작은 표본은 평균을 향해 축소됩니다. 큰 샘플은 극단적으로 보일 수 있습니다. 이러한 축소로 인해 3경기 연속 연속 무승부에 대한 과잉 반응을 방지할 수 있습니다. 또한 거인에게 두 번 패배한 후 새로 승격된 팀을 묻어두는 것을 방지합니다. 컨텍스트는 여전히 왕입니다. 홈에서 리그 선두를 상대로 1-0으로 승리하는 것은 최하위 클럽을 상대로 3-0으로 승리하는 것보다 더 강력한 신호일 수 있습니다. 상대 조정 없는 골득실차는 무딘 도구다. 상대 조정 골득실 차이는 포아송과 엘로가 이미 포착하려고 시도한 것과 더 가깝습니다.

제니트 대 스파르타크, 러시아 프리미어 리그, 2024년 3월 2일(CC BY-SA 3.0 / Wikimedia Commons)
제니트 대 스파르타크, 러시아 프리미어 리그, 2024년 3월 2일(CC BY-SA 3.0 / Wikimedia Commons)

그렇다면 독자는 시작하기 전에 이러한 방법을 실제로 어떻게 사용해야 할까요? 먼저 질문을 숫자로 적어보세요. 가장 가능성이 높은 1X2, 점수 분포를 원하시나요, 아니면 두 팀 모두 득점하는지 여부만 원하시나요? 둘째, 마지막 세 개의 헤드라인이 아니라 각 팀에 대해 최근 30~50개의 관련 경기를 수집하세요. 셋째, 대부분의 리그에서 여전히 골의 몇 십분의 일을 추가하는 홈 이점을 조정합니다. 넷째, 리그 데이터가 부족한 경우를 제외하고 친선 경기와 컵 동점 불일치를 할인합니다. 다섯째, 0-0과 1-1에 관심이 있는 경우 Dixon-Coles 스타일 수정을 적용합니다. 여섯째, 그리드를 실제로 논의할 확률로 변환합니다. 일곱째, 부상, 출전 정지, 명백한 로테이션에 대한 건전성 점검. 여덟째, 47%를 확실한 것으로 반올림하지 마십시오. 아홉째, 확률과 실제 결과를 기록해 두십시오. 열째, 똑똑해 보였던 주말만 기억하는 대신 매달 보정을 검토하세요. FootballAlarm 스타일의 통계 페이지가 존재하는 이유는 모든 리그에 대해 이를 수동으로 수행하는 것이 지루하기 때문입니다. 자동화는 판단을 대체하지 않습니다. 복사-붙여넣기 오류를 대체합니다. 판단에 따라 새로 영입된 공격수가 11명에 포함되는지 여부가 결정됩니다. 물에 잠긴 투구가 슈팅 가치를 변화시키는지는 여전히 판단에 의해 결정됩니다. 그런 다음 모델은 해당 호출을 진동이 아닌 변경된 입력으로 흡수합니다. 바이브는 방법이 아닙니다. 방법은 감사를 받을 수 있기 때문에 당황스러운 일이 있어도 살아남습니다. 감사 추적에는 사용한 데이터 빈티지, 부패 매개변수 및 홈 요소가 포함됩니다. 이 세 가지를 말할 수 없다면 아직 통계적 예측이 없는 것입니다. 스프레드시트 의상을 입고 있다는 의견이 있습니다. 의견이 맞을 수도 있습니다. 통계적 방법은 다음 주 토요일에도 여전히 유효할 이유로 옳으려고 노력합니다. 다음 토요일에는 그리드에서 ‘가능성 없음’이라는 점수가 하나 이상 포함됩니다. 그것은 실패가 아닙니다. 그게 축구다. 축구는 우리가 경기를 유명한 로고로 동전 던지는 척하는 대신 카운트를 모델링하는 이유입니다. 동전던지기는 공격과 방어를 무시합니다. 포아송은 그렇지 않습니다. xG는 그렇지 않습니다. 엘로는 그렇지 않습니다. 겸손하게 그것들을 함께 사용하십시오. 겸손은 마지막 통계 방법이고, 한 팬은 건너뛴다. 건너뛰지 마세요. 예측하고, 기록하고, 수정하세요. 그렇다면 어쨌든 경기를 지켜보세요. 아름다움은 결코 38%가 아니었기 때문입니다. 아름다움은 미리 경고하려고 노력한 공, 미스, 숫자입니다.

따라서 경기 예측의 수명은 헤드라인이 아니라 루프입니다. 수집하고, 평가하고, 프로젝트하고, 점수를 매기고, 학습하세요. 포아송은 목표 언어를 제공합니다. Dixon-Coles는 조용한 악보를 수정합니다. xG는 어떤 기회가 실제였는지 알려줍니다. 엘로는 월요일마다 당황하지 않는 달리기 근력을 유지하고 있다. 홈 어드밴티지는 여전히 완고한 경험적 사실로 남아있습니다. 시간 붕괴는 모델을 활성 상태로 유지합니다. 교정은 모델러를 정직하게 유지합니다. 이 중 어느 것도 90분의 드라마를 제거하지 못합니다. 드라마 가격만 나오네요. 가격 드라마는 분석가들이 추측을 거부할 때 말하는 방식입니다. 추측하는 것은 저렴합니다. 견적은 작업입니다. 작업은 경기 전 그리드 모드가 1-1인 동안 5분 남았을 때 2-1로 표시될 수 있는 점수판처럼 보입니다. 둘 다 사실일 수 있습니다. 모드는 명령이 아닙니다. 최빈값은 분포의 정점입니다. 분포는 통계적 일치 예측의 핵심입니다. 한 문장만 기억난다면 그 문장을 기억하세요. 결과는 샘플입니다. 방법은 배포입니다. 확률 없이 단일 점수만 게시하는 방법은 불확실성을 숨기고 있습니다. 불확실성은 제품입니다. 게시하세요. 그러면 독자는 40%의 집이 실제로 무엇을 의미하는지 결정할 수 있습니다. 이는 이미 새겨진 트로피가 아니라 10번 중 4번의 비슷한 경기를 의미합니다. 각인은 휘파람 소리 후에 발생합니다. 통계는 이전에 발생합니다. 이 기사가 있는 곳은 이전입니다. 이후는 테이블이 업데이트되는 곳입니다. 그들 사이에는 경기가 어떻게 끝날지 대답할 수 있는 유일한 정직한 기술이 있습니다. 마음에 드는 것으로 끝날 수도 있습니다. 그렇지 않을 수도 있습니다. 숫자는 분할을 알려줍니다. 그 분할은 예측입니다. 다른 모든 것은 연극입니다. 극장이 허용됩니다. 연극은 방법이 아니다. 그 방법은 여기에, 200개의 문장으로, 다음 고정 장치가 소문 대신 그리드와 직면하도록 합니다. 그리드를 사용하세요. 꼬리를 존중하세요. 경기를 즐기세요.

리그 테이블은 롤링 xG에 비해 후행 지표입니다. 새로 승격된 클럽은 초기에 비관적인 이전 클럽보다 더 나은 성과를 내는 경우가 많습니다. 전환 중인 챔피언은 초기의 낙관적인 사전 실적보다 낮은 성과를 보이는 경우가 많습니다. 세트피스 전문가들은 작은 별도의 공격 범프를 받을 자격이 있습니다. 압박이 심한 팀은 슛 데이터가 불완전할 경우 푸아송이 슛을 놓칠 수 있는 전환 기회를 인정합니다. 골키퍼의 자질은 신비한 아우라가 아닌 수비 등급에 속합니다. 벌금율은 시끄럽습니다. 한 지점 킥 후에는 모델을 다시 작성하지 마십시오. 레드카드 주파수도 시끄럽기 때문에 리그 기반 등급이어야 합니다. 컵 대회에는 리그 모델이 부분적으로만 포착하는 동기가 혼합되어 있습니다. 인터내셔널은 클럽 리듬을 재설정하고 일부 중간 테이블 팀의 무승부 기회를 약간 부풀렸습니다. 여자 리그와 남자 리그에는 별도의 매개변수 파일이 필요합니다. Premier League 홈 이점을 다른 디비전으로 복사하는 것은 흔히 발생하는 조용한 오류입니다. 예측하고 있는 리그 내에서 홈 어드밴티지를 추정해 보세요. 승리에 대한 3점은 역사적으로 인센티브를 변경했으므로 1990년대 이전 데이터를 맹목적으로 수집하지 마십시오. 5명의 교체와 같은 규칙 변경도 게임 후반 목표 비율을 변경합니다. 정권 변화를 추적하지 않으면 붕괴 가중치가 과거와 싸울 것입니다. StatsBomb 및 유사한 프로젝트의 공개 데이터를 통해 아마추어가 xG를 재현할 수 있게 되었습니다. 재현성은 누구도 확인할 수 없는 비법 소스보다 더 가치가 있습니다. 두 모델이 일치하지 않으면 출력의 평균을 계산하기 전에 입력을 검사하십시오. 보정된 모델을 평균화하는 것이 도움이 될 수 있습니다. 이야기를 평균화하는 것은 거의 도움이 되지 않습니다. 무승부가 많은 리그는 득점이 높은 리그와는 다른 Dixon-Coles 강도가 필요합니다. 스칸디나비아의 시즌 초반 투구는 스페인의 8월이 아니다. 지리는 운명이 아니지만 공변량이다. 대륙 컵에서 시간대를 넘나드는 여행은 실제 피로 변수입니다. 주중 유럽 경기는 종종 주말 리그의 강도를 억제합니다. 대규모 선수단의 로테이션 정책은 11명의 라인업을 필수 입력으로 만듭니다.

Uncategorized

統計的手法を使用して試合結果を予測する方法

統計的手法を使って試合結果をどのように予測しますか?正直な答えは、予言ではなく、確率から始まります。サッカーは得点が少なくばらつきが大きいスポーツであるため、単一のスコアラインが確実であることは決してありません。優れたモデルは、多くの同様の一致において各結果がどのくらいの頻度で発生するかを推定します。ホームでの勝利、引き分け、そしてアウェイでの勝利が、可能性のある古典的な 1X2 マーケットを形成します。合計のオーバーとアンダー、両チームの得点、および正確なスコアは、同じゴールプロセスの別の見方にすぎません。最も古い実用的なエンジンは、目標のポアソン モデルです。 Michael Maher の 1982 年の作品では、各チームの得点を攻撃率と防御率を伴うカウント プロセスとして扱いました。最近の試合からそれらのレートを推定し、ホームアドバンテージ要素を追加します。ポアソン公式により、ゴールが 0、1、2、またはそれ以上になる可能性が得られます。 2 つの独立したポアソンを組み合わせると、0-0 から 5-4 以降のスコア グリッドが生成されます。ホームチームがより多く得点するセルを合計すると、ホームチームの勝利確率が得られます。対角線を合計すると引き分けになります。残りマスはアウェー勝利。ディクソンとコールズは後に、0-0と1-1が平凡なポアソンが予想するよりも頻繁に起こることを示した。これらの調整により、スコアの低いセルが膨張し、他のセルがわずかに収縮します。先月のフォームは 10 か月前の試合よりも有益であるため、時間の経過が重要です。指数関数的な重みにより、歴史を捨てることなく、最近のゲームにさらに多くの声が与えられます。リーグの強さは、チームが大会をまたいで対戦する場合にも重要です。トップディフェンスに対するゴールは、降格チームに対するゴールと同じ証拠ではない。 Elo などのレーティングは、勝敗引き分けの履歴を 1 つの強さの数値に変換し、試合ごとに更新します。 FIFA ランキングも同じ考え方の公的なものですが、より遅く、より政治的です。クラブモデルは通常、より多くのデータを参照するため、週末のリーグ戦で全国ランキングを上回ります。データ品質が地味なボトルネックになっています。怪我の欠場、誤ってコード化されたレッドカード、ラインナップの遅れは、エレガントな数学を台無しにするでしょう。きれいな備品、きれいなスコア、そしてホームの明確な定義から始めます。そうすれば統計がものを言います。

プレミアリーグの試合ラインナップ — マンチェスター・シティ対バーンリー、2024年1月31日(CC0 / ウィキメディア・コモンズ)
プレミアリーグの試合ラインナップ — マンチェスター・シティ対バーンリー、2024年1月31日(CC0 / ウィキメディア・コモンズ)

シュート数が同等ではないため、予想されるゴールによって会話が変わりました。 6 メートルからのタップインは、群衆の中へ 30 メートル進むことにはなりません。 xG モデルは、位置、アシストの種類、場合によってはディフェンダーの密度に基づいて、各ショットに過去のコンバージョン確率を割り当てます。試合中のシュートの質を合計することで、チームに値するゴール数が推定されます。シーズンを通して、xG の賛成と反対は、ポストやゴールキーパーに振り回される生のゴールよりも安定しています。ポアソン スタイル モデルで攻撃入力と防御入力として xG を使用すると、多くの場合、キャリブレーションが改善されます。それでも、xG は魔法ではありません。 1 つの週末のサンプル サイズは小さいです。モデルが間違っていなくても、チームは 2.4 xG をポストして 1-0 で負ける可能性があります。モデルはチャンスが生まれたと語った。試合はフィニッシュとセーブが介入したとのこと。このギャップは差異であり、数字を放棄する理由にはなりません。ポゼッション、ボックス内へのパス、プレスの激しさは状況を追加しますが、同じ攻撃ストーリーを二重にカウントする可能性があります。特徴の選択では、単に最後のブロードキャストを説明する変数ではなく、将来の目標を予測する変数を優先する必要があります。過去のシーズンを相互検証するのが大人の選択方法です。早い年にトレーニングし、後の年にテストし、サンプル内での適合を祝うことを拒否します。より単純なスコアと対数損失は、自信過剰な確率を罰します。最も可能性の高いスコアの精度| 1-1 と 1-0 は確率質量を共有するため、バニティ メトリックです。ホームが 38%、引き分けが 28%、アウェイが 34% というモデルは、アウェイチームが勝った場合でも優れている可能性があります。問題は、34% 離れたところで勝利が実際に約 3 分の 1 の確率で到達するかどうかです。キャリブレーション プロットはその質問に答えます。シャープネスはもう 1 つの軸です。常に 33-33-33 と表示されるモデルは調整されており、役に立ちません。証拠が動くと、確率も動くことが必要です。先発ストライカーが負傷すると攻撃率が低下するはずだ。週半ばの混雑により、ローテーションと終盤のゴールの可能性がわずかに高まるはずだ。移動距離、休息日、ダービーの強度は小さな影響ですが、それでも積み重なっていきます。天気とピッチの質は、それらを推定するのに十分な雨の試合がない限り、誤差項に属します。コアモデルは説明しやすいように単純にしてください。チェックできない複雑さは、最終的には嘘をつくことになります。

モントリオール、スタッド・サプートの試合スコアボード (CC BY-SA 3.0 / ウィキメディア・コモンズ)
モントリオール、スタッド・サプートの試合スコアボード (CC BY-SA 3.0 / ウィキメディア・コモンズ)

実際のパイプラインは、テレビのグラフィックほどロマンチックではありません。終了した試合を日付、チーム、会場、スコアとともに収集します。時間減衰を伴うローリング攻撃と防御の評価を計算します。リーグが信頼できるショット データを公開している場合は、xG をブレンドします。評価を次の試合の予想ゴールに変換します。スコア マトリックスを構築します。 1X2、合計、両チームの得点を読み上げます。これらの確率を市場価格の終値と比較するのは、自分自身の可能性の代わりとしてではなく、健全性のチェックとしてのみ行ってください。市場は群衆です。群衆は、遅いニュースに対して鋭敏である場合もあれば、遅い場合もあります。優位性がある場合、それは通常、より良い怪我のタイミングか、よりクリーンなリーグ特有のホームファクターです。ホームでの55パーセントの勝利を約束として決して扱ってはいけません。これは、同様の住宅が半分以上の確率で勝つということだと考えてください。バンクロールの考え方はベッティングに属し、予測とは別の分野です。確率が正しくなった時点で予測は終了します。正直な予想では、番狂わせが尾を引いているため、依然として有名な番狂わせを見逃しています。レッドカード、ペナルティ抽選、土壇場でのオウンゴールはその尾部にあります。メソッドに関する優れた記事には、これを 2 回言う必要があります。統計的予測は水晶玉ではありません。相対尤度マップです。マップは、2 つの一般的なファン エラーを回避するのに役立ちます。最初の間違いは最近の状況です。4 対 0 で 1 回勝ったからといって、中位チームが優勝候補になるわけではありません。 2 つ目の間違いは、物語の捉え方です。有名なクラブ名は評価ではありません。パフォーマンスが低下した場合には、評価も低下することを許容すべきです。データが薄い場合、階層モデルはリーグ間で強さを共有できます。ベイジアン更新は、事前分布から開始して証拠に基づいて進む正式な方法です。このアイデアを使用するのに博士号は必要ありません。リーグの平均予想ゴール数から始めて、チームの最近の試合に向けて推定値を導き出します。小さなサンプルは平均に向かって縮小します。大きなサンプルは極端に見えることが許可されます。この縮小により、3 試合の連続試合に過剰に反応する必要がなくなります。また、巨人に2度負けた後に新しく昇格したチームを葬り去ることもできなくなる。コンテキストは依然として王様です。ホームでのリーグリーダー相手の1-0は、最下位クラブ相手の3-0よりも強力なシグナルとなる可能性がある。相手の調整なしの得失点差は鈍器だ。相手調整後の得失点差は、ポアソンとエロがすでに獲得しようとしているものに近づいている。

ゼニト対スパルタク、ロシア・プレミアリーグ、2024年3月2日(CC BY-SA 3.0 / ウィキメディア・コモンズ)
ゼニト対スパルタク、ロシア・プレミアリーグ、2024年3月2日(CC BY-SA 3.0 / ウィキメディア・コモンズ)

それでは、読者は実際にキックオフ前にこれらのメソッドをどのように使用すればよいのでしょうか?まず、質問を数字で書きます。最も可能性の高い 1X2、スコア分布、または両チームが得点するかどうかだけが必要ですか?次に、最後の 3 つの見出しではなく、各チームの関連する最新の 30 ~ 50 の試合を収集します。第三に、ホームアドバンテージに合わせて調整します。ホームアドバンテージは、ほとんどのリーグでまだゴールの数十分の1を追加します。 4番目に、リーグデータが不足している場合を除き、親善試合やカップ戦のタイミスマッチを割引きします。 5 番目に、0-0 と 1-1 を重視する場合は、ディクソン-コールズ スタイルの補正を適用します。 6 番目に、グリッドを実際に説明する確率に変換します。 7番目に、怪我、出場停止、明らかなローテーションに対する健全性チェック。第 8 に、47 パーセントを確実なものに四捨五入することを拒否します。 9番目に、確率と実際の結果を記録してください。 10番目に、賢く見えた週末だけを思い出すのではなく、毎月調整を見直してください。 FootballAlarm スタイルの統計ページが存在するのは、リーグごとにこれを手動で行うのは面倒だからです。自動化は判断に取って代わるものではありません。コピー&ペーストのエラーを置き換えます。新たに契約したストライカーがイレブンに入るかどうかは依然として判決が決定している。水浸しのピッチがシュートの価値を変えるかどうかは依然として判定によって決定される。その後、モデルはそれらの呼び出しをバイブとしてではなく、変更された入力として吸収します。バイブスは方法ではありません。メソッドは監査できるため、恥ずかしさを乗り越えることができます。監査証跡には、使用したデータのヴィンテージ、減衰パラメータ、およびホーム係数が含まれます。これら 3 つを述べられない場合は、統計的な予測がまだできていないことになります。あなたはスプレッドシートの衣装を着て意見を持っています。意見は正しいかもしれません。統計的手法が正しくなろうとするのには、次の土曜日にも有効な理由があります。次の土曜日には、少なくとも1つのスコアが含まれる可能性が低いとグリッドが判断した。それは失敗ではありません。それがフットボールだ。フットボールだからこそ、私たちは試合を有名なロゴの付いたコイン投げのふりをするのではなく、モデルとしてカウントするのです。コイン投げは攻撃力と防御力を無視します。ポアソンはそうではありません。 xG にはありません。エロはそうではありません。謙虚さを持ってこれらを使用してください。謙虚さは最後の統計手法であり、ファンがスキップする手法です。スキップしないでください。予測、記録、修正。とにかく試合を見てください。美しさは決して38パーセントではないからです。美しさは、ボール、ミス、そして事前に警告しようとした番号です。

したがって、試合予想の寿命はヘッドラインではなくループです。収集、評価、プロジェクト、採点、学習を行います。ポアソンは目標言語を提供します。ディクソン=コールズが静かなスコアを修復する。 xG は、どのチャンスが本当だったのかを教えてくれます。エロは毎週月曜日にあわてない走力を保っています。ホームアドバンテージは依然として頑固な経験的事実です。時間減衰によりモデルは起動したままになります。キャリブレーションにより、モデラーは正直に保たれます。こうしたことのどれもが、90 分間からドラマを取り除くものではありません。それはドラマの値段だけです。アナリストが推測を拒否した場合の価格設定のドラマです。推測は安いです。見積もりは仕事です。仕事は、試合前のグリッドが 1-1 モードであったときに、残り 5 分で 2-1 と表示されるスコアボードのように見えます。どちらも真実である可能性があります。モードはコマンドではありません。最頻値は分布のピークです。分布は統計的一致予測の要点です。一文しか覚えていない場合は、それを覚えておいてください。結果はサンプルです。メソッドとはディストリビューションのことです。確率を付けずに単一のスコアのみを公開する方法は、その不確実性を隠しています。不確実性は産物です。公開してください。そうすれば、読者は40パーセントの家が実際に何を意味するかを判断できます。これは、既に刻まれたトロフィーではなく、10 試合のうち 4 試合が同様の試合であることを意味します。彫刻はホイッスルの後に行われます。統計は以前に発生します。 Before がこの記事の場所です。 After ではテーブルが更新されます。両者の間には、試合がどのように終わるかを答えるために私たちが持っている唯一の正直な技術があります。お気に入りで終わるかもしれない。そうではないかもしれません。数字が分岐点を物語っていた。その分岐は予測です。それ以外はすべて演劇です。劇場は許可されています。演劇は手段ではありません。この方法は 200 文で示されており、次の試合では噂ではなくグリッドに直面することになります。グリッドを使用します。尻尾を尊重しましょう。試合をお楽しみください。

リーグ表は、ローリング xG と比較して遅れている指標です。新しく昇格したクラブは、初期の悲観的なクラブを上回るパフォーマンスを示すことがよくあります。移行期のチャンピオンは、初期の楽観的な以前のパフォーマンスを下回ることがよくあります。セットプレーのスペシャリストには、攻撃面でのちょっとした刺激を与える価値がある。ハイプレスチームは、ショットデータが不完全な場合、シュートのポアソンがミスする可能性があるトランジションチャンスを認めます。ゴールキーパーの資質は、神秘的なオーラではなく、守備力の評価に関係します。罰金率には騒々しいものがあります。 1 回のスポットキック後にモデルを再構築しないでください。レッドカードの頻度もうるさく、リーグベースで評価されるべきです。カップ戦には、リーグモデルでは部分的にしか捉えられない動機が混在しています。インターナショナルブレークはクラブのリズムをリセットし、一部の中位チームの引き分けのチャンスをわずかに膨らませます。女子リーグと男子リーグには個別のパラメータ ファイルが必要です。プレミアリーグのホームアドバンテージを別のディビジョンにコピーすることは、よくあるサイレントエラーです。予想しているリーグ内のホームアドバンテージを推定します。勝利に対する 3 ポイントは歴史的にインセンティブを変えたので、1990 年代以前のデータをやみくもにプールしないでください。 5人の選手交代などのルール変更も試合終盤のゴール率に変化をもたらす。そうした体制の変化を追跡しなければ、減衰の重みが過去と戦うことになります。 StatsBomb や同様のプロジェクトからのオープン データにより、xG はアマチュアでも再現可能になりました。再現性は誰もチェックできない秘密のソースよりも価値があります。 2 つのモデルが一致しない場合は、出力を平均する前に入力を検査します。キャリブレーションされたモデルの平均化が役立ちます。平均的なストーリーが役立つことはほとんどありません。引き分けの多いリーグでは、得点数の多いリーグとは異なるディクソン・コールズの激しさが必要となる。スカンジナビアのシーズン初期のピッチはスペインの8月ではありません。地理は運命ではありませんが、共変量です。コンチネンタルカップでタイムゾーンを越えて移動することは、疲労の大きな要因となります。週半ばのヨーロッパの試合は週末のリーグ戦の熱量を抑えることが多い。大規模なチームのローテーション方針により、11名のラインナップが必須のインプットとなります。

Uncategorized

Cara Memprediksi Hasil Pertandingan dengan Metode Statistik

Bagaimana cara memprediksi hasil pertandingan dengan metode statistik? Jawaban yang jujur ​​dimulai dengan probabilitas, bukan ramalan. Sepak bola adalah olahraga dengan skor rendah dan varian tinggi, sehingga skor tunggal tidak pernah menjadi kepastian. Model yang baik memperkirakan seberapa sering setiap hasil harus terjadi di banyak pertandingan serupa. Kemenangan kandang, seri, dan kemenangan tandang membentuk kemungkinan pasar klasik 1X2. Total over dan under, kedua tim mencetak gol, dan skor pasti hanyalah pandangan lain dari proses gol yang sama. Mesin praktis tertua adalah model tujuan Poisson. Karya Michael Maher tahun 1982 memperlakukan skor masing-masing tim sebagai proses penghitungan dengan tingkat serangan dan tingkat pertahanan. Anda memperkirakan tarif tersebut dari pertandingan terkini, lalu menambahkan faktor keunggulan tuan rumah. Rumus Poisson kemudian memberikan peluang gol nol, satu, dua, atau lebih. Menggabungkan dua Poisson independen menghasilkan kisi skor dari 0-0 hingga 5-4 dan seterusnya. Menjumlahkan sel dimana tim tuan rumah mendapat skor lebih banyak menghasilkan probabilitas kemenangan tuan rumah. Menjumlahkan diagonal menghasilkan hasil seri. Massa yang tersisa adalah kemenangan tandang. Dixon dan Coles kemudian menunjukkan bahwa 0-0 dan 1-1 terjadi lebih sering daripada perkiraan Poisson. Penyesuaiannya akan memperbesar sel-sel dengan skor rendah tersebut dan sedikit mengempiskan sel-sel lainnya. Peluruhan waktu penting karena formulir bulan lalu lebih informatif daripada pertandingan sepuluh bulan lalu. Bobot eksponensial memberikan lebih banyak suara pada game terbaru tanpa membuang sejarah. Kekuatan liga juga penting ketika tim bertemu di berbagai kompetisi. Sebuah gol melawan tim dengan pertahanan terbaik bukanlah bukti yang sama dengan gol melawan tim yang terdegradasi. Peringkat seperti Elo mengubah riwayat menang-kalah-seri menjadi satu nomor kekuatan yang diperbarui setelah setiap pertandingan. Pemeringkatan FIFA mirip dengan gagasan yang sama, meskipun lebih lambat dan lebih politis. Model klub biasanya mengalahkan peringkat nasional untuk pertandingan liga akhir pekan karena mereka melihat lebih banyak data. Kualitas data adalah hambatan yang paling besar. Cedera yang hilang, kode kartu merah yang salah, dan susunan pemain yang tertunda akan meracuni matematika yang elegan. Mulailah dengan perlengkapan bersih, skor bersih, dan definisi rumah yang jelas. Maka statistiklah yang bisa berbicara.

Susunan pertandingan Liga Premier — Manchester City vs Burnley, 31 Januari 2024 (CC0 / Wikimedia Commons)
Susunan pertandingan Liga Premier — Manchester City vs Burnley, 31 Januari 2024 (CC0 / Wikimedia Commons)

Gol yang diharapkan mengubah pembicaraan karena tembakannya tidak seimbang. Sebuah tap-in dari jarak enam meter bukanlah perjalanan sejauh tiga puluh meter ke dalam kerumunan. Model xG menetapkan probabilitas konversi historis pada setiap tembakan berdasarkan lokasi, jenis bantuan, dan terkadang kepadatan pemain bertahan. Menjumlahkan kualitas tembakan dalam suatu pertandingan memperkirakan berapa banyak gol yang layak diterima suatu tim. Selama satu musim, xG untuk dan melawan lebih stabil daripada gol mentah, yang berayun ke tiang dan penjaga gawang. Menggunakan xG sebagai input serangan dan pertahanan dalam model gaya Poisson sering kali meningkatkan kalibrasi. Namun, xG bukanlah keajaiban. Ukuran sampel dalam satu akhir pekan kecil. Sebuah tim dapat memposting 2,4 xG dan kalah 1-0 tanpa modelnya salah. Model tersebut mengatakan peluang tercipta. Pertandingan mengatakan penyelesaian dan penyelamatan diintervensi. Kesenjangan tersebut adalah perbedaan, bukan alasan untuk mengabaikan angka. Penguasaan bola, umpan ke kotak penalti, dan intensitas menekan menambah konteks namun bisa menggandakan cerita serangan yang sama. Pemilihan fitur harus mengutamakan variabel yang memprediksi tujuan masa depan, bukan variabel yang hanya menggambarkan siaran terakhir. Validasi silang pada musim lalu adalah cara orang dewasa untuk memilih. Berlatihlah di tahun-tahun sebelumnya, ujilah di tahun berikutnya, dan tolak untuk merayakan kecocokan sampel. Skor yang lebih buruk dan kehilangan log menghukum probabilitas yang terlalu percaya diri. Akurasi skor yang paling mungkin| adalah metrik kesombongan karena 1-1 dan 1-0 berbagi massa probabilitas. Sebuah model yang mengatakan 38 persen tuan rumah, 28 persen imbang, 34 persen tandang bisa menjadi sangat baik bahkan ketika tim tandang menang. Pertanyaannya adalah apakah 34 persen kemenangan tandang tersebut benar-benar terjadi pada sepertiga waktu pertandingan. Plot kalibrasi menjawab pertanyaan itu. Ketajaman adalah sumbu lainnya: model yang selalu bertuliskan 33-33-33 dikalibrasi dan tidak berguna. Anda menginginkan probabilitas yang berubah seiring dengan perubahan bukti. Cedera pada striker awal akan menurunkan tingkat serangan. Tengah minggu yang padat seharusnya sedikit meningkatkan peluang rotasi dan gol di menit-menit akhir. Jarak tempuh, hari istirahat, dan intensitas derby merupakan pengaruh kecil yang tetap bertambah. Cuaca dan kualitas lapangan termasuk dalam istilah kesalahan kecuali Anda memiliki cukup hujan untuk memperkirakannya. Jaga agar model inti cukup sederhana untuk dijelaskan. Kompleksitas yang tidak dapat diperiksa pada akhirnya akan membohongi Anda.

Papan skor pertandingan di Stade Saputo, Montreal (CC BY-SA 3.0 / Wikimedia Commons)
Papan skor pertandingan di Stade Saputo, Montreal (CC BY-SA 3.0 / Wikimedia Commons)

Saluran pipa yang praktis terlihat kurang romantis dibandingkan grafik televisi. Kumpulkan pertandingan yang sudah selesai dengan tanggal, tim, tempat, dan skor. Hitung peringkat serangan dan pertahanan bergulir dengan peluruhan waktu. Padukan xG jika liga menerbitkan data tembakan yang andal. Ubah peringkat menjadi sasaran yang diharapkan untuk pertandingan berikutnya. Bangun matriks skor. Bacakan 1X2, total, dan skor kedua tim. Bandingkan probabilitas tersebut dengan harga penutupan pasar hanya sebagai pemeriksaan kewarasan, bukan sebagai pengganti kemungkinan Anda sendiri. Pasar adalah tempat keramaian. Penonton seringkali tajam dan kadang lambat dalam menerima berita yang terlambat. Keunggulan Anda, jika ada, biasanya adalah waktu cedera yang lebih baik atau faktor kandang khusus liga yang lebih bersih. Jangan pernah menganggap kemenangan kandang sebesar 55 persen sebagai sebuah janji. Perlakukan itu sebagai pernyataan bahwa rumah serupa menang lebih dari separuh waktu. Pemikiran bankroll termasuk dalam taruhan, yang merupakan disiplin ilmu terpisah dari peramalan. Peramalan berakhir ketika probabilitasnya benar. Ramalan yang jujur ​​masih belum memperhitungkan gangguan-gangguan yang terkenal, karena gangguan-gangguan tersebut akan segera terjadi. Kartu merah, lotere penalti, dan gol bunuh diri di menit-menit terakhir juga terjadi. Artikel bagus tentang metode harus mengatakan ini dua kali. Prediksi statistik bukanlah bola kristal. Ini adalah peta kemungkinan relatif. Peta membantu Anda menghindari dua kesalahan umum kipas. Kesalahan pertama adalah teater kekinian: satu kemenangan 4-0 tidak membuat tim papan tengah menjadi favorit juara. Kesalahan kedua adalah penangkapan naratif: nama klub terkenal bukanlah rating. Peringkat harus dibiarkan turun ketika kinerja menurun. Model hierarki dapat berbagi kekuatan antar liga ketika data terbatas. Pemutakhiran Bayesian adalah cara formal untuk memulai dari masa lalu dan bergerak dengan bukti. Anda tidak memerlukan gelar PhD untuk menggunakan ide tersebut. Mulailah dengan rata-rata gol yang diharapkan di liga, lalu tarik perkiraan tersebut ke pertandingan terakhir tim. Sampel kecil menyusut menuju mean. Sampel berukuran besar dibiarkan terlihat ekstrem. Penyusutan itu menyelamatkan Anda dari reaksi berlebihan terhadap tiga pertandingan beruntun. Ini juga menghentikan Anda mengubur tim yang baru dipromosikan setelah dua kekalahan melawan raksasa. Konteks tetap menjadi raja. Skor 1-0 di kandang melawan pemimpin liga bisa menjadi sinyal yang lebih kuat dibandingkan skor 3-0 melawan klub papan bawah. Selisih gol tanpa penyesuaian lawan adalah instrumen yang tumpul. Selisih gol yang disesuaikan lawan lebih mendekati apa yang Poisson dan Elo coba tangkap.

Zenit vs Spartak, Liga Premier Rusia, 2 Maret 2024 (CC BY-SA 3.0 / Wikimedia Commons)
Zenit vs Spartak, Liga Premier Rusia, 2 Maret 2024 (CC BY-SA 3.0 / Wikimedia Commons)

Jadi bagaimana seharusnya pembaca menggunakan metode ini sebelum memulai? Pertama, tuliskan pertanyaannya dalam angka. Apakah Anda menginginkan 1X2 yang paling mungkin, distribusi skor, atau hanya apakah kedua tim mencetak gol? Kedua, kumpulkan tiga puluh hingga lima puluh pertandingan terakhir yang relevan untuk masing-masing tim, bukan tiga berita utama terakhir. Ketiga, sesuaikan dengan keunggulan tuan rumah, yang di sebagian besar liga masih menambah sepersepuluh gol. Keempat, diskon pertandingan persahabatan dan pertandingan piala yang tidak cocok kecuali Anda kekurangan data liga. Kelima, terapkan koreksi gaya Dixon-Coles jika Anda peduli dengan skor 0-0 dan 1-1. Keenam, ubah grid menjadi probabilitas yang sebenarnya akan Anda diskusikan. Ketujuh, pemeriksaan kewarasan terhadap cedera, suspensi, dan rotasi yang jelas. Kedelapan, menolak membulatkan 47 persen menjadi pasti. Kesembilan, catat probabilitas Anda dan hasil sebenarnya. Kesepuluh, tinjau kalibrasi setiap bulan daripada hanya mengingat akhir pekan Anda terlihat pintar. Halaman statistik bergaya FootballAlarm ada karena melakukan ini dengan tangan untuk setiap liga itu membosankan. Otomatisasi tidak menggantikan penilaian. Ini menggantikan kesalahan salin-tempel. Penilaian masih menentukan apakah striker yang baru dikontrak masuk dalam sebelas pemain. Penghakiman tetap menentukan apakah nada yang tergenang air mengubah nilai tembakan. Model kemudian menyerap panggilan tersebut sebagai masukan yang diubah, bukan sebagai getaran. Getaran bukanlah sebuah metode. Metode dapat bertahan dari rasa malu karena dapat diaudit. Jalur audit mencakup data vintage, parameter peluruhan, dan faktor asal yang Anda gunakan. Jika Anda tidak dapat menyatakan ketiganya, Anda belum memiliki prakiraan statistik. Anda mempunyai pendapat mengenakan kostum spreadsheet. Pendapat bisa saja benar. Metode statistik berusaha menjadi benar karena suatu alasan yang masih akan berhasil pada Sabtu depan. Sabtu depan akan berisi setidaknya satu skor yang disebut grid tidak mungkin. Itu bukanlah kegagalan. Itulah sepak bola. Sepak bola adalah alasan kami memodelkan penghitungan alih-alih menganggap pertandingan sebagai lemparan koin dengan logo terkenal. Pembalikan koin mengabaikan serangan dan pertahanan. Poisson tidak. xG tidak. Elo tidak. Gunakan semuanya dengan kerendahan hati. Kerendahan hati adalah metode statistik terakhir, dan yang dilewati oleh penggemar. Jangan lewatkan itu. Memprediksi, mencatat, merevisi. Kalau begitu tonton saja pertandingannya, karena kecantikannya tidak pernah mencapai 38 persen. Keindahannya adalah bolanya, kesalahannya, dan nomor yang mencoba memperingatkan Anda sebelumnya.

Oleh karena itu, kehidupan ramalan pertandingan adalah sebuah lingkaran, bukan berita utama. Kumpulkan, beri peringkat, proyeksikan, skor, dan pelajari. Poisson memberi Anda bahasa tujuan. Dixon-Coles memperbaiki skor yang tenang. xG memberi tahu Anda peluang mana yang nyata. Elo tetap menjaga kekuatan larinya yang tidak panik setiap hari senin. Keunggulan tuan rumah tetap menjadi fakta empiris yang sulit dihilangkan. Peluruhan waktu membuat model tetap terjaga. Kalibrasi membuat pemodel tetap jujur. Semua ini tidak menghilangkan drama dari sembilan puluh menit. Itu hanya memberi harga pada dramanya. Drama penetapan harga adalah cara analis berbicara ketika mereka menolak untuk menebak. Menebak itu murah. Memperkirakan adalah pekerjaan. Pekerjaan tampak seperti papan skor yang mungkin terbaca 2-1 dengan lima menit tersisa sementara grid pra-pertandingan Anda memiliki mode 1-1. Keduanya bisa jadi benar. Modusnya bukanlah sebuah perintah. Modus merupakan puncak suatu distribusi. Distribusi adalah inti dari prediksi pertandingan statistik. Jika Anda hanya mengingat satu kalimat, ingatlah itu. Hasil adalah contoh. Metode adalah distribusi. Metode yang hanya mempublikasikan satu skor tanpa probabilitas menyembunyikan ketidakpastiannya. Ketidakpastian adalah produknya. Publikasikan itu. Kemudian pembaca dapat memutuskan apa arti sebenarnya dari 40 persen rumah. Artinya empat pertandingan serupa dalam sepuluh pertandingan, bukan satu trofi yang sudah terukir. Ukiran terjadi setelah peluit berbunyi. Statistik terjadi sebelumnya. Sebelumnya adalah tempat artikel ini berada. Setelah itu tabel diperbarui. Di antara keduanya terdapat satu-satunya keahlian jujur ​​yang kita miliki untuk menjawab bagaimana sebuah pertandingan akan berakhir. Ini mungkin berakhir sebagai favorit. Mungkin juga tidak. Angka-angka tersebut memberi tahu Anda perpecahannya. Perpecahan itu adalah prediksinya. Yang lainnya adalah teater. Teater diperbolehkan. Teater bukanlah sebuah metode. Metodenya ada di sini, dalam dua ratus kalimat, sehingga pertandingan selanjutnya dihadapkan pada grid, bukan rumor. Gunakan kisi-kisi. Hormati ekornya. Nikmati pertandingannya.

Tabel liga adalah indikator tertinggal dibandingkan dengan rolling xG. Klub yang baru dipromosikan sering kali mengungguli klub-klub sebelumnya yang pesimistis. Seorang pemimpin dalam masa transisi seringkali memiliki kinerja yang buruk dibandingkan pendahulunya yang optimistis. Spesialis set-piece layak mendapatkan serangan kecil yang terpisah. Tim-tim dengan tekanan tinggi mengakui adanya peluang transisi yang mungkin terlewatkan oleh tembakan Poisson jika data tembakan tidak lengkap. Kualitas kiper termasuk dalam peringkat pertahanan, bukan dalam aura mistik. Tingkat penalti sangat tinggi; jangan membangun kembali model setelah satu kali tendangan. Frekuensi kartu merah juga berisik dan harus diberi peringkat berdasarkan liga. Kompetisi piala memadukan motivasi yang hanya sebagian ditangkap oleh model liga. Jeda internasional mengatur ulang ritme klub dan sedikit meningkatkan peluang hasil imbang untuk beberapa tim papan tengah. Liga wanita dan liga pria memerlukan file parameter terpisah. Menyalin keunggulan kandang di Premier League ke divisi lain adalah kesalahan yang umum terjadi. Perkirakan keuntungan tuan rumah di liga yang Anda perkirakan. Tiga poin untuk sebuah kemenangan mengubah insentif secara historis, jadi jangan mengumpulkan data sebelum tahun 1990an secara membabi buta. Perubahan aturan seperti lima pergantian pemain juga mengubah tingkat gol di akhir pertandingan. Lacak peralihan rezim tersebut atau beban pembusukan Anda akan melawan masa lalu. Data terbuka dari StatsBomb dan proyek serupa membuat xG dapat direproduksi untuk para amatir. Reproduksibilitas lebih berharga daripada saus rahasia yang tidak dapat diperiksa oleh siapa pun. Jika dua model berbeda, periksa masukannya sebelum membuat rata-rata keluarannya. Rata-rata model yang dikalibrasi dapat membantu; rata-rata cerita jarang membantu. Liga dengan hasil imbang membutuhkan intensitas Dixon-Coles yang berbeda dengan liga dengan skor tinggi. Lapangan awal musim Skandinavia bukan bulan Agustus di Spanyol. Geografi bukanlah takdir, namun merupakan kovariat. Bepergian melintasi zona waktu di piala kontinental adalah variabel kelelahan yang nyata. Laga tengah pekan Eropa kerap menekan intensitas liga akhir pekan. Kebijakan rotasi skuad yang besar membuat susunan sebelas nama menjadi masukan yang wajib.

Uncategorized

Как предсказать результаты матча статистическими методами

Как предсказать результат матча статистическими методами? Честный ответ начинается с вероятностей, а не с пророчеств. Футбол — это вид спорта с низкой результативностью и высокой дисперсией, поэтому единый счет никогда не является бесспорным. Хорошая модель оценивает, как часто каждый исход должен происходить во многих похожих матчах. Победа дома, ничья и победа на выезде образуют классический рынок возможностей 1X2. Тоталы больше и меньше, обе команды забьют и точные результаты — это всего лишь другие взгляды на один и тот же процесс достижения цели. Самый старый практический двигатель — это модель Пуассона для целей. В работе Майкла Махера 1982 года результативность каждой команды рассматривалась как процесс подсчета очков с учетом скорости атаки и защиты. Вы оцениваете эти показатели на основе последних матчей, а затем добавляете коэффициент домашнего преимущества. Тогда формула Пуассона дает вероятность забить ноль, один, два или более голов. Объединение двух независимых Пуассонов дает сетку оценок от 0–0 до 5–4 и выше. Суммирование ячеек, в которых команда хозяев забивает больше, дает вероятность победы дома. Суммирование диагоналей дает ничью. Оставшаяся масса – это выездная победа. Диксон и Коулз позже показали, что 0-0 и 1-1 случаются чаще, чем ожидает простой Пуассон. Их корректировка раздувает эти ячейки с низкими показателями и слегка снижает другие. Временной распад имеет значение, поскольку форма прошлого месяца более информативна, чем совпадение десятимесячной давности. Экспоненциальные веса придают последним играм больше голоса, не отбрасывая при этом историю. Сила лиги также имеет значение, когда команды встречаются в разных соревнованиях. Гол в ворота сильнейшей защиты – это не то же самое доказательство, что гол в ворота вылетевшей команды. Такие рейтинги, как Эло, преобразуют историю побед, поражений и ничьих в единый показатель силы, который обновляется после каждого матча. Рейтинги ФИФА являются общедоступным аналогом той же идеи, хотя они медленнее и более политизированы. Модели клубов обычно превосходят национальные рейтинги по матчам лиги выходного дня, потому что они видят больше данных. Качество данных является узким местом. Отсутствие травм, неправильно закодированные красные карточки и запоздалые составы отравят элегантную математику. Начните с чистых матчей, чистых результатов и четкого определения дома. Тогда статистика может говорить.

Состав матча Премьер-лиги — «Манчестер Сити» — «Бернли», 31 января 2024 г. (CC0 / Wikimedia Commons)
Состав матча Премьер-лиги — «Манчестер Сити» — «Бернли», 31 января 2024 г. (CC0 / Wikimedia Commons)

Ожидаемые голы изменили ход разговора, потому что удары не равны. Врезка с шести метров — это не тридцатиметровый въезд в толпу. Модели xG присваивают каждому удару историческую вероятность реализации в зависимости от местоположения, типа передачи и иногда плотности защитников. Суммируя качество бросков за матч, можно оценить, сколько голов заслужила команда. В течение сезона xG за и против стабильнее, чем сырые голы, которые раскачиваются на штангах и голкиперах. Использование xG в качестве входных данных для атаки и защиты в модели Пуассона часто улучшает калибровку. Тем не менее, xG — это не волшебство. Размер выборки за один уик-энд невелик. Команда может опубликовать 2,4 xG и проиграть 1–0, и модель не будет ошибочной. Модель сказала, что шансы были созданы. В матче вмешались завершение и сэйвы. Этот разрыв — дисперсия, а не повод отказываться от цифр. Владение мячом, передачи в штрафную и интенсивность прессинга добавляют контекста, но могут дважды засчитать одну и ту же атакующую историю. При выборе функций следует отдавать предпочтение переменным, которые предсказывают будущие цели, а не переменным, которые просто описывают последнюю трансляцию. Перекрестная проверка прошлых сезонов — это способ выбора для взрослых. Тренируйтесь в предыдущие годы, тестируйте в более поздние годы и отказывайтесь праздновать соответствие выборке. Оценка Брайера и потеря журнала наказывают за самоуверенность в вероятностях. Точность наиболее вероятного результата | это метрика тщеславия, потому что 1-1 и 1-0 имеют общую вероятностную массу. Модель, в которой говорится: 38 процентов дома, 28 процентов ничьих и 34 процента на выезде, может быть превосходной, даже если побеждает команда гостей. Вопрос в том, действительно ли эти 34 процента побед на выезде приходятся примерно в трети случаев. Калибровочные графики отвечают на этот вопрос. Другая ось — резкость: модель, на которой всегда написано 33-33-33, откалибрована и бесполезна. Вам нужны вероятности, которые меняются вместе с доказательствами. Травмы стартового нападающего должны снизить скорость атаки. Перегруженная середина недели должна немного повысить вероятность ротации и поздних голов. Расстояние путешествия, дни отдыха и интенсивность дерби — это небольшие эффекты, которые все равно складываются. Погода и качество поля входят в состав ошибок, если только у вас нет достаточного количества дождливых матчей, чтобы их оценить. Сохраняйте базовую модель достаточно простой для объяснения. Сложность, которую невозможно проверить, в конечном итоге обманет вас.

Табло матча на стадионе «Сапуто», Монреаль (CC BY-SA 3.0 / Wikimedia Commons)
Табло матча на стадионе «Сапуто», Монреаль (CC BY-SA 3.0 / Wikimedia Commons)

Практичный конвейер выглядит менее романтично, чем телевизионная графика. Собирайте завершенные матчи с указанием дат, команд, мест проведения и результатов. Вычислите скользящие рейтинги атаки и защиты с затуханием во времени. Добавьте xG, если лига публикует надежные данные по ударам. Преобразуйте рейтинги в ожидаемые голы на следующий матч. Постройте матрицу оценок. Считайте 1X2, итоги и количество забитых очков обеими командами. Сравнивайте эти вероятности с ценами закрытия рынка только для проверки здравомыслия, а не вместо вашей собственной вероятности. Рынки – это толпы. На поздних новостях толпа часто бывает резкой, а иногда и медленной. Ваше преимущество, если оно у вас есть, обычно заключается в лучшем моменте травмы или более чистом домашнем факторе конкретной лиги. Никогда не воспринимайте 55-процентную домашнюю победу как обещание. Относитесь к этому как к утверждению, что аналогичные дома выигрывают чуть больше, чем в половине случаев. Банкролльное мышление относится к ставкам, которые являются отдельной дисциплиной от прогнозирования. Прогнозирование заканчивается, когда вероятности честны. Честные прогнозы по-прежнему не учитывают известные расстройства, потому что расстройства находятся в хвосте. Красные карточки, лотерея пенальти и автоголы на последней минуте живут в этом хвосте. Хорошая статья о методах должна сказать об этом дважды. Статистическое предсказание — это не хрустальный шар. Это карта относительной вероятности. Карты помогут вам избежать двух распространенных ошибок фанатов. Первая ошибка – театр недавних событий: одна победа со счетом 4:0 не делает команду из середины таблицы фаворитом титула. Вторая ошибка — это нарративный захват: известное название клуба — это не рейтинг. Рейтинги должны падать, когда падают результаты. Иерархические модели могут распределять силы между лигами, когда данных мало. Байесовское обновление — это формальный способ начать с априорных данных и двигаться дальше с доказательствами. Вам не нужна докторская степень, чтобы использовать эту идею. Начните со средних ожидаемых голов по лиге, а затем примените оценку к недавним матчам команды. Небольшие выборки сжимаются к среднему значению. Крупные образцы позволяют выглядеть экстремально. Это сокращение убережет вас от чрезмерной реакции на результативную серию из трех матчей. Это также не дает вам похоронить недавно получившую повышение команду после двух поражений от гигантов. Контекст остается королем. Счет 1:0 дома против лидера лиги может быть более сильным сигналом, чем счет 3:0 против клуба, находящегося внизу. Разница мячей без корректировки соперника — грубый инструмент. Разница мячей с поправкой на соперников ближе к тому, что уже пытаются достичь Пуассон и Эло.

«Зенит» — «Спартак», Российская Премьер-лига, 2 марта 2024 г. (CC BY-SA 3.0 / Wikimedia Commons)
«Зенит» — «Спартак», Российская Премьер-лига, 2 марта 2024 г. (CC BY-SA 3.0 / Wikimedia Commons)

Так как же читателю следует использовать эти методы перед началом? Сначала запишите вопрос цифрами. Вам нужен наиболее вероятный вариант 1X2, распределение очков или только то, забьют ли обе команды? Во-вторых, соберите последние тридцать-пятьдесят важных матчей для каждой стороны, а не последние три заголовка. В-третьих, сделайте поправку на преимущество хозяев, которое в большинстве лиг все же добавляет несколько десятых гола. В-четвертых, делайте скидку на товарищеские матчи и несовпадающие кубковые матчи, если у вас нет данных о лиге. В-пятых, примените коррекцию стиля Диксона-Коулза, если вас волнуют счеты 0-0 и 1-1. В-шестых, преобразуйте сетку в вероятности, которые вы фактически обсудите. В-седьмых, проверьте здравомыслие на предмет травм, дисквалификаций и очевидных ротаций. В-восьмых, откажитесь от округления 47 процентов до однозначного результата. В-девятых, ведите журнал ваших вероятностей и реальных результатов. В-десятых, проверяйте калибровку каждый месяц, а не вспоминайте только те выходные, когда вы выглядели умно. Статистические страницы в стиле FootballAlarm существуют потому, что делать это вручную для каждой лиги утомительно. Автоматизация не заменяет суждения. Он заменяет ошибки копирования-вставки. Решение по-прежнему решает, попадет ли недавно подписанный нападающий в число одиннадцати. Решение по-прежнему решает, повлияет ли затопленное поле на ценность стрельбы. Затем модель воспринимает эти звонки как измененные входные данные, а не как вибрации. Вибрации – это не метод. Методы выдерживают затруднения, потому что их можно одитировать. Журналы аудита включают винтаж данных, параметр затухания и использованный вами домашний коэффициент. Если вы не можете сформулировать эти три, значит, у вас еще нет статистического прогноза. У вас есть свое мнение в костюме электронной таблицы. Мнения могут быть правильными. Статистические методы пытаются оказаться верными по причине, которая все еще будет работать в следующую субботу. В следующую субботу будет хотя бы один гол, который сетка назвала маловероятным. Это не провал. Это футбол. Именно благодаря футболу мы моделируем счет, а не притворяемся, что матчи — это подбрасывание монеты со знаменитыми логотипами. Подбрасывание монеты игнорирует атаку и защиту. Пуассон этого не делает. xG нет. Эло нет. Используйте их вместе со смирением. Смирение — последний статистический метод, который фанаты игнорируют. Не пропускайте это. Прогнозируйте, записывайте, корректируйте. Тогда все равно посмотрите матч, потому что красота никогда не составляла 38 процентов. Красота – это мяч, промах и номер, который пытался вас предупредить заранее.

Таким образом, жизнь прогноза на матч представляет собой цикл, а не заголовок. Собирайте, оценивайте, проектируйте, оценивайте и учитесь. Пуассон дает вам целевой язык. Диксон-Коулз восстанавливает тихие счеты. xG расскажет вам, какие шансы были реальными. Эло сохраняет силы и не паникует каждый понедельник. Преимущество дома остается упрямым эмпирическим фактом. Затухание во времени не дает модели уснуть. Калибровка позволяет разработчику модели быть честным. Ничто из этого не снимает драматизма с девяноста минут. Это только цена драмы. Ценовая драма – это то, о чем говорят аналитики, когда отказываются гадать. Угадывать – это дешево. Оценка — это работа. Работа выглядит как табло, на котором за пять минут до конца матча может быть написано 2-1, в то время как в предматчевой сетке в качестве режима было 1-1. И то, и другое может быть правдой. Режим не является командой. Мода – это пик распределения. Распределения — это вся суть статистического прогнозирования совпадений. Если вы помните только одно предложение, запомните это. Результатом является образец. Метод — это распределение. Методы, которые публикуют только один результат без вероятностей, скрывают свою неопределенность. Неопределенность – это продукт. Опубликуйте это. Тогда читатель сможет решить, что на самом деле означают 40 процентов дома. Это означает четыре одинаковых матча из десяти, а не уже выгравированный трофей. Гравировка происходит после свистка. Статистика бывает раньше. «До» — вот где живет эта статья. После этого таблица обновляется. Между ними находится единственное честное средство, которое у нас есть, чтобы ответить на вопрос, чем может закончиться матч. Это может закончиться как фаворит. Возможно, нет. Цифры подсказали вам раскол. Этот раскол является прогнозом. Все остальное — театр. Театр разрешен. Театр – это не метод. Метод здесь, в двухстах предложениях, чтобы следующий матч столкнулся с сеткой, а не со слухами. Используйте сетку. Уважайте хвост. Наслаждайтесь матчем.

Таблицы рейтингов являются запаздывающими показателями по сравнению с скользящим xG. Недавно получивший повышение клуб часто превосходит ранние пессимистичные предшественники. Чемпион переходного периода часто проигрывает своим ранним оптимистическим прогнозам. Специалисты по стандартным положениям заслуживают небольшого отдельного удара в атаке. Команды, пользующиеся высокой прессой, допускают вероятность перехода, которую Пуассон при ударах может промахнуться, если данные об ударах будут неполными. Качество вратаря связано с рейтингом защиты, а не с мистической аурой. Ставки штрафов слишком высоки; не перестраивайте модель после одного пенальти. Частота красных карточек также является шумной и должна соответствовать базовому рейтингу лиги. Кубковые соревнования сочетают в себе мотивацию, которую модели лиг отражают лишь частично. Перерывы на международные матчи меняют клубный ритм и немного повышают шансы на ничью у некоторых команд из середины таблицы. Женским и мужским лигам нужны отдельные файлы параметров. Копирование домашнего преимущества Премьер-лиги в другой дивизион — распространенная молчаливая ошибка. Оцените преимущество дома в лиге, которую вы прогнозируете. Три очка за победу исторически меняли стимулы, поэтому не объединяйте вслепую данные до 1990-х годов. Изменения в правилах, такие как пять замен, также меняют показатели забитых мячей в конце игры. Отслеживайте эти изменения режима, иначе ваши веса распада будут бороться с прошлым. Открытые данные StatsBomb и подобных проектов сделали xG воспроизводимым для любителей. Воспроизводимость более ценна, чем секретный соус, который никто не может проверить. Если две модели расходятся во мнениях, проверьте входные данные, прежде чем усреднять выходные данные. Усреднение калиброванных моделей может помочь; усреднение историй редко помогает. Лиге с большим количеством ничьих нужна другая интенсивность Диксона-Коулза, чем лиге с высокими показателями. Скандинавские поля в начале сезона — это не август в Испании. География — это не судьба, а ковариата. Путешествие через часовые пояса в континентальных кубках — настоящая переменная усталости. Европейские матчи в середине недели часто подавляют интенсивность лиги на выходных. Политика ротации больших составов делает составы из одиннадцати игроков обязательным условием.

Uncategorized

কিভাবে পরিসংখ্যানগত পদ্ধতির সাথে ম্যাচের ফলাফলের পূর্বাভাস দেওয়া যায়

আপনি কিভাবে পরিসংখ্যানগত পদ্ধতির সাথে একটি ম্যাচ ফলাফল ভবিষ্যদ্বাণী করবেন? সৎ উত্তর সম্ভাব্যতা দিয়ে শুরু হয়, ভবিষ্যদ্বাণী নয়। ফুটবল একটি কম স্কোরিং খেলা যা উচ্চ বৈচিত্র্য সহ, তাই একটি একক স্কোরলাইন কখনই নিশ্চিত নয়। একটি ভাল মডেল অনুমান করে যে প্রতিটি ফলাফল কত ঘন ঘন একই রকম ম্যাচ জুড়ে হওয়া উচিত। হোম জয়, ড্র এবং অ্যাওয়ে জেতা সম্ভাবনার ক্লাসিক 1X2 বাজার। ওভার এবং কম মোট, উভয় দলই স্কোর করবে এবং সঠিক স্কোর হল একই লক্ষ্য প্রক্রিয়ার অন্য দৃষ্টিভঙ্গি। প্রাচীনতম ব্যবহারিক ইঞ্জিনটি লক্ষ্যের জন্য একটি পয়সন মডেল। মাইকেল মাহের 1982 এর কাজ প্রতিটি দলের স্কোরিংকে আক্রমণের হার এবং একটি প্রতিরক্ষা হার সহ গণনা প্রক্রিয়া হিসাবে বিবেচনা করে। আপনি সাম্প্রতিক ম্যাচগুলি থেকে সেই হারগুলি অনুমান করেন, তারপর একটি হোম-অ্যাডভান্টেজ ফ্যাক্টর যোগ করুন। পয়সন সূত্রটি তখন শূন্য, এক, দুই বা তার বেশি গোলের সুযোগ দেয়। দুটি স্বাধীন পয়সন একত্রিত করা 0-0 থেকে 5-4 এবং তার পরে একটি স্কোর গ্রিড তৈরি করে। ঘরের সারসংকলন যেখানে হোম টিম বেশি স্কোর করে তা হোম জয়ের সম্ভাবনা তৈরি করে। তির্যক যোগ করলে ড্র পাওয়া যায়। বাকি ভর হল দূরে জয়। ডিক্সন এবং কোলস পরে দেখিয়েছেন যে 0-0 এবং 1-1 একটি প্লেইন পয়সনের প্রত্যাশার চেয়ে বেশি ঘন ঘন ঘটে। তাদের সামঞ্জস্য সেই কম-স্কোর কোষগুলিকে স্ফীত করে এবং অন্যগুলিকে সামান্য ডিফ্লেট করে। সময়ের ক্ষয় গুরুত্বপূর্ণ কারণ গত মাসের ফর্ম দশ মাস আগের ম্যাচের চেয়ে বেশি তথ্যপূর্ণ। সূচকীয় ওজন সাম্প্রতিক গেমগুলিকে ইতিহাসকে দূরে ফেলে না দিয়ে আরও ভয়েস দেয়৷ দলগুলি যখন প্রতিযোগিতা জুড়ে মিলিত হয় তখন লিগের শক্তিও গুরুত্বপূর্ণ। শীর্ষ ডিফেন্সের বিরুদ্ধে একটি গোল একটি রিলিগেটেড দলের বিপক্ষে গোলের মতো একই প্রমাণ নয়। ইলোর মতো রেটিংগুলি জয়-পরাজয়-ড্র ইতিহাসকে একটি একক শক্তি সংখ্যায় রূপান্তর করে যা প্রতি ম্যাচের পরে আপডেট হয়। ফিফা র‍্যাঙ্কিং একই ধারণার একটি পাবলিক কাজিন, যদিও তারা ধীরগতির এবং আরও রাজনৈতিক। ক্লাব মডেল সাধারণত সপ্তাহান্তে লিগ ফিক্সচারের জন্য জাতীয় র‌্যাঙ্কিংকে হারায় কারণ তারা আরও ডেটা দেখে। ডেটা গুণমান একটি শান্ত বাধা। অনুপস্থিত আঘাত, ভুলভাবে কোড করা লাল কার্ড, এবং বিলম্বিত লাইনআপ মার্জিত গণিতকে বিষাক্ত করবে। পরিষ্কার ফিক্সচার, পরিষ্কার স্কোর এবং বাড়ির একটি পরিষ্কার সংজ্ঞা দিয়ে শুরু করুন। তাহলে পরিসংখ্যান কথা বলতে পারে।

প্রিমিয়ার লিগের ম্যাচ লাইনআপ — ম্যানচেস্টার সিটি বনাম বার্নলি, 31 জানুয়ারী 2024 (CC0 / Wikimedia Commons)
প্রিমিয়ার লিগের ম্যাচ লাইনআপ — ম্যানচেস্টার সিটি বনাম বার্নলি, 31 জানুয়ারী 2024 (CC0 / Wikimedia Commons)

প্রত্যাশিত গোল কথোপকথন পরিবর্তন করেছে কারণ শট সমান নয়। ছয় মিটার থেকে একটি ট্যাপ-ইন ভিড়ের মধ্যে ত্রিশ মিটার ড্রাইভ নয়। xG মডেলগুলি অবস্থান, সহায়তার ধরন এবং কখনও কখনও ডিফেন্ডার ঘনত্বের উপর ভিত্তি করে প্রতিটি শটকে একটি ঐতিহাসিক রূপান্তর সম্ভাবনা নির্ধারণ করে। একটি ম্যাচের শটের গুণমানের সমষ্টি অনুমান করে যে একটি দল কতটি গোল প্রাপ্য। এক মৌসুমে, পক্ষে এবং বিপক্ষে xG কাঁচা গোলের চেয়ে বেশি স্থিতিশীল, যা পোস্ট এবং গোলরক্ষকদের উপর সুইং করে। পয়সন-স্টাইল মডেলে আক্রমণ এবং প্রতিরক্ষা ইনপুট হিসাবে xG ব্যবহার করা প্রায়শই ক্রমাঙ্কন উন্নত করে। তবুও, xG জাদু নয়। এক সপ্তাহান্তে নমুনার আকার ছোট। একটি দল 2.4 xG পোস্ট করতে পারে এবং মডেলটি ভুল না করে 1-0 হারাতে পারে। মডেল বলেন, সম্ভাবনা তৈরি হয়েছে। ম্যাচ ফিনিশিং ও সেভের হস্তক্ষেপ বলে। সেই ব্যবধানটি বৈচিত্র্য, সংখ্যা পরিত্যাগ করার কারণ নয়। দখল, বক্সে পাস, এবং তীব্রতা চাপলে প্রসঙ্গ যোগ করা যায় কিন্তু একই আক্রমণাত্মক গল্প দ্বিগুণ গণনা করতে পারে। বৈশিষ্ট্য নির্বাচন ভেরিয়েবল পছন্দ করা উচিত যে ভেরিয়েবল ভবিষ্যত লক্ষ্য ভবিষ্যদ্বাণী, ভেরিয়েবল নয় যে শুধুমাত্র শেষ সম্প্রচার বর্ণনা. বিগত ঋতুতে ক্রস-ভ্যালিডেশন হল প্রাপ্তবয়স্কদের বেছে নেওয়ার উপায়। আগের বছরগুলিতে প্রশিক্ষণ দিন, পরবর্তী বছরে পরীক্ষা করুন এবং ইন-স্যাম্পল ফিট উদযাপন করতে অস্বীকার করুন। ব্রিয়ার স্কোর এবং লগ ক্ষতি অতিরিক্ত আত্মবিশ্বাসী সম্ভাবনাকে শাস্তি দেয়। সর্বাধিক সম্ভাব্য স্কোরের যথার্থতা| একটি ভ্যানিটি মেট্রিক কারণ 1-1 এবং 1-0 সম্ভাব্য ভর ভাগ করে। একটি মডেল যা বলে যে 38 শতাংশ হোম, 28 শতাংশ ড্র, 34 শতাংশ দূরে থাকা দলটি জিতলেও দুর্দান্ত হতে পারে। প্রশ্ন হল সেই 34 শতাংশ দূরে জয়গুলি আসলে প্রায় এক তৃতীয়াংশ সময় আসে কিনা। ক্রমাঙ্কন প্লট যে প্রশ্নের উত্তর. তীক্ষ্ণতা হল অন্য অক্ষ: একটি মডেল যা সবসময় বলে 33-33-33 ক্যালিব্রেট করা এবং অকেজো। আপনি সম্ভাব্যতা চান যেগুলি যখন প্রমাণ সরে যায়। একজন শুরুর স্ট্রাইকারের ইনজুরির কারণে আক্রমণের হার কমানো উচিত। একটি ঘনবসতিপূর্ণ মধ্য সপ্তাহে ঘূর্ণন এবং দেরিতে গোলের সম্ভাবনা কিছুটা বাড়াতে হবে। ভ্রমণের দূরত্ব, বিশ্রামের দিন এবং ডার্বির তীব্রতা হল ছোট প্রভাব যা এখনও যোগ করে। আবহাওয়া এবং পিচের গুণমান ত্রুটির পরিভাষায় অন্তর্ভুক্ত যদি না আপনার কাছে সেগুলি অনুমান করার জন্য যথেষ্ট বৃষ্টির ম্যাচ না থাকে। মূল মডেলটি ব্যাখ্যা করার জন্য যথেষ্ট সহজ রাখুন। জটিলতা যা চেক করা যাবে না শেষ পর্যন্ত আপনার কাছে মিথ্যা হবে।

Stade Saputo, Montreal-এ ম্যাচ স্কোরবোর্ড (CC BY-SA 3.0 / Wikimedia Commons)
Stade Saputo, Montreal-এ ম্যাচ স্কোরবোর্ড (CC BY-SA 3.0 / Wikimedia Commons)

একটি ব্যবহারিক পাইপলাইন একটি টেলিভিশন গ্রাফিকের চেয়ে কম রোমান্টিক দেখায়। তারিখ, দল, ভেন্যু এবং স্কোর সহ সমাপ্ত ম্যাচগুলি সংগ্রহ করুন। সময় ক্ষয় সঙ্গে ঘূর্ণায়মান আক্রমণ এবং প্রতিরক্ষা রেটিং গণনা. লিগ নির্ভরযোগ্য শট ডেটা প্রকাশ করলে xG-তে মিশ্রিত করুন। পরবর্তী ম্যাচের জন্য প্রত্যাশিত লক্ষ্যে রেটিং রূপান্তর করুন। স্কোর ম্যাট্রিক্স তৈরি করুন। 1X2, মোট, এবং উভয় দল থেকে স্কোর পড়ুন। আপনার নিজের সম্ভাবনার বিকল্প হিসাবে নয়, শুধুমাত্র একটি স্যানিটি চেক হিসাবে বন্ধ বাজার মূল্যের সাথে সেই সম্ভাবনাগুলির তুলনা করুন। মার্কেটগুলোতে ভিড়। ভিড় প্রায়ই তীক্ষ্ণ এবং কখনও কখনও দেরী সংবাদে ধীর হয়. আপনার প্রান্ত, যদি আপনার একটি থাকে, সাধারণত ভাল ইনজুরি টাইমিং বা ক্লিনার লিগ-নির্দিষ্ট হোম ফ্যাক্টর। 55 শতাংশ হোম জয়কে কখনই প্রতিশ্রুতি হিসাবে বিবেচনা করবেন না। এটিকে একটি বিবৃতি হিসাবে বিবেচনা করুন যে অনুরূপ বাড়িগুলি অর্ধেকেরও বেশি সময় জিতবে। ব্যাঙ্করোল চিন্তা বাজির অন্তর্গত, যা পূর্বাভাস থেকে একটি পৃথক শৃঙ্খলা। সম্ভাব্যতা সৎ হলে পূর্বাভাস শেষ হয়। সৎ পূর্বাভাস এখনও বিখ্যাত আপসেট মিস, কারণ বিপর্যস্ত লেজ আছে. লাল কার্ড, পেনাল্টি লটারি এবং শেষ মুহূর্তের নিজস্ব গোল সেই লেজে থাকে। পদ্ধতি সম্পর্কে একটি ভাল নিবন্ধ এটি দুবার বলতে হবে। পরিসংখ্যানগত ভবিষ্যদ্বাণী একটি ক্রিস্টাল বল নয়। এটি আপেক্ষিক সম্ভাবনার একটি মানচিত্র। মানচিত্র আপনাকে দুটি সাধারণ ফ্যান ত্রুটি এড়াতে সাহায্য করে। প্রথম ত্রুটিটি হল রিসেন্সি থিয়েটার: একটি 4-0 ব্যবধানে জয় একটি মধ্য-টেবিল দলকে শিরোপা পছন্দ করে না। দ্বিতীয় ত্রুটিটি বর্ণনামূলক ক্যাপচার: একটি বিখ্যাত ক্লাবের নাম একটি রেটিং নয়। পারফরম্যান্স কমে গেলে রেটিং পড়তে দেওয়া উচিত। হায়ারার্কিক্যাল মডেলগুলি লিগ জুড়ে শক্তি ভাগ করে নিতে পারে যখন ডেটা পাতলা হয়। Bayesian আপডেট করা একটি পূর্ব থেকে শুরু করার এবং প্রমাণ সহ সরানোর একটি আনুষ্ঠানিক উপায়। ধারণাটি ব্যবহার করার জন্য আপনার পিএইচডির প্রয়োজন নেই। লীগ-গড় প্রত্যাশিত গোল দিয়ে শুরু করুন, তারপর দলের সাম্প্রতিক ম্যাচগুলির দিকে অনুমানটি টানুন। ছোট নমুনা গড়ের দিকে সঙ্কুচিত হয়। বড় নমুনা চরম দেখতে অনুমতি দেওয়া হয়. এই সংকোচন আপনাকে তিন-ম্যাচের হট স্ট্রিকে অতিরিক্ত প্রতিক্রিয়া করা থেকে বাঁচায়। এটি আপনাকে জায়ান্টদের বিরুদ্ধে দুটি পরাজয়ের পরে একটি নতুন প্রচারিত পক্ষকে সমাধিস্থ করা থেকেও বাধা দেয়। প্রসঙ্গ রাজা থেকে যায়। লিগ লিডারের বিরুদ্ধে ঘরের মাঠে 1-0 তে নীচের ক্লাবের বিরুদ্ধে 3-0 এর চেয়ে শক্তিশালী সংকেত হতে পারে। প্রতিপক্ষের সমন্বয় ছাড়া গোল পার্থক্য একটি ভোঁতা যন্ত্র। প্রতিপক্ষের সাথে সামঞ্জস্য করা গোলের পার্থক্য Poisson এবং Elo ইতিমধ্যে ক্যাপচার করার চেষ্টা করার কাছাকাছি।

জেনিট বনাম স্পার্টাক, রাশিয়ান প্রিমিয়ার লীগ, 2 মার্চ 2024 (CC BY-SA 3.0 / Wikimedia Commons)
জেনিট বনাম স্পার্টাক, রাশিয়ান প্রিমিয়ার লীগ, 2 মার্চ 2024 (CC BY-SA 3.0 / Wikimedia Commons)

সুতরাং কিভাবে একটি পাঠক আসলে কিকঅফ আগে এই পদ্ধতি ব্যবহার করা উচিত? প্রথমে প্রশ্নটি সংখ্যায় লিখুন। আপনি কি খুব সম্ভবত 1X2 চান, একটি স্কোর ডিস্ট্রিবিউশন, নাকি শুধুমাত্র উভয় দলই স্কোর করতে চান? দ্বিতীয়ত, প্রতিটি পক্ষের জন্য শেষ ত্রিশ থেকে পঞ্চাশটি প্রাসঙ্গিক ম্যাচ সংগ্রহ করুন, শেষ তিনটি শিরোনাম নয়। তৃতীয়ত, হোম সুবিধার জন্য সামঞ্জস্য করুন, যা বেশিরভাগ লিগে এখনও একটি গোলের কয়েক দশমাংশ যোগ করে। চতুর্থ, ডিসকাউন্ট ফ্রেন্ডলি এবং অমিল কাপ টাই যদি না আপনার লিগ ডেটার অভাব হয়। পঞ্চম, আপনি যদি 0-0 এবং 1-1 সম্পর্কে যত্নবান হন তবে একটি ডিক্সন-কোলস শৈলী সংশোধন প্রয়োগ করুন। ষষ্ঠ, গ্রিডটিকে সম্ভাব্যতার মধ্যে রূপান্তর করুন যা আপনি আসলে আলোচনা করবেন। সপ্তম, ইনজুরি, সাসপেনশন এবং সুস্পষ্ট ঘূর্ণনের বিরুদ্ধে বিবেক-চেক। অষ্টম, একটি নিশ্চিত জিনিস মধ্যে বৃত্তাকার 47 শতাংশ প্রত্যাখ্যান. নবম, আপনার সম্ভাব্যতা এবং বাস্তব ফলাফলের একটি লগ রাখুন। দশম, প্রতিমাসে ক্রমাঙ্কন পর্যালোচনা করুন শুধুমাত্র উইকএন্ড মনে রাখার পরিবর্তে আপনাকে বুদ্ধিমান দেখাচ্ছিল। ফুটবল অ্যালার্ম-স্টাইলের পরিসংখ্যান পৃষ্ঠাগুলি বিদ্যমান কারণ প্রতিটি লিগের জন্য এটি হাতে করে করা ক্লান্তিকর। অটোমেশন বিচার প্রতিস্থাপন করে না। এটি কপি-পেস্ট ত্রুটি প্রতিস্থাপন করে। নতুন সই করা স্ট্রাইকার একাদশে আছে কিনা তা বিচার এখনও নির্ধারণ করে। বিচার এখনও সিদ্ধান্ত নেয় যে জলাবদ্ধ পিচ শুটিং মান পরিবর্তন করে কিনা। মডেলটি সেই কলগুলিকে পরিবর্তিত ইনপুট হিসাবে শোষণ করে, ভাইব হিসাবে নয়। Vibes একটি পদ্ধতি নয়. পদ্ধতিগুলি বিব্রত থেকে বেঁচে থাকে কারণ সেগুলি নিরীক্ষিত হতে পারে। অডিট ট্রেলগুলিতে ডেটা ভিন্টেজ, ক্ষয় প্যারামিটার এবং আপনি যে হোম ফ্যাক্টর ব্যবহার করেছেন তা অন্তর্ভুক্ত করে। আপনি যদি এই তিনটি বলতে না পারেন তবে আপনার কাছে এখনও পরিসংখ্যানগত পূর্বাভাস নেই। আপনি একটি স্প্রেডশীট পরিচ্ছদ পরা একটি মতামত আছে. মতামত সঠিক হতে পারে। পরিসংখ্যানগত পদ্ধতিগুলি এমন একটি কারণে সঠিক হওয়ার চেষ্টা করে যা এখনও পরের শনিবার কাজ করবে। আগামী শনিবার অন্তত একটি স্কোর থাকবে যাকে বলা হয় অসম্ভাব্য। সেটা ব্যর্থতা নয়। সেটা হলো ফুটবল। ফুটবল এই কারণেই আমরা মডেল গণনার পরিবর্তে ম্যাচগুলি বিখ্যাত লোগো সহ মুদ্রা উল্টানোর ভান করি৷ মুদ্রা উল্টে আক্রমণ এবং প্রতিরক্ষা উপেক্ষা করে। পয়সন করে না। xG করে না। এলো না। নম্রতার সাথে তাদের একসাথে ব্যবহার করুন। নম্রতা হল শেষ পরিসংখ্যান পদ্ধতি, এবং যেটি ভক্তরা এড়িয়ে যান। এড়িয়ে যাবেন না। ভবিষ্যদ্বাণী, রেকর্ড, সংশোধন. তারপর যেভাবেই হোক ম্যাচ দেখুন, কারণ সৌন্দর্যের 38 শতাংশ কখনই ছিল না। সৌন্দর্য হল বল, মিস, এবং সংখ্যা যা আপনাকে আগাম সতর্ক করার চেষ্টা করেছে।

ম্যাচের পূর্বাভাসের জীবন তাই একটি লুপ, শিরোনাম নয়। সংগ্রহ, হার, প্রকল্প, স্কোর, এবং শিখুন. পয়সন আপনাকে একটি লক্ষ্য ভাষা দেয়। ডিক্সন-কোলস শান্ত স্কোর মেরামত. xG আপনাকে বলে যে কোন সম্ভাবনা বাস্তব ছিল। ইলো একটি চলমান শক্তি রাখে যা প্রতি সোমবার আতঙ্কিত হয় না। হোম সুবিধা একটি জেদী অভিজ্ঞতামূলক সত্য অবশেষ. সময়ের ক্ষয় মডেলকে জাগ্রত রাখে। ক্রমাঙ্কন মডেলারকে সৎ রাখে। এর কোনোটাই নব্বই মিনিটের নাটককে সরিয়ে দেয় না। এটা শুধু নাটকের দাম। মূল্য নির্ধারণের নাটক হল বিশ্লেষকরা কীভাবে কথা বলেন যখন তারা অনুমান করতে অস্বীকার করেন। অনুমান করা সস্তা। অনুমান করা কাজ। কাজটি একটি স্কোরবোর্ডের মতো দেখায় যা 2-1 পড়তে পারে পাঁচ মিনিট বাকি থাকাকালীন আপনার প্রাক-ম্যাচ গ্রিডে মোড হিসাবে 1-1 ছিল। দুটোই সত্য হতে পারে। মোড একটি কমান্ড নয়. মোড হল ডিস্ট্রিবিউশনের সর্বোচ্চ। ডিস্ট্রিবিউশন হল পরিসংখ্যানগত ম্যাচের পূর্বাভাসের পুরো পয়েন্ট। আপনার যদি একটি মাত্র বাক্য মনে থাকে তবে তা মনে রাখবেন। একটি ফলাফল একটি নমুনা. একটি পদ্ধতি একটি বিতরণ. সম্ভাব্যতা ছাড়াই শুধুমাত্র একটি একক স্কোর প্রকাশ করার পদ্ধতিগুলি তাদের অনিশ্চয়তা লুকিয়ে রাখে। অনিশ্চয়তা পণ্য। এটি প্রকাশ করুন। তারপর পাঠক সিদ্ধান্ত নিতে পারেন যে 40 শতাংশ বাড়ি আসলে কী বোঝায়। এর মানে দশের মধ্যে চারটি একই রকম ম্যাচ, একটি ট্রফি ইতিমধ্যে খোদাই করা নয়। বাঁশির পরে খোদাই করা হয়। পরিসংখ্যান আগে ঘটে. আগে এই নিবন্ধটি বাস যেখানে. তারপর যেখানে টেবিল আপডেট করা হয়. তাদের মধ্যে একটি ম্যাচ কিভাবে শেষ হতে পারে উত্তর দেওয়ার জন্য আমাদের কাছে একমাত্র সৎ নৈপুণ্য রয়েছে। এটি প্রিয় হিসাবে শেষ হতে পারে. এটা নাও হতে পারে। সংখ্যা আপনাকে বিভক্ত বলেছে. সেই বিভাজনই ভবিষ্যদ্বাণী। বাকি সবই থিয়েটার। থিয়েটার অনুমোদিত। থিয়েটার কোনো পদ্ধতি নয়। পদ্ধতিটি এখানে, দুইশত বাক্যে, যাতে পরবর্তী ফিক্সচারটি একটি গুজবের পরিবর্তে একটি গ্রিডের মুখোমুখি হয়। গ্রিড ব্যবহার করুন। লেজকে সম্মান করুন। ম্যাচ উপভোগ করুন।

লিগ টেবিল রোলিং xG এর তুলনায় পিছিয়ে থাকা সূচক। একটি সদ্য উন্নীত করা ক্লাব প্রায়ই প্রথম দিকের হতাশাবাদী পুর্বকে ছাড়িয়ে যায়। ট্রানজিশনে একজন চ্যাম্পিয়ন প্রায়ই প্রথম দিকের আশাবাদী পুর্বের কম পারফর্ম করে। সেট-পিস বিশেষজ্ঞদের একটি ছোট পৃথক আক্রমণকারী বাম্প প্রাপ্য। হাই-প্রেস দলগুলি ট্রানজিশনের সম্ভাবনা স্বীকার করে যে শট ডেটা অসম্পূর্ণ থাকলে শটগুলিতে পয়সন মিস করতে পারে। গোলরক্ষকের গুণমান ডিফেন্স রেটিং এর অন্তর্গত, রহস্যময় আভায় নয়। শাস্তির হার শোরগোল; এক স্পট কিকের পরে একটি মডেল পুনর্নির্মাণ করবেন না। লাল-কার্ড ফ্রিকোয়েন্সিগুলিও শোরগোলপূর্ণ এবং লিগ-বেস-রেট হওয়া উচিত। কাপ প্রতিযোগিতায় অনুপ্রেরণা মিশ্রিত হয় যা লিগ মডেলগুলি শুধুমাত্র আংশিকভাবে ক্যাপচার করে। আন্তর্জাতিক বিরতি ক্লাবের ছন্দ রিসেট করে এবং মধ্য-টেবিলের কিছু পক্ষের জন্য ড্রয়ের সম্ভাবনা কিছুটা বাড়িয়ে দেয়। মহিলা লীগ এবং পুরুষদের লিগের জন্য আলাদা প্যারামিটার ফাইল প্রয়োজন। প্রিমিয়ার লিগের হোম সুবিধাকে অন্য বিভাগে অনুলিপি করা একটি সাধারণ নীরব ত্রুটি। আপনি যে লিগের পূর্বাভাস করছেন তার মধ্যে বাড়ির সুবিধা অনুমান করুন। জয়ের জন্য তিনটি পয়েন্ট ঐতিহাসিকভাবে প্রণোদনা পরিবর্তন করে, তাই 1990-এর দশকের আগের ডেটা অন্ধভাবে পুল করবেন না। নিয়মের পরিবর্তন যেমন পাঁচটি প্রতিস্থাপনও দেরীতে খেলার গোল হার পরিবর্তন করে। সেই শাসনের পরিবর্তনগুলি ট্র্যাক করুন বা আপনার ক্ষয় হওয়া ওজন অতীতের সাথে লড়াই করবে। StatsBomb থেকে খোলা ডেটা এবং অনুরূপ প্রকল্পগুলি অপেশাদারদের জন্য xG পুনরুত্পাদনযোগ্য করে তুলেছে। প্রজননযোগ্যতা একটি গোপন সসের চেয়ে বেশি মূল্যবান কেউ চেক করতে পারে না। যদি দুটি মডেল একমত না হয়, আউটপুট গড় করার আগে ইনপুটগুলি পরিদর্শন করুন। গড় ক্যালিব্রেটেড মডেল সাহায্য করতে পারে; গড় গল্প খুব কমই সাহায্য করে। একটি ড্র-ভারী লিগের জন্য একটি উচ্চ-স্কোরিং লিগের চেয়ে ভিন্ন ডিক্সন-কোলস তীব্রতা প্রয়োজন। স্ক্যান্ডিনেভিয়ান প্রারম্ভিক মরসুমের পিচগুলি স্পেনে আগস্ট নয়। ভূগোল নিয়তি নয়, তবে এটি একটি কোভারিয়েট। মহাদেশীয় কাপে সময় অঞ্চল জুড়ে ভ্রমণ একটি বাস্তব ক্লান্তি পরিবর্তনশীল। মধ্য সপ্তাহের ইউরোপীয় ম্যাচগুলি প্রায়ই সপ্তাহান্তে লিগের তীব্রতাকে দমন করে। বড় স্কোয়াডগুলির ঘূর্ণন নীতিগুলি এগারো-নাম লাইনআপগুলিকে একটি প্রয়োজনীয় ইনপুট করে তোলে।

Uncategorized

كيفية التنبؤ بنتائج المطابقة بالطرق الإحصائية

كيف تتوقع نتيجة المباراة بالطرق الإحصائية؟ الجواب الصادق يبدأ بالاحتمالات، وليس النبوءة. كرة القدم هي رياضة منخفضة التهديف مع تباين كبير، لذا فإن نتيجة واحدة ليست مؤكدة على الإطلاق. يقوم النموذج الجيد بتقدير عدد المرات التي يجب أن تحدث فيها كل نتيجة عبر العديد من التطابقات المماثلة. الفوز على أرضه، والتعادل، والفوز خارج أرضه يشكل سوق الاحتمالات الكلاسيكي 1X2. الإجماليات الزائدة أو الأقل، يسجل كلا الفريقين، والنتائج الدقيقة هي مجرد وجهات نظر أخرى لنفس عملية الهدف. أقدم محرك عملي هو نموذج بواسون للأهداف. تعامل عمل مايكل ماهر عام 1982 مع تسجيل كل فريق على أنه عملية حساب بمعدل هجوم ومعدل دفاع. يمكنك تقدير هذه المعدلات من المباريات الأخيرة، ثم إضافة عامل ميزة المنزل. تمنح صيغة بواسون بعد ذلك فرصة تسجيل هدف واحد أو هدفين أو أكثر. يؤدي الجمع بين اثنين من بواسون مستقلين إلى إنتاج شبكة نقاط من 0-0 إلى 5-4 وما بعدها. يؤدي جمع الخلايا التي يسجل فيها الفريق المضيف نقاطًا أكبر إلى احتمالية الفوز على أرضه. جمع القطر ينتج التعادل. الكتلة المتبقية هي الفوز خارج الأرض. أظهر ديكسون وكولز لاحقًا أن 0-0 و1-1 تحدث في كثير من الأحيان أكثر مما توقعه بواسون العادي. يؤدي تعديلها إلى تضخيم تلك الخلايا ذات الدرجات المنخفضة وتفريغ الخلايا الأخرى قليلاً. إن تناقص الوقت مهم لأن شكل الشهر الماضي أكثر إفادة من مباراة منذ عشرة أشهر. تمنح الأوزان الأسية الألعاب الأخيرة صوتًا أكبر دون التخلص من التاريخ. قوة الدوري مهمة أيضًا عندما تلتقي الفرق عبر المسابقات. الهدف ضد أحد كبار الدفاع ليس هو نفس الدليل على الهدف ضد الفريق الهابط. تعمل التقييمات مثل Elo على تحويل سجل الفوز والخسارة والتعادل إلى رقم قوة واحد يتم تحديثه بعد كل مباراة. تصنيفات الفيفا هي ابن عم عام لنفس الفكرة، على الرغم من أنها أبطأ وأكثر سياسية. عادةً ما تتفوق نماذج الأندية على التصنيف الوطني لمباريات الدوري في نهاية الأسبوع لأنها ترى المزيد من البيانات. جودة البيانات هي عنق الزجاجة الهادئ. إن غياب الإصابات، والبطاقات الحمراء المشفرة بشكل خاطئ، والتشكيلات المتأخرة سوف تسمم الرياضيات الأنيقة. ابدأ بتركيبات نظيفة، ونتائج نظيفة، وتعريف واضح للمنزل. ثم يمكن للإحصاءات أن تتحدث.

تشكيلة مباريات الدوري الإنجليزي الممتاز – مانشستر سيتي ضد بيرنلي، 31 يناير 2024 (CC0 / ويكيميديا ​​كومنز)
تشكيلة مباريات الدوري الإنجليزي الممتاز – مانشستر سيتي ضد بيرنلي، 31 يناير 2024 (CC0 / ويكيميديا ​​كومنز)

الأهداف المتوقعة غيرت مجرى الحديث لأن التسديدات ليست متساوية. إن التسجيل من مسافة ستة أمتار لا يعني مسافة ثلاثين مترًا وسط حشد من الناس. تقوم نماذج xG بتعيين احتمالية تحويل تاريخية لكل لقطة بناءً على الموقع ونوع المساعدة وأحيانًا كثافة المدافع. يؤدي جمع جودة التسديدة خلال المباراة إلى تقدير عدد الأهداف التي يستحقها الفريق. على مدار الموسم، تكون أهداف xG المؤيدة والمعارضة أكثر استقرارًا من الأهداف الخام، التي تتأرجح على القائمين وحراس المرمى. غالبًا ما يؤدي استخدام xG كمدخلات الهجوم والدفاع في نموذج نمط بواسون إلى تحسين المعايرة. ومع ذلك، فإن xG ليس سحرًا. حجم العينة في عطلة نهاية الأسبوع الواحدة صغير. يمكن للفريق أن ينشر 2.4xG ويخسر 1-0 دون أن يكون النموذج خاطئًا. قال النموذج إن الفرص خلقت. وقالت المباراة إن الإنهاء والإنقاذ تدخلا. وهذه الفجوة هي التباين، وليست سببا للتخلي عن الأرقام. الاستحواذ والتمرير داخل منطقة الجزاء والضغط المكثف يضيف سياقًا ولكن يمكن مضاعفة نفس القصة الهجومية. يجب أن يفضل اختيار الميزة المتغيرات التي تتنبأ بالأهداف المستقبلية، وليس المتغيرات التي تصف البث الأخير فقط. التحقق من الصحة في المواسم الماضية هو طريقة الكبار للاختيار. تدرب على السنوات السابقة، واختبر في سنة لاحقة، وارفض الاحتفال بملاءمة العينة. نتيجة بريير وخسارة السجل تعاقب الاحتمالات المفرطة في الثقة. دقة النتيجة الأكثر احتمالا| هو مقياس الغرور لأن 1-1 و1-0 يتقاسمان كتلة الاحتمال. النموذج الذي ينص على أن 38% في أرضهم، و28% تعادل، و34% خارج أرضهم يمكن أن يكون ممتازًا حتى عندما يفوز الفريق الضيف. والسؤال هو ما إذا كانت تلك الانتصارات التي تبلغ 34 بالمائة خارج الأرض تصل فعليًا إلى حوالي ثلث الوقت. مؤامرات المعايرة تجيب على هذا السؤال. الحدة هي المحور الآخر: النموذج الذي يقول دائمًا 33-33-33 هو نموذج معاير وعديم الفائدة. تريد الاحتمالات التي تتحرك عندما يتحرك الدليل. يجب أن تؤدي إصابات المهاجم الأساسي إلى خفض معدل الهجوم. من المفترض أن يؤدي منتصف الأسبوع المزدحم إلى زيادة فرصة التناوب والأهداف المتأخرة قليلاً. تعد مسافة السفر وأيام الراحة وكثافة الديربي من التأثيرات الصغيرة التي لا تزال تتراكم. تنتمي جودة الطقس ودرجة الملعب إلى مصطلح الخطأ ما لم يكن لديك ما يكفي من التطابقات الممطرة لتقديرها. اجعل النموذج الأساسي بسيطًا بما يكفي لشرحه. التعقيد الذي لا يمكن التحقق منه سوف يكذب عليك في النهاية.

لوحة نتائج المباراة في ملعب سابوتو، مونتريال (CC BY-SA 3.0 / ويكيميديا ​​كومنز)
لوحة نتائج المباراة في ملعب سابوتو، مونتريال (CC BY-SA 3.0 / ويكيميديا ​​كومنز)

يبدو خط الأنابيب العملي أقل رومانسية من الرسم التلفزيوني. اجمع المباريات النهائية مع التواريخ والفرق والأماكن والنتائج. حساب الهجوم المتداول وتقييمات الدفاع مع تسوس الوقت. امزج xG إذا نشر الدوري بيانات تسديد موثوقة. تحويل التقييمات إلى الأهداف المتوقعة للمباراة القادمة. بناء مصفوفة النتيجة. اقرأ 1X2، والإجماليات، وكلا الفريقين ليسجل. قارن هذه الاحتمالات بأسعار إغلاق السوق فقط للتحقق من سلامة الأمور، وليس كبديل لاحتمالاتك الخاصة. الأسواق حشود. غالبًا ما تكون الحشود حادة وبطيئة أحيانًا في الأخبار المتأخرة. عادةً ما تكون ميزتك، إذا كانت لديك واحدة، هي توقيت الإصابة الأفضل أو عامل المنزل الأنظف الخاص بالدوري. لا تتعامل أبدًا مع الفوز على أرضك بنسبة 55 بالمائة على أنه وعد. تعامل مع الأمر على أنه بيان بأن المنازل المماثلة تفوز بما يزيد قليلاً عن نصف الوقت. ينتمي تفكير التمويل إلى الرهان، وهو نظام منفصل عن التنبؤ. ينتهي التنبؤ عندما تكون الاحتمالات صادقة. لا تزال التوقعات الصادقة تفوت المفاجآت الشهيرة، لأن المفاجآت في الذيل. البطاقات الحمراء، ويانصيب ضربات الجزاء، والأهداف الخاصة في اللحظة الأخيرة تعيش في هذا الذيل. مقالة جيدة عن الأساليب يجب أن تقول هذا مرتين. التنبؤ الإحصائي ليس كرة بلورية. إنها خريطة للاحتمال النسبي. تساعدك الخرائط على تجنب خطأي المعجبين الشائعين. الخطأ الأول هو حداثة المسرح: الفوز بنتيجة 4-0 لا يجعل فريقًا في منتصف الجدول مرشحًا للفوز باللقب. الخطأ الثاني هو التقاط السرد: اسم النادي الشهير ليس تصنيفًا. ينبغي السماح للتقييمات بالانخفاض عندما تنخفض العروض. يمكن للنماذج الهرمية مشاركة القوة عبر الدوريات عندما تكون البيانات ضعيفة. يعد التحديث البايزي طريقة رسمية للبدء من نقطة سابقة والتحرك باستخدام الأدلة. لا تحتاج إلى درجة الدكتوراه لاستخدام هذه الفكرة. ابدأ بمتوسط ​​الأهداف المتوقعة في الدوري، ثم اسحب التقدير نحو المباريات الأخيرة للفريق. عينات صغيرة تتقلص نحو المتوسط. يُسمح للعينات الكبيرة أن تبدو متطرفة. هذا الانكماش يوفر عليك من المبالغة في رد الفعل تجاه خط ساخن من ثلاث مباريات. كما أنه يمنعك من دفن فريق صاعد حديثًا بعد هزيمتين أمام العمالقة. يبقى السياق هو الملك. يمكن أن تكون النتيجة 1-0 على أرضه أمام متصدر الدوري إشارة أقوى من الفوز 3-0 أمام متذيل الترتيب. فارق الأهداف دون تعديل الخصم هو أداة فظة. إن فارق الأهداف المعدل من قبل الخصم أقرب إلى ما يحاول بواسون وإيلو بالفعل التقاطه.

زينيت ضد سبارتاك، الدوري الروسي الممتاز، 2 مارس 2024 (CC BY-SA 3.0 / ويكيميديا ​​كومنز)
زينيت ضد سبارتاك، الدوري الروسي الممتاز، 2 مارس 2024 (CC BY-SA 3.0 / ويكيميديا ​​كومنز)

إذًا كيف ينبغي للقارئ أن يستخدم هذه الأساليب فعليًا قبل البداية؟ أولا، اكتب السؤال بالأرقام. هل تريد 1X2 على الأرجح، أو توزيع النتائج، أو فقط ما إذا كان كلا الفريقين يسجلان؟ ثانيًا، قم بجمع آخر ثلاثين إلى خمسين مباراة ذات صلة لكل جانب، وليس العناوين الثلاثة الأخيرة. ثالثًا، التكيف مع ميزة اللعب على أرضه، والتي في معظم الدوريات لا تزال تضيف بضعة أعشار من الهدف. رابعًا، خصم المباريات الودية ومواجهات الكأس غير المتطابقة إلا إذا كنت تفتقر إلى بيانات الدوري. خامسًا، قم بتطبيق تصحيح أسلوب ديكسون كولز إذا كنت تهتم بالنتائج 0-0 و1-1. سادسا، قم بتحويل الشبكة إلى الاحتمالات التي ستناقشها فعليا. سابعا: التحقق من سلامة اللاعبين من الإصابات والإيقافات والتناوب الواضح. ثامنا، ارفض تقريب نسبة 47% إلى شيء مؤكد. تاسعا، احتفظ بسجل لاحتمالاتك والنتائج الحقيقية. عاشرًا، قم بمراجعة المعايرة كل شهر بدلاً من تذكر عطلات نهاية الأسبوع التي كنت تبدو فيها ذكيًا فقط. توجد صفحات إحصائية على طراز FootballAlarm لأن القيام بذلك يدويًا لكل دوري أمر ممل. الأتمتة لا تحل محل الحكم. فهو يحل محل أخطاء النسخ واللصق. لا يزال الحكم يقرر ما إذا كان المهاجم الموقع حديثًا ضمن أحد عشر فريقًا أم لا. لا يزال الحكم يقرر ما إذا كانت الملعب المشبع بالمياه يغير قيمة التسديد. ثم يمتص النموذج تلك المكالمات كمدخلات متغيرة، وليس كمشاعر. المشاعر ليست وسيلة. الأساليب تنجو من الإحراج لأنها يمكن تدقيقها. تتضمن مسارات التدقيق نموذج البيانات ومعلمة الاضمحلال والعامل الرئيسي الذي استخدمته. إذا لم تتمكن من ذكر هذه الثلاثة، فليس لديك بعد توقعات إحصائية. لديك رأي ترتدي زي جدول البيانات. الآراء يمكن أن تكون صحيحة. تحاول الأساليب الإحصائية أن تكون صحيحة لسبب سيظل ساريًا يوم السبت المقبل. سيحتوي يوم السبت القادم على نتيجة واحدة على الأقل تسمى الشبكة غير محتملة. هذا ليس الفشل. هذه هي كرة القدم. كرة القدم هي السبب وراء تصميمنا للأعداد بدلاً من التظاهر بأن المباريات عبارة عن رمي العملات المعدنية مع الشعارات الشهيرة. تقلب العملة تتجاهل الهجوم والدفاع. بواسون لا. XG لا. إيلو لا. استخدمها مع التواضع. التواضع هو آخر أسلوب إحصائي، والمشجعون يتخطونه. لا تخطي ذلك. التنبؤ والتسجيل والمراجعة. إذن شاهدي المباراة على أي حال، لأن الجمال لم يكن أبدًا بنسبة 38 بالمائة. الجمال هو الكرة، والخطأ، والرقم الذي حاول تحذيرك مسبقًا.

وبالتالي فإن مدة توقع المباراة هي حلقة وليست عنوانًا رئيسيًا. جمع وتقييم والمشروع والنتيجة والتعلم. بواسون يمنحك لغة الهدف. يقوم ديكسون كولز بإصلاح الدرجات الهادئة. يخبرك xG بالفرص الحقيقية. يحتفظ Elo بقوة الجري التي لا داعي للذعر كل يوم اثنين. تظل ميزة المنزل حقيقة تجريبية عنيدة. إن تسوس الوقت يبقي النموذج مستيقظًا. المعايرة تحافظ على صدق العارض. لا شيء من هذا يزيل الدراما من تسعين دقيقة. إنه يسعر الدراما فقط. دراما التسعير هي الطريقة التي يتحدث بها المحللون عندما يرفضون التخمين. التخمين رخيص. التقدير هو العمل. يبدو العمل وكأنه لوحة نتائج قد تقرأ 2-1 قبل خمس دقائق متبقية بينما تحتوي شبكة ما قبل المباراة على 1-1 كوضع. كلاهما يمكن أن يكون صحيحا. الوضع ليس أمرا. الوضع هو ذروة التوزيع. التوزيعات هي بيت القصيد من التنبؤ المطابقة الإحصائية. إذا كنت تتذكر جملة واحدة فقط، فتذكر ذلك. والنتيجة هي عينة. الطريقة هي التوزيع. إن الأساليب التي تنشر درجة واحدة فقط بدون احتمالات تخفي عدم اليقين. عدم اليقين هو المنتج. انشرها. ومن ثم يمكن للقارئ أن يقرر المعنى الحقيقي لـ 40 بالمائة من المنزل. يعني أربع مباريات متشابهة في عشر، وليس كأسًا محفورًا بالفعل. النقش يحدث بعد صافرة الحكم. الإحصائيات تحدث من قبل. قبل هو المكان الذي تعيش فيه هذه المقالة. بعد ذلك يتم تحديث الجدول. بينهما توجد الحرفة الصادقة الوحيدة التي لدينا للإجابة على الكيفية التي قد تنتهي بها المباراة. قد ينتهي الأمر باعتباره المفضل. ربما لا. الأرقام أخبرتك بالانقسام. هذا الانقسام هو التنبؤ. كل شيء آخر هو المسرح. المسرح مسموح. المسرح ليس وسيلة. الطريقة هنا، في مائتي جملة، بحيث تواجه المباراة التالية شبكة بدلاً من الإشاعة. استخدم الشبكة. احترم الذيل. استمتع بالمباراة.

تعد جداول الدوري مؤشرات متخلفة مقارنة بـ xG المتداول. غالبًا ما يتفوق النادي الذي تمت ترقيته حديثًا على سابقاته المتشائمة المبكرة. غالبًا ما يكون أداء البطل الذي يمر بمرحلة انتقالية أقل من أداء القادة المتفائلين الأوائل. يستحق المتخصصون في الركلات الثابتة نتوءًا هجوميًا منفصلاً صغيرًا. تعترف فرق الضغط العالي بفرص الانتقال التي قد يضيعها بواسون في التسديدات إذا كانت بيانات التسديدة غير مكتملة. جودة حارس المرمى تنتمي إلى تصنيف الدفاع، وليس إلى الهالة الغامضة. معدلات العقوبات صاخبة. لا تقم بإعادة بناء نموذج بعد ركلة جزاء واحدة. ترددات البطاقة الحمراء مزعجة أيضًا ويجب أن يتم تصنيفها على أساس الدوري. تمزج مسابقات الكأس بين الدوافع التي تلتقطها نماذج الدوري جزئيًا فقط. تعمل الفترات الدولية على إعادة ضبط إيقاع النادي وتضخيم فرص التعادل قليلاً لبعض فرق منتصف الجدول. تحتاج بطولات الدوري للسيدات وبطولات الرجال إلى ملفات معلمات منفصلة. يعد نسخ ميزة الدوري الإنجليزي الممتاز على أرضه إلى قسم آخر خطأً صامتًا شائعًا. قم بتقدير ميزة المنزل داخل الدوري الذي تتوقعه. لقد غيرت النقاط الثلاث للفوز الحوافز تاريخياً، لذا لا ينبغي لنا أن نجمع بيانات ما قبل التسعينيات بشكل أعمى. تغييرات القواعد مثل خمسة تبديلات تؤدي أيضًا إلى تغيير معدلات الأهداف في وقت متأخر من المباراة. تتبع تحولات النظام تلك وإلا فإن أوزانك المتحللة ستحارب الماضي. البيانات المفتوحة من StatsBomb والمشاريع المماثلة جعلت xG قابلة للتكرار للهواة. إن إمكانية التكاثر أكثر قيمة من الخلطة السرية التي لا يمكن لأحد التحقق منها. إذا اختلف النموذجان، قم بفحص المدخلات قبل حساب متوسط ​​المخرجات. يمكن أن تساعد النماذج المعايرة المتوسطة؛ نادرا ما يساعد متوسط ​​القصص. يحتاج الدوري المليء بالتعادل إلى كثافة ديكسون كولز مختلفة عن الدوري الذي يسجل أهدافًا عالية. الملاعب الاسكندنافية في بداية الموسم ليست في أغسطس في إسبانيا. الجغرافيا ليست قدراً، بل هي متغير مشترك. يعد السفر عبر المناطق الزمنية في الكؤوس القارية متغيرًا حقيقيًا للتعب. غالبًا ما تؤدي المباريات الأوروبية في منتصف الأسبوع إلى قمع كثافة الدوري في نهاية الأسبوع. تجعل سياسات التناوب للفرق الكبيرة من التشكيلات المكونة من أحد عشر اسمًا مدخلاً مطلوبًا.

Uncategorized

सांख्यिकीय तरीकों से मिलान परिणामों की भविष्यवाणी कैसे करें

आप सांख्यिकीय तरीकों से मैच परिणाम की भविष्यवाणी कैसे करते हैं? ईमानदार उत्तर संभावनाओं से शुरू होता है, भविष्यवाणी से नहीं। फ़ुटबॉल उच्च भिन्नता वाला कम स्कोर वाला खेल है, इसलिए एकल स्कोरलाइन कभी भी निश्चित नहीं होती है। एक अच्छा मॉडल यह अनुमान लगाता है कि कई समान मैचों में प्रत्येक परिणाम कितनी बार होना चाहिए। घरेलू जीत, ड्रा और दूर जीत संभावनाओं का क्लासिक 1X2 बाजार बनाते हैं। कुल योग के ऊपर और नीचे, दोनों टीमों द्वारा स्कोर किया जाना, और सटीक स्कोर एक ही लक्ष्य प्रक्रिया के अन्य दृश्य हैं। लक्ष्यों के लिए सबसे पुराना व्यावहारिक इंजन पॉइसन मॉडल है। माइकल माहेर के 1982 के काम में प्रत्येक टीम के स्कोरिंग को आक्रमण दर और रक्षा दर के साथ गिनती प्रक्रिया के रूप में माना गया। आप हाल के मैचों से उन दरों का अनुमान लगाते हैं, फिर घरेलू-लाभ कारक जोड़ते हैं। पॉइसन फॉर्मूला तब शून्य, एक, दो या अधिक लक्ष्यों का मौका देता है। दो स्वतंत्र पॉइसन्स को मिलाने से 0-0 से 5-4 और उससे आगे तक स्कोर ग्रिड तैयार होता है। उन कक्षों का योग जहां घरेलू टीम अधिक स्कोर करती है, घरेलू जीत की संभावना पैदा करती है। विकर्ण का योग करने पर ड्रा प्राप्त होता है। शेष द्रव्यमान दूर की जीत है। डिक्सन और कोल्स ने बाद में दिखाया कि 0-0 और 1-1 सामान्य पॉइसन की अपेक्षा से अधिक बार घटित होते हैं। उनका समायोजन उन कम-स्कोर कोशिकाओं को फुलाता है और दूसरों को थोड़ा सा ख़राब करता है। समय का क्षय मायने रखता है क्योंकि पिछले महीने का फॉर्म दस महीने पहले के मैच की तुलना में अधिक जानकारीपूर्ण है। घातीय भार इतिहास को नजरअंदाज किए बिना हाल के खेलों को अधिक आवाज देते हैं। जब टीमें विभिन्न प्रतियोगिताओं में मिलती हैं तो लीग की ताकत भी मायने रखती है। शीर्ष रक्षापंक्ति के विरुद्ध किया गया गोल, किसी पिछड़ी हुई टीम के विरुद्ध किए गए गोल के समान प्रमाण नहीं है। एलो जैसी रेटिंग्स जीत-हार-ड्रा इतिहास को एक एकल ताकत संख्या में बदल देती हैं जो हर मैच के बाद अपडेट होती है। फीफा रैंकिंग उसी विचार का सार्वजनिक चचेरा भाई है, हालांकि वे धीमी और अधिक राजनीतिक हैं। क्लब मॉडल आमतौर पर सप्ताहांत लीग फिक्स्चर के लिए राष्ट्रीय रैंकिंग को हरा देते हैं क्योंकि वे अधिक डेटा देखते हैं। डेटा गुणवत्ता एक शांत बाधा है। गुम चोटें, गलत कोडित लाल कार्ड, और विलंबित लाइनअप सुरुचिपूर्ण गणित को विषाक्त कर देंगे। स्वच्छ फिक्स्चर, स्वच्छ स्कोर और घर की स्पष्ट परिभाषा से शुरुआत करें। फिर आंकड़े बोल सकते हैं.

प्रीमियर लीग मैच लाइनअप - मैनचेस्टर सिटी बनाम बर्नले, 31 जनवरी 2024 (CC0 / विकिमीडिया कॉमन्स)
प्रीमियर लीग मैच लाइनअप – मैनचेस्टर सिटी बनाम बर्नले, 31 जनवरी 2024 (CC0 / विकिमीडिया कॉमन्स)

अपेक्षित लक्ष्यों ने बातचीत बदल दी क्योंकि शॉट बराबर नहीं हैं। छह मीटर से प्रवेश करना भीड़ में तीस मीटर की ड्राइव नहीं है। xG मॉडल प्रत्येक शॉट को स्थान, सहायता प्रकार और कभी-कभी डिफेंडर घनत्व के आधार पर एक ऐतिहासिक रूपांतरण संभावना प्रदान करते हैं। एक मैच में शॉट की गुणवत्ता का सारांश यह अनुमान लगाता है कि एक टीम कितने गोल की हकदार है। एक सीज़न में, xG पक्ष और विपक्ष कच्चे लक्ष्यों की तुलना में अधिक स्थिर होते हैं, जो पोस्ट और गोलकीपरों पर स्विंग करते हैं। पॉइसन-शैली मॉडल में हमले और रक्षा इनपुट के रूप में xG का उपयोग करने से अक्सर अंशांकन में सुधार होता है। फिर भी, xG जादू नहीं है. एक सप्ताहांत में नमूना आकार छोटा है। मॉडल गलत हुए बिना एक टीम 2.4 xG पोस्ट कर सकती है और 1-0 से हार सकती है। मॉडल ने कहा कि संभावनाएं बनीं। मैच में कहा गया कि फिनिशिंग और सेव ने हस्तक्षेप किया। वह अंतर भिन्नता है, संख्याओं को त्यागने का कारण नहीं। कब्ज़ा, बॉक्स में पास, और दबाव की तीव्रता संदर्भ जोड़ती है लेकिन एक ही हमलावर कहानी को दोगुना कर सकती है। फ़ीचर चयन में उन वेरिएबल्स को प्राथमिकता दी जानी चाहिए जो भविष्य के लक्ष्यों की भविष्यवाणी करते हैं, न कि वेरिएबल्स जो केवल अंतिम प्रसारण का वर्णन करते हैं। पिछले सीज़न पर क्रॉस-वैलिडेशन चुनने का वयस्क तरीका है। पहले के वर्षों में प्रशिक्षण लें, बाद के वर्ष में परीक्षण करें और इन-सैंपल फिट का जश्न मनाने से इनकार करें। बैरियर स्कोर और लॉग हानि अति आत्मविश्वास वाली संभावनाओं को दंडित करती है। सर्वाधिक संभावित स्कोर की सटीकता| एक वैनिटी मीट्रिक है क्योंकि 1-1 और 1-0 संभाव्यता द्रव्यमान साझा करते हैं। एक मॉडल जो कहता है कि 38 प्रतिशत घर, 28 प्रतिशत ड्रा, 34 प्रतिशत दूर, तब भी उत्कृष्ट हो सकता है जब दूर की टीम जीतती है। सवाल यह है कि क्या 34 प्रतिशत दूर की जीत वास्तव में लगभग एक तिहाई समय तक पहुंचती है। अंशांकन प्लॉट उस प्रश्न का उत्तर देते हैं। तीक्ष्णता दूसरी धुरी है: एक मॉडल जो हमेशा 33-33-33 कहता है वह कैलिब्रेटेड और बेकार है। आप ऐसी संभावनाएँ चाहते हैं जो सबूत बढ़ने पर चलती हैं। शुरुआती स्ट्राइकर की चोटों से आक्रमण की दर कम होनी चाहिए। भीड़भाड़ वाले मध्य सप्ताह में रोटेशन और देर से लक्ष्यों की संभावना थोड़ी बढ़ जानी चाहिए। यात्रा की दूरी, आराम के दिन और डर्बी की तीव्रता ऐसे छोटे प्रभाव हैं जो अभी भी बढ़ते हैं। मौसम और पिच की गुणवत्ता त्रुटि शब्द में आती है जब तक कि आपके पास उनका अनुमान लगाने के लिए पर्याप्त बारिश वाले मैच न हों। मुख्य मॉडल को समझाने के लिए पर्याप्त सरल रखें। जिस जटिलता की जाँच नहीं की जा सकती वह अंततः आपसे झूठ बोलेगी।

स्टेड सैपुटो, मॉन्ट्रियल में मैच स्कोरबोर्ड (CC BY-SA 3.0 / विकिमीडिया कॉमन्स)
स्टेड सैपुटो, मॉन्ट्रियल में मैच स्कोरबोर्ड (CC BY-SA 3.0 / विकिमीडिया कॉमन्स)

एक व्यावहारिक पाइपलाइन एक टेलीविज़न ग्राफ़िक की तुलना में कम रोमांटिक लगती है। तिथियों, टीमों, स्थानों और स्कोर के साथ समाप्त मैच एकत्र करें। समय क्षय के साथ रोलिंग आक्रमण और रक्षा रेटिंग की गणना करें। यदि लीग विश्वसनीय शॉट डेटा प्रकाशित करता है तो xG में ब्लेंड करें। रेटिंग को अगले मैच के लिए अपेक्षित लक्ष्यों में बदलें। स्कोर मैट्रिक्स बनाएं. 1X2, कुल और दोनों टीमों का स्कोर पढ़ें। उन संभावनाओं की तुलना बाज़ार की समापन कीमतों के साथ केवल विवेक जांच के रूप में करें, अपनी संभावना के विकल्प के रूप में नहीं। बाज़ारों में भीड़ है. देर से आने वाली ख़बरों पर भीड़ अक्सर तेज़ और कभी-कभी धीमी हो जाती है। आपकी बढ़त, यदि आपके पास एक है, आमतौर पर बेहतर चोट समय या एक क्लीनर लीग-विशिष्ट घरेलू कारक है। 55 प्रतिशत घरेलू जीत को कभी भी एक वादे के रूप में न लें। इसे एक कथन के रूप में मानें कि समान घर आधे से अधिक समय जीतते हैं। बैंकरोल सोच सट्टेबाजी से संबंधित है, जो पूर्वानुमान से एक अलग अनुशासन है। संभावनाएँ ईमानदार होने पर पूर्वानुमान समाप्त हो जाता है। ईमानदार पूर्वानुमान अभी भी प्रसिद्ध उथल-पुथल से चूक जाते हैं, क्योंकि उथल-पुथल पूंछ में होती है। लाल कार्ड, पेनल्टी लॉटरी और आखिरी मिनट में खुद के गोल उस पूंछ में रहते हैं। तरीकों के बारे में एक अच्छे लेख में इसे दो बार अवश्य कहा जाना चाहिए। सांख्यिकीय भविष्यवाणी कोई क्रिस्टल बॉल नहीं है. यह सापेक्ष संभावना का मानचित्र है। मानचित्र आपको दो सामान्य प्रशंसक त्रुटियों से बचने में मदद करते हैं। पहली गलती रीसेंसी थियेटर है: एक 4-0 की जीत मिड-टेबल टीम को खिताब की पसंदीदा नहीं बनाती है। दूसरी त्रुटि नैरेटिव कैप्चर है: एक प्रसिद्ध क्लब का नाम कोई रेटिंग नहीं है। जब प्रदर्शन गिरे तो रेटिंग भी गिरने देना चाहिए। डेटा कम होने पर पदानुक्रमित मॉडल लीगों में ताकत साझा कर सकते हैं। बायेसियन अद्यतनीकरण पूर्व से शुरू करने और साक्ष्य के साथ आगे बढ़ने का एक औपचारिक तरीका है। इस विचार का उपयोग करने के लिए आपको पीएचडी की आवश्यकता नहीं है। लीग-औसत अपेक्षित लक्ष्यों से प्रारंभ करें, फिर अनुमान को टीम के हाल के मैचों की ओर खींचें। छोटे नमूने माध्य की ओर सिकुड़ते हैं। बड़े नमूनों को चरम दिखने की अनुमति है। वह सिकुड़न आपको तीन मैचों की हॉट स्ट्रीक पर अति प्रतिक्रिया करने से बचाती है। यह आपको दिग्गजों के खिलाफ दो हार के बाद एक नई पदोन्नत टीम को खत्म करने से भी रोकता है। प्रसंग राजा रहता है. लीग लीडर के विरुद्ध घरेलू मैदान पर 1-0 निचले क्लब के विरुद्ध 3-0 से अधिक मजबूत संकेत हो सकता है। प्रतिद्वंद्वी के समायोजन के बिना गोल अंतर एक कुंद उपकरण है। प्रतिद्वंद्वी-समायोजित गोल अंतर पॉइसन और एलो पहले से ही हासिल करने की कोशिश के करीब है।

जेनिट बनाम स्पार्टक, रूसी प्रीमियर लीग, 2 मार्च 2024 (सीसी बाय-एसए 3.0 / विकिमीडिया कॉमन्स)
जेनिट बनाम स्पार्टक, रूसी प्रीमियर लीग, 2 मार्च 2024 (सीसी बाय-एसए 3.0 / विकिमीडिया कॉमन्स)

तो एक पाठक को वास्तव में किकऑफ़ से पहले इन तरीकों का उपयोग कैसे करना चाहिए? सबसे पहले, प्रश्न को संख्याओं में लिखें। क्या आप सर्वाधिक संभावित 1X2, स्कोर वितरण चाहते हैं, या केवल दोनों टीमें स्कोर चाहती हैं? दूसरा, प्रत्येक पक्ष के लिए पिछले तीस से पचास प्रासंगिक मैचों को इकट्ठा करें, न कि अंतिम तीन सुर्खियाँ। तीसरा, घरेलू लाभ के लिए समायोजन करें, जो अधिकांश लीगों में अभी भी लक्ष्य का कुछ दसवां हिस्सा जोड़ता है। चौथा, डिस्काउंट फ्रेंडली और बेमेल कप टाई, जब तक कि आपके पास लीग डेटा की कमी न हो। पांचवां, यदि आप 0-0 और 1-1 की परवाह करते हैं तो डिक्सन-कोल्स शैली सुधार लागू करें। छठा, ग्रिड को उन संभावनाओं में परिवर्तित करें जिन पर आप वास्तव में चर्चा करेंगे। सातवां, चोटों, निलंबन और स्पष्ट रोटेशन के खिलाफ विवेक-जांच। आठवां, 47 प्रतिशत को एक निश्चित चीज़ में बदलने से इनकार करें। नौवां, अपनी संभावनाओं और वास्तविक परिणामों का एक लॉग रखें। दसवां, केवल उन सप्ताहांतों को याद करने के बजाय हर महीने अंशांकन की समीक्षा करें जिनमें आप चतुर दिखते थे। फ़ुटबॉलअलार्म-शैली के सांख्यिकीय पृष्ठ मौजूद हैं क्योंकि प्रत्येक लीग के लिए इसे हाथ से करना कठिन है। स्वचालन निर्णय का स्थान नहीं लेता. यह कॉपी-पेस्ट त्रुटियों को प्रतिस्थापित करता है। निर्णय अभी भी तय करता है कि नया हस्ताक्षरित स्ट्राइकर ग्यारह में है या नहीं। निर्णय अभी भी यह तय करता है कि क्या जलजमाव वाली पिच शूटिंग मूल्य को बदलती है या नहीं। मॉडल तब उन कॉलों को बदले हुए इनपुट के रूप में अवशोषित करता है, वाइब्स के रूप में नहीं। वाइब्स कोई विधि नहीं है. तरीके शर्मिंदगी से बचे रहते हैं क्योंकि उनका ऑडिट किया जा सकता है। ऑडिट ट्रेल्स में डेटा विंटेज, क्षय पैरामीटर और आपके द्वारा उपयोग किया गया होम फैक्टर शामिल है। यदि आप उन तीनों को नहीं बता सकते हैं, तो आपके पास अभी तक कोई सांख्यिकीय पूर्वानुमान नहीं है। स्प्रेडशीट पोशाक पहनने पर आपकी एक राय है। राय सही हो सकती है. सांख्यिकीय विधियाँ किसी कारण से सही होने का प्रयास करती हैं जो अगले शनिवार को भी काम करेंगी। अगले शनिवार को ग्रिड में कम से कम एक स्कोर होगा जिसे असंभावित कहा जाएगा। वह असफलता नहीं है. वह फुटबॉल है. फुटबॉल यही कारण है कि हम मैचों का दिखावा करने के बजाय प्रसिद्ध लोगो के साथ सिक्के उछालते हैं। सिक्के की उछाल हमले और बचाव को नजरअंदाज करती है। पॉइसन नहीं करता. xG नहीं करता. एलो नहीं करता. इनका उपयोग विनम्रता के साथ मिलकर करें। विनम्रता अंतिम सांख्यिकीय पद्धति है, और जिसे प्रशंसक छोड़ देते हैं। इसे छोड़ें नहीं. भविष्यवाणी करें, रिकॉर्ड करें, संशोधित करें। फिर भी मैच देखें, क्योंकि सुंदरता कभी भी 38 प्रतिशत नहीं थी। सुंदरता गेंद, मिस और वह नंबर है जिसने आपको पहले से चेतावनी देने की कोशिश की।

इसलिए मैच की भविष्यवाणी का जीवन एक लूप है, कोई हेडलाइन नहीं। एकत्रित करें, रेट करें, प्रोजेक्ट करें, स्कोर करें और सीखें। पॉइसन आपको एक लक्ष्य भाषा देता है। डिक्सन-कोल्स शांत स्कोर की मरम्मत करता है। xG आपको बताता है कि कौन सी संभावनाएँ वास्तविक थीं। एलो एक चालू ताकत रखता है जो हर सोमवार को घबराता नहीं है। घरेलू लाभ एक जिद्दी अनुभवजन्य तथ्य बना हुआ है। समय का क्षय मॉडल को जागृत रखता है। अंशांकन मॉडेलर को ईमानदार रखता है। इनमें से कोई भी नब्बे मिनट से नाटक को नहीं हटाता। यह केवल नाटक की कीमत है। जब विश्लेषक अनुमान लगाने से इनकार करते हैं तो मूल्य निर्धारण नाटक इस प्रकार बात करते हैं। अनुमान लगाना सस्ता है. अनुमान लगाना काम है. कार्य एक स्कोरबोर्ड की तरह दिखता है जो पांच मिनट शेष रहने पर 2-1 पढ़ सकता है जबकि आपके प्री-मैच ग्रिड में मोड 1-1 था। दोनों सच हो सकते हैं. मोड कोई कमांड नहीं है. मोड वितरण का शिखर है। वितरण सांख्यिकीय मिलान भविष्यवाणी का संपूर्ण बिंदु हैं। यदि आपको केवल एक वाक्य याद है, तो उसे याद रखें। परिणाम एक नमूना है. एक विधि एक वितरण है. वे विधियाँ जो संभावनाओं के बिना केवल एक ही अंक प्रकाशित करती हैं, अपनी अनिश्चितता को छिपा रही हैं। अनिश्चितता उत्पाद है. इसे प्रकाशित करें. तब पाठक यह तय कर सकते हैं कि 40 प्रतिशत घर का वास्तव में क्या मतलब है। इसका मतलब है कि दस में से चार समान मैच, न कि पहले से ही उकेरी गई कोई ट्रॉफी। सीटी बजने के बाद उत्कीर्णन होता है। आंकड़े पहले भी होते हैं. पहले वह जगह है जहां यह लेख रहता है। उसके बाद तालिका अद्यतन की जाती है। उनके बीच हमारे पास एकमात्र ईमानदार शिल्प है जो यह उत्तर दे सकता है कि मैच कैसे समाप्त हो सकता है। यह पसंदीदा के रूप में समाप्त हो सकता है। यह नहीं हो सकता है. संख्याओं ने आपको विभाजन बता दिया। वह विभाजन भविष्यवाणी है. बाकी सब थिएटर है. थिएटर की अनुमति है. थिएटर कोई विधा नहीं है. विधि यहाँ है, दो सौ वाक्यों में, ताकि अगले फिक्स्चर का सामना अफवाह के बजाय ग्रिड से हो। ग्रिड का प्रयोग करें. पूंछ का सम्मान करें. मैच का आनंद लीजिये.

लीग तालिकाएँ रोलिंग xG की तुलना में पिछड़ने वाले संकेतक हैं। एक नया पदोन्नत क्लब अक्सर शुरुआती निराशावादी पूर्ववर्तियों से बेहतर प्रदर्शन करता है। परिवर्तन में एक चैंपियन अक्सर शुरुआती आशावादी पूर्ववर्तियों से कमज़ोर प्रदर्शन करता है। सेट-पीस विशेषज्ञ एक छोटे से अलग हमलावर बम्प के पात्र हैं। हाई-प्रेस टीमें संक्रमण की संभावनाओं को स्वीकार करती हैं कि यदि शॉट डेटा अधूरा है तो पॉइसन शॉट चूक सकते हैं। गोलकीपर की गुणवत्ता रक्षा रेटिंग में होती है, रहस्यवादी आभा में नहीं। जुर्माने की दरें शोर-शराबे वाली हैं; एक स्पॉट किक के बाद मॉडल का पुनर्निर्माण न करें। रेड-कार्ड आवृत्तियाँ भी शोर करती हैं और उन्हें लीग-बेस-रेटेड होना चाहिए। कप प्रतियोगिताएं उन प्रेरणाओं को मिश्रित करती हैं जिन्हें लीग मॉडल केवल आंशिक रूप से ही पकड़ पाते हैं। अंतर्राष्ट्रीय ब्रेक से क्लब की लय पुनः निर्धारित होती है और कुछ मिड-टेबल पक्षों के लिए अवसरों में थोड़ी बढ़ोतरी होती है। महिला लीग और पुरुष लीग को अलग-अलग पैरामीटर फ़ाइलों की आवश्यकता है। प्रीमियर लीग के घरेलू लाभ को दूसरे डिवीजन में कॉपी करना एक सामान्य मूक त्रुटि है। आप जिस लीग का अनुमान लगा रहे हैं, उसके अंदर घरेलू लाभ का अनुमान लगाएं। एक जीत के लिए तीन अंक ऐतिहासिक रूप से प्रोत्साहन को बदल देते हैं, इसलिए 1990 के दशक से पहले के डेटा को आँख बंद करके एकत्रित न करें। पांच प्रतिस्थापन जैसे नियम परिवर्तन भी देर से खेल लक्ष्य दरों को बदलते हैं। उन शासन परिवर्तनों को ट्रैक करें या आपका क्षय भार अतीत से लड़ेगा। स्टैट्सबॉम्ब और इसी तरह की परियोजनाओं के खुले डेटा ने xG को शौकीनों के लिए प्रतिलिपि प्रस्तुत करने योग्य बना दिया। प्रतिलिपि प्रस्तुत करने योग्यता उस गुप्त सॉस से अधिक मूल्यवान है जिसे कोई जाँच नहीं सकता। यदि दो मॉडल असहमत हैं, तो आउटपुट का औसत निकालने से पहले इनपुट का निरीक्षण करें। औसत कैलिब्रेटेड मॉडल मदद कर सकते हैं; औसत कहानियाँ शायद ही कभी मदद करती हैं। एक ड्रॉ-हेवी लीग को उच्च स्कोरिंग लीग की तुलना में एक अलग डिक्सन-कोल्स तीव्रता की आवश्यकता होती है। स्कैंडिनेवियाई शुरुआती सीज़न की पिचें स्पेन में अगस्त में नहीं हैं। भूगोल नियति नहीं है, बल्कि सहवर्ती है। कॉन्टिनेंटल कप में समय क्षेत्रों में यात्रा करना एक वास्तविक थकान कारक है। मध्य सप्ताह के यूरोपीय मैच अक्सर सप्ताहांत लीग की तीव्रता को दबा देते हैं। बड़े दस्तों की रोटेशन नीतियां ग्यारह-नाम लाइनअप को एक आवश्यक इनपुट बनाती हैं।

Uncategorized

如何用统计方法预测比赛结果

如何用统计方法预测比赛结果?诚实的答案从概率开始,而不是预言。足球是一项低得分、高方差的运动,因此单一的得分永远不是确定的。一个好的模型可以估计许多相似比赛中每个结果发生的频率。主队获胜、平局和客队获胜形成了经典的 1X2 市场可能性。总分大小、两支球队得分以及准确得分只是同一进球过程的不同观点。最古老的实用引擎是泊松目标模型。 Michael Maher 1982 年的工作将每支球队的得分视为一个包含进攻率和防守率的计数过程。您根据最近的比赛估算这些比率,然后添加主场优势因素。泊松公式给出了零个、一个、两个或多个进球的机会。结合两个独立的泊松分布可产生从 0-0 到 5-4 及以上的得分网格。将主队得分较高的单元格相加即可得出主队获胜的概率。将对角线求和即可得出平局。剩下的质量就是客场获胜。迪克森和科尔斯后来证明,0-0 和 1-1 发生的频率比普通泊松预期的要高。他们的调整会夸大那些低分的单元格,并稍微缩小其他的单元格。时间衰减很重要,因为上个月的比赛比十个月前的比赛信息更丰富。指数权重赋予最近的游戏更多的发言权,同时又不会抛弃历史。当球队在不同的比赛中相遇时,联盟的实力也很重要。对阵顶级防守球队的进球与对阵降级球队的进球并不相同。 Elo 等评级将胜负平局历史记录转化为每场比赛后更新的单一实力数字。国际足联排名是同一想法的公开表亲,尽管它们速度较慢且更具政治性。俱乐部模型通常会在周末联赛中击败全国排名,因为他们看到更多数据。数据质量是安静的瓶颈。缺席的伤病、错误的红牌编码以及延迟的阵容都会毒害优雅的数学。从干净的赛程、干净的分数和清晰的主场定义开始。那么统计数据就能说话。

英超联赛阵容——曼城 vs 伯恩利,2024 年 1 月 31 日(CC0 / Wikimedia Commons)
英超联赛阵容——曼城 vs 伯恩利,2024 年 1 月 31 日(CC0 / Wikimedia Commons)

预期进球改变了话题,因为射门次数并不相等。从六米处点击进入并不等同于驱车三十米进入人群。 xG 模型根据位置、助攻类型(有时还包括防守者密度)为每次投篮分配历史转换概率。总结一场比赛的射门质量可以估算一支球队应得的进球数。在一个赛季中,目标进球数和目标进球数比原始进球更稳定,后者会在门柱和守门员上摆动。在泊松型模型中使用 xG 作为攻击和防御输入通常可以改善校准。不过,xG 并不是魔法。单个周末的样本量很小。一支球队可以发布 2.4 xG 并以 1-0 输掉比赛,而模型不会出错。该模型表示,机会是创造出来的。比赛称终结和扑救介入。这种差距是方差,而不是放弃数字的理由。控球、传球到禁区和压迫强度增加了背景,但可能会重复计算相同的进攻故事。特征选择应该更喜欢预测未来目标的变量,而不是仅仅描述最后一次广播的变量。对过去几季的交叉验证是成人的选择方式。前几年进行训练,后一年进行测试,并拒绝庆祝样本内的拟合度。 Brier 分数和对数损失会惩罚过度自信的概率。最有可能得分的准确性|是一个虚荣度量,因为 1-1 和 1-0 共享概率质量。即使客队获胜,主场胜率 38%、平局 28%、客场 34% 的模型也非常出色。问题是 34% 的客场胜利是否真的达到了三分之一的概率。校准图回答了这个问题。清晰度是另一个轴:总是显示 33-33-33 的模型已校准且无用。你希望概率随着证据的变化而变化。首发前锋受伤会降低攻击率。周中的拥挤应该会稍微增加轮换和后期进球的机会。旅行距离、休息天数和德比强度都是很小的影响,但它们仍然会累积起来。天气和球场质量属于误差项,除非您有足够多的下雨比赛来估计它们。保持核心模型足够简单以便于解释。无法检查的复杂性最终会欺骗你。

蒙特利尔萨普托体育场的比赛记分牌(CC BY-SA 3.0 / Wikimedia Commons)
蒙特利尔萨普托体育场的比赛记分牌(CC BY-SA 3.0 / Wikimedia Commons)

实用的管道看起来没有电视图片那么浪漫。收集已完成的比赛,包括日期、球队、场地和比分。计算随时间衰减的滚动攻击和防御等级。如果联盟发布可靠的投篮数据,请加入 xG。将评分转换为下一场比赛的预期进球。构建得分矩阵。读出 1X2、总计和两队得分。将这些概率与收盘市价进行比较只是为了进行合理性检查,而不是替代您自己的可能性。市场里人头攒动。人群对最新消息的反应通常很敏锐,有时也很缓慢。你的优势,如果你有的话,通常是更好的伤停时机或者更干净的联赛特定主场因素。永远不要将 55% 的主场胜利视为承诺。将其视为类似房屋胜出率略高于一半的声明。资金思维属于博彩,它是与预测不同的学科。当概率真实时,预测结束。诚实的预测仍然会错过著名的冷门,因为冷门就在尾部。红牌、点球抽签和最后一刻的乌龙球都存在于这条尾巴中。一篇关于方法的好文章必须说两遍。统计预测不是水晶球。它是相对可能性的地图。地图可以帮助您避免两种常见的粉丝错误。第一个错误是近因剧:4-0 的胜利并不能使积分榜中游的球队成为夺冠热门。第二个错误是叙事捕捉:著名的俱乐部名称不是评级。当表演下降时,应该允许收视率下降。当数据稀少时,分层模型可以在各个联盟之间共享优势。贝叶斯更新是一种从先验开始并根据证据进行移动的正式方法。你不需要博士学位就可以使用这个想法。从联赛平均预期进球开始,然后根据球队最近的比赛进行估算。小样本向平均值收缩。大样本可以显得极端。这种收缩可以让你避免对三连胜反应过度。它还可以防止你在两次输给豪门后埋葬升班马。背景仍然是王道。主场 1-0 对阵联赛领头羊可能比 3-0 对阵排名垫底的俱乐部发出更强烈的信号。没有对手调整的净胜球是一个钝器。对手调整后的净胜球更接近泊松和埃洛已经试图捕捉到的目标。

泽尼特 vs 斯巴达克,俄罗斯超级联赛,2024 年 3 月 2 日(CC BY-SA 3.0 / Wikimedia Commons)
泽尼特 vs 斯巴达克,俄罗斯超级联赛,2024 年 3 月 2 日(CC BY-SA 3.0 / Wikimedia Commons)

那么读者在开始之前应该如何实际使用这些方法呢?首先,用数字写下问题。您想要最有可能的 1X2、得分分布,还是只想要两支球队都得分?其次,收集双方最近三十到五十场相关比赛,而不是最后三个头条新闻。第三,根据主场优势进行调整,在大多数联赛中,主场优势仍然会增加零点几球。第四,除非您缺乏联赛数据,否则请折扣友谊赛和不匹配的杯赛。第五,如果您关心 0-0 和 1-1,请应用 Dixon-Coles 风格校正。第六,将网格转换为您将实际讨论的概率。第七,针对伤病、停赛和明显轮换进行健全检查。第八,拒绝将 47% 化为确定的事情。第九,记录你的概率和真实结果。第十,每个月检查一次校准,而不是只记住你看起来聪明的周末。 FootballAlarm 风格的统计页面之所以存在,是因为为每个联赛手动执行此操作非常乏味。自动化并不能取代判断。它取代了复制粘贴错误。判断仍然决定新签下的前锋是否能进入十一人。判断仍然决定了浸水的球场是否会改变投篮价值。然后,模型将这些调用吸收为更改后的输入,而不是振动。共鸣不是一种方法。方法可以避免尴尬,因为它们可以被审计。审计跟踪包括数据年份、衰减参数和您使用的家庭因素。如果您无法说出这三项,则您还没有统计预测。您穿着电子表格服装有意见。意见可以是对的。统计方法试图做到正确,其原因在下周六仍然有效。下周六将至少包含一个被网格认为不太可能的分数。那不是失败。那就是足球。足球是我们对计数进行建模而不是假装比赛是带有著名徽标的抛硬​​币的原因。抛硬币无视攻击和防御。泊松则不然。 xG 没有。埃洛没有。谦虚地使用它们。谦逊是最后一种统计方法,也是粉丝们跳过的一种。不要跳过它。预测、记录、修改。无论如何,还是看比赛吧,因为美丽从来都不是那 38%。美丽的是球,错过了,以及试图提前警告你的号码。

因此,比赛预测的生命周期是一个循环,而不是一个标题。收集、评分、项目、评分和学习。泊松给你一个目标语言。迪克森-科尔斯修复了安静的乐谱。 xG 告诉您哪些机会是真实的。 Elo每周一都保持着不慌不忙的跑步实力。主场优势仍然是一个顽固的经验事实。时间衰减使模型保持清醒。校准使建模者保持诚实。所有这些都无法消除九十分钟的戏剧性。它只为戏剧定价。定价戏剧是分析师拒绝猜测时的谈话方式。猜测很便宜。估算是工作。 Work 看起来就像一个记分牌,在还剩 5 分钟时可能会显示 2-1,而赛前网格的模式为 1-1。两者都可以是真的。该模式不是命令。众数是分布的峰值。分布是统计匹配预测的重点。如果你只记得一句话,请记住它。结果是一个样本。方法是一种分布。只发布单个分数而没有概率的方法隐藏了它们的不确定性。不确定性就是产品。发布它。然后读者可以决定 40% 的家庭真正意味着什么。这意味着十场比赛中有四场类似的比赛,而不是已经刻好的奖杯。雕刻发生在哨声之后。统计数据发生在之前。之前是本文所在的地方。之后是更新表的地方。在他们之间,有我们唯一诚实的技巧来回答比赛可能如何结束。它可能会成为最受欢迎的。可能不会。数字告诉你分裂的情况。这种分裂就是预测。其他一切都是戏剧。允许剧院。戏剧不是一种方法。方法就在这里,两百句话,让下一场比赛面对的是网格,而不是谣言。使用网格。尊重尾巴。享受比赛吧。

与滚动预期目标相比,联赛表是滞后指标。新晋级的俱乐部通常会比早期悲观的俱乐部表现更好。转型中的冠军往往表现不如早期乐观的先辈。定位球专家应该得到一个小的单独的进攻冲击。高压力球队承认,如果投篮数据不完整,泊松投篮可能会错过转换机会。守门员的品质属于防守等级,而不是神秘光环。罚款率很吵;点球后不要重建模型。红牌频率也很嘈杂,应该是基于联盟的评级。杯赛混合了联赛模型仅部分捕捉到的动机。国际比赛日重置了俱乐部的节奏,并略微增加了一些中游球队的平局机会。女子联赛和男子联赛需要单独的参数文件。将英超联赛的主场优势复制到另一个联赛是一个常见的无声错误。估计您预测的联赛中的主场优势。一场胜利三分改变了历史上的激励措施,因此不要盲目汇总 20 世纪 90 年代之前的数据。诸如五次换人之类的规则变化也会改变比赛后期的进球率。跟踪这些政权的转变,否则你的衰变权重将与过去作斗争。来自 StatsBomb 和类似项目的开放数据使业余爱好者可以重现 xG。可重复性比无人能检验的秘密更有价值。如果两个模型不一致,请在对输出进行平均之前检查输入。对校准模型进行平均会有所帮助;平均故事很少有帮助。平局较多的联赛需要与高得分联赛不同的迪克森-科尔斯强度。斯堪的纳维亚赛季初期的比赛并不是西班牙的八月。地理不是命运,但它是一个协变量。参加大陆杯跨越时区旅行是一个真正的疲劳变量。周中的欧洲比赛往往会压制周末联赛的强度。大球队的轮换政策使得十一人阵容成为必要的投入。