Negativa resultat och publiceringsbias
Kunna värdera negativa resultat och förstå varför publicerade siffror är skeva.
Förkunskaper
- FMultipla jämförelserkrävs
Intuition
Hundra grupper testar samma idé. Fem får positiva resultat (varav några av slump). De fem publicerar. De 95 lägger ner.
Litteraturen visar nu att idén fungerar. Det är publiceringsbias, och den gör publicerade effektstorlekar systematiskt överskattade.
I ML förstärks det av två saker till:
- Benchmark-jakt: bara resultat som slår SOTA publiceras, oavsett hur många varianter som provades.
- Reproduktioner belönas inte: att visa att något inte håller ger sällan publicering.
Följden är att ett publicerat resultat ska betraktas som en hypotes tills det replikerats oberoende.
Formellt
Ett användbart negativt resultat skiljer sig från «det funkade inte». Det måste svara på tre frågor:
- Var det rätt implementerat? Sanity checks: reproducerar du originalets resultat på originalets uppgift? Om inte är ditt negativa resultat om din implementation, inte om metoden.
- Hade experimentet kraft nog? Med tre frön och σ = 1 % kan du inte upptäcka en effekt på 0,5 %. «Ingen effekt» och «för svagt experiment» är olika slutsatser.
- Vad var omfånget? Metoden fungerade inte på din data, i din skala, med dina hyperparametrar. Det är ofta ett helt legitimt och värdefullt resultat — men det ska stå.
Formulering som håller:
«Vi kunde inte reproducera den rapporterade vinsten av X på vår domän (svensk juridisk text, 40 k exempel, 5 frön). Skillnaden mot baslinjen var +0,2 pe [−0,9; 1,3]. Vi reproducerade originalets resultat på deras dataset (+3,1 pe), vilket talar för att implementationen är korrekt och att effekten är domänspecifik.»
Den meningen är mer användbar än de flesta positiva resultat, eftersom den sparar tid för alla som övervägde samma sak.
Internt är det ännu viktigare: ett team som bara dokumenterar det som fungerade kommer att prova samma misslyckade idé igen om ett år. Journalen (nod experimentlogg) är platsen där negativa resultat betalar sig.
Behärskning innebär
- Värderar negativa resultat korrekt
- Förklarar publiceringsbias och dess följder
- Rapporterar egna negativa resultat användbart
Logga in för att göra övningarna och bygga upp din behärskning.
Källor
- arXiv — Show Your Work: Improved Reporting of Experimental Results — arXiv (öppen åtkomst; licens per artikel)
- ML Reproducibility Challenge — fri läsning