E· Universitetvetenskaplig-metod· ca 60 min· grundläggande — ändras sällan· verifierad 2026-09-20
Vetenskaplig metod i AI
Kunna formulera en falsifierbar hypotes, designa ett kontrollerat experiment och rapportera osäkerhet.
Förkunskaper
Intuition
ML-forskning har ett reproducerbarhetsproblem: många rapporterade förbättringar försvinner när någon kör om med samma frön, samma baslinje-tuning och fler datamängder. Metoden som skyddar:
- Fråga → hypotes som kan falsifieras, skriven före experimentet.
- Kontroll: bara en sak ändras. Baslinjen får lika mycket hyperparameter-tuning som den nya metoden.
- Variation: minst 3–5 frön; rapportera medel ± std eller KI. Ett frö är en anekdot.
- Flera datamängder: en förbättring på en datamängd är ofta brus.
- Ablation: ta bort varje komponent — vilken gör jobbet?
- Rapportera negativa resultat och allt du provade, inte bara det som fungerade.
Vanliga fel: testset använt för val, baslinje undertunad, cherry-pickade frön, mått bytt i efterhand, «signifikant» utan intervall.
Interaktivt
Granska ett påstående: «Vår nya optimerare ger 1,2 pe bättre på CIFAR-10 än Adam.»
Frågor du ställer:
- Hur många frön? Vad är std mellan frön för Adam? (Ofta ~0,3–0,5 pe → 1,2 kan vara 2σ, kan vara brus.)
- Fick Adam samma lr-sökning?
- Hur valdes epoker/tidigt stopp — på test?
- Fungerar det på ImageNet, på text?
- Finns kod, frön och exakt konfiguration?
Om svaren saknas är påståendet inte fel — det är oprövat. Gör samma granskning av dina egna resultat innan du visar dem för någon.
Behärskning innebär
- Formulerar falsifierbar hypotes och kontrollerat experiment för en ML-fråga
- Rapporterar med osäkerhet, flera frön och baslinje
- Känner igen vanliga metodfel i ML-papper
Logga in för att göra övningarna och bygga upp din behärskning.
Källor
- arXiv — Deep Reinforcement Learning that Matters — arXiv (öppen åtkomst; licens per artikel)
- arXiv — Show Your Work: Improved Reporting of Experimental Results — arXiv (öppen åtkomst; licens per artikel)