Normalfördelningen och standardisering
Kunna standardisera värden (z-poäng) och läsa av sannolikheter i normalfördelningen.
Öva i Mattegrafen ↗ · Matematik 2cÖva i Mattegrafen ↗ · Normalfördelningen och dess egenskaperFörkunskaper
- DSannolikhetsfördelningarkrävs
Intuition
Normalfördelningen: symmetrisk klocka kring μ, bredd σ. 68–95–99,7: 68 % av värdena inom ±1σ, 95 % inom ±2σ, 99,7 % inom ±3σ.
z-poäng = (x − μ)/σ: hur många standardavvikelser från medel. z = 2 är ovanligt (topp 2,3 %), z = 0 helt genomsnittligt. Med z kan du jämföra äpplen och päron: 180 cm lång (z ≈ 1,2) mot 95 kg (z ≈ 2) — vikten är mer avvikande.
Centrala gränsvärdessatsen: medelvärdet av många oberoende värden blir normalfördelat oavsett ursprungsfördelning. Därför är normalen överallt — och därför är standardisering av features (z-poäng) ett standardsteg före träning.
Kod
import numpy as np
from scipy.stats import norm
mu, sigma = 170, 8
z = (186 - mu) / sigma # 2.0
print(norm.cdf(z)) # 0.977 — andel kortare än 186
print(1 - norm.cdf(z)) # 0.023 — andel längre
print(norm.ppf(0.95) * sigma + mu) # 183.2 — 95:e percentilen
# CGS i praktiken: medel av 30 tärningskast
rng = np.random.default_rng(0)
m = rng.integers(1, 7, size=(10_000, 30)).mean(axis=1)
print(round(m.mean(), 2), round(m.std(), 2)) # 3.5 0.31 ≈ 1.71/√30
Standardisera features: (X - X.mean(0)) / X.std(0) — beräknat på träningsdata.
Behärskning innebär
- Standardiserar värden till z-poäng
- Läser av sannolikheter med 68–95–99,7-regeln och tabell/kod
- Förklarar varför normalfördelningen dyker upp överallt (CGS)
Logga in för att göra övningarna och bygga upp din behärskning.
Källor
- Wikipedia — Normalfördelning (CC BY-SA 4.0) — CC BY-SA 4.0
- Wikipedia — Centrala gränsvärdessatsen (CC BY-SA 4.0) — CC BY-SA 4.0