Hoppa till innehållet
AI-grafen
D· AI-utvecklaredeep-learning· ca 45 min· grundläggande — ändras sällan· verifierad 2026-09-20

Gradient descent

Kunna utföra gradient descent-steg för hand på en enkel loss, förklara inlärningstaktens roll, och implementera loopen i några rader Python.

Förkunskaper

Intuition

Vi har en loss-funktion — felet som funktion av vikterna. Vi vill till botten. Gradient descent: räkna ut lutningen (gradienten) där vi står, ta ett litet steg mot lutningen, upprepa.

w ← w − η · L'(w)

η (eta) är inlärningstakten: steglängden. För liten och det tar evigheter. För stor och du hoppar över dalen och kan hamna högre upp än du började.

Kod

L(w) = (w − 3)², L'(w) = 2(w − 3). Start w = 0, η = 0,25:

stegwL'(w)nytt w
10−60 − 0,25·(−6) = 1,5
21,5−32,25
32,25−1,52,625

Närmar sig 3. I Python:

w, eta = 0.0, 0.25
for step in range(20):
    grad = 2 * (w - 3)
    w = w - eta * grad
print(w)   # ≈ 3.0

Med flera vikter är gradienten en vektor av partiella derivator — samma regel, komponent för komponent. Varianten stokastisk gradient descent (SGD) räknar gradienten på en liten batch exempel i taget, vilket är billigare och ofta bättre.

Behärskning innebär

  • Utför två uppdateringssteg för hand
  • Förklarar vad som händer vid för stor respektive för liten inlärningstakt

Logga in för att göra övningarna och bygga upp din behärskning.

Källor

Alla källor och licenser