Hoppa till innehållet
AI-grafen
E· Universitetetik-juridik-samhalle· ca 60 min· utvecklande· verifierad 2026-09-20

Upphovsrätt och träningsdata

Kunna resonera om text- och datautvinning, licenser och rättigheter för genererat material.

Förkunskaper

Intuition

Tre frågor som ofta blandas ihop:

  1. Får man träna på skyddat material?
  2. Vem äger det som modellen genererar?
  3. Vad händer om modellen reproducerar sin träningsdata?

Svaren skiljer sig mellan jurisdiktioner och är delvis oavgjorda i domstol. Men riktningen i EU är tydligare än på många andra håll.

Formellt

1. Träning på skyddat material — EU. DSM-direktivet (2019/790) artiklarna 3 och 4 ger undantag för text- och datautvinning (TDM). Artikel 3 gäller forskningsorganisationer och kulturarvsinstitutioner för vetenskapliga ändamål. Artikel 4 gäller alla andra, men rättighetshavaren kan reservera sig — och för innehåll online ska förbehållet göras maskinläsbart (i praktiken robots.txt eller metadata). Reserverar sig rättighetshavaren krävs licens.

I Sverige är detta genomfört i upphovsrättslagen. USA saknar motsvarande undantag och prövar i stället «fair use» från fall till fall — flera stora tvister pågår.

2. Äganderätt till genererat material. I EU och Sverige krävs mänskligt skapande för upphovsrätt. Rent maskingenererat material har sannolikt inget upphovsrättsligt skydd. Är mänsklig kreativ insats tillräckligt stor (urval, bearbetning, komposition) kan resultatet skyddas — men bara i den delen. USA:s Copyright Office har intagit samma linje.

Praktisk följd: en bild du genererat kan sannolikt användas av vem som helst. Det är sällan vad kunden tror.

3. Reproduktion av träningsdata. Om modellen matar ut något som i praktiken är en kopia av ett skyddat verk kan det vara intrång, oavsett hur det uppstod. Därför kör man memoreringskontroller: närmaste-granne-sökning i träningsdata, och filtrering av utdata mot kända verk.

I en träningspipeline innebär allt detta tre konkreta krav: registrera licens per källa, respektera maskinläsbara förbehåll vid insamling, och spara proveniens så att en källa kan tas bort i efterhand om rättsläget ändras. AI-grafens källregister med licens, fingeravtryck och omverifiering var 30:e dag är byggt för precis det.

Behärskning innebär

  • Resonerar om text- och datautvinning och dess undantag
  • Bedömer rättigheter för genererat material
  • Hanterar licenser i en träningspipeline

Logga in för att göra övningarna och bygga upp din behärskning.

Källor

Alla källor och licenser