Musik- och ljudgenerering
Kunna förklara hur generativa ljudmodeller fungerar och deras licens- och upphovsrättsfrågor.
Förkunskaper
- FDiffusionsmodellerkrävs
- FTalsyntes (TTS)krävs
Intuition
Ljud är svårare att generera än bild av ett enkelt skäl: 44 100 sampel per sekund. Tre minuter musik är nästan åtta miljoner tal. Att generera dem ett i taget är hopplöst.
Lösningen är densamma som för bild: komprimera först, generera i det komprimerade rummet.
Två huvudspår:
| Ansats | Hur | Exempel |
|---|---|---|
| Ljudtokens | en neural codec (EnCodec, SoundStream) komprimerar ljud till ~50 diskreta tokens per sekund; en transformer genererar tokens; codecen avkodar tillbaka | MusicGen, AudioLM |
| Latent diffusion | en autoencoder ger ett latent rum; diffusion genererar där; avkodaren ger vågformen | Stable Audio, AudioLDM |
Båda är samma idé som i bildgenerering, med samma kompromiss: hårdare komprimering ger snabbare generering och sämre detaljer.
Det som är unikt svårt med musik: långsiktig struktur. En modell kan producera åtta sekunder som låter utmärkt och ändå sakna det som gör tre minuter till en låt — återkommande teman, uppbyggnad, upplösning.
Formellt
Residual vektorkvantisering (RVQ) är kärnan i ljudcodecs. En enda kodbok räcker inte för hög kvalitet, så flera läggs i lager: den första kvantiserar signalen grovt, den andra kvantiserar residualen, den tredje residualen av det, och så vidare. Med 8 kodböcker à 1 024 poster och 50 ramar per sekund blir det 400 tokens per sekund — hanterbart för en transformer, och skalbart: färre lager ger lägre bitrate och gradvis sämre kvalitet.
Utvärdering av genererat ljud:
| Mått | Mäter | Svaghet |
|---|---|---|
| FAD (Fréchet Audio Distance) | avstånd mellan fördelningar av ljudembeddingar | säger inget om enskilda klipp |
| CLAP-poäng | hur väl ljudet matchar textprompten | ärvt från en modell som själv kan ha fel |
| Lyssningstest | kvalitet och musikalitet | dyrt, men oersättligt |
| Memoreringskontroll | närmaste granne i träningsdata | det juridiskt viktigaste |
Det juridiska läget — tre skilda frågor:
- Träningsdata. I EU gäller TDM-undantaget (DSM-direktivet art. 4) med möjlighet för rättighetshavaren att reservera sig. Musikbranschen har reserverat sig brett, och flera stora tvister pågår internationellt.
- Stil. En musikalisk stil är inte upphovsrättsligt skyddad. En melodi är. Gränsen prövas just nu.
- Utdata. Rent maskingenererad musik saknar sannolikt upphovsrättsligt skydd i EU, eftersom det krävs mänskligt skapande. Det är sällan vad användaren räknar med.
Praktiskt för den som använder verktygen: läs leverantörens villkor (de skiljer sig kraftigt i vad som får användas kommersiellt), kör memoreringskontroll om du publicerar, och var medveten om att du sannolikt inte äger resultatet ensam — eller alls.
Behärskning innebär
- Förklarar ljudtokens och latent diffusion för ljud
- Utvärderar genererat ljud
- Resonerar om upphovsrätt till träningsdata och utdata
Logga in för att göra övningarna och bygga upp din behärskning.
Källor
- arXiv — Simple and Controllable Music Generation (MusicGen) — arXiv (öppen åtkomst; licens per artikel)
- arXiv — High Fidelity Neural Audio Compression (EnCodec) — arXiv (öppen åtkomst; licens per artikel)
- DSM-direktivet (EU) 2019/790, art. 3–4 — EU-rättsakt