Hoppa till innehållet
AI-grafen
F· AI engineeringljud-och-tal· ca 90 min· volatil — kontrolleras ofta· verifierad 2026-09-20

Musik- och ljudgenerering

Kunna förklara hur generativa ljudmodeller fungerar och deras licens- och upphovsrättsfrågor.

Förkunskaper

Intuition

Ljud är svårare att generera än bild av ett enkelt skäl: 44 100 sampel per sekund. Tre minuter musik är nästan åtta miljoner tal. Att generera dem ett i taget är hopplöst.

Lösningen är densamma som för bild: komprimera först, generera i det komprimerade rummet.

Två huvudspår:

AnsatsHurExempel
Ljudtokensen neural codec (EnCodec, SoundStream) komprimerar ljud till ~50 diskreta tokens per sekund; en transformer genererar tokens; codecen avkodar tillbakaMusicGen, AudioLM
Latent diffusionen autoencoder ger ett latent rum; diffusion genererar där; avkodaren ger vågformenStable Audio, AudioLDM

Båda är samma idé som i bildgenerering, med samma kompromiss: hårdare komprimering ger snabbare generering och sämre detaljer.

Det som är unikt svårt med musik: långsiktig struktur. En modell kan producera åtta sekunder som låter utmärkt och ändå sakna det som gör tre minuter till en låt — återkommande teman, uppbyggnad, upplösning.

Formellt

Residual vektorkvantisering (RVQ) är kärnan i ljudcodecs. En enda kodbok räcker inte för hög kvalitet, så flera läggs i lager: den första kvantiserar signalen grovt, den andra kvantiserar residualen, den tredje residualen av det, och så vidare. Med 8 kodböcker à 1 024 poster och 50 ramar per sekund blir det 400 tokens per sekund — hanterbart för en transformer, och skalbart: färre lager ger lägre bitrate och gradvis sämre kvalitet.

Utvärdering av genererat ljud:

MåttMäterSvaghet
FAD (Fréchet Audio Distance)avstånd mellan fördelningar av ljudembeddingarsäger inget om enskilda klipp
CLAP-poänghur väl ljudet matchar textpromptenärvt från en modell som själv kan ha fel
Lyssningstestkvalitet och musikalitetdyrt, men oersättligt
Memoreringskontrollnärmaste granne i träningsdatadet juridiskt viktigaste

Det juridiska läget — tre skilda frågor:

  1. Träningsdata. I EU gäller TDM-undantaget (DSM-direktivet art. 4) med möjlighet för rättighetshavaren att reservera sig. Musikbranschen har reserverat sig brett, och flera stora tvister pågår internationellt.
  2. Stil. En musikalisk stil är inte upphovsrättsligt skyddad. En melodi är. Gränsen prövas just nu.
  3. Utdata. Rent maskingenererad musik saknar sannolikt upphovsrättsligt skydd i EU, eftersom det krävs mänskligt skapande. Det är sällan vad användaren räknar med.

Praktiskt för den som använder verktygen: läs leverantörens villkor (de skiljer sig kraftigt i vad som får användas kommersiellt), kör memoreringskontroll om du publicerar, och var medveten om att du sannolikt inte äger resultatet ensam — eller alls.

Behärskning innebär

  • Förklarar ljudtokens och latent diffusion för ljud
  • Utvärderar genererat ljud
  • Resonerar om upphovsrätt till träningsdata och utdata

Logga in för att göra övningarna och bygga upp din behärskning.

Källor

Alla källor och licenser