Suno Speech: AI-muziekgenerator voegt gesproken audio toe

Suno Speech: AI-muziekgenerator voegt gesproken audio toe

Suno heeft naam gemaakt met door AI gegenereerde nummers. Met de nieuwste functie stapt het bedrijf over naar een aanverwant formaat: gesproken audio met een eigen soundtrack.

De nieuwe tool heet Speech. Die maakt tegelijk een vertelstem en passende achtergrondmuziek en levert beide aan als één audiotrack. Gebruikers hoeven geen voice-over op te nemen, geen achtergrondmuziek te zoeken en de twee niet zelf te mixen. Het model doet dat allemaal in één keer.

Zo werkt Speech

De werkwijze volgt het vertrouwde patroon van Suno, waarbij alles via prompts verloopt:

  1. Begin met tekst of een idee. Gebruikers kunnen een afgewerkt script plakken of een ruw concept intypen.
  2. Beschrijf de stem. De prompt bepaalt hoe de verteller moet klinken.
  3. Beschrijf de muziek. Een tweede beschrijving bepaalt de stijl van het geluid eronder.

Het model van Suno genereert vervolgens stem en muziek samen. Het resultaat is één gecombineerd bestand, geen losse sporen.

Suno noemt een paar toepassingen om mee te beginnen: gedichten, meditaties en verhaaltjes voor het slapengaan. Bij die formats draait veel om sfeer. Een meditatietrack vraagt om een rustige stem met onopvallend geluid eronder. Een slaapverhaaltje vraagt om warmte en het juiste tempo. Door stem en muziek samen te genereren, moeten die twee goed op elkaar afgestemd blijven.

Korte test, onvolmaakte bèta

Volgens Jack Brody, productchef bij Suno, heeft het bedrijf Speech een maand lang getest met een kleine groep testers voordat de bredere lancering volgde.

Suno maakt er geen geheim van dat de bèta nog problemen heeft. Het bedrijf geeft zelf het voorbeeld van accenten: een stem die Brits moet klinken, kan soms Australisch uit de bus komen. Dat is een kleine fout, maar die wijst op een breder probleem met stemsturing via prompts. Gebruikers beschrijven in woorden wat ze willen, en de interpretatie van het model komt daar niet altijd mee overeen. Voor hobbyprojecten maakt dat misschien niet zoveel uit. Voor iedereen die content maakt waarbij een specifieke stem belangrijk is, is het een echte beperking.

De vraag naar trainingsdata

Suno heeft niet bekendgemaakt hoe het het Speech-model heeft getraind. Dat zwijgen is relevant gezien de juridische positie van het bedrijf.

AI-muziekgeneratoren liggen onder vuur vanwege mogelijke schending van auteursrechten, en Suno is een van de belangrijkste doelwitten. Grote platenlabels hebben al rechtszaken aangespannen tegen de start-up. Onlangs oordeelde bovendien een rechtbank in München, Duitsland, in het nadeel van Suno. De rechtbank verwierp fair use als rechtvaardiging voor het gebruik van auteursrechtelijk beschermde data. Fair use is een doctrine uit het Amerikaanse auteursrecht waar AI-bedrijven zich vaak op beroepen als ze het trainen op bestaande werken verdedigen. De uitspraak in München laat zien dat dat argument in deze zaak geen stand hield.

Tegen die achtergrond roept een nieuw model dat zowel stem als muziek produceert een voor de hand liggende vraag op: op welke audio is het getraind? Suno heeft die vraag niet beantwoord. Voor gebruikers blijft het daardoor enigszins onduidelijk welk materiaal achter de tracks zit die ze genereren.

Waarom dit ertoe doet

Speech doet vermoeden dat Suno niet alleen een generator voor nummers wil blijven. Gesproken audio met een soundtrack opent de deur naar een breder scala aan alledaagse content, van ontspanningstracks tot korte vertelde stukken. Daarmee schuift Suno op richting AI-bedrijven die zich op stemmen richten, een segment waar de belangstelling van investeerders groot lijkt, zo blijkt uit ElevenLabs, dat zijn waardering verdubbelde tot 22 miljard dollar. Tegelijk komen anderen vanuit de tegenovergestelde richting binnen, zoals Stability AI met zijn koerswijziging naar muziek. De grenzen tussen het genereren van stemmen, muziek en audio in het algemeen lijken te vervagen.

De gecombineerde aanpak is het interessante deel. Veel makers plakken vertelling en muziek nog altijd met de hand aan elkaar. Als één prompt een bruikbaar resultaat oplevert, kan dat tijd besparen voor mensen die eenvoudige audiocontent maken. De accentfout herinnert er wel aan dat de controle nog grof is. Het is de moeite waard om te volgen of Suno fijnere instellingen voor stemmen toevoegt, of aparte sporen voor stem en muziek, naarmate de bèta volwassener wordt.

De juridische kant weegt misschien zwaarder dan de productkant. Suno heeft al te maken met rechtszaken van labels en een verloren zaak in Duitsland, en heeft niets gezegd over de trainingsdata van Speech. Dat wijst erop dat transparantie een pijnpunt blijft. Lezers die Suno gebruiken voor meer dan persoonlijke experimenten doen er goed aan in de gaten te houden hoe deze zaken zich ontwikkelen, en of rechtbanken in andere landen de redenering van de uitspraak in München over fair use volgen.