Suno Speech : le générateur de musique IA passe à la voix

Suno Speech : le générateur de musique IA passe à la voix

Suno s'est fait un nom avec ses chansons générées par IA. Sa dernière fonctionnalité fait entrer l'entreprise dans un format voisin : de l'audio parlé accompagné de sa propre bande sonore.

Le nouvel outil s'appelle Speech. Il produit simultanément une voix narrée et une musique de fond adaptée, puis livre le tout sous la forme d'une seule piste audio. Plus besoin d'enregistrer une voix off, de trouver un fond musical et de mixer les deux. Le modèle s'occupe de tout en une seule passe.

Comment fonctionne Speech

Le fonctionnement reprend le principe des prompts que les utilisateurs de Suno connaissent déjà :

  1. Partir d'un texte ou d'une idée. Les utilisateurs peuvent coller un script finalisé ou taper une idée approximative.
  2. Décrire la voix. Le prompt définit comment le narrateur doit sonner.
  3. Décrire la musique. Une seconde description fixe le style de l'accompagnement sonore.

Le modèle de Suno génère ensuite la voix et la musique ensemble. Le résultat est un fichier unique, et non des pistes séparées.

Suno propose quelques premiers cas d'usage : poèmes, méditations et histoires du soir. Ces formats reposent beaucoup sur l'ambiance. Une piste de méditation exige une voix calme et un fond sonore discret. Une histoire du soir demande de la chaleur et un bon rythme. Générer la voix et la musique conjointement doit permettre de les garder en accord.

Un test court, une bêta imparfaite

Selon Jack Brody, responsable produit de Suno, l'entreprise a fait tester Speech pendant un mois à un petit groupe d'utilisateurs avant le lancement plus large.

Suno reconnaît ouvertement que la bêta présente encore des problèmes. Son propre exemple concerne les accents : une voix censée sonner britannique peut parfois sortir avec un accent australien. L'erreur est minime, mais elle révèle un problème plus large du contrôle de la voix par prompt. Les utilisateurs décrivent ce qu'ils veulent avec des mots, et l'interprétation du modèle ne correspond pas toujours. Pour des projets amateurs, cela compte peu. Pour quiconque produit des contenus où une voix précise est importante, c'est une vraie limite.

La question des données d'entraînement

Suno n'a pas révélé comment il a entraîné le modèle de Speech. Ce silence pèse, compte tenu de la situation juridique de l'entreprise.

Les générateurs de musique par IA sont sous pression en raison de possibles violations du droit d'auteur, et Suno figure parmi les principales cibles. Des grandes maisons de disques ont déjà porté plainte contre la start-up. Plus récemment, un tribunal de Munich, en Allemagne, a tranché contre Suno. Le tribunal a rejeté le fair use comme justification de l'utilisation de données protégées. Le fair use est une doctrine du droit d'auteur américain que les entreprises d'IA invoquent souvent pour défendre l'entraînement sur des œuvres existantes. La décision de Munich montre que cet argument n'a pas tenu dans cette affaire.

Dans ce contexte, un nouveau modèle qui produit à la fois de la voix et de la musique soulève une question évidente : sur quels contenus audio a-t-il été entraîné ? Suno n'y a pas répondu. Pour les utilisateurs, cela laisse planer un doute sur le matériau à l'origine des pistes qu'ils génèrent.

Pourquoi c'est important

Speech laisse penser que Suno ne veut pas rester un simple générateur de chansons. L'audio parlé avec bande sonore ouvre la porte à un éventail plus large de contenus du quotidien, des pistes de relaxation aux courts textes narrés. Suno se rapproche ainsi des entreprises d'IA spécialisées dans la voix, un segment où l'intérêt des investisseurs semble fort, comme le montre ElevenLabs, qui double sa valorisation à 22 milliards de dollars. Dans le même temps, d'autres arrivent par la direction opposée, avec Stability AI qui se réoriente vers la musique. Les frontières entre génération de voix, de musique et d'audio en général semblent s'estomper.

L'approche combinée est l'aspect le plus intéressant. Beaucoup de créateurs assemblent encore narration et musique à la main. Si un seul prompt peut fournir un résultat exploitable, cela pourrait faire gagner du temps à ceux qui réalisent des contenus audio simples. Le bug des accents rappelle toutefois que le contrôle reste approximatif. Il faudra voir si Suno ajoute des réglages plus fins pour les voix, ou des pistes séparées pour la voix et la musique, à mesure que la bêta mûrit.

Le volet juridique pourrait peser plus lourd que le produit. Suno fait déjà face à des plaintes de maisons de disques et à une défaite judiciaire en Allemagne, et n'a rien dit des données d'entraînement de Speech. La transparence devrait donc rester un point sensible. Les lecteurs qui utilisent Suno pour autre chose que des expériences personnelles feraient bien de suivre l'évolution de ces affaires, et de voir si les tribunaux d'autres pays suivent le raisonnement de la décision de Munich sur le fair use.