Suno Speech: el generador musical con IA añade narración

Suno Speech: el generador musical con IA añade narración

Suno se hizo un nombre con las canciones generadas por IA. Su última función lleva a la empresa a un formato vecino: audio hablado que viene con su propia banda sonora.

La nueva herramienta se llama Speech. Crea una voz narrada y una música de fondo adecuada al mismo tiempo, y entrega ambas en una sola pista de audio. Los usuarios no tienen que grabar una locución, buscar una base musical y mezclar las dos. El modelo se encarga de todo de una sola vez.

Cómo funciona Speech

El flujo de trabajo sigue el esquema basado en instrucciones que los usuarios de Suno ya conocen:

  1. Empezar con un texto o una idea. Los usuarios pueden pegar un guion terminado o escribir un concepto aproximado.
  2. Describir la voz. La instrucción define cómo debe sonar el narrador.
  3. Describir la música. Una segunda descripción define el estilo del sonido que acompaña.

A continuación, el modelo de Suno genera la voz y la música juntas. El resultado es un único archivo combinado, no pistas separadas.

Suno propone algunos primeros usos: poemas, meditaciones y cuentos para dormir. Son formatos que dependen mucho del ambiente. Una pista de meditación necesita una voz tranquila y un sonido discreto por debajo. Un cuento para dormir necesita calidez y buen ritmo. Generar voz y música a la vez pretende que ambas vayan en sintonía.

Una prueba breve, una beta imperfecta

Según Jack Brody, director de producto de Suno, la empresa probó Speech con un pequeño grupo de usuarios durante un mes antes del lanzamiento más amplio.

Suno reconoce abiertamente que la beta todavía tiene problemas. Su propio ejemplo son los acentos: una voz a la que se le pide sonar británica a veces acaba sonando australiana. Es un fallo menor, pero apunta a un problema más amplio del control de voz mediante instrucciones. Los usuarios describen con palabras lo que quieren, y la interpretación del modelo no siempre coincide. Para proyectos de aficionados puede que no importe demasiado. Para quien produzca contenidos en los que una voz concreta sea importante, es una limitación real.

La cuestión de los datos de entrenamiento

Suno no ha revelado cómo entrenó el modelo de Speech. Ese silencio importa por la situación jurídica de la empresa.

Los generadores de música con IA están bajo presión por posibles infracciones de derechos de autor, y Suno es uno de los principales objetivos. Las grandes discográficas ya han presentado demandas contra la startup. Más recientemente, un tribunal de Munich, en Alemania, falló en contra de Suno. El tribunal rechazó el fair use como justificación para utilizar datos protegidos por derechos de autor. El fair use es una doctrina del derecho de autor estadounidense a la que las empresas de IA han recurrido a menudo para defender el entrenamiento con obras existentes. La sentencia de Munich demuestra que ese argumento no se sostuvo en este caso.

En este contexto, un nuevo modelo que produce tanto voz como música plantea una pregunta evidente: ¿con qué audio se ha entrenado? Suno no ha respondido. Para los usuarios, eso deja cierta incertidumbre sobre el material que hay detrás de las pistas que generan.

Por qué importa

Speech sugiere que Suno no quiere quedarse solo en generador de canciones. El audio hablado con banda sonora abre la puerta a un abanico más amplio de contenidos cotidianos, desde pistas de relajación hasta piezas narradas breves. Eso acerca a Suno a las empresas de IA centradas en la voz, un segmento en el que el interés de los inversores parece fuerte, como demuestra que ElevenLabs haya duplicado su valoración hasta los 22.000 millones de dólares. Al mismo tiempo, otros llegan desde la dirección contraria, como Stability AI con su giro hacia la música. Las fronteras entre la generación de voz, de música y de audio en general parecen estar difuminándose.

Lo interesante es el enfoque combinado. Muchos creadores siguen uniendo narración y música a mano. Si una sola instrucción puede dar un resultado aprovechable, podría ahorrar tiempo a quienes hacen contenidos de audio sencillos. Aun así, el fallo de los acentos recuerda que el control sigue siendo tosco. Conviene estar atentos a si Suno añade ajustes más finos para las voces, o pistas separadas para voz y música, a medida que la beta madure.

El aspecto legal puede pesar más que el del producto. Suno ya se enfrenta a demandas de las discográficas y a una derrota judicial en Alemania, y no ha dicho nada sobre los datos de entrenamiento de Speech. Todo indica que la transparencia seguirá siendo un punto delicado. Los lectores que usen Suno para algo más que experimentos personales deberían seguir de cerca cómo evolucionan estos casos y si los tribunales de otros países siguen el razonamiento de la sentencia de Munich sobre el fair use.