Suno Speech: KI-Musikgenerator erzeugt nun auch Sprache
Suno hat sich mit KI-generierten Songs einen Namen gemacht. Die neueste Funktion führt das Unternehmen in ein benachbartes Format: gesprochene Audioinhalte samt eigenem Soundtrack.
Das neue Werkzeug heißt Speech. Es erzeugt gleichzeitig eine Erzählstimme und passende Hintergrundmusik und liefert beides als eine einzige Audiospur aus. Nutzer müssen weder einen Sprechertext aufnehmen noch eine Musikunterlegung suchen und beides abmischen. Das Modell erledigt alles in einem Durchgang.
So funktioniert Speech
Der Ablauf folgt dem Prompt-basierten Muster, das Suno-Nutzer bereits kennen:
- Mit einem Text oder einer Idee beginnen. Nutzer können ein fertiges Skript einfügen oder ein grobes Konzept eintippen.
- Die Stimme beschreiben. Der Prompt legt fest, wie der Erzähler klingen soll.
- Die Musik beschreiben. Eine zweite Beschreibung bestimmt den Stil der begleitenden Klänge.
Sunos Modell erzeugt Stimme und Musik dann gemeinsam. Das Ergebnis ist eine kombinierte Datei, keine getrennten Einzelspuren.
Suno nennt einige erste Einsatzmöglichkeiten: Gedichte, Meditationen und Gutenachtgeschichten. Bei diesen Formaten kommt es stark auf die Stimmung an. Ein Meditationstrack braucht eine ruhige Stimme und unaufdringliche Klänge darunter. Eine Gutenachtgeschichte braucht Wärme und das richtige Tempo. Indem Stimme und Musik gemeinsam erzeugt werden, sollen beide aufeinander abgestimmt bleiben.
Ein kurzer Test, eine unfertige Beta
Laut Jack Brody, Produktchef bei Suno, hat das Unternehmen Speech vor der breiteren Veröffentlichung einen Monat lang mit einer kleinen Gruppe von Testern erprobt.
Suno räumt offen ein, dass die Beta noch Probleme hat. Das eigene Beispiel sind Akzente: Eine Stimme, die laut Prompt britisch klingen soll, klingt manchmal australisch. Das ist ein kleiner Fehler, verweist aber auf ein grundsätzlicheres Problem bei der Stimmsteuerung per Prompt. Nutzer beschreiben in Worten, was sie wollen, und die Interpretation des Modells trifft das nicht immer. Bei Hobbyprojekten spielt das vielleicht keine große Rolle. Wer Inhalte produziert, bei denen es auf eine bestimmte Stimme ankommt, stößt hier jedoch an eine echte Grenze.
Die Frage nach den Trainingsdaten
Suno hat nicht offengelegt, wie das Speech-Modell trainiert wurde. Dieses Schweigen ist wegen der rechtlichen Lage des Unternehmens von Bedeutung.
KI-Musikgeneratoren stehen wegen möglicher Urheberrechtsverletzungen unter Druck, und Suno ist eines der Hauptziele. Große Plattenfirmen haben bereits Klagen gegen das Start-up eingereicht. Zuletzt hat ein Gericht in Munich, Germany, gegen Suno entschieden. Das Gericht ließ Fair Use als Rechtfertigung für die Nutzung urheberrechtlich geschützter Daten nicht gelten. Fair Use ist ein Grundsatz aus dem US-Urheberrecht, auf den sich KI-Unternehmen häufig berufen, wenn sie das Training mit bestehenden Werken verteidigen. Das Münchner Urteil zeigt, dass dieses Argument in diesem Fall nicht verfangen hat.
Vor diesem Hintergrund drängt sich bei einem neuen Modell, das sowohl Stimme als auch Musik erzeugt, eine naheliegende Frage auf: Mit welchem Audiomaterial wurde es trainiert? Suno hat darauf keine Antwort gegeben. Für Nutzer bleibt damit eine gewisse Unsicherheit über das Material, das hinter den von ihnen erzeugten Tracks steckt.
Warum das wichtig ist
Speech deutet darauf hin, dass Suno nicht nur ein Song-Generator bleiben will. Gesprochene Audioinhalte mit Soundtrack öffnen die Tür zu einem breiteren Spektrum alltäglicher Inhalte, von Entspannungstracks bis zu kurzen erzählten Stücken. Damit rückt Suno näher an KI-Unternehmen heran, die sich auf Stimmen konzentrieren, ein Segment, in dem das Interesse von Investoren groß zu sein scheint, wie die Verdopplung der Bewertung von ElevenLabs auf 22 Mrd. Dollar zeigt. Gleichzeitig drängen andere aus der entgegengesetzten Richtung in den Markt, etwa Stability AI mit seiner Neuausrichtung auf Musik. Die Grenzen zwischen Stimm-, Musik- und allgemeiner Audiogenerierung scheinen zu verschwimmen.
Spannend ist vor allem der kombinierte Ansatz. Viele Kreative fügen Erzählung und Musik immer noch von Hand zusammen. Wenn ein einziger Prompt ein brauchbares Ergebnis liefert, könnte das Menschen, die einfache Audioinhalte erstellen, Zeit sparen. Der Akzent-Fehler erinnert allerdings daran, dass die Steuerung noch grob ist. Es lohnt sich zu beobachten, ob Suno im Laufe der Beta feinere Einstellungen für Stimmen oder getrennte Spuren für Stimme und Musik nachliefert.
Die rechtliche Seite könnte schwerer wiegen als die Produktseite. Suno sieht sich bereits Klagen von Plattenfirmen und einer Niederlage vor Gericht in Deutschland gegenüber und hat sich zu den Trainingsdaten von Speech nicht geäußert. Das spricht dafür, dass Transparenz ein wunder Punkt bleiben wird. Wer Suno für mehr als private Experimente nutzt, sollte im Blick behalten, wie sich diese Verfahren entwickeln und ob Gerichte in anderen Ländern der Argumentation des Münchner Urteils zu Fair Use folgen.
