Die meisten Text-to-Speech-APIs händigen dir ein Dropdown mit Preset-Stimmen aus und betrachten die Sache als erledigt. Qwen3 TTS geht weiter. Aufgebaut auf dem Qwen3-LLM-Backbone, bietet es drei unterschiedliche Modi: wähle eine Preset-Stimme für sofortige Ergebnisse, klone jede Stimme aus einem 10-Sekunden-Audiosample oder beschreibe eine komplett neue Stimme in einfachem Englisch und lass das Modell sie generieren.
Drei Wege, Sprache zu generieren
Jeder Modus bedient einen anderen Workflow. Hier der Vergleich:
| CustomVoice | VoiceClone | VoiceDesign | |
|---|---|---|---|
| Was du bereitstellst | Auswahl aus 9 Presets | Upload eines 5-15s-Audiosamples | Schreibe eine Textbeschreibung |
| Am besten für | Schnelle Integration, Produktions-Apps | Marken-Erzähler, deine eigene Stimme | Fiktive Charaktere, Prototyping |
| Konsistenz | Bei jedem Durchlauf identisch | Hoch (gleiche Referenz = gleiche Stimme) | Variabel (gleicher Prompt ≈ ähnliche Stimme) |
| API-Slug | Qwen3_TTS_12Hz_1_7B_CustomVoice |
Qwen3_TTS_12Hz_1_7B_Base |
Qwen3_TTS_12Hz_1_7B_VoiceDesign |
Preset-Stimmen mit CustomVoice
Der schnellste Weg zur Sprachausgabe. Wähle eine Stimme, übergib deinen Text, bekomme Audio zurück.
Qwen3 TTS bietet 9 Stimmen-Identitäten, jede verfügbar über 10 Sprachen: Englisch, Chinesisch, Japanisch, Koreanisch, Deutsch, Französisch, Russisch, Portugiesisch, Spanisch und Italienisch. Das herausragende Feature ist die sprachübergreifende Konsistenz – Eric klingt wie Eric, ob er Englisch, Deutsch oder Japanisch spricht. Gleiche Klangfarbe, angemessener Akzent für jede Sprache.
| Stimme | Geschlecht | Charakter | Gut für |
|---|---|---|---|
| Vivian | W | Warm, konversationell | Assistenten, IVR |
| Serena | W | Elegant, ruhig | Hörbücher, Erzählung |
| Ono_Anna | W | Jugendlich, klar | Produktvideos, Tutorials |
| Sohee | W | Weich, sanft | Kinderinhalte, Meditation |
| Eric | M | Standard, geschäftsmäßig | Corporate, Podcasts |
| Dylan | M | Jung, energisch | Werbespots, Social Media |
| Ryan | M | Locker, konversationell | Podcasts, Erklärvideos |
| Aiden | M | Jung, leicht | Tutorials, Apps |
| Uncle_Fu | M | Reif, warm | Storytelling, Mentoring |
Eine Ausnahme: Ryan ist auf Chinesisch nicht verfügbar. Jede andere Stimme funktioniert über alle 10 Sprachen.
Das LLM-Backbone verleiht CustomVoice einen Vorteil gegenüber traditionellen TTS-Engines bei der Prosodie. Eine rhetorische Frage bekommt eine andere Intonation als eine Feststellung, und das Modell behandelt Pausen um Gedankenstriche und Auslassungspunkte natürlich. Nutze Zeichensetzung als dein primäres Tempo-Werkzeug – Punkte für volle Stopps, Kommas für Atemzüge, … für Spannung.
Klone jede Stimme mit VoiceClone
VoiceClone nimmt ein kurzes Audiosample und reproduziert diese Stimme auf jedem Text, den du bereitstellst. Das Modell übernimmt Klangfarbe, Tempo, Akzent und emotionalen Stil aus der Referenz – alles ohne Feintuning oder Training.
Die herausragende Fähigkeit ist sprachübergreifendes Klonen. Nimm ein 10-Sekunden-Englisch-Sample auf, und die geklonte Stimme kann alle 10 unterstützten Sprachen sprechen, während sie ihre Identität behält. Eine einzige Aufnahme treibt dein gesamtes mehrsprachiges Produkt.
Bereite dein Referenz-Audio vor
Die Klonqualität hängt zu etwa 70 % von der Referenz und zu 30 % von deinem Text ab. Ein paar Minuten in eine gute Aufnahme zu investieren, zahlt sich über jede Generierung aus.
Länge: 8-12 Sekunden sind der Sweet Spot. Unter 5 Sekunden füllt das Modell Lücken mit Raterei. Über 15 Sekunden bringen abnehmende Erträge.
Qualität: Nimm in einem ruhigen Raum mit einem vernünftigen Mikrofon auf. Hintergrundrauschen, Hall und Echo werden mit der Stimme geklont. Ein USB-Kondensatormikrofon in einem behandelten Raum schlägt eine Handy-Aufnahme im Café jedes Mal.
Inhalt: Ein Sprecher, durchgehende Sprache, keine langen Pausen. Eine Referenz mit variierter Prosodie – Fragen, Feststellungen, Kommas, Punkte – gibt dem Modell mehr Informationen darüber, wie der Sprecher natürlich klingt.
Stil-Abgleich: Das Modell klont emotionalen Stil neben der Klangfarbe. Eine ruhige, gemessene Referenz produziert ruhigen Output, selbst wenn dein Text Ausrufezeichen hat. Nimm deine Referenz in der Stimmung auf, die der Output tragen soll.
VoiceClone funktioniert gut für Marken-Erzählung, automatisierte Podcast-Intros in deiner eigenen Stimme und mehrsprachiges Marketing, bei dem du einen konsistenten Sprecher über jeden Markt hinweg willst. Ein Wort zur Ethik: Jemandes Stimme ohne dessen Zustimmung zu klonen, ist in vielen Rechtsräumen illegal, inklusive nach dem EU AI Act. Klone nur Stimmen, die dir gehören oder für die du eine Nutzungserlaubnis hast.
Eine Stimme aus Worten entwerfen mit VoiceDesign
VoiceDesign verfolgt den entgegengesetzten Ansatz zu VoiceClone. Anstatt ein Audiosample bereitzustellen, beschreibst du die gewünschte Stimme in einfachem Text, und das Modell generiert einen passenden Sprecher von Grund auf.
Die Beschreibung (in der API instruct genannt) funktioniert über acht Dimensionen: Geschlecht, Alter, Tonhöhe, Tempo, Emotion, Akzent, Klangfarbe und Persönlichkeit. Je spezifischer deine Beschreibung, desto konsistenter der Output zwischen Durchläufen. „Weibliche Stimme“ lässt enormen Raum für Interpretation. „Britisch weiblich, 30er, Mezzosopran, warm, leichter RP-Akzent, weiche Klangfarbe, Hörbuch-Erzähler-Energie“ verengt den Raum dramatisch.
Drei Beispiele, die die Bandbreite demonstrieren:
Hörbuch-Erzähler: British male, 70s, warm and authoritative, low-medium pitch, measured pace, rich timbre, documentary-style gravitas, slight RP accent.
Werbe-Voiceover: American male, early 30s, high energy, bright timbre, medium-high pitch, fast pace, confident announcer voice.
Charakterstimme: Elderly woman, 80s, raspy and mischievous, medium-low pitch, slow deliberate pace, slight Eastern European accent, gravelly timbre, fairy tale witch energy.
Das Modell versteht Archetyp-Referenzen wie „BBC-Dokumentationserzähler“ oder „Spät-Radio-DJ“ und übersetzt sie in stimmliche Eigenschaften. Vermeide es, spezifische reale Personen zu nennen – bleib bei Rollen und Archetypen.
VoiceDesign glänzt bei Charakter-Dialog in Spielen und Hörspielen, beim Prototyping von Markenstimmen vor der Talent-Buchung und in jeder Situation, in der du eine spezifische stimmliche Qualität brauchst, aber keine Aufnahme zum Klonen hast. Betrachte es als Casting – generiere 5-10 Varianten, wähle die beste aus, speichere den exakten Prompt für Konsistenz über dein Projekt hinweg.
Ein wichtiger Unterschied zu den anderen Modi: VoiceDesign ist nicht deterministisch. Dieselbe Beschreibung produziert ähnliche, aber nicht identische Stimmen über Durchläufe hinweg. Für die Produktion finde eine Stimme, die dir gefällt, und verwende dann diesen exakten Prompt-Text durchgehend in deinem Projekt.
Text schreiben, der richtig klingt
Alle drei Modi teilen sich dieselben Text-Behandlungsregeln, verwurzelt im Qwen3-LLM-Backbone.
Zeichensetzung steuert das Tempo. Punkte erzeugen volle Pausen. Kommas fügen kurze Atemzüge hinzu. Gedankenstriche erzeugen dramatisches Innehalten. Auslassungspunkte bauen Spannung auf. Das sind keine Vorschläge – sie sind das primäre Werkzeug, um zu formen, wie dein Audio klingt.
GROSSBUCHSTABEN setzen sparsam Nachdruck. I said NO. betont „NO“ natürlich. Aber I AM SO EXCITED ABOUT THIS liest sich als Schreien. Beschränke GROSSBUCHSTABEN auf ein oder zwei Worte pro Absatz.
Passe deinen Textstil an deine Stimme an. Eine Corporate-Erzählerstimme gepaart mit lockerem Slang („Yo, was geht“) klingt dissonant. Eine verspielte Podcast-Stimme, die Haftungsausschlüsse liest, klingt genauso falsch. Stimme und Worte müssen zusammengehören.
Halte Durchläufe zwischen 500 und 1.500 Zeichen. Das Modell verarbeitet bis zu 5.000, aber die Prosodie bleibt im mittleren Bereich am natürlichsten. Für längere Inhalte teile in Segmente auf und verkette das Audio.
Für Chinesisch und Japanisch verwende vollbreite Zeichensetzung. 。,?! statt .,?! – das Modell wurde auf vollbreite Zeichen für CJK-Text trainiert.
