FilmoTvor.AI
Torna alle guide

Audio

Qwen3 TTS: voci preset, clonazione voce e voice design

8 min di letturaLa maggior parte delle API TTS ti consegna un menu a tendina di voci preset e chiude lì. Qwen3 TTS va oltre — voci preset, clonazione da un campione e design di una voce da una descrizione testuale.

La maggior parte delle API text-to-speech ti consegna un menu a tendina di voci predefinite e chiude lì l'argomento. Qwen3 TTS va oltre. Costruito sul backbone LLM di Qwen3, offre tre modalità distinte: scegli una voce predefinita per risultati immediati, clona qualunque voce da un campione audio di 10 secondi, oppure descrivi una voce completamente nuova in inglese semplice e lascia che il modello la generi.

Tre modi per generare parlato

Ogni modalità serve a un workflow diverso. Ecco come si confrontano:

CustomVoice VoiceClone VoiceDesign
Cosa fornisci Scegli tra 9 predefinite Carichi un campione audio di 5-15s Scrivi una descrizione testuale
Ideale per Integrazione rapida, app di produzione Narratore di brand, la tua stessa voce Personaggi di finzione, prototipazione
Coerenza Identica a ogni esecuzione Alta (stesso riferimento = stessa voce) Variabile (stesso prompt ≈ voce simile)
Slug API Qwen3_TTS_12Hz_1_7B_CustomVoice Qwen3_TTS_12Hz_1_7B_Base Qwen3_TTS_12Hz_1_7B_VoiceDesign

Voci predefinite con CustomVoice

Il percorso più veloce per il parlato. Scegli una voce, passi il tuo testo, ricevi l'audio.

Qwen3 TTS offre 9 identità vocali, ciascuna disponibile in 10 lingue: inglese, cinese, giapponese, coreano, tedesco, francese, russo, portoghese, spagnolo e italiano. La funzione distintiva è la coerenza tra le lingue – Eric suona come Eric sia che parli inglese, tedesco o giapponese. Stesso timbro, accento appropriato per ogni lingua.

Voce Genere Carattere Adatta a
Vivian F Calda, conversazionale Assistenti, IVR
Serena F Elegante, calma Audiolibri, narrazione
Ono_Anna F Giovanile, limpida Video di prodotto, tutorial
Sohee F Morbida, delicata Contenuti per bambini, meditazione
Eric M Standard, in stile business Corporate, podcast
Dylan M Giovane, energico Pubblicità, social media
Ryan M Casual, conversazionale Podcast, spiegazioni
Aiden M Giovane, leggera Tutorial, app
Uncle_Fu M Matura, calda Storytelling, mentorship

Un'eccezione: Ryan non è disponibile in cinese. Tutte le altre voci funzionano in tutte e 10 le lingue.

Il backbone LLM dà a CustomVoice un vantaggio sui motori TTS tradizionali per quanto riguarda la prosodia. Una domanda retorica riceve un'intonazione diversa rispetto a un'affermazione, e il modello gestisce le pause attorno a em-dash ed ellissi in modo naturale. Usa la punteggiatura come strumento principale di ritmo – i punti per le pause complete, le virgole per i respiri, per la suspense.

Clona qualunque voce con VoiceClone

VoiceClone prende un breve campione audio e riproduce quella voce su qualunque testo tu fornisca. Il modello cattura timbro, ritmo, accento e stile emotivo dal riferimento – tutto senza alcun fine-tuning o training.

La capacità distintiva è il cloning multilingue. Registra un campione inglese di 10 secondi e la voce clonata può parlare tutte e 10 le lingue supportate mantenendo la propria identità. Una singola registrazione alimenta l'intero tuo prodotto multilingua.

Preparare l'audio di riferimento

La qualità del clone dipende all'incirca al 70% dal riferimento e al 30% dal tuo testo. Investire qualche minuto in una buona registrazione ripaga su ogni generazione.

Lunghezza: 8-12 secondi è il punto ottimale. Sotto i 5 secondi il modello riempie i vuoti con supposizioni. Oltre i 15 secondi si hanno rendimenti decrescenti.

Qualità: Registra in una stanza silenziosa con un microfono decente. Rumore di fondo, riverbero ed eco vengono clonati insieme alla voce. Un microfono a condensatore USB in una stanza trattata batte sempre una registrazione telefonica in un bar.

Contenuto: Un solo parlante, parlato continuo, senza pause lunghe. Un riferimento con prosodia varia – domande, affermazioni, virgole, punti – dà al modello più informazioni su come suona naturalmente il parlante.

Corrispondenza di stile: Il modello clona lo stile emotivo insieme al timbro. Un riferimento calmo e misurato produce un output calmo anche se il tuo testo ha punti esclamativi. Registra il riferimento nell'umore che vuoi l'output trasmetta.

VoiceClone funziona bene per la narrazione di brand, intro automatici di podcast con la tua voce e marketing multilingua in cui vuoi un unico parlante coerente in ogni mercato. Una nota sull'etica: clonare la voce di qualcuno senza il suo consenso è illegale in molte giurisdizioni, inclusa l'EU AI Act. Clona solo voci di cui sei proprietario o per cui hai l'autorizzazione.

Disegna una voce dalle parole con VoiceDesign

VoiceDesign prende l'approccio opposto rispetto a VoiceClone. Invece di fornire un campione audio, descrivi la voce che vuoi in testo semplice e il modello genera un parlante corrispondente da zero.

La descrizione (chiamata instruct nell'API) funziona su otto dimensioni: genere, età, intonazione, ritmo, emozione, accento, timbro e personalità. Più specifica è la tua descrizione, più coerente sarà l'output tra le esecuzioni. «Voce femminile» lascia un enorme margine di interpretazione. «Femminile britannica, 30 anni, mezzosoprano, calda, leggero accento RP, timbro fluido, energia da narratrice di audiolibro» restringe drasticamente lo spazio.

Tre esempi che mostrano la gamma:

Narratore di audiolibro: British male, 70s, warm and authoritative, low-medium pitch, measured pace, rich timbre, documentary-style gravitas, slight RP accent.

Voiceover pubblicitario: American male, early 30s, high energy, bright timbre, medium-high pitch, fast pace, confident announcer voice.

Voce di personaggio: Elderly woman, 80s, raspy and mischievous, medium-low pitch, slow deliberate pace, slight Eastern European accent, gravelly timbre, fairy tale witch energy.

Il modello comprende riferimenti ad archetipi come «BBC documentary narrator» o «late-night radio DJ» e li traduce in caratteristiche vocali. Evita di nominare persone reali specifiche – attieniti a ruoli e archetipi.

VoiceDesign brilla per i dialoghi dei personaggi in giochi e audio dramma, per prototipare voci di brand prima di assumere talenti e in ogni situazione in cui ti serve una qualità vocale specifica ma non hai una registrazione da clonare. Pensala come un casting – genera 5-10 varianti, scegli la migliore, salva il prompt esatto per la coerenza lungo tutto il progetto.

Una differenza importante rispetto alle altre modalità: VoiceDesign non è deterministica. La stessa descrizione produce voci simili ma non identiche tra le esecuzioni. Per la produzione, trova una voce che ti piace e poi riutilizza quel prompt esatto per tutto il progetto.

Scrivere testo che suoni bene

Tutte e tre le modalità condividono le stesse regole di gestione del testo, radicate nel backbone LLM di Qwen3.

La punteggiatura controlla il ritmo. I punti creano pause complete. Le virgole aggiungono brevi respiri. Gli em-dash creano sospensione drammatica. Le ellissi costruiscono suspense. Non sono suggerimenti – sono lo strumento principale per modellare come suona il tuo audio.

Le MAIUSCOLE aggiungono enfasi con parsimonia. Ho detto NO. sottolinea «NO» in modo naturale. Ma SONO COSÌ ECCITATO PER QUESTO suona come un urlo. Limita le MAIUSCOLE a una o due parole per paragrafo.

Abbina lo stile del testo alla voce. Una voce narrante corporate abbinata a slang casual («Yo, come va») suona dissonante. Una voce da podcast giocosa che legge disclaimer legali suona altrettanto sbagliata. La voce e le parole devono appartenere l'una all'altra.

Mantieni le esecuzioni tra 500 e 1.500 caratteri. Il modello gestisce fino a 5.000, ma la prosodia resta più naturale nel range medio. Per contenuti più lunghi, dividi in segmenti e concatenane l'audio.

Per cinese e giapponese, usa la punteggiatura a larghezza piena. 。,?! invece di .,?! – il modello è stato addestrato su caratteri a larghezza piena per il testo CJK.