FilmoTvor.AI
Retour aux guides

Audio

Qwen3 TTS : voices préréglées, clonage vocal et voice design

8 min de lectureLa plupart des API TTS vous livrent un menu déroulant de voices préréglées et s'arrêtent là. Qwen3 TTS va plus loin — voices préréglées, clonage depuis un échantillon et design d'une voix depuis une description textuelle.

La plupart des API de synthèse vocale vous livrent un menu déroulant de voix prédéfinies et s'arrêtent là. Qwen3 TTS va plus loin. Construit sur l'ossature LLM Qwen3, il propose trois modes distincts : choisir une voix prédéfinie pour un résultat immédiat, cloner n'importe quelle voix à partir d'un échantillon audio de 10 secondes, ou décrire une voix totalement nouvelle en anglais simple et laisser le modèle la générer.

Trois façons de générer de la parole

Chaque mode sert un flux de travail différent. Voici la comparaison :

CustomVoice VoiceClone VoiceDesign
Ce que vous fournissez Choisissez parmi 9 préréglages Téléversez un échantillon audio de 5-15 s Écrivez une description texte
Idéal pour Intégration rapide, applications en production Narrateur de marque, votre propre voix Personnages fictifs, prototypage
Cohérence Identique à chaque exécution Élevée (même référence = même voix) Variable (même prompt ≈ voix similaire)
Slug API Qwen3_TTS_12Hz_1_7B_CustomVoice Qwen3_TTS_12Hz_1_7B_Base Qwen3_TTS_12Hz_1_7B_VoiceDesign

Voix prédéfinies avec CustomVoice

Le chemin le plus rapide vers la parole. Choisissez une voix, passez votre texte, récupérez l'audio.

Qwen3 TTS propose 9 identités vocales, chacune disponible dans 10 langues : anglais, chinois, japonais, coréen, allemand, français, russe, portugais, espagnol et italien. La fonctionnalité remarquable est la cohérence inter-langue – Eric sonne comme Eric qu'il parle anglais, allemand ou japonais. Même timbre, accent approprié à chaque langue.

Voix Genre Caractère Bonne pour
Vivian F Chaleureuse, conversationnelle Assistants, serveurs vocaux
Serena F Élégante, calme Livres audio, narration
Ono_Anna F Jeune, claire Vidéos produit, tutoriels
Sohee F Douce, gentille Contenu pour enfants, méditation
Eric M Standard, professionnel Entreprise, podcasts
Dylan M Jeune, énergique Publicités, réseaux sociaux
Ryan M Décontracté, conversationnel Podcasts, vidéos explicatives
Aiden M Jeune, léger Tutoriels, applications
Uncle_Fu M Âgé, chaleureux Récits, mentorat

Une exception : Ryan n'est pas disponible en chinois. Toutes les autres voix fonctionnent dans les 10 langues.

L'ossature LLM donne à CustomVoice un avantage sur les moteurs TTS traditionnels en matière de prosodie. Une question rhétorique reçoit une intonation différente d'une affirmation, et le modèle gère naturellement les pauses autour des tirets cadratins et des points de suspension. Utilisez la ponctuation comme votre principal outil de cadence – les points pour les arrêts complets, les virgules pour les respirations, pour le suspense.

Clonez n'importe quelle voix avec VoiceClone

VoiceClone prend un court échantillon audio et reproduit cette voix sur n'importe quel texte que vous fournissez. Le modèle capte le timbre, le rythme, l'accent et le style émotionnel depuis la référence – le tout sans aucun fine-tuning ni entraînement.

La capacité remarquable est le clonage interlingue. Enregistrez un échantillon en anglais de 10 secondes, et la voix clonée peut parler les 10 langues prises en charge tout en conservant son identité. Un seul enregistrement alimente tout votre produit multilingue.

Préparer votre audio de référence

La qualité du clonage dépend à environ 70 % de la référence et à 30 % de votre texte. Investir quelques minutes dans un bon enregistrement paie sur chaque génération.

Longueur : 8-12 secondes est le bon compromis. En dessous de 5 secondes, le modèle comble les manques avec des approximations. Au-delà de 15 secondes, les rendements deviennent décroissants.

Qualité : Enregistrez dans une pièce calme avec un micro correct. Le bruit de fond, la réverbération et l'écho sont clonés en même temps que la voix. Un micro à condensateur USB dans une pièce traitée bat un enregistrement de téléphone dans un café à tous les coups.

Contenu : Un seul locuteur, parole continue, sans longues pauses. Une référence à la prosodie variée – questions, affirmations, virgules, points – donne au modèle plus d'informations sur la façon dont le locuteur sonne naturellement.

Adéquation du style : Le modèle clone le style émotionnel en même temps que le timbre. Une référence calme et posée produit une sortie calme même si votre texte comporte des points d'exclamation. Enregistrez votre référence dans l'ambiance que vous souhaitez voir portée par la sortie.

VoiceClone fonctionne bien pour la narration de marque, les intros de podcast automatisées avec votre propre voix, et le marketing multilingue où vous voulez un locuteur cohérent sur tous les marchés. Une note éthique : cloner la voix de quelqu'un sans son consentement est illégal dans de nombreuses juridictions, y compris au titre de l'AI Act de l'UE. Ne clonez que des voix que vous possédez ou que vous êtes autorisé à utiliser.

Concevez une voix à partir de mots avec VoiceDesign

VoiceDesign prend l'approche opposée de VoiceClone. Au lieu de fournir un échantillon audio, vous décrivez la voix souhaitée en texte simple, et le modèle génère un locuteur correspondant à partir de zéro.

La description (appelée instruct dans l'API) fonctionne selon huit dimensions : genre, âge, hauteur, rythme, émotion, accent, timbre et personnalité. Plus votre description est précise, plus la sortie est cohérente entre les exécutions. « Female voice » laisse une marge énorme à l'interprétation. « British female, 30s, mezzo-soprano, warm, slight RP accent, smooth timbre, audiobook narrator energy » réduit considérablement l'espace.

Trois exemples qui illustrent l'éventail :

Narrateur de livre audio : British male, 70s, warm and authoritative, low-medium pitch, measured pace, rich timbre, documentary-style gravitas, slight RP accent.

Voix off publicitaire : American male, early 30s, high energy, bright timbre, medium-high pitch, fast pace, confident announcer voice.

Voix de personnage : Elderly woman, 80s, raspy and mischievous, medium-low pitch, slow deliberate pace, slight Eastern European accent, gravelly timbre, fairy tale witch energy.

Le modèle comprend les références à des archétypes comme « BBC documentary narrator » ou « late-night radio DJ » et les traduit en caractéristiques vocales. Évitez de nommer des personnes réelles précises – tenez-vous-en aux rôles et aux archétypes.

VoiceDesign excelle pour les dialogues de personnages dans les jeux et les fictions audio, le prototypage de voix de marque avant d'engager un talent, et toute situation où vous avez besoin d'une qualité vocale précise sans enregistrement à cloner. Considérez cela comme un casting – générez 5-10 variantes, choisissez la meilleure, conservez le texte de prompt exact pour la cohérence dans tout votre projet.

Une différence importante avec les autres modes : VoiceDesign n'est pas déterministe. La même description produit des voix similaires mais non identiques d'une exécution à l'autre. En production, trouvez une voix qui vous plaît, puis réutilisez ce texte de prompt exact tout au long de votre projet.

Écrire un texte qui sonne juste

Les trois modes partagent les mêmes règles de traitement du texte, enracinées dans l'ossature LLM Qwen3.

La ponctuation contrôle la cadence. Les points créent des pauses complètes. Les virgules ajoutent de brèves respirations. Les tirets cadratins créent une suspension dramatique. Les points de suspension installent le suspense. Ce ne sont pas des suggestions – c'est l'outil principal pour façonner la sonorité de votre audio.

Les MAJUSCULES ajoutent de l'insistance avec parcimonie. I said NO. fait ressortir naturellement « NO ». Mais I AM SO EXCITED ABOUT THIS se lit comme un cri. Limitez les MAJUSCULES à un ou deux mots par paragraphe.

Adaptez le style de votre texte à votre voix. Une voix de narrateur entreprise associée à de l'argot décontracté (« Yo, what's up ») sonne dissonante. Une voix de podcast ludique lisant des mentions légales sonne tout aussi faux. La voix et les mots doivent aller ensemble.

Gardez des exécutions entre 500 et 1 500 caractères. Le modèle gère jusqu'à 5 000, mais la prosodie reste plus naturelle dans la plage médiane. Pour les contenus plus longs, segmentez et concaténez l'audio.

Pour le chinois et le japonais, utilisez la ponctuation pleine chasse. 。,?! au lieu de .,?! – le modèle a été entraîné sur des caractères pleine chasse pour le texte CJK.