FilmoTvor.AI
Späť na návody

Zvuk

Qwen3 TTS: prednastavené hlasy, klonovanie a Voice Design

8 min čítaniaVäčšina TTS API vám ponúkne iba rozbaľovacie menu hlasov. Qwen3 TTS ide ďalej — prednastavené hlasy, klonovanie z vzorky aj design hlasu z textového popisu.

Väčšina text-to-speech API vám podhodí rozbaľovacie menu s prednastavenými hlasmi a tým to skončí. Qwen3 TTS ide ďalej. Postavený na backboni Qwen3 LLM ponúka tri odlišné režimy: vyberte prednastavený hlas pre okamžité výsledky, naklonujte akýkoľvek hlas z 10-sekundovej audio vzorky, alebo popíšte úplne nový hlas v obyčajnej angličtine a nechajte model, aby ho vygeneroval.

Tri spôsoby generovania reči

Každý režim slúži inému pracovnému toku. Tu je ich porovnanie:

CustomVoice VoiceClone VoiceDesign
Čo dodáte Vyberte z 9 predvolieb Nahrajte 5–15s audio vzorku Napíšte textový opis
Najlepšie na Rýchla integrácia, produkčné aplikácie Brand narrator, vlastný hlas Fiktívne postavy, prototypovanie
Konzistencia Identická pri každom spustení Vysoká (rovnaká referencia = rovnaký hlas) Premenlivá (rovnaký prompt ≈ podobný hlas)
API slug Qwen3_TTS_12Hz_1_7B_CustomVoice Qwen3_TTS_12Hz_1_7B_Base Qwen3_TTS_12Hz_1_7B_VoiceDesign

Prednastavené hlasy s CustomVoice

Najrýchlejšia cesta k reči. Vyberte hlas, zadajte text, dostanete audio späť.

Qwen3 TTS ponúka 9 hlasových identít, každú dostupnú v 10 jazykoch: angličtina, čínština, japončina, kórejčina, nemčina, francúzština, ruština, portugalčina, španielčina a taliančina. Výraznou vlastnosťou je konzistencia naprieč jazykmi – Eric znie ako Eric, či už hovorí po anglicky, nemecky či japonsky. Rovnaké zafarbenie, primeraný akcent pre každý jazyk.

Hlas Rod Charakter Vhodný na
Vivian Ž Teplý, konverzačný Asistenti, IVR
Serena Ž Elegantná, pokojná Audioknihy, narácia
Ono_Anna Ž Mladistvá, jasná Produktové videá, tutoriály
Sohee Ž Mäkká, nežná Detský obsah, meditácie
Eric M Štandardný, obchodný Corporate, podcasty
Dylan M Mladý, energický Reklamy, sociálne siete
Ryan M Uvoľnený, konverzačný Podcasty, vysvetľujúce videá
Aiden M Mladý, ľahký Tutoriály, aplikácie
Uncle_Fu M Zrelý, teplý Rozprávanie príbehov, mentoring

Jediná výnimka: Ryan nie je dostupný v čínštine. Každý iný hlas funguje naprieč všetkými 10 jazykmi.

LLM backbone dáva CustomVoice náskok oproti tradičným TTS enginom, pokiaľ ide o prozódiu. Rétorická otázka dostane inú intonáciu než výrok a model prirodzene funguje s pauzami okolo pomlčiek a trojbodiek. Ako primárny nástroj tempa používajte interpunkciu – bodky pre úplné zastavenie, čiarky pre dych, pre napätie.

Klonujte akýkoľvek hlas s VoiceClone

VoiceClone zoberie krátku audio vzorku a reprodukuje ten hlas na akomkoľvek texte, ktorý dodáte. Model z referencie zachytí zafarbenie, tempo, akcent a emocionálny štýl – všetko bez akéhokoľvek doladenia alebo trénovania.

Výraznou schopnosťou je medzijazykové klonovanie. Nahrávkou 10-sekundovej anglickej vzorky môže naklonovaný hlas hovoriť všetkými 10 podporovanými jazykmi a pritom si zachovať identitu. Jedna nahrávka poháňa celý váš viacjazyčný produkt.

Príprava referenčného audia

Kvalita klonovania závisí zhruba 70 % od referencie a 30 % od vášho textu. Pár minút investovaných do dobrej nahrávky sa vráti pri každej generácii.

Dĺžka: 8–12 sekúnd je zlatá stredná cesta. Pod 5 sekúnd model vyplňuje medzery odhadmi. Nad 15 sekúnd prináša klesajúcu výťažnosť.

Kvalita: Nahrávajte v tichej miestnosti s dôstojným mikrofónom. Šum pozadia, reverb a ozvena sa klonujú spolu s hlasom. USB kondenzátorový mikrofón v upravenej miestnosti zakaždým prekoná nahrávku z telefónu v kaviarni.

Obsah: Jeden hovoriaci, súvislá reč, bez dlhých pauz. Referencia s rôznorodou prozódie – otázky, výroky, čiarky, bodky – dáva modelu viac informácií o tom, ako hovoriaci prirodzene znie.

Zhoda štýlu: Model klonuje emocionálny štýl spolu so zafarbením. Pokojná, odmeraná referencia produkuje pokojný výstup, aj keď má váš text výkričníky. Nahrávajte referenciu v nálade, ktorú má výstup niesť.

VoiceClone sa hodí na brand narration, automatizované podcastové intrá vo vašom vlastnom hlase a viacjazyčný marketing, kde chcete jedného konzistentného hovoriaceho naprieč každým trhom. Slovo o etike: klonovanie niečieho hlasu bez jeho súhlasu je v mnohých jurisdikciách nelegálne, vrátane podľa EU AI Act. Klonujte len hlasy, ktoré vlastníte alebo na ktoré máte povolenie.

VoiceDesign pristupuje k veci opačne než VoiceClone. Namiesto dodania audio vzorky opíšte požadovaný hlas v obyčajnom texte a model vygeneruje zodpovedajúceho hovoriaceho úplne od nuly.

Opis (v API nazvaný instruct) funguje v ôsmich dimenziách: rod, vek, výška, tempo, emócia, akcent, zafarbenie a osobnosť. Čím konkrétnejší je váš opis, tým konzistentnejší je výstup medzi spusteniami. „Ženský hlas“ ponecháva obrovský priestor na interpretáciu. „Britská žena, 30 rokov, mezzosoprán, teplá, mierny RP akcent, hladké zafarbenie, energia rozprávača audiokníh“ priestor dramaticky zužuje.

Tri príklady, ktoré demonštrujú rozsah:

Rozprávač audiokníh: British male, 70s, warm and authoritative, low-medium pitch, measured pace, rich timbre, documentary-style gravitas, slight RP accent.

Komerčný voiceover: American male, early 30s, high energy, bright timbre, medium-high pitch, fast pace, confident announcer voice.

Hlas postavy: Elderly woman, 80s, raspy and mischievous, medium-low pitch, slow deliberate pace, slight Eastern European accent, gravelly timbre, fairy tale witch energy.

Model rozumie referenciám na archetypy ako „BBC documentary narrator“ či „late-night radio DJ“ a prekladá ich do vokálnych charakteristík. Vyhnite sa menu konkrétnych skutočných ľudí – držte sa rolí a archetypov.

VoiceDesign žiari v dialógoch postáv v hrách a audio drámach, pri prototypovaní brand hlasov pred najatím talentov a v každej situácii, keď potrebujete špecifickú vokálnu kvalitu, ale nemáte nahrávku na klonovanie. Považujte to za casting – vygenerujte 5–10 variantov, vyberte najlepší, uložte presný prompt pre konzistenciu naprieč projektom.

Jeden dôležitý rozdiel oproti ostatným režimom: VoiceDesign nie je deterministický. Rovnaký opis produkuje podobné, no nie identické hlasy naprieč spusteniami. Pre produkciu nájdite hlas, ktorý sa vám páči, a potom tento presný text promptu opätovne používajte v celom projekte.

Písanie textu, ktorý znie správne

Všetky tri režimy zdieľajú rovnaké pravidlá spracovania textu, zakorenené v Qwen3 LLM backbonu.

Interpunkcia riadi tempo. Bodky vytvárajú úplné pauzy. Čiarky pridávajú krátke nádychy. Pomlčky vytvárajú dramatické pozastavenie. Trojbodky budujú napätie. Toto nie sú návrhy – sú primárnym nástrojom na tvarovanie toho, ako vaše audio znie.

VEĽKÉ PÍSMENÁ pridávajú dôraz s mierou. Povedal som NIE. prirodzene zdôrazní „NIE“. Ale SOM TAK NADŠENÝ Z TOHTO pôsobí ako kričanie. Obmedzte VEĽKÉ PÍSMENÁ na jedno-dve slová na odsek.

Prispôsobte štýl textu hlasu. Corporate narrator hlas spárovaný s uvoľneným slangom („Čau, čo je“) znie disonantne. Hravý podcastový hlas čítajúci právne vyhlásenia znie rovnako zle. Hlas a slová musia k sebe patriť.

Držte dĺžku spustenia medzi 500 a 1 500 znakmi. Model zvláda až 5 000, ale prozódia zostáva najprirodzenejšia v strednom rozsahu. Pre dlhší obsah rozdeľte na segmenty a audio zreťazte.

Pre čínštinu a japončinu používajte plnošírkovú interpunkciu. 。,?! namiesto .,?! – model bol trénovaný na plnošírkových znakoch pre CJK text.