Väčšina text-to-speech API vám podhodí rozbaľovacie menu s prednastavenými hlasmi a tým to skončí. Qwen3 TTS ide ďalej. Postavený na backboni Qwen3 LLM ponúka tri odlišné režimy: vyberte prednastavený hlas pre okamžité výsledky, naklonujte akýkoľvek hlas z 10-sekundovej audio vzorky, alebo popíšte úplne nový hlas v obyčajnej angličtine a nechajte model, aby ho vygeneroval.
Tri spôsoby generovania reči
Každý režim slúži inému pracovnému toku. Tu je ich porovnanie:
| CustomVoice | VoiceClone | VoiceDesign | |
|---|---|---|---|
| Čo dodáte | Vyberte z 9 predvolieb | Nahrajte 5–15s audio vzorku | Napíšte textový opis |
| Najlepšie na | Rýchla integrácia, produkčné aplikácie | Brand narrator, vlastný hlas | Fiktívne postavy, prototypovanie |
| Konzistencia | Identická pri každom spustení | Vysoká (rovnaká referencia = rovnaký hlas) | Premenlivá (rovnaký prompt ≈ podobný hlas) |
| API slug | Qwen3_TTS_12Hz_1_7B_CustomVoice |
Qwen3_TTS_12Hz_1_7B_Base |
Qwen3_TTS_12Hz_1_7B_VoiceDesign |
Prednastavené hlasy s CustomVoice
Najrýchlejšia cesta k reči. Vyberte hlas, zadajte text, dostanete audio späť.
Qwen3 TTS ponúka 9 hlasových identít, každú dostupnú v 10 jazykoch: angličtina, čínština, japončina, kórejčina, nemčina, francúzština, ruština, portugalčina, španielčina a taliančina. Výraznou vlastnosťou je konzistencia naprieč jazykmi – Eric znie ako Eric, či už hovorí po anglicky, nemecky či japonsky. Rovnaké zafarbenie, primeraný akcent pre každý jazyk.
| Hlas | Rod | Charakter | Vhodný na |
|---|---|---|---|
| Vivian | Ž | Teplý, konverzačný | Asistenti, IVR |
| Serena | Ž | Elegantná, pokojná | Audioknihy, narácia |
| Ono_Anna | Ž | Mladistvá, jasná | Produktové videá, tutoriály |
| Sohee | Ž | Mäkká, nežná | Detský obsah, meditácie |
| Eric | M | Štandardný, obchodný | Corporate, podcasty |
| Dylan | M | Mladý, energický | Reklamy, sociálne siete |
| Ryan | M | Uvoľnený, konverzačný | Podcasty, vysvetľujúce videá |
| Aiden | M | Mladý, ľahký | Tutoriály, aplikácie |
| Uncle_Fu | M | Zrelý, teplý | Rozprávanie príbehov, mentoring |
Jediná výnimka: Ryan nie je dostupný v čínštine. Každý iný hlas funguje naprieč všetkými 10 jazykmi.
LLM backbone dáva CustomVoice náskok oproti tradičným TTS enginom, pokiaľ ide o prozódiu. Rétorická otázka dostane inú intonáciu než výrok a model prirodzene funguje s pauzami okolo pomlčiek a trojbodiek. Ako primárny nástroj tempa používajte interpunkciu – bodky pre úplné zastavenie, čiarky pre dych, … pre napätie.
Klonujte akýkoľvek hlas s VoiceClone
VoiceClone zoberie krátku audio vzorku a reprodukuje ten hlas na akomkoľvek texte, ktorý dodáte. Model z referencie zachytí zafarbenie, tempo, akcent a emocionálny štýl – všetko bez akéhokoľvek doladenia alebo trénovania.
Výraznou schopnosťou je medzijazykové klonovanie. Nahrávkou 10-sekundovej anglickej vzorky môže naklonovaný hlas hovoriť všetkými 10 podporovanými jazykmi a pritom si zachovať identitu. Jedna nahrávka poháňa celý váš viacjazyčný produkt.
Príprava referenčného audia
Kvalita klonovania závisí zhruba 70 % od referencie a 30 % od vášho textu. Pár minút investovaných do dobrej nahrávky sa vráti pri každej generácii.
Dĺžka: 8–12 sekúnd je zlatá stredná cesta. Pod 5 sekúnd model vyplňuje medzery odhadmi. Nad 15 sekúnd prináša klesajúcu výťažnosť.
Kvalita: Nahrávajte v tichej miestnosti s dôstojným mikrofónom. Šum pozadia, reverb a ozvena sa klonujú spolu s hlasom. USB kondenzátorový mikrofón v upravenej miestnosti zakaždým prekoná nahrávku z telefónu v kaviarni.
Obsah: Jeden hovoriaci, súvislá reč, bez dlhých pauz. Referencia s rôznorodou prozódie – otázky, výroky, čiarky, bodky – dáva modelu viac informácií o tom, ako hovoriaci prirodzene znie.
Zhoda štýlu: Model klonuje emocionálny štýl spolu so zafarbením. Pokojná, odmeraná referencia produkuje pokojný výstup, aj keď má váš text výkričníky. Nahrávajte referenciu v nálade, ktorú má výstup niesť.
VoiceClone sa hodí na brand narration, automatizované podcastové intrá vo vašom vlastnom hlase a viacjazyčný marketing, kde chcete jedného konzistentného hovoriaceho naprieč každým trhom. Slovo o etike: klonovanie niečieho hlasu bez jeho súhlasu je v mnohých jurisdikciách nelegálne, vrátane podľa EU AI Act. Klonujte len hlasy, ktoré vlastníte alebo na ktoré máte povolenie.
Navrhnite hlas zo slov s VoiceDesign
VoiceDesign pristupuje k veci opačne než VoiceClone. Namiesto dodania audio vzorky opíšte požadovaný hlas v obyčajnom texte a model vygeneruje zodpovedajúceho hovoriaceho úplne od nuly.
Opis (v API nazvaný instruct) funguje v ôsmich dimenziách: rod, vek, výška, tempo, emócia, akcent, zafarbenie a osobnosť. Čím konkrétnejší je váš opis, tým konzistentnejší je výstup medzi spusteniami. „Ženský hlas“ ponecháva obrovský priestor na interpretáciu. „Britská žena, 30 rokov, mezzosoprán, teplá, mierny RP akcent, hladké zafarbenie, energia rozprávača audiokníh“ priestor dramaticky zužuje.
Tri príklady, ktoré demonštrujú rozsah:
Rozprávač audiokníh: British male, 70s, warm and authoritative, low-medium pitch, measured pace, rich timbre, documentary-style gravitas, slight RP accent.
Komerčný voiceover: American male, early 30s, high energy, bright timbre, medium-high pitch, fast pace, confident announcer voice.
Hlas postavy: Elderly woman, 80s, raspy and mischievous, medium-low pitch, slow deliberate pace, slight Eastern European accent, gravelly timbre, fairy tale witch energy.
Model rozumie referenciám na archetypy ako „BBC documentary narrator“ či „late-night radio DJ“ a prekladá ich do vokálnych charakteristík. Vyhnite sa menu konkrétnych skutočných ľudí – držte sa rolí a archetypov.
VoiceDesign žiari v dialógoch postáv v hrách a audio drámach, pri prototypovaní brand hlasov pred najatím talentov a v každej situácii, keď potrebujete špecifickú vokálnu kvalitu, ale nemáte nahrávku na klonovanie. Považujte to za casting – vygenerujte 5–10 variantov, vyberte najlepší, uložte presný prompt pre konzistenciu naprieč projektom.
Jeden dôležitý rozdiel oproti ostatným režimom: VoiceDesign nie je deterministický. Rovnaký opis produkuje podobné, no nie identické hlasy naprieč spusteniami. Pre produkciu nájdite hlas, ktorý sa vám páči, a potom tento presný text promptu opätovne používajte v celom projekte.
Písanie textu, ktorý znie správne
Všetky tri režimy zdieľajú rovnaké pravidlá spracovania textu, zakorenené v Qwen3 LLM backbonu.
Interpunkcia riadi tempo. Bodky vytvárajú úplné pauzy. Čiarky pridávajú krátke nádychy. Pomlčky vytvárajú dramatické pozastavenie. Trojbodky budujú napätie. Toto nie sú návrhy – sú primárnym nástrojom na tvarovanie toho, ako vaše audio znie.
VEĽKÉ PÍSMENÁ pridávajú dôraz s mierou. Povedal som NIE. prirodzene zdôrazní „NIE“. Ale SOM TAK NADŠENÝ Z TOHTO pôsobí ako kričanie. Obmedzte VEĽKÉ PÍSMENÁ na jedno-dve slová na odsek.
Prispôsobte štýl textu hlasu. Corporate narrator hlas spárovaný s uvoľneným slangom („Čau, čo je“) znie disonantne. Hravý podcastový hlas čítajúci právne vyhlásenia znie rovnako zle. Hlas a slová musia k sebe patriť.
Držte dĺžku spustenia medzi 500 a 1 500 znakmi. Model zvláda až 5 000, ale prozódia zostáva najprirodzenejšia v strednom rozsahu. Pre dlhší obsah rozdeľte na segmenty a audio zreťazte.
Pre čínštinu a japončinu používajte plnošírkovú interpunkciu. 。,?! namiesto .,?! – model bol trénovaný na plnošírkových znakoch pre CJK text.
