FilmoTvor.AI
Volver a las guías

Audio

Qwen3 TTS: voces predefinidas, clonación de voz y diseño de voz

8 min de lecturaLa mayoría de APIs TTS te dan un desplegable de voces predefinidas y se acaban. Qwen3 TTS va más allá — voces predefinidas, clonación desde una muestra y diseño de voz desde una descripción de texto.

La mayoría de APIs de texto a voz te ofrecen un desplegable con voces predefinidas y se dan por satisfechos. Qwen3 TTS va más allá. Construido sobre la base del LLM Qwen3, ofrece tres modos distintos: elige una voz predefinida para resultados instantáneos, clona cualquier voz a partir de una muestra de audio de 10 segundos, o describe una voz completamente nueva en inglés sencillo y deja que el modelo la genere.

Tres formas de generar voz

Cada modo sirve a un flujo de trabajo distinto. Así se comparan:

CustomVoice VoiceClone VoiceDesign
Qué proporcionas Eliges entre 9 predefinidas Subes una muestra de audio de 5-15 s Escribes una descripción de texto
Mejor para Integración rápida, apps en producción Narrador de marca, tu propia voz Personajes ficticios, prototipado
Consistencia Idéntica en cada ejecución Alta (misma referencia = misma voz) Variable (mismo prompt ≈ voz similar)
Slug de API Qwen3_TTS_12Hz_1_7B_CustomVoice Qwen3_TTS_12Hz_1_7B_Base Qwen3_TTS_12Hz_1_7B_VoiceDesign

Voces predefinidas con CustomVoice

El camino más rápido hacia la voz. Elige una voz, pasa tu texto, recibe audio.

Qwen3 TTS ofrece 9 identidades de voz, cada una disponible en 10 idiomas: inglés, chino, japonés, coreano, alemán, francés, ruso, portugués, español e italiano. La característica destacada es la consistencia entre idiomas: Eric suena como Eric tanto si habla en inglés, alemán o japonés. Mismo timbre, acento apropiado para cada idioma.

Voz Género Carácter Buena para
Vivian F Cálida, conversacional Asistentes, IVR
Serena F Elegante, serena Audiolibros, narración
Ono_Anna F Joven, clara Vídeos de producto, tutoriales
Sohee F Suave, delicada Contenido infantil, meditación
Eric M Estándar, formal Corporativo, podcasts
Dylan M Joven, enérgico Anuncios, redes sociales
Ryan M Casual, conversacional Podcasts, explicativos
Aiden M Joven, ligera Tutoriales, apps
Uncle_Fu M Maduro, cálido Narración de historias, mentoría

Una excepción: Ryan no está disponible en chino. Todas las demás voces funcionan en los 10 idiomas.

La base del LLM le da a CustomVoice una ventaja sobre los motores TTS tradicionales en cuanto a prosodia. Una pregunta retórica recibe una entonación distinta a la de una afirmación, y el modelo gestiona las pausas alrededor de rayas y puntos suspensivos de forma natural. Usa la puntuación como tu principal herramienta de ritmo: puntos para paradas completas, comas para respiraciones, para suspense.

Clona cualquier voz con VoiceClone

VoiceClone toma una muestra de audio corta y reproduce esa voz en cualquier texto que proporciones. El modelo capta el timbre, el ritmo, el acento y el estilo emocional de la referencia, todo sin ningún fine-tuning ni entrenamiento.

La capacidad destacada es la clonación interlingüe. Graba una muestra de 10 segundos en inglés y la voz clonada puede hablar en los 10 idiomas admitidos manteniendo su identidad. Una sola grabación alimenta todo tu producto multilingüe.

Preparar tu audio de referencia

La calidad de la clonación depende aproximadamente en un 70 % de la referencia y en un 30 % de tu texto. Invertir unos minutos en una buena grabación se rentabiliza en cada generación.

Duración: 8-12 segundos es el punto óptimo. Por debajo de 5 segundos el modelo rellena los huecos con conjeturas. Por encima de 15 segundos los rendimientos son decrecientes.

Calidad: Graba en una habitación silenciosa con un micrófono decente. El ruido de fondo, la reverberación y el eco se clonan junto con la voz. Un micrófono de condensador USB en una habitación insonorizada supera siempre a una grabación de móvil en una cafetería.

Contenido: Un único locutor, habla continua, sin pausas largas. Una referencia con prosodia variada (preguntas, afirmaciones, comas, puntos) le da al modelo más información sobre cómo suena el hablante de forma natural.

Adaptación de estilo: El modelo clona el estilo emocional junto con el timbre. Una referencia calmada y mesurada produce una salida calmada aunque tu texto tenga signos de exclamación. Graba tu referencia con el estado de ánimo que quieres que la salida transmita.

VoiceClone funciona bien para narración de marca, intros automáticos de podcast con tu propia voz y marketing multilingüe donde quieres un único locutor consistente en cada mercado. Una nota sobre ética: clonar la voz de alguien sin su consentimiento es ilegal en muchas jurisdicciones, incluida la EU AI Act. Clona solo voces que poseas o para las que tengas permiso de uso.

Diseña una voz a partir de palabras con VoiceDesign

VoiceDesign toma el enfoque opuesto a VoiceClone. En lugar de proporcionar una muestra de audio, describes la voz que quieres en texto sencillo y el modelo genera un locutor acorde desde cero.

La descripción (llamada instruct en la API) funciona a lo largo de ocho dimensiones: género, edad, tono, ritmo, emoción, acento, timbre y personalidad. Cuanto más específica sea tu descripción, más consistente será la salida entre ejecuciones. «Voz femenina» deja un enorme margen de interpretación. «Británica femenina, 30 años, mezzosoprano, cálida, ligero acento RP, timbre suave, energía de narradora de audiolibro» reduce drásticamente el espacio.

Tres ejemplos que demuestran el abanico:

Narrador de audiolibro: British male, 70s, warm and authoritative, low-medium pitch, measured pace, rich timbre, documentary-style gravitas, slight RP accent.

Voz en off de anuncio: American male, early 30s, high energy, bright timbre, medium-high pitch, fast pace, confident announcer voice.

Voz de personaje: Elderly woman, 80s, raspy and mischievous, medium-low pitch, slow deliberate pace, slight Eastern European accent, gravelly timbre, fairy tale witch energy.

El modelo entiende referencias a arquetipos como «narrador de documental de la BBC» o «DJ de radio de madrugada» y las traduce en características vocales. Evita nombrar a personas reales específicas: limítate a roles y arquetipos.

VoiceDesign brilla en el diálogo de personajes para videojuegos y dramas de audio, en el prototipado de voces de marca antes de contratar talento y en cualquier situación donde necesites una cualidad vocal específica pero no tienes una grabación que clonar. Piénsalo como un casting: genera 5-10 variantes, elige la mejor y guarda el prompt exacto para mantener la consistencia en todo tu proyecto.

Una diferencia importante respecto a los otros modos: VoiceDesign no es determinista. La misma descripción produce voces similares pero no idénticas entre ejecuciones. Para producción, encuentra una voz que te guste y luego reutiliza ese texto de prompt exacto en todo tu proyecto.

Escribir texto que suene correcto

Los tres modos comparten las mismas reglas de manejo de texto, basadas en la base del LLM Qwen3.

La puntuación controla el ritmo. Los puntos crean pausas completas. Las comas añaden respiraciones breves. Las rayas crean una suspensión dramática. Los puntos suspensivos generan suspense. No son sugerencias: son la principal herramienta para dar forma a cómo suena tu audio.

Las MAYÚSCULAS añaden énfasis con moderación. I said NO. resalta «NO» de forma natural. Pero I AM SO EXCITED ABOUT THIS se lee como un grito. Limita las MAYÚSCULAS a una o dos palabras por párrafo.

Adapta el estilo de tu texto a tu voz. Una voz de narrador corporativo combinada con jerga casual («Ey, ¿qué tal») suena disonante. Una voz de podcast desenfadada leyendo avisos legales suena igual de mal. La voz y las palabras deben pertenecer juntas.

Mantén las ejecuciones entre 500 y 1.500 caracteres. El modelo gestiona hasta 5.000, pero la prosodia se mantiene más natural en el rango medio. Para contenido más largo, divídelo en segmentos y concatena el audio.

Para chino y japonés, usa puntuación de ancho completo. 。,?! en lugar de .,?!: el modelo se entrenó con caracteres de ancho completo para texto CJK.