ACE-Step no funciona como Suno. No hay un cuadro de texto mágico donde describes una canción y rezas. En su lugar, te da dos controles separados: tags que moldean el sonido y lyrics que definen la estructura de la canción. Entender la separación entre ambos es la diferencia entre obtener una salida aleatoria y obtener el tema que realmente escuchas en tu cabeza.
Por qué los prompts de ACE-Step son diferentes
La mayoría de herramientas de música por IA aceptan una única descripción en lenguaje natural. «Escríbeme una balada de piano triste sobre amor perdido» y el modelo interpreta todo a la vez. Género, ambiente, instrumentos, letra, estructura, todo enredado en una sola frase.
ACE-Step separa estas preocupaciones en dos campos que no interfieren entre sí.
tags (caption) es una lista de palabras clave separadas por comas que controla el audio. Género, ambiente, instrumentos, estilo vocal, calidad de producción, BPM. Piénsalo como una mesa de mezclas: cada tag es un fader.
lyrics lleva el texto de la canción más los marcadores estructurales ([verse], [chorus], [bridge]) y las etiquetas de idioma como [en] o [ja]. Déjalo vacío y el modelo genera un instrumental.
Esto importa porque puedes cambiar todo el género editando las tags mientras mantienes intacta la misma letra. Una balada folk se convierte en un beat de trap en segundos, con palabras idénticas sobre un paisaje sonoro completamente distinto.
Cómo escribir las tags
Un conjunto de tags sólido lleva 5-12 palabras clave. Más de 15, y empiezan a diluirse entre sí. El orden importa menos que la especificidad: grand piano supera a piano, y fingerpicked acoustic guitar produce un resultado más claro que guitar.
La fórmula
El género siempre va primero
La tag de género ancla todo lo demás. ACE-Step cubre un amplio abanico:
| Familia | Tags que funcionan bien |
|---|---|
| Electrónica | techno, progressive house, trance, drum and bass, breakcore, darkwave, synthwave |
| Hip-hop | trap, boom bap, drill, phonk, lo-fi hip-hop, cloud rap, uk drill |
| Rock | indie rock, post-rock, shoegaze, dream pop, post-punk, grunge, doom metal |
| Pop | synth-pop, city pop, k-pop, j-pop, indie pop, hyperpop |
| Jazz | bebop, fusion, smooth jazz, gypsy jazz, cool jazz |
| Orquestal | cinematic, trailer music, orchestral score, baroque, minimalist |
| Acústica | indie folk, bluegrass, bossa nova, americana, sea shanty |
| Ambient | dark ambient, drone, new age, generative |
¿Obtienes resultados turbios con un género de nicho como darkwave o breakcore? Ejecuta el mismo prompt en XL Turbo antes de reescribir tus tags. El modelo más grande (~10B parámetros) resuelve géneros de nicho que las variantes de 3.5B difuminan.
Nombra instrumentos, no adjetivos
«Grand piano, upright bass, brushed drums» le da al modelo tres fuentes de sonido concretas que renderizar. «Sofisticado, elegante, refinado» no le da nada con lo que trabajar.
XL Turbo es también donde brillan los instrumentos raros. hammered dulcimer, theremin, shakuhachi, prepared piano: estos producen timbres distintos en XL que los modelos de 3.5B aplanan en algo genérico.
Las tags de producción moldean la mezcla
Estas controlan el «acabado» sonoro del tema. Las tags de fidelidad (hi-fi, lo-fi, dusty, polished) fijan la claridad general. Las tags de carácter como analog warmth, tape saturation y vinyl crackle añaden textura por encima. Las tags espaciales (wide stereo, intimate, cinematic) definen cómo de grande se siente el tema. Y las tags de dinámica (compressed, sidechain pumping) moldean el comportamiento del loudness.
La diferencia es dramática: lo-fi hip-hop, dusty, vinyl crackle, tape saturation y hip-hop, hi-fi, clean, wide stereo producen mezclas completamente distintas a partir de letras idénticas.
Incluye siempre el BPM
Fíjalo tanto en las tags (p. ej., 88 bpm) como en el parámetro bpm. El modelo usa ambas entradas, y la consistencia entre ellas aprieta la salida rítmica.
| Género | Rango típico de BPM |
|---|---|
| Balada / acústica | 60-80 |
| Lo-fi hip-hop | 70-90 |
| Pop | 100-120 |
| House | 120-128 |
| Techno | 128-140 |
| Trap (half-time) | 130-145 |
| Drum and bass | 170-180 |
Tres errores de tags que arruinan la salida
«Una hermosa pieza de piano melancólica sobre el otoño en París» parece un prompt razonable. No lo es. El modelo espera palabras clave: piano ballad, melancholic, intimate, Parisian cafe, felt piano, 68 bpm.
Las tags contradictorias provocan un fallo distinto. aggressive, serene o lo-fi, hi-fi, polished obligan al modelo a oscilar entre polos en lugar de comprometerse con ninguno.
Por último, vigila tu BPM. Etiquetar techno a 70 bpm confunde al modelo porque el techno vive en 128-140. ¿Lento y oscuro? Eso es dark ambient o downtempo, no techno lento.
Cómo estructurar las lyrics
Las lyrics no son solo palabras: son la arquitectura de la canción.
Los marcadores de sección le dicen al modelo qué tocar
Cada marcador va entre corchetes, en minúsculas:
| Marcador | Propósito |
|---|---|
[intro] |
Apertura instrumental |
[verse] |
Estrofa |
[pre-chorus] |
Constructor de tensión antes del estribillo |
[chorus] |
El estribillo, repítelo |
[bridge] |
Sección de contraste |
[inst] |
Solo instrumental o descanso |
[build-up] |
Tensión creciente (electrónica) |
[drop] |
Pico de liberación de energía (EDM) |
[breakdown] |
Reducir la energía (electrónica) |
[outro] |
Final |
Un marcador sin texto debajo se convierte en un pasaje instrumental. Así es como creas solos, interludios y transiciones sin ninguna voz.
Marcadores de idioma para canciones multilingües
ACE-Step admite 19 idiomas. Los 10 primeros funcionan mejor: [en], [zh], [ru], [es], [ja], [de], [fr], [pt], [it], [ko]. Otros (incluido [pl]) funcionan pero pueden rendir menos.
Coloca el marcador de idioma al principio de una sección, nunca a mitad de línea. Estrofas en inglés con un estribillo en japonés en estilo j-rock es una combinación que funciona particularmente bien en XL Turbo.
Mantén las líneas cortas
El modelo mapea sílabas a compases. Las líneas de 4-8 sílabas fluyen de forma natural. A partir de 12 sílabas, el ritmo vocal se fractura: el modelo intenta meter demasiadas palabras en muy pocos compases.
Repite el estribillo. Ayuda al modelo a fijarse en una melodía consistente. Los esquemas de rima AABB o ABAB suenan más naturales que el verso libre, pero la rima no es obligatoria.
Instrumentales
Dos formas de pasar a totalmente instrumental:
Deja las lyrics vacías y añade
no vocalsoinstrumentala las tagsUsa solo marcadores de sección sin texto:
[intro]→[inst]→[outro]
Añadir no vocals en las tags mientras escribes texto de letra crea confusión: el modelo puede producir vocalizaciones inquietantes sin palabras. Elige un enfoque y mantente en él.
Tres variantes, un mismo formato de prompt
FilmoTvor.AI ejecuta tres modelos de ACE-Step 1.5. Los tres aceptan el mismo formato de tags y lyrics: la diferencia está en calidad, velocidad y control:
| Turbo (3.5B) | XL Turbo (~10B, INT8) | Base (3.5B) | |
|---|---|---|---|
| Steps | 8 (fijo) | 8 (fijo) | 5-100 (ajustable) |
| Guidance (CFG) | 1 (fijo) | 1 (fijo) | 3-20 (ajustable) |
| Duración mínima | 10s | 10s | 30s |
| Géneros de nicho | A veces falla | Gestiona bien | A veces falla |
| Formato largo (200s+) | Pierde coherencia | Se mantiene | Se mantiene |
| Claridad vocal | Adecuada | Limpia | La más limpia |
El flujo de trabajo: esboza en Turbo (genera 5-10 variantes rápido, encuentra el arreglo que funciona), refina en XL Turbo (mejor calidad de sonido, la mayoría de temas terminan aquí), pule en Base con steps=40-60 (máxima fidelidad para renders críticos).
Para Base en concreto, dos parámetros importan:
Steps controlan calidad frente a velocidad. 27 es el punto óptimo para la mayoría del trabajo. Por debajo de 15 obtienes borradores tipo Turbo. Por encima de 60, las mejoras se vuelven imperceptibles.
Guidance (CFG) controla cómo de estrictamente el modelo sigue tus tags. A 5-7, suena suelto y musical. A 10-12, sigue tus tags de cerca. Por encima de 15, se vuelve rígido y puede introducir artefactos. Los prompts complejos se benefician de un CFG más alto; los prompts de género simple suenan mejor con valores más bajos.
5 ejemplos completos de prompt
1. Lo-fi hip-hop (boom bap, jazzy)
tags:
lyrics:
bpm: 88 · duration: 180s
El [inst] antes de la outro deja espacio para un solo de influencia jazz: en XL Turbo, espera una trompeta con sordina o una improvisación de piano flotando sobre el bucle de boom bap.
2. Techno progresivo oscuro (instrumental)
tags:
lyrics:
bpm: 134 · duration: 240s
La secuencia [build-up] → [drop] es esencial para la música electrónica. El modelo lee estos marcadores como instrucciones dinámicas: sube y luego libera. Dos ciclos de ese patrón crean un arreglo completo apto para DJ.
3. Balada folk de cámara (acústica, íntima)
tags:
lyrics:
bpm: 68 · duration: 210s
El material acústico se beneficia más de Base con steps=40+. La guitarra de púa y los armónicos del chelo necesitan pasos de muestreo extra para renderizarse de forma limpia. Prototipa el arreglo en XL Turbo primero y luego cambia a Base para el render final.
4. Trailer orquestal híbrido (cinematográfico)
tags:
lyrics:
bpm: 90 · duration: 120s
La música de trailer depende del contraste dinámico: tensión silenciosa frente a explosiones orquestales. El arco [build-up] → [inst] → [chorus] le da al modelo una trayectoria clara de la contención al pleno poder.
5. Dark ambient (atmosférico, formato largo)
tags:
lyrics:
bpm: 55 · duration: 270s
A 270 segundos, la ventaja de la variante XL Turbo sobre el Turbo de 3.5B se vuelve audible. El modelo más pequeño tiende a perder coherencia pasada la marca de los 3 minutos: las texturas hacen bucle o se deslizan hacia el ruido. XL sostiene el paisaje sonoro en evolución durante toda la duración.
El atajo del audio de referencia
Las tres variantes aceptan ref_audio: un clip de 5-60 segundos que el modelo trata como referencia de estilo. El timbre, la textura de producción y el ambiente del clip influyen en el tema generado.
Envía un fragmento instrumental seco: 10-30 segundos, estilo consistente de principio a fin. Una intro de guitarra limpia, un pad de sintetizador aislado, un bucle de batería. Estos le dan al modelo un timbre claro de referencia.
Las mezclas cargadas de voces funcionan en contra: el modelo intenta clonar la voz en lugar de extraer el estilo de producción. Las mezclas completas densas se convierten en barro porque el modelo promedia todas las capas. Los clips de menos de 5 segundos llevan muy poca señal para algo útil.
En XL Turbo, incluso señales sutiles se transfieren: una caída de reverberación específica, el carácter de la compresión de cinta, la calidez particular de una cadena de grabación analógica. Las variantes de 3.5B captan los trazos generales pero pierden estos detalles.
Errores comunes
Cubrimos los errores de tags más arriba. Aquí están los que aparecen en las lyrics y los parámetros.
Las líneas de más de 10 sílabas fracturan el ritmo vocal. El modelo mete palabras en compases que no pueden sostenerlas: reescribe a 4-8 sílabas por línea y el ritmo se fija de inmediato.
Apilar cinco géneros de nicho (darkwave, witch house, phonk, vaporwave, drill) suena aventurado en el papel. En la práctica, el modelo no puede resolver tantas señales contradictorias y la salida colapsa en ruido. Un género principal más un modificador es el techo.
Un marcador [chorus] sin texto debajo no generará un estribillo pegadizo. Genera silencio. Escribe la letra del estribillo o renombra la sección como [inst].
Olvidar el marcador de idioma en letras que no son inglesas es el fallo más sigiloso. ¿Palabras polacas sin [pl] al principio de la sección? El modelo puede cantarlas con la fonética inglesa de todos modos.
Y la trampa del BPM: si lo omites de las tags, el modelo adivina. techno sin una tag de BPM explícita puede aterrizar en 115 en lugar de 130: lo bastante cerca para sonar mal, lo bastante lejos para arruinar el groove.
