FilmoTvor.AI
Volver a las guías

Audio

Guía de prompting para ACE-Step 1.5: cómo escribir tags, estructurar letras y generar mejor música

9 min de lecturaACE-Step no funciona como Suno. No hay caja de texto mágica — obtienes dos controles: tags que dan forma al sonido y letras que dan forma a la estructura.

ACE-Step no funciona como Suno. No hay un cuadro de texto mágico donde describes una canción y rezas. En su lugar, te da dos controles separados: tags que moldean el sonido y lyrics que definen la estructura de la canción. Entender la separación entre ambos es la diferencia entre obtener una salida aleatoria y obtener el tema que realmente escuchas en tu cabeza.

Por qué los prompts de ACE-Step son diferentes

La mayoría de herramientas de música por IA aceptan una única descripción en lenguaje natural. «Escríbeme una balada de piano triste sobre amor perdido» y el modelo interpreta todo a la vez. Género, ambiente, instrumentos, letra, estructura, todo enredado en una sola frase.

ACE-Step separa estas preocupaciones en dos campos que no interfieren entre sí.

tags (caption) es una lista de palabras clave separadas por comas que controla el audio. Género, ambiente, instrumentos, estilo vocal, calidad de producción, BPM. Piénsalo como una mesa de mezclas: cada tag es un fader.

lyrics lleva el texto de la canción más los marcadores estructurales ([verse], [chorus], [bridge]) y las etiquetas de idioma como [en] o [ja]. Déjalo vacío y el modelo genera un instrumental.

Esto importa porque puedes cambiar todo el género editando las tags mientras mantienes intacta la misma letra. Una balada folk se convierte en un beat de trap en segundos, con palabras idénticas sobre un paisaje sonoro completamente distinto.

Cómo escribir las tags

Un conjunto de tags sólido lleva 5-12 palabras clave. Más de 15, y empiezan a diluirse entre sí. El orden importa menos que la especificidad: grand piano supera a piano, y fingerpicked acoustic guitar produce un resultado más claro que guitar.

La fórmula

El género siempre va primero

La tag de género ancla todo lo demás. ACE-Step cubre un amplio abanico:

Familia Tags que funcionan bien
Electrónica techno, progressive house, trance, drum and bass, breakcore, darkwave, synthwave
Hip-hop trap, boom bap, drill, phonk, lo-fi hip-hop, cloud rap, uk drill
Rock indie rock, post-rock, shoegaze, dream pop, post-punk, grunge, doom metal
Pop synth-pop, city pop, k-pop, j-pop, indie pop, hyperpop
Jazz bebop, fusion, smooth jazz, gypsy jazz, cool jazz
Orquestal cinematic, trailer music, orchestral score, baroque, minimalist
Acústica indie folk, bluegrass, bossa nova, americana, sea shanty
Ambient dark ambient, drone, new age, generative

¿Obtienes resultados turbios con un género de nicho como darkwave o breakcore? Ejecuta el mismo prompt en XL Turbo antes de reescribir tus tags. El modelo más grande (~10B parámetros) resuelve géneros de nicho que las variantes de 3.5B difuminan.

Nombra instrumentos, no adjetivos

«Grand piano, upright bass, brushed drums» le da al modelo tres fuentes de sonido concretas que renderizar. «Sofisticado, elegante, refinado» no le da nada con lo que trabajar.

XL Turbo es también donde brillan los instrumentos raros. hammered dulcimer, theremin, shakuhachi, prepared piano: estos producen timbres distintos en XL que los modelos de 3.5B aplanan en algo genérico.

Las tags de producción moldean la mezcla

Estas controlan el «acabado» sonoro del tema. Las tags de fidelidad (hi-fi, lo-fi, dusty, polished) fijan la claridad general. Las tags de carácter como analog warmth, tape saturation y vinyl crackle añaden textura por encima. Las tags espaciales (wide stereo, intimate, cinematic) definen cómo de grande se siente el tema. Y las tags de dinámica (compressed, sidechain pumping) moldean el comportamiento del loudness.

La diferencia es dramática: lo-fi hip-hop, dusty, vinyl crackle, tape saturation y hip-hop, hi-fi, clean, wide stereo producen mezclas completamente distintas a partir de letras idénticas.

Incluye siempre el BPM

Fíjalo tanto en las tags (p. ej., 88 bpm) como en el parámetro bpm. El modelo usa ambas entradas, y la consistencia entre ellas aprieta la salida rítmica.

Género Rango típico de BPM
Balada / acústica 60-80
Lo-fi hip-hop 70-90
Pop 100-120
House 120-128
Techno 128-140
Trap (half-time) 130-145
Drum and bass 170-180

Tres errores de tags que arruinan la salida

«Una hermosa pieza de piano melancólica sobre el otoño en París» parece un prompt razonable. No lo es. El modelo espera palabras clave: piano ballad, melancholic, intimate, Parisian cafe, felt piano, 68 bpm.

Las tags contradictorias provocan un fallo distinto. aggressive, serene o lo-fi, hi-fi, polished obligan al modelo a oscilar entre polos en lugar de comprometerse con ninguno.

Por último, vigila tu BPM. Etiquetar techno a 70 bpm confunde al modelo porque el techno vive en 128-140. ¿Lento y oscuro? Eso es dark ambient o downtempo, no techno lento.

Cómo estructurar las lyrics

Las lyrics no son solo palabras: son la arquitectura de la canción.

Los marcadores de sección le dicen al modelo qué tocar

Cada marcador va entre corchetes, en minúsculas:

Marcador Propósito
[intro] Apertura instrumental
[verse] Estrofa
[pre-chorus] Constructor de tensión antes del estribillo
[chorus] El estribillo, repítelo
[bridge] Sección de contraste
[inst] Solo instrumental o descanso
[build-up] Tensión creciente (electrónica)
[drop] Pico de liberación de energía (EDM)
[breakdown] Reducir la energía (electrónica)
[outro] Final

Un marcador sin texto debajo se convierte en un pasaje instrumental. Así es como creas solos, interludios y transiciones sin ninguna voz.

Marcadores de idioma para canciones multilingües

ACE-Step admite 19 idiomas. Los 10 primeros funcionan mejor: [en], [zh], [ru], [es], [ja], [de], [fr], [pt], [it], [ko]. Otros (incluido [pl]) funcionan pero pueden rendir menos.

Coloca el marcador de idioma al principio de una sección, nunca a mitad de línea. Estrofas en inglés con un estribillo en japonés en estilo j-rock es una combinación que funciona particularmente bien en XL Turbo.

Mantén las líneas cortas

El modelo mapea sílabas a compases. Las líneas de 4-8 sílabas fluyen de forma natural. A partir de 12 sílabas, el ritmo vocal se fractura: el modelo intenta meter demasiadas palabras en muy pocos compases.

Repite el estribillo. Ayuda al modelo a fijarse en una melodía consistente. Los esquemas de rima AABB o ABAB suenan más naturales que el verso libre, pero la rima no es obligatoria.

Instrumentales

Dos formas de pasar a totalmente instrumental:

  • Deja las lyrics vacías y añade no vocals o instrumental a las tags

  • Usa solo marcadores de sección sin texto: [intro][inst][outro]

Añadir no vocals en las tags mientras escribes texto de letra crea confusión: el modelo puede producir vocalizaciones inquietantes sin palabras. Elige un enfoque y mantente en él.

Tres variantes, un mismo formato de prompt

FilmoTvor.AI ejecuta tres modelos de ACE-Step 1.5. Los tres aceptan el mismo formato de tags y lyrics: la diferencia está en calidad, velocidad y control:

Turbo (3.5B) XL Turbo (~10B, INT8) Base (3.5B)
Steps 8 (fijo) 8 (fijo) 5-100 (ajustable)
Guidance (CFG) 1 (fijo) 1 (fijo) 3-20 (ajustable)
Duración mínima 10s 10s 30s
Géneros de nicho A veces falla Gestiona bien A veces falla
Formato largo (200s+) Pierde coherencia Se mantiene Se mantiene
Claridad vocal Adecuada Limpia La más limpia

El flujo de trabajo: esboza en Turbo (genera 5-10 variantes rápido, encuentra el arreglo que funciona), refina en XL Turbo (mejor calidad de sonido, la mayoría de temas terminan aquí), pule en Base con steps=40-60 (máxima fidelidad para renders críticos).

Para Base en concreto, dos parámetros importan:

Steps controlan calidad frente a velocidad. 27 es el punto óptimo para la mayoría del trabajo. Por debajo de 15 obtienes borradores tipo Turbo. Por encima de 60, las mejoras se vuelven imperceptibles.

Guidance (CFG) controla cómo de estrictamente el modelo sigue tus tags. A 5-7, suena suelto y musical. A 10-12, sigue tus tags de cerca. Por encima de 15, se vuelve rígido y puede introducir artefactos. Los prompts complejos se benefician de un CFG más alto; los prompts de género simple suenan mejor con valores más bajos.

5 ejemplos completos de prompt

1. Lo-fi hip-hop (boom bap, jazzy)

tags:

lyrics:

bpm: 88 · duration: 180s

El [inst] antes de la outro deja espacio para un solo de influencia jazz: en XL Turbo, espera una trompeta con sordina o una improvisación de piano flotando sobre el bucle de boom bap.


2. Techno progresivo oscuro (instrumental)

tags:

lyrics:

bpm: 134 · duration: 240s

La secuencia [build-up][drop] es esencial para la música electrónica. El modelo lee estos marcadores como instrucciones dinámicas: sube y luego libera. Dos ciclos de ese patrón crean un arreglo completo apto para DJ.


3. Balada folk de cámara (acústica, íntima)

tags:

lyrics:

bpm: 68 · duration: 210s

El material acústico se beneficia más de Base con steps=40+. La guitarra de púa y los armónicos del chelo necesitan pasos de muestreo extra para renderizarse de forma limpia. Prototipa el arreglo en XL Turbo primero y luego cambia a Base para el render final.


4. Trailer orquestal híbrido (cinematográfico)

tags:

lyrics:

bpm: 90 · duration: 120s

La música de trailer depende del contraste dinámico: tensión silenciosa frente a explosiones orquestales. El arco [build-up][inst][chorus] le da al modelo una trayectoria clara de la contención al pleno poder.


5. Dark ambient (atmosférico, formato largo)

tags:

lyrics:

bpm: 55 · duration: 270s

A 270 segundos, la ventaja de la variante XL Turbo sobre el Turbo de 3.5B se vuelve audible. El modelo más pequeño tiende a perder coherencia pasada la marca de los 3 minutos: las texturas hacen bucle o se deslizan hacia el ruido. XL sostiene el paisaje sonoro en evolución durante toda la duración.

El atajo del audio de referencia

Las tres variantes aceptan ref_audio: un clip de 5-60 segundos que el modelo trata como referencia de estilo. El timbre, la textura de producción y el ambiente del clip influyen en el tema generado.

Envía un fragmento instrumental seco: 10-30 segundos, estilo consistente de principio a fin. Una intro de guitarra limpia, un pad de sintetizador aislado, un bucle de batería. Estos le dan al modelo un timbre claro de referencia.

Las mezclas cargadas de voces funcionan en contra: el modelo intenta clonar la voz en lugar de extraer el estilo de producción. Las mezclas completas densas se convierten en barro porque el modelo promedia todas las capas. Los clips de menos de 5 segundos llevan muy poca señal para algo útil.

En XL Turbo, incluso señales sutiles se transfieren: una caída de reverberación específica, el carácter de la compresión de cinta, la calidez particular de una cadena de grabación analógica. Las variantes de 3.5B captan los trazos generales pero pierden estos detalles.

Errores comunes

Cubrimos los errores de tags más arriba. Aquí están los que aparecen en las lyrics y los parámetros.

Las líneas de más de 10 sílabas fracturan el ritmo vocal. El modelo mete palabras en compases que no pueden sostenerlas: reescribe a 4-8 sílabas por línea y el ritmo se fija de inmediato.

Apilar cinco géneros de nicho (darkwave, witch house, phonk, vaporwave, drill) suena aventurado en el papel. En la práctica, el modelo no puede resolver tantas señales contradictorias y la salida colapsa en ruido. Un género principal más un modificador es el techo.

Un marcador [chorus] sin texto debajo no generará un estribillo pegadizo. Genera silencio. Escribe la letra del estribillo o renombra la sección como [inst].

Olvidar el marcador de idioma en letras que no son inglesas es el fallo más sigiloso. ¿Palabras polacas sin [pl] al principio de la sección? El modelo puede cantarlas con la fonética inglesa de todos modos.

Y la trampa del BPM: si lo omites de las tags, el modelo adivina. techno sin una tag de BPM explícita puede aterrizar en 115 en lugar de 130: lo bastante cerca para sonar mal, lo bastante lejos para arruinar el groove.