ACE-Step non funziona come Suno. Non c'è una magic text box in cui descrivi una canzone e preghi. Invece, ti dà due controlli separati: tag che modellano il suono, e lyrics che definiscono la struttura del brano. Comprendere la divisione tra i due è la differenza tra ottenere output casuale e ottenere il brano che senti realmente nella tua testa.
Perché i prompt di ACE-Step sono diversi
Gran parte degli strumenti di musica AI accetta una singola descrizione in linguaggio naturale. «Scrivimi una triste ballata al piano sull'amore perduto» – e il modello interpreta tutto insieme. Genere, umore, strumenti, testo, struttura – tutti aggrovigliati in un'unica frase.
ACE-Step separa queste preoccupazioni in due campi che non interferiscono tra loro.
tags (caption) è una lista di keyword separate da virgole che controllano l'audio. Genere, umore, strumenti, stile vocale, qualità di produzione, BPM. Pensala come un mixer: ogni tag è un fader.
lyrics porta il testo del brano più i marcatori strutturali – [verse], [chorus], [bridge] – e i tag di lingua come [en] o [ja]. Lascialo vuoto e il modello genera un brano strumentale.
Questo conta perché puoi cambiare l'intero genere modificando i tag mantenendo intatto lo stesso testo. Una ballata folk diventa un beat trap in pochi secondi, con le stesse parole su un paesaggio sonoro completamente diverso.
Come scrivere i tag
Un set di tag solido va da 5 a 12 keyword. Più di 15 e iniziano a diluirsi tra loro. L'ordine conta meno della specificità – grand piano sovraperforma piano, e fingerpicked acoustic guitar produce un risultato più nitido di guitar.
La formula
Il genere è sempre per primo
Il tag di genere ancora tutto il resto. ACE-Step copre un'ampia gamma:
| Famiglia | Tag che funzionano bene |
|---|---|
| Electronic | techno, progressive house, trance, drum and bass, breakcore, darkwave, synthwave |
| Hip-hop | trap, boom bap, drill, phonk, lo-fi hip-hop, cloud rap, uk drill |
| Rock | indie rock, post-rock, shoegaze, dream pop, post-punk, grunge, doom metal |
| Pop | synth-pop, city pop, k-pop, j-pop, indie pop, hyperpop |
| Jazz | bebop, fusion, smooth jazz, gypsy jazz, cool jazz |
| Orchestral | cinematic, trailer music, orchestral score, baroque, minimalist |
| Acoustic | indie folk, bluegrass, bossa nova, americana, sea shanty |
| Ambient | dark ambient, drone, new age, generative |
Risultati fangosi con un genere di nicchia come darkwave o breakcore? Esegui lo stesso prompt su XL Turbo prima di riscrivere i tag. Il modello più grande (~10B parametri) risolve i generi di nicchia che le varianti 3.5B sfocano insieme.
Nominare strumenti, non aggettivi
«Grand piano, upright bass, brushed drums» dà al modello tre sorgenti sonore concrete da renderizzare. «Raffinato, elegante, sofisticato» non gli dà nulla con cui lavorare.
XL Turbo è anche dove gli strumenti rari brillano. hammered dulcimer, theremin, shakuhachi, prepared piano – questi producono timbri distinti su XL che i modelli 3.5B appiattiscono in qualcosa di generico.
I tag di produzione modellano il mix
Questi controllano la «finitura» sonica del brano. I tag di fedeltà (hi-fi, lo-fi, dusty, polished) impostano la chiarezza generale. I tag di carattere come analog warmth, tape saturation, e vinyl crackle aggiungono texture sopra. I tag spaziali (wide stereo, intimate, cinematic) definiscono quanto grande sembra il brano. E i tag di dinamica – compressed, sidechain pumping – modellano il comportamento del loudness.
La differenza è drammatica: lo-fi hip-hop, dusty, vinyl crackle, tape saturation e hip-hop, hi-fi, clean, wide stereo producono mix completamente diversi a partire dallo stesso testo.
Includi sempre il BPM
Impostalo sia nei tag (es. 88 bpm) sia come parametro bpm. Il modello usa entrambi gli input, e la coerenza tra i due stringe l'output ritmico.
| Genere | Range BPM tipico |
|---|---|
| Ballata / acustica | 60-80 |
| Lo-fi hip-hop | 70-90 |
| Pop | 100-120 |
| House | 120-128 |
| Techno | 128-140 |
| Trap (half-time) | 130-145 |
| Drum and bass | 170-180 |
Tre errori con i tag che rovinano l'output
«Un bellissimo brano malinconico al piano sull'autunno a Parigi» sembra un prompt ragionevole. Non lo è. Il modello si aspetta keyword: piano ballad, melancholic, intimate, Parisian cafe, felt piano, 68 bpm.
Tag contraddittori causano un fallimento diverso. aggressive, serene o lo-fi, hi-fi, polished costringono il modello a oscillare tra poli invece di impegnarsi in uno dei due.
Infine, fai attenzione al BPM. Taggare techno a 70 bpm confonde il modello perché il techno vive a 128-140. Lento e scuro? Quello è dark ambient o downtempo, non techno lento.
Come strutturare i testi
I testi non sono solo parole – sono l'architettura del brano.
I marcatori di sezione dicono al modello cosa suonare
Ogni marcatore va in parentesi quadre, minuscolo:
| Marcatore | Scopo |
|---|---|
[intro] |
Apertura strumentale |
[verse] |
Strofa |
[pre-chorus] |
Costruzione di tensione prima del ritornello |
[chorus] |
Il ritornello – ripetilo |
[bridge] |
Sezione di contrasto |
[inst] |
Assolo strumentale o break |
[build-up] |
Tensione crescente (elettronica) |
[drop] |
Picco di rilascio energetico (EDM) |
[breakdown] |
Strippare l'energia indietro (elettronica) |
[outro] |
Chiusura |
Un marcatore senza testo sotto diventa un passaggio strumentale. È così che crei assoli, interludi e transizioni senza alcuna voce.
Marcatori di lingua per brani multilingue
ACE-Step supporta 19 lingue. Le prime 10 performano meglio: [en], [zh], [ru], [es], [ja], [de], [fr], [pt], [it], [ko]. Altre (incluso [pl]) funzionano ma possono sottoperformare.
Posiziona il marcatore di lingua all'inizio di una sezione, mai a metà riga. Strofe in inglese con ritornello in giapponese in stile j-rock è una combinazione che funziona particolarmente bene su XL Turbo.
Tieni le righe corte
Il modello mappa le sillabe sui beat. Le righe di 4-8 sillabe fluiscono naturalmente. A 12+ sillabe, il ritmo vocale si frattura – il modello cerca di stipare troppe parole in troppo pochi beat.
Ripeti il ritornello. Aiuta il modello a bloccarsi su una melodia coerente. Gli schemi di rima AABB o ABAB suonano più naturali del verso libero, ma la rima non è obbligatoria.
Strumentali
Due modi per andare completamente strumentali:
Lascia i testi vuoti e aggiungi
no vocalsoinstrumentalai tagUsa solo marcatori di sezione senza testo:
[intro]→[inst]→[outro]
Aggiungere no vocals nei tag mentre scrivi testo crea confusione – il modello può produrre inquietanti vocalizzazioni senza parole. Scegli un approccio e mantienilo.
Tre varianti, un formato di prompt
FilmoTvor.AI fa girare tre modelli ACE-Step 1.5. Tutti e tre accettano lo stesso formato di tag e testi – la differenza sta in qualità, velocità e controllo:
| Turbo (3.5B) | XL Turbo (~10B, INT8) | Base (3.5B) | |
|---|---|---|---|
| Step | 8 (fissi) | 8 (fissi) | 5-100 (regolabili) |
| Guidance (CFG) | 1 (fisso) | 1 (fisso) | 3-20 (regolabile) |
| Durata minima | 10s | 10s | 30s |
| Generi di nicchia | A volte manca | Gestisce bene | A volte manca |
| Lungo formato (200s+) | Perde coerenza | Regge | Regge |
| Chiarezza vocale | Adeguata | Pulita | La più pulita |
Il workflow: schizza su Turbo (genera 5-10 varianti velocemente, trova l'arrangiamento che funziona), rifinisci su XL Turbo (qualità sonora migliore, gran parte dei brani è finita qui), lucida su Base con steps=40-60 (massima fedeltà per i render critici).
Per Base nello specifico, due parametri contano:
Gli Step controllano qualità vs. velocità. 27 è il punto ottimale per gran parte del lavoro. Sotto 15 ottieni bozze come Turbo. Sopra 60, i guadagni diventano impercettibili.
La Guidance (CFG) controlla quanto strettamente il modello segue i tuoi tag. A 5-7, suona sciolta e musicale. A 10-12, segue i tuoi tag da vicino. Sopra 15, diventa rigido e può introdurre artefatti. I prompt complessi beneficiano di CFG più alto; i prompt con genere semplice suonano meglio a valori più bassi.
5 esempi completi di prompt
1. Lo-fi hip-hop (boom bap, jazzy)
tags:
lyrics:
bpm: 88 · durata: 180s
Il [inst] prima dell'outro lascia spazio a un assolo di influenza jazz – su XL Turbo, aspettati una tromba sordata o un'improvvisazione al piano che fluttua sopra il loop boom bap.
2. Dark progressive techno (strumentale)
tags:
lyrics:
bpm: 134 · durata: 240s
La sequenza [build-up] → [drop] è essenziale per la musica elettronica. Il modello legge questi marcatori come istruzioni dinamiche: crescere, poi rilasciare. Due cicli di quel pattern creano un arrangiamento completo adatto ai DJ.
3. Chamber folk ballad (acustica, intima)
tags:
lyrics:
bpm: 68 · durata: 210s
Il materiale acustico beneficia più di Base con steps=40+. La chitarra fingerpicked e le armoniche del violoncello hanno bisogno di step di campionamento extra per renderizzare in modo pulito. Prototipa l'arrangiamento prima su XL Turbo, poi passa a Base per il render finale.
4. Hybrid orchestral trailer (cinematic)
tags:
lyrics:
bpm: 90 · durata: 120s
La musica da trailer dipende dal contrasto dinamico – tensione quieta contro esplosioni orchestrali. L'arco [build-up] → [inst] → [chorus] dà al modello una traiettoria chiara dal controllo al pieno potere.
5. Dark ambient (atmosferica, lungo formato)
tags:
lyrics:
bpm: 55 · durata: 270s
A 270 secondi, il vantaggio della variante XL Turbo sulla Turbo 3.5B diventa udibile. Il modello più piccolo tende a perdere coerenza oltre il segno dei 3 minuti – le texture vanno in loop o scivolano nel rumore. XL sostiene il paesaggio sonoro in evoluzione per l'intera durata.
La scorciatoia dell'audio di riferimento
Tutte e tre le varianti accettano ref_audio – un clip di 5-60 secondi che il modello tratta come riferimento di stile. Timbro, texture di produzione e umore del clip influenzano il brano generato.
Invia un frammento strumentale asciutto – 10-30 secondi, stile coerente per tutta la durata. Un intro di chitarra pulito, un pad di synth isolato, un drum loop. Questi danno al modello un timbro chiaro da referenziare.
I mix ricchi di voce si ritorcono contro: il modello cerca di clonare la voce invece di estrarre lo stile di produzione. I mix completi e densi si trasformano in fango perché il modello fa una media di tutti i livelli. I clip sotto i 5 secondi portano troppo poco segnale per qualcosa di utile.
Su XL Turbo, anche gli spunti sottili si trasferiscono – uno specifico decadimento del riverbero, il carattere della compressione a nastro, la particolare calore di una catena di registrazione analogica. Le varianti 3.5B colgono i tratti generali ma mancano questi dettagli.
Errori comuni
Abbiamo trattato gli errori con i tag sopra. Ecco quelli che compaiono nei testi e nei parametri.
Righe oltre le 10 sillabe fratturano il tempismo vocale. Il modello stipa parole in beat che non possono contenerle – riscrivi a 4-8 sillabe per riga e il ritmo si blocca immediatamente.
Sovrapporre cinque generi di nicchia (darkwave, witch house, phonk, vaporwave, drill) suona avventuroso sulla carta. In pratica, il modello non riesce a risolvere così tanti segnali in conflitto e l'output collassa in rumore. Un genere primario più un modificatore è il limite massimo.
Un marcatore [chorus] senza testo sotto non genererà un ritornello orecchiabile. Genera silenzio. Scrivi il testo del ritornello o rinomina la sezione [inst].
Dimenticare il marcatore di lingua su testi non in inglese è il fallimento più subdolo. Parole polacche senza [pl] all'inizio della sezione? Il modello può cantarle nella fonetica inglese a prescindere.
E la trappola del BPM: ometterlo dai tag, e il modello tira a indovinare. techno senza un tag BPM esplicito potrebbe atterrare a 115 invece di 130 – abbastanza vicino da suonare sbagliato, abbastanza lontano da rovinare il groove.
