FilmoTvor.AI
Torna alle guide

Audio

Guida al prompt ACE-Step 1.5: come scrivere tag, strutturare i testi e generare musica migliore

9 min di letturaACE-Step non funziona come Suno. Niente casella di testo magica — ottieni due controlli: i tag che modellano il suono e i testi che modellano la struttura.

ACE-Step non funziona come Suno. Non c'è una magic text box in cui descrivi una canzone e preghi. Invece, ti dà due controlli separati: tag che modellano il suono, e lyrics che definiscono la struttura del brano. Comprendere la divisione tra i due è la differenza tra ottenere output casuale e ottenere il brano che senti realmente nella tua testa.

Perché i prompt di ACE-Step sono diversi

Gran parte degli strumenti di musica AI accetta una singola descrizione in linguaggio naturale. «Scrivimi una triste ballata al piano sull'amore perduto» – e il modello interpreta tutto insieme. Genere, umore, strumenti, testo, struttura – tutti aggrovigliati in un'unica frase.

ACE-Step separa queste preoccupazioni in due campi che non interferiscono tra loro.

tags (caption) è una lista di keyword separate da virgole che controllano l'audio. Genere, umore, strumenti, stile vocale, qualità di produzione, BPM. Pensala come un mixer: ogni tag è un fader.

lyrics porta il testo del brano più i marcatori strutturali – [verse], [chorus], [bridge] – e i tag di lingua come [en] o [ja]. Lascialo vuoto e il modello genera un brano strumentale.

Questo conta perché puoi cambiare l'intero genere modificando i tag mantenendo intatto lo stesso testo. Una ballata folk diventa un beat trap in pochi secondi, con le stesse parole su un paesaggio sonoro completamente diverso.

Come scrivere i tag

Un set di tag solido va da 5 a 12 keyword. Più di 15 e iniziano a diluirsi tra loro. L'ordine conta meno della specificità – grand piano sovraperforma piano, e fingerpicked acoustic guitar produce un risultato più nitido di guitar.

La formula

Il genere è sempre per primo

Il tag di genere ancora tutto il resto. ACE-Step copre un'ampia gamma:

Famiglia Tag che funzionano bene
Electronic techno, progressive house, trance, drum and bass, breakcore, darkwave, synthwave
Hip-hop trap, boom bap, drill, phonk, lo-fi hip-hop, cloud rap, uk drill
Rock indie rock, post-rock, shoegaze, dream pop, post-punk, grunge, doom metal
Pop synth-pop, city pop, k-pop, j-pop, indie pop, hyperpop
Jazz bebop, fusion, smooth jazz, gypsy jazz, cool jazz
Orchestral cinematic, trailer music, orchestral score, baroque, minimalist
Acoustic indie folk, bluegrass, bossa nova, americana, sea shanty
Ambient dark ambient, drone, new age, generative

Risultati fangosi con un genere di nicchia come darkwave o breakcore? Esegui lo stesso prompt su XL Turbo prima di riscrivere i tag. Il modello più grande (~10B parametri) risolve i generi di nicchia che le varianti 3.5B sfocano insieme.

Nominare strumenti, non aggettivi

«Grand piano, upright bass, brushed drums» dà al modello tre sorgenti sonore concrete da renderizzare. «Raffinato, elegante, sofisticato» non gli dà nulla con cui lavorare.

XL Turbo è anche dove gli strumenti rari brillano. hammered dulcimer, theremin, shakuhachi, prepared piano – questi producono timbri distinti su XL che i modelli 3.5B appiattiscono in qualcosa di generico.

I tag di produzione modellano il mix

Questi controllano la «finitura» sonica del brano. I tag di fedeltà (hi-fi, lo-fi, dusty, polished) impostano la chiarezza generale. I tag di carattere come analog warmth, tape saturation, e vinyl crackle aggiungono texture sopra. I tag spaziali (wide stereo, intimate, cinematic) definiscono quanto grande sembra il brano. E i tag di dinamica – compressed, sidechain pumping – modellano il comportamento del loudness.

La differenza è drammatica: lo-fi hip-hop, dusty, vinyl crackle, tape saturation e hip-hop, hi-fi, clean, wide stereo producono mix completamente diversi a partire dallo stesso testo.

Includi sempre il BPM

Impostalo sia nei tag (es. 88 bpm) sia come parametro bpm. Il modello usa entrambi gli input, e la coerenza tra i due stringe l'output ritmico.

Genere Range BPM tipico
Ballata / acustica 60-80
Lo-fi hip-hop 70-90
Pop 100-120
House 120-128
Techno 128-140
Trap (half-time) 130-145
Drum and bass 170-180

Tre errori con i tag che rovinano l'output

«Un bellissimo brano malinconico al piano sull'autunno a Parigi» sembra un prompt ragionevole. Non lo è. Il modello si aspetta keyword: piano ballad, melancholic, intimate, Parisian cafe, felt piano, 68 bpm.

Tag contraddittori causano un fallimento diverso. aggressive, serene o lo-fi, hi-fi, polished costringono il modello a oscillare tra poli invece di impegnarsi in uno dei due.

Infine, fai attenzione al BPM. Taggare techno a 70 bpm confonde il modello perché il techno vive a 128-140. Lento e scuro? Quello è dark ambient o downtempo, non techno lento.

Come strutturare i testi

I testi non sono solo parole – sono l'architettura del brano.

I marcatori di sezione dicono al modello cosa suonare

Ogni marcatore va in parentesi quadre, minuscolo:

Marcatore Scopo
[intro] Apertura strumentale
[verse] Strofa
[pre-chorus] Costruzione di tensione prima del ritornello
[chorus] Il ritornello – ripetilo
[bridge] Sezione di contrasto
[inst] Assolo strumentale o break
[build-up] Tensione crescente (elettronica)
[drop] Picco di rilascio energetico (EDM)
[breakdown] Strippare l'energia indietro (elettronica)
[outro] Chiusura

Un marcatore senza testo sotto diventa un passaggio strumentale. È così che crei assoli, interludi e transizioni senza alcuna voce.

Marcatori di lingua per brani multilingue

ACE-Step supporta 19 lingue. Le prime 10 performano meglio: [en], [zh], [ru], [es], [ja], [de], [fr], [pt], [it], [ko]. Altre (incluso [pl]) funzionano ma possono sottoperformare.

Posiziona il marcatore di lingua all'inizio di una sezione, mai a metà riga. Strofe in inglese con ritornello in giapponese in stile j-rock è una combinazione che funziona particolarmente bene su XL Turbo.

Tieni le righe corte

Il modello mappa le sillabe sui beat. Le righe di 4-8 sillabe fluiscono naturalmente. A 12+ sillabe, il ritmo vocale si frattura – il modello cerca di stipare troppe parole in troppo pochi beat.

Ripeti il ritornello. Aiuta il modello a bloccarsi su una melodia coerente. Gli schemi di rima AABB o ABAB suonano più naturali del verso libero, ma la rima non è obbligatoria.

Strumentali

Due modi per andare completamente strumentali:

  • Lascia i testi vuoti e aggiungi no vocals o instrumental ai tag

  • Usa solo marcatori di sezione senza testo: [intro][inst][outro]

Aggiungere no vocals nei tag mentre scrivi testo crea confusione – il modello può produrre inquietanti vocalizzazioni senza parole. Scegli un approccio e mantienilo.

Tre varianti, un formato di prompt

FilmoTvor.AI fa girare tre modelli ACE-Step 1.5. Tutti e tre accettano lo stesso formato di tag e testi – la differenza sta in qualità, velocità e controllo:

Turbo (3.5B) XL Turbo (~10B, INT8) Base (3.5B)
Step 8 (fissi) 8 (fissi) 5-100 (regolabili)
Guidance (CFG) 1 (fisso) 1 (fisso) 3-20 (regolabile)
Durata minima 10s 10s 30s
Generi di nicchia A volte manca Gestisce bene A volte manca
Lungo formato (200s+) Perde coerenza Regge Regge
Chiarezza vocale Adeguata Pulita La più pulita

Il workflow: schizza su Turbo (genera 5-10 varianti velocemente, trova l'arrangiamento che funziona), rifinisci su XL Turbo (qualità sonora migliore, gran parte dei brani è finita qui), lucida su Base con steps=40-60 (massima fedeltà per i render critici).

Per Base nello specifico, due parametri contano:

Gli Step controllano qualità vs. velocità. 27 è il punto ottimale per gran parte del lavoro. Sotto 15 ottieni bozze come Turbo. Sopra 60, i guadagni diventano impercettibili.

La Guidance (CFG) controlla quanto strettamente il modello segue i tuoi tag. A 5-7, suona sciolta e musicale. A 10-12, segue i tuoi tag da vicino. Sopra 15, diventa rigido e può introdurre artefatti. I prompt complessi beneficiano di CFG più alto; i prompt con genere semplice suonano meglio a valori più bassi.

5 esempi completi di prompt

1. Lo-fi hip-hop (boom bap, jazzy)

tags:

lyrics:

bpm: 88 · durata: 180s

Il [inst] prima dell'outro lascia spazio a un assolo di influenza jazz – su XL Turbo, aspettati una tromba sordata o un'improvvisazione al piano che fluttua sopra il loop boom bap.


2. Dark progressive techno (strumentale)

tags:

lyrics:

bpm: 134 · durata: 240s

La sequenza [build-up][drop] è essenziale per la musica elettronica. Il modello legge questi marcatori come istruzioni dinamiche: crescere, poi rilasciare. Due cicli di quel pattern creano un arrangiamento completo adatto ai DJ.


3. Chamber folk ballad (acustica, intima)

tags:

lyrics:

bpm: 68 · durata: 210s

Il materiale acustico beneficia più di Base con steps=40+. La chitarra fingerpicked e le armoniche del violoncello hanno bisogno di step di campionamento extra per renderizzare in modo pulito. Prototipa l'arrangiamento prima su XL Turbo, poi passa a Base per il render finale.


4. Hybrid orchestral trailer (cinematic)

tags:

lyrics:

bpm: 90 · durata: 120s

La musica da trailer dipende dal contrasto dinamico – tensione quieta contro esplosioni orchestrali. L'arco [build-up][inst][chorus] dà al modello una traiettoria chiara dal controllo al pieno potere.


5. Dark ambient (atmosferica, lungo formato)

tags:

lyrics:

bpm: 55 · durata: 270s

A 270 secondi, il vantaggio della variante XL Turbo sulla Turbo 3.5B diventa udibile. Il modello più piccolo tende a perdere coerenza oltre il segno dei 3 minuti – le texture vanno in loop o scivolano nel rumore. XL sostiene il paesaggio sonoro in evoluzione per l'intera durata.

La scorciatoia dell'audio di riferimento

Tutte e tre le varianti accettano ref_audio – un clip di 5-60 secondi che il modello tratta come riferimento di stile. Timbro, texture di produzione e umore del clip influenzano il brano generato.

Invia un frammento strumentale asciutto – 10-30 secondi, stile coerente per tutta la durata. Un intro di chitarra pulito, un pad di synth isolato, un drum loop. Questi danno al modello un timbro chiaro da referenziare.

I mix ricchi di voce si ritorcono contro: il modello cerca di clonare la voce invece di estrarre lo stile di produzione. I mix completi e densi si trasformano in fango perché il modello fa una media di tutti i livelli. I clip sotto i 5 secondi portano troppo poco segnale per qualcosa di utile.

Su XL Turbo, anche gli spunti sottili si trasferiscono – uno specifico decadimento del riverbero, il carattere della compressione a nastro, la particolare calore di una catena di registrazione analogica. Le varianti 3.5B colgono i tratti generali ma mancano questi dettagli.

Errori comuni

Abbiamo trattato gli errori con i tag sopra. Ecco quelli che compaiono nei testi e nei parametri.

Righe oltre le 10 sillabe fratturano il tempismo vocale. Il modello stipa parole in beat che non possono contenerle – riscrivi a 4-8 sillabe per riga e il ritmo si blocca immediatamente.

Sovrapporre cinque generi di nicchia (darkwave, witch house, phonk, vaporwave, drill) suona avventuroso sulla carta. In pratica, il modello non riesce a risolvere così tanti segnali in conflitto e l'output collassa in rumore. Un genere primario più un modificatore è il limite massimo.

Un marcatore [chorus] senza testo sotto non genererà un ritornello orecchiabile. Genera silenzio. Scrivi il testo del ritornello o rinomina la sezione [inst].

Dimenticare il marcatore di lingua su testi non in inglese è il fallimento più subdolo. Parole polacche senza [pl] all'inizio della sezione? Il modello può cantarle nella fonetica inglese a prescindere.

E la trappola del BPM: ometterlo dai tag, e il modello tira a indovinare. techno senza un tag BPM esplicito potrebbe atterrare a 115 invece di 130 – abbastanza vicino da suonare sbagliato, abbastanza lontano da rovinare il groove.