Applicazione desktop per Windows · voce, musica e ducking automatico in un unico passaggio

Condividi

CDF Eleven TTS è l’applicazione che ho realizzato per produrre spot audio senza passare da uno studio di registrazione. Si scrive il testo, si sceglie la voce, si aggiunge una musica di sottofondo, e in pochi secondi esce un MP3 pronto da mandare in onda. Nasce dall’esigenza pratica di preparare annunci e comunicazioni di servizio in tempi rapidi, mantenendo però un risultato che suoni professionale.

La schermata principale di CDF Eleven TTS con la scheda Connessione

Il cuore del progetto è la gestione automatica del rapporto tra voce e musica. Quando la voce parla, la base musicale si abbassa da sola; quando la voce finisce, la musica torna al volume pieno e sfuma. È lo stesso effetto che in radio si ottiene manualmente al mixer, qui calcolato con precisione: l’applicazione sa esattamente dove inizia e dove finisce il parlato, quindi il risultato è pulito e ripetibile, senza aggiustamenti a orecchio.

La scheda Sottofondo con i parametri di ducking automatico

Qui sotto un esempio prodotto interamente con l’applicazione: voce, sottofondo e ducking, dal testo al file finito.

Uno spot generato con CDF Eleven TTS

Si può partire da un testo scritto a mano oppure farsi aiutare: c’è una funzione che genera il copy dello spot descrivendo semplicemente cosa serve — per esempio “spot di trenta secondi per una gelateria, tono allegro”. Il testo prodotto compare pronto da rileggere e correggere prima di darlo in voce.

La generazione assistita del testo dello spot

Per chi ha già una voce registrata, l’applicazione può saltare del tutto la parte di sintesi e limitarsi a montare la musica sotto il parlato esistente. E quando i contenuti da produrre sono tanti, basta preparare una cartella di file di testo: l’applicazione li lavora tutti in sequenza, generando uno spot completo per ciascuno.

La scheda Contenuto con le tre modalità di lavorazione

La musica può arrivare da quattro strade: un file proprio, una base generata su richiesta descrivendo lo stile desiderato, una ricerca tra brani liberi, oppure la libreria di sottofondi già pronti inclusa nel progetto — brani catalogati per atmosfera, dal corporate al retrò anni Ottanta, ampliabile semplicemente aggiungendo file in una cartella. Un’anteprima con contatore permette di ascoltare la traccia e individuare il secondo esatto da cui farla partire, utile quando la parte buona di un brano non è l’inizio.

La libreria dei sottofondi musicali predefiniti con filtro di ricerca

Il risultato è uno strumento che comprime in pochi minuti un lavoro che altrimenti richiederebbe registrazione, montaggio ed esportazione separati — utile per annunci commerciali, comunicazioni di servizio, sigle parlate e contenuti didattici.

Aspetti tecnici

Applicazione desktop Windows scritta in Python con interfaccia tkinter, distribuita come eseguibile singolo tramite PyInstaller. Sintesi vocale con ElevenLabs (modello Eleven v3, tag espressivi supportati), generazione testi con Gemini, basi musicali da Eleven Music o Jamendo. Il motore di mix è realizzato senza ffmpeg: decodifica con miniaudio, inviluppo del volume e sovrapposizione con numpy e protezione anti-clipping, riesportazione MP3 con lameenc. Elaborazione in batch su cartelle di testi, anteprima con posizione e durata, e libreria di sottofondi espandibile.

← Tutti i progetti

Radio D&D
Privacy e cookie