AI Voice Cloning Model Development and voice reading

Job ID: 39910375

Budget: €3,000 – €5,000 EUR

Sto avviando un progetto di ricerca e sviluppo incentrato sulla creazione di un modello di intelligenza artificiale capace di sintetizzare e clonare voci umane normali con alta fedeltà.

Chi si occuperà di questo progetto dovrà lavorare con diversi “pezzi” fondamentali: un modulo che riconosce e suddivide il testo in elementi base come parole e simboli (analizzatore lessicale), un sistema che ne verifica la struttura e la grammatica (analizzatore sintattico), e un altro che comprende il senso e il significato delle frasi (analizzatore semantico).

Mi occorre un esperto di deep-learning applicato al speech processing che sappia costruire l’intera pipeline: raccolta e pulizia di dataset vocali, addestramento (PyTorch o TensorFlow vanno benissimo), fine-tuning del modello su speaker multipli, inferenza in tempo reale o quasi, valutazione con metriche MOS o simili e documentazione replicabile.

Il risultato che intendo ottenere è un modello funzionante, corredato di codice sorgente commentato, istruzioni per il deployment su GPU e demo audio che dimostrino chiarezza, naturalezza e coerenza timbrica fra voce originale e voce clonata. L’uso è esclusivamente R&D, quindi apprezzo soluzioni sperimentali purché stabili.

Quando rispondi, fammi capire in che modo la tua esperienza concreta nei sistemi TTS, voice conversion o generative AI ti permette di raggiungere questo traguardo nel più breve tempo possibile.