La voce
Servono trenta secondi di registrazione pulita — un telefono in una stanza senza eco basta. Da quel momento la voce è riusabile: si scrive il testo e lei lo legge, quante volte serve.
Il video che apre la home di questo sito è fatto così: un avatar generato al computer, e sopra la voce di Enrieta Fontana, clonata da una registrazione di ventisei secondi.
Non è una dimostrazione preparata per la pagina. È la prima cosa che vede chiunque arrivi su enrietabiz.com — e nel video stesso c'è la riga che lo dice.
Il video di presentazione della home. Volto generato, voce reale clonata. Parte muto: l'audio si accende dal pulsante.
La voce è stata registrata una volta sola, ventisei secondi in una stanza silenziosa. Da lì in poi non serve più registrare: si scrive il testo e la voce lo legge, con le stesse pause e la stessa inflessione.
Il volto invece non esiste. È un ritratto generato, animato sul parlato — la bocca, gli occhi e la testa seguono l'audio. È il pezzo che la gente nota per primo, ed è anche quello che va dichiarato per primo.
«Il volto che hai visto all'inizio è un avatar, però la voce è mia — te lo dico perché è esattamente il lavoro che faccio.»
Lo stesso montaggio esiste in italiano, inglese e tedesco. La registrazione di partenza resta una sola: le altre due lingue non sono mai state pronunciate davvero.
Commissionato dalla Moira Orfei Circus Academy per ricordare la sua fondatrice, scomparsa nel 2015. Settantadue secondi: un ritratto ricostruito dai materiali d'archivio, animato sul parlato, con una voce costruita per l'occasione.
È stato il lavoro più lungo di questo tipo che abbiamo fatto, e il più delicato: qui non si inventa un personaggio, si tocca il ricordo che una famiglia e un pubblico hanno di una persona vera. Ogni passaggio è stato guardato e approvato da chi l'ha commissionato, prima di essere montato.
«Non posso che esprimere la mia più profonda gratitudine per lo splendido lavoro svolto sul video dedicato a Moira Orfei. È stato un progetto lungo e impegnativo, un lavoro da brividi che ha saputo farla rivivere attraverso le immagini con una intensità straordinaria, e il risultato finale ha superato ogni aspettativa.»
Tre passaggi separati, che si possono comprare anche uno alla volta: la voce senza l'avatar, o l'avatar con una voce di catalogo.
Servono trenta secondi di registrazione pulita — un telefono in una stanza senza eco basta. Da quel momento la voce è riusabile: si scrive il testo e lei lo legge, quante volte serve.
O una vostra fotografia vera, o un ritratto generato se preferite non metterci la faccia. Frontale, luce piatta, spalle comprese: è l'inquadratura che regge meglio l'animazione.
Si scrive il copione, la voce lo legge, il volto lo pronuncia. Sottotitoli inclusi, presi dal testo scritto e non trascritti all'ascolto — così i nomi propri non vengono storpiati.
Questa tecnologia diventa un problema il giorno in cui serve a far dire a qualcuno una cosa che non ha detto. Le regole di casa sono queste, e valgono anche quando il cliente chiede il contrario.
La voce si clona una volta e poi resta: è la spesa più piccola delle tre, e si ammortizza dal secondo video in poi.
Il prezzo vero dipende da quanto dura il video, da quante lingue servono e da quanti giri di revisione mettete in conto. Un video di presentazione da un minuto è una cosa; settantadue secondi ricostruiti da materiale d'archivio, come il tributo, sono un'altra.
Si parte dal contenuto, non dal listino: raccontate cosa deve dire il video e a chi, e vi diciamo se conviene farlo così o in un altro modo.
Gli agenti che rispondono ai clienti al posto vostro
Agenti AI su misura →I flussi che tolgono il lavoro ripetitivo
Automazioni n8n →Cosa dicono le persone per cui abbiamo lavorato
Recensioni →A EnrietaBiz bastano trenta secondi di registrazione pulita: una stanza senza eco e il microfono del telefono. Non serve uno studio. La qualità del risultato dipende più dal silenzio di fondo che dalla durata: due minuti registrati male rendono meno di trenta secondi registrati bene.
Sì. EnrietaBiz genera un ritratto che non corrisponde a nessuna persona esistente e lo anima sul parlato. È quello che Enrieta Fontana ha fatto per il video di presentazione di enrietabiz.com: il volto è generato, la voce è la sua. In quel caso il testo deve dire che il volto è un avatar — è una regola della casa, non un'opzione.
Sì. Il video di presentazione di EnrietaBiz esiste in italiano, inglese e tedesco partendo da una sola registrazione in italiano: le altre due lingue non sono mai state pronunciate. L'accento resta quello di chi ha registrato, e su alcune lingue si sente — va provato prima di deciderlo.
Si può, e EnrietaBiz l'ha fatto: il tributo a Moira Orfei, settantadue secondi, commissionato dalla Moira Orfei Circus Academy. Si fa solo su richiesta di chi ne ha titolo — la famiglia, l'erede, la fondazione — e con l'approvazione riga per riga di quello che il video dice. Senza quella, non si parte.
Per un video di presentazione di un minuto, con voce clonata e avatar, EnrietaBiz lavora su qualche giorno: la voce si clona in un pomeriggio, il resto è copione e revisioni. I lavori di ricostruzione da materiale d'archivio, come il tributo a Moira Orfei, richiedono settimane e si preventivano a parte.
Portate il testo che dovrebbe dire, o anche solo l'idea. In mezz'ora si capisce se la strada è questa — e se non lo è, ve lo diciamo.
Prenota mezz'ora