Die Stimme
Dreissig Sekunden saubere Aufnahme genügen — ein Telefon in einem Raum ohne Hall reicht. Ab da ist die Stimme wiederverwendbar: man schreibt den Text, und sie liest ihn, so oft es nötig ist.
Das Video auf der Startseite dieser Website ist genau so gemacht: ein am Computer erzeugter Avatar, darüber die Stimme von Enrieta Fontana, geklont aus einer Aufnahme von sechsundzwanzig Sekunden.
Das ist keine Demo, die für diese Seite gebaut wurde. Es ist das Erste, was jede Besucherin und jeder Besucher von enrietabiz.com sieht — und das Video sagt es selbst.
Das Präsentationsvideo der Startseite. Generiertes Gesicht, echte geklonte Stimme. Es startet stumm: der Ton lässt sich über die Schaltfläche einschalten.
Die Stimme wurde ein einziges Mal aufgenommen: sechsundzwanzig Sekunden in einem stillen Raum. Danach muss nichts mehr aufgenommen werden — man schreibt den Text, und die Stimme liest ihn, mit denselben Pausen und derselben Betonung.
Das Gesicht dagegen existiert nicht. Es ist ein generiertes Porträt, animiert auf das Gesprochene: Mund, Augen und Kopf folgen dem Ton. Es ist der Teil, den man zuerst bemerkt — und damit auch der Teil, der zuerst benannt gehört.
«Das Gesicht, das Sie am Anfang gesehen haben, ist ein Avatar. Und die Stimme ist meine — geklont. Ich sage es, weil genau das meine Arbeit ist.»
Denselben Schnitt gibt es auf Italienisch, Englisch und Deutsch. Die Ausgangsaufnahme bleibt eine einzige: die beiden anderen Sprachen wurden nie wirklich gesprochen.
In Auftrag gegeben von der Moira Orfei Circus Academy, zur Erinnerung an ihre Gründerin, die 2015 gestorben ist. Zweiundsiebzig Sekunden: ein aus Archivmaterial rekonstruiertes Porträt, animiert auf das Gesprochene, mit einer eigens dafür gebauten Stimme.
Es war die längste Arbeit dieser Art, die wir gemacht haben, und die heikelste: hier erfindet man keine Figur, hier berührt man die Erinnerung, die eine Familie und ein Publikum an einen echten Menschen haben. Jeder Schritt wurde von den Auftraggebern gesehen und freigegeben, bevor überhaupt geschnitten wurde.
«Ich kann nur meine tiefste Dankbarkeit für die wunderbare Arbeit am Video über Moira Orfei ausdrücken. Es war ein langes und anspruchsvolles Projekt, eine Arbeit, die Gänsehaut macht und sie in den Bildern mit ausserordentlicher Intensität wieder hat aufleben lassen — das Ergebnis hat jede Erwartung übertroffen.»
Drei getrennte Schritte, die man auch einzeln kaufen kann: die Stimme ohne Avatar, oder den Avatar mit einer Stimme aus dem Katalog.
Dreissig Sekunden saubere Aufnahme genügen — ein Telefon in einem Raum ohne Hall reicht. Ab da ist die Stimme wiederverwendbar: man schreibt den Text, und sie liest ihn, so oft es nötig ist.
Entweder ein echtes Foto von Ihnen oder ein generiertes Porträt, wenn Sie Ihr Gesicht lieber nicht hergeben. Frontal, flaches Licht, Schultern im Bild: das ist der Ausschnitt, der die Animation am besten trägt.
Das Skript wird geschrieben, die Stimme liest es, das Gesicht spricht es. Untertitel inklusive, aus dem geschriebenen Text gesetzt und nicht nach Gehör transkribiert — so werden Eigennamen nicht verstümmelt.
Diese Technik wird an dem Tag zum Problem, an dem sie jemanden etwas sagen lässt, das er nie gesagt hat. Das sind die Hausregeln, und sie gelten auch dann, wenn ein Kunde das Gegenteil verlangt.
Die Stimme wird einmal geklont und bleibt dann: das ist der kleinste der drei Posten, und er rechnet sich ab dem zweiten Video.
Der eigentliche Preis hängt davon ab, wie lang das Video ist, wie viele Sprachen es braucht und wie viele Korrekturrunden Sie einplanen. Ein Präsentationsvideo von einer Minute ist das eine; zweiundsiebzig aus Archivmaterial rekonstruierte Sekunden wie bei der Hommage sind etwas ganz anderes.
Wir fangen beim Inhalt an, nicht bei der Preisliste: sagen Sie, was das Video sagen soll und zu wem — wir sagen Ihnen, ob dieser Weg der richtige ist.
Die Agenten, die Ihren Kundinnen und Kunden für Sie antworten
Massgeschneiderte KI-Agenten →Die Abläufe, die die wiederkehrende Arbeit wegnehmen
n8n-Automatisierungen →Was die Menschen sagen, für die wir gearbeitet haben
Bewertungen →Bei EnrietaBiz genügen dreissig Sekunden saubere Aufnahme: ein Raum ohne Hall und das Mikrofon eines Telefons. Ein Studio ist nicht nötig. Die Qualität hängt mehr von der Stille im Hintergrund ab als von der Länge — zwei schlecht aufgenommene Minuten bringen weniger als dreissig gut aufgenommene Sekunden.
Ja. EnrietaBiz erzeugt ein Porträt, das keiner existierenden Person entspricht, und animiert es auf das Gesprochene. Genau das hat Enrieta Fontana für das Präsentationsvideo von enrietabiz.com gemacht: das Gesicht ist generiert, die Stimme ist ihre. In diesem Fall muss der Text sagen, dass das Gesicht ein Avatar ist — das ist eine Hausregel, keine Option.
Ja. Das Präsentationsvideo von EnrietaBiz gibt es auf Italienisch, Englisch und Deutsch, ausgehend von einer einzigen italienischen Aufnahme: die beiden anderen Sprachen wurden nie gesprochen. Der Akzent bleibt der der aufnehmenden Person, und in manchen Sprachen hört man ihn — deshalb wird das vorher geprüft und nicht vorher versprochen.
Man kann, und EnrietaBiz hat es getan: die Hommage an Moira Orfei, zweiundsiebzig Sekunden, in Auftrag gegeben von der Moira Orfei Circus Academy. Es geschieht nur auf Wunsch derer, die dazu befugt sind — Familie, Erben, Stiftung — und mit zeilenweiser Freigabe dessen, was das Video sagt. Ohne die wird nicht angefangen.
Für ein Präsentationsvideo von einer Minute mit geklonter Stimme und Avatar arbeitet EnrietaBiz in Tagen: die Stimme ist an einem Nachmittag geklont, der Rest ist Skript und Korrekturen. Rekonstruktionen aus Archivmaterial wie die Hommage an Moira Orfei brauchen Wochen und werden separat offeriert.
Bringen Sie den Text mit, den es sagen soll — oder auch nur die Idee. Eine halbe Stunde genügt, um zu sehen, ob das der richtige Weg ist. Und wenn nicht, sagen wir es Ihnen.
Halbe Stunde buchen