Hauptmenü

Neuigkeiten:

Bitte unterstützt uns und bestellt über diese Links bei Amazon  oder HumbleBumble!

Tonrestaurierung mit KI, am Beispiel Zeitansage mit Elvira Bader von 58 bis 05

Begonnen von LogicDeLuxe, 06. Oktober 2026, 10:03:07

Vorheriges Thema - Nächstes Thema

LogicDeLuxe

Viele unter uns kennen sie sicher noch, die telefonische Zeitansage. Die Original-Aufnahen gibt es hier: https://archive.org/details/Zeitansage
Leider ist die Tonqualität ziemlich bescheiden. Daß es die mal in besser gab, kann man in "Die Sendung mit der Maus" hören. Wer die Folge nicht kennt, einfach mal nach Zeitansage suchen.

Ich hab zur Restauration jetzt Seed-VC etwas zweckentfremdet, da es eigentlich ein Stimm-Tauscher ist, der auch singen kann. Ich hab also das Zeitansage-Beispiel aus der erwähnten Sendung als Referenz-Stimme verwendet, und die Samples von Archive.org für den gesprochenen Referenz-Text. Im Grunde funktioniert das. Die Tonqualität ist gut, der Sprech-Rythmus und Sprach-Melodie bleiben erhalten. Blöd ist allerdings, daß die Stimmen mit diesem Tool immer einen amerikanischen Akzent bekommen.

Hat jemand eine Idee, wie man das akzentfrei bekommen kann, bzw. wie es wahlweise den Akzent der Referenz-Stimme oder dem Referenz-Text beibehalten kann? Das wäre praktisch die Perfektion des Stimmentauschens. Bitte keine Abos! Mich interessieren nur Sachen, die man lokal installieren kann.

Entrauscht habe ich den Sample der Sendung übrigens mit StemDeck: https://github.com/stemdeckapp/stemdeck
Eigentlich dient das Programm dazu, Musikspuren aus dem fertigen Mix zu trennen, was es meistens auch ziemlich gut macht, aber ich habe festgestellt, daß es sich auch prima eignet, um Sprachaufnahmen vom Rauschen zu befreien.

Seed-VC gibt es hier: https://github.com/Plachtaa/seed-vc

Meine rekonstruierte Zeitansage mit Bash-Script hier: https://abmischung.de/files/Zeitansage_KI-Remastered.zip

Das war mir in erster Linie als Machbarkeitsstudie gedacht. Es gibt ja z.B. einige alte DOS-Spiele mit Sprachausgabe in nur 8bit, 11025 Hz, was schon damals unnötig bescheiden klang. Da es sich meist um Profisprecher handelt, sind Referenz-Stimmen-Aufnahmen ja leicht zu beschaffen, z.B. aus jüngeren Spielen, Filmen, Serien oder Hörspielen. Nur der amerikanische Akzent hindert mich noch daran, das ernsthaft anwenden zu können.

Wenn es um neue Sätze geht, ist übrigens OmniVoice von hervorragender Qualität und das sogar ziemlich schnell: https://github.com/k2-fsa/OmniVoice
Das spricht auch akzentfrei, bzw. mit einem wählbaren Akzent, und beherrscht zahlreiche Sprachen. Da hat man aber eben das übliche Problem, daß dem die menschliche Komponente fehlt. Es ist kaum möglich, Emotionen damit zu vermitteln. Die Betonung hängt vom Seed ab und ist nicht vorhersehbar.