Hier findest du Neuigkeiten rund um offene Sprachtechnologien im Allgemeinen und Thorsten-Voice im Speziellen. Neue Modelle, Presse und Vorträge.
Am 15. August spreche ich auf der FrOSCon erstmals öffentlich über die gesellschaftliche Seite von KI-Stimmenklonen – aus meiner ganz persönlichen Perspektive als Stimmenspender.
Ein neues freies TTS-Modell auf Basis von CosyVoice3 — kostenlos, offen lizenziert und vollständig lokal nutzbar, ohne Cloud und ohne Datenweitergabe.
Ich durfte einen Blogpost für das Mozilla Data Collective schreiben — über meine Beweggründe, Zweifel und was aus der Stimmspende geworden ist.
Alle meine Thorsten-Voice Sprachdatensätze sind jetzt zusätzlich über das Mozilla Data Collective (MDC) verfügbar — weiterhin CC0-lizenziert.
Ein neues Modell auf Basis von Orpheus TTS — klingt es wirklich natürlicher als die bisherigen? Ich bitte um eure Schwarm-Ohren.
Vom kleinen Nischenprojekt zu 10.000 Menschen, die sich für offene Sprachtechnologie begeistern. Ein Dankeschön an die Community.
Ein Artikel über das Thorsten-Voice-Projekt ist bei SPIEGEL Online (Netzwelt) erschienen — über die Entstehungsgeschichte, die Motivation hinter der Stimmspende und digitale Souveränität.
Ich durfte auf der Jubiläumsausgabe (20 Jahre) der Free and Open Source Software Conference einen Vortrag halten.
Freie, lokal nutzbare TTS-Sprachmodelle in Deutsch — ganz ohne Cloud-Zwang. Mein Artikel in der aktuellen Ausgabe des entwickler.de-Magazins.
Warum Sprachsynthese nicht proprietär und intransparent sein muss — und wie Thorsten-Voice einen anderen Akzent setzt.
Das Projekt wurde in den vergangenen Monaten in verschiedenen Medien aufgegriffen — von Fachzeitschriften über Blogs bis zur Tagespresse.
Coqui TTS wird seit der Schließung von Coqui AI nicht mehr gepflegt und läuft offiziell nur bis Python 3.11 — ein Community-Fork schafft Abhilfe.
Netzpolitik.org hat einen Artikel über das Thorsten-Voice-Projekt veröffentlicht: „Dieser Mann hat seine Stimme verschenkt.“
Die Wetterauer Zeitung, die Frankfurter Neue Presse und die Frankfurter Rundschau berichten über das Thorsten-Voice-Projekt.
Ein YouTube-Tutorial zeigt, wie Text-Preprocessing (Cleaning/Normalisierung) jede TTS-Stimme von robotisch zu natürlich klingend verbessert.
Neue Tutorial-Reihe zur Home Assistant Voice Preview Edition — vom Unboxing bis zum lokalen, datenschutzfreundlichen Setup mit Whisper und Piper.
Rückblick auf ein starkes YouTube-Jahr: über 355.000 Views, 3.738 neue Abonnenten und 34 Uploads rund um offene Sprachtechnologie.
Schritt-für-Schritt-Tutorial zu F5 TTS: lokales Voice-Cloning mit nur wenigen Sekunden Audio-Input, inklusive Lizenzüberblick und Hugging-Face-Demo.
Seit Oktober 2019 unterstützt Thorsten-Voice die Open-Source-Sprachtechnologie-Community — zum Geburtstag gibt's alle Datensätze in 44kHz.
Zu Gast im Deutschlandradio-Podcast „KI Verstehen“: ein Gespräch über die Bedeutung von Open Source im KI-Umfeld — inklusive hessischer Sprachprobe.
Aus privatem Lokalpatriotismus: ein Text der Stadt Frankfurt, vorgelesen von der (süd)hessisch babbelnden Thorsten-Voice.
Erste Schritte auf Mastodon als Twitter/X-Alternative — zu finden unter @thorstenvoice auf techhub.social.
Über 2.000 Aufnahmen im (süd)hessischen Dialekt, CC0-lizenziert auf Zenodo — für KI, Machine Learning, Wissenschaft und Forschung nutzbar.
Die erste Version der kostenlosen, (süd)hessisch babbelnden künstlichen Sprachausgabe ist verfügbar.
Ankündigung eines neuen TTS-Modells: (Süd)Hessisch als freie, künstliche Stimme — kostenlos, offline und offen lizenziert.
Nach dem „low“- und „medium“-Modell folgt jetzt auch die hochwertige „high“-Qualitätsstufe für Piper TTS.
Vortrag „Qualitative und freie Sprachsynthese – darf's ein bisschen weniger Cloud sein?“ auf der großen deutschen Open-Source-Konferenz.
Das Thorsten-Voice-Projekt im gedruckten t3n-Magazin und im t3n-Catchup-Podcast der Heise-Gruppe.
Neue Schritt-für-Schritt-Anleitungen auf YouTube: Thorsten-Voice einrichten unter Windows, Linux, macOS, Raspberry Pi und in Home Assistant.
Vortrag beim 109. Webmontag Frankfurt über die Vorteile freier, Open-Source-künstlicher TTS-Stimmen und die Ziele des Thorsten-Voice-Projekts.
Dank Mimic 3 kann Thorsten-Voice auch emotional betonen — fröhlich, wütend, angewidert, müde oder flüsternd.
Ein eigener Hugging-Face-Space macht es möglich, die Thorsten-Voice-Stimme direkt im Browser mit eigenen Texten auszuprobieren — ganz ohne Installation.
Der neue Sprachdatensatz steht unter CC0-Lizenz zum freien Download bereit — bitte bei Nutzung die DOI zitieren.
Ankündigung des Datensatzes „Thorsten-22.10“ mit über 12.400 Aufnahmen und 11+ Stunden Audiomaterial.
Nach einer Community-Abstimmung ist das neue Modell seit heute per Coqui TTS 0.8.0 direkt einsetzbar.
Community-Abstimmung zwischen zwei neu trainierten TTS-Modellen — nur eines schafft es in die Veröffentlichung.
Golem.de beschreibt anhand meiner Thorsten-Voice-Stimme den Ablauf zur Erzeugung einer eigenen TTS-Stimme.
Ein komplett neu aufgenommener Sprachdatensatz (Thorsten-22.05-neutral) und ein neues VITS-Modell, trainiert mit Coqui TTS.
Hörprobe zum Vergleich zwischen dem bestehenden Thorsten-Modell (Tacotron2 DCA + Fullband MelGAN) und dem Modell in Arbeit (Tacotron2 DDC + HifiGAN).
Dominik und ich experimentieren weiter an der bestmöglichen TTS-Konfiguration — Hörproben mit typischen Mycroft-Skill-Sätzen.
Über 12.000 mono Aufnahmen bei 22 kHz, trainiert mit Coqui TTS (Tacotron2 DDC + HifiGAN) — kostenfrei unter CC0-Lizenz, offline nutzbar.
Ein verbessertes neutrales Sprachdataset ist fast fertig — mit besserem Audio-Setup und natürlicherem Sprachfluss als beim ersten Versuch.
Die allererste Version dieser Webseite geht online — mit dem Ziel, freies und offenes Text-to-Speech bekannter zu machen.