Kurze und lange Sätze, mit und ohne Zahlen, Abkürzungen und englische Ausdrücke. Kreuz und Quer, damit Du dir ein ehrliches Bild machen kannst.
Alle Beispiele sind unbearbeitet, nur die Lautstärke wurde normalisiert. Keine Auswahl von "besten Takes", kein Feintuning. Ich muss niemanden beeindrucken, sondern möchte dir zeigen, was du tatsächlich bekommst.
Die Erzeugungszeiten sind bewusst auf einem MacBook M1 ohne High-End-Grafikkarte gemessen, damit du einen realistischen Eindruck bekommst, wie sich das auf einem normalen Rechner anfühlt. Die Zeitangabe neben jedem Abspiel-Button ist die reine Erzeugungsdauer, nicht die Länge der Audiodatei.
Die Testsätze wurden von einer KI erstellt, nicht von mir handverlesen — damit ich nicht unbewusst Sätze auswähle, von denen ich schon weiß, dass sie gut klingen.
Dieselben Sätze, drei Engines. So hörst du direkt den Unterschied in Klang und Erzeugungszeit.
Dieselben Sätze, drei Engines — Piper, Kokoro und CosyVoice, alle mit hessischem Dialekt.
Ein und derselbe Satz, sechs Emotionen — nur mit Piper verfügbar.
Bei CosyVoice fällt auf: Zahlen werden aktuell auf Englisch ausgesprochen statt auf Deutsch. Wer CosyVoice einsetzt, sollte Zahlen, Datums- und Uhrzeitangaben vorher selbst in ausgeschriebene deutsche Worte umwandeln (Textnormalisierung) — sonst klingt das Ergebnis an genau diesen Stellen falsch.
Genau deshalb stehen hier auch die unbequemen Beispiele, nicht nur die, die am besten klingen. Eine Stimme, die überall perfekt wirkt, wäre nicht ehrlich.
Wer Zahlen, Daten oder Uhrzeiten vorab selbst normalisieren möchte: Die Python-Bibliothek num2words wandelt Ziffern zuverlässig in ausgeschriebene deutsche Wörter um und lässt sich gut in eine eigene Vorverarbeitung einbauen. Abkürzungen wie "z. B." oder "bzw." muss man aktuell noch selbst per Wörterbuch ersetzen. Dafür gibt es keine allgemeingültige automatische Lösung. Alternativ kann auch german transliterate verwendet werden.