SOUTH.BYTE
AI Governance & IT-Beratung

Deutscher TTS-Vergleich auf dem DGX Spark

43 Testfälle (Testset & Eval-Code), Judge: whisper-large-v3 mit Casing-Prompt. Je Modell/Stimme wird der jeweils neueste vollständige Lauf gezeigt (Spalten nach WER sortiert, bester Wert je Zeile hervorgehoben; niedriger = besser). Die WER enthält auch STT-Fehler (obere Schranke des TTS-Fehlers) — Kategorien-Deltas sind aussagekräftiger als Absolutwerte. Leitmetrik ist die je Wiederholung bei 1.0 gekappte WER (Totalersetzung); die Differenz zur ungekappten Zeile zeigt, wo einzelne Wiederholungen entgleist sind (ASR-Decoder-Schleifen oder TTS-Loop-Babble erzeugen sonst WER ≫ 1 und dominieren den Mittelwert). Spaltentitel führen zur Abhörseite mit allen Clips.

Judge-Wahl und Kreuzvalidierung: Haupt-Judge ist Whisper large-v3. Er hat granite-speech-4.1-2b abgelöst, nachdem eine Kalibrierung mit bekanntem Audioinhalt granite überführt hat: Ein TTS sprach die bereits ausgeschriebenen Referenztexte, sodass feststand, was im Audio zu hören ist. granite verlor dort systematisch Zahlen — aus „siebzehn Uhr fünfundvierzig" wurde „Der Zug fährt um uhr", aus „eine Million zweihundertfünfzigtausend Euro" ein abgebrochenes „beläuft sich auf eine". Whisper transkribiert diese Fälle korrekt (WER 0.137 gegen 0.147, Wortverlust 0.126 gegen 0.143). Sein Schwachpunkt ist umgekehrt die Schreibweise: Ohne Gegenmaßnahme notiert er Zahlen als Ziffern („17.45 Uhr") und macht damit unmessbar, was der Testsatz prüft. Ein Initial-Prompt drängt ihn zu ausgeschriebenen Zahlwörtern und senkt die Ziffernquote von 83 % auf 33 %; seine Beispiele stammen bewusst nicht aus dem Testsatz, sonst souffliert man dem Judge die erwarteten Antworten.

Die unteren beiden Zeilen zeigen beide Judges im identischen Protokoll (nur Wiederholung r0, beste WER über refs plus normalisierten Originaltext). voxtral-mini-3b dient als Gegenprobe, ist aber kein neutraler Maßstab: Er rück-normalisiert aggressiv zu Ziffern und wertet damit eine falsche Verbalisierung als Treffer. Die Spanne zwischen beiden Zeilen ist als Unsicherheitsband zu lesen, nicht als zwei gleichwertige Messungen. Beide Modelle können in Decoder-Endlosschleifen laufen — das ist kein Einzelfehler von granite, sondern generelles Verhalten autoregressiver ASR-Modelle. Solche Fälle werden erkannt, einmal mit leichtem Sampling wiederholt und ansonsten bei WER 1.0 gekappt.

MetrikQwen3-TTS-12Hz-1.7B-CustomVoice · uncle_fuVoxtral-4B-TTS-2603 · de_femaleQwen3-TTS-12Hz-1.7B-VoiceDesign · de_male_youngQwen3-TTS-12Hz-1.7B-VoiceDesign · de_female_coachQwen3-TTS-12Hz-1.7B-VoiceDesign · de_male_newsQwen3-TTS-12Hz-1.7B-VoiceDesign · de_female_newsQwen3-TTS-12Hz-1.7B-VoiceDesign · de_male_coachmagpie_tts_multilingual_357m.nemo +TN · sofiaQwen3-TTS-12Hz-1.7B-VoiceDesign · de_female_calmVoxCPM2 · designVoxtral-4B-TTS-2603 · de_malemagpie_tts_multilingual_357m.nemo · sofiaQwen3-TTS-12Hz-1.7B-CustomVoice · aidenchatterbox · defaultchatterbox · de_f1Qwen3-TTS-12Hz-1.7B-CustomVoice · serena
N (Wiederholungen)3333333333333333
WER (Mittel, Cap 1.0)0.1560.1580.1600.1640.1660.1670.1710.1730.1810.1930.1960.2240.2240.2320.2340.258
WER (Mittel, ungekappt)0.1560.1580.1670.1650.2750.1670.1920.1730.1810.3350.1960.2240.2240.2380.2340.264
WER (best-of-N)0.1200.1230.1220.1190.1170.1240.1230.1510.1400.1400.1310.2000.1480.1730.1650.177
CER (Cap 1.0)0.1180.1310.1340.1240.1300.1390.1450.1470.1310.1550.1450.2080.1570.1550.1550.168
Realtime-Faktor0.6961.2570.6960.7140.7400.7110.7270.5070.6981.2660.8180.3610.6931.8170.8030.708
WER compound0.1330.1220.0670.0890.1000.1440.1220.0890.1440.1330.1220.1110.2560.2000.1560.356
WER loanword0.0480.0610.0710.1130.0650.0680.0480.0890.0680.0810.1140.1030.1920.0810.0800.207
WER longform0.0370.0370.0370.0570.0460.0370.0420.0640.0560.0830.0540.1640.0540.1030.0790.063
WER names0.0490.0370.0490.0620.0740.0490.1980.0370.0490.0490.0860.0620.0490.1360.1610.210
WER normalization0.2850.2920.3140.2970.3030.3090.2860.3200.3180.3490.3360.4090.3220.3830.4070.339
WER umlaut0.0320.0320.0160.0140.0480.0060.0710.0380.0680.0430.0780.0220.1330.0960.0850.122
Tempo (s/Zeichen, Median)0.08410.06300.08750.08910.09210.09330.09210.06750.08870.06460.05900.06140.07330.07430.07590.0812
WER whisper-large-v3 (r0, refs+Text)0.0980.0940.1160.1420.1460.1240.1230.0960.1240.1220.1430.1980.1860.1930.1980.231
WER voxtral-mini-3b (r0, refs+Text)0.0890.0730.1210.0930.0970.0990.0640.0770.0660.1060.0950.1720.2170.1570.1780.181

Lizenzhinweise