43 Testfälle (Testset & Eval-Code), Judge: whisper-large-v3 mit Casing-Prompt. Je Modell/Stimme wird der jeweils neueste vollständige Lauf gezeigt (Spalten nach WER sortiert, bester Wert je Zeile hervorgehoben; niedriger = besser). Die WER enthält auch STT-Fehler (obere Schranke des TTS-Fehlers) — Kategorien-Deltas sind aussagekräftiger als Absolutwerte. Leitmetrik ist die je Wiederholung bei 1.0 gekappte WER (Totalersetzung); die Differenz zur ungekappten Zeile zeigt, wo einzelne Wiederholungen entgleist sind (ASR-Decoder-Schleifen oder TTS-Loop-Babble erzeugen sonst WER ≫ 1 und dominieren den Mittelwert). Spaltentitel führen zur Abhörseite mit allen Clips.
Judge-Wahl und Kreuzvalidierung: Haupt-Judge ist Whisper large-v3. Er hat granite-speech-4.1-2b abgelöst, nachdem eine Kalibrierung mit bekanntem Audioinhalt granite überführt hat: Ein TTS sprach die bereits ausgeschriebenen Referenztexte, sodass feststand, was im Audio zu hören ist. granite verlor dort systematisch Zahlen — aus „siebzehn Uhr fünfundvierzig" wurde „Der Zug fährt um uhr", aus „eine Million zweihundertfünfzigtausend Euro" ein abgebrochenes „beläuft sich auf eine". Whisper transkribiert diese Fälle korrekt (WER 0.137 gegen 0.147, Wortverlust 0.126 gegen 0.143). Sein Schwachpunkt ist umgekehrt die Schreibweise: Ohne Gegenmaßnahme notiert er Zahlen als Ziffern („17.45 Uhr") und macht damit unmessbar, was der Testsatz prüft. Ein Initial-Prompt drängt ihn zu ausgeschriebenen Zahlwörtern und senkt die Ziffernquote von 83 % auf 33 %; seine Beispiele stammen bewusst nicht aus dem Testsatz, sonst souffliert man dem Judge die erwarteten Antworten.
Die unteren beiden Zeilen zeigen beide Judges im identischen Protokoll (nur Wiederholung r0, beste WER über refs plus normalisierten Originaltext). voxtral-mini-3b dient als Gegenprobe, ist aber kein neutraler Maßstab: Er rück-normalisiert aggressiv zu Ziffern und wertet damit eine falsche Verbalisierung als Treffer. Die Spanne zwischen beiden Zeilen ist als Unsicherheitsband zu lesen, nicht als zwei gleichwertige Messungen. Beide Modelle können in Decoder-Endlosschleifen laufen — das ist kein Einzelfehler von granite, sondern generelles Verhalten autoregressiver ASR-Modelle. Solche Fälle werden erkannt, einmal mit leichtem Sampling wiederholt und ansonsten bei WER 1.0 gekappt.
| Metrik | Qwen3-TTS-12Hz-1.7B-CustomVoice · uncle_fu | Voxtral-4B-TTS-2603 · de_female | Qwen3-TTS-12Hz-1.7B-VoiceDesign · de_male_young | Qwen3-TTS-12Hz-1.7B-VoiceDesign · de_female_coach | Qwen3-TTS-12Hz-1.7B-VoiceDesign · de_male_news | Qwen3-TTS-12Hz-1.7B-VoiceDesign · de_female_news | Qwen3-TTS-12Hz-1.7B-VoiceDesign · de_male_coach | magpie_tts_multilingual_357m.nemo +TN · sofia | Qwen3-TTS-12Hz-1.7B-VoiceDesign · de_female_calm | VoxCPM2 · design | Voxtral-4B-TTS-2603 · de_male | magpie_tts_multilingual_357m.nemo · sofia | Qwen3-TTS-12Hz-1.7B-CustomVoice · aiden | chatterbox · default | chatterbox · de_f1 | Qwen3-TTS-12Hz-1.7B-CustomVoice · serena |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| N (Wiederholungen) | 3 | 3 | 3 | 3 | 3 | 3 | 3 | 3 | 3 | 3 | 3 | 3 | 3 | 3 | 3 | 3 |
| WER (Mittel, Cap 1.0) | 0.156 | 0.158 | 0.160 | 0.164 | 0.166 | 0.167 | 0.171 | 0.173 | 0.181 | 0.193 | 0.196 | 0.224 | 0.224 | 0.232 | 0.234 | 0.258 |
| WER (Mittel, ungekappt) | 0.156 | 0.158 | 0.167 | 0.165 | 0.275 | 0.167 | 0.192 | 0.173 | 0.181 | 0.335 | 0.196 | 0.224 | 0.224 | 0.238 | 0.234 | 0.264 |
| WER (best-of-N) | 0.120 | 0.123 | 0.122 | 0.119 | 0.117 | 0.124 | 0.123 | 0.151 | 0.140 | 0.140 | 0.131 | 0.200 | 0.148 | 0.173 | 0.165 | 0.177 |
| CER (Cap 1.0) | 0.118 | 0.131 | 0.134 | 0.124 | 0.130 | 0.139 | 0.145 | 0.147 | 0.131 | 0.155 | 0.145 | 0.208 | 0.157 | 0.155 | 0.155 | 0.168 |
| Realtime-Faktor | 0.696 | 1.257 | 0.696 | 0.714 | 0.740 | 0.711 | 0.727 | 0.507 | 0.698 | 1.266 | 0.818 | 0.361 | 0.693 | 1.817 | 0.803 | 0.708 |
| WER compound | 0.133 | 0.122 | 0.067 | 0.089 | 0.100 | 0.144 | 0.122 | 0.089 | 0.144 | 0.133 | 0.122 | 0.111 | 0.256 | 0.200 | 0.156 | 0.356 |
| WER loanword | 0.048 | 0.061 | 0.071 | 0.113 | 0.065 | 0.068 | 0.048 | 0.089 | 0.068 | 0.081 | 0.114 | 0.103 | 0.192 | 0.081 | 0.080 | 0.207 |
| WER longform | 0.037 | 0.037 | 0.037 | 0.057 | 0.046 | 0.037 | 0.042 | 0.064 | 0.056 | 0.083 | 0.054 | 0.164 | 0.054 | 0.103 | 0.079 | 0.063 |
| WER names | 0.049 | 0.037 | 0.049 | 0.062 | 0.074 | 0.049 | 0.198 | 0.037 | 0.049 | 0.049 | 0.086 | 0.062 | 0.049 | 0.136 | 0.161 | 0.210 |
| WER normalization | 0.285 | 0.292 | 0.314 | 0.297 | 0.303 | 0.309 | 0.286 | 0.320 | 0.318 | 0.349 | 0.336 | 0.409 | 0.322 | 0.383 | 0.407 | 0.339 |
| WER umlaut | 0.032 | 0.032 | 0.016 | 0.014 | 0.048 | 0.006 | 0.071 | 0.038 | 0.068 | 0.043 | 0.078 | 0.022 | 0.133 | 0.096 | 0.085 | 0.122 |
| Tempo (s/Zeichen, Median) | 0.0841 | 0.0630 | 0.0875 | 0.0891 | 0.0921 | 0.0933 | 0.0921 | 0.0675 | 0.0887 | 0.0646 | 0.0590 | 0.0614 | 0.0733 | 0.0743 | 0.0759 | 0.0812 |
| WER whisper-large-v3 (r0, refs+Text) | 0.098 | 0.094 | 0.116 | 0.142 | 0.146 | 0.124 | 0.123 | 0.096 | 0.124 | 0.122 | 0.143 | 0.198 | 0.186 | 0.193 | 0.198 | 0.231 |
| WER voxtral-mini-3b (r0, refs+Text) | 0.089 | 0.073 | 0.121 | 0.093 | 0.097 | 0.099 | 0.064 | 0.077 | 0.066 | 0.106 | 0.095 | 0.172 | 0.217 | 0.157 | 0.178 | 0.181 |