43 Testfälle (Testset & Eval-Code), Judge whisper-large-v3. Bester Wert je Spalte grün, niedriger = besser; Spalten sortierbar. Die WER enthält auch STT-Fehler (obere Schranke) — Kategorien-Deltas sind aussagekräftiger als Absolutwerte. Leitmetrik ist die bei 1.0 gekappte WER.
Die Tabelle ist sortiert, aber nicht überall trennscharf. Zwei Wiederholungen derselben Konfiguration streuen bei n = 3 um rund 0.02 WER. Dazu kommt der Eigenfehler des Judges: auf Kalibrier-Audio, dessen Inhalt bekannt ist, kam Whisper auf 0.154 WER — ein Anhaltspunkt für die Größenordnung, kein exakter Sockel für diesen Testsatz, denn Absolutwerte hängen am Audiosatz. Abstände in dieser Größenordnung sind Messrauschen — die Spitzengruppe ist eine Gruppe, kein Ranking, und ein Platz 1 darin ist kein belegter Vorsprung.
| Stimme | Release | WER (Cap 1.0) | WER ungekappt | WER Whisper | WER Voxtral | CER | RTF | Lizenz |
|---|---|---|---|---|---|---|---|---|
| Audio8-TTS-Preview-0.6b · default anhören ↗ | 2026-07 | 0.152 | 0.152 | 0.108 | 0.083 | 0.129 | 0.740 | Apache-2.0 |
| Qwen3-TTS-12Hz-1.7B-CustomVoice · uncle_fu anhören ↗ | 2026-01 | 0.156 | 0.156 | 0.098 | 0.089 | 0.118 | 0.696 | Apache-2.0 |
| Audio8-TTS-Preview-0.6b · de_f1 anhören ↗ | 2026-07 | 0.157 | 0.157 | 0.092 | 0.087 | 0.130 | 0.752 | Apache-2.0 |
| Voxtral-4B-TTS-2603 · de_female anhören ↗ | 2025-11 | 0.158 | 0.158 | 0.094 | 0.073 | 0.131 | 1.257 | CC BY-NC 4.0 (nicht-kommerziell) |
| Qwen3-TTS-12Hz-1.7B-VoiceDesign · de_male_young anhören ↗ | 2026-01 | 0.160 | 0.167 | 0.116 | 0.121 | 0.134 | 0.696 | Apache-2.0 |
| Qwen3-TTS-12Hz-1.7B-VoiceDesign · de_female_coach anhören ↗ | 2026-01 | 0.164 | 0.165 | 0.142 | 0.093 | 0.124 | 0.714 | Apache-2.0 |
| Qwen3-TTS-12Hz-1.7B-VoiceDesign · de_male_news anhören ↗ | 2026-01 | 0.166 | 0.275 | 0.146 | 0.097 | 0.130 | 0.740 | Apache-2.0 |
| Qwen3-TTS-12Hz-1.7B-VoiceDesign · de_female_news anhören ↗ | 2026-01 | 0.167 | 0.167 | 0.124 | 0.099 | 0.139 | 0.711 | Apache-2.0 |
| Qwen3-TTS-12Hz-1.7B-VoiceDesign · de_male_coach anhören ↗ | 2026-01 | 0.171 | 0.192 | 0.123 | 0.064 | 0.145 | 0.727 | Apache-2.0 |
| magpie_tts_multilingual_357m.nemo +TN · sofia anhören ↗ | 2025-12 | 0.173 | 0.173 | 0.096 | 0.077 | 0.147 | 0.507 | NVIDIA Open Model License |
| Qwen3-TTS-12Hz-1.7B-VoiceDesign · de_female_calm anhören ↗ | 2026-01 | 0.181 | 0.181 | 0.124 | 0.066 | 0.131 | 0.698 | Apache-2.0 |
| VoxCPM2 · design anhören ↗ | 2026-04 | 0.193 | 0.335 | 0.122 | 0.106 | 0.155 | 1.266 | Apache-2.0 |
| Voxtral-4B-TTS-2603 · de_male anhören ↗ | 2025-11 | 0.196 | 0.196 | 0.143 | 0.095 | 0.145 | 0.818 | CC BY-NC 4.0 (nicht-kommerziell) |
| audio8-TTS-0.1B-ONNX-INT8 · de_f1 anhören ↗ | 2026-08 | 0.204 | 0.293 | 0.148 | 0.105 | 0.155 | 1.958 | Apache-2.0 |
| magpie_tts_multilingual_357m.nemo · sofia anhören ↗ | 2025-12 | 0.224 | 0.224 | 0.198 | 0.172 | 0.208 | 0.361 | NVIDIA Open Model License |
| Qwen3-TTS-12Hz-1.7B-CustomVoice · aiden anhören ↗ | 2026-01 | 0.224 | 0.224 | 0.186 | 0.217 | 0.157 | 0.693 | Apache-2.0 |
| chatterbox · default anhören ↗ | 2025-04 | 0.232 | 0.238 | 0.193 | 0.157 | 0.155 | 1.817 | MIT (Audio enthält Perth-Wasserzeichen) |
| chatterbox · de_f1 anhören ↗ | 2025-04 | 0.234 | 0.234 | 0.198 | 0.178 | 0.155 | 0.803 | MIT (Audio enthält Perth-Wasserzeichen) |
| Qwen3-TTS-12Hz-1.7B-CustomVoice · serena anhören ↗ | 2026-01 | 0.258 | 0.264 | 0.231 | 0.181 | 0.168 | 0.708 | Apache-2.0 |
| audio8-TTS-0.1B-ONNX-INT8 · default anhören ↗ | 2026-08 | 0.270 | 0.270 | 0.251 | 0.279 | 0.196 | 1.579 | Apache-2.0 |
| AuK-Flash · de_f1 anhören ↗ | 2026-08 | 0.477 | 0.477 | 0.427 | 0.415 | 0.270 | 0.350 | MIT |
| AuK · de_f1 anhören ↗ | 2026-08 | 0.496 | 0.501 | 0.446 | 0.467 | 0.280 | 2.266 | MIT |
Haupt-Judge ist Whisper large-v3 mit Casing-Prompt (verbalisiert Zahlen, statt „17.45 Uhr" zu notieren). WER Whisper und WER Voxtral zeigen dieselben Clips durch zwei ASR-Modelle — die Spanne ist ein Unsicherheitsband, kein Doppelmaß (voxtral-mini-3b normalisiert aggressiver zu Ziffern). Endlos-Decoder-Läufe werden erkannt, einmal wiederholt und sonst bei WER 1.0 gekappt.