SOUTH.BYTE
AI Governance & IT-Beratung

Deutscher TTS-Vergleich auf dem DGX Spark

43 Testfälle (Testset & Eval-Code), Judge whisper-large-v3. Bester Wert je Spalte grün, niedriger = besser; Spalten sortierbar. Die WER enthält auch STT-Fehler (obere Schranke) — Kategorien-Deltas sind aussagekräftiger als Absolutwerte. Leitmetrik ist die bei 1.0 gekappte WER.

Die Tabelle ist sortiert, aber nicht überall trennscharf. Zwei Wiederholungen derselben Konfiguration streuen bei n = 3 um rund 0.02 WER. Dazu kommt der Eigenfehler des Judges: auf Kalibrier-Audio, dessen Inhalt bekannt ist, kam Whisper auf 0.154 WER — ein Anhaltspunkt für die Größenordnung, kein exakter Sockel für diesen Testsatz, denn Absolutwerte hängen am Audiosatz. Abstände in dieser Größenordnung sind Messrauschen — die Spitzengruppe ist eine Gruppe, kein Ranking, und ein Platz 1 darin ist kein belegter Vorsprung.

StimmeReleaseWER (Cap 1.0)WER ungekapptWER WhisperWER VoxtralCERRTFLizenz
Audio8-TTS-Preview-0.6b · default anhören ↗2026-070.1520.1520.1080.0830.1290.740Apache-2.0
Qwen3-TTS-12Hz-1.7B-CustomVoice · uncle_fu anhören ↗2026-010.1560.1560.0980.0890.1180.696Apache-2.0
Audio8-TTS-Preview-0.6b · de_f1 anhören ↗2026-070.1570.1570.0920.0870.1300.752Apache-2.0
Voxtral-4B-TTS-2603 · de_female anhören ↗2025-110.1580.1580.0940.0730.1311.257CC BY-NC 4.0 (nicht-kommerziell)
Qwen3-TTS-12Hz-1.7B-VoiceDesign · de_male_young anhören ↗2026-010.1600.1670.1160.1210.1340.696Apache-2.0
Qwen3-TTS-12Hz-1.7B-VoiceDesign · de_female_coach anhören ↗2026-010.1640.1650.1420.0930.1240.714Apache-2.0
Qwen3-TTS-12Hz-1.7B-VoiceDesign · de_male_news anhören ↗2026-010.1660.2750.1460.0970.1300.740Apache-2.0
Qwen3-TTS-12Hz-1.7B-VoiceDesign · de_female_news anhören ↗2026-010.1670.1670.1240.0990.1390.711Apache-2.0
Qwen3-TTS-12Hz-1.7B-VoiceDesign · de_male_coach anhören ↗2026-010.1710.1920.1230.0640.1450.727Apache-2.0
magpie_tts_multilingual_357m.nemo +TN · sofia anhören ↗2025-120.1730.1730.0960.0770.1470.507NVIDIA Open Model License
Qwen3-TTS-12Hz-1.7B-VoiceDesign · de_female_calm anhören ↗2026-010.1810.1810.1240.0660.1310.698Apache-2.0
VoxCPM2 · design anhören ↗2026-040.1930.3350.1220.1060.1551.266Apache-2.0
Voxtral-4B-TTS-2603 · de_male anhören ↗2025-110.1960.1960.1430.0950.1450.818CC BY-NC 4.0 (nicht-kommerziell)
audio8-TTS-0.1B-ONNX-INT8 · de_f1 anhören ↗2026-080.2040.2930.1480.1050.1551.958Apache-2.0
magpie_tts_multilingual_357m.nemo · sofia anhören ↗2025-120.2240.2240.1980.1720.2080.361NVIDIA Open Model License
Qwen3-TTS-12Hz-1.7B-CustomVoice · aiden anhören ↗2026-010.2240.2240.1860.2170.1570.693Apache-2.0
chatterbox · default anhören ↗2025-040.2320.2380.1930.1570.1551.817MIT (Audio enthält Perth-Wasserzeichen)
chatterbox · de_f1 anhören ↗2025-040.2340.2340.1980.1780.1550.803MIT (Audio enthält Perth-Wasserzeichen)
Qwen3-TTS-12Hz-1.7B-CustomVoice · serena anhören ↗2026-010.2580.2640.2310.1810.1680.708Apache-2.0
audio8-TTS-0.1B-ONNX-INT8 · default anhören ↗2026-080.2700.2700.2510.2790.1961.579Apache-2.0
AuK-Flash · de_f1 anhören ↗2026-080.4770.4770.4270.4150.2700.350MIT
AuK · de_f1 anhören ↗2026-080.4960.5010.4460.4670.2802.266MIT

Haupt-Judge ist Whisper large-v3 mit Casing-Prompt (verbalisiert Zahlen, statt „17.45 Uhr" zu notieren). WER Whisper und WER Voxtral zeigen dieselben Clips durch zwei ASR-Modelle — die Spanne ist ein Unsicherheitsband, kein Doppelmaß (voxtral-mini-3b normalisiert aggressiver zu Ziffern). Endlos-Decoder-Läufe werden erkannt, einmal wiederholt und sonst bei WER 1.0 gekappt.

WER je Kategorie

Stimmecompoundloanwordlongformnamesnormalizationumlaut
Audio8-TTS-Preview-0.6b · default anhören ↗0.0560.0550.0580.0990.2980.000
Qwen3-TTS-12Hz-1.7B-CustomVoice · uncle_fu anhören ↗0.1330.0480.0370.0490.2850.032
Audio8-TTS-Preview-0.6b · de_f1 anhören ↗0.1220.0550.0670.0120.3000.000
Voxtral-4B-TTS-2603 · de_female anhören ↗0.1220.0610.0370.0370.2920.032
Qwen3-TTS-12Hz-1.7B-VoiceDesign · de_male_young anhören ↗0.0670.0710.0370.0490.3140.016
Qwen3-TTS-12Hz-1.7B-VoiceDesign · de_female_coach anhören ↗0.0890.1130.0570.0620.2970.014
Qwen3-TTS-12Hz-1.7B-VoiceDesign · de_male_news anhören ↗0.1000.0650.0460.0740.3030.048
Qwen3-TTS-12Hz-1.7B-VoiceDesign · de_female_news anhören ↗0.1440.0680.0370.0490.3090.006
Qwen3-TTS-12Hz-1.7B-VoiceDesign · de_male_coach anhören ↗0.1220.0480.0420.1980.2860.071
magpie_tts_multilingual_357m.nemo +TN · sofia anhören ↗0.0890.0890.0640.0370.3200.038
Qwen3-TTS-12Hz-1.7B-VoiceDesign · de_female_calm anhören ↗0.1440.0680.0560.0490.3180.068
VoxCPM2 · design anhören ↗0.1330.0810.0830.0490.3490.043
Voxtral-4B-TTS-2603 · de_male anhören ↗0.1220.1140.0540.0860.3360.078
audio8-TTS-0.1B-ONNX-INT8 · de_f1 anhören ↗0.2330.0680.0870.0000.3690.000
magpie_tts_multilingual_357m.nemo · sofia anhören ↗0.1110.1030.1640.0620.4090.022
Qwen3-TTS-12Hz-1.7B-CustomVoice · aiden anhören ↗0.2560.1920.0540.0490.3220.133
chatterbox · default anhören ↗0.2000.0810.1030.1360.3830.096
chatterbox · de_f1 anhören ↗0.1560.0800.0790.1610.4070.085
Qwen3-TTS-12Hz-1.7B-CustomVoice · serena anhören ↗0.3560.2070.0630.2100.3390.122
audio8-TTS-0.1B-ONNX-INT8 · default anhören ↗0.1000.1370.0750.0370.4990.136
AuK-Flash · de_f1 anhören ↗0.7250.2350.3430.2890.5890.321
AuK · de_f1 anhören ↗0.7830.4370.3510.4000.5280.319