Was ein Computer mit Schweizerdeutsch kann
Und was er nicht kann. Diese Seite sammelt, was in diesem Feld wirklich gemessen wurde — mit Zahlen und Quellen, damit Sie unsere Aussagen daran prüfen können.
Warum es schwierig ist
Es gibt keine offizielle Rechtschreibung. Es gibt Empfehlungen aus dem Jahr 1938, die in der Dialektforschung benutzt werden — aber selbst geschulte Leute wenden sie unterschiedlich an, und kaum jemand schreibt so, wenn er einer Freundin schreibt.
Gesprochen wird Mundart, geschrieben wird Hochdeutsch. Deshalb ist «aufschreiben, was gesagt wurde» hier keine Transkription, sondern eine Übersetzung — und genau so ist fast jedes System gebaut, das es gibt.
Und es ist eine kleine Sprache im Datensinn: die grössten öffentlichen Sammlungen sind ein paar hundert Stunden, und fast alle sind nur für die Forschung lizenziert.
Woher die Daten kommen
Die öffentlichen Sammlungen, auf denen dieses Feld steht. Die Spalte «Richtung» ist die wichtigste: sie zeigt, dass fast alles Mundart hört und Hochdeutsch schreibt.
ArchiMob 2016
Mundart geschrieben
- Lizenz
- CC BY-NC-SA 4.0 · Text; Audio auf Anfrage
Swiss Parliaments Corpus 2021
Mundart gehört → Hochdeutsch geschrieben
- Stunden
- 293
- Sprechende
- 198
- Lizenz
- MIT
SwissDial 2021
Text → Mundart gesprochen
- Regionen
- 8
- Lizenz
- keine Lizenz veröffentlicht
SDS-200 2022
Mundart gehört → Hochdeutsch geschrieben
- Stunden
- 200
- Sprechende
- 3.816
- Lizenz
- nur Forschung
STT4SG-350 2023
Mundart gehört → Hochdeutsch geschrieben
- Stunden
- 343
- Sprechende
- 316
- Regionen
- 7
- Lizenz
- nur Forschung
Verstehen
Wortfehlerrate auf demselben Testsatz, damit die Zahlen vergleichbar sind. Alle diese Systeme schreiben Schriftdeutsch — die Zahl sagt, wie gut übersetzt wurde, nicht wie gut Mundart geschrieben wurde.
23%
Wortfehlerrate
14%
Wortfehlerrate
XLS-R 1B 2023
nachtrainiertGewichte offen
12.1%
Wortfehlerrate
Whisper large-v2 2025
nachtrainiertGewichte nicht veröffentlicht
Sprechen
Hier ist der Markt irreführend. Was als «Schweizerdeutsche Stimme» verkauft wird, ist meist Schweizer Hochdeutsch — die geschriebene Sprache, vorgelesen. Echte Mundart-Synthese gibt es fast nur in der Forschung.
Kommerzielle «de-CH»-Stimmen
Schweizer HochdeutschDienst
ETH Zürich, Swiss Voice
MundartForschung
T5 und VITS, Forschungspipeline 2023
MundartForschung
Stimmübertragung aus Podcasts 2025
MundartForschung
Sprachmodelle
Ob ein Modell Mundart wirklich kann, oder ob das nur in der Medienmitteilung steht. «Geprüft» heisst: jemand hat es gemessen und veröffentlicht.
SwissBERT 2023
Mundart nicht geprüftCC BY-NC 4.0
SwissBERT + gsw 2024
Mundart geprüftCC BY-NC 4.0
Apertus 2025
Mundart nicht geprüftApache 2.0
Was das für Heidi heisst
Das Diktieren schreibt nicht Mundart auf. Es schreibt, was Sie sagen wollen, in der Sprache, die Sie schon können — genau das, was die Forschung kann.
Heidi spricht nicht. Eine Stimme, die Zürichdeutsch falsch ausspricht, wäre für Sie nicht überprüfbar, und das ist der einzige Fehler, den dieses Produkt nicht machen darf.
Die Dialektprüfung läuft ohne Modell. Sie ist eine feste Regelliste, kein Sprachmodell — deshalb kann sie nicht anfangen, sich Dinge auszudenken.
Quellen
- Samardžić, Scherrer & Glaser 2016. ArchiMob — A Corpus of Spoken Swiss German. Proceedings of LREC 2016, 4061–4066, Portorož.
- Plüss, Neukom, Scheller & Vogel 2021. Swiss Parliaments Corpus, an Automatically Aligned Swiss German Speech to Standard German Text Corpus. Proceedings of the Swiss Text Analytics Conference 2021, CEUR-WS Vol-2957.
- Dogan-Schönberger, Mäder & Hofmann 2021. SwissDial: Parallel Multidialectal Corpus of Spoken Swiss German. arXiv preprint 2103.11401 — not peer-reviewed.
- Plüss, Hürlimann, Cuny, Stöckli, Kapotis, Hartmann, Ulasik, Scheller, Schraner, Jain, Deriu, Cieliebak & Vogel 2022. SDS-200: A Swiss German Speech to Standard German Text Corpus. Proceedings of LREC 2022, 3250–3256, Marseille.
- Plüss, Deriu, Schraner, Paonessa, Hartmann, Schmidt, Scheller, Hürlimann, Samardžić, Vogel & Cieliebak 2023. STT4SG-350: A Speech Corpus for All Swiss German Dialect Regions. Proceedings of ACL 2023 (Short Papers), 1763–1772, Toronto.
- Dolev, Lutz & Aepli 2024. Does Whisper Understand Swiss German? An Automatic, Qualitative and Human Evaluation. Proceedings of VarDial 2024, 28–40, Mexico City.
- Timmel, Paonessa, Vogel, Perruchoud & Kakooee 2025. Fine-tuning Whisper on Low-Resource Languages for Real-World Applications. Proceedings of the Swiss Text Analytics Conference 2025.
- Bollinger, Deriu & Vogel 2023. Text-to-Speech Pipeline for Swiss German — A Comparison. arXiv preprint 2305.19750 — not peer-reviewed.
- Stucki, Deriu & Cieliebak 2025. Voice Adaptation for Swiss German. arXiv preprint 2505.22054 — submitted, not yet accepted.
- Vamvas, Graën & Sennrich 2023. SwissBERT: The Multilingual Language Model for Switzerland. Proceedings of the Swiss Text Analytics Conference 2023, 54–69.
- Vamvas, Aepli & Sennrich 2024. Modular Adaptation of Multilingual Encoders to Written Swiss German Dialect. Proceedings of the 1st Workshop on Modular and Open Multilingual NLP, 16–23, St Julians.
- Project Apertus (EPFL, ETH Zurich & CSCS) 2025. Apertus: Democratizing Open and Compliant LLMs for Global Language Environments. arXiv preprint 2509.14233. Swiss German appears as 6,000 post-training instruction examples; no dialect evaluation is reported.
- Dieth 1986. Schwyzertütschi Dialäktschrift. 2nd edition, Sauerländer, Aarau; first published 1938 as recommendations of a commission of the Neue Helvetische Gesellschaft. Widely used in dialectology, applied inconsistently even within one corpus, and unknown to most writers — a proposal, not an orthographic standard.
- Zampieri, Malmasi, Scherrer, Samardžić, Tyers, Silfverberg, Klyueva, Pan, Huang, Ionescu, Butnaru & Jauhiainen 2019. A Report on the Third VarDial Evaluation Campaign. Proceedings of VarDial 2019, 1–16, Ann Arbor. Best macro F1 on four Swiss German dialect areas: 0.76.