Du hast zwei Stunden Interview aufgenommen und brauchst den Text. Oder ein Video, das nach Untertiteln verlangt. Oder einen Podcast, aus dem du Zitate ziehen willst. Die bequeme Option ist, das Audio an einen Cloud-Dienst zu schicken, der pro Minute abrechnet und eine Kopie deiner Aufnahme behält. Die Option, die dir fast niemand richtig erklärt, ist, dass du alles auf deinem eigenen Rechner erledigen kannst, kostenlos und ohne dass das Audio ihn verlässt, mit Open-Source-Modellen, die 2026 bereits auf professionellem Niveau abliefern.
Das Problem ist nicht der Mangel an Optionen, sondern der Lärm. „Whisper" ist zu einem Sammelbegriff geworden, der ein halbes Dutzend verschiedener Implementierungen verbirgt, und jede Woche kommt ein neues Modell heraus, das behauptet, „das beste" zu sein. Lass es uns ordnen: welches Modell führt, welches du je nach Fall nimmst und wie du es ohne Drama lokal zum Laufen bringst.
Hinweis
Dieser Leitfaden ist technisch, aber praktisch. Du musst nichts über Machine Learning wissen: Wenn du mit dem Terminal umgehen kannst und weißt, wie man ein Python-Paket installiert, hast du in weniger als zehn Minuten hochwertige Transkriptionen.
Wofür du Sprache zu Text willst
Bevor du ein Modell wählst, solltest du die Aufgabe klar vor Augen haben. STT (Speech-to-Text) deckt Szenarien ab, die gleich aussehen, aber unterschiedlich wiegen:
- Transkribieren von Meetings, Interviews, Vorlesungen oder Podcasts in reinen Text. Hier zählen vor allem die Genauigkeit und dass es langes Audio durchhält.
- Untertitel für Videos: Du brauchst den Text plus die synchronisierten Zeitstempel, idealerweise auf Wortebene.
- Diarisierung: trennen, wer was sagt, wenn es mehrere Stimmen gibt. Nicht alle Modelle können das von Haus aus.
- Diktat oder Transkription in Echtzeit: Hier führt die Latenz, nicht die absolute Genauigkeit.
- Volumen verarbeiten: Tausende Dateien in der Warteschlange, wo der Durchsatz zählt (wie viel Audio du pro Sekunde verarbeitest).
Jeder dieser Fälle kippt die Waage zu einem anderen Modell. Deshalb gibt es nicht „das beste" schlechthin: Es gibt das beste für dein Vorhaben.
Was Whisper ist und warum es weiter führt
Whisper ist das Spracherkennungsmodell, das OpenAI als Open Source freigab und das das Spiel veränderte: Zum ersten Mal gab es ein kostenloses Modell mit offenen Gewichten, das 99+ Sprachen mit einer Genauigkeit transkribierte, die es bis dahin nur bei Bezahldiensten gab. Es wurde mit 680.000 Stunden Audio aus dem Internet trainiert, und diese Vielfalt verleiht ihm eine brutale Robustheit gegenüber Akzenten, Hintergrundlärm und Audio schlechter Qualität.
2026 ist seine Referenzversion Whisper large-v3, mit einem WER (Wortfehlerrate) von rund 7,4 % im Englischen und einer mehrsprachigen Unterstützung, die kein Open-Source-Konkurrent in der Breite erreicht. Es gibt kleinere Versionen (tiny, base, small, medium), die Genauigkeit für Geschwindigkeit und Speicher opfern, und eine optimierte Variante large-v3-turbo, die Audio mit über 200x der Echtzeit verarbeitet, bei minimalem Genauigkeitsverlust.
Der Schlüssel, um alles zu verstehen: Whisper ist das Modell; die „Varianten" sind Arten, es auszuführen. faster-whisper, whisper.cpp und WhisperX nutzen dieselben Gewichte von Whisper. Beim gleichen Audio und der gleichen Konfiguration liefern sie praktisch dieselbe Transkription. Was sich ändert, ist die Inferenz-Engine: die Geschwindigkeit, der Speicherverbrauch und die Extras, die sie hinzufügen.
Tipp
Merkregel: Wenn jemand sagt „ich nutze Whisper", frag ihn mit welcher Engine. Das ist der Unterschied, ob du eine Stunde Audio in fünf Minuten oder in vierzig transkribierst.
Die Whisper-Varianten: welche wofür
Hier entscheiden sich 90 % der Fälle. Drei Engines decken fast alles ab:
faster-whisper — das Arbeitspferd
Es ist eine Neuimplementierung von Whisper auf CTranslate2, einer stark optimierten Inferenz-Engine in C++. Sie unterstützt Quantisierung (int8), die den Speicherverbrauch senkt und die Inferenz bis zu 4x schneller macht als das originale Whisper, bei gleicher Genauigkeit. Wenn du eine NVIDIA-GPU hast, ist das deine Standardoption: Geschwindigkeit und VRAM-Verbrauch als Sieger. Das empfehle ich den meisten.
whisper.cpp — für Mac und CPU
Ein reiner Port in C/C++ ohne externe Abhängigkeiten. Er kompiliert zu einer kleinen Binärdatei, nutzt das GGML-Format mit Ganzzahl-Quantisierung und läuft überall. Auf dem Mac (Apple Silicon) nutzt er Metal und Core ML; auf Maschinen ohne GPU ist er die leichteste Art zu transkribieren. Wenn du keine dedizierte Grafikkarte hast oder an einem Laptop arbeitest, fang hier an.
WhisperX — wenn du Timestamps und Diarisierung brauchst
Statt roher Geschwindigkeit hinterherzujagen, verwandelt WhisperX Whisper in eine vollständige Transkriptions-Pipeline: Es fügt Zeitstempel auf Wortebene (phonetisches Alignment) und Diarisierung (Sprechertrennung) hinzu. Das ist die Option für exakte Untertitel oder Interview-Transkriptionen, bei denen es zählt zu wissen, wer was gesagt hat.
Achtung
Es gibt weitere Varianten (insanely-fast-whisper, distil-whisper usw.), aber verzettel dich nicht: faster-whisper für GPU, whisper.cpp für Mac/CPU und WhisperX für Timestamps decken fast jeden echten Bedarf ab. Der Rest sind Optimierungen für konkrete Fälle.
Über Whisper hinaus: Distil-Whisper, Parakeet und Canary
Whisper steht nicht mehr allein an der Spitze. Drei Familien verdienen deine Aufmerksamkeit, wenn dein Fall spezifisch ist:
Distil-Whisper ist eine destillierte Version von Whisper: 51 % kleiner (756 M Parameter gegenüber 1.550 M von large-v3) und rund 6x schneller, mit nur ~1 % mehr Fehler bei langem Audio. Der Haken: Es ist für Englisch optimiert. Wenn du Englisch transkribierst und Geschwindigkeit willst, ohne fast etwas an Genauigkeit aufzugeben, ist es ein Juwel.
NVIDIA Parakeet ist die NVIDIA-Familie für Englisch (mit jüngst hinzugekommenen mehrsprachigen Varianten). Ihre Stärke ist der brutale Durchsatz: Der RTFx (Echtzeitfaktor) übersteigt 2.000, was sie unschlagbar macht, um große Mengen Audio im Stapel zu verarbeiten. Die Version TDT v3 fügt Mehrsprachigkeit hinzu, auf Kosten etwas Genauigkeit im Englischen.
NVIDIA Canary-Qwen 2.5B ist bis heute der König der Genauigkeit im Open ASR Leaderboard von Hugging Face: ein WER von 5,63 %, unter dem von Whisper, mit einer Abdeckung von rund 25 Sprachen (vor allem Englisch und europäische) und sehr hoher Inferenzgeschwindigkeit. Wenn du die genauestmögliche Transkription in diesen Sprachen suchst, ist es die Referenz.
Und für Edge-Geräte laufen Modelle wie Moonshine (ab 27 MB) auf minimaler Hardware ohne Verbindung, ideal für eingebettetes Diktat oder IoT.
Vergleichstabelle
| Modell / Engine | Am besten für | Genauigkeit (WER Englisch) | Geschwindigkeit | Sprachen |
|---|---|---|---|---|
| Whisper large-v3 | Mehrsprachig, maximale Kompatibilität | ~7,4 % | Basis (Referenz) | 99+ |
| faster-whisper | NVIDIA-GPU, allgemeiner Einsatz | ~7,4 % (gleich) | Bis zu 4x schneller | 99+ |
| whisper.cpp | Mac und CPU ohne GPU | ~7,4 % (gleich) | Leicht, optimiert | 99+ |
| WhisperX | Untertitel und Diarisierung | ~7,4 % + Timestamps | Schnell + Extras | 99+ |
| Distil-Whisper | Englisch schnell | ~9,7 % (~1 % mehr) | ~6x schneller | Englisch |
| NVIDIA Parakeet TDT | Volumen / Stapel | ~8,0 % | RTFx >2.000 (Maximum) | Englisch / multi (v3) |
| NVIDIA Canary-Qwen | Maximale Genauigkeit | 5,63 % (Spitze) | Sehr hoch | ~25 |
Die WER-Zahlen stammen aus öffentlichen Benchmarks (Open ASR Leaderboard und unabhängige Vergleiche) und sind Richtwerte: Der reale Fehler hängt vom Audio, der Sprache und der Konfiguration ab. Häng dich nicht an einer Nachkommastelle auf; häng dich am Anwendungsfall auf.
Whisper lokal ausführen, Schritt für Schritt
Kommen wir zum Praktischen mit faster-whisper, der empfohlenen Option für die meisten. Du brauchst Python 3.9+ und, idealerweise, eine NVIDIA-GPU (läuft auf CPU, nur langsamer).
1. Installiere das Paket:
pip install faster-whisper2. Transkribiere eine Datei mit einem Python-Skript:
from faster_whisper import WhisperModel
# Modell large-v3 mit int8-Quantisierung (schnell und wenig VRAM)
# Nutze device="cpu", wenn du keine NVIDIA-GPU hast
model = WhisperModel("large-v3", device="cuda", compute_type="int8")
segments, info = model.transcribe("interview.mp3", beam_size=5)
print(f"Erkannte Sprache: {info.language} ({info.language_probability:.2f})")
for segment in segments:
print(f"[{segment.start:.2f}s -> {segment.end:.2f}s] {segment.text}")3. Was jede Sache macht:
WhisperModel("large-v3", ...)lädt das große Modell (beim ersten Mal wird es heruntergeladen). Wechsle zu"small"oder"medium", wenn dir der Speicher knapp wird.compute_type="int8"aktiviert die Quantisierung: weniger VRAM und mehr Geschwindigkeit bei kaum Qualitätsverlust.transcribe()erkennt die Sprache selbst. Wenn du sie schon kennst, giblanguage="de"an, um zu beschleunigen.- Jedes
segmentbringt Text und Zeitstempel (start,end), genau das, was du brauchst, um nach SRT zu exportieren und Untertitel zu erzeugen.
4. Für Untertitel durchläufst du die Segmente und schreibst den Text mit seinen Timestamps im Format SRT oder VTT heraus. Wenn du Genauigkeit auf Wortebene willst oder Sprecher trennen möchtest, ist das der Moment, zu WhisperX zu wechseln.
Tipp
Fang immer mit einem kurzen Clip (eine Minute) an, um Sprache und Qualität zu prüfen, bevor du die vollen zwei Stunden loslässt. Das spart Zeit und sagt dir, ob du im Modell hoch- oder runtergehen musst.
Auf dem Mac ohne GPU wäre das Äquivalent, whisper.cpp zu kompilieren, ein GGML-Modell (ggml-large-v3.bin) herunterzuladen und die Binärdatei auf deine Datei loszulassen: gleiche Qualität, native, für Apple Silicon optimierte Ausführung.
Für wen ist welches Modell?
Es gibt keinen absoluten Sieger. Es gibt Passung:
faster-whisper, wenn du eine NVIDIA-GPU hast und das allgemein Beste willst: schnell, mehrsprachig, präzise. Das ist die Antwort für 80 % der Leute.
whisper.cpp, wenn du am Mac oder an einem Rechner ohne Grafikkarte arbeitest. Leicht, ohne Abhängigkeiten, nativ.
WhisperX, wenn deine Arbeit exakte Untertitel oder Transkriptionen mit mehreren identifizierten Sprechern sind. Journalisten, Videoeditoren, Podcast-Leute.
Distil-Whisper, wenn du nur Englisch transkribierst und Geschwindigkeit deine Priorität ist. Doppelt so schnell bei fast keinem Fehler mehr.
NVIDIA Parakeet, wenn du Volumen im industriellen Maßstab verarbeitest: Tausende Dateien, automatisierte Pipelines, wo der Durchsatz führt.
NVIDIA Canary-Qwen, wenn du die maximal mögliche Genauigkeit in Englisch und europäischen Sprachen brauchst und es dir nichts ausmacht, auf die Abdeckung von 99 Sprachen von Whisper zu verzichten.
Die ehrliche Frage ist nicht „welches ist das beste Sprache-zu-Text-Modell?", denn die Antwort ändert sich mit deiner Hardware und deinem Fall. Die Frage ist „transkribiere ich lokal, kostenlos und privat, oder zahle ich pro Minute an einen Dienst, der mein Audio behält?". Und 2026 lautet die Antwort für fast jeden: die erste. Open Source transkribiert bereits genauso gut, auf deiner Maschine, ohne an die Kasse zu gehen.
