Tu as deux heures d'entretien enregistrées et il te faut le texte. Ou une vidéo qui réclame des sous-titres. Ou un podcast dont tu veux tirer des citations. L'option confortable, c'est d'envoyer l'audio à un service cloud qui facture à la minute et garde une copie de ton enregistrement. L'option que presque personne ne t'explique bien, c'est que tu peux tout faire sur ton propre ordinateur, gratuitement et sans que l'audio n'en sorte, avec des modèles open source qui, en 2026, rendent déjà à un niveau professionnel.
Le problème, ce n'est pas le manque d'options, c'est le bruit. « Whisper » est devenu un terme parapluie qui cache une demi-douzaine d'implémentations différentes, et chaque semaine sort un nouveau modèle qui se dit « le meilleur ». Remettons de l'ordre : quel modèle domine, lequel utiliser selon ton cas et comment le faire tourner en local sans prise de tête.
Note
Ce guide est technique mais pratique. Pas besoin de t'y connaître en machine learning : si tu te débrouilles avec le terminal et que tu sais installer un paquet Python, tu peux avoir des transcriptions de qualité en moins de dix minutes.
À quoi tu veux servir la voix en texte
Avant de choisir un modèle, il vaut mieux cerner le travail. Le STT (speech-to-text) couvre des scénarios qui se ressemblent mais pèsent différemment :
- Transcrire réunions, entretiens, cours ou podcasts en texte brut. Ici, ce qui prime, c'est la précision et la capacité à tenir sur de l'audio long.
- Sous-titres de vidéos : il te faut le texte plus les horodatages synchronisés, idéalement au niveau du mot.
- Diarisation : séparer qui dit quoi quand il y a plusieurs voix. Tous les modèles ne le font pas d'origine.
- Dictée ou transcription en temps réel : ici, c'est la latence qui commande, pas la précision absolue.
- Traiter du volume : des milliers de fichiers en file d'attente, où ce qui compte, c'est le débit (combien d'audio tu traites par seconde).
Chacun de ces cas fait pencher la balance vers un modèle différent. C'est pour ça qu'il n'existe pas « le meilleur » tout court : il existe le meilleur pour ton besoin.
Qu'est-ce que Whisper et pourquoi il domine encore
Whisper est le modèle de reconnaissance vocale qu'OpenAI a libéré en open source et qui a changé la donne : pour la première fois, il existait un modèle gratuit, à poids ouverts, qui transcrivait 99+ langues avec une précision que seuls les services payants offraient jusque-là. Il a été entraîné sur 680 000 heures d'audio issu d'internet, et cette diversité lui donne une robustesse folle face aux accents, au bruit de fond et à l'audio de mauvaise qualité.
En 2026, sa version de référence est Whisper large-v3, avec un WER (taux d'erreur par mot) autour de 7,4 % en anglais et un support multilingue qu'aucun concurrent open source n'égale en ampleur. Il existe des versions plus petites (tiny, base, small, medium) qui sacrifient la précision au profit de la vitesse et de la mémoire, et une variante large-v3-turbo optimisée qui traite l'audio à plus de 200x le temps réel avec une perte de précision minime.
La clé pour tout comprendre : Whisper est le modèle ; les « variantes » sont des façons de l'exécuter. faster-whisper, whisper.cpp et WhisperX utilisent les mêmes poids de Whisper. Avec le même audio et la même configuration, ils donnent pratiquement la même transcription. Ce qui change, c'est le moteur d'inférence : la vitesse, la mémoire consommée et les extras ajoutés.
Astuce
Règle mentale : quand quelqu'un dit « j'utilise Whisper », demande-lui avec quel moteur. C'est la différence entre transcrire une heure d'audio en cinq minutes ou en quarante.
Les variantes de Whisper : laquelle pour quoi
C'est là que se décide 90 % des cas. Trois moteurs couvrent presque tout :
faster-whisper — le cheval de bataille
C'est une réimplémentation de Whisper sur CTranslate2, un moteur d'inférence en C++ très optimisé. Il prend en charge la quantification (int8), qui réduit l'usage mémoire et accélère l'inférence jusqu'à 4x plus vite que le Whisper d'origine, en gardant la même précision. Si tu as un GPU NVIDIA, c'est ton option par défaut : rapidité et consommation de VRAM gagnantes. C'est ce que je recommande pour la majorité.
whisper.cpp — pour Mac et CPU
Un portage pur en C/C++ sans dépendances externes. Il compile en un petit binaire, utilise le format GGML avec quantification entière et tourne n'importe où. Sur Mac (Apple Silicon), il exploite Metal et Core ML ; sur les machines sans GPU, c'est la façon la plus légère de transcrire. Si tu n'as pas de carte graphique dédiée ou si tu travailles sur un portable, commence par là.
WhisperX — quand tu as besoin de timestamps et de diarisation
Au lieu de courir après la vitesse brute, WhisperX transforme Whisper en un pipeline de transcription complet : il ajoute des horodatages au niveau du mot (alignement phonétique) et la diarisation (séparer les intervenants). C'est l'option pour des sous-titres exacts ou des transcriptions d'entretiens où il importe de savoir qui a dit quoi.
Attention
Il existe d'autres variantes (insanely-fast-whisper, distil-whisper, etc.), mais ne te disperse pas : faster-whisper pour GPU, whisper.cpp pour Mac/CPU et WhisperX pour les timestamps couvrent presque tous les besoins réels. Le reste, ce sont des optimisations pour des cas précis.
Au-delà de Whisper : Distil-Whisper, Parakeet et Canary
Whisper n'est plus seul au sommet. Trois familles méritent ton attention si ton cas est spécifique :
Distil-Whisper est une version distillée de Whisper : 51 % plus petite (756 M de paramètres contre 1 550 M pour large-v3) et environ 6x plus rapide, avec seulement ~1 % d'erreur en plus sur de l'audio long. Le hic : elle est optimisée pour l'anglais. Si tu transcris de l'anglais et que tu veux de la vitesse sans presque rien lâcher en précision, c'est une pépite.
NVIDIA Parakeet est la famille de NVIDIA pour l'anglais (avec des variantes multilingues récentes). Son point fort, c'est le débit brutal : le RTFx (facteur de temps réel) dépasse les 2 000, ce qui la rend imbattable pour traiter de gros volumes d'audio en lot. La version TDT v3 ajoute le support multilingue, au prix d'un peu de précision en anglais.
NVIDIA Canary-Qwen 2.5B est, à ce jour, le roi de la précision sur l'Open ASR Leaderboard de Hugging Face : un WER de 5,63 %, en dessous de Whisper, avec une couverture d'environ 25 langues (anglais et langues européennes surtout) et une vitesse d'inférence très élevée. Si ce que tu cherches, c'est la transcription la plus exacte possible dans ces langues, c'est la référence.
Et pour les appareils embarqués, des modèles comme Moonshine (à partir de 27 Mo) tournent sur du matériel minimal, hors connexion, idéals pour la dictée embarquée ou l'IoT.
Tableau comparatif
| Modèle / moteur | Meilleur pour | Précision (WER anglais) | Vitesse | Langues |
|---|---|---|---|---|
| Whisper large-v3 | Multilingue, compatibilité maximale | ~7,4 % | Base (référence) | 99+ |
| faster-whisper | GPU NVIDIA, usage général | ~7,4 % (identique) | Jusqu'à 4x plus rapide | 99+ |
| whisper.cpp | Mac et CPU sans GPU | ~7,4 % (identique) | Léger, optimisé | 99+ |
| WhisperX | Sous-titres et diarisation | ~7,4 % + timestamps | Rapide + extras | 99+ |
| Distil-Whisper | Anglais rapide | ~9,7 % (~1 % de plus) | ~6x plus rapide | Anglais |
| NVIDIA Parakeet TDT | Volume / lots | ~8,0 % | RTFx >2 000 (maximum) | Anglais / multi (v3) |
| NVIDIA Canary-Qwen | Précision maximale | 5,63 % (leader) | Très élevée | ~25 |
Les chiffres de WER viennent de benchmarks publics (Open ASR Leaderboard et comparatifs indépendants) et sont indicatifs : l'erreur réelle dépend de l'audio, de la langue et de la configuration. Ne t'attache pas à une décimale ; attache-toi au cas d'usage.
Exécuter Whisper en local, pas à pas
Passons au concret avec faster-whisper, l'option recommandée pour la majorité. Il te faut Python 3.9+ et, idéalement, un GPU NVIDIA (ça marche sur CPU, juste plus lentement).
1. Installe le paquet :
pip install faster-whisper2. Transcris un fichier avec un script Python :
from faster_whisper import WhisperModel
# Modèle large-v3 avec quantification int8 (rapide et peu de VRAM)
# Utilise device="cpu" si tu n'as pas de GPU NVIDIA
model = WhisperModel("large-v3", device="cuda", compute_type="int8")
segments, info = model.transcribe("entretien.mp3", beam_size=5)
print(f"Langue détectée : {info.language} ({info.language_probability:.2f})")
for segment in segments:
print(f"[{segment.start:.2f}s -> {segment.end:.2f}s] {segment.text}")3. Ce que fait chaque chose :
WhisperModel("large-v3", ...)charge le grand modèle (il le télécharge la première fois). Passe à"small"ou"medium"si tu es juste en mémoire.compute_type="int8"active la quantification : moins de VRAM et plus de vitesse avec à peine une perte de qualité.transcribe()détecte la langue tout seul. Si tu la connais déjà, passelanguage="fr"pour accélérer.- Chaque
segmentapporte le texte et les horodatages (start,end), c'est justement ce dont tu as besoin pour exporter en SRT et générer des sous-titres.
4. Pour les sous-titres, parcours les segments et déverse le texte avec ses timestamps au format SRT ou VTT. Si tu veux une précision au niveau du mot ou séparer les intervenants, c'est le moment de passer à WhisperX.
Astuce
Commence toujours par un clip court (une minute) pour vérifier la langue et la qualité avant de lâcher les deux heures entières. Ça fait gagner du temps et ça te dit si tu dois monter ou descendre de modèle.
Sur Mac sans GPU, l'équivalent serait de compiler whisper.cpp, de télécharger un modèle GGML (ggml-large-v3.bin) et de lancer le binaire sur ton fichier : même qualité, exécution native optimisée pour Apple Silicon.
Pour qui chaque modèle ?
Il n'y a pas de gagnant absolu. Il y a une adéquation :
faster-whisper si tu as un GPU NVIDIA et que tu veux le meilleur en général : rapide, multilingue, précis. C'est la réponse pour 80 % des gens.
whisper.cpp si tu travailles sur Mac ou sur une machine sans carte graphique. Léger, sans dépendances, natif.
WhisperX si ton travail, ce sont des sous-titres exacts ou des transcriptions avec plusieurs intervenants identifiés. Journalistes, monteurs vidéo, gens du podcast.
Distil-Whisper si tu transcris seulement de l'anglais et que la vitesse est ta priorité. Deux fois plus rapide pour presque aucune erreur en plus.
NVIDIA Parakeet si tu traites du volume industriel : des milliers de fichiers, des pipelines automatisés, où le débit commande.
NVIDIA Canary-Qwen si tu as besoin de la précision maximale possible en anglais et en langues européennes, et que renoncer à la couverture de 99 langues de Whisper ne te gêne pas.
La question honnête n'est pas « quel est le meilleur modèle de voix en texte ? », parce que la réponse change avec ton matériel et ton cas. La question, c'est « je transcris en local, gratuitement et en privé, ou je paie à la minute un service qui garde mon audio ? ». Et en 2026, la réponse pour presque tout le monde, c'est la première : l'open source transcrit déjà aussi bien, sur ta machine, sans passer par la caisse.
