blackdark
Audio IASTTvoix en texteWhisperfaster-whispertranscription IAopen source

Meilleurs modèles open source de voix en texte (STT) en 2026 : Whisper et au-delà

Guide pratique des meilleurs modèles open source de voix en texte : Whisper et ses variantes (faster-whisper, whisper.cpp, WhisperX), Distil-Whisper, NVIDIA Parakeet et Canary. Précision, vitesse, langues et comment les exécuter en local, pas à pas.

Par BlackdarkMis à jour le 8 min de lecture

Tu as deux heures d'entretien enregistrées et il te faut le texte. Ou une vidéo qui réclame des sous-titres. Ou un podcast dont tu veux tirer des citations. L'option confortable, c'est d'envoyer l'audio à un service cloud qui facture à la minute et garde une copie de ton enregistrement. L'option que presque personne ne t'explique bien, c'est que tu peux tout faire sur ton propre ordinateur, gratuitement et sans que l'audio n'en sorte, avec des modèles open source qui, en 2026, rendent déjà à un niveau professionnel.

Le problème, ce n'est pas le manque d'options, c'est le bruit. « Whisper » est devenu un terme parapluie qui cache une demi-douzaine d'implémentations différentes, et chaque semaine sort un nouveau modèle qui se dit « le meilleur ». Remettons de l'ordre : quel modèle domine, lequel utiliser selon ton cas et comment le faire tourner en local sans prise de tête.

Note

Ce guide est technique mais pratique. Pas besoin de t'y connaître en machine learning : si tu te débrouilles avec le terminal et que tu sais installer un paquet Python, tu peux avoir des transcriptions de qualité en moins de dix minutes.

À quoi tu veux servir la voix en texte

Avant de choisir un modèle, il vaut mieux cerner le travail. Le STT (speech-to-text) couvre des scénarios qui se ressemblent mais pèsent différemment :

  • Transcrire réunions, entretiens, cours ou podcasts en texte brut. Ici, ce qui prime, c'est la précision et la capacité à tenir sur de l'audio long.
  • Sous-titres de vidéos : il te faut le texte plus les horodatages synchronisés, idéalement au niveau du mot.
  • Diarisation : séparer qui dit quoi quand il y a plusieurs voix. Tous les modèles ne le font pas d'origine.
  • Dictée ou transcription en temps réel : ici, c'est la latence qui commande, pas la précision absolue.
  • Traiter du volume : des milliers de fichiers en file d'attente, où ce qui compte, c'est le débit (combien d'audio tu traites par seconde).

Chacun de ces cas fait pencher la balance vers un modèle différent. C'est pour ça qu'il n'existe pas « le meilleur » tout court : il existe le meilleur pour ton besoin.

Qu'est-ce que Whisper et pourquoi il domine encore

Whisper est le modèle de reconnaissance vocale qu'OpenAI a libéré en open source et qui a changé la donne : pour la première fois, il existait un modèle gratuit, à poids ouverts, qui transcrivait 99+ langues avec une précision que seuls les services payants offraient jusque-là. Il a été entraîné sur 680 000 heures d'audio issu d'internet, et cette diversité lui donne une robustesse folle face aux accents, au bruit de fond et à l'audio de mauvaise qualité.

En 2026, sa version de référence est Whisper large-v3, avec un WER (taux d'erreur par mot) autour de 7,4 % en anglais et un support multilingue qu'aucun concurrent open source n'égale en ampleur. Il existe des versions plus petites (tiny, base, small, medium) qui sacrifient la précision au profit de la vitesse et de la mémoire, et une variante large-v3-turbo optimisée qui traite l'audio à plus de 200x le temps réel avec une perte de précision minime.

La clé pour tout comprendre : Whisper est le modèle ; les « variantes » sont des façons de l'exécuter. faster-whisper, whisper.cpp et WhisperX utilisent les mêmes poids de Whisper. Avec le même audio et la même configuration, ils donnent pratiquement la même transcription. Ce qui change, c'est le moteur d'inférence : la vitesse, la mémoire consommée et les extras ajoutés.

Astuce

Règle mentale : quand quelqu'un dit « j'utilise Whisper », demande-lui avec quel moteur. C'est la différence entre transcrire une heure d'audio en cinq minutes ou en quarante.

Les variantes de Whisper : laquelle pour quoi

C'est là que se décide 90 % des cas. Trois moteurs couvrent presque tout :

faster-whisper — le cheval de bataille

C'est une réimplémentation de Whisper sur CTranslate2, un moteur d'inférence en C++ très optimisé. Il prend en charge la quantification (int8), qui réduit l'usage mémoire et accélère l'inférence jusqu'à 4x plus vite que le Whisper d'origine, en gardant la même précision. Si tu as un GPU NVIDIA, c'est ton option par défaut : rapidité et consommation de VRAM gagnantes. C'est ce que je recommande pour la majorité.

whisper.cpp — pour Mac et CPU

Un portage pur en C/C++ sans dépendances externes. Il compile en un petit binaire, utilise le format GGML avec quantification entière et tourne n'importe où. Sur Mac (Apple Silicon), il exploite Metal et Core ML ; sur les machines sans GPU, c'est la façon la plus légère de transcrire. Si tu n'as pas de carte graphique dédiée ou si tu travailles sur un portable, commence par là.

WhisperX — quand tu as besoin de timestamps et de diarisation

Au lieu de courir après la vitesse brute, WhisperX transforme Whisper en un pipeline de transcription complet : il ajoute des horodatages au niveau du mot (alignement phonétique) et la diarisation (séparer les intervenants). C'est l'option pour des sous-titres exacts ou des transcriptions d'entretiens où il importe de savoir qui a dit quoi.

Attention

Il existe d'autres variantes (insanely-fast-whisper, distil-whisper, etc.), mais ne te disperse pas : faster-whisper pour GPU, whisper.cpp pour Mac/CPU et WhisperX pour les timestamps couvrent presque tous les besoins réels. Le reste, ce sont des optimisations pour des cas précis.

Au-delà de Whisper : Distil-Whisper, Parakeet et Canary

Whisper n'est plus seul au sommet. Trois familles méritent ton attention si ton cas est spécifique :

Distil-Whisper est une version distillée de Whisper : 51 % plus petite (756 M de paramètres contre 1 550 M pour large-v3) et environ 6x plus rapide, avec seulement ~1 % d'erreur en plus sur de l'audio long. Le hic : elle est optimisée pour l'anglais. Si tu transcris de l'anglais et que tu veux de la vitesse sans presque rien lâcher en précision, c'est une pépite.

NVIDIA Parakeet est la famille de NVIDIA pour l'anglais (avec des variantes multilingues récentes). Son point fort, c'est le débit brutal : le RTFx (facteur de temps réel) dépasse les 2 000, ce qui la rend imbattable pour traiter de gros volumes d'audio en lot. La version TDT v3 ajoute le support multilingue, au prix d'un peu de précision en anglais.

NVIDIA Canary-Qwen 2.5B est, à ce jour, le roi de la précision sur l'Open ASR Leaderboard de Hugging Face : un WER de 5,63 %, en dessous de Whisper, avec une couverture d'environ 25 langues (anglais et langues européennes surtout) et une vitesse d'inférence très élevée. Si ce que tu cherches, c'est la transcription la plus exacte possible dans ces langues, c'est la référence.

Et pour les appareils embarqués, des modèles comme Moonshine (à partir de 27 Mo) tournent sur du matériel minimal, hors connexion, idéals pour la dictée embarquée ou l'IoT.

Tableau comparatif

Comparatif des modèles open source de voix en texte en 2026
Modèle / moteurMeilleur pourPrécision (WER anglais)VitesseLangues
Whisper large-v3Multilingue, compatibilité maximale~7,4 %Base (référence)99+
faster-whisperGPU NVIDIA, usage général~7,4 % (identique)Jusqu'à 4x plus rapide99+
whisper.cppMac et CPU sans GPU~7,4 % (identique)Léger, optimisé99+
WhisperXSous-titres et diarisation~7,4 % + timestampsRapide + extras99+
Distil-WhisperAnglais rapide~9,7 % (~1 % de plus)~6x plus rapideAnglais
NVIDIA Parakeet TDTVolume / lots~8,0 %RTFx >2 000 (maximum)Anglais / multi (v3)
NVIDIA Canary-QwenPrécision maximale5,63 % (leader)Très élevée~25
Faites glisser pour voir tout le tableau

Les chiffres de WER viennent de benchmarks publics (Open ASR Leaderboard et comparatifs indépendants) et sont indicatifs : l'erreur réelle dépend de l'audio, de la langue et de la configuration. Ne t'attache pas à une décimale ; attache-toi au cas d'usage.

Exécuter Whisper en local, pas à pas

Passons au concret avec faster-whisper, l'option recommandée pour la majorité. Il te faut Python 3.9+ et, idéalement, un GPU NVIDIA (ça marche sur CPU, juste plus lentement).

1. Installe le paquet :

Installation (terminal)
pip install faster-whisper

2. Transcris un fichier avec un script Python :

Transcrire de l'audio avec faster-whisper
from faster_whisper import WhisperModel

# Modèle large-v3 avec quantification int8 (rapide et peu de VRAM)
# Utilise device="cpu" si tu n'as pas de GPU NVIDIA
model = WhisperModel("large-v3", device="cuda", compute_type="int8")

segments, info = model.transcribe("entretien.mp3", beam_size=5)

print(f"Langue détectée : {info.language} ({info.language_probability:.2f})")

for segment in segments:
  print(f"[{segment.start:.2f}s -> {segment.end:.2f}s] {segment.text}")

3. Ce que fait chaque chose :

  • WhisperModel("large-v3", ...) charge le grand modèle (il le télécharge la première fois). Passe à "small" ou "medium" si tu es juste en mémoire.
  • compute_type="int8" active la quantification : moins de VRAM et plus de vitesse avec à peine une perte de qualité.
  • transcribe() détecte la langue tout seul. Si tu la connais déjà, passe language="fr" pour accélérer.
  • Chaque segment apporte le texte et les horodatages (start, end), c'est justement ce dont tu as besoin pour exporter en SRT et générer des sous-titres.

4. Pour les sous-titres, parcours les segments et déverse le texte avec ses timestamps au format SRT ou VTT. Si tu veux une précision au niveau du mot ou séparer les intervenants, c'est le moment de passer à WhisperX.

Astuce

Commence toujours par un clip court (une minute) pour vérifier la langue et la qualité avant de lâcher les deux heures entières. Ça fait gagner du temps et ça te dit si tu dois monter ou descendre de modèle.

Sur Mac sans GPU, l'équivalent serait de compiler whisper.cpp, de télécharger un modèle GGML (ggml-large-v3.bin) et de lancer le binaire sur ton fichier : même qualité, exécution native optimisée pour Apple Silicon.

Pour qui chaque modèle ?

Il n'y a pas de gagnant absolu. Il y a une adéquation :

faster-whisper si tu as un GPU NVIDIA et que tu veux le meilleur en général : rapide, multilingue, précis. C'est la réponse pour 80 % des gens.

whisper.cpp si tu travailles sur Mac ou sur une machine sans carte graphique. Léger, sans dépendances, natif.

WhisperX si ton travail, ce sont des sous-titres exacts ou des transcriptions avec plusieurs intervenants identifiés. Journalistes, monteurs vidéo, gens du podcast.

Distil-Whisper si tu transcris seulement de l'anglais et que la vitesse est ta priorité. Deux fois plus rapide pour presque aucune erreur en plus.

NVIDIA Parakeet si tu traites du volume industriel : des milliers de fichiers, des pipelines automatisés, où le débit commande.

NVIDIA Canary-Qwen si tu as besoin de la précision maximale possible en anglais et en langues européennes, et que renoncer à la couverture de 99 langues de Whisper ne te gêne pas.

La question honnête n'est pas « quel est le meilleur modèle de voix en texte ? », parce que la réponse change avec ton matériel et ton cas. La question, c'est « je transcris en local, gratuitement et en privé, ou je paie à la minute un service qui garde mon audio ? ». Et en 2026, la réponse pour presque tout le monde, c'est la première : l'open source transcrit déjà aussi bien, sur ta machine, sans passer par la caisse.

FAQ

Le STT (speech-to-text) est la technologie qui convertit l'audio parlé en texte écrit. Il sert à transcrire des réunions, des entretiens et des podcasts, à générer des sous-titres automatiques de vidéos, à dicter du texte, à indexer de l'audio pour la recherche et à alimenter des assistants vocaux. Les modèles open source font tout cela sur ta propre machine, sans coût à la minute ni envoi de l'audio dans le cloud.

Il n'y en a pas un seul : ça dépend de l'usage. Pour une couverture multilingue (99+ langues) et une compatibilité maximale, Whisper large-v3 reste maître. Pour la vitesse sur GPU, faster-whisper. Pour de l'anglais à débit extrême, NVIDIA Parakeet. Pour la meilleure précision absolue en anglais et en langues européennes, NVIDIA Canary-Qwen. La recommandation pratique pour la plupart des gens, c'est faster-whisper avec le modèle large-v3.

Les trois utilisent les mêmes poids de Whisper d'OpenAI, donc avec le même audio ils donnent pratiquement la même précision. Ce qui change, c'est le moteur : le Whisper d'origine tourne sous PyTorch ; faster-whisper le réimplémente sur CTranslate2 (jusqu'à 4x plus rapide et moins de VRAM avec la quantification) ; whisper.cpp est un portage en C/C++ sans dépendances, idéal pour Mac (Metal/Core ML) et CPU.

Pas forcément. Avec faster-whisper et la quantification int8, un GPU de milieu de gamme transcrit bien plus vite qu'en temps réel. Sans GPU, whisper.cpp avec un modèle petit ou moyen fonctionne sur n'importe quel portable moderne, et les modèles de type Moonshine (27 Mo) tournent même sur des appareils embarqués. Le modèle large réclame plus de mémoire, mais les variantes distilled abaissent la barre.

Oui, et c'est l'un de leurs meilleurs usages. Whisper et ses variantes produisent des horodatages, et des formats comme WhisperX donnent des timestamps au niveau du mot pour des sous-titres parfaitement synchronisés. faster-whisper et whisper.cpp exportent directement en SRT ou VTT, les formats de sous-titres standard que YouTube, Premiere ou n'importe quel lecteur comprennent.

Partager
Newsletter

Recevez les prochains guides par e-mail

Des idées et ressources sur l'IA et le marketing, sans remplissage. Ce qui marche et comment l'appliquer.

Des idées et des ressources, sans spam. Désabonne-toi quand tu veux.

Ce guide vous est utile ?

S'abonner