Quel modèle de transcription locale choisir ? Vitesse, langue et mémoire
Le plus gros modèle n’est pas automatiquement le meilleur choix. Pour une dictée interactive, un modèle plus rapide que le temps réel et assez fiable sur votre vocabulaire bat souvent un modèle lourd qui interrompt le flux.
Dernière vérification: 2026-07-31. Voicetypr propose plusieurs modèles locaux et publie ce guide. Les caractéristiques générales viennent des dépôts OpenAI, ggml-org et de la documentation NVIDIA ; aucun benchmark matériel indépendant n’a été réalisé ici.
Verdict rapide
Commencez par le modèle recommandé par l’application pour votre plateforme, puis augmentez seulement si les corrections diminuent assez pour compenser l’attente et la mémoire. Pour le français, vérifiez explicitement un modèle multilingue ; plusieurs variantes Parakeet historiques sont anglaises.
Verdict selon votre profil
Ordinateur modeste
Petit modèle quantifié d’abord
Il réduit mémoire et attente, puis laisse mesurer si la qualité suffit.
Français et autres langues
Modèle multilingue vérifié
Une famille de modèles peut contenir des versions anglaises et multilingues différentes.
Longs fichiers
Tester débit et stabilité
Le meilleur choix de dictée courte n’est pas forcément celui d’une heure d’audio.
Critères de choix
Langues déclarées
Ne déduisez pas la portée d’une famille : vérifiez la variante exacte et sa carte de modèle.
Mémoire et accélération
CPU, GPU, Apple Silicon et quantification changent fortement le temps de traitement.
Erreur sur votre corpus
Mesurez noms, jargon et bruit ; une moyenne publique ne remplace pas votre test.
Whisper propose un continuum plutôt qu’un gagnant
OpenAI documente des modèles tiny, base, small, medium, large et turbo avec des exigences mémoire et vitesses relatives différentes. Les valeurs publiées sont indicatives et dépendent du matériel, de la langue et de l’audio.
Les variantes .en ciblent l’anglais ; pour le français, choisissez une variante multilingue. Turbo vise une transcription rapide mais n’est pas le bon outil pour traduire la parole vers l’anglais.
Le moteur d’inférence compte aussi
whisper.cpp optimise l’exécution sur plusieurs plateformes et propose quantification, CPU, Metal, CUDA et autres accélérations. Le même nom de modèle peut donc produire un profil de mémoire et de vitesse différent selon l’implémentation.
NVIDIA documente Parakeet comme une famille avec plusieurs décodeurs et langues. La documentation évolue : vérifiez la carte exacte au lieu d’écrire simplement “Parakeet est multilingue”.
Une méthode de sélection en trois passages
Premier passage : éliminez les modèles incompatibles avec votre langue et votre matériel. Deuxième : mesurez vitesse et erreurs sur cinq extraits. Troisième : gardez le plus petit modèle dont les erreurs critiques restent acceptables.
Répétez après une mise à jour importante. Conservez les sorties brutes et ne laissez pas une mise en forme facultative masquer les différences entre moteurs.
Limites et points à vérifier
- Les modèles réellement proposés peuvent varier selon la version et la plateforme de Voicetypr.
- Les chiffres du dépôt OpenAI ne prédisent pas la vitesse sur votre ordinateur.
- Cette page ne classe pas les modèles sans corpus français commun.
Notre méthode
- Lecture des tableaux de modèles officiels OpenAI.
- Vérification des capacités d’inférence dans le dépôt whisper.cpp.
- Contrôle des langues et familles dans la documentation NVIDIA NeMo.
Sources
- OpenAI — Whisper
- ggml-org — whisper.cpp
- NVIDIA NeMo — choisir un modèle
- NVIDIA NeMo — modèles ASR
- Voicetypr — confidentialité et parcours des données
- Voicetypr — tarifs publics
Revérifiez les prix, la compatibilité et les conditions de confidentialité auprès de chaque éditeur avant achat.
Questions fréquentes
Le plus gros modèle est-il toujours plus précis ?
Non. Il peut mieux réussir certains corpus, mais la langue, le bruit, l’implémentation et le matériel changent le résultat.
Quel modèle choisir pour le français ?
Écartez les variantes explicitement anglaises, puis comparez les modèles multilingues disponibles sur vos propres extraits.
La quantification réduit-elle la qualité ?
Elle réduit surtout la taille et peut modifier légèrement le résultat selon le niveau. Mesurez le compromis sur le même corpus.
Vérifiez le flux avec votre propre voix
L’essai de trois jours ne demande pas de carte. Utilisez un texte représentatif, gardez la transcription brute et contrôlez le résultat dans vos applications habituelles avant d’acheter.