Alternatives à Whisper (OpenAI) : quelles API de transcription françaises en 2026 ?

Tu cherches une alternative à Whisper d'OpenAI pour transcrire de l'audio en français ? Réponse courte : Gladia pour la couverture multilingue et le temps réel en production, Voxtral de Mistral AI pour le prix le plus bas et des modèles que tu peux héberger toi-même. Maintenant, voici pourquoi ce choix se joue beaucoup moins sur la précision annoncée que sur trois questions qu'on oublie presque toujours de poser.
Précision d'entrée de jeu : je n'ai pas ouvert de compte de production sur ces API, les chiffres qui suivent viennent de la documentation technique et des tarifs publics des éditeurs, datés et sourcés. Whisper a rendu la transcription automatique accessible à tout le monde fin 2022. Trois ans plus tard, le rapport de force a changé, et deux acteurs français sont devenus des options crédibles en production.
Whisper n'est plus le choix par défaut
Whisper reste une excellente base, mais ce n'est plus la référence automatique. OpenAI facture aujourd'hui la transcription autour de 0,006 $ par minute avec gpt-4o-transcribe, 0,003 $ avec la version mini, et environ 0,017 $ par minute pour le temps réel. Sans dégressivité publique sur le volume : le tarif est le même que tu traites une heure ou dix mille heures par mois.
C'est précisément ce qui a ouvert la porte aux concurrents. Sur un produit qui transcrit en continu, un assistant de réunion, un support client, un agent vocal, la transcription cesse d'être une ligne de test pour devenir un poste de coût, et l'arbitrage se joue au centime.
| Critère | Whisper / OpenAI | Gladia | Voxtral (Mistral AI) |
|---|---|---|---|
| Éditeur | États-Unis | France (Paris) | France (Paris) |
| Langues | ~99 | 100+ | 13 en natif |
| Prix asynchrone | ~0,006 $ / min | 0,61 € / h, dès 0,20 € / h au volume | ~0,003 $ / min |
| Temps réel | ~0,017 $ / min | 0,75 € / h, dès 0,25 € / h | Oui, latence < 200 ms |
| Modèle auto-hébergeable | Oui (Whisper open source) | Non | Oui (poids ouverts) |
Gladia couvre le plus de langues
Gladia est aujourd'hui l'option française la plus solide pour un produit multilingue. Fondée à Paris en 2022, elle a lancé en juin 2026 Solaria-3, la troisième génération de son modèle maison, conçue pour l'audio professionnel réel : réunions bruyantes, débit rapide, interlocuteurs qui se coupent.
Les chiffres publiés par l'éditeur : plus de 100 langues en asynchrone comme en temps réel, une latence sous les 300 millisecondes, 9,6 % de taux d'erreur sur de l'anglais réel, plus de 300 000 développeurs et 2 milliards de minutes transcrites.
Sur le prix, il faut être honnête, et c'est plus intéressant que le discours habituel : Gladia n'est pas moins cher que Whisper par défaut. Le plan Starter est à 0,61 € par heure en asynchrone, soit davantage qu'OpenAI. C'est au volume que ça bascule, avec le plan Growth annoncé à partir de 0,20 € par heure. En temps réel, en revanche, l'écart s'inverse dès le premier plan. Gladia se justifie quand tu transcris beaucoup ou que tu transcris en direct, pas quand tu prototypes.
Voxtral casse les prix et se laisse rapatrier chez toi
Mistral AI a complété sa pile audio en février 2026 avec Voxtral Transcribe 2, deux modèles pensés pour la production : un pour le batch, un pour le temps réel. Au programme, 13 langues en natif dont le français, environ 4 % de taux d'erreur sur le benchmark FLEURS, une latence annoncée sous 200 millisecondes, la diarisation, le biais de contexte pour lui imposer ton vocabulaire métier et des horodatages au mot.
Le tarif est le vrai argument : environ 0,003 $ la minute, soit la moitié du prix de gpt-4o-transcribe.
Surtout, les poids des modèles Voxtral sont publiés en ouvert sur Hugging Face. Tu peux donc les faire tourner sur ta propre infrastructure. Pour une entreprise dont l'audio ne doit tout simplement pas sortir de chez elle, c'est la seule option de cette comparaison qui règle le problème à la racine, sans contrat ni promesse contractuelle à faire respecter.
Les scores de précision annoncés ne sont pas comparables
C'est le piège numéro un de ce marché, et personne ne le dit. Gladia annonce 9,6 % de taux d'erreur, Mistral environ 4 % : on en conclut mécaniquement que Mistral est deux fois plus précis. C'est faux, parce que ce ne sont pas les mêmes épreuves.
FLEURS est un benchmark de parole lue, articulée, enregistrée proprement. L'audio business réel, c'est un micro d'ordinateur portable posé au milieu d'une table, deux personnes qui se coupent la parole et un accent régional. En passant du premier au second, les taux d'erreur montent en flèche, chez tous les fournisseurs sans exception. Comparer un score FLEURS à un score sur audio conversationnel, c'est comparer un temps sur piste sèche à un temps sous la pluie.
Le seul benchmark qui compte, c'est ton propre audio. Prends trente minutes représentatives de ton usage réel, avec tes accents, ton jargon et ton bruit de fond, et passe-les dans les trois API. Gladia offre 50 € de crédits pour ça, et les tarifs à la minute des deux autres rendent le test quasi gratuit.
La souveraineté se joue sur la juridiction, pas sur le serveur
Contrairement à ce qu'on lit souvent, le risque avec une API américaine n'est pas qu'elle s'entraîne sur ton audio : OpenAI ne le fait pas sur les données transmises par API par défaut. Le vrai sujet est juridique. Un fournisseur de droit américain reste soumis au Cloud Act, qui permet aux autorités américaines de réclamer des données détenues par une entreprise américaine, quel que soit le pays où elles sont stockées.
Pour de la voix, l'enjeu est très concret, parce que l'audio d'entreprise est rarement anodin : conversations clients, entretiens de recrutement, comités de direction, consultations médicales. Gladia affiche RGPD, HIPAA, SOC 2 Type 2 et ISO 27001, avec une option de non-conservation des données selon le plan. Mistral, éditeur français lui aussi, ajoute la possibilité de tout garder en interne via les modèles ouverts.
Si ton audio contient des données personnelles ou stratégiques, le pays de l'éditeur n'est pas un supplément d'âme, c'est une ligne de la spécification technique.
Alors, lequel choisir ?
Pour un produit multilingue ou du temps réel en production, prends Gladia : la couverture à 100+ langues et la latence sous 300 ms sont les meilleures du lot, et le tarif devient compétitif dès que le volume monte.
Pour le meilleur coût sur du français ou de l'anglais, ou si tu veux pouvoir rapatrier le modèle chez toi un jour, prends Voxtral de Mistral AI.
Pour prototyper en une soirée sans réfléchir à l'architecture, Whisper fait toujours parfaitement le travail. Le piège est simplement de ne jamais rouvrir le dossier ensuite, et de découvrir la facture et la question juridique le jour où le produit marche.
Questions fréquentes
Quelle est la meilleure alternative française à Whisper d'OpenAI ?+
Cela dépend de l'usage. Pour un produit multilingue ou de la transcription en temps réel, Gladia est le choix le plus solide : fondée à Paris en 2022, son modèle Solaria-3 couvre plus de 100 langues avec une latence annoncée sous 300 millisecondes. Pour le meilleur coût sur du français ou de l'anglais, ou pour héberger le modèle sur sa propre infrastructure, Voxtral de Mistral AI est préférable : environ 0,003 $ la minute et des poids de modèle publiés en ouvert sur Hugging Face.
Gladia est-il moins cher que Whisper ?+
Pas par défaut. Le plan Starter de Gladia est à 0,61 € par heure en transcription asynchrone, soit davantage que les 0,006 $ par minute facturés par OpenAI pour gpt-4o-transcribe. Gladia devient moins cher au volume, avec un plan Growth annoncé à partir de 0,20 € par heure, et sur le temps réel, où l'écart s'inverse dès le premier plan face aux 0,017 $ par minute d'OpenAI.
Peut-on comparer les taux d'erreur (WER) annoncés par les éditeurs ?+
Non, sauf s'ils portent sur le même benchmark. Mistral annonce environ 4 % de taux d'erreur sur FLEURS, un corpus de parole lue et enregistrée proprement, tandis que Gladia annonce 9,6 % sur de l'anglais réel de type conversation professionnelle. Les deux chiffres ne mesurent pas la même difficulté : les taux d'erreur montent fortement sur de l'audio bruité, chez tous les fournisseurs. Le seul test fiable consiste à passer son propre audio dans chaque API.
Pourquoi choisir une API de transcription européenne plutôt qu'américaine ?+
Le risque principal n'est pas l'entraînement sur vos données : OpenAI ne s'entraîne pas sur les données transmises par API par défaut. L'enjeu est juridique. Un éditeur de droit américain reste soumis au Cloud Act, qui permet aux autorités américaines de réclamer des données détenues par une entreprise américaine, quel que soit leur pays de stockage. Pour de l'audio d'entreprise (entretiens de recrutement, conversations clients, comités de direction), cette exposition juridique est un critère technique à part entière.
Outils cités dans cet article
L'API française de transcription audio : plus de 100 langues, temps réel sous 300 ms.