Voxtral, le modèle audio open source avec lequel Mistral AI vise la transcription
Mistral AI lance Voxtral, sa première famille de modèles open source consacrée à la parole. Déclinée en versions 24B et Mini 3B, elle entend combiner transcription, compréhension du contenu audio et prise en charge multilingue, à un tarif annoncé inférieur à 0,001 dollar la minute via l’API.

La voix est devenue l’une des principales portes d’entrée vers l’intelligence artificielle. Réunions de travail, entretiens, cours, appels au service client ou notes dictées contiennent une masse d’informations difficile à exploiter lorsqu’elle reste enfermée dans un fichier sonore. Avec Voxtral, présenté le 17 juillet 2025, Mistral AI veut transformer ces enregistrements en texte, mais aussi permettre d’en extraire du sens.
L’entreprise française lance ainsi sa première famille de modèles open source dédiée à l’audio. Son ambition ne se limite pas à produire une transcription mot à mot : Voxtral est conçu pour identifier la langue d’un enregistrement, répondre à des questions sur son contenu et générer des résumés. Mistral AI met en avant un service facturé à moins de 0,001 dollar par minute via son API, ainsi qu’une disponibilité en téléchargement sur Hugging Face.
Voxtral, la première famille audio de Mistral AI
Jusqu’ici surtout connue pour ses modèles de langage capables de traiter et de générer du texte, Mistral AI investit avec Voxtral le champ de la parole. La famille comprend deux déclinaisons, Voxtral 24B et Voxtral Mini 3B. Elles visent les usages de reconnaissance vocale et de transcription, un domaine où les logiciels doivent faire face à de nombreuses difficultés concrètes : accents, débit de parole, vocabulaire spécialisé, alternance entre plusieurs langues et qualité inégale des microphones.
La reconnaissance vocale automatique consiste d’abord à convertir un signal audio en texte. Mais, dans de nombreux cas, disposer de la retranscription intégrale ne suffit pas. Une équipe qui enregistre une réunion souhaite retrouver une décision prise à un moment donné. Un journaliste peut vouloir isoler un passage précis d’un entretien. Un étudiant peut chercher les idées principales d’un cours. C’est sur cette seconde étape, la compréhension du contenu, que Mistral AI entend distinguer Voxtral.
Le terme « open source » employé par l’entreprise renvoie ici à la mise à disposition des modèles en téléchargement. Cette possibilité intéresse notamment les organisations qui souhaitent expérimenter sur leur propre infrastructure ou garder un contrôle opérationnel sur leur environnement technique. Elle n’empêche pas l’existence d’une offre facturée : l’accès par API, c’est-à-dire un service en ligne auquel les développeurs connectent leurs applications, est proposé à un prix par minute d’audio traitée.
Deux modèles et des limites de durée annoncées
Mistral AI décline Voxtral en une version appelée 24B et une version plus compacte, Voxtral Mini 3B. L’entreprise ne détaille pas, dans cette présentation, les cas d’usage précis à privilégier pour chacune des deux variantes. Elle les propose toutefois comme deux options de sa nouvelle gamme pour des besoins différents en matière de reconnaissance et de compréhension de la parole.
Les informations communiquées fixent également des plafonds de durée selon la tâche demandée. Voxtral peut traiter jusqu’à 30 minutes d’audio pour la transcription et jusqu’à 40 minutes pour une analyse approfondie, telle que la recherche d’information dans l’enregistrement ou la génération d’un résumé.
| Élément | Information communiquée par Mistral AI |
|---|---|
| Modèles disponibles | Voxtral 24B et Voxtral Mini 3B |
| Transcription | Jusqu’à 30 minutes d’audio |
| Compréhension et analyse | Jusqu’à 40 minutes d’audio |
| Accès | Téléchargement sur Hugging Face et API Mistral |
| Prix API annoncé | Moins de 0,001 dollar par minute |
| Langues citées | Français, espagnol, hindi, entre autres |
Ces chiffres décrivent les capacités annoncées dans les différents modes d’utilisation, non une garantie universelle de résultat. Une conversation très bruitée, plusieurs personnes qui parlent simultanément ou des noms propres rares restent, pour tout système de transcription, des situations plus complexes qu’un enregistrement clair réalisé dans de bonnes conditions.
Transcrire, comprendre et interroger un enregistrement
Le point central de l’annonce est la « compréhension sémantique native » mise en avant par Mistral AI. Derrière cette expression, l’objectif est de ne pas traiter l’audio comme une simple suite de mots à convertir en texte. Le modèle doit aussi relier les propos entre eux afin de répondre à des questions sur ce qui a été dit ou de produire une synthèse exploitable.
Dans un entretien professionnel, cela pourrait par exemple servir à demander quels sujets ont été abordés, quelles informations sont associées à une personne ou à retrouver une réponse dans un passage long. Pour un appel de service client, un tel outil peut aider à identifier le motif de l’échange et à produire un compte rendu. Dans le cadre d’un cours, il peut rendre plus facile le repérage des notions principales dans une captation audio.
Mistral AI indique aussi que Voxtral reconnaît automatiquement plusieurs langues, en citant notamment le français, l’espagnol et l’hindi. Cette détection automatique est utile lorsque l’on ignore la langue du fichier en entrée ou lorsqu’une même personne alterne entre plusieurs idiomes. Elle ne dispense pas de vérifier le résultat final, en particulier lorsque la précision des termes importe : compte rendu juridique, vocabulaire médical, noms de produits ou citations destinées à être publiées.
La source évoque enfin la possibilité, dans une future mise à jour, de différencier les interlocuteurs et de détecter certaines caractéristiques telles que l’âge ou le sexe. Ces capacités ne sont pas présentées comme disponibles lors de l’annonce. La séparation des locuteurs peut améliorer la lisibilité d’une transcription d’échange, mais l’inférence de caractéristiques personnelles soulève aussi des questions de fiabilité et de respect de la vie privée.
Que valent les promesses face à Whisper et Gemini ?
Mistral AI affirme que Voxtral surpasse plusieurs concurrents sur différents benchmarks, ces tests standardisés utilisés pour comparer les performances de modèles. L’entreprise cite notamment Whisper large-v3, un modèle de reconnaissance vocale largement employé dans l’écosystème open source, et indique que Voxtral rivalise avec Gemini 2.5 Flash pour la transcription comme pour des tâches multilingues.
Ces annonces donnent un point de repère, mais elles doivent être lues avec la prudence habituelle face aux benchmarks publiés par un éditeur. Aucun chiffre détaillé n’est fourni ici pour mesurer l’écart annoncé selon les langues, la qualité des fichiers ou les types de contenu. Or un modèle peut exceller sur un jeu de test et se montrer moins convaincant dans des conditions réelles particulières, par exemple face à un accent régional, à du bruit de fond ou à des conversations où les intervenants se coupent régulièrement.
Le prix constitue l’autre axe de comparaison avancé par Mistral AI. Avec un coût inférieur à 0,001 dollar la minute, l’entreprise affirme proposer une solution à moins de la moitié du coût de certaines offres concurrentes. Pour les organisations qui doivent traiter des volumes importants d’appels, de réunions ou de médias, la dépense par minute peut peser fortement dans le choix d’un prestataire. Mais elle ne doit pas être évaluée isolément : la qualité de transcription, les besoins de correction humaine, les contraintes d’intégration et le traitement des données comptent tout autant.
Une arrivée annoncée dans Le Chat
Mistral AI prévoit d’intégrer progressivement Voxtral à Le Chat, son agent conversationnel, dans les prochaines semaines. Les utilisateurs pourront enregistrer un son ou importer un fichier audio, obtenir une transcription, poser des questions au sujet de l’enregistrement et demander un résumé.
Cette intégration peut rendre les fonctions audio plus accessibles à des personnes qui ne développent pas d’application. Plutôt que de configurer une API ou un logiciel de transcription séparé, elles pourront interagir avec le contenu vocal dans la même interface conversationnelle. L’intérêt dépendra naturellement de la qualité des résultats sur les fichiers soumis et de la simplicité des fonctions d’import ou d’enregistrement lors du déploiement effectif.
L’enjeu est aussi de rapprocher deux opérations souvent séparées. Les outils de dictée et de transcription produisent un texte que l’utilisateur doit ensuite relire ou analyser dans une autre application. Un modèle vocal couplé à un assistant conversationnel promet de raccourcir ce parcours : de l’audio brut à une question précise, puis à une réponse ou une synthèse.
Ce que les entreprises peuvent adapter
Au-delà de l’accès standard, Mistral AI annonce des options destinées aux entreprises. Elles pourront recourir au fine-tuning, c’est-à-dire à l’adaptation d’un modèle à des données ou à un domaine particulier. L’entreprise cite la santé, le droit et le service client parmi les secteurs concernés. Un tel ajustement peut aider à mieux reconnaître du vocabulaire spécialisé, des formulations récurrentes ou des noms propres propres à une organisation.
Mistral AI prévoit également un déploiement privé sur l’infrastructure de l’entreprise, ainsi qu’un accompagnement pour l’intégration. Cette option peut intéresser les organisations qui manipulent des enregistrements sensibles ou qui souhaitent intégrer la reconnaissance vocale à leurs outils internes. Elle ne dispense pas d’évaluer les règles de conservation, les droits d’accès et les conditions dans lesquelles les personnes enregistrées sont informées.
L’adaptation d’un modèle n’est pas non plus une solution automatique. Elle suppose de disposer d’exemples pertinents et suffisamment représentatifs, puis de vérifier que le système reste performant sur des cas nouveaux. Dans la santé comme dans le droit, une transcription imparfaite ou un résumé qui omet une nuance peut avoir davantage de conséquences que dans un usage de prise de notes personnelle.
Ce qu’il faut surveiller
Voxtral place Mistral AI sur un terrain stratégique : celui des interfaces vocales, où l’utilité d’un modèle ne se mesure pas seulement à sa capacité à reconnaître des mots, mais à sa faculté à restituer correctement le sens d’un échange. L’intégration annoncée à Le Chat sera un premier indicateur de la manière dont ces fonctions peuvent être appropriées par le grand public.
Il faudra surtout observer les résultats sur des fichiers réels en français et dans des contextes multilingues, les modalités pratiques du déploiement privé pour les entreprises, ainsi que la précision des modèles lorsque l’audio est long ou dégradé. Les promesses de performance face à Whisper large-v3 et Gemini 2.5 Flash devront, elles aussi, être confrontées à des évaluations indépendantes et à des cas d’usage concrets.
Pour les utilisateurs, la règle demeure simple : un système de reconnaissance vocale peut accélérer considérablement la prise de notes et la recherche d’information, mais une transcription ou une synthèse produite par IA doit être relue dès lors qu’elle sert de document de référence. C’est particulièrement vrai pour les propos attribués à une personne, les données sensibles et les décisions professionnelles.
Questions fréquentes
Qu’est-ce que Voxtral de Mistral AI ?
Voxtral est une famille de modèles open source dédiée à l’audio, présentée par Mistral AI le 17 juillet 2025. Elle sert à convertir des enregistrements en texte, mais aussi à analyser leur contenu, produire des résumés et répondre à des questions sur ce qui a été dit. La gamme comprend Voxtral 24B et Voxtral Mini 3B.
Combien coûte l’API Voxtral ?
Mistral AI annonce un tarif inférieur à 0,001 dollar par minute d’audio traitée via son API. Ce mode d’accès permet aux développeurs de connecter Voxtral à un logiciel ou à un service. Les modèles sont aussi proposés au téléchargement sur Hugging Face, tandis que les entreprises peuvent envisager un déploiement privé accompagné par Mistral AI.
Quelles langues Voxtral peut-il reconnaître ?
Mistral AI indique que Voxtral détecte automatiquement plusieurs langues. L’entreprise cite explicitement le français, l’espagnol et l’hindi. La détection automatique est particulièrement utile pour traiter des fichiers dont la langue n’est pas connue à l’avance ou des enregistrements multilingues. La qualité finale doit néanmoins être vérifiée selon le contexte et la qualité sonore.
Quelle durée audio Voxtral peut-il traiter ?
Selon les caractéristiques annoncées, Voxtral peut transcrire jusqu’à 30 minutes d’audio. Pour les tâches de compréhension plus poussées, comme répondre à une question sur l’enregistrement ou en générer un résumé, la limite annoncée atteint 40 minutes. Ces durées correspondent aux capacités communiquées par Mistral AI pour les différents modes d’usage.
Voxtral est-il déjà disponible dans Le Chat ?
Au 17 juillet 2025, Mistral AI annonce une intégration progressive de Voxtral à Le Chat dans les prochaines semaines. L’objectif est de permettre aux utilisateurs d’enregistrer ou d’importer un fichier audio, puis d’obtenir une transcription, un résumé ou des réponses à leurs questions sur le contenu. L’annonce ne signifie donc pas que toutes ces fonctions sont déjà déployées pour tous les utilisateurs.
Sources
Références consultées pour la rédaction de cet article. Les adresses sont indiquées à titre informatif et ne sont pas des liens.
- Mistral AI, site officiel et actualités de l’entreprisemistral.ai
- Documentation officielle de l’API Mistraldocs.mistral.ai
- Page Hugging Face de l’organisation Mistral AIhuggingface.co/mistralai



