Outils et applications

ChatGPT déploie son mode vocal avancé, neuf voix pour des échanges plus fluides

OpenAI commence à déployer le mode vocal avancé de ChatGPT auprès d’une partie de ses abonnés. Avec neuf voix au total, dont cinq nouvelles, l’outil promet des conversations plus naturelles et gère mieux les interruptions. Son arrivée reste toutefois progressive, notamment pour les utilisateurs européens.

Une personne échange oralement avec un assistant IA sur son smartphone, entourée d’ondes sonores abstraites.
Illustration : Actu.ai

Parler à ChatGPT ne consiste plus seulement à dicter une question puis à écouter une réponse lue par une voix de synthèse. Avec son mode vocal avancé, OpenAI veut rapprocher l’échange d’une conversation orale ordinaire : l’utilisateur peut interrompre l’assistant, reprendre sa phrase ou demander un changement de ton sans avoir à repartir de zéro. Le 24 septembre 2024, l’entreprise a commencé à diffuser cette fonction de façon progressive auprès de ses abonnés payants.

L’enjeu dépasse le confort. La voix est une interface immédiate, particulièrement utile lorsqu’on marche, cuisine, conduit une réflexion à voix haute ou ne peut pas taper sur un clavier. Mais une conversation plus naturelle ne transforme pas ChatGPT en interlocuteur humain, ni en source infaillible. Ce nouveau mode doit donc être compris à la fois comme une évolution technique marquante et comme un outil à employer avec discernement.

Un déploiement progressif après l’annonce de juin

OpenAI avait annoncé ce mode vocal avancé en juin 2024. Trois mois plus tard, son déploiement commence auprès d’un nombre limité d’utilisateurs des offres ChatGPT Plus et ChatGPT Team. Il ne s’agit donc pas encore d’une disponibilité généralisée pour tous les comptes ChatGPT.

L’entreprise procède par vagues, une méthode courante pour ce type de fonction exigeante : elle permet de surveiller la qualité des réponses, le comportement de l’outil dans des conditions réelles et les éventuels problèmes de sécurité. Au 25 septembre, les abonnés éligibles doivent recevoir l’accès progressivement dans l’application.

Date ou périodeÉtape annoncée par OpenAICe que cela implique pour les utilisateurs
Juin 2024Annonce du mode vocal avancéOpenAI présente une nouvelle manière de converser oralement avec ChatGPT.
24 septembre 2024Début du déploiementLes abonnés Plus et Team sont servis progressivement.
25 septembre 2024Accès encore limitéTous les abonnés ne disposent pas nécessairement de la fonction immédiatement.
Prochaines étapes annoncéesExtension de la disponibilitéOpenAI prévoit d’élargir l’accès, y compris dans les régions non couvertes au lancement.

Pour les lecteurs français, un point compte particulièrement : OpenAI indique travailler à l’arrivée du service dans l’Union européenne, mais aussi au Royaume-Uni, en Suisse, en Islande, en Norvège et au Liechtenstein. Au moment de ce premier déploiement, la disponibilité varie donc selon le compte et le pays.

Comment le mode vocal avancé rend-il les échanges plus naturels ?

Dans une interface vocale classique, l’échange suit souvent une chaîne en plusieurs étapes : la parole est transcrite en texte, un modèle formule une réponse textuelle, puis une voix de synthèse lit cette réponse. Ce mécanisme fonctionne, mais il peut créer une impression de délai et rendre les interruptions difficiles à gérer.

Le mode vocal avancé de ChatGPT s’appuie sur les capacités audio de GPT-4o. Son ambition est de traiter directement l’audio de l’utilisateur et de produire une réponse vocale avec moins de rigidité. L’assistant peut notamment tenir compte du rythme de la conversation, marquer des pauses audibles et accepter qu’on l’interrompe avant la fin de sa réponse.

Cette fluidité change la sensation d’usage. Au lieu d’attendre systématiquement la fin d’un long monologue, il devient possible de dire, par exemple, « plus court », « explique autrement » ou « attends, je reformule ». Cela rapproche l’outil d’un dialogue, sans effacer sa nature de système informatique : ChatGPT génère une réponse probable à partir de ce qu’il entend et du contexte de la discussion.

Mode vocal classique et mode vocal avancé : ce qui change

Approche vocale classique

  • La parole est généralement convertie en texte avant le traitement par le modèle.
  • Les tours de parole sont plus séquentiels et les interruptions peuvent être moins fluides.
  • La restitution vocale peut paraître plus mécanique selon le rythme et l’intonation.
  • L’expérience ressemble davantage à une commande suivie d’une réponse.

Mode vocal avancé de ChatGPT

  • GPT-4o traite l’audio de façon plus directe pour produire une réponse vocale.
  • L’utilisateur peut interrompre l’assistant et ajuster sa demande pendant l’échange.
  • Les pauses et les variations de rythme cherchent à rendre l’écoute plus naturelle.
  • Neuf voix sont proposées, dont cinq nouvelles options lors de ce déploiement.

Neuf voix au total, dont cinq nouvelles

Cette mise à jour enrichit aussi le choix de la voix. ChatGPT propose désormais neuf voix de sortie. Cinq viennent s’ajouter aux quatre voix déjà disponibles : Arbor, Maple, Sol, Spruce et Vale. OpenAI les présente comme des options aux tons et aux personnalités distincts, afin que chacun puisse choisir une restitution plus adaptée à son usage.

Le choix d’une voix n’est pas qu’une question esthétique. Une voix posée peut être appréciée pour écouter une explication longue, tandis qu’un ton plus énergique peut mieux convenir à une séance de questions-réponses ou à un exercice de langue. Pour autant, les utilisateurs ne doivent pas y voir une identité humaine stable. La voix sert d’interface au modèle, elle ne correspond pas à une personne qui participerait réellement à l’échange.

La qualité perçue repose notamment sur la prosodie, c’est-à-dire la capacité à faire varier le rythme, les silences et l’intonation. Ces éléments sont essentiels pour éviter une diction mécanique. Ils peuvent rendre l’écoute plus agréable, mais ils ont aussi un effet psychologique : plus une voix paraît naturelle, plus il est facile d’attribuer à tort à l’outil une compréhension ou une intention humaine.

Comment accéder au mode vocal avancé de ChatGPT ?

L’accès passe par l’application ChatGPT et par la fonction vocale lorsqu’elle est proposée sur le compte. OpenAI active le mode avancé progressivement pour les abonnés Plus et Team concernés. Une fois l’accès accordé, l’utilisateur peut sélectionner une voix parmi les options proposées, puis engager une conversation orale.

Dans les faits, plusieurs conditions doivent être réunies : disposer d’un abonnement compatible, être dans une zone où le déploiement a commencé, autoriser l’accès au microphone et bénéficier d’une connexion internet suffisamment stable. Une connexion faible peut dégrader la réactivité et rendre l’échange moins naturel, même si la qualité de la voix elle-même reste élevée.

Il faut aussi distinguer le mode vocal des autres fonctions intégrées à ChatGPT Plus. Les outils de création d’images avec DALL-E 3 ou d’analyse de données enrichissent le service, mais ne sont pas des composantes du dialogue vocal. Le mode avancé est avant tout conçu pour modifier la manière dont l’utilisateur parle et écoute.

Les démonstrations d’OpenAI ont également suscité des attentes autour de la caméra ou du partage d’écran. Ces fonctions ne font pas partie de ce premier lancement du mode vocal avancé. Elles doivent arriver ultérieurement, selon le calendrier annoncé par l’entreprise. Cette distinction est importante pour éviter de confondre les capacités présentées et les fonctions effectivement disponibles à ce stade.

Quels usages peut-il réellement améliorer ?

L’IA vocale est particulièrement pertinente lorsqu’elle évite un geste contraignant, comme taper une requête sur un écran. Avec un assistant capable de suivre une conversation, plusieurs usages se dessinent sans exiger de connaissances techniques particulières.

Dans l’éducation, ChatGPT peut être sollicité pour faire réciter un cours, reformuler une notion ou entraîner la prononciation dans une langue. Dans un contexte professionnel, il peut aider à préparer une idée, organiser une liste de questions ou résumer oralement un sujet que l’utilisateur lui expose. Dans les loisirs, le dialogue vocal ouvre des pistes pour des jeux interactifs, des histoires improvisées ou des échanges plus spontanés.

Le service peut également intéresser la relation client, où les interfaces conversationnelles se multiplient. Toutefois, la présence d’une voix réaliste ne suffit pas à faire d’un outil un bon conseiller. Dans les domaines impliquant des décisions importantes, comme la santé, le droit, les finances ou la sécurité, une réponse de ChatGPT doit être vérifiée auprès de sources compétentes.

Voici quelques bonnes pratiques simples pour profiter de la conversation vocale sans lui demander plus qu’elle ne peut fournir :

  • formuler une demande précise et corriger l’assistant lorsqu’il interprète mal une question ;
  • demander une réponse courte, une liste ou une reformulation lorsque l’échange devient confus ;
  • ne pas communiquer d’informations personnelles, professionnelles ou confidentielles inutiles ;
  • vérifier les faits, les chiffres et les conseils importants avant de les utiliser.

Une expérience vocale qui pose aussi des questions de confiance

Rendre une IA plus convaincante à l’oral soulève des enjeux de confidentialité et de sécurité. Pour fonctionner, une conversation vocale implique que l’application capte la parole de l’utilisateur. Avant d’utiliser cette fonction, il est donc prudent de vérifier les autorisations du microphone et les réglages de données disponibles dans son compte.

La prudence est particulièrement recommandée dans les lieux partagés. Une demande dictée à haute voix peut révéler des informations à l’entourage, même si l’utilisateur n’a pas l’intention de les partager. Le risque ne se limite pas aux données sensibles : un échange vocal peut aussi être mal compris à cause d’un bruit ambiant, d’un accent, d’une hésitation ou d’une formulation ambiguë.

L’autre enjeu est celui de l’anthropomorphisme. Des pauses naturelles et une intonation expressive rendent ChatGPT plus facile à écouter, mais peuvent créer une impression de proximité excessive. Or, l’outil ne possède ni expérience personnelle ni jugement humain. Il peut produire une réponse fluide, assurée et pourtant erronée. Cette limite s’applique au texte comme à la voix, mais elle devient parfois moins visible lorsque la réponse est prononcée avec naturel.

Enfin, le développement de voix de synthèse réalistes renforce la nécessité de règles claires contre l’imitation abusive et les usages trompeurs. Les utilisateurs ont intérêt à rester attentifs à l’origine d’un contenu audio, surtout lorsqu’une voix prétend représenter une personne réelle ou transmettre une information sensible.

Ce qu’il faut surveiller

Le lancement de septembre 2024 marque une étape importante pour ChatGPT : OpenAI ne cherche plus seulement à améliorer la qualité des réponses écrites, mais aussi la qualité du tour de parole. Le passage à neuf voix, l’ajout de pauses et la gestion des interruptions donnent un aperçu de l’orientation prise par les assistants : des outils plus présents dans les gestes ordinaires, et moins dépendants du clavier.

Les prochains éléments à surveiller seront d’abord l’élargissement effectif du déploiement, notamment dans l’Union européenne. Il faudra aussi observer l’arrivée éventuelle des fonctions visuelles annoncées, telles que le partage d’écran et l’usage de la caméra, qui pourraient transformer un échange vocal en assistant multimodal capable de commenter ce que l’utilisateur voit.

Le véritable test restera néanmoins celui de l’utilité. Un bon assistant vocal ne se mesure pas seulement à la chaleur de sa voix ou à sa vitesse de réponse. Il doit comprendre la demande, respecter les limites fixées par l’utilisateur, rester fiable sur les informations importantes et offrir des garanties solides sur les données partagées. C’est à cette condition que la conversation avec l’IA pourra devenir un usage durable, plutôt qu’une simple démonstration technologique.

Questions fréquentes

Le mode vocal avancé de ChatGPT est-il disponible en France ?

Au 25 septembre 2024, le déploiement vient de commencer pour certains abonnés ChatGPT Plus et Team, mais OpenAI n’a pas encore ouvert le mode vocal avancé dans l’Union européenne. L’entreprise indique travailler à son arrivée dans cette zone. En France, il faut donc attendre une extension officielle du service.

Comment activer le mode vocal avancé dans ChatGPT ?

L’accès dépend d’abord du déploiement réalisé par OpenAI sur le compte de l’utilisateur. Lorsqu’il est disponible, il s’utilise depuis la fonction vocale de l’application ChatGPT, avec l’autorisation d’utiliser le microphone. Les abonnés Plus et Team concernés peuvent ensuite choisir l’une des voix proposées avant de démarrer la conversation.

Quelle différence entre le mode vocal classique et le mode vocal avancé de ChatGPT ?

Le mode avancé vise un dialogue moins séquentiel. Il permet notamment de gérer les interruptions, d’intégrer des pauses et de répondre avec une voix plus expressive. Techniquement, il s’appuie sur les capacités audio de GPT-4o. Cela rend l’échange plus fluide, mais ne rend pas les informations fournies automatiquement exactes.

Combien de voix sont disponibles dans le mode vocal avancé de ChatGPT ?

ChatGPT propose neuf voix au total avec cette mise à jour. Cinq nouvelles voix s’ajoutent aux quatre précédentes : Arbor, Maple, Sol, Spruce et Vale. Elles offrent des tons différents afin que l’utilisateur puisse choisir une restitution qui lui convient davantage. Leur réalisme ne change toutefois pas la nature automatisée des réponses.

Peut-on confier des informations personnelles au mode vocal de ChatGPT ?

Il vaut mieux éviter de dicter des données sensibles, comme des identifiants, des informations médicales détaillées, des documents professionnels confidentiels ou des coordonnées bancaires. Une conversation vocale implique l’usage du microphone et peut aussi être entendue par l’entourage. Vérifier les autorisations de l’application et les réglages de données reste une précaution essentielle.

Sources

Références consultées pour la rédaction de cet article. Les adresses sont indiquées à titre informatif et ne sont pas des liens.

  1. OpenAI, annonce du déploiement du mode vocal avancé de ChatGPT, septembre 2024openai.com/index/advanced-voice-mode
  2. OpenAI Help Center, documentation et questions fréquentes sur le mode vocalhelp.openai.com
  3. OpenAI, GPT-4o System Card, informations sur les capacités audio et la sécuritéopenai.com/index/gpt-4o-system-card