Outils et applications

ChatGPT ajoute la vidéo en direct : comment fonctionne l’assistance visuelle d’OpenAI

OpenAI étend le mode vocal avancé de ChatGPT avec la vidéo en direct et le partage d’écran. Les abonnés Plus et Pro peuvent montrer leur environnement ou leur téléphone à l’assistant pour obtenir une aide contextualisée. Au 14 décembre 2024, cette nouveauté reste toutefois indisponible dans l’Union européenne.

Une personne montre du matériel de cuisine à l’assistant vocal sur la caméra de son smartphone.
Illustration : Actu.ai

ChatGPT ne se limite plus à écouter une question ou à lire une photo envoyée dans une conversation. Avec la vidéo en direct, OpenAI rapproche son assistant d’une interaction en face à face : l’utilisateur peut montrer un objet, une pièce, un appareil ou l’écran de son téléphone, puis poser ses questions à voix haute. L’ambition est claire, faire de l’IA un interlocuteur capable de s’appuyer sur le contexte visuel immédiat.

Cette évolution a été dévoilée par OpenAI dans le cadre de son programme de lancements de décembre 2024. Elle concerne le mode vocal avancé de ChatGPT, déjà conçu pour rendre les échanges oraux plus fluides. La caméra et le partage d’écran ajoutent désormais une nouvelle couche à cette conversation : ce que l’utilisateur montre devient une information supplémentaire dont l’assistant peut tenir compte.

Au 14 décembre 2024, la fonction est annoncée pour les abonnés ChatGPT Plus et Pro sur mobile, mais son déploiement ne couvre pas encore l’Union européenne, ni la Suisse, l’Islande, la Norvège et le Liechtenstein. Cette restriction géographique est un point essentiel pour les utilisateurs français : l’annonce ne signifie pas une disponibilité immédiate en France.

Une conversation vocale qui prend en compte ce que voit la caméra

Le principe est comparable à un appel vidéo, à une différence fondamentale : l’interlocuteur est ici ChatGPT. Une fois le mode vocal avancé activé dans l’application, l’utilisateur peut accéder à un bouton vidéo et choisir la caméra avant ou arrière de son appareil. Il filme alors ce qui l’entoure tout en échangeant oralement avec l’assistant.

ChatGPT peut examiner les éléments visibles et répondre à partir de cette scène. Une personne peut, par exemple, montrer le matériel dont elle dispose pour préparer un café et demander comment procéder. L’intérêt ne réside pas seulement dans l’identification d’un objet isolé. L’assistant est censé articuler les informations fournies à l’oral avec celles qu’il perçoit à l’image : les ustensiles présents, leur disposition et la question posée.

Il faut toutefois employer l’expression « en temps réel » avec précision. Il s’agit d’une interaction conversationnelle continue, dans laquelle l’utilisateur montre une situation et obtient des réponses pendant l’échange. OpenAI ne détaille pas publiquement, dans cette annonce, chaque mécanisme interne d’analyse de la vidéo ni un niveau de performance garanti dans toutes les situations.

Vidéo en direct et partage d’écran : deux usages distincts

L’annonce d’OpenAI réunit deux capacités proches, mais différentes dans leur fonctionnement et leurs usages. La première mobilise la caméra du téléphone pour montrer le monde physique. La seconde permet de partager ce qui s’affiche sur l’écran de l’appareil, notamment dans le cadre d’une question technique ou d’une action à effectuer dans une application.

FonctionCe que l’utilisateur montreExemples d’aide possiblePoint de vigilance
Vidéo en directUn objet, une pièce, du matériel, un document devant la caméraIdentifier des éléments visibles, obtenir des étapes pour une tâche, demander une explication contextualiséeUne image floue, mal cadrée ou peu éclairée peut conduire à une interprétation incomplète
Partage d’écranL’interface du smartphone et son contenu affichéComprendre un réglage, commenter un message, être guidé dans une démarche numériqueL’écran peut contenir des informations personnelles ou confidentielles

Le partage d’écran répond en particulier à une difficulté fréquente avec les assistants conversationnels : décrire une interface est parfois beaucoup plus long que la montrer. Plutôt que de retranscrire le texte d’un bouton, le nom d’un menu ou le message d’erreur rencontré, l’utilisateur peut afficher directement la situation et demander quoi faire.

Cela ne signifie pas que ChatGPT prend le contrôle du téléphone. Dans le périmètre présenté par OpenAI, l’assistant apporte des explications et des suggestions à partir de l’écran partagé. Il peut ainsi aider à rédiger une réponse ou à comprendre les étapes d’une manipulation, mais la personne conserve la main sur les actions effectuées sur son appareil.

Vidéo en direct ou partage d’écran : quel usage avec ChatGPT ?

Vidéo en direct

  • Utilise la caméra avant ou arrière du smartphone.
  • Montre l’environnement physique, des objets ou du matériel.
  • Convient aux questions pratiques fondées sur ce qui est visible.
  • Dépend fortement du cadrage, de la lumière et de la netteté de l’image.

Partage d’écran

  • Affiche directement l’interface présente sur l’appareil.
  • Aide à comprendre un réglage, un message ou une démarche numérique.
  • Évite de décrire longuement les éléments affichés à l’écran.
  • Demande une vigilance particulière face aux données personnelles visibles.

Comment ChatGPT peut-il interpréter une vidéo ?

Cette fonction s’inscrit dans la logique des modèles dits multimodaux. Un assistant multimodal peut traiter plusieurs formes d’information, ici la parole de l’utilisateur, le texte éventuellement affiché et les éléments visuels captés par la caméra ou montrés à l’écran. Au lieu de s’appuyer uniquement sur une consigne écrite, il reçoit donc un ensemble d’indices qui peuvent rendre sa réponse plus adaptée.

Dans une conversation classique, l’utilisateur doit transformer une situation visuelle en texte : « J’ai devant moi tel appareil, avec tel bouton et tel voyant. » Avec la caméra, une partie de cette description peut être montrée. La personne peut ensuite préciser son besoin à l’oral : « À quoi sert ce bouton ? », « Dans quel ordre dois-je utiliser ces objets ? » ou « Est-ce que mon écran indique la bonne étape ? »

La valeur de l’outil vient de cette boucle courte entre observation, question et réponse. Si la première réponse ne suffit pas, il est possible de déplacer la caméra, de montrer un détail ou de reformuler sa demande, sans quitter l’échange vocal. Cela peut rendre l’assistance plus naturelle que l’envoi successif de captures d’écran ou de photographies.

Pour autant, une IA qui reconnaît certains objets ou lit du texte affiché ne possède pas une compréhension humaine parfaite de la scène. Elle peut manquer un détail hors champ, mal interpréter un objet partiellement visible ou ne pas saisir une intention implicite. Les réponses doivent donc être considérées comme une aide, non comme une validation définitive lorsqu’une erreur pourrait avoir des conséquences importantes.

Des usages quotidiens, de la cuisine au dépannage numérique

OpenAI met en avant l’idée d’un assistant qui accompagne davantage les tâches du quotidien. La démonstration autour de la préparation d’un café illustre ce que cela peut apporter : l’utilisateur n’a pas besoin de connaître le nom exact de chaque accessoire pour demander un conseil adapté au matériel visible.

Plus largement, la vidéo peut être utile dans plusieurs situations simples :

  • Apprentissage pratique : montrer des fournitures, un montage ou les étapes d’une activité afin de demander des explications adaptées à ce qui est sous les yeux.
  • Organisation domestique : faire identifier ou comparer des objets visibles, puis demander des pistes pour accomplir une tâche.
  • Aide numérique : partager un écran pour comprendre un réglage, lire une interface ou préparer la réponse à un message.
  • Accessibilité conversationnelle : privilégier la parole et la démonstration plutôt qu’une longue description écrite, lorsque cela est plus confortable pour l’utilisateur.

Dans tous ces cas, la qualité de la question reste déterminante. Montrer une scène ne suffit pas toujours. Dire ce que l’on cherche à faire, ce qui a déjà été essayé et ce qui pose problème aide l’assistant à produire une réponse plus pertinente. Il est également préférable de demander des étapes vérifiables plutôt qu’une consigne vague, surtout pour une tâche technique.

Qui peut utiliser la fonction en décembre 2024 ?

Le lancement s’inscrit dans les « 12 Days of OpenAI », une série d’annonces quotidiennes débutée le 5 décembre 2024. La vidéo et le partage d’écran sont intégrés au mode vocal avancé et réservés, lors de cette phase, aux utilisateurs des formules payantes ChatGPT Plus et ChatGPT Pro.

L’accès suppose un smartphone doté d’une caméra et une connexion Internet suffisamment stable pour maintenir une conversation vocale enrichie par l’image. L’utilisateur doit également disposer de l’application ChatGPT et du mode vocal avancé. La disponibilité réelle peut être progressive, comme c’est souvent le cas pour les nouvelles fonctions en ligne : posséder l’abonnement ne garantit pas nécessairement que l’option apparaisse instantanément sur tous les comptes ou tous les appareils.

Le principal frein, pour le public français, est géographique. OpenAI indique que la fonctionnalité ne sera pas lancée immédiatement dans l’Union européenne, ainsi qu’en Suisse, en Islande, en Norvège et au Liechtenstein. Sam Altman, dirigeant d’OpenAI, a expliqué vouloir proposer ces produits en Europe tout en évoquant des contraintes réglementaires à résoudre. L’entreprise affirme viser un lancement « le plus tôt possible ».

Cette situation rappelle qu’une nouveauté technologique mondiale ne se déploie pas nécessairement au même rythme dans tous les territoires. Les obligations locales relatives aux données personnelles, à la protection des utilisateurs et aux services numériques peuvent imposer des ajustements avant une mise à disposition.

Vie privée, qualité des réponses et autres limites à connaître

Montrer son environnement ou partager l’écran de son téléphone nécessite une précaution évidente : la caméra peut capter bien plus que l’objet que l’on souhaite faire analyser. Visages, documents, coordonnées, notifications, conversations privées ou informations de paiement peuvent apparaître involontairement. Avant de lancer une session, mieux vaut vérifier le cadre filmé et fermer les applications ou contenus sensibles.

La qualité de l’analyse dépend aussi de facteurs très concrets. Une mauvaise connexion peut gêner la fluidité de l’échange. Un éclairage insuffisant, un texte trop petit, des reflets ou une caméra instable peuvent empêcher l’assistant de distinguer correctement les éléments utiles. Dans ce cas, il vaut mieux rapprocher l’appareil, changer d’angle ou expliciter verbalement ce que l’on montre.

Enfin, l’assistant peut formuler une réponse convaincante tout en se trompant. Cette limite, déjà connue avec les modèles de langage, ne disparaît pas avec la vision. Une caméra enrichit les données à disposition de l’IA, mais elle ne garantit ni l’exhaustivité de l’observation ni la justesse de chaque conclusion. L’utilisateur doit rester décisionnaire, en particulier lorsque la situation engage sa sécurité, ses données ou son argent.

Ce qu’il faut surveiller

La nouveauté la plus importante n’est pas seulement la capacité de ChatGPT à regarder une vidéo. C’est l’évolution du rôle de l’assistant : il passe d’un outil que l’on interroge avec du texte à un compagnon conversationnel susceptible d’être mobilisé au moment même où une question survient. Voix, caméra et écran réunis dans une même interface peuvent réduire la distance entre un problème concret et l’aide demandée.

Il faudra désormais observer trois points. Le premier est le calendrier européen : OpenAI n’a pas donné de date précise pour la France au 14 décembre 2024. Le deuxième concerne la fiabilité en usage réel, loin des démonstrations, notamment face à des environnements encombrés ou des demandes ambiguës. Le troisième est celui de la confiance : plus l’IA accède à des informations visuelles et personnelles, plus les règles d’utilisation et les réflexes de confidentialité deviennent importants.

OpenAI a également présenté un mode vocal inspiré de Santa, signe que l’entreprise associe à ces avancées techniques une dimension plus ludique et personnalisée. Mais derrière cet habillage, l’enjeu est surtout pratique : faire en sorte que l’utilisateur puisse montrer ce qu’il ne sait pas décrire, puis recevoir une aide compréhensible sans interrompre son activité.

Questions fréquentes

ChatGPT peut-il vraiment analyser une vidéo en direct ?

Oui. Dans le mode vocal avancé, les abonnés ChatGPT Plus et Pro peuvent montrer une vidéo captée par la caméra de leur smartphone et discuter avec l’assistant. ChatGPT peut s’appuyer sur les éléments visibles pour répondre. Il ne s’agit toutefois pas d’une compréhension parfaite de toutes les scènes : le cadrage, la lumière et la précision de la demande restent essentiels.

Comment activer la vidéo dans le mode vocal avancé de ChatGPT ?

Il faut ouvrir le mode vocal avancé dans l’application ChatGPT, puis utiliser le bouton vidéo prévu à cet effet. L’utilisateur peut alors employer la caméra avant ou arrière de son smartphone pendant la conversation. Au 14 décembre 2024, cette possibilité est annoncée pour les abonnements Plus et Pro, sous réserve de sa disponibilité dans le pays concerné.

Quelle différence entre la vidéo et le partage d’écran de ChatGPT ?

La vidéo montre le monde réel au moyen de la caméra : un objet, un appareil ou une pièce. Le partage d’écran montre, lui, ce qui s’affiche sur le téléphone. Le premier est adapté à l’assistance pratique dans un environnement physique, le second à l’aide pour une interface, un réglage ou un message. Les deux fonctions s’utilisent dans le mode vocal avancé.

La vidéo de ChatGPT est-elle disponible en France ?

Non, pas au moment de la publication de cet article, le 14 décembre 2024. OpenAI a indiqué que les fonctions de vidéo et de partage d’écran ne sont pas encore proposées dans l’Union européenne, ainsi qu’en Suisse, en Islande, en Norvège et au Liechtenstein. L’entreprise dit travailler à un lancement européen dès que possible, sans annoncer de date précise.

ChatGPT peut-il agir directement sur mon téléphone grâce au partage d’écran ?

Le partage d’écran permet à ChatGPT de voir l’interface affichée et de proposer une aide contextualisée, par exemple pour comprendre une étape ou préparer une réponse. Dans la présentation de cette fonction, il s’agit d’une assistance et non d’une prise de contrôle de l’appareil. L’utilisateur conserve la responsabilité des choix et des actions réalisés sur son téléphone.

Sources

Références consultées pour la rédaction de cet article. Les adresses sont indiquées à titre informatif et ne sont pas des liens.

  1. OpenAI, programme 12 Days of OpenAI et annonces de décembre 2024openai.com/index/12-days-of-openai
  2. Centre d’aide d’OpenAI, questions fréquentes sur le mode vocalhelp.openai.com/en/articles/8400625-voice-mode-faq