Modèles et LLM

GPT-4o : OpenAI ouvre son IA multimodale aux utilisateurs gratuits de ChatGPT

OpenAI déploie GPT-4o dans ChatGPT, y compris pour les utilisateurs gratuits, avec des échanges plus fluides en texte et en image. Le nouveau modèle doit aussi faire une place centrale à la voix. Cette ouverture élargit l’accès à l’IA générative, sans faire disparaître les limites d’usage, de fiabilité et de confidentialité.

Une personne utilise un ordinateur et un smartphone pour analyser une image et converser avec une IA.
Illustration : Actu.ai

Une IA capable de lire un document, commenter une image et répondre à la voix avec moins de latence : c’est la promesse formulée par OpenAI avec son nouveau modèle. Le 13 mai 2024, l’entreprise a présenté GPT-4o, appelé à devenir le moteur d’une expérience ChatGPT plus directe, plus multimodale et surtout plus largement accessible. La nouveauté ne réside pas seulement dans une hausse de performances : OpenAI veut mettre une partie de ces capacités à la portée des utilisateurs qui n’ont pas d’abonnement payant.

Le nom prête toutefois à confusion. Il ne s’agit pas de « GPT-40 », mais de GPT-4o, avec la lettre « o » pour « omni ». Ce terme renvoie à l’ambition du modèle : faire dialoguer plus naturellement plusieurs types d’informations, notamment le texte, l’image et l’audio.

GPT-4o, et non GPT-40 : qu’a lancé OpenAI ?

GPT-4o est un nouveau grand modèle de langage, ou LLM, développé par OpenAI. Comme les précédentes versions de GPT, il peut rédiger, résumer, traduire, répondre à des questions ou aider à analyser un contenu. Sa particularité est d’être présenté comme un modèle nativement multimodal, c’est-à-dire pensé pour traiter plusieurs formats au sein d’un même système.

Dans la démonstration d’OpenAI, l’utilisateur ne se limite plus à taper une demande dans une fenêtre de discussion. Il peut montrer une image, poser une question à voix haute, interrompre l’assistant, demander une reformulation ou lui faire commenter ce qu’il voit. L’objectif affiché est de rendre l’interaction plus proche d’un échange oral que d’une succession de requêtes écrites.

Cette évolution ne signifie pas que l’IA comprend le monde comme un humain. Un modèle génératif prédit des éléments de réponse à partir d’énormes quantités de données d’entraînement et du contexte fourni. Il peut produire une explication pertinente, reconnaître certains éléments d’une image ou suivre le fil d’une conversation, mais il peut aussi se tromper, manquer une nuance ou affirmer avec assurance une information inexacte.

Un modèle conçu pour le texte, l’image et la voix

Jusqu’ici, une conversation vocale avec une IA pouvait reposer sur plusieurs briques techniques : une première transcrivait la parole en texte, un modèle de langage formulait une réponse, puis une synthèse vocale la lisait. OpenAI promet avec GPT-4o une approche plus intégrée. La voix, les intonations et les interruptions doivent pouvoir être prises en compte avec davantage de fluidité.

L’entreprise indique que GPT-4o peut répondre à des échanges audio avec un délai moyen de 320 millisecondes, et jusqu’à 232 millisecondes dans les meilleurs cas. C’est un niveau de réactivité comparable au temps de réponse d’un interlocuteur humain dans une conversation ordinaire. Sur le papier, ce gain est essentiel : une voix artificielle qui attend plusieurs secondes avant chaque réponse donne vite l’impression d’un dialogue mécanique.

Au moment de l’annonce, les capacités immédiatement proposées dans ChatGPT concernent avant tout le texte et les images. Les fonctions vocales avancées, montrées par OpenAI lors de sa présentation, doivent faire l’objet d’un déploiement progressif dans les semaines suivantes, d’abord auprès d’un petit groupe d’abonnés ChatGPT Plus.

Fonction ou accès annoncé le 13 mai 2024Ce que cela signifie pour l’utilisateurDisponibilité annoncée
Conversations en texte avec GPT-4oRédiger, expliquer, résumer, traduire ou répondre à des questionsUtilisateurs gratuits et abonnés, avec des limites différentes
Analyse d’imagesPoser une question sur une photo, un schéma ou une capture d’écranDéploiement dans ChatGPT, selon les limites d’usage
Navigation, analyse de données et import de fichiersUtiliser ChatGPT sur des contenus plus variés qu’un simple messageFonctions étendues aux utilisateurs gratuits dans le déploiement annoncé
Voix avancée en temps réelConverser oralement, interrompre l’IA et obtenir des réponses plus naturellesDéploiement progressif annoncé pour les abonnés Plus
Accès par APIIntégrer GPT-4o dans un service ou une applicationFacturation distincte, destinée aux développeurs

Pour les développeurs, OpenAI annonce aussi un coût de 5 dollars par million de jetons en entrée et 15 dollars par million de jetons en sortie via son API. Un jeton est une unité de texte utilisée par les modèles, qui peut correspondre à un mot, une partie de mot ou un signe de ponctuation. L’entreprise affirme que GPT-4o est 50 % moins cher que GPT-4 Turbo dans cette grille tarifaire et offre des limites de débit cinq fois plus élevées.

Qui peut utiliser GPT-4o dans ChatGPT ?

Le changement le plus visible concerne l’offre gratuite de ChatGPT. OpenAI annonce que GPT-4o doit être proposé aux utilisateurs sans abonnement, dans la limite de plafonds d’usage. C’est une inflexion importante : les modèles les plus avancés de l’entreprise ont longtemps été associés en priorité à l’offre payante ChatGPT Plus.

Cette ouverture ne rend pas les offres identiques. Les abonnés payants conservent une capacité d’utilisation plus élevée. OpenAI indique qu’ils bénéficient d’une limite de messages avec GPT-4o pouvant aller jusqu’à cinq fois celle des utilisateurs gratuits. En pratique, cela compte pour les personnes qui utilisent l’outil de manière intensive, pour travailler sur de longs documents, analyser de nombreux fichiers ou multiplier les conversations au cours d’une journée.

GPT-4o dans ChatGPT : accès gratuit ou abonnement payant

Utilisateurs gratuits

  • Accès annoncé à GPT-4o dans ChatGPT.
  • Utilisation soumise à des plafonds de messages.
  • Accès étendu à la vision, aux fichiers et à l’analyse de données.
  • Fonctions vocales avancées non annoncées immédiatement pour cette formule.

Abonnés ChatGPT Plus

  • Accès à GPT-4o avec une capacité d’usage supérieure.
  • Limite de messages pouvant atteindre cinq fois celle de l’offre gratuite.
  • Accès prioritaire aux nouveautés annoncées par OpenAI.
  • Déploiement progressif des fonctions vocales avancées prévu dans les semaines suivantes.

Cette distinction entre accès et volume est déterminante. Une personne qui souhaite demander une explication ponctuelle, préparer un courrier ou comprendre une image peut bénéficier d’une expérience plus riche qu’auparavant sans payer. En revanche, un professionnel dont le travail dépend quotidiennement de l’outil risque d’atteindre plus vite les restrictions de l’offre gratuite.

L’API suit une logique différente. Elle ne relève pas de l’abonnement ChatGPT : les entreprises et développeurs qui souhaitent intégrer GPT-4o dans un site, un logiciel ou un service client paient en fonction de leur consommation. L’annonce d’un modèle moins coûteux et capable de gérer du texte et de la vision peut donc aussi intéresser les éditeurs d’applications.

Quels usages GPT-4o peut-il changer au quotidien ?

La multimodalité a un intérêt concret lorsqu’elle évite à l’utilisateur de transformer manuellement une situation en texte. Une photographie, un graphique ou un fichier peuvent servir de point de départ à une question. Cela réduit certaines barrières techniques et élargit les usages possibles de ChatGPT.

Pour le grand public, GPT-4o peut notamment servir à :

  • demander l’explication d’un graphique ou d’un schéma difficile à interpréter ;
  • résumer le contenu d’un document importé, puis poser des questions complémentaires ;
  • obtenir une aide à la rédaction, à la traduction ou à la reformulation d’un texte ;
  • utiliser une conversation vocale pour pratiquer une langue ou préparer un exposé ;
  • identifier les étapes de résolution d’un problème à partir d’une image, tout en vérifiant le résultat par soi-même.

Dans l’éducation, un assistant plus réactif peut faciliter la reformulation d’une notion ou l’entraînement oral. Dans la relation client, il peut aider à produire des réponses, classer des demandes ou guider un utilisateur dans une procédure. Dans le marketing, il peut proposer des variantes de messages et analyser des contenus fournis. Mais l’outil ne remplace pas l’expertise du professeur, du conseiller, du juriste, du soignant ou du créatif qui l’emploie.

C’est particulièrement vrai pour les décisions qui ont des conséquences importantes. Une IA générative peut suggérer une réponse convaincante sans disposer du contexte complet, sans citer correctement ses sources et sans détecter toutes les erreurs de son propre raisonnement. Pour un contrat, une démarche administrative, une recommandation médicale ou un choix financier, la vérification humaine demeure indispensable.

L’IA devient-elle vraiment accessible à tous ?

L’accès gratuit à GPT-4o rend les outils d’OpenAI plus accessibles, mais il ne suffit pas à effacer toutes les inégalités d’usage. Il faut disposer d’un appareil connecté, savoir formuler sa demande, comprendre les limites de l’outil et être capable d’évaluer sa réponse. L’aisance numérique et la maîtrise de la langue restent des facteurs importants.

La voix pourrait justement abaisser une partie de ces barrières. Parler est plus naturel que rédiger une instruction détaillée, notamment pour les jeunes enfants, les personnes peu habituées au clavier ou celles qui ont besoin d’une interaction plus directe. Encore faut-il que les fonctions vocales tiennent leurs promesses de disponibilité, de qualité et de sécurité lors de leur déploiement.

Il faut aussi distinguer l’accessibilité technique de l’accessibilité économique. La gratuité avec des plafonds permet de découvrir un outil avancé et de l’utiliser occasionnellement. Elle ne garantit pas un service sans interruption ni les mêmes possibilités qu’un abonnement. OpenAI conserve ainsi une offre payante pour les usages plus soutenus, tout en élargissant sa base d’utilisateurs.

Fiabilité, confidentialité et sécurité : les questions qui demeurent

L’arrivée d’une IA plus conversationnelle peut donner l’impression qu’elle est plus fiable ou plus consciente de ce qu’elle dit. Il faut résister à ce raccourci. La vitesse d’une réponse, son ton naturel ou sa capacité à commenter une image ne constituent pas une garantie de vérité. GPT-4o doit être considéré comme un assistant capable d’aider à explorer, rédiger et comprendre, pas comme une autorité infaillible.

La confidentialité prend aussi une dimension nouvelle avec la voix et l’image. Une photo peut contenir un visage, une adresse, un écran professionnel, un document personnel ou des informations concernant un tiers. Un enregistrement vocal peut révéler des données privées et le contexte d’une conversation. Avant d’importer un contenu, mieux vaut se demander s’il est nécessaire de le transmettre à un service en ligne et relire les réglages ainsi que les conditions applicables au compte utilisé.

Pour les organisations, le cadre d’usage doit être clair. Quels documents les salariés peuvent-ils soumettre à l’outil ? Quelles réponses doivent être vérifiées ? Qui est responsable d’un contenu erroné ou d’une donnée divulguée ? Ces questions valent autant pour GPT-4o que pour les autres IA génératives. L’élargissement de l’accès rend leur traitement plus urgent, car ces outils sortent du cercle des spécialistes.

Ce qu’il faut surveiller après cette annonce

Au 14 mai 2024, GPT-4o marque surtout une double évolution : une IA qui se veut plus naturelle dans ses échanges et une stratégie d’accès plus ouverte de la part d’OpenAI. La qualité réelle de l’expérience dépendra toutefois du déploiement des fonctions vocales, de la stabilité du service et des limites appliquées aux comptes gratuits.

Il faudra également observer la place que prendra le modèle dans les usages professionnels. La baisse des coûts annoncée pour l’API pourrait encourager davantage d’entreprises à intégrer texte et image dans leurs produits. Mais cette diffusion ne sera durable que si les gains de productivité s’accompagnent de contrôles, de règles de confidentialité et d’une information claire des utilisateurs.

Enfin, GPT-4o illustre une tendance plus large : l’interface de l’IA générative quitte progressivement le seul champ de la conversation écrite. Si la voix, l’image et le texte fonctionnent réellement ensemble avec fluidité, l’IA pourrait devenir moins visible comme technologie, mais plus présente dans les gestes ordinaires. Cette proximité rendra d’autant plus nécessaire l’apprentissage d’un réflexe simple : utiliser l’assistant pour s’aider, puis vérifier avant d’agir.

Questions fréquentes

GPT-40 et GPT-4o, est-ce le même modèle ?

Le modèle présenté par OpenAI le 13 mai 2024 s’appelle GPT-4o, avec la lettre « o », et non GPT-40 avec le chiffre zéro. Ce « o » signifie « omni » et désigne l’ambition multimodale du système, conçu pour gérer le texte, l’image et l’audio dans une même expérience.

GPT-4o est-il vraiment gratuit dans ChatGPT ?

Oui, OpenAI annonce l’arrivée de GPT-4o pour les utilisateurs gratuits de ChatGPT. Cet accès reste toutefois soumis à des limites d’utilisation. Les abonnés ChatGPT Plus conservent une capacité de messages plus importante, pouvant aller jusqu’à cinq fois celle proposée aux comptes gratuits.

Que peut faire GPT-4o avec une image ?

GPT-4o peut analyser une image fournie dans ChatGPT et répondre à des questions à son sujet. Il peut par exemple aider à comprendre un schéma, commenter un graphique ou décrire des éléments visibles. Ses réponses doivent néanmoins être vérifiées, car il peut mal interpréter un détail ou fournir une explication erronée.

Quand la conversation vocale de GPT-4o sera-t-elle disponible ?

Le 13 mai 2024, OpenAI a annoncé un déploiement progressif de ses nouvelles fonctions vocales dans les semaines suivantes. Elles doivent d’abord être testées auprès d’un petit groupe d’abonnés ChatGPT Plus. Les fonctions de texte et d’image constituent la première étape de l’accès élargi au modèle.

Peut-on confier des documents personnels à GPT-4o ?

Il est préférable de ne pas transmettre de documents contenant des données sensibles, comme des informations médicales, financières, professionnelles ou concernant d’autres personnes, sans avoir vérifié les réglages et les conditions du service. Une IA peut être utile pour analyser un fichier, mais cette commodité doit être mise en balance avec la confidentialité des informations partagées.

Sources

Références consultées pour la rédaction de cet article. Les adresses sont indiquées à titre informatif et ne sont pas des liens.

  1. OpenAI, annonce officielle de GPT-4o, 13 mai 2024openai.com/index/hello-gpt-4o
  2. OpenAI, fiche de sécurité de GPT-4oopenai.com/index/gpt-4o-system-card
  3. OpenAI, présentation Spring Update et nouveautés de ChatGPTopenai.com/index/spring-update