Outils et applications

Gemini ajoute Canvas et Audio Overview pour écrire, coder et écouter ses documents

Google enrichit Gemini avec Canvas, un espace de travail pour affiner des textes et tester du code, et Audio Overview, qui transforme des documents en discussions audio. Lancées en mars 2025, ces fonctions rapprochent l’assistant conversationnel de la création de contenus, avec des usages distincts et quelques limites à connaître.

Écran d’ordinateur avec un document en cours d’édition et une synthèse audio générée à partir de notes.
Illustration : Actu.ai

Google fait évoluer Gemini au-delà de la simple fenêtre de conversation. Avec Canvas et Audio Overview, annoncés en mars 2025, l’assistant peut désormais accompagner plus directement deux étapes souvent séparées du travail numérique : mettre en forme une idée, puis la restituer sous une forme plus facile à consulter. L’une des fonctions vise l’écriture et le code, l’autre l’écoute.

L’ambition est claire : éviter les allers-retours permanents entre un chatbot, un traitement de texte, un éditeur de code et un outil de synthèse. Dans Gemini, Canvas ouvre un espace dédié pour faire progresser un brouillon ou un prototype. Audio Overview part, lui, de documents fournis par l’utilisateur afin d’en produire une conversation audio de type podcast. Ces deux outils ne remplissent toutefois pas le même rôle, et ils ne remplacent ni une relecture humaine ni un véritable espace de gestion de projet.

Deux nouveautés pour transformer la conversation en production

Jusqu’ici, l’usage le plus courant d’un assistant conversationnel consistait à formuler une demande, recevoir une réponse, puis copier celle-ci dans un autre logiciel. Cette logique reste possible, mais Google veut rendre le cycle de création plus continu. Avec Canvas, la réponse générée par Gemini devient un objet que l’on peut retravailler dans un panneau distinct. Avec Audio Overview, un ensemble de contenus écrits peut devenir une synthèse orale que l’on écoute plutôt que l’on lit.

Ces fonctions s’inscrivent dans la stratégie multimodale de Gemini. Un même assistant peut traiter du texte, du code et des documents, puis en proposer plusieurs formes de restitution. Il ne s’agit pas d’une fusion de tous les outils de création de Google, mais d’une tentative de rapprocher les premières étapes, souvent les plus fastidieuses, de la réflexion, de la rédaction et de la révision.

FonctionPoint de départRésultat principalDisponibilité annoncée en mars 2025
CanvasUne consigne, un texte ou une idée de codeUn espace de travail pour réviser un document ou tester un prototypeDéploiement mondial dans Gemini et Gemini Advanced, dans toutes les langues
Audio OverviewDes documents, des présentations ou des rapports Deep ResearchUne discussion audio de type podcast entre deux voix d’IADéploiement mondial dans Gemini et Gemini Advanced, en anglais

Cette distinction est importante. Canvas n’est pas un outil de montage audio, tandis qu’Audio Overview ne sert pas à écrire un article phrase par phrase. Le premier aide à construire, le second aide à assimiler.

Canvas, un espace pour rédiger et coder avec Gemini

Canvas apparaît comme une surface de travail associée à la conversation avec Gemini. Au lieu de recevoir un long bloc de texte dans le fil de discussion, l’utilisateur peut demander à l’IA de créer un premier brouillon dans un espace latéral, puis de le modifier avec elle. L’intérêt n’est pas seulement de produire plus vite : il est de pouvoir intervenir sur une partie précise sans devoir réécrire toute sa consigne.

Pour un texte, le principe est simple. On peut demander une trame d’article, un discours, une fiche de révision ou le plan d’une présentation. Une fois le contenu affiché dans Canvas, il est possible de sélectionner un passage et de demander à Gemini de le raccourcir, d’en modifier le ton, d’en changer le format ou de proposer une autre formulation. Google met ainsi l’accent sur un travail par itérations : un premier jet, des corrections ciblées, puis une version plus aboutie.

L’outil vise aussi les développeurs et les personnes qui apprennent à programmer. Gemini peut y produire du code pour des prototypes d’applications web, des scripts Python, des jeux ou d’autres projets. Canvas permet de visualiser et d’interagir avec certains résultats de code dans un environnement de prévisualisation. L’utilisateur peut alors formuler une demande très concrète, comme modifier un élément de l’interface, ajouter une fonction ou corriger un comportement, sans repartir d’une page blanche.

L’apport est particulièrement tangible pour les débutants. Un prototype permet de comprendre le lien entre une instruction en langage naturel, le code généré et le résultat à l’écran. Cela ne dispense pas de comprendre la logique du programme, ni de contrôler sa sécurité ou ses éventuelles erreurs. Mais Canvas peut réduire la barrière initiale qui sépare une idée d’une première démonstration fonctionnelle.

Canvas ou Audio Overview : deux façons d’utiliser Gemini

Canvas pour construire

  • Travaille sur un brouillon de texte ou un projet de code.
  • Permet des retouches ciblées de ton, de longueur ou de format.
  • Peut prévisualiser certains prototypes et résultats de code.
  • Convient à l’écriture, à l’idéation et à l’expérimentation.
  • Peut exporter un document vers Google Docs.

Audio Overview pour comprendre

  • Part de documents, de diapositives ou de rapports Deep Research.
  • Produit une discussion audio de type podcast entre deux voix d’IA.
  • Aide à découvrir ou revoir un contenu dense par l’écoute.
  • Ne remplace pas la consultation du document source.
  • Est annoncé en anglais au lancement.

Audio Overview, un document raconté sous forme de conversation

Audio Overview repose sur une idée différente : quand un dossier est long ou dense, l’écoute peut parfois constituer une porte d’entrée plus pratique que la lecture linéaire. L’utilisateur ajoute à Gemini des documents, des diapositives ou des rapports produits par Deep Research, puis déclenche la génération d’un aperçu audio. Gemini crée alors une discussion de type podcast entre deux voix d’IA à partir des sources fournies.

Le résultat ne doit pas être compris comme une simple lecture vocale intégrale. La promesse est plutôt celle d’une conversation synthétique : les deux voix parcourent les idées importantes, établissent des liens et rendent le sujet plus facile à aborder. Ce format peut être utile pour se familiariser avec un rapport, revoir les grandes lignes d’un cours ou préparer une réunion à partir de documents déjà rassemblés.

La fonction s’inspire d’Audio Overviews, déjà connue dans NotebookLM, l’outil de recherche documentaire de Google. Son arrivée dans Gemini rapproche donc cette expérience audio de l’assistant généraliste de l’entreprise. Pour une personne qui utilise Deep Research afin de constituer un dossier, la possibilité de l’écouter ensuite donne une seconde manière de l’explorer.

Il convient néanmoins de ne pas confondre accessibilité et exhaustivité. Une conversation audio générée par IA peut omettre une nuance, simplifier un raisonnement ou mettre l’accent sur un point secondaire. Elle est particulièrement adaptée à la découverte et à la révision, moins à la vérification d’un chiffre, d’une clause ou d’une citation précise. Pour ces usages, le document d’origine demeure la référence à consulter.

Au moment de l’annonce, Audio Overview est disponible en anglais. Cette limite de langue concerne la fonctionnalité elle-même, y compris lorsque les utilisateurs de Gemini peuvent converser avec l’assistant dans d’autres langues. Google indique vouloir étendre l’expérience à davantage de langues par la suite, sans donner de calendrier précis.

Ce que ces outils changent, et ce qu’ils ne font pas

Le principal changement tient à la continuité du travail. Un étudiant peut demander le plan d’une explication, reprendre une section dans Canvas, puis créer un aperçu audio d’un document de cours. Un professionnel peut transformer des notes en brouillon, exporter ce dernier vers Google Docs, puis écouter une synthèse d’un rapport préparatoire. Un développeur peut enfin utiliser Canvas pour passer d’une idée à un prototype testable.

Ces scénarios ne signifient pas que Gemini devient automatiquement un studio de production complet. Plusieurs limites pratiques doivent être gardées en tête :

  • Le contrôle éditorial reste humain. Une formulation fluide n’est pas nécessairement exacte. Les textes, résumés et explications doivent être relus, surtout lorsqu’ils contiennent des données sensibles ou des éléments factuels importants.
  • L’audio n’est pas une preuve. Audio Overview synthétise des contenus fournis, mais il ne remplace pas leur lecture lorsqu’une décision dépend de détails précis.
  • Le partage n’est pas la coédition native. Canvas est conçu pour travailler avec l’IA. Les fonctions de collaboration entre personnes relèvent plutôt des outils de partage habituels, notamment après export.
  • Les formats de fichiers ne sont pas détaillés. L’annonce ne garantit pas d’export audio particulier, tel que MP3 ou WAV. Elle ne fixe pas non plus de limite chiffrée au nombre de projets Canvas.

Quels usages pour les étudiants, les créateurs et les équipes ?

Pour les étudiants, Canvas peut aider à structurer une dissertation, simplifier un paragraphe trop complexe ou créer un petit outil pédagogique. Audio Overview peut servir à réviser un dossier dans un format plus conversationnel. La bonne pratique consiste à conserver les sources de cours à portée de main et à comparer la synthèse audio au contenu initial.

Pour les créateurs de contenu, Canvas offre une méthode rapide pour explorer plusieurs angles, adapter le niveau de langage à un public ou clarifier un plan. La fonction ne doit pas être utilisée comme une machine à publier : l’originalité, la vérification des informations et le respect des droits sur les contenus fournis restent indispensables.

Pour les équipes, l’intérêt se situe dans la préparation. Un compte rendu peut être transformé en brouillon plus lisible, une idée technique en prototype, et un rapport long en aperçu audio. Dans un cadre professionnel, il faut toutefois examiner les règles internes avant d’ajouter à Gemini des documents confidentiels, des données personnelles ou des informations stratégiques. Le confort d’usage ne doit pas faire oublier la prudence dans le choix des fichiers transmis à un service en ligne.

Ce qu’il faut surveiller

La première question sera celle de l’adoption réelle. Canvas réussira s’il permet de gagner du temps sans éloigner les utilisateurs de leurs outils habituels de rédaction et de développement. Sa valeur dépendra aussi de la qualité des modifications demandées : une instruction précise, portant sur un passage clairement sélectionné, produit généralement un résultat plus utile qu’une demande vague de réécriture complète.

Pour Audio Overview, l’enjeu sera l’extension linguistique. Une fonction de synthèse orale a un intérêt évident pour les personnes qui préfèrent écouter, mais sa portée internationale restera limitée tant que l’anglais sera la seule langue annoncée. La qualité de la restitution, la fidélité aux documents et la capacité à préserver les nuances seront tout aussi déterminantes.

Enfin, ces outils illustrent une évolution plus large des assistants d’IA : ils ne se contentent plus de répondre à une question, ils cherchent à devenir des espaces où l’on écrit, expérimente, révise et consulte. Cette intégration peut rendre la technologie plus accessible. Elle rend aussi la vérification des résultats, la protection des documents partagés et la distinction entre assistance et décision humaine encore plus essentielles.

Questions fréquentes

Comment utiliser Canvas dans Gemini ?

Dans Gemini, Canvas s’active depuis la barre de saisie prévue à cet effet. Vous pouvez demander à l’IA de rédiger un brouillon ou de générer du code, puis intervenir directement sur le contenu affiché dans l’espace de travail. Sélectionnez un passage pour demander une modification ciblée, par exemple un ton plus simple, un texte plus court ou une autre mise en forme.

Canvas de Gemini permet-il de travailler à plusieurs en temps réel ?

Canvas est conçu pour travailler de façon interactive avec Gemini, mais l’annonce de mars 2025 ne le présente pas comme un espace de coédition simultanée entre plusieurs utilisateurs humains. Pour partager un document avec une équipe, Google indique qu’il peut être exporté vers Google Docs, où les fonctions de partage et de commentaires habituelles peuvent ensuite être utilisées.

Comment Gemini crée-t-il un podcast à partir d’un document ?

Il faut ajouter à Gemini un document, une présentation ou un rapport issu de Deep Research, puis lancer Audio Overview. L’outil génère une discussion audio de type podcast, animée par deux voix d’IA, qui synthétise les éléments du contenu fourni. Ce n’est pas une lecture mot à mot : il faut donc consulter le fichier initial pour vérifier un détail important.

Audio Overview de Gemini est-il disponible en français ?

Non, pas au moment de l’annonce du 20 mars 2025. Google déploie Audio Overview auprès des utilisateurs de Gemini et Gemini Advanced dans le monde, mais la fonctionnalité est alors proposée en anglais. Google évoque l’arrivée d’autres langues à l’avenir, sans préciser de date ni confirmer la disponibilité du français.

Peut-on télécharger les podcasts Gemini en MP3 ou en WAV ?

L’annonce de Google sur Audio Overview ne garantit pas l’export de l’audio dans un format précis, comme MP3 ou WAV. Elle décrit avant tout une expérience d’écoute dans Gemini, construite à partir des documents ajoutés. Il ne faut donc pas considérer la fonction comme un outil de production ou de distribution de podcasts au sens traditionnel.

Sources

Références consultées pour la rédaction de cet article. Les adresses sont indiquées à titre informatif et ne sont pas des liens.

  1. Google Blog, annonce de Canvas et Audio Overview dans Gemini, mars 2025blog.google
  2. NotebookLM, outil de recherche documentaire de Google intégrant les Audio Overviewsnotebooklm.google