Veo arrive dans Vertex AI, Google vise la vidéo générative professionnelle
Google Cloud intègre Veo, son modèle de génération vidéo par IA, à Vertex AI en aperçu privé. Le service promet des séquences en 1080p de plus d’une minute, créées à partir de texte ou d’images. Mais l’accès restreint impose encore de la prudence face aux démonstrations.

La course à la vidéo générée par intelligence artificielle ne se joue plus seulement dans les laboratoires et les démonstrations spectaculaires. Avec l’arrivée de Veo dans Vertex AI, Google Cloud veut faire entrer son modèle de création vidéo dans l’environnement de travail des entreprises, des développeurs et des équipes de production déjà clientes de sa plateforme.
Annoncé par Google Cloud le 3 décembre 2024 en aperçu privé, Veo promet de transformer une consigne écrite ou une image en séquence animée. Google met particulièrement en avant la définition 1080p, la possibilité de dépasser une minute de vidéo et une cadence de 24 ou 30 images par seconde. Des caractéristiques ambitieuses pour un secteur où la fluidité des mouvements et la stabilité des images restent les difficultés les plus visibles.
Veo dans Vertex AI : qu’annonce exactement Google Cloud ?
Veo est le modèle de génération vidéo de Google. Présenté initialement par l’entreprise en mai 2024, il fait désormais son entrée dans Vertex AI, la plateforme cloud de Google conçue pour permettre aux organisations d’accéder à des modèles d’intelligence artificielle et de les utiliser dans leurs propres projets.
Cette arrivée ne correspond pas à un lancement grand public. Veo est proposé en aperçu privé, ce qui signifie que seuls des clients sélectionnés peuvent y accéder à ce stade. Les créateurs indépendants, le public et une partie des médias ne peuvent donc pas librement éprouver l’outil. Il faut faire une distinction importante entre les vidéos de démonstration diffusées par Google et les résultats qu’obtiendraient des utilisateurs sur des demandes ordinaires, parfois complexes ou imparfaitement formulées.
L’intérêt de Vertex AI est d’inscrire Veo dans un cadre professionnel. Une entreprise qui travaille déjà dans l’écosystème Google Cloud peut envisager la génération vidéo comme une capacité supplémentaire au sein de ses flux de travail, plutôt que comme un service isolé. Cela peut concerner la création de maquettes visuelles, de contenus de communication, de prototypes publicitaires ou de séquences destinées à illustrer une idée avant une production plus lourde.
Les capacités annoncées de Veo en un coup d’œil
La promesse technique de Veo repose sur une combinaison de durée, de définition et de modes de création. Le modèle peut partir d’une instruction textuelle, mais aussi d’une image à animer. Google évoque également des invites vidéo, sans que les modalités précises de ce type d’entrée soient détaillées dans l’annonce.
| Caractéristique | Ce que Google annonce pour Veo |
|---|---|
| Accès | Aperçu privé dans Vertex AI |
| Définition maximale annoncée | 1080p |
| Durée annoncée | Des vidéos pouvant dépasser une minute |
| Cadence annoncée | 24 ou 30 images par seconde |
| Création depuis du texte | Génération texte-vers-vidéo |
| Création depuis une image | Génération image-vers-vidéo |
| Effets mis en avant | Time-lapse et mouvements de caméra |
La génération texte-vers-vidéo consiste à décrire une scène, une action, une ambiance ou un sujet, afin que le modèle produise les images animées correspondantes. L’exercice demande davantage qu’une simple succession de belles images : l’outil doit comprendre les relations entre les éléments de la scène, maintenir l’apparence des sujets et construire un mouvement crédible dans le temps.
La fonction image-vers-vidéo répond à une autre logique. L’image fournit un point de départ visuel, par exemple un personnage, un décor ou une composition, que le système doit prolonger sous forme de mouvement. Pour les équipes créatives, cet usage peut être intéressant lorsqu’une direction artistique existe déjà sous la forme d’un croquis, d’une photographie ou d’une image de référence.
Google insiste aussi sur la faculté de Veo à produire différents styles visuels et à prendre en compte des demandes cinématographiques. Dans ses exemples, l’entreprise a notamment montré un ours jouant de la guitare, une foule réunie lors d’un concert électro et un voilier affrontant une mer agitée. Ces scènes servent avant tout à illustrer le rendu, le mouvement et la continuité visuelle que Google attribue à son modèle.
Pourquoi la cohérence visuelle est-elle le vrai défi ?
Produire une image fixe convaincante est une chose. Produire plusieurs centaines, voire plusieurs milliers d’images qui racontent une même scène en est une autre. Dans une vidéo, le moindre changement involontaire devient vite apparent : un visage qui se transforme, un objet qui disparaît, des mains déformées, un vêtement dont les motifs changent ou un décor qui se reconstruit d’une image à l’autre.
Google attribue les performances de Veo à une architecture de transformers à diffusion latente. Derrière cette expression, on retrouve deux idées importantes. Les modèles de diffusion génèrent progressivement une image à partir d’une représentation initialement bruitée. Les transformers sont, eux, conçus pour traiter les relations entre de nombreux éléments d’une séquence. Le terme « latent » renvoie à un espace de calcul compressé, plutôt qu’à une manipulation directe de chaque pixel à chaque étape.
Dans le cas de la vidéo, cette architecture vise notamment à préserver les liens entre les images successives. Google affirme que les personnages, les objets et les styles peuvent ainsi rester plus stables pendant une séquence. C’est une promesse déterminante : un clip peut être très impressionnant sur quelques secondes, mais difficilement exploitable si son sujet principal change continuellement d’apparence.
Les démonstrations de Veo mettent également en scène des effets tels que les time-lapses et des mouvements de caméra. Ces éléments sont importants pour se rapprocher des codes du langage audiovisuel. Un mouvement latéral, un travelling, un changement de point de vue ou l’accélération visible du passage du temps ne sont pas de simples ornements : ils influencent la manière dont le spectateur comprend une scène.
Vertex AI change surtout le public visé par Veo
L’intégration à Vertex AI donne à Veo une orientation plus clairement tournée vers les organisations. Le modèle n’est pas présenté comme un éditeur vidéo simplifié destiné à remplacer un logiciel de montage sur un ordinateur personnel. Il devient plutôt une brique d’IA générative susceptible d’être mobilisée dans des processus de création et de développement déjà structurés.
Pour une agence, une marque ou une équipe produit, les cas d’usage les plus immédiats pourraient être la visualisation d’un concept, la préparation d’un storyboard, la variation rapide d’une même idée ou la fabrication de séquences de test. Dans ces situations, l’objectif n’est pas nécessairement de livrer une vidéo finale sans retouche. Il peut s’agir de réduire le temps nécessaire pour passer d’une intention écrite à un aperçu animé.
Cette distinction compte. La vidéo générative peut accélérer la phase d’exploration, mais une production professionnelle implique aussi un scénario, une identité de marque, des droits sur les éléments utilisés, une validation éditoriale et souvent un travail de montage. Veo peut élargir la palette des outils disponibles, sans supprimer ces étapes.
Face à Sora, une compétition encore difficile à mesurer
L’annonce positionne naturellement Veo face aux autres modèles de vidéo générative, notamment Sora d’OpenAI. Google Cloud arrive dans un contexte de concurrence intense entre les grandes entreprises technologiques, au moment même où Amazon présente ses propres avancées en intelligence artificielle générative lors de la conférence AWS Re:Invent.
La comparaison directe reste toutefois délicate. Les modèles ne sont pas toujours ouverts au même public, ne proposent pas les mêmes durées ou définitions et peuvent être évalués avec des consignes différentes. Une vidéo officielle réussie ne dit pas, à elle seule, comment le système se comportera sur des scènes chargées, des personnages multiples, des mouvements rapides ou des demandes précises de la part d’un client.
À la date de cette annonce, Veo demeure inaccessible au grand public. L’absence de tests pratiques étendus empêche donc d’établir un classement fiable entre Veo et ses concurrents. Les qualités mises en avant par Google sont prometteuses, mais les limites concrètes, les erreurs éventuelles et la régularité des résultats doivent encore être observées.
Veo : promesses annoncées et points encore à vérifier
Ce que Google met en avant
- Des vidéos générées jusqu’en 1080p, à 24 ou 30 images par seconde.
- Des séquences pouvant dépasser une minute selon l’annonce.
- La génération depuis du texte et la fonction image-vers-vidéo.
- Une meilleure cohérence des personnages, objets et styles.
- Des effets cinématographiques, dont le time-lapse et les mouvements de caméra.
Ce qui reste à évaluer
- La régularité des résultats sur des demandes complexes ou très détaillées.
- Les éventuels artefacts visuels sur les séquences longues.
- La précision des contrôles offerts aux utilisateurs professionnels.
- Les conditions concrètes d’accès pendant l’aperçu privé.
- Les performances comparées à Sora et aux autres modèles vidéo.
Des usages créatifs, mais des exigences de production intactes
Les capacités annoncées de Veo peuvent intéresser de nombreux métiers de l’image. Un studio peut explorer l’animation d’un concept visuel. Une équipe marketing peut imaginer un aperçu de campagne. Un service de communication peut illustrer une idée qui serait longue ou coûteuse à filmer. Des créateurs peuvent aussi s’en servir pour tester un rythme, une atmosphère ou un angle de mise en scène avant de mobiliser une équipe humaine et du matériel.
Toutefois, le résultat généré ne doit pas être confondu avec une vidéo prête à être diffusée sans contrôle. Plus l’usage est public ou commercial, plus les questions de conformité, de représentation fidèle, de droits et de validation deviennent importantes. Une organisation devra notamment vérifier que le contenu correspond à son message, qu’il ne véhicule pas d’erreur manifeste et qu’il respecte les règles applicables à son activité.
La facilité de création soulève aussi une question de confiance. Une séquence réaliste peut être utilisée de façon créative et légitime, mais elle peut également rendre plus difficile la distinction entre un événement filmé et une scène générée. Dans un contexte professionnel, l’information donnée au public sur l’origine d’une image ou d’une vidéo peut donc devenir un élément essentiel de responsabilité éditoriale.
Ce qu’il faut surveiller avant un déploiement plus large
La première inconnue concerne l’ouverture de Veo. Google ne donne pas, dans cette annonce, de calendrier pour une disponibilité grand public. Les conditions précises d’accès, les modalités d’utilisation et l’étendue des capacités proposées aux clients de Vertex AI compteront autant que les vidéos promotionnelles.
Il faudra également évaluer la fiabilité du modèle sur la durée. Veo promet des séquences de plus d’une minute, un seuil significatif pour la génération vidéo par IA. Or, conserver une identité visuelle cohérente sur un plan long est plus exigeant que produire une courte boucle convaincante. Les essais effectués sur des scènes quotidiennes, des actions complexes et des sujets humains seront particulièrement révélateurs.
Enfin, la place de Veo dépendra de son intégration concrète dans les outils des entreprises. La vidéo générative n’est pas seulement une affaire de prouesse technique : elle doit s’insérer dans des méthodes de travail, répondre à des besoins créatifs réels et permettre un contrôle suffisant des contenus produits. En entrant dans Vertex AI, Veo franchit une étape stratégique. Son adoption dépendra désormais de la distance entre ses promesses et les usages observés sur le terrain.
Questions fréquentes
Veo de Google est-il disponible pour le grand public ?
Non. Au 3 décembre 2024, Veo est proposé en aperçu privé dans Vertex AI, la plateforme d’intelligence artificielle de Google Cloud. L’accès est donc réservé à une sélection de clients et il n’existe pas d’ouverture générale pour le grand public. Cette restriction limite aussi les tests indépendants du modèle.
Que peut générer Veo à partir d’un texte ou d’une image ?
Veo peut créer une vidéo à partir d’une description textuelle, ce que l’on appelle texte-vers-vidéo, ou animer une image de départ avec la fonction image-vers-vidéo. Google annonce des vidéos jusqu’en 1080p, avec une cadence de 24 ou 30 images par seconde et une durée pouvant dépasser une minute.
Comment fonctionne la technologie de Veo ?
Google décrit Veo comme un modèle reposant sur des transformers à diffusion latente. Cette approche doit aider l’IA à générer progressivement les images tout en tenant compte des liens entre les différents éléments d’une vidéo. L’objectif est notamment de conserver des personnages, des objets et des décors plus cohérents d’une image à l’autre.
Veo est-il un concurrent de Sora d’OpenAI ?
Oui, Veo se positionne comme un concurrent direct de Sora dans la génération de vidéos par IA. Google met en avant la résolution 1080p, les vidéos de plus d’une minute, la cohérence visuelle et la création depuis du texte ou des images. Une comparaison définitive reste néanmoins prématurée, car Veo n’est pas ouvert au public.
Quels usages professionnels Veo peut-il avoir ?
Veo peut servir à visualiser rapidement un concept, préparer un storyboard, tester une ambiance, illustrer une campagne ou créer des maquettes vidéo. Son arrivée dans Vertex AI suggère une cible professionnelle. Pour une diffusion commerciale ou publique, les contenus devront toutefois être vérifiés, montés et validés comme toute autre production audiovisuelle.
Sources
Références consultées pour la rédaction de cet article. Les adresses sont indiquées à titre informatif et ne sont pas des liens.
- Google Cloud, plateforme Vertex AIcloud.google.com/vertex-ai
- Google Cloud Blog, annonces sur l’intelligence artificielle et l’apprentissage automatiquecloud.google.com/blog/products/ai-machine-learning
- Google Blog, rubrique intelligence artificielleblog.google/technology/ai



