- Gemini Omni Blog
- Comment utiliser Gemini Omni : guide pas à pas de la création vidéo par IA
Comment utiliser Gemini Omni : guide pas à pas de la création vidéo par IA

Gemini Omni transforme la création vidéo par IA en un flux de travail plus souple et plus accessible. Vous partez d'une idée écrite ou d'une image de référence, choisissez le format adapté, générez une vidéo courte, puis affinez le résultat jusqu'à ce qu'il corresponde à votre direction créative.
Si vous découvrez le modèle, deux questions vous viennent probablement tout de suite :
- Où pouvez-vous utiliser Gemini Omni ?
- Comment générer une bonne vidéo avec ?
Ce guide répond aux deux. Vous apprendrez à accéder au générateur Gemini Omni, choisir un mode de génération, écrire un prompt efficace, configurer votre vidéo, évaluer le premier résultat et améliorer les générations suivantes.
Où pouvez-vous utiliser Gemini Omni ?
Le générateur vidéo en ligne est accessible via Gemini Omni.
Le générateur est conçu pour vous mener de l'idée initiale à la vidéo générée sans imposer un flux de montage compliqué. Selon le modèle et le mode sélectionnés, vous pouvez :
- Générer une vidéo à partir d'une description textuelle.
- Animer une image de référence téléversée.
- Choisir un format paysage ou portrait.
- Sélectionner une qualité et une résolution.
- Générer des visuels avec un audio synchronisé.
- Télécharger ou recadrer la vidéo finie.
- Continuer à affiner le résultat avec de nouvelles instructions.
Pour commencer immédiatement, ouvrez Gemini Omni, sélectionnez un mode de génération et suivez les étapes ci-dessous.
Étape 1 : décidez ce que vous voulez créer
Avant d'ouvrir le générateur, définissez l'objectif de votre vidéo.
Posez-vous ces questions :
- S'agit-il d'une publicité produit ?
- D'une scène cinématographique ?
- D'un clip vertical pour les réseaux sociaux ?
- D'une version animée d'une image existante ?
- D'une vidéo de personnage ou d'avatar ?
- D'un effet visuel ou d'une transformation de style ?
- D'un plan court qui s'intégrera à une séquence plus longue ?
Un objectif créatif clair facilite toutes les décisions suivantes.
Par exemple, l'idée suivante est trop vague :
Make a cool coffee video.
Un brief créatif plus utile serait :
Create an eight-second vertical advertisement showing a cold brew bottle emerging from ice, designed for Instagram Reels.
La seconde version établit le sujet, l'action, la durée, l'orientation et la plateforme de publication.
Essayez de construire chaque vidéo courte autour d'une seule idée visuelle principale. Si votre concept comporte plusieurs lieux ou des événements narratifs complexes, découpez-le en plans distincts.
Étape 2 : choisir Text-to-Video ou Image-to-Video
Les deux modes de départ les plus utiles pour les débutants sont Text-to-Video et Image-to-Video.
Text-to-Video
Choisissez Text-to-Video lorsque vous voulez créer une nouvelle scène à partir d'une description écrite.
Ce mode convient bien pour :
- Des scènes cinématographiques originales
- Des concepts produit
- Des visuels abstraits
- Des plans d'ensemble
- Des idées publicitaires
- Des animations pédagogiques
- Des accroches pour les réseaux sociaux
Comme il n'y a pas d'image de départ, votre prompt doit décrire clairement ce qui doit apparaître à l'écran.
Vous devez normalement préciser le sujet, l'action, l'environnement, le mouvement de caméra, l'éclairage et le style visuel.
Image-to-Video
Choisissez Image-to-Video lorsque vous disposez déjà d'une référence visuelle, par exemple :
- Une photographie de produit
- Un design de personnage
- Une illustration
- Une case de storyboard
- Une image de mode
- Un concept d'animation de logo
- Un rendu architectural
Image-to-Video est particulièrement utile lorsque vous voulez que la vidéo générée préserve un produit, un personnage, une composition ou une identité visuelle existants.
Utilisez une image de référence nette, en haute résolution, avec un sujet évident. Une photographie de produit claire fournit généralement de meilleurs repères visuels qu'un collage chargé de plusieurs éléments sans rapport.
Ne téléversez que des images dont vous êtes propriétaire ou pour lesquelles vous avez une autorisation.
Étape 3 : écrire un prompt Gemini Omni structuré
Un prompt Gemini Omni fiable peut se construire selon la structure suivante :
Sujet + Action + Environnement + Caméra + Éclairage + Style
Vous pouvez aussi inclure des indications audio et des interdictions si nécessaire.
Voici un exemple complet en text-to-video :
A small transparent luxury perfume bottle rests on wet black stone at blue hour. Begin with an extreme macro shot of condensation on the glass, then slowly pull the camera backward to reveal the entire bottle as a thin layer of mist moves gently across the surface. Cool cyan rim lighting, realistic reflections, shallow depth of field, premium cinematic product-commercial style. Add subtle water droplets, quiet atmospheric ambience, and a soft glass chime near the final reveal. Keep the product centered and clearly visible. No hands, no people, no captions, no logos, no additional products, and no camera shake.
Un résultat text-to-video Gemini Omni généré à partir du prompt ci-dessus.
Ce prompt donne au modèle plusieurs décisions de production claires :
- Sujet : un flacon de parfum transparent
- Action : de la brume et de l'eau en mouvement autour du produit
- Environnement : une pierre noire humide à l'heure bleue
- Caméra : un plan macro suivi d'un lent recul
- Éclairage : une lumière de contour cyan froide
- Style : publicité de luxe
- Interdictions : pas de texte, pas de mains, pas de produits supplémentaires
Évitez de combiner plusieurs idées incompatibles dans un prompt court. Une vidéo de huit secondes fonctionne généralement mieux lorsqu'elle contient une action claire et un mouvement de caméra maîtrisé.
Étape 4 : choisir le bon format d'image
Choisissez le format en fonction de l'endroit où la vidéo finale sera publiée.
Choisissez Paysage pour :
- Les vidéos YouTube
- Les sections héros de sites web
- Les présentations
- Les publicités pour ordinateur
- Les scènes cinématographiques
- Les vitrines produit
Choisissez Portrait pour :
- TikTok
- Instagram Reels
- YouTube Shorts
- Les publicités mobiles
- La narration verticale
- Les vidéos produit pour les réseaux sociaux
Composer dès le départ dans la bonne orientation donne généralement un meilleur résultat que générer dans un format puis recadrer.
Lorsque vous créez une vidéo verticale, mentionnez la composition verticale dans le prompt. Les sujets importants doivent rester près du centre afin que les interfaces, les sous-titres et les commandes des plateformes ne les masquent pas.
Étape 5 : sélectionner une résolution et une qualité
Utilisez une résolution basse pendant que vous testez une idée. Passez à une résolution supérieure une fois que la composition, le mouvement et le prompt fonctionnent.
Un flux de travail pratique :
- Générer un premier brouillon en 720p.
- Évaluer le sujet, l'action et le mouvement de caméra.
- Corriger le prompt.
- Tester la version révisée.
- Générer la version validée en 1080p ou 4K.
Ce flux vous évite de dépenser du temps ou des crédits supplémentaires sur un concept qui nécessite encore des changements majeurs.
Une résolution plus élevée ne corrige pas une composition faible ni un prompt flou. Réglez d'abord les problèmes créatifs, puis augmentez la qualité de sortie.
Étape 6 : planifier l'action d'une vidéo courte
Les vidéos courtes générées par IA fonctionnent mieux lorsqu'elles se concentrent sur un seul temps visuel.
Pour une vidéo de huit secondes, essayez cette structure temporelle :
- 0–2 secondes : établir le sujet.
- 2–6 secondes : montrer l'action ou la transformation principale.
- 6–8 secondes : révéler la composition finale.
Par exemple, une vidéo produit peut commencer par un gros plan, introduire du mouvement ou de la lumière au milieu, et se terminer par un plan héros épuré.
Ne demandez pas au modèle de raconter toute une histoire avec plusieurs lieux et plusieurs événements majeurs en une seule génération courte.
Pour créer une vidéo de 30 secondes, générez plusieurs plans reliés puis assemblez-les ensuite. Réutilisez les mêmes descriptions du personnage, du produit, de l'environnement, de l'éclairage et de la palette de couleurs dans chaque prompt.
Étape 7 : générer et évaluer le premier résultat
Cliquez sur Generate Video et traitez la première sortie comme un brouillon.
Évaluez le résultat à l'aide de cinq questions :
- Le sujet principal est-il reconnaissable ?
- L'action demandée se produit-elle clairement ?
- Le mouvement de caméra est-il approprié ?
- Le style et l'éclairage sont-ils cohérents ?
- L'audio soutient-il la scène ?
Identifiez l'élément le plus faible avant de générer à nouveau.
Si le produit est correct mais que la brume est trop dense, ne réécrivez pas le prompt entier. Modifiez uniquement l'instruction sur la brume.
Par exemple :
Keep the bottle, lighting, environment, and camera path unchanged. Reduce the amount of mist, make the product label sharper, and slow the final camera movement.
Des révisions précises sont plus utiles que des instructions du type « fais mieux » ou « réessaie ».
Étape 8 : utiliser efficacement les images de référence
Lors d'une génération Image-to-Video, expliquez quels détails doivent rester stables et quels éléments peuvent bouger.
L'image produit suivante sert de référence visuelle pour cet exemple :

Utilisez un prompt comme celui-ci :
Use the uploaded image only as a visual identity reference for the perfume bottle. Do not use the uploaded composition as the opening frame. Create a completely new 16:9 luxury commercial scene. Begin in a nearly dark studio with a narrow cyan beam moving across a wet black stone surface. As the light expands, reveal the referenced perfume bottle already standing upright at the center of the scene. Keep the bottle stable while the environment provides the motion. Use a slow, controlled dolly-in toward the product with no orbit and no sudden camera movement. Fine water droplets slide across the stone, soft mist moves behind the bottle, and realistic reflections gradually appear beneath it. At the fourth second, introduce a warm golden backlight behind the bottle, creating an elegant halo through the transparent glass. Finish with a clean, centered hero shot of the product, fully illuminated and sharply focused. Preserve the bottle's original shape, proportions, glass material, liquid color, silver cap, and front emblem. Do not deform or rotate the bottle. Do not add readable text, extra products, hands, people, flowers, or decorative objects. Premium fragrance advertisement, photorealistic materials, controlled studio lighting, realistic glass refraction, shallow depth of field, elegant and minimal composition. Add quiet atmospheric ambience, subtle water sounds, and one soft glass chime during the final product reveal.
Un résultat image-to-video Gemini Omni généré à partir de l'image de référence et du prompt ci-dessus.
Le prompt se sert de l'image comme référence d'identité produit tout en laissant Gemini Omni construire une scène inédite. Il sépare aussi les détails figés du produit de l'éclairage, de la brume, de l'eau et des mouvements de caméra qui peuvent changer.
Pour une référence de personnage, identifiez les caractéristiques visuelles les plus importantes :
- La coiffure
- Les vêtements
- La structure du visage
- L'âge
- Les accessoires
- La palette de couleurs
- Le style graphique
Ne vous fiez pas entièrement à une instruction générale du type « garde le personnage cohérent ». Nommez les détails qui doivent rester inchangés.
Étape 9 : créer une vidéo verticale pour les réseaux sociaux
Les vidéos verticales ont besoin d'une accroche visuelle immédiate. Les spectateurs décident souvent dès la première seconde s'ils continuent à regarder.
Voici un prompt conçu pour une vidéo sociale au format court :
Create an eight-second vertical cinematic video of a miniature city emerging from inside a transparent glass coffee cup. Begin with an extreme close-up of the dark coffee surface. Within the first second, tiny illuminated buildings rise smoothly from the liquid while warm windows switch on one by one. The camera tilts upward and slowly pulls back to reveal the complete miniature city inside the cup. Realistic liquid physics, warm café lighting, highly detailed miniature architecture, shallow depth of field, magical realism, and a strong visual hook in the opening second. Add subtle city ambience, gentle ceramic sounds, and a soft rising musical tone. Keep the main city centered for a 9:16 composition. No captions, no logos, no people, and no distorted buildings.
Une vidéo Gemini Omni au format portrait, conçue pour les plateformes de contenus courts.
La transformation principale démarre immédiatement, ce qui rend le résultat plus adapté aux Shorts, aux Reels et à TikTok.
Pour les textes marketing importants, ajoutez les sous-titres après la génération. Vous garderez ainsi le contrôle sur l'orthographe, le rythme, la police, le placement et la lisibilité.
Étape 10 : construire une vidéo plus longue en plusieurs plans
Une vidéo plus longue doit être pensée comme une suite de plans reliés entre eux.
Par exemple, une vidéo produit de 24 secondes peut contenir trois clips de huit secondes :
Plan 1 : introduction
A sealed silver box rests in a dark studio. A narrow beam of light moves across the surface. Slow cinematic dolly-in, black background, controlled reflections, premium technology advertisement style.
Plan 2 : révélation du produit
Continue the same dark studio, silver materials, and lighting style. The box opens slowly and reveals a pair of wireless headphones floating above a soft blue light. Smooth upward camera movement, realistic reflections, no text.
Plan 3 : plan héros final
Preserve the same headphones, studio environment, blue accent lighting, and premium commercial style. Rotate the headphones slowly toward the camera and finish with a centered hero composition. Subtle electronic ambience, no text or additional objects.
Répéter les détails visuels importants aide les plans à donner l'impression d'appartenir à la même séquence.
Erreurs courantes avec Gemini Omni
Écrire un prompt vague
« Make an amazing cinematic video » ne définit ni le sujet, ni l'action, ni le mouvement de caméra.
Décrivez ce que la caméra doit enregistrer.
Multiplier les changements de scène
Un clip court ne devrait pas contenir cinq lieux, trois personnages et plusieurs transformations majeures. Découpez les idées complexes en plans distincts.
Ignorer la caméra
La direction de la caméra a un effet majeur sur le résultat final.
Instructions de caméra utiles :
- Travelling avant lent (slow dolly-in)
- Plan de suivi à l'épaule (handheld tracking shot)
- Plan fixe sur trépied (locked-off tripod shot)
- Orbite macro (macro orbit)
- Plan en plongée (overhead shot)
- Révélation en contre-plongée (low-angle reveal)
- Mouvement de grue fluide (smooth crane movement)
- Plan par-dessus l'épaule (over-the-shoulder shot)
Regénérer sans diagnostiquer le problème
Avant de générer à nouveau, déterminez si le problème vient du sujet, de l'action, de la composition, de la caméra, de l'éclairage, du style ou de l'audio.
Modifiez l'instruction concernée au lieu de tout remplacer.
Utiliser du texte généré pour des éléments importants
Le texte généré par IA peut être incohérent. Ajoutez les noms de produits, les prix, les sous-titres et les appels à l'action au montage dès que la précision compte.
Téléverser du contenu sans autorisation
Ne téléversez que des images, vidéos, logos, visages ou photos de produits que vous êtes autorisé à utiliser. Vérifiez les images générées avant de les publier ou de les exploiter commercialement.
Questions fréquentes
Gemini Omni est-il gratuit ?
Les crédits disponibles, les modèles et les options de sortie peuvent varier. Consultez les options tarifaires actuelles de Gemini Omni avant de démarrer un projet en production.
Gemini Omni peut-il animer une image ?
Oui. Sélectionnez Image-to-Video, téléversez une image de référence, décrivez le mouvement souhaité et indiquez les détails qui doivent rester inchangés.
Gemini Omni peut-il générer des vidéos verticales ?
Oui. Choisissez Portrait pour créer des vidéos destinées à TikTok, Instagram Reels, YouTube Shorts et aux autres plateformes pensées pour le mobile.
Puis-je faire une vidéo de plus de huit secondes ?
Vous pouvez créer une séquence plus longue en générant plusieurs clips reliés. Réutilisez des descriptions cohérentes pour le sujet, l'environnement, l'éclairage, le style de caméra et la palette de couleurs.
Gemini Omni génère-t-il de l'audio ?
La disponibilité de l'audio dépend du modèle et du mode de génération sélectionnés. Lorsque l'audio est disponible, décrivez l'ambiance, les dialogues, la musique et les effets sonores séparément des instructions visuelles.
Quelle est la meilleure structure de prompt pour Gemini Omni ?
Une structure fiable est :
Sujet + Action + Environnement + Caméra + Éclairage + Style
Ajoutez les indications audio, le rythme, le format d'image et les interdictions lorsqu'ils sont pertinents.
Comment garder un personnage cohérent ?
Utilisez une image de référence nette et répétez les détails caractéristiques du personnage dans chaque prompt. Gardez la coiffure, les vêtements, les traits du visage, les accessoires, l'éclairage et le style graphique cohérents.
Pourquoi Gemini Omni a-t-il ignoré une partie de mon prompt ?
Le prompt contient peut-être trop d'instructions ou des actions contradictoires. Simplifiez-le autour d'un sujet principal et d'un seul événement visuel, puis ajoutez les détails progressivement.
Commencez à créer avec Gemini Omni
La façon la plus rapide d'apprendre Gemini Omni est de commencer par une scène simple et de l'améliorer par des révisions maîtrisées.
Commencez avec :
- Un sujet
- Une action
- Un environnement
- Un mouvement de caméra
- Un style visuel
Générez un brouillon, identifiez l'élément le plus faible, et ne révisez que cette partie.
Quand vous êtes prêt, ouvrez Gemini Omni, collez l'un des prompts d'exemple de ce guide et créez votre première vidéo.
Vous pouvez aussi explorer les démos vidéo Gemini Omni pour trouver d'autres idées et de l'inspiration visuelle.
