- Gemini Omni 博客
- 如何使用 Gemini Omni:AI 视频创作分步指南
如何使用 Gemini Omni:AI 视频创作分步指南

Gemini Omni 让 AI 视频创作变成一套更灵活、更易上手的工作流。你可以从一段文字构想或一张参考图开始,选择合适的画幅,生成一段短视频,然后不断打磨,直到它符合你的创作方向。
如果你刚接触这个模型,大概会立刻冒出两个问题:
- 在哪里可以使用 Gemini Omni?
- 怎样才能用它生成一段好视频?
本指南会回答这两个问题。你将学到如何进入 Gemini Omni 生成器、选择生成模式、写出有效的提示词、配置视频参数、评估第一次生成结果,以及如何让后续生成越来越好。
在哪里可以使用 Gemini Omni?
你可以通过 Gemini Omni 使用这个基于浏览器的视频生成器。
生成器的设计目标,是让你从最初的想法直接抵达成品视频,而不需要一套复杂的剪辑流程。根据所选的模型和模式,你可以:
- 从一段文字描述生成视频。
- 让上传的参考图动起来。
- 选择横版或竖版画幅。
- 选择画质与分辨率。
- 生成带同步音频的画面。
- 下载成品视频或重新构图。
- 用新的指令继续优化结果。
如果你想马上开始,打开 Gemini Omni,选一个生成模式,然后按下面的步骤操作。
第 1 步:想清楚你要做什么
在打开生成器之前,先定义这条视频的目的。
问问自己:
- 这是一支产品广告吗?
- 一个电影感的场景?
- 一条竖版社交媒体短片?
- 把一张现成图片动画化?
- 一条角色或虚拟形象视频?
- 一个视觉特效或风格转换?
- 一个将来会成为长片段一部分的短镜头?
创作目标越清晰,后面每一个决定就越容易。
举个例子,下面这个想法就太宽泛了:
Make a cool coffee video.
一份更有用的创作简报应该是:
Create an eight-second vertical advertisement showing a cold brew bottle emerging from ice, designed for Instagram Reels.
第二个版本明确了主体、动作、时长、画幅方向和发布平台。
尽量让每条短视频只围绕一个核心视觉创意。如果你的构想包含多个场景或复杂的故事情节,就把它拆成若干个独立镜头。
第 2 步:选择文生视频还是图生视频
对新手来说,最实用的两个起步模式是「文生视频」和「图生视频」。
文生视频(Text-to-Video)
当你想从一段文字描述创造一个全新场景时,选择文生视频。
这个模式适合:
- 原创的电影感场景
- 产品概念片
- 抽象视觉
- 定场镜头
- 广告创意
- 教学动画
- 社交媒体开场钩子
因为没有起始图像,你的提示词必须清楚地描述画面上应该出现什么。
通常你需要指明主体、动作、环境、镜头运动、光影和视觉风格。
图生视频(Image-to-Video)
当你已经有了视觉参考素材时,选择图生视频,比如:
- 一张产品照片
- 一份角色设定
- 一张插画
- 一格分镜
- 一张时尚大片
- 一个 Logo 动效概念
- 一张建筑效果图
当你希望生成的视频保留既有的产品、角色、构图或视觉识别时,图生视频尤其有用。
请使用画面干净、分辨率高、主体明确的参考图。一张清晰的产品照片,通常比一张塞满不相关元素的拼贴图能提供更好的视觉引导。
只上传你拥有版权或已获授权使用的图片。
第 3 步:写一条结构化的 Gemini Omni 提示词
一条可靠的 Gemini Omni 提示词,可以按以下结构搭建:
主体 + 动作 + 环境 + 镜头 + 光影 + 风格
必要时你还可以加入音频指令和限制条件。
下面是一个完整的文生视频示例:
A small transparent luxury perfume bottle rests on wet black stone at blue hour. Begin with an extreme macro shot of condensation on the glass, then slowly pull the camera backward to reveal the entire bottle as a thin layer of mist moves gently across the surface. Cool cyan rim lighting, realistic reflections, shallow depth of field, premium cinematic product-commercial style. Add subtle water droplets, quiet atmospheric ambience, and a soft glass chime near the final reveal. Keep the product centered and clearly visible. No hands, no people, no captions, no logos, no additional products, and no camera shake.
由上面这条提示词生成的 Gemini Omni 文生视频成品。
这条提示词给了模型几个明确的制作决策:
- 主体: 一只透明香水瓶
- 动作: 雾气与水在产品周围流动
- 环境: 蓝调时刻的湿润黑色岩石
- 镜头: 微距开场,随后缓慢后拉
- 光影: 冷调青色轮廓光
- 风格: 奢侈品广告
- 限制: 不要文字、手部或多余产品
不要在一条短提示词里堆叠多个互相冲突的创意。一条 8 秒视频,通常在只包含一个明确动作和一次可控镜头运动时效果最好。
第 4 步:选对画幅比例
根据成品视频最终发布的位置来选择画幅比例。
选择横版,适用于:
- YouTube 视频
- 网站首屏
- 演示文稿
- 桌面端广告
- 电影感场景
- 产品展示
选择竖版,适用于:
- TikTok
- Instagram Reels
- YouTube Shorts
- 移动端广告
- 竖屏叙事
- 社交媒体产品视频
一开始就按正确的画幅方向构图,通常比先用一种画幅生成、之后再裁剪的效果更好。
制作竖版视频时,记得在提示词里注明竖屏构图。重要主体应保持在画面中央附近,这样界面元素、字幕和平台控件才不会遮挡它们。
第 5 步:选择分辨率与画质
测试创意时用较低的分辨率。等构图、运动和提示词都调通之后,再选更高的分辨率。
一套实用的流程是:
- 先用 720p 生成初稿。
- 评估主体、动作和镜头运动。
- 修正提示词。
- 测试修改后的版本。
- 确认无误后再用 1080p 或 4K 生成最终版。
这套流程能帮你避免在一个还需要大改的构想上,浪费额外的时间或额度。
更高的分辨率救不了糟糕的构图或含糊的提示词。先解决创作层面的问题,再提升输出画质。
第 6 步:为短视频规划动作节奏
AI 生成的短视频,在只聚焦一个视觉节拍时效果最好。
对一条 8 秒视频,可以试试这个时间结构:
- 0–2 秒: 建立主体。
- 2–6 秒: 展现主要动作或转变。
- 6–8 秒: 揭示最终构图。
举例来说,一条产品视频可以从特写开场,中段引入运动或光影变化,最后以一个干净的主视觉镜头收尾。
不要要求模型在一次短生成里,讲完一个横跨多个场景、包含若干重大事件的完整故事。
想做一条 30 秒的视频,就生成多个相互衔接的镜头,之后再拼接起来。在每条提示词里,重复使用相同的角色、产品、环境、光影和配色描述。
第 7 步:生成并评估第一次结果
点击 Generate Video,并把第一次输出当作草稿。
用五个问题来评估结果:
- 主体是否可辨认?
- 要求的动作是否清晰发生了?
- 镜头运动是否合适?
- 风格与光影是否统一?
- 音频是否服务于画面?
在重新生成之前,先找出最薄弱的那一环。
如果产品看起来没问题,只是雾气太浓,不要重写整条提示词,只改雾气那一句。
例如:
Keep the bottle, lighting, environment, and camera path unchanged. Reduce the amount of mist, make the product label sharper, and slow the final camera movement.
具体的修改指令,远比「做得更好一点」或者「再试一次」这类说法有用。
第 8 步:高效使用参考图
做图生视频时,要说明哪些细节必须保持稳定、哪些元素可以运动。
下面这张产品图,就是本示例的视觉参考:

可以使用这样一条提示词:
Use the uploaded image only as a visual identity reference for the perfume bottle. Do not use the uploaded composition as the opening frame. Create a completely new 16:9 luxury commercial scene. Begin in a nearly dark studio with a narrow cyan beam moving across a wet black stone surface. As the light expands, reveal the referenced perfume bottle already standing upright at the center of the scene. Keep the bottle stable while the environment provides the motion. Use a slow, controlled dolly-in toward the product with no orbit and no sudden camera movement. Fine water droplets slide across the stone, soft mist moves behind the bottle, and realistic reflections gradually appear beneath it. At the fourth second, introduce a warm golden backlight behind the bottle, creating an elegant halo through the transparent glass. Finish with a clean, centered hero shot of the product, fully illuminated and sharply focused. Preserve the bottle's original shape, proportions, glass material, liquid color, silver cap, and front emblem. Do not deform or rotate the bottle. Do not add readable text, extra products, hands, people, flowers, or decorative objects. Premium fragrance advertisement, photorealistic materials, controlled studio lighting, realistic glass refraction, shallow depth of field, elegant and minimal composition. Add quiet atmospheric ambience, subtle water sounds, and one soft glass chime during the final product reveal.
由上面的参考图和提示词生成的 Gemini Omni 图生视频成品。
这条提示词把图片当作产品识别参考,同时允许 Gemini Omni 构建一个全新场景。它还把固定不变的产品细节,与可以变化的光影、雾气、水流和镜头运动区分开来。
如果参考的是角色,要指明最重要的视觉特征:
- 发型
- 服装
- 面部结构
- 年龄
- 配饰
- 配色
- 画风
不要完全依赖「保持人物一致」这类笼统指令。把需要保持不变的细节逐一点名。
第 9 步:制作一条竖版社交媒体视频
竖版视频需要一个立刻抓人的视觉钩子。观众往往在第一秒内就决定要不要继续看下去。
下面是一条为短视频社交平台设计的提示词:
Create an eight-second vertical cinematic video of a miniature city emerging from inside a transparent glass coffee cup. Begin with an extreme close-up of the dark coffee surface. Within the first second, tiny illuminated buildings rise smoothly from the liquid while warm windows switch on one by one. The camera tilts upward and slowly pulls back to reveal the complete miniature city inside the cup. Realistic liquid physics, warm café lighting, highly detailed miniature architecture, shallow depth of field, magical realism, and a strong visual hook in the opening second. Add subtle city ambience, gentle ceramic sounds, and a soft rising musical tone. Keep the main city centered for a 9:16 composition. No captions, no logos, no people, and no distorted buildings.
一条为短视频社交平台设计的 Gemini Omni 竖版视频。
主要的转变从一开场就发生,这让成品更适合 Shorts、Reels 和 TikTok。
对于重要的营销文案,请在视频生成之后再加字幕。这样你能更好地控制拼写、时间点、字体、位置和可读性。
第 10 步:制作更长的多镜头视频
更长的视频,应该被规划成一串相互衔接的镜头。
举例来说,一条 24 秒的产品视频,可以由三段 8 秒的片段组成:
镜头 1:引入
A sealed silver box rests in a dark studio. A narrow beam of light moves across the surface. Slow cinematic dolly-in, black background, controlled reflections, premium technology advertisement style.
镜头 2:产品揭示
Continue the same dark studio, silver materials, and lighting style. The box opens slowly and reveals a pair of wireless headphones floating above a soft blue light. Smooth upward camera movement, realistic reflections, no text.
镜头 3:最终主视觉
Preserve the same headphones, studio environment, blue accent lighting, and premium commercial style. Rotate the headphones slowly toward the camera and finish with a centered hero composition. Subtle electronic ambience, no text or additional objects.
重复那些关键的视觉细节,能让这几个镜头看起来像是属于同一个序列。
Gemini Omni 常见错误
写出含糊的提示词
「Make an amazing cinematic video」并没有定义主体、动作或镜头运动。
请描述镜头应该拍到什么。
塞进太多场景切换
一个短片段里不该出现五个场景、三个角色和若干次重大转变。把复杂的构想拆成独立镜头。
忽略镜头语言
镜头调度对最终结果影响巨大。
有用的镜头指令包括:
- 缓慢推轨(slow dolly-in)
- 手持跟拍(handheld tracking shot)
- 固定三脚架镜头(locked-off tripod shot)
- 微距环绕(macro orbit)
- 俯拍(overhead shot)
- 低角度揭示(low-angle reveal)
- 平滑的摇臂运动(smooth crane movement)
- 过肩镜头(over-the-shoulder shot)
不诊断问题就重新生成
在再次生成之前,先判断问题出在主体、动作、构图、镜头、光影、风格还是音频。
改动相关的那条指令,而不是推倒重来。
依赖生成出来的重要文字
AI 生成的文字可能前后不一致。凡是对准确性有要求的产品名、价格、字幕和行动号召,都应该在后期剪辑时添加。
上传未经授权的内容
只上传你有权使用的图片、视频、Logo、人脸或产品照片。在发布或商用之前,请先审核生成的素材。
常见问题
Gemini Omni 是免费的吗?
可用额度、模型和输出选项会有所不同。在开始正式项目之前,请查看当前的 Gemini Omni 价格方案。
Gemini Omni 能让图片动起来吗?
可以。选择图生视频,上传一张参考图,描述你想要的运动,并指明哪些细节必须保持不变。
Gemini Omni 能生成竖版视频吗?
可以。为 TikTok、Instagram Reels、YouTube Shorts 等移动优先平台制作视频时,选择竖版即可。
能做超过 8 秒的视频吗?
你可以通过生成多个相互衔接的片段来构建更长的序列。在主体、环境、光影、镜头风格和配色上重复使用一致的描述。
Gemini Omni 会生成音频吗?
是否有音频取决于所选的模型和生成模式。当音频可用时,请把环境音、对白、音乐和音效与画面指令分开描述。
Gemini Omni 最佳的提示词结构是什么?
一个可靠的结构是:
主体 + 动作 + 环境 + 镜头 + 光影 + 风格
在相关时,再加上音频指令、时间节奏、画幅比例和限制条件。
怎样保持角色一致?
使用一张清晰的参考图,并在每条提示词里重复该角色的标志性细节。保持发型、服装、面部特征、配饰、光影和画风一致。
为什么 Gemini Omni 忽略了我提示词的一部分?
可能是提示词里指令太多,或者动作之间互相冲突。先围绕一个主体和一个视觉事件把它简化,然后再逐步添加细节。
开始用 Gemini Omni 创作
学会 Gemini Omni 最快的方式,就是从一个简单的场景开始,通过可控的修改不断改进它。
从这些开始:
- 一个主体
- 一个动作
- 一个环境
- 一次镜头运动
- 一种视觉风格
生成一版草稿,找出最薄弱的一环,然后只修改那一部分。
准备好之后,打开 Gemini Omni,粘贴本指南中任意一条示例提示词,创作你的第一条视频。
你也可以浏览 Gemini Omni 视频演示,获取更多创意和视觉灵感。
