- Gemini Omni 博客
- Gemini Omni 1.1 对比 Omni Flash:五大关键升级
Gemini Omni 1.1 对比 Omni Flash:五大关键升级

Gemini Omni 1.1 与初代 Gemini Omni Flash 到底有多大差别?简短的回答是:1.1 保留了同样的多模态底座,但新增了五项面向实际制作的升级——更长的场景、可预先规划的转场、由参考驱动的运动、快速原型验证,以及高分辨率交付。
Gemini Omni 1.1 于 2026 年 8 月 27 日发布,在保留初代模型多模态特质的同时,补上了一组目标明确的创作控制能力。用户依然可以把文本、图片、音频和视频组合起来作为输入,生成带声音的视频,并通过自然语言对话修改片段。区别在于,1.1 让创作者对镜头从哪里开始、在哪里结束、持续多久,以及能以多高的效率打磨,拥有了更大的话语权。
在这篇对比中,我们会逐一分析这五项升级,说明哪些部分保持不变,并帮助创作者判断 Gemini Omni 1.1 适合放在真实制作流程的哪个位置。
什么是 Gemini Omni 1.1 Flash?
Gemini Omni 1.1 Flash 是 Google 更新后的多模态视频生成与编辑模型。它接受文本、图片、音频和视频输入,并输出带音频的高分辨率视频。由于模型原生具备多模态能力,创作者不必仅靠文字描述创意,而是可以提供视觉参考、一段已有素材、一条配乐,或者以上组合,再通过对话引导结果。
Google 把 Omni 描述为 Gemini 的推理能力与生成式媒体的交汇点。这一点很关键,因为视频创作需要的远不止好看的画面。一个真正好用的模型必须理解指令、在时间维度上保持主体一致、解读运动、遵循物理关系,并在用户提出具体修改时给出可预期的响应。
Gemini Omni 1.1 在这一基础上,加入了为实际制作设计的功能:最长 40 秒的场景延长、首尾帧控制、最长三秒的视频参考、经济的 360p 草稿模式,以及放大到 1080p 或 4K 的能力。
关于命名的说明: Google 最初发布的模型名为 Gemini Omni Flash,并没有正式称之为「Gemini Omni 1.0」。在本文中,「1.0」指的是 2026 年 5 月的初代版本,「1.1」指的是 2026 年 8 月的官方更新。
Gemini Omni 1.1 与初代 Omni Flash 速览对比
| 能力 | 初代 Gemini Omni Flash(「1.0」) | Gemini Omni 1.1 Flash |
|---|---|---|
| 多模态输入 | 文本、图片、音频和视频 | 文本、图片、音频和视频 |
| 对话式编辑 | 支持 | 支持,并扩展了制作层面的控制 |
| 原生视频音频 | 支持 | 支持 |
| 场景时长流程 | 以短小、自成一体的片段为主 | 以 10 秒为单位延长,累计最长 40 秒 |
| 延长时使用的上下文 | 早期模型主要依赖最后一秒 | 可分析此前最多 10 秒的画面 |
| 首尾帧控制 | 没有专门的控制项 | 支持,可用于规划转场和连续镜头 |
| 视频参考输入 | 通用的视频输入与编辑 | 创建场景时可参考最长三秒的视频 |
| 草稿流程 | 标准渲染 | 更快、成本更低的 360p 预览 |
| 最终分辨率选项 | 高分辨率输出 | 可放大到 1080p 和 4K 用于交付 |
| 面向开发者的定位 | 首轮推出与探索性尝试 | 通过开发者工具提供、可用于生产的更新 |
真正重要的变化,并不是 1.1 取代了初代的创作理念,而是它减少了「第一版生成得不错」与「最终成片可用」之间的多处摩擦。
1. 更长的场景,更好的连贯性
最受关注的升级是场景延长。Gemini Omni 1.1 可以按 10 秒的增量继续已有场景,累计长度最多 40 秒。这对于对话、产品演示、视觉叙事、音乐段落,以及无法塞进单个短片段的电影化揭示镜头,都特别有用。
更有分量的其实是连贯性。据 Google 介绍,Omni 1.1 在生成下一段时可以分析此前最多 10 秒的素材,而早期模型只参考最后一秒。更大的上下文窗口,让模型掌握了更多关于角色、运动、镜头方向、光线、环境和叙事动作的信息,从而知道该如何续接。
对创作者来说,这意味着两段延长之间的突兀跳变更少。角色更有可能延续同一个动作,镜头运动可以更自然地展开,对话也能保持原有的视觉节奏。当然,为每次延长写清楚提示词仍是好习惯,只是模型现在有了更扎实的依据来维持场景一致。
2. 首尾帧控制
文本提示词很强大,但并不总能精确定义视觉上的起点和终点。Gemini Omni 1.1 通过允许用户同时指定生成镜头的起始帧和结束帧,解决了这个问题。
模型随后会在这两张图之间生成连续的视频。这项控制在以下场景中很有价值:
- 流畅的产品揭示
- 环绕人物或物体的镜头运动
- 前后对比式的转变
- 不同场景之间的匹配转场
- 必须落在精确构图上的推镜
- 适合社交媒体的无缝或近似无缝循环
在初代版本中,创作者可以描述一次转场,但对最终构图的把握没那么确定。到了 1.1,终点可以预先用视觉方式定义,提示词便能专注于两帧之间的路径——比如镜头运动、节奏、动作和氛围。
3. 视频参考带来更精确的调度
Gemini Omni 一直强调「用各种输入创作视频」这一理念。1.1 让参考驱动的创作更加实用:创作者可以用最长三秒的视频,作为新场景的上下文。
一段简短的参考能传达文字难以描述的信息:一个舞蹈动作的时机、手持镜头的能量感、布料的运动、动作的节奏,或者某个角色的行为方式。与图片和文字提示词结合后,视频参考能为模型在运动和视觉连贯性上给出更清晰的目标。
这一点对品牌内容尤其有帮助。创作者可以提供一张产品图定义外观、一段短片定义镜头运动,再用提示词描述新的场景。结果是一份更丰富的创意简报,而不需要冗长的技术描述。
4. 从草稿到成片更快的工作流
AI 视频创作是迭代式的。即便提示词写得不错,也可能需要好几个版本,构图、节奏、运动和调性才会到位。把每次尝试都按完整分辨率渲染,既浪费时间也浪费生成额度。
Gemini Omni 1.1 引入了 360p 草稿预览,让迭代更高效。创作者可以在低分辨率下验证场景结构、调整提示词,反复几次直到创意成立。一旦时机与构图通过,被选中的版本就可以进入更高分辨率的最终渲染。
这形成了一条更接近专业预演(previsualization)的流程:
- 用 360p 起草概念。
- 检查取景、动作、镜头运动和节奏。
- 只打磨需要改进的部分。
- 以 1080p 出终版,或放大到 4K。
这项升级提升的不只是画质,更让「多试几次」在成本上变得可行。
5. 4K 放大,交付即可用于生产
Gemini Omni 1.1 支持把完成的视频放大到 1080p 和 4K。更清晰的成片文件,在大屏播放、演示汇报、广告投放、后期裁切,以及需要把 AI 生成素材与实拍素材混剪的项目中都很有用。
需要理解的是,4K 是一个放大后的交付选项,并不意味着每一处细节都是原生以 4K 生成的。源生成的质量依然重要。创作者应当在草稿阶段就检查人脸、手部、文字、产品细节和快速运动,再决定是否进入最终放大。
哪些地方没有变?
Gemini Omni 1.1 保留了初代模型的核心优势。它依然是一个对话式的多模态系统,而不是传统的时间线剪辑器。你可以从一个简单想法出发,补充参考、生成片段,再用自然语言提出有针对性的修改。模型也依旧会生成同步的音画,并在理解场景时调用 Gemini 的世界知识。
这次更新同样没有消除生成式视频的所有局限。Google 的模型卡指出,跨多次编辑的完全一致性、高度复杂的运动,以及完全准确的文字,仍然具有挑战性。对于商业项目,每一条输出都应仔细审核,尤其当品牌资产、可读的字体排印、连贯性或事实准确性很重要时。
谁最能从 Gemini Omni 1.1 中受益?
新版本对已经走出「一次性尝鲜」阶段的创作者尤为相关:
- 电影人与预演团队 可以测试更长的动作和事先规划好的镜头转场。
- 市场营销团队 可以制作产品揭示、活动素材的多个版本,以及更高分辨率的广告物料。
- 社交媒体创作者 可以设计循环、竖屏序列,以及结尾更可预期的多段式故事。
- 教育工作者 可以在保持同一视觉场景和讲述者的前提下延长讲解内容。
- 开发者 可以搭建包含草稿、延长、参考和放大各阶段的视频生成与编辑流程。
- 设计师与代理商 可以用参考片段传达运动构想,而不必只依赖文字提示词。
如何用 Gemini Omni 1.1 得到更好的结果
当提示词清楚地区分主体、动作、镜头、环境、视觉风格、光线和音频时,这些新控制能力才最见效。做场景延长时,描述「接下来该发生什么」,而不是重复整段原始提示词。做首尾帧生成时,说明镜头或主体应该如何从起始构图走到最终构图。
一个实用的提示词范式是:
主体与动作 + 镜头取景与运动 + 地点 + 光线与风格 + 音频 + 连贯性约束
例如:
一辆银色跑车在夜晚湿滑的海岸公路上加速。镜头以低角度后方跟拍开始,平滑地绕到驾驶员一侧,最后停在与所提供末帧相匹配的前四分之三特写。蓝色月光、路灯的暖色反射、真实的轮胎溅水、连续运动、无剪辑。低沉的引擎声、海风,以及克制的电影感配乐。
创作方向越清晰,模型的新控制能力就越有用武之地。
最终结论:Gemini Omni 1.1 是一次有意义的升级吗?
是的。初代 Gemini Omni Flash 立住了那个大想法:通过对话,用几乎任意的媒体组合来生成和编辑视频。而 Gemini Omni 1.1 让这个想法实质性地更好用了。
场景延长支撑更长的叙事。10 秒的先前上下文改善了连贯性。首尾帧控制让转场更可预期。视频参考更直接地传达运动。360p 草稿模式鼓励更快的试错,1080p 与 4K 放大则提供了更灵活的交付选项。
结果是一个能更自然地嵌入真实创作流程的模型——从粗略概念一直到精修导出。Gemini Omni 1.1 并不能取代创意方向、剪辑判断或质量把控,它只是为这三件事都提供了更好的工具。
想上手这套新流程吗?访问 Gemini Omni 1.1 视频生成器,了解它的能力,开始创作你的下一支 AI 视频。
