🎉 限时特惠:享受 40% 折扣

如何用 Gemini Omni 打造一致的 AI 虚拟人

on 4 hours ago

用 Gemini Omni 打造的一致性 AI 虚拟人:同一位主持人出现在工作室、街头与办公室等多个场景中

创建一个 AI 虚拟人并不难。真正的挑战在于:当视频、镜头角度、光线条件、动作和环境不断变化时,如何让这个角色始终保持可识别。

同一个角色可能在第一段视频里完全正确,到了下一段却换了一张脸。发型会变化,服装细节会消失,甚至连角色的年龄感和声音都会在不同场景之间漂移。当多段素材被剪进同一支广告、教程或社交媒体系列时,这些不一致会格外刺眼。

Gemini Omni 能够改善这一工作流程——它把基于参考图的视频生成与自然语言修改结合在一起。你不必每次都从零描述角色,而是可以复用一张清晰的参考图、重复同一段身份描述,并要求模型在只改变场景、动作或镜头的前提下保留该角色。

本指南将讲解如何用 Gemini Omni 创建更加一致的 AI 虚拟人,从准备主参考图开始,一直到用同一套视觉身份生成多个场景。

什么才算是"一致的 AI 虚拟人"?

一致的虚拟人并不需要在每一帧都完全相同。即便是真人,在不同的光线、镜头、表情和视角下,看上去也会略有差异。

我们真正要的是身份连续性。观众应当一眼就能认出,这是同一个角色。

最重要的身份特征包括:

  • 面部结构与比例
  • 眼睛的颜色与形状
  • 发型、长度与发色
  • 大致年龄
  • 肤色以及雀斑等可见细节
  • 标志性服装
  • 配饰
  • 说话的声音
  • 整体性格与肢体语言

有些描述比另一些更有用。"一位漂亮的年轻女性"过于笼统,它几乎没有给模型提供任何身份信息。

而"一位虚构的成年女性,鹅蛋脸,榛绿色眼睛,齐肩栗棕色波浪发,小圆金耳环,钴蓝色西装外套,象牙白上衣"这样的描述,则提供了清晰得多的视觉目标。

一致性来自于:保留这些定义身份的细节,同时允许场景、动作、构图和运镜自由变化。

第一步:在生成视频之前先定义虚拟人

先为你的虚拟人写一份简短的身份档案。这份档案应当描述那些在整个项目中保持不变的特征。

例如:

该虚拟人是一位虚构的成年西方女性,鹅蛋脸,榛绿色眼睛,自然的眉形,淡淡的雀斑,齐肩栗棕色波浪发。她佩戴小圆金耳环,穿着钴蓝色西装外套和象牙白圆领上衣。她的气质温暖、亲切且自信。

不要用多余的形容词堆砌档案。请聚焦于可以被看到或听到的细节。诸如"她拥有一个鼓舞人心的灵魂"之类的抽象表述,对保持外观毫无帮助。

身份档案一旦定稿,就把它保存在随手可取的地方。每次生成都复用同一段措辞,而不是为每个场景临时编一段新描述。

如果你在一个提示词里把角色描述成职业主持人,在另一个提示词里又写成年轻时尚博主,模型可能会重新解读她的年龄、面部结构、妆容和肢体语言。

第二步:制作一张干净的主参考图

主参考图是虚拟人的视觉锚点。

请使用满足以下条件的高分辨率图片:

  • 画面中只有一个清晰可见的人物
  • 光线均匀且相对中性
  • 面部没有遮挡
  • 背景简洁
  • 面部比例自然
  • 头发与服装清晰可见
  • 没有文字或标志
  • 没有无关物体或其他人物

半身或四分之三身构图通常比极近特写提供更多有用信息。它既能清晰展示面部,也能确立服装、姿态、配饰和身体比例。

为 Gemini Omni 制作的一致性 AI 虚拟人参考图

不要拿一张杂乱的生活照当主参考图。如果画面中出现多个人物或物体,模型可能无从判断哪些视觉信息才是需要保持一致的。

上面这张图之所以效果好,是因为它让模型清楚地看到了虚拟人的脸、头发、耳环、外套和上衣。背景简洁,光线柔和,没有无关主体来争夺注意力。

参考图所描绘的应当是虚构人物,或是你已获得肖像使用许可的真人。请勿在未经同意的情况下制作冒充真实人物的欺骗性视频。

第三步:把身份信息与场景指令分开

一个优秀的虚拟人提示词应当包含两类彼此独立的信息:

  1. 固定不变的身份区块
  2. 随场景变化的场景区块

身份区块描述面部、头发、服装、配饰、年龄和性格。它在所有提示词中都应保持几乎一致。

场景区块则描述某一支视频的地点、动作、运镜、光线、台词和声音。

下面是一个可复用的结构:

请仅将上传的图片作为该虚构主持人的身份参考,而非字面意义上的首帧画面。请保留她的面部结构、榛绿色眼睛、齐肩栗棕色波浪发、小圆金耳环、钴蓝色西装外套、象牙白上衣、年龄感、肤色和身体比例。

场景:这位虚构主持人站在一间极简风格的创意工作室中,直接对着镜头讲话。请使用稳定的中景、缓慢的镜头推进、柔和的日光、自然的手势、真实的皮肤质感和干净的背景。整段保持一镜到底,不要有剪辑。

这种拆分让你在更换场景时,不至于顺手把角色也重新设计了一遍。

它同样有助于定位问题来源。如果身份稳定但动作不对,你只需修改动作指令;如果地点正确但面部漂移了,你可以加强身份参考,而不必重写整个场景。

第四步:先生成一段简单的基准片段

不要一上来就做整个项目里最复杂的场景。

先在受控环境中生成一段简短的基准片段。使用简洁的背景、有限的肢体动作、稳定的光线和一镜到底的运镜。这样你就能在引入高难度动作或戏剧化光效之前,先评估角色的面部表现。

请检查以下细节:

  • 面部是否与参考图一致?
  • 发型是否依然可辨认?
  • 耳环、外套等标志性特征是否都在?
  • 角色的年龄感是否正确?
  • 眼睛和嘴在运动过程中是否稳定?
  • 声音是否与设定的性格相符?
  • 角色在说话时是否依然可辨认?
  • 口型是否与台词对得上?

这段受控的工作室片段,在引入更高难度场景之前,先确立了虚拟人的基础外观、声音、面部动态和说话风格。

简洁的背景让面部和嘴部更易于检查。蓝色西装外套则形成了一个可辨识的服装锚点,可以在后续视频中反复使用。

如果基准片段不正确,就不要继续生成更多场景。先把身份问题修正过来,否则后续片段可能会不断复制错误版本的虚拟人。

即使你打算再生成一个版本,也请保留最好的那段基准片段。它是评估后续每个场景时非常有用的视觉基准。

第五步:每次只改变一个主要变量

当一个提示词同时改变服装、地点、镜头角度、光线、动作和情绪表演时,一致性就会变得难以维持。

更稳妥的做法是:每次生成只改变一到两个主要变量。

例如:

  • 片段 1:中性工作室,稳定中景
  • 片段 2:同样的服装,换到户外环境
  • 片段 3:同样的环境,换成更近的镜头角度
  • 片段 4:同样的构图,换一个手势
  • 片段 5:谨慎地引入新服装

这种可控的推进方式,有助于判断究竟是哪一次改动导致了身份漂移。

测试新环境时,保留虚拟人的服装;测试新服装时,使用简单的光线和熟悉的镜头角度。当每个变量都能单独跑通之后,你就可以把它们组合进更有野心的场景里。

这段户外片段改变了环境、光线、运镜和肢体动作,同时保留了虚拟人的核心身份与服装。

把它和工作室视频对比一下。地点和动作都不同,但可辨认的面孔、棕色头发、金耳环、蓝色外套、象牙白上衣以及整体性格,依然指向同一个角色。

比起生成三段几乎相同的工作室镜头,这才是对一致性更有效的检验。一个好用的虚拟人,应当在故事换到不同环境后依然可辨认。

第六步:精确描述动作

"让她动作自然一点"这类模糊指令,留给模型的解读空间太大了。

请把角色的可见动作和镜头的运动分开描述:

主持人朝镜头缓步走三步,停下,肩膀微微左转,然后微笑。她的头部动作克制而自然。镜头以相同速度向后跟拍,保持稳定的中景。

当你想要保住面部时,详细的动作指令尤其有用。

快速旋转、夸张表情、突兀的镜头运动、强烈的运动模糊,以及手部反复从脸前经过,都会加剧画面的不稳定。如果角色正在说话,过多的动作还会让准确的口型同步更加困难。

对于以虚拟人为核心的视频,建议优先使用:

  • 缓慢的转头
  • 自然的眨眼
  • 克制的手势
  • 短距离的行走
  • 稳定的中景
  • 轻柔的镜头推进
  • 简单的跟拍
  • 没有多余剪辑的连续场景

在确认虚拟人能在简单动作中保持可辨认之后,你再引入更复杂的动作。

同样有用的做法,是在主提示词里直接写明不希望发生什么:

不要有场景剪辑,不要出现其他人物,不要更换服装,不要有夸张手势,也不要有物体从她脸前经过。

明确的排除项能够降低多余视觉元素干扰角色的概率。

第七步:让台词简短自然

台词会额外增加一层一致性难度,因为模型必须在生成语音、口型、表情和音频的同时保住面部。

请使用能在所选视频时长内从容说完的短句。如果台词过长,角色可能会语速异常地快、吞字,或者失去准确的口型同步。

对于 8 秒的片段,一句大约 14–18 个英文单词的台词通常比一大段话更好把控。对于 10 秒的片段,如果语速保持适中,两个短句也可行。

请把确切台词写在引号之内:

她看向镜头,清晰地说道:"我在每个场景里都是同一位数字创作者——一个身份,一种声音,无数个故事。"

然后再单独描述演绎方式:

声音:温暖的成年女性嗓音,中性美式口音,沉稳自信,语速适中,吐字清晰,重音自然。

不要在不同场景之间更改声音描述。如果第一个提示词要求沉稳的职业嗓音,下一个却要求年轻而高度亢奋的表演,虚拟人听起来可能会像换了一个人。

如果你所使用的工作流提供可复用的语音参考,请在每个片段中都使用同一个参考。如果平台不提供可复用语音,就保持书面的声音描述完全一致,并仔细检查输出结果。

功能可用性会因平台和地区而异。如果无法获得可靠的语音连续性,你可以先生成不带台词的画面,然后在后期为所有片段配上同一条录制或合成的人声。

第八步:用对话式编辑做精准修正

Gemini Omni 在兼容的工作流中支持自然语言视频修改。这意味着你可以要求它只改动生成片段中的某一部分,而保留其余部分不变。

修改指令请保持简短而具体。例如:

请恢复主持人在参考图中原本的面部特征和发型。其余一切保持不变。

让发型更贴近参考图。面部、服装、动作、镜头、光线、背景和音频均保持不变。

把笑容幅度调小,表情更自然一些。其余一切保持不变。

把光线改成温暖的夕阳。保留主持人的身份、服装、动作、构图和声音。

"其余一切保持不变"这句话能够明确本次编辑的作用范围。不过,每次编辑仍可能带来细微变化,因此请把修改后的版本同时与参考图和原视频进行对比。

如果某次编辑严重破坏了面部,请回到之前那个更好的版本,而不要在已经劣化的结果上反复编辑。

不要把太多修正塞进同一次请求。如果面部、服装、镜头、背景和台词都需要改动,请拆成几次目标明确的编辑分别完成。

第九步:生成多段独立片段,而不是一整段长视频

对于多场景的虚拟人视频,生成若干短片段通常比要求模型一次生成完整故事更可控。

每个片段都可以拥有自己聚焦的场景提示词,同时复用同一张身份参考图和同一段身份区块。之后你可以挑出最好的结果,在剪辑软件里拼接起来。

一个简单的虚拟人序列可能包含:

  1. 工作室开场
  2. 户外生活场景
  3. 竖屏科普段落
  4. 结尾的行动号召

这种结构也让失败的场景更容易替换。如果第三段的面部不一致,你只需重新生成那一段,而不必重做整支视频。

这段竖屏主持片段,检验的是同一个虚拟人在不同画幅、工作空间、构图和呈现形式下是否依然可辨认。

虚拟人依旧保持着同样可辨认的面孔、发型、耳环、外套、上衣和声音走向,但整个片段已经为竖屏社交媒体体验重新构图。

这说明了为什么一致性应当在有意义的差异化场景之间检验,而不是在几乎相同的生成结果之间检验。

可复用的 Gemini Omni 虚拟人提示词模板

请把这个模板当作起点:

请仅将上传的图片作为身份参考,而非字面意义上的首帧画面。请保留该主体的面部结构、年龄感、肤色、眼睛形状与颜色、发型、发色、标志性配饰、服装和身体比例。角色必须始终清晰可辨为同一位虚构人物。

角色行为:[性格、表情与手势]。

场景:[地点与背景]。

动作:[具体的肢体动作序列]。

镜头:[景别、角度、镜头质感与运动]。

光线:[方向、色彩、强度与氛围]。

台词:"[虚拟人所说的确切内容]。"

声音:[口音、音色、语速与能量]。

声音设计:[环境音、音乐与音效]。

格式:[画幅比例与时长]。

请使用一镜到底,不要有场景剪辑。保持真实的人体结构、自然的面部动态、稳定的眼睛和准确的口型同步。不要改变角色的身份、发型、服装细节、配饰、年龄感或声音。不要添加字幕、文字、标志、多余人物或干扰性物体。

并非每个提示词都需要填满所有字段。与当前场景无关的指令可以删掉,但身份区块要保持稳定。

常见的虚拟人一致性错误

只用一个角色名字

除非角色名字已经关联到已保存的角色或参考素材,否则它并不包含足够的视觉信息。在平台需要时,请继续提供参考图和身份描述。

改动身份描述

在一个提示词里称她为"一位成熟的职业主持人",在另一个里又称她为"一位年轻的时尚博主",可能会改变她的年龄感、面部结构、妆容和行为方式。

请在整个项目中复用同一套身份措辞。

一上来就做复杂动作

快速运动、杂乱背景、戏剧化阴影、夸张表情和频繁剪辑,都会让一致性更难评估。请先建立一段可靠的基准片段。

使用低质量参考图

模糊、重度调色、极端视角、面部遮挡和被裁掉的头发,都会削弱参考图的作用。

过早更换服装

服装是重要的视觉锚点。在测试新地点、新镜头角度和新动作时,请保持同一套可辨认的服装。等面部稳定之后,再引入服装变化。

一次性要求过多修正

如果面部、服装、背景、镜头和台词都需要改动,请拆分成更小的编辑。这样更容易保住视频中已经成功的部分。

把一致性当成一种保证

参考图和对话式编辑可以改善连续性,但生成式视频依然可能漂移。发布之前,请务必检查面部、手部、服装、配饰、声音和背景。

如何评估最终的虚拟人视频

把这些片段并排放在一起,直接进行对比。

请问自己以下问题:

  • 在没人告知的情况下,观众能认出这是同一个人吗?
  • 眼睛颜色、脸型、发型和年龄感是否一致?
  • 耳环和服装是否依然可辨认?
  • 声音的音高、口音、语速和性格是否相近?
  • 虚拟人是否保持着同样的举止习惯?
  • 面部在说话和运动过程中是否保持稳定?
  • 差异是由自然的光线和视角造成的,还是身份真的发生了改变?

细微的变化是可以接受的。目标不是像素级的复刻,而是可信的身份连续性。

如果某支视频明显不同,请找出最小的那个错误元素,只重新生成或编辑该场景。

结语

一致的 AI 虚拟人,来自一套可重复的方法,而不是某一条完美的提示词。

定义稳定的身份,制作干净的主参考图,把固定的角色特征与变化的场景指令分开,并从一段简单的基准片段开始。复用同一张参考图和同一段身份区块,逐步引入新变量,并在出现意外变化时做精准修改。

让台词短到能在所选时长内说完,精确描述动作,并在每个片段中使用相同的声音走向。分段生成场景,这样一段失败的结果不必推翻整个项目就能替换。

Gemini Omni 通过基于参考图的生成和自然语言修改,让这个流程更加实用。它可以减少反复重写提示词的工作量,但充分的前期准备和质量把控依然必不可少。

现在就用 Gemini Omni 开始创建你的一致性 AI 虚拟人吧——把第一张成功的参考图和第一段基准片段,当作后续每个场景的地基。