- Gemini Omni 部落格
- 如何用 Gemini Omni 打造一致的 AI 虛擬形象
如何用 Gemini Omni 打造一致的 AI 虛擬形象
![]()
建立一個 AI 虛擬形象並不難。真正的挑戰在於:當影片、鏡頭角度、光線條件、動作和環境不斷變化時,如何讓這個角色始終保持可辨識。
同一個角色可能在第一段影片裡完全正確,到了下一段卻換了一張臉。髮型會改變,服裝細節會消失,甚至連角色的年齡感和聲音都會在不同場景之間漂移。當多段素材被剪進同一支廣告、教學或社群媒體系列時,這些不一致會格外刺眼。
Gemini Omni 能夠改善這套工作流程——它把以參考圖為基礎的影片生成,與自然語言修改結合在一起。你不必每次都從零描述角色,而是可以重複使用一張清晰的參考圖、沿用同一段身分描述,並要求模型在只改變場景、動作或鏡頭的前提下保留該角色。
本指南將說明如何用 Gemini Omni 建立更一致的 AI 虛擬形象,從準備主參考圖開始,一直到用同一套視覺身分生成多個場景。
什麼才算是「一致的 AI 虛擬形象」?
一致的虛擬形象並不需要在每一格畫面都完全相同。即便是真人,在不同的光線、鏡頭、表情和視角下,看起來也會略有差異。
我們真正要的是身分連續性。觀眾應該一眼就能認出,這是同一個角色。
最重要的身分特徵包括:
- 臉部結構與比例
- 眼睛的顏色與形狀
- 髮型、長度與髮色
- 大致年齡
- 膚色以及雀斑等可見細節
- 標誌性服裝
- 配件
- 說話的聲音
- 整體個性與肢體語言
有些描述比另一些更有用。「一位漂亮的年輕女性」過於籠統,它幾乎沒有提供任何身分資訊給模型。
而「一位虛構的成年女性,鵝蛋臉,榛綠色眼睛,及肩栗棕色波浪髮,小圓形金耳環,鈷藍色西裝外套,象牙白上衣」這樣的描述,則提供了清晰得多的視覺目標。
一致性來自於:保留這些定義身分的細節,同時讓場景、動作、構圖和運鏡自由變化。
第 1 步:在生成影片之前先定義虛擬形象
先為你的虛擬形象寫一份簡短的身分檔案。這份檔案應該描述那些在整個專案中保持不變的特徵。
例如:
這個虛擬形象是一位虛構的成年西方女性,鵝蛋臉,榛綠色眼睛,自然的眉形,淡淡的雀斑,及肩栗棕色波浪髮。她配戴小圓形金耳環,穿著鈷藍色西裝外套和象牙白圓領上衣。她的氣質溫暖、親切且自信。
不要用多餘的形容詞堆砌檔案。請聚焦於看得到或聽得到的細節。像「她擁有一個鼓舞人心的靈魂」這類抽象敘述,對維持外觀毫無幫助。
身分檔案一旦定稿,就把它存在隨手可取的地方。每次生成都沿用同一段用詞,而不是為每個場景臨時編一段新描述。
如果你在一個提示詞裡把角色寫成專業主持人,在另一個提示詞裡又寫成年輕時尚網紅,模型可能會重新詮釋她的年齡、臉部結構、妝容和肢體語言。
第 2 步:製作一張乾淨的主參考圖
主參考圖是虛擬形象的視覺定錨。
請使用符合以下條件的高解析度圖片:
- 畫面中只有一位清晰可見的人物
- 光線均勻且相對中性
- 臉部沒有遮擋
- 背景簡潔
- 臉部比例自然
- 頭髮與服裝清晰可見
- 沒有文字或標誌
- 沒有無關物件或其他人物
半身或四分之三身構圖,通常比極近特寫提供更多有用資訊。它既能清楚呈現臉部,也能確立服裝、姿態、配件和身體比例。
![]()
不要拿一張雜亂的生活照當主參考圖。如果畫面中出現多個人物或物件,模型可能無從判斷哪些視覺資訊才需要保持一致。
上面這張圖之所以效果好,是因為它讓模型清楚看見虛擬形象的臉、頭髮、耳環、外套和上衣。背景簡潔,光線柔和,沒有無關主體來搶奪注意力。
參考圖所描繪的應該是虛構人物,或是你已取得肖像使用許可的真人。請勿在未經同意的情況下製作冒充真實人物的欺騙性影片。
第 3 步:把身分資訊與場景指令分開
一個好的虛擬形象提示詞,應該包含兩類彼此獨立的資訊:
- 固定不變的身分區塊
- 隨場景變化的場景區塊
身分區塊描述臉部、頭髮、服裝、配件、年齡和個性。它在所有提示詞中都應保持幾乎一致。
場景區塊則描述某一支影片的地點、動作、運鏡、光線、台詞和聲音。
以下是一個可重複使用的結構:
請僅將上傳的圖片作為這位虛構主持人的身分參考,而不是字面上的第一格畫面。請保留她的臉部結構、榛綠色眼睛、及肩栗棕色波浪髮、小圓形金耳環、鈷藍色西裝外套、象牙白上衣、年齡感、膚色和身體比例。
場景:這位虛構主持人站在一間極簡風格的創意工作室中,直接對著鏡頭說話。請使用穩定的中景、緩慢的鏡頭推進、柔和的日光、自然的手勢、真實的皮膚質感和乾淨的背景。整段保持一鏡到底,不要有剪接。
這樣的拆分,能讓你在更換場景時,不會順手把角色也重新設計了一遍。
它同樣有助於定位問題來源。如果身分穩定但動作不對,你只需修改動作指令;如果地點正確但臉部漂移了,你可以強化身分參考,而不必重寫整個場景。
第 4 步:先生成一段簡單的基準片段
不要一開始就挑戰整個專案裡最複雜的場景。
先在可控環境中生成一段簡短的基準片段。使用簡潔的背景、有限的肢體動作、穩定的光線和一鏡到底的運鏡。這樣你就能在導入高難度動作或戲劇性光效之前,先評估角色的臉部表現。
請檢查以下細節:
- 臉部是否與參考圖相符?
- 髮型是否依然可辨識?
- 耳環、外套等標誌性特徵是否都在?
- 角色的年齡感是否正確?
- 眼睛和嘴在運動過程中是否穩定?
- 聲音是否符合設定的個性?
- 角色在說話時是否依然可辨識?
- 唇形是否與台詞對得上?
這段可控的工作室片段,在導入更高難度的場景之前,先確立了虛擬形象的基礎外觀、聲音、臉部動態和說話風格。
簡潔的背景讓臉部和嘴部更容易檢查。藍色西裝外套則形成了一個可辨識的服裝定錨,可以在後續影片中重複使用。
如果基準片段不正確,就不要繼續生成更多場景。請先把身分問題修正過來,否則後續片段可能會不斷複製錯誤版本的虛擬形象。
即使你打算再生成一個版本,也請保留最好的那段基準片段。它是評估後續每個場景時非常有用的視覺基準。
第 5 步:每次只改變一個主要變數
當一個提示詞同時改變服裝、地點、鏡頭角度、光線、動作和情緒表演時,一致性就會變得難以維持。
比較穩妥的做法是:每次生成只改變一到兩個主要變數。
例如:
- 片段 1:中性工作室,穩定中景
- 片段 2:同樣的服裝,換到戶外環境
- 片段 3:同樣的環境,換成更近的鏡頭角度
- 片段 4:同樣的構圖,換一個手勢
- 片段 5:謹慎地導入新服裝
這種可控的推進方式,有助於判斷究竟是哪一次改動導致身分漂移。
測試新環境時,保留虛擬形象的服裝;測試新服裝時,使用簡單的光線和熟悉的鏡頭角度。當每個變數都能單獨跑通之後,你就可以把它們組合進更有企圖心的場景裡。
這段戶外片段改變了環境、光線、運鏡和肢體動作,同時保留了虛擬形象的核心身分與服裝。
把它和工作室影片對照一下。地點和動作都不同,但可辨識的臉孔、棕色頭髮、金耳環、藍色外套、象牙白上衣以及整體個性,依然指向同一個角色。
比起生成三段幾乎相同的工作室鏡頭,這才是對一致性更有效的檢驗。一個好用的虛擬形象,應該在故事換到不同環境後依然可辨識。
第 6 步:精確描述動作
「讓她動作自然一點」這類模糊指令,留給模型的詮釋空間太大了。
請把角色的可見動作和鏡頭的運動分開描述:
主持人朝鏡頭緩步走三步,停下,肩膀微微左轉,然後微笑。她的頭部動作克制而自然。鏡頭以相同速度向後跟拍,維持穩定的中景。
當你想保住臉部時,詳細的動作指令特別有用。
快速旋轉、誇張表情、突兀的鏡頭運動、強烈的動態模糊,以及手部反覆從臉前經過,都會加劇畫面的不穩定。如果角色正在說話,過多的動作還會讓精準的唇形同步更加困難。
對於以虛擬形象為核心的影片,建議優先使用:
- 緩慢的轉頭
- 自然的眨眼
- 克制的手勢
- 短距離的走動
- 穩定的中景
- 輕柔的鏡頭推進
- 簡單的跟拍
- 沒有多餘剪接的連續場景
在確認虛擬形象能在簡單動作中保持可辨識之後,你再導入更複雜的動作。
同樣有用的做法,是在主提示詞裡直接寫明不希望發生什麼:
不要有場景剪接,不要出現其他人物,不要更換服裝,不要有誇張手勢,也不要有物件從她臉前經過。
明確的排除項目能降低多餘視覺元素干擾角色的機率。
第 7 步:讓台詞簡短自然
台詞會額外增加一層一致性難度,因為模型必須在生成語音、嘴型、表情和音訊的同時保住臉部。
請使用能在所選影片長度內從容說完的短句。如果台詞過長,角色可能會語速異常地快、吞字,或是失去精準的唇形同步。
對於 8 秒的片段,一句大約 14–18 個英文單字的台詞通常比一大段話更好掌控。對於 10 秒的片段,如果語速維持適中,兩個短句也可行。
請把確切台詞寫在引號之內:
她看向鏡頭,清楚地說:「我在每個場景裡都是同一位數位創作者——一個身分,一種聲音,無數個故事。」
然後再另外描述演繹方式:
聲音:溫暖的成年女性嗓音,中性美式口音,沉穩自信,語速適中,咬字清晰,重音自然。
不要在不同場景之間更改聲音描述。如果第一個提示詞要求沉穩的專業嗓音,下一個卻要求年輕而高度亢奮的表演,虛擬形象聽起來可能會像換了一個人。
如果你使用的工作流程提供可重複使用的語音參考,請在每個片段都使用同一個參考。如果平台沒有提供可重複使用的語音,就讓書面的聲音描述保持完全一致,並仔細檢查輸出結果。
功能可用性會因平台和地區而異。如果無法取得可靠的語音連續性,你可以先生成沒有台詞的畫面,然後在後製為所有片段配上同一條錄製或合成的人聲。
第 8 步:用對話式編輯做精準修正
Gemini Omni 在相容的工作流程中支援自然語言影片修改。這表示你可以要求它只改動生成片段中的某一部分,而保留其餘部分不變。
修改指令請保持簡短而具體。例如:
請恢復主持人在參考圖中原本的臉部特徵和髮型。其餘一切保持不變。
讓髮型更貼近參考圖。臉部、服裝、動作、鏡頭、光線、背景和音訊都保持不變。
把笑容幅度縮小,表情更自然一些。其餘一切保持不變。
把光線改成溫暖的夕陽。保留主持人的身分、服裝、動作、構圖和聲音。
「其餘一切保持不變」這句話,能明確界定本次編輯的作用範圍。不過,每次編輯仍可能帶來細微變化,因此請把修改後的版本同時與參考圖和原始影片對照。
如果某次編輯嚴重破壞了臉部,請回到先前那個較好的版本,而不要在已經劣化的結果上反覆編輯。
不要把太多修正塞進同一次請求。如果臉部、服裝、鏡頭、背景和台詞都需要改動,請拆成幾次目標明確的編輯分別完成。
第 9 步:生成多段獨立片段,而不是一整支長片
對於多場景的虛擬形象影片,生成若干短片段通常比要求模型一次生成完整故事更可控。
每個片段都可以有自己聚焦的場景提示詞,同時沿用同一張身分參考圖和同一段身分區塊。之後你可以挑出最好的結果,在剪輯軟體裡組接起來。
一個簡單的虛擬形象序列可能包含:
- 工作室開場
- 戶外生活場景
- 直式知識型段落
- 結尾的行動呼籲
這種結構也讓失敗的場景更容易替換。如果第三段的臉部不一致,你只需重新生成那一段,而不必重做整支影片。
這段直式主持片段,檢驗的是同一個虛擬形象在不同畫面比例、工作空間、構圖和呈現形式下是否依然可辨識。
虛擬形象依舊維持著同樣可辨識的臉孔、髮型、耳環、外套、上衣和聲音方向,但整段片段已經為直式社群媒體體驗重新構圖。
這說明了為什麼一致性應該在有意義的差異化場景之間檢驗,而不是在幾乎相同的生成結果之間檢驗。
可重複使用的 Gemini Omni 虛擬形象提示詞範本
請把這個範本當作起點:
請僅將上傳的圖片作為身分參考,而不是字面上的第一格畫面。請保留該主體的臉部結構、年齡感、膚色、眼睛形狀與顏色、髮型、髮色、標誌性配件、服裝和身體比例。角色必須始終清楚可辨為同一位虛構人物。
角色行為:[個性、表情與手勢]。
場景:[地點與背景]。
動作:[具體的肢體動作順序]。
鏡頭:[景別、角度、鏡頭質感與運動]。
光線:[方向、色彩、強度與氛圍]。
台詞:「[虛擬形象所說的確切內容]。」
聲音:[口音、音色、語速與能量]。
音效:[環境音、音樂與音效]。
格式:[畫面比例與長度]。
請使用一鏡到底,不要有場景剪接。維持真實的人體結構、自然的臉部動態、穩定的眼睛和精準的唇形同步。不要改變角色的身分、髮型、服裝細節、配件、年齡感或聲音。不要加入字幕、文字、標誌、多餘人物或干擾性物件。
並不是每個提示詞都需要填滿所有欄位。與當前場景無關的指令可以刪掉,但身分區塊要保持穩定。
常見的虛擬形象一致性錯誤
只用一個角色名字
除非角色名字已經連結到已儲存的角色或參考素材,否則它並不包含足夠的視覺資訊。在平台需要時,請持續提供參考圖和身分描述。
更動身分描述
在一個提示詞裡稱她為「一位成熟的專業主持人」,在另一個裡又稱她為「一位年輕的時尚網紅」,可能會改變她的年齡感、臉部結構、妝容和行為方式。
請在整個專案中沿用同一套身分用詞。
一開始就做複雜動作
快速運動、雜亂背景、戲劇性陰影、誇張表情和頻繁剪接,都會讓一致性更難評估。請先建立一段可靠的基準片段。
使用低品質參考圖
模糊、重度調色、極端視角、臉部遮擋和被裁掉的頭髮,都會削弱參考圖的作用。
太早更換服裝
服裝是重要的視覺定錨。在測試新地點、新鏡頭角度和新動作時,請維持同一套可辨識的服裝。等臉部穩定之後,再導入服裝變化。
一次要求過多修正
如果臉部、服裝、背景、鏡頭和台詞都需要改動,請拆成更小的編輯。這樣更容易保住影片中已經成功的部分。
把一致性當成一種保證
參考圖和對話式編輯可以改善連續性,但生成式影片依然可能漂移。發布之前,請務必檢查臉部、手部、服裝、配件、聲音和背景。
如何評估最終的虛擬形象影片
把這些片段並排放在一起,直接進行比較。
請問自己以下問題:
- 在沒人告知的情況下,觀眾能認出這是同一個人嗎?
- 眼睛顏色、臉型、髮型和年齡感是否一致?
- 耳環和服裝是否依然可辨識?
- 聲音的音高、口音、語速和個性是否相近?
- 虛擬形象是否維持著同樣的舉止習慣?
- 臉部在說話和運動過程中是否保持穩定?
- 差異是自然的光線和視角造成的,還是身分真的改變了?
細微的變化是可以接受的。目標不是像素等級的複製,而是可信的身分連續性。
如果某支影片明顯不同,請找出最小的那個錯誤元素,只重新生成或編輯該場景。
結語
一致的 AI 虛擬形象,來自一套可重複的方法,而不是某一條完美的提示詞。
定義穩定的身分,製作乾淨的主參考圖,把固定的角色特徵與變動的場景指令分開,並從一段簡單的基準片段開始。沿用同一張參考圖和同一段身分區塊,逐步導入新變數,並在出現意外變化時做精準修改。
讓台詞短到能在所選長度內說完,精確描述動作,並在每個片段使用相同的聲音方向。分段生成場景,這樣一段失敗的結果不必推翻整個專案就能替換。
Gemini Omni 透過以參考圖為基礎的生成和自然語言修改,讓這套流程更加實用。它可以減少反覆重寫提示詞的工作量,但充分的前期準備和品質把關依然不可或缺。
現在就用 Gemini Omni 開始建立你的一致性 AI 虛擬形象吧——把第一張成功的參考圖和第一段基準片段,當作後續每個場景的地基。
