- Gemini Omni ブログ
- Gemini Omni で一貫した AI アバターを作る方法
Gemini Omni で一貫した AI アバターを作る方法
![]()
AI アバターを作ること自体は簡単です。本当に難しいのは、動画・カメラアングル・照明・アクション・環境が変わっても、そのアバターを同じ人物として認識できる状態に保つことです。
最初のクリップでは正しく見えたキャラクターが、次のクリップでは別の顔になっていることがあります。髪型が変わり、服のディテールが消え、年齢の印象や声までシーンごとにぶれてしまうこともあります。こうした不一致は、複数のクリップを 1 本の広告・チュートリアル・SNS シリーズに編集したときにとりわけ目立ちます。
Gemini Omni は、参照画像にもとづく動画生成と自然言語による修正を組み合わせることで、このワークフローを改善できます。毎回ゼロからキャラクターを説明する代わりに、明確な参照画像を使い回し、同じアイデンティティ記述を繰り返し、シーン・アクション・カメラだけを変えながらキャラクターを維持するようモデルに指示できます。
このガイドでは、マスター参照画像の準備から、同じビジュアルアイデンティティで複数シーンを生成するところまで、Gemini Omni で一貫した AI アバターを作る方法を解説します。
一貫した AI アバターとは何か
一貫したアバターとは、すべてのフレームで完全に同一である必要がある、という意味ではありません。実在の人物でさえ、照明・レンズ・表情・見る角度が変われば少し違って見えます。
目指すのはアイデンティティの連続性です。視聴者が「これは同じキャラクターだ」と即座に理解できることが重要です。
とくに重要なアイデンティティ要素は次のとおりです。
- 顔の骨格と各パーツの比率
- 目の色と形
- 髪型・長さ・髪色
- おおよその年齢
- 肌の色、そばかすなどの見える特徴
- 象徴的な服装
- アクセサリー
- 話し声
- 全体的な性格と身のこなし
説明の書き方によって有用性は大きく変わります。「美しい若い女性」では漠然としすぎていて、モデルに与えられるアイデンティティ情報がほとんどありません。
一方、「卵型の顔、ヘーゼルグリーンの瞳、肩までのウェーブがかったチェスナットブラウンの髪、小さな丸いゴールドのピアス、コバルトブルーのブレザー、アイボリーのトップスを身につけた架空の成人女性」という記述は、はるかに明確なビジュアル目標を示します。
一貫性とは、こうしたアイデンティティを決定づけるディテールを保ったまま、舞台・アクション・構図・カメラワークだけを自由に変えられる状態から生まれます。
ステップ 1:動画を生成する前にアバターを定義する
まず、アバターの短いアイデンティティ・プロファイルを書きましょう。ここにはプロジェクト全体を通して変わらない特徴を記述します。
例:
このアバターは架空の成人女性で、卵型の顔、ヘーゼルグリーンの瞳、自然な眉、うっすらとしたそばかす、肩までのウェーブがかったチェスナットブラウンの髪を持つ。小さな丸いゴールドのピアス、コバルトブルーのブレザー、アイボリーのクルーネックトップスを身につけている。物腰は温かく、親しみやすく、自信がある。
不要な形容詞を詰め込まないでください。見える・聞こえる要素に絞ります。「彼女には人を鼓舞する魂がある」といった抽象的な表現は、外見の維持には役立ちません。
プロファイルが固まったら、すぐ取り出せる場所に保存します。シーンごとに新しい説明を即興で書くのではなく、毎回まったく同じ文言を再利用してください。
あるプロンプトでは「プロのプレゼンター」、別のプロンプトでは「若手のファッションインフルエンサー」と書いてしまうと、モデルが年齢・顔の骨格・メイク・振る舞いを解釈し直してしまう可能性があります。
ステップ 2:クリーンなマスター参照画像を用意する
マスター参照画像はアバターのビジュアル上の基準点です。
次の条件を満たす高解像度の画像を使ってください。
- 人物がひとりだけ、はっきり写っている
- 均一で比較的ニュートラルな照明
- 顔が遮られていない
- 背景がシンプル
- 顔のプロポーションが自然
- 髪と服がはっきり見える
- 文字やロゴが入っていない
- 無関係な物や他の人物が写っていない
極端なクローズアップよりも、上半身またはスリークォーターのポートレートのほうが有用な情報が多くなります。顔をはっきり示しつつ、服装・姿勢・アクセサリー・体のプロポーションも同時に確定できるからです。
![]()
雑然としたライフスタイル写真をメインの参照にするのは避けましょう。複数の人物や物が写っていると、どのビジュアル情報を保持すべきかをモデルが判断できません。
上の画像がうまく機能するのは、アバターの顔・髪・ピアス・ブレザー・トップスがモデルにはっきり見えているからです。背景はシンプルで光は柔らかく、注意を奪う無関係な被写体もありません。
参照画像は架空の人物、または肖像の使用許可を得ている人物にしてください。同意なく実在の人物になりすます欺瞞的な動画を作ってはいけません。
ステップ 3:アイデンティティとシーン指示を分ける
優れたアバター用プロンプトは、性質の異なる 2 種類の情報で構成されます。
- 変わらないアイデンティティ・ブロック
- 毎回変わるシーン・ブロック
アイデンティティ・ブロックには、顔・髪・服・アクセサリー・年齢・性格を書きます。これはすべてのプロンプトでほぼ同一に保ちます。
シーン・ブロックには、その 1 本の動画に固有の場所・アクション・カメラワーク・照明・セリフ・音を書きます。
再利用できる構成は次のとおりです。
アップロードした画像は、この架空のプレゼンターのアイデンティティ参照としてのみ使用し、文字どおりの最初のフレームとして扱わないでください。顔の骨格、ヘーゼルグリーンの瞳、肩までのウェーブがかったチェスナットブラウンの髪、小さな丸いゴールドのピアス、コバルトブルーのブレザー、アイボリーのトップス、年齢の印象、肌の色、体のプロポーションを保ってください。
シーン:架空のプレゼンターがミニマルなクリエイティブスタジオに立ち、カメラに向かって直接語りかける。安定したミディアムショット、ゆっくりとしたカメラの寄り、柔らかい自然光、自然なジェスチャー、リアルな肌の質感、すっきりした背景を使用する。カットを入れず、ワンカットで通すこと。
このように分けておくと、シーンを変えるときにキャラクターまで設計し直してしまう事故を防げます。
問題の切り分けにも役立ちます。アイデンティティは安定しているのに動きがおかしいなら、アクション指示だけを直せば済みます。場所は正しいのに顔がぶれているなら、シーン全体を書き直さずにアイデンティティ参照を強化できます。
ステップ 4:まずはシンプルなベースクリップを作る
プロジェクトで最も複雑なシーンから始めてはいけません。
まずはコントロールしやすい環境で短いベースクリップを生成します。シンプルな背景、控えめな体の動き、安定した照明、ワンカットのカメラワークを使ってください。難しい動きや劇的な照明を持ち込む前に、キャラクターの顔を評価しやすくなります。
次の点を確認します。
- 顔は参照画像と一致しているか
- 髪型は認識できる状態を保っているか
- ピアスやブレザーなど、象徴的な特徴は残っているか
- キャラクターの年齢の印象は正しいか
- 動いている間、目と口は安定しているか
- 声は意図した性格に合っているか
- 話している間もキャラクターだと認識できるか
- 口の動きはセリフと合っているか
このコントロールされたスタジオクリップは、より負荷の高いシーンに進む前に、アバターの基本的な外見・声・表情の動き・話し方を確定させるものです。
すっきりした背景のおかげで顔と口を検証しやすくなっています。ブルーのブレザーは、後の動画でも使い回せる分かりやすい衣装の基準点になります。
ベースクリップが正しくない場合は、そのまま次のシーンを生成しないでください。先にアイデンティティを直します。そうしないと、以降のクリップが誤ったバージョンのアバターを再生産し続けることになります。
別バージョンを作るつもりでも、いちばん良かったベースクリップは保存しておきましょう。以降のすべてのシーンを評価するための有用なビジュアル基準になります。
ステップ 5:主要な変数は一度にひとつだけ変える
服装・場所・カメラアングル・照明・アクション・感情表現を 1 つのプロンプトで同時に変えると、一貫性の維持は一気に難しくなります。
より安全なのは、1 回の生成で変える主要な変数を 1〜2 個に絞る進め方です。
例:
- クリップ 1:ニュートラルなスタジオ、安定したミディアムショット
- クリップ 2:同じ服装で屋外環境へ
- クリップ 3:同じ環境でカメラをより寄せる
- クリップ 4:同じ構図で別のジェスチャー
- クリップ 5:慎重に新しい衣装を導入する
この段階的な進め方なら、どの変更がアイデンティティのぶれを招いたかを特定できます。
新しい環境を試すときは服装を維持し、新しい衣装を試すときはシンプルな照明と慣れたカメラアングルを使います。各変数が単独で機能すると確認できたら、より野心的なシーンで組み合わせていきましょう。
この屋外クリップは、環境・照明・カメラワーク・身体の動きを変えつつ、アバターの核となるアイデンティティと衣装を維持しています。
スタジオの動画と比べてみてください。場所も動きも違いますが、認識できる顔立ち、ブラウンの髪、ゴールドのピアス、ブルーのブレザー、アイボリーのトップス、全体的な人物像は同じキャラクターにつながっています。
ほぼ同じスタジオショットを 3 本作るより、これは一貫性のはるかに有効な検証になります。使えるアバターとは、舞台が別の環境に移っても認識できるアバターです。
ステップ 6:動きを正確に記述する
「自然に動かして」といった曖昧な指示は、解釈の余地を残しすぎます。
キャラクターの見える動きと、カメラの動きは分けて書きましょう。
プレゼンターはカメラに向かってゆっくり 3 歩進み、立ち止まり、肩をわずかに左へ向けて微笑む。頭の動きは抑制的で自然。カメラは同じ速度で後退しながらトラッキングし、安定したミディアムショットを維持する。
顔を保ちたいときこそ、詳細な動きの指示が効いてきます。
素早い回転、極端な表情、急なカメラの動き、強いモーションブラー、手が繰り返し顔の前を横切る動作は、映像の不安定さを増やします。キャラクターが話している場合、過度な動きは正確なリップシンクも難しくします。
アバター中心の動画では、次のような要素を優先してください。
- ゆっくりした首の動き
- 自然なまばたき
- 抑制されたハンドジェスチャー
- 短い歩行
- 安定したミディアムショット
- 緩やかなカメラの寄り
- シンプルなトラッキングショット
- 不要なカットのない連続したシーン
シンプルな動きでもアバターが認識できると確認できてから、より複雑なアクションを導入しましょう。
起きてほしくないことをメインのプロンプトに直接書くのも有効です。
シーンのカット、他の人物、衣装の変更、大げさなジェスチャー、顔の前を横切る物体は入れないこと。
明確な除外指定は、不要なビジュアル要素がキャラクターを妨げる可能性を下げます。
ステップ 7:セリフは短く自然に
セリフは一貫性の難易度をさらに一段上げます。モデルは顔を保ちながら、発話・口の動き・表情・音声を同時に生成しなければならないからです。
選んだ動画の尺のなかで無理なく言い切れる短い文を使ってください。セリフが長すぎると、不自然に早口になったり、単語を飛ばしたり、リップシンクが崩れたりします。
8 秒のクリップなら、英語で 14〜18 語程度の 1 文が扱いやすい目安です。10 秒のクリップなら、落ち着いた話速を保てば短い 2 文でも成立します。
セリフは引用符の中に、そのままの文言で書きます。
彼女はカメラを見つめ、はっきりとこう言う。「私はどのシーンでも同じデジタルクリエイター。ひとつのアイデンティティ、ひとつの声、そして無数のストーリー。」
話し方はそのあと別に記述します。
声:温かみのある成人女性の声、ニュートラルなアメリカ英語のアクセント、落ち着いて自信があり、会話的で中程度の速さ、明瞭な発音、自然な強調。
声の記述をシーンごとに変えないでください。最初のプロンプトで落ち着いたプロの声を指定し、次で若々しくハイテンションな演技を求めれば、アバターは別人のように聞こえてしまいます。
使っているワークフローで再利用可能な音声リファレンスが提供されている場合は、すべてのクリップで同じリファレンスを使います。提供されていない場合は、文章での声の記述を完全に同一に保ち、出力を注意深く確認してください。
機能の提供状況はプラットフォームや地域によって異なります。安定した声の連続性が得られない場合は、セリフなしで映像だけを生成し、ポストプロダクションで統一した録音音声または合成音声を当てる方法もあります。
ステップ 8:対話型編集でピンポイントに直す
Gemini Omni は、対応するワークフローにおいて自然言語での動画修正をサポートします。つまり、生成済みクリップの一部だけを変更し、それ以外を保つよう指示できます。
編集指示は短く具体的に。例:
プレゼンターの顔立ちと髪型を参照画像のとおりに戻してください。それ以外はすべてそのままにしてください。
髪型を参照画像にもっと近づけてください。顔、服装、アクション、カメラ、照明、背景、音声は変更しないでください。
笑顔を小さくして、表情をより自然にしてください。それ以外はすべてそのままにしてください。
照明を暖かい夕暮れに変更してください。プレゼンターのアイデンティティ、服装、動き、フレーミング、声は維持してください。
「それ以外はすべてそのまま」という一文が、編集の適用範囲を明確にします。ただし、どんな編集にも小さな変化はつきものなので、修正後のバージョンは参照画像と元の動画の両方と見比べてください。
編集で顔が大きく崩れた場合は、劣化した結果をさらに編集し続けるのではなく、状態の良かった以前のバージョンに戻りましょう。
1 回のリクエストに修正を詰め込みすぎないでください。顔・服・カメラ・背景・セリフのすべてを変えたいなら、目的を絞った複数の編集に分割します。
ステップ 9:長尺 1 本ではなく、クリップを分けて生成する
複数シーンのアバター動画では、物語全体を 1 回で生成させるより、短いクリップを複数作るほうが制御しやすくなります。
各クリップは、同じアイデンティティ参照とアイデンティティ・ブロックを使い回しつつ、それぞれに焦点を絞ったシーンプロンプトを持てます。あとは良い結果を選び、編集ソフトでつなげばかまいません。
シンプルなアバター・シーケンスの例:
- スタジオでの導入
- 屋外のライフスタイルシーン
- 縦型の解説パート
- 最後のコール・トゥ・アクション
この構成なら、失敗したシーンの差し替えも簡単です。3 本目の顔が一致していなければ、その 1 本だけを作り直せば済みます。
この縦型プレゼンターのクリップは、アスペクト比・空間・構図・見せ方が変わっても同じアバターだと認識できるかを検証するものです。
アバターは同じ顔立ち・髪型・ピアス・ブレザー・トップス・声の方向性を保ちながら、縦型の SNS 体験に合わせて構図が組み直されています。
一貫性を、ほぼ同じ生成結果どうしではなく、意味のある差のあるシーン間で評価すべき理由がここにあります。
再利用できる Gemini Omni アバター用プロンプトテンプレート
次のテンプレートを出発点にしてください。
アップロードした画像はアイデンティティ参照としてのみ使用し、文字どおりの最初のフレームとして扱わないでください。被写体の顔の骨格、年齢の印象、肌の色、目の形と色、髪型、髪色、象徴的なアクセサリー、服装、体のプロポーションを保ってください。キャラクターは常に同一の架空人物としてはっきり認識できる必要があります。
キャラクターの振る舞い:[性格・表情・ジェスチャー]。
シーン:[場所と背景]。
アクション:[具体的な身体動作の流れ]。
カメラ:[ショットサイズ、アングル、レンズの質感、動き]。
照明:[方向、色、強さ、雰囲気]。
セリフ:「[アバターが話す正確な言葉]。」
声:[アクセント、トーン、話速、エネルギー]。
サウンド:[環境音、音楽、効果音]。
フォーマット:[アスペクト比と尺]。
シーンのカットを入れず、ワンカットで通してください。リアルな人体構造、自然な表情の動き、安定した目、正確なリップシンクを維持してください。キャラクターのアイデンティティ、髪型、服のディテール、アクセサリー、年齢の印象、声を変えないでください。字幕、文字、ロゴ、余分な人物、注意をそらす物体を追加しないでください。
すべてのプロンプトにすべての項目が必要なわけではありません。今回のシーンに関係のない指示は削ってかまいませんが、アイデンティティ・ブロックは安定させてください。
よくあるアバター一貫性の失敗
キャラクター名だけに頼る
キャラクター名は、保存済みのキャラクターや参照アセットに紐づいていないかぎり、十分なビジュアル情報を含みません。プラットフォームが求める場合は、参照画像とアイデンティティ記述を提供し続けてください。
アイデンティティ記述を変えてしまう
あるプロンプトで「成熟したプロのプレゼンター」、別のプロンプトで「若手のファッションインフルエンサー」と呼べば、年齢の印象・顔の骨格・メイク・振る舞いが変わり得ます。
プロジェクト全体で同じ文言を再利用してください。
複雑なアクションから始める
速い動き、雑然とした背景、劇的な影、極端な表情、頻繁なカットは、一貫性の評価を難しくします。まず信頼できるベースクリップを確立しましょう。
低品質な参照画像を使う
ぼけ、強いカラーグレーディング、極端な角度、顔の遮蔽、髪の見切れは、参照画像の有用性を下げます。
早い段階で衣装を変える
服装は重要なビジュアルの基準点です。新しい場所・カメラアングル・動きを試す間は、同じ衣装を維持してください。衣装の変更は顔が安定してから導入します。
一度に多くの修正を求める
顔・服・背景・カメラ・セリフのすべてを変える必要があるなら、小さな編集に分割しましょう。うまくいっている部分を保ちやすくなります。
一貫性を保証だと考える
参照画像と対話型編集は連続性を改善しますが、生成動画は依然としてぶれることがあります。公開前に、顔・手・服・アクセサリー・声・背景を必ず確認してください。
完成したアバター動画の評価方法
クリップを並べて、直接見比べます。
次の問いを立ててください。
- 何も説明されなくても、視聴者は同じ人物だと認識できるか
- 目の色、顔の形、髪型、年齢の印象は一致しているか
- ピアスと服装は認識できる状態を保っているか
- 声の高さ、アクセント、話速、人物像は近いか
- 同じ癖や身のこなしが保たれているか
- 発話中や動作中も顔は安定しているか
- 違いは自然な照明や遠近によるものか、それともアイデンティティ自体が変わってしまったのか
小さな違いは許容できます。目指すのはピクセル単位の複製ではなく、説得力のあるアイデンティティの連続性です。
1 本だけ明らかに違って見えるなら、いちばん小さな誤りの要素を特定し、そのシーンだけを再生成または編集してください。
まとめ
一貫した AI アバターは、完璧な 1 本のプロンプトではなく、再現可能な仕組みから生まれます。
安定したアイデンティティを定義し、クリーンなマスター参照を用意し、変わらないキャラクター特性と変わるシーン指示を分け、シンプルなベースクリップから始めましょう。同じ参照画像とアイデンティティ・ブロックを再利用し、新しい変数は少しずつ導入し、想定外の変化が出たらピンポイントで修正します。
セリフは選んだ尺で言い切れる長さに保ち、動きは正確に記述し、声の方向性はすべてのクリップで統一してください。シーンを分けて生成すれば、失敗した 1 本をプロジェクト全体の作り直しなしに差し替えられます。
Gemini Omni は、参照画像にもとづく生成と自然言語での修正によって、このプロセスをより現実的なものにします。プロンプトの書き直しにかかる労力は減らせますが、丁寧な準備と品質チェックは依然として欠かせません。
Gemini Omni で一貫した AI アバターづくりを始めましょう。最初にうまくいった参照画像とベースクリップを、以降のすべてのシーンの土台として扱ってください。
