写真をAIビデオに変換する方法
あらゆる写真を生き生きとしたAIビデオに変換:アニメーションに適したソース画像を選び、シーンに属する動きをプロンプトし、アイデンティティを完全に安定させる。
画像からビデオへの変換は、AIビデオにおいて最も効果的な機能です。1枚の良い写真を入力すれば、数秒の信じられる動きが出力されます。しかし、多くの試みが失敗するのもここです。なぜなら、シーンがサポートできない動きを求めてしまうからです。ポートレートにカメラが周回する必要はありません。耳がピクッと動き、背景のボケが呼吸する必要があるのです。このガイドでは、クリーンにアニメーションするソース写真の選び方、シーンに属する動きのプロンプトの書き方、被写体を認識可能なまま保つ方法を説明します。
以下の例では、1枚の個人的なスタイルの写真を4秒のクリップにアニメーション化しています。同じパイプラインは、ポートレート、ペット、商品写真、風景にもManifoldGenで機能します。
動きのために作られた写真から始める
モデルはセグメント化できるものしか動かせないため、ソースの品質がプロンプト以上に重要です:
- シャープな被写体——目、毛、またはエッジがくっきりと焦点が合っている。動きは柔らかさをどろどろに増幅します。
- クリーンな背景分離——被写体が背景と明確に区別されている。混雑したシーンでは、モデルは犬がどこで終わり公園が始まるのかを推測しなければなりません。
- 単一の被写体——フレームごとに1人の人物または動物。2人の被写体はクリップの途中でアイデンティティを交換します。グループは別のテクニックです。
- すでに動きが暗示されている——風になびく髪、ストリングライト、水。モデルは既存のエネルギーを拡張する方が、新しいエネルギーを発明するよりはるかに得意です。
- 適切な解像度——長辺で約1024px。そうでない場合はまずアップスケール。アニメーションはソースにないディテールを回復できません。
シーンに属する動きをプロンプトする
INPUT

PROMPT
Gentle breeze moves the fur and the grass around the blanket, ears lift as the dog tilts its head slightly toward camera, string lights twinkle softly, background bokeh breathes, natural handheld micro-movement, subtle and lifelike.OUTPUT — GENERATED WITH MANIFOLDGEN
· 4s
ソース静止画自体は、この画像プロンプトで生成されました:「公園のピクニックブランケットに座るゴールデンレトリバーの率直なスマホ写真、舌を出し、後ろに木々とボケたストリングライト、夕方の太陽フレア、個人的な写真のようなわずかに不完全なフレーミング」。すべての動きの節が、フレーム内にすでに存在するもの——毛、草、耳、光、ボケ——を指定していることに注意してください。シーンに新しい要素を追加するよう求めるものは何もありません。
そのプロンプトを、環境(毛皮や草をなびかせる風)、表情(カメラに向かって首を傾げる)、雰囲気(きらめく光)、光学(息づくボケ)、カメラ(手持ちの微動)というアンビエントレイヤーのチェックリストとして読み解いてください。各レイヤーに1つの節を設け、それぞれを目に見える要素に結び付けます。この構造こそが、結果をモーフではなく、生きている瞬間として感じさせる理由です。
アイデンティティを安定させる
アイデンティティのずれ(顔の変形、模様の移動)は、人々が最初に気づく失敗モードです。防御策は3つ:
- 動きはデフォルトで控えめに。動きの単位ごとに被写体が描き直される可能性があります。「わずかに」「そっと」「微妙に」といった言葉は、飾りではなく重要な役割を担います。
- ポーズの変更は小さなものだけに。首を傾げる、まばたき、呼吸、重心移動は効果的です。立ち上がる、振り返る、歩き去るは避けましょう。
- 利用可能なら低い強度を使用。画像強度を下げると、動きは少なくなりますが、出力が元のピクセルに近づきます。顔やペットには最適なトレードオフです。
それでもずれる場合は、他の何よりも先に動きの節を半分に減らしてください。プロンプトが過負荷だと、モデルが即興で対応してしまいます。
再利用可能な画像から動画へのスケルトン
[Environmental motion] moves [ambient elements],
[small expressive action] as [subject] [micro-gesture toward camera],
[atmospheric layer] softly, background [optical layer] breathes,
natural handheld micro-movement, subtle and lifelike.優れた画像から動画へのクリップの背後にある唯一のルール:フレーム内に存在する動きを延長し、新しいオブジェクト、手足、光源を必要とする動きを導入しないこと。風、まばたき、呼吸、きらめき、さざ波—そして止める。
トラブルシューティング
- 被写体が溶けたり、種が変わったりする—要求した動きが多すぎます。節を2つに減らし、「微妙に」を追加してください。
- クリップが静止画のズームのように見える—カメラだけを説明し、シーンを説明していません。カメラの表現を、風、まばたき、光の節に置き換えてください。
- 新しいオブジェクトが現れる(余分な犬、浮遊する葉)—プロンプトが写真にない要素を導入しています。見えるものだけを説明してください。
- 動きが強く始まり、その後止まる—クリップの長さがプロンプトのエネルギーを超えています。4秒に保つか、「風が絶え間なく吹く」のような持続的なアンビエント節を1つ追加してください。
- 背景がひどく歪む—画像強度を上げる/動きの強度を下げて、被写体が動いている間も環境を固定してください。
- 再試行しても顔の類似性が失われる—毎回、以前にアニメーション化したフレームではなく、元のファイルから再生成してください。
カメラロールから3枚の写真を選び、Studioで上記のスケルトンを使って実行し、見直したくなるクリップを保持します。その後、同じソースを /tools/cinematic-cameras のさまざまなプリセットで試して、モーションスタイルを比較してください。
Try these prompts on your own shot.
Every example on this page was generated with ManifoldGen. Open the Studio and run the same structure on your idea.