Wir haben zwei Kurzfilme mit Dialogen mit einem Videomodell erstellt
Zwei komplette Kurzfilme – eine magisch-düstere Tragödie und eine Sci-Fi-Geschichte über eine gestrandete Crew – erstellt mit 16 strukturierten H3-Prompts: ein wortwörtliches IDENTITY LOCK pro Aufnahme für Charakterkonsistenz, Dialoge, die für die Lippensynchronisation während der Generierung in den Prompt geschrieben wurden, und Musik, die nachträglich gemischt wurde. Der Workflow, die Prompts und die Render-Zahlen.
Wir haben zwei komplette Kurzfilme mit Dialogen erstellt – Ember, eine magisch-düstere Tragödie, die in einer Wüstenstadt spielt, und Hollow Orbit, die Geschichte eines abgestürzten Vermessungsschiffs auf einem biolumineszierenden, gezeiten-gebundenen Planeten – ausschließlich mit unserem H3-Videomodell auf unserem eigenen GPU-Stack. Jeder Film besteht aus 8 Aufnahmen × 5 Sekunden: insgesamt 16 Aufnahmen, und jede Aufnahme ist ein einziger strukturierter Prompt. H3 hat kein Gedächtnis zwischen den Aufnahmen, daher liegt die Charakterkonsistenz im Prompt selbst, und Dialoge werden vom Modell generiert, wobei die Lippensynchronisation während der Generierung erfolgt. Dieser Artikel beschreibt den gesamten Workflow: die Identitätstechnik, das Dialogformat, warum Musik niemals in das Modell gelangt und was die Render gekostet haben.
Zwei Filme, sechzehn Prompts
Beide Filme wurden zuerst als Shotlists geplant und dann als Prompts – ein Prompt pro Einstellung, sequenziell auf einem lokalen GPU-Worker gerendert. Ember ist eine magisch-düstere Tragödie: Eine Straßenmagierin stiehlt eine verbotene Glut, um ihren sterbenden Bruder zu retten; der Wächter, der sie liebt, fängt einen tödlichen Bolzen für sie ab, und sie verbrennt ihren eigenen Funken, um ihn zu retten, und zerfällt bei Sonnenaufgang zu Glut. Streit, Liebe, Verlust – vierzig Sekunden davon. Hollow Orbit strandet ein Vermessungsschiff auf einem gezeiten-gebundenen Planeten: Der außerirdische Chor baut ihren Motor wieder auf, verlangt aber einen Bewohnergeist; Co-Pilotin Lena beschließt zu bleiben und wird zum Steuer, und das Tal blüht in ihrer Tattoo-Geometrie auf, während das Schiff entkommt.
PROMPT
[SHOT e1 — verbatim from the spec, opening truncated]
PHOTOREAL CINEMATIC FANTASY, anamorphic 2.39:1, warm ember palette against
cold indigo pre-dawn. IDENTITY LOCK: SERA, woman mid-20s, sun-bronzed olive
skin, black braided crown hair with loose windblown strands, amber eyes,
glowing copper sigil tattoos spiraling up both forearms, crimson open-backed
wrap top baring her shoulder blades, long charcoal skirt with a high slit...
SCENE: She stands on the ribbed clay rooftop of a teetering desert city at
first light, dealing a fan of tarot-sized cards whose faces smolder like
coals... AUDIO: dry wind over clay, distant bell-goat chimes, the soft hiss
of the burning card. No dialogue, no music, no subtitles, no logos.OUTPUT — GENERATED WITH MANIFOLDGEN
Ember — 8 Einstellungen × 5 Sekunden, durchgängig generiert und geschnitten
Einstellung 1 etabliert Geografie und den Diebstahl in einem Prompt. Der IDENTITY LOCK fixiert Sera, während alles darunter – Ort, Aktion, Kamera, Licht, Audio – pro Einstellung neu ist; die verbleibenden sieben Prompts ändern nur diese Variablen.
PROMPT
[SHOT h1 — verbatim from the spec, opening truncated]
PHOTOREAL SCIENCE FICTION, anamorphic 2.39:1, awe-heavy establishing.
SCENE: the survey ship MERIDIAN LARK, a hundred-meter wedge, crashed nose-down
in a valley of glassy violet coral under a locked twilight sky; a banded gas
giant hangs fixed on the horizon; aurora curtains ripple green-violet...
ACTION 0-5s: two tiny suited figures descend the rope from the airlock onto
coral that glows faintly brighter around each of their footfalls, light
rippling outward like pond rings... No dialogue, no music, no subtitles.OUTPUT — GENERATED WITH MANIFOLDGEN
Hollow Orbit — 8 Einstellungen × 5 Sekunden, Dialog vom Modell generiert
Der gesamte Film besteht aus acht solcher Prompts. Das Schiff, das Tal und der Chor tauchen in den Einstellungen wieder auf, weil ihre Beschreibungen wortwörtlich wiederholt werden – dieselbe Disziplin, die der IDENTITY LOCK auf Gesichter anwendet.
Wie Charakterkonsistenz funktioniert
Jede H3-Generierung ist unabhängig: Einstellung 7 hat keine Kenntnis von Einstellung 6. Konsistenz ist daher eine Prompt-Disziplin, keine Modellfunktion. Jeder Shot-Prompt beginnt mit demselben IDENTITY LOCK-Block, wortwörtlich eingefügt, der alles über einen Charakter fixiert, was sich niemals ändern darf. Hier ist der gekürzte SERA-Lock aus Embers Spezifikation:
IDENTITY LOCK, repeat every shot:
SERA, woman mid-20s, sun-bronzed olive skin, black braided crown hair with
loose windblown strands, amber eyes, glowing copper sigil tattoos spiraling
up both forearms, crimson open-backed wrap top baring her shoulder blades,
long charcoal skirt with a high slit, brass bangles, wrapped barefoot sandals.
KADE, city guard about 30, brown skin, close-cropped black hair, trimmed
stubble, a scar over his right brow, dented bronze scale armor over an
indigo tunic, crimson sash at the waist.
[... repeated verbatim at the top of all eight prompts ...]Der Lock fixiert Gesicht, Haare, Garderobe, Schmuck, sogar wie ihre Magie sich manifestiert – und er wird in alle acht Prompts von Ember eingefügt, ohne ein Wort zu ändern. Der Shot-Prompt darunter ändert nur, was sich ändern soll: Ort, Aktion, Kamera, Licht, Ton. Drift beginnt in dem Moment, in dem Sie den Lock umformulieren; eine „schwarz geflochtene Krone“, die in Einstellung 6 zu „lockeren Strandwellen“ wird, ist ein anderer Charakter.
Dialog, der tatsächlich lippensynchron ist
Zeilen werden mit ihrer exakten Formulierung in den Shot-Prompt geschrieben, und H3 führt sie aus – Lippensynchronisation erfolgt während der Generierung, nicht in einem Post-Pass. Zwei Regeln halten jede Dialogeinstellung zusammen: Nennen Sie den Sprecher und markieren Sie die Wörter als fixiert. Embers letzte Zeile an den Wächter, als sie ihren Funken bei Sonnenaufgang verbrennt:
[SHOT e8 — sacrifice finale, sunrise]
ACTION AND DIALOGUE: 0-2.5s she presses the guttering EMBER into his chest;
its light floods his wound; her own sigils stream out like molten thread into
him. SERA, a whisper, smiling: "Live brighter." 2.5-4s: his eyes open, gasp;
hers go softly dark as her body loosens into drifting embers and ash-light.Und Hollow Orbits Entscheidungs-Beat, nachdem der Chor den Motor wieder aufgebaut und seinen Preis genannt hat:
[SHOT h6 — cockpit conflict]
ACTION AND DIALOGUE: 0-1.5s IVAR slams the console. IVAR, raw: "We fly OUT."
1.5-3.5s LENA, steady, terrified, lip-synced: "Only a mind can hold the helm
it's offering. A machine can't carry it." 3.5-5s: hold on the two-shot, storm
light flaring between them, neither blinking.Beide Zeilen sind absichtlich kurz: eine Nahaufnahme, ein Satz, die genauen Worte in Anführungszeichen und eine Audio-Zeile, die nur Stimme und diegetischen Klang enthält. Die Anweisung „keine Musik“ ist keine Dekoration – sie ist das, was den nächsten Abschnitt ermöglicht.
Musik bleibt außerhalb des Modells
H3 rendert Dialog, Ambiente und Effekte bei der Generierung, was bedeutet, dass eine im selben Durchgang integrierte Filmmusik den Dialog-Track innerhalb des Audio des Modells stören würde. Wir lassen Musik komplett außen vor und behandeln sie als ein Mischproblem.
Instrumental-Hintergrundmusik wird separat mit unserem Musikmodell generiert und in ffmpeg unter den Dialog gemischt, wobei sie per Sidechain-Ducking abgesenkt wird, sobald ein Charakter spricht. Jede Audio:-Zeile in einem Shot-Prompt listet nur diegetische Geräusche auf – Stimmen, Wind, Brummen des Rumpfes. Musik wird niemals generiert.
Was der Betrieb kostet
| Phase | Wie es lief |
|---|---|
| Shot-Rendering | 16 Shots – 8 pro Film, je 5 Sekunden, ein strukturierter Prompt pro Shot |
| Hardware | Unser eigener GPU-Stack: ein lokaler GPU-Worker, Shots sequenziell gerendert |
| Zeit pro Shot | Etwa 4–10 Minuten pro 5-Sekunden-Shot |
| Charakterkonsistenz | IDENTITY LOCK-Block wortwörtlich in jedem Prompt wiederholt |
| Dialog | Mit exaktem Wortlaut in den Prompt geschrieben, von H3 generiert und lippensynchronisiert |
| Musik | Instrumental-Hintergrundmusik von unserem Musikmodell, in ffmpeg unter den Dialog gemischt |
Derselbe Stack ist im Studio verfügbar: direkte Shots unter /studio, Vertonung mit dem Generator unter /tools/music-generator und alle Assets auf dieser Website durchsuchbar halten. Einen IDENTITY LOCK schreiben, wortwörtlich in jeden Prompt einfügen, die exakt gesprochenen Worte in Anführungszeichen setzen und Musik aus dem Modell heraushalten – das ist die gesamte Methode hinter beiden Filmen.
Try these prompts on your own shot.
Every example on this page was generated with ManifoldGen. Open the Studio and run the same structure on your idea.