Abbiamo Realizzato Due Cortometraggi con Dialoghi Utilizzando un Solo Modello Video
Due cortometraggi completi — una tragedia noir-magica e una storia di fantascienza con equipaggio bloccato — realizzati con 16 prompt H3 strutturati: un IDENTITY LOCK verbatim per ogni inquadratura per la coerenza del personaggio, dialoghi scritti nel prompt per la sincronizzazione labiale al momento della generazione e musica mixata in seguito. Il flusso di lavoro, i prompt e i costi di rendering.
Abbiamo realizzato due cortometraggi completi con dialoghi — Ember, una tragedia noir-magica ambientata in una città desertica, e Hollow Orbit, la storia di una nave da ricognizione precipitata su un pianeta bioluminescente in rotazione sincrona — utilizzando esclusivamente il nostro modello video H3 sul nostro stack GPU. Ogni film è composto da 8 inquadrature × 5 secondi: 16 inquadrature in totale, e ogni inquadratura è un singolo prompt strutturato. H3 non ha memoria tra le inquadrature, quindi la coerenza del personaggio risiede nel prompt stesso, e i dialoghi sono generati dal modello, con la sincronizzazione labiale che avviene durante la generazione. Questo articolo descrive l'intero flusso di lavoro: la tecnica di identità, il formato del dialogo, perché la musica non entra mai nel modello e quanto sono costati i rendering.
Due film, sedici prompt
Entrambi i film sono stati pianificati prima come liste di riprese e poi come prompt — un prompt per ogni ripresa, renderizzato sequenzialmente su un worker GPU locale. Ember è una tragedia magic-noir: una maga di strada ruba una brace proibita per salvare il fratello morente, la guardia che la ama si prende un colpo mortale per lei, e lei brucia la sua stessa scintilla per salvarlo, disperdendosi in braci all'alba. Conflitto, amore, perdita — quaranta secondi di tutto ciò. Hollow Orbit blocca una nave di rilevamento su un pianeta in rotazione sincrona: il Coro alieno ricostruisce il loro motore ma richiede una mente residente, la copilota Lena sceglie di rimanere e diventa il timone, e la valle fiorisce nella geometria del suo tatuaggio mentre la nave fugge.
PROMPT
[SHOT e1 — verbatim from the spec, opening truncated]
PHOTOREAL CINEMATIC FANTASY, anamorphic 2.39:1, warm ember palette against
cold indigo pre-dawn. IDENTITY LOCK: SERA, woman mid-20s, sun-bronzed olive
skin, black braided crown hair with loose windblown strands, amber eyes,
glowing copper sigil tattoos spiraling up both forearms, crimson open-backed
wrap top baring her shoulder blades, long charcoal skirt with a high slit...
SCENE: She stands on the ribbed clay rooftop of a teetering desert city at
first light, dealing a fan of tarot-sized cards whose faces smolder like
coals... AUDIO: dry wind over clay, distant bell-goat chimes, the soft hiss
of the burning card. No dialogue, no music, no subtitles, no logos.OUTPUT — GENERATED WITH MANIFOLDGEN
Ember — 8 riprese × 5 secondi, generate e montate da inizio a fine
La ripresa 1 stabilisce la geografia e il furto in un unico prompt. L'IDENTITY LOCK blocca Sera mentre tutto ciò che sta sotto — posizione, azione, telecamera, luce, audio — è nuovo per ogni ripresa; i restanti sette prompt cambiano solo queste variabili.
PROMPT
[SHOT h1 — verbatim from the spec, opening truncated]
PHOTOREAL SCIENCE FICTION, anamorphic 2.39:1, awe-heavy establishing.
SCENE: the survey ship MERIDIAN LARK, a hundred-meter wedge, crashed nose-down
in a valley of glassy violet coral under a locked twilight sky; a banded gas
giant hangs fixed on the horizon; aurora curtains ripple green-violet...
ACTION 0-5s: two tiny suited figures descend the rope from the airlock onto
coral that glows faintly brighter around each of their footfalls, light
rippling outward like pond rings... No dialogue, no music, no subtitles.OUTPUT — GENERATED WITH MANIFOLDGEN
Hollow Orbit — 8 riprese × 5 secondi, dialogo generato dal modello
L'intero film è composto da otto prompt di questo tipo. La nave, la valle e il Coro riappaiono in diverse riprese perché i loro descrittori si ripetono alla lettera — la stessa disciplina che l'IDENTITY LOCK applica ai volti.
Come funziona la coerenza dei personaggi
Ogni generazione H3 è indipendente: la ripresa 7 non ha conoscenza della ripresa 6. La coerenza è quindi una disciplina del prompt, non una caratteristica del modello. Ogni prompt di ripresa si apre con lo stesso blocco IDENTITY LOCK, incollato alla lettera, che fissa tutto ciò che riguarda un personaggio e che non deve mai cambiare. Ecco il blocco SERA troncato dalla specifica di Ember:
IDENTITY LOCK, repeat every shot:
SERA, woman mid-20s, sun-bronzed olive skin, black braided crown hair with
loose windblown strands, amber eyes, glowing copper sigil tattoos spiraling
up both forearms, crimson open-backed wrap top baring her shoulder blades,
long charcoal skirt with a high slit, brass bangles, wrapped barefoot sandals.
KADE, city guard about 30, brown skin, close-cropped black hair, trimmed
stubble, a scar over his right brow, dented bronze scale armor over an
indigo tunic, crimson sash at the waist.
[... repeated verbatim at the top of all eight prompts ...]Il blocco fissa viso, capelli, guardaroba, gioielli, persino come si manifesta la sua magia — ed è incollato in tutti gli otto prompt di Ember senza cambiare una parola. Il prompt della ripresa sottostante cambia solo ciò che dovrebbe cambiare: posizione, azione, telecamera, luce, suono. La deriva inizia nel momento in cui si riformula il blocco; una "corona di trecce nere" che diventa "onde da spiaggia sciolte" nella ripresa 6 è un personaggio diverso.
Dialoghi che si sincronizzano perfettamente con il labiale
Le battute sono scritte nel prompt della ripresa con la loro esatta formulazione, e H3 le esegue — la sincronizzazione labiale avviene durante la generazione, non in una fase successiva. Due regole tengono insieme ogni ripresa di dialogo: nominare l'oratore e contrassegnare le parole come fisse. L'ultima battuta di Ember alla guardia, mentre brucia la sua scintilla all'alba:
[SHOT e8 — sacrifice finale, sunrise]
ACTION AND DIALOGUE: 0-2.5s she presses the guttering EMBER into his chest;
its light floods his wound; her own sigils stream out like molten thread into
him. SERA, a whisper, smiling: "Live brighter." 2.5-4s: his eyes open, gasp;
hers go softly dark as her body loosens into drifting embers and ash-light.E la decisione chiave di Hollow Orbit, una volta che il Coro ha ricostruito il motore e stabilito il suo prezzo:
[SHOT h6 — cockpit conflict]
ACTION AND DIALOGUE: 0-1.5s IVAR slams the console. IVAR, raw: "We fly OUT."
1.5-3.5s LENA, steady, terrified, lip-synced: "Only a mind can hold the helm
it's offering. A machine can't carry it." 3.5-5s: hold on the two-shot, storm
light flaring between them, neither blinking.Entrambe le battute sono brevi di proposito: un primo piano, una clausola, le parole esatte tra virgolette e una riga Audio: che trasporta solo voce e suono diegetico. L'istruzione "no score" non è una decorazione — è ciò che rende possibile la sezione successiva.
La musica rimane fuori dal modello
H3 renderizza dialoghi, atmosfera ed effetti in fase di generazione, il che significa che una colonna sonora integrata nello stesso passaggio si scontrerebbe con la traccia dialoghi all'interno dell'audio del modello stesso. Manteniamo la musica completamente fuori e la trattiamo come un problema di mixaggio.
Le basi strumentali sono generate separatamente con il nostro modello musicale e mixate sotto il dialogo in ffmpeg, con sidechain-ducking in modo che la base si abbassi ogni volta che un personaggio parla. Ogni riga Audio: in un prompt di ripresa elenca solo il suono diegetico — voci, vento, ronzio dello scafo. La musica non entra mai nella generazione.
Costo di esecuzione
| Fase | Come è stato eseguito |
|---|---|
| Rendering delle riprese | 16 riprese — 8 per film, 5 secondi ciascuna, un prompt strutturato per ripresa |
| Hardware | Il nostro stack GPU: un worker GPU locale, riprese renderizzate sequenzialmente |
| Tempo per ripresa | Circa 4–10 minuti per ripresa di 5 secondi |
| Coerenza del personaggio | Blocco IDENTITY LOCK ripetuto alla lettera in ogni prompt |
| Dialogo | Scritto nel prompt con la formulazione esatta, generato e sincronizzato labialmente da H3 |
| Musicaaa | Basi strumentali dal nostro modello musicale, mixate sotto il dialogo in ffmpeg |
Lo stesso stack è aperto nello studio: dirigi le riprese su /studio, assegnagli un punteggio con il generatore su /tools/music-generator e mantieni ogni risorsa ricercabile su questo sito. Scrivi un IDENTITY LOCK, incollalo in ogni prompt alla lettera, metti le parole esatte pronunciate tra virgolette e tieni la musica fuori dal modello — questo è l'intero metodo dietro entrambi i film.
Try these prompts on your own shot.
Every example on this page was generated with ManifoldGen. Open the Studio and run the same structure on your idea.