SHOWCASE · August 24, 2026 · 7 MIN READ

Hicimos Dos Cortometrajes con Diálogo Usando un Modelo de Video

Dos cortometrajes completos —una tragedia de cine negro mágico y una historia de ciencia ficción de tripulación varada— realizados con 16 prompts H3 estructurados: un IDENTITY LOCK verbatim por toma para la consistencia del personaje, diálogo escrito en el prompt para la sincronización labial en el momento de la generación, y música mezclada después. El flujo de trabajo, los prompts y los números de renderizado.

Hicimos dos cortometrajes completos con diálogo — Ember, una tragedia de cine negro mágico ambientada en una ciudad desértica, y Hollow Orbit, la historia de una nave de reconocimiento estrellada en un planeta bioluminiscente con acoplamiento de marea — usando nada más que nuestro modelo de video H3 en nuestra propia pila de GPU. Cada película tiene 8 tomas × 5 segundos: 16 tomas en total, y cada toma es un único prompt estructurado. H3 no tiene memoria entre tomas, por lo que la consistencia del personaje reside en el propio prompt, y el diálogo es generado por el modelo, con la sincronización labial ocurriendo en la generación. Este artículo es todo el flujo de trabajo: la técnica de identidad, el formato de diálogo, por qué la música nunca entra en el modelo y cuánto costaron los renders.

Dos películas, dieciséis prompts

Ambas películas se planificaron primero como listas de tomas y luego como "prompts" (indicaciones) — un "prompt" por toma, renderizado secuencialmente en un único trabajador de GPU local. Ember es una tragedia de magia negra: una hechicera callejera roba una brasa prohibida para salvar a su hermano moribundo, el guardia que la ama recibe un golpe mortal por ella, y ella quema su propia chispa para salvarlo, dispersándose en brasas al amanecer. Lucha, amor, pérdida — cuarenta segundos de ello. Hollow Orbit deja varada una nave de reconocimiento en un planeta con acoplamiento de marea: el Coro alienígena reconstruye su motor pero exige una mente residente, la copiloto Lena elige quedarse y se convierte en el timón, y el valle florece en la geometría de su tatuaje mientras la nave escapa.

FILM 1 — EMBER

PROMPT

[SHOT e1 — verbatim from the spec, opening truncated]
PHOTOREAL CINEMATIC FANTASY, anamorphic 2.39:1, warm ember palette against
cold indigo pre-dawn. IDENTITY LOCK: SERA, woman mid-20s, sun-bronzed olive
skin, black braided crown hair with loose windblown strands, amber eyes,
glowing copper sigil tattoos spiraling up both forearms, crimson open-backed
wrap top baring her shoulder blades, long charcoal skirt with a high slit...
SCENE: She stands on the ribbed clay rooftop of a teetering desert city at
first light, dealing a fan of tarot-sized cards whose faces smolder like
coals... AUDIO: dry wind over clay, distant bell-goat chimes, the soft hiss
of the burning card. No dialogue, no music, no subtitles, no logos.

OUTPUT — GENERATED WITH MANIFOLDGEN

Ember — 8 tomas × 5 segundos, generadas y editadas de principio a fin

La toma 1 establece la geografía y el robo en un solo "prompt". El BLOQUEO DE IDENTIDAD fija a Sera mientras todo lo que está debajo — ubicación, acción, cámara, luz, audio — es nuevo por toma; los siete "prompts" restantes solo cambian esas variables.

FILM 2 — HOLLOW ORBIT

PROMPT

[SHOT h1 — verbatim from the spec, opening truncated]
PHOTOREAL SCIENCE FICTION, anamorphic 2.39:1, awe-heavy establishing.
SCENE: the survey ship MERIDIAN LARK, a hundred-meter wedge, crashed nose-down
in a valley of glassy violet coral under a locked twilight sky; a banded gas
giant hangs fixed on the horizon; aurora curtains ripple green-violet...
ACTION 0-5s: two tiny suited figures descend the rope from the airlock onto
coral that glows faintly brighter around each of their footfalls, light
rippling outward like pond rings... No dialogue, no music, no subtitles.

OUTPUT — GENERATED WITH MANIFOLDGEN

Hollow Orbit — 8 tomas × 5 segundos, diálogo generado por el modelo

Toda la película consta de ocho "prompts" de este tipo. La nave, el valle y el Coro reaparecen en las tomas porque sus descriptores se repiten textualmente — la misma disciplina que el BLOQUEO DE IDENTIDAD aplica a los rostros.

Cómo funciona la consistencia de los personajes

Cada generación H3 es independiente: la toma 7 no tiene conocimiento de la toma 6. La consistencia es, por lo tanto, una disciplina del "prompt", no una característica del modelo. Cada "prompt" de toma comienza con el mismo bloque de BLOQUEO DE IDENTIDAD, pegado textualmente, que fija todo lo que no debe cambiar de un personaje. Aquí está el BLOQUEO de SERA truncado de la especificación de Ember:

IDENTITY LOCK, repeat every shot:
SERA, woman mid-20s, sun-bronzed olive skin, black braided crown hair with
loose windblown strands, amber eyes, glowing copper sigil tattoos spiraling
up both forearms, crimson open-backed wrap top baring her shoulder blades,
long charcoal skirt with a high slit, brass bangles, wrapped barefoot sandals.
KADE, city guard about 30, brown skin, close-cropped black hair, trimmed
stubble, a scar over his right brow, dented bronze scale armor over an
indigo tunic, crimson sash at the waist.
[... repeated verbatim at the top of all eight prompts ...]

El bloqueo fija la cara, el cabello, el vestuario, las joyas e incluso cómo se manifiesta su magia, y se pega en los ocho "prompts" de Ember sin cambiar una palabra. El "prompt" de toma debajo solo cambia lo que debe cambiar: ubicación, acción, cámara, luz, sonido. La deriva comienza en el momento en que se reformula el bloqueo; una "corona trenzada negra" que se convierte en "ondas playeras sueltas" en la toma 6 es un personaje diferente.

Diálogo que realmente sincroniza los labios

Las líneas se escriben en el "prompt" de la toma con su redacción exacta, y H3 las interpreta — la sincronización labial ocurre durante la generación, no en un pase posterior. Dos reglas mantienen unida cada toma de diálogo: nombrar al hablante y marcar las palabras como fijas. La última línea de Ember al guardia, mientras quema su chispa al amanecer:

[SHOT e8 — sacrifice finale, sunrise]
ACTION AND DIALOGUE: 0-2.5s she presses the guttering EMBER into his chest;
its light floods his wound; her own sigils stream out like molten thread into
him. SERA, a whisper, smiling: "Live brighter." 2.5-4s: his eyes open, gasp;
hers go softly dark as her body loosens into drifting embers and ash-light.

Y el momento de decisión de Hollow Orbit, una vez que el Coro ha reconstruido el motor y ha puesto su precio:

[SHOT h6 — cockpit conflict]
ACTION AND DIALOGUE: 0-1.5s IVAR slams the console. IVAR, raw: "We fly OUT."
1.5-3.5s LENA, steady, terrified, lip-synced: "Only a mind can hold the helm
it's offering. A machine can't carry it." 3.5-5s: hold on the two-shot, storm
light flaring between them, neither blinking.

Ambas líneas son cortas a propósito: un primer plano, una cláusula, las palabras exactas entre comillas y una línea de Audio: que solo lleva voz y sonido diegético. La instrucción "sin banda sonora" no es una decoración, es lo que hace posible la siguiente sección.

La música se mantiene fuera del modelo

H3 renderiza el diálogo, el ambiente y los efectos en la generación, lo que significa que una banda sonora integrada en el mismo pase competiría con la pista de diálogo dentro del propio audio del modelo. Mantenemos la música completamente fuera y la tratamos como un problema de mezcla.

Banda sonora en postproducción, no en el "prompt"

Las bases instrumentales se generan por separado con nuestro modelo de música y se mezclan bajo el diálogo en ffmpeg, con sidechain-ducking para que la base baje cada vez que un personaje habla. Cada línea de Audio: en un prompt de toma solo lista sonido diegético — voces, viento, zumbido del casco. La música nunca entra en la generación.

Lo que cuesta ejecutar

EtapaCómo se ejecutó
Renderizado de tomas16 tomas — 8 por película, 5 segundos cada una, un prompt estructurado por toma
HardwareNuestra propia pila de GPU: un trabajador de GPU local, tomas renderizadas secuencialmente
Tiempo por tomaAproximadamente 4–10 minutos por toma de 5 segundos
Consistencia del personajeBloque IDENTITY LOCK repetido textualmente en cada prompt
DiálogoEscrito en el prompt con la redacción exacta, generado y sincronizado con los labios por H3
MúsicaBases instrumentales de nuestro modelo de música, mezcladas bajo el diálogo en ffmpeg

La misma pila está abierta en el estudio: dirige tomas en /studio, puntúalas con el generador en /tools/music-generator y mantén todos los activos buscables en este sitio. Escribe un IDENTITY LOCK, pégalo en cada prompt textualmente, pon las palabras exactas habladas entre comillas y mantén la música fuera del modelo — ese es todo el método detrás de ambas películas.

Try these prompts on your own shot.

Every example on this page was generated with ManifoldGen. Open the Studio and run the same structure on your idea.

Open Studio