PRODUCT UPDATE · August 25, 2026 · 6 MIN READ

De Pose a Bruxa: Seis Novas Formas de Controloooar Vídeos de IA

Transforme filmagens comuns num sinal de controlo de pose, profundidade, contorno, linha ou máscara, e depois regenere-o como um novo personagem ou mundo. Lançámos seis ferramentas de controlo de vídeo MiniMax H3 e testámos o caminho completo com uma renderização real de pose-a-bruxa.

O vídeo-para-vídeo geralmente pede a um modelo para preservar tudo e mudar tudo ao mesmo tempo. É por isso que uma forte transferência de estilo pode perder a caminhada, achatar o movimento da câmara ou substituir lentamente o artista por uma pessoa diferente. As nossas novas ferramentas de controlo H3 dividem o problema em dois: primeiro, extraem a parte do clipe de origem que importa, depois usam esse sinal para guiar uma nova geração.

Lançámos seis fluxos de trabalho focados — Canny, Profundidade, HED, MLSD, Pose e Inpaintagem de Vídeo — no modelo ControloooNet Union MiniMax-H3-Fun. Cada ferramenta aceita um vídeo de origem normal. ManifoldGen prepara a passagem de controlo correta automaticamente, ou pode desativar o pré-processamento e carregar um vídeo de controlo que preparou noutro local.

O teste: transformar uma performance numa bruxa da floresta

Para o teste de lançamento, usámos um pequeno clipe de condução de pose e pedimos uma bruxa da floresta de corpo inteiro com vestes esmeralda em camadas, cabelo prateado e uma floresta antiga iluminada pela lua. O resultado mantém a performance de origem e o timing das mãos, enquanto substitui a pessoa, o guarda-roupa, a iluminação e o local.

REAL LAUNCH RENDER — POSE CONTROL

INPUT

Source performance / pose control

PROMPT

A powerful forest witch performing the movement, full body, layered emerald robes and leather corset, silver hair, magical particles around her hands, moonlit ancient forest, cinematic fantasy realism

OUTPUT — GENERATED WITH MANIFOLDGEN

Saída da bruxa da floresta — gerada no worker de controlo H3 de produção · 2.3s

Esta é a saída de produção real, não um conceito de maquete. O controlo de pose transporta a performance corporal; o prompt controla o novo sujeito e o mundo.

Que controlo deve usar?

ControloooO que preservaMelhor uso
PoseArticulações do corpo, gestos e timing da performanceSubstituir um caminhante, dançarino ou ator por um mago, criatura ou novo personagem
ProfundidadeCaminho da câmera, distância, camadas espaciais e volume do objetoReconstruir um local mantendo o movimento 3D original
CannySilhuetas fortes e contornos nítidosTransformações gráficas, produtos, veículos e objetos claramente delineados
HEDContornos mais suaves e detalhes orgânicos internosRostos, tecidos, criaturas, ilustrações e formas expressivas
MLSDLinhas retas dominantes e geometria de perspectivaArquitetura, cômodos, ruas, cenários e ambientes projetados
InpaintagemTudo fora de uma máscara fornecidaSubstituir guarda-roupa ou adereços, remover objetos ou adicionar efeitos localizados

A distinção útil é o que você não pode perder. Escolha Pose quando a performance é sagrada, Profundidade quando a câmera e o volume importam, Canny para formas ousadas, HED para contornos sutis e MLSD para geometria construída. Use Inpaintagem quando a maior parte do quadro já está correta e apenas uma região deve mudar.

Um vídeo normal é suficiente

Você não precisa executar OpenPose, um estimador de profundidade ou um detector de bordas antes de fazer o upload. Mantenha "Extrair controle do meu vídeo normal" ativado e o worker derivará um vídeo de controle temporalmente alinhado antes da geração. Usuários avançados podem desativar essa opção para enviar diretamente um passe Canny, Profundidade, HED, MLSD ou Pose já preparado.

Inpaintagem precisa de um arquivo extra

Faça o upload do clipe de origem e de um vídeo de máscara correspondente. As áreas brancas são regeneradas ao longo do tempo; as áreas pretas permanecem ancoradas ao original. Uma máscara estável produz uma edição mais estável.

Configurações que importam

  • A força do controle decide quão estritamente a nova cena segue o guia. Comece perto do padrão; diminua para uma mudança criativa maior e aumente quando o movimento ou a geometria começarem a desviar.
  • Sugira a substituição, não a fonte. Descreva o novo objeto, guarda-roupa, ambiente, luz, materiais e acabamento desejado.
  • Use uma seed ao comparar prompts ou valores de força. Mantê-la fixa facilita o julgamento do efeito de uma configuração alterada.
  • Comece em 480p em um trecho curto. Uma vez que o movimento e o enquadramento funcionem, passe para 576p ou 720p e renderize o clipe mais longo.

As ferramentas de lançamento aceitam clipes de até 15 segundos, com opções de saída de 3, 5, 8, 10 e 15 segundos. As resoluções são 480p, 576p e 720p. A geração é executada como um trabalho assíncrono durável, então uma renderização longa não depende de manter uma solicitação de navegador aberta.

Preços de lançamento

Antes de gerar, a página mostra uma estimativa baseada na duração e resolução. No lançamento, os preços aproximados para 480p são $1.16 para 3 segundos, $1.44 para 5 segundos, $1.88 para 8 segundos e $2.88 para 15 segundos. Uma renderização em 576p custa cerca de 1.35× a estimativa de 480p e 720p custa cerca de 2×. A cobrança final é definida pelo tempo de execução real da GPU, então você paga pelo processamento utilizado em vez de um teto fixo inflacionado.

Prototipe rápido, finalize com alta qualidade

A geração de vídeo com controle é um trabalho de GPU de alta memória. Teste o prompt e a força do controle na seção útil mais curta em 480p, depois invista na duração e resolução finais depois que o movimento estiver correto.

Disponibilidade e licença do modelo

Estas seis ferramentas usam a Licença Comunitária MiniMax H3. Atualmente, elas não estão disponíveis nos Estados Unidos, União Europeia, Reino Unido e Coreia do Sul. A ferramenta verifica o território antes da geração e exige a aceitação da licença na interface. Se a ferramenta estiver disponível onde você está, revise a licença do modelo vinculada para as restrições que se aplicam ao seu uso.

O que fazer primeiro

Comece com uma performance limpa e legível: uma pessoa andando, dançando, lançando ou virando no quadro. Execute-a através do Pose e descreva um personagem cuja silhueta possa plausivelmente seguir esse movimento — uma bruxa, cavaleiro blindado, espírito da floresta ou criatura estilizada. Em seguida, use a mesma fonte através do Profundidade ou HED. Ver qual informação cada controle preserva é a maneira mais rápida de entender as seis ferramentas, e muitas vezes revela um tratamento mais forte do que o planejado.

Try these prompts on your own shot.

Every example on this page was generated with ManifoldGen. Open the Studio and run the same structure on your idea.

Open Studio