De la pose à la sorcière : six nouvelles façons de contrôler la vidéo IA
Transformez des séquences ordinaires en un signal de contrôle de pose, de profondeur, de contour, de ligne ou masqué, puis régénérez-les en un nouveau personnage ou un nouveau monde. Nous avons lancé six outils de contrôle vidéo MiniMax H3 et testé le chemin complet avec un rendu réel de pose-à-sorcière.
La vidéo-vers-vidéo demande généralement à un modèle de tout préserver et de tout changer en même temps. C'est pourquoi un transfert de style puissant peut faire perdre la marche, aplatir le mouvement de la caméra ou remplacer lentement l'interprète par une personne différente. Nos nouveaux outils de contrôle H3 divisent le problème en deux : d'abord extraire la partie pertinente du clip source, puis utiliser ce signal pour guider une nouvelle génération.
Nous avons lancé six workflows ciblés — Canny, Profondeur, HED, MLSD, Pose et Inpainting vidéo — sur le modèle MiniMax-H3-Fun ContrôleNet Union. Chaque outil accepte une vidéo source normale. ManifoldGen prépare automatiquement le passage de contrôle correct, ou vous pouvez désactiver le prétraitement et télécharger une vidéo de contrôle que vous avez préparée ailleurs.
Le test : transformer une performance en sorcière de la forêt
Pour le test de lancement, nous avons utilisé un court clip de conduite de pose et demandé une sorcière de la forêt en corps entier, vêtue de robes émeraude superposées, de cheveux argentés, dans une forêt ancienne éclairée par la lune. Le résultat conserve la performance source et le timing des mains tout en remplaçant la personne, la garde-robe, l'éclairage et le lieu.
INPUT
Source performance / pose control
PROMPT
A powerful forest witch performing the movement, full body, layered emerald robes and leather corset, silver hair, magical particles around her hands, moonlit ancient forest, cinematic fantasy realismOUTPUT — GENERATED WITH MANIFOLDGEN
Sortie de la sorcière de la forêt — générée sur le worker de contrôle H3 de production · 2.3s
Ceci est le résultat de production réel, pas une maquette conceptuelle. Le contrôle de pose porte la performance corporelle ; le prompt contrôle le nouveau sujet et le monde.
Quel contrôle devriez-vous utiliser ?
| Contrôle | Ce qu'il préserve | Meilleure utilisation |
|---|---|---|
| Pose | Articulations du corps, gestes et timing de la performance | Remplacer un marcheur, un danseur ou un acteur par un mage, une créature ou un nouveau personnage |
| Profondeur | Trajectoire de la caméra, distance, couches spatiales et volume du sujet | Reconstruire un lieu en conservant le mouvement 3D original |
| Canny | Silhouettes fortes et bords nets | Transformations graphiques, produits, véhicules et sujets clairement délimités |
| HED | Contours plus doux et détails organiques internes | Visages, tissus, créatures, illustrations et formes expressives |
| MLSD | Lignes droites dominantes et géométrie en perspective | Architecture, pièces, rues, décors et environnements conçus |
| Inpainting | Tout ce qui se trouve en dehors d'un masque fourni | Remplacer des vêtements ou des accessoires, supprimer des objets ou ajouter des effets localisés |
La distinction utile est ce que vous ne pouvez pas vous permettre de perdre. Choisissez Pose lorsque la performance est sacrée, Profondeur lorsque la caméra et le volume comptent, Canny pour une forme audacieuse, HED pour un contour nuancé, et MLSD pour une géométrie construite. Utilisez Inpainting lorsque la majeure partie du cadre est déjà correcte et qu'une seule région doit changer.
Une vidéo normale suffit
Vous n'avez pas besoin d'exécuter OpenPose, un estimateur de profondeur ou un détecteur de contours avant de télécharger. Gardez l'option « Extraire le contrôle de ma vidéo normale » activée et le worker dérivera une vidéo de contrôle temporellement alignée avant la génération. Les utilisateurs avancés peuvent désactiver ce commutateur pour envoyer directement un passe Canny, Profondeur, HED, MLSD ou Pose déjà préparé.
Téléchargez le clip source et une vidéo de masque correspondante. Les zones blanches sont régénérées au fil du temps ; les zones noires restent ancrées à l'original. Un masque stable produit un montage plus stable.
Paramètres importants
- La force du contrôle détermine la rigueur avec laquelle le nouveau plan suit le guide. Commencez près de la valeur par défaut ; diminuez-la pour un changement créatif plus important et augmentez-la lorsque le mouvement ou la géométrie commence à dériver.
- Décrivez le remplacement, pas la source. Décrivez le nouveau sujet, les vêtements, l'environnement, la lumière, les matériaux et la finition souhaitée.
- Utilisez une graine lors de la comparaison des prompts ou des valeurs de force. La maintenir fixe facilite l'évaluation de l'effet d'un paramètre modifié.
- Commencez à 480p sur un court extrait. Une fois que le mouvement et le cadrage fonctionnent, passez à 576p ou 720p et rendez le clip plus long.
Les outils de lancement acceptent des clips jusqu'à 15 secondes, avec des options de sortie de 3, 5, 8, 10 et 15 secondes. Les résolutions sont 480p, 576p et 720p. La génération s'exécute comme une tâche asynchrone durable, de sorte qu'un rendu long ne dépend pas du maintien d'une requête de navigateur ouverte.
Tarifs de lancement
Avant de générer, la page affiche une estimation basée sur la durée et la résolution. Au lancement, les prix approximatifs en 480p sont de 1,16 $ pour 3 secondes, 1,44 $ pour 5 secondes, 1,88 $ pour 8 secondes et 2,88 $ pour 15 secondes. Un rendu en 576p coûte environ 1,35 fois l'estimation en 480p et en 720p environ 2 fois. Le coût final est ajusté en fonction du temps d'exécution réel du GPU, vous ne payez donc que pour la puissance de calcul utilisée plutôt qu'un plafond fixe gonflé.
La génération de vidéo de contrôle est un travail GPU gourmand en mémoire. Testez le prompt et la force du contrôle sur la section utile la plus courte en 480p, puis investissez dans la durée et la résolution finales une fois que le mouvement est correct.
Disponibilité et licence du modèle
Ces six outils utilisent la licence communautaire MiniMax H3. Ils ne sont actuellement pas disponibles aux États-Unis, dans l'Union européenne, au Royaume-Uni et en Corée du Sud. L'outil vérifie le territoire avant la génération et nécessite l'acceptation de la licence dans l'interface. Si l'outil est disponible là où vous vous trouvez, veuillez consulter la licence du modèle liée pour connaître les restrictions qui s'appliquent à votre utilisation.
Que faire en premier
Commencez par une performance propre et lisible : une personne marchant, dansant, lançant ou tournant dans le cadre. Passez-la par Pose et décrivez un personnage dont la silhouette peut plausiblement suivre ce mouvement — une sorcière, un chevalier en armure, un esprit de la forêt ou une créature stylisée. Ensuite, prenez la même source à travers Profondeur ou HED. Voir quelles informations chaque contrôle préserve est le moyen le plus rapide de comprendre les six outils, et révèle souvent un traitement plus fort que celui que vous aviez prévu.
Try these prompts on your own shot.
Every example on this page was generated with ManifoldGen. Open the Studio and run the same structure on your idea.