PRODUCT UPDATE · August 25, 2026 · 6 MIN READ

Od Pozy do Wiedźmy: Sześć Nowych Sposobów Kontroli Wideo AI

Przekształć zwykły materiał filmowy w sygnał kontrolny pozy, głębi, krawędzi, linii lub maski, a następnie wygeneruj go ponownie jako nową postać lub świat. Wprowadziliśmy sześć narzędzi kontrolnych wideo MiniMax H3 i przetestowaliśmy pełną ścieżkę z rzeczywistym renderem od pozy do wiedźmy.

Wideo-do-wideo zazwyczaj wymaga od jednego modelu zachowania wszystkiego i zmiany wszystkiego naraz. Dlatego silne przeniesienie stylu może zgubić chód, spłaszczyć ruch kamery lub powoli zastąpić wykonawcę inną osobą. Nasze nowe narzędzia kontrolne H3 dzielą problem na dwie części: najpierw wyodrębniają istotną część klipu źródłowego, a następnie wykorzystują ten sygnał do kierowania nową generacją.

Uruchomiliśmy sześć ukierunkowanych przepływów pracy — Canny, Głębia, HED, MLSD, Poza i Inpainting wideo — na modelu MiniMax-H3-Fun KontrolaNet Union. Każde narzędzie akceptuje normalne wideo źródłowe. ManifoldGen automatycznie przygotowuje odpowiednie przejście kontrolne, lub możesz wyłączyć przetwarzanie wstępne i przesłać wideo kontrolne przygotowane gdzie indziej.

Test: zamień występ w leśną wiedźmę

Do testu uruchomienia użyliśmy krótkiego klipu sterującego pozami i poprosiliśmy o pełnowymiarową leśną wiedźmę w warstwowych szmaragdowych szatach, ze srebrnymi włosami i w oświetlonym księżycem starożytnym lesie. Wynik zachowuje oryginalny występ i synchronizację rąk, jednocześnie zastępując osobę, garderobę, oświetlenie i lokalizację.

REAL LAUNCH RENDER — POSE CONTROL

INPUT

Source performance / pose control

PROMPT

A powerful forest witch performing the movement, full body, layered emerald robes and leather corset, silver hair, magical particles around her hands, moonlit ancient forest, cinematic fantasy realism

OUTPUT — GENERATED WITH MANIFOLDGEN

Wynik leśnej wiedźmy — wygenerowany na produkcyjnym kontrolerze H3 · 2.3s

To jest rzeczywisty wynik produkcyjny, a nie makieta koncepcyjna. Kontrola pozy przenosi ruch ciała; prompt kontroluje nowy temat i świat.

Której kontroli powinieneś użyć?

KontrolaCo zachowujeNajlepsze zastosowanie
PozaStawy ciała, gesty i synchronizacja ruchuZastąp spacerowicza, tancerza lub aktora magiem, stworzeniem lub nową postacią
GłębiaŚcieżka kamery, odległość, warstwy przestrzenne i objętość obiektuOdbuduj lokalizację, zachowując oryginalny ruch 3D
CannyWyraźne sylwetki i ostre krawędzieTransformacje graficzne, produkty, pojazdy i wyraźnie zarysowane obiekty
HEDMiękkie kontury i wewnętrzne detale organiczneTwarze, tkaniny, stworzenia, ilustracje i ekspresyjne kształty
MLSDDominujące linie proste i geometria perspektywicznaArchitektura, pomieszczenia, ulice, plany filmowe i zaprojektowane środowiska
InpaintingWszystko poza dostarczoną maskąZastąp garderobę lub rekwizyty, usuń obiekty lub dodaj zlokalizowane efekty

Użyteczne rozróżnienie to to, czego nie możesz sobie pozwolić stracić. Wybierz Pozę, gdy występ jest święty, Głębokość, gdy kamera i objętość mają znaczenie, Canny dla odważnego kształtu, HED dla subtelnego konturu i MLSD dla skonstruowanej geometrii. Użyj Inpainting, gdy większość kadru jest już poprawna i tylko jeden obszar powinien się zmienić.

Wystarczy zwykłe wideo

Nie musisz uruchamiać OpenPoza, estymatora głębi ani detektora krawędzi przed przesłaniem. Pozostaw włączoną opcję „Wyodrębnij kontrolę z mojego normalnego wideo”, a worker wygeneruje czasowo wyrównane wideo kontrolne przed generacją. Zaawansowani użytkownicy mogą wyłączyć ten przełącznik, aby bezpośrednio wysłać już przygotowany pass Canny, Głębia, HED, MLSD lub Poza.

Inpainting wymaga jednego dodatkowego pliku

Prześlij klip źródłowy i pasujące wideo z maską. Białe obszary są regenerowane w czasie; czarne obszary pozostają zakotwiczone w oryginale. Stabilna maska zapewnia bardziej stabilną edycję.

Ustawienia, które mają znaczenie

  • Siła kontroli decyduje o tym, jak ściśle nowe ujęcie podąża za przewodnikiem. Zacznij od wartości domyślnej; zmniejsz ją dla większej zmiany kreatywnej i zwiększ, gdy ruch lub geometria zaczynają się rozjeżdżać.
  • Promptuj zamiennik, a nie źródło. Opisz nowy obiekt, garderobę, środowisko, światło, materiały i pożądane wykończenie.
  • Użyj seeda podczas porównywania promptów lub wartości siły. Utrzymywanie go na stałym poziomie ułatwia ocenę wpływu zmienionego ustawienia.
  • Zacznij od 480p na krótkim fragmencie. Gdy ruch i kadrowanie działają, przejdź do 576p lub 720p i wyrenderuj dłuższy klip.

Narzędzia startowe akceptują klipy do 15 sekund, z możliwością wyboru długości wyjściowej 3, 5, 8, 10 i 15 sekund. Rozdzielczości to 480p, 576p i 720p. Generowanie odbywa się jako trwałe zadanie asynchroniczne, więc długie renderowanie nie zależy od utrzymywania otwartego żądania przeglądarki.

Ceny w momencie uruchomienia

Przed wygenerowaniem strona wyświetla szacunkową cenę na podstawie czasu trwania i rozdzielczości. W momencie uruchomienia, przybliżone ceny dla 480p to 1,16 $ za 3 sekundy, 1,44 $ za 5 sekund, 1,88 $ za 8 sekund i 2,88 $ za 15 sekund. Renderowanie w 576p kosztuje około 1,35 razy więcej niż szacunkowa cena dla 480p, a w 720p około 2 razy więcej. Ostateczna opłata jest ustalana na podstawie rzeczywistego czasu pracy GPU, więc płacisz za wykorzystane zasoby obliczeniowe, a nie za zawyżony, stały limit.

Prototypuj krótko, finalizuj w wysokiej jakości

Generowanie wideo z kontrolą stylu to praca wymagająca dużej ilości pamięci GPU. Przetestuj prompt i siłę kontroli na najkrótszym użytecznym fragmencie w 480p, a następnie zainwestuj w ostateczny czas trwania i rozdzielczość, gdy ruch będzie odpowiedni.

Dostępność i licencja modelu

Te sześć narzędzi korzysta z licencji społecznościowej MiniMax H3. Obecnie są one niedostępne w Stanach Zjednoczonych, Unii Europejskiej, Wielkiej Brytanii i Korei Południowej. Narzędzie sprawdza terytorium przed generowaniem i wymaga akceptacji licencji w interfejsie. Jeśli narzędzie jest dostępne w Twojej lokalizacji, zapoznaj się z załączoną licencją modelu, aby poznać ograniczenia dotyczące Twojego użytkowania.

Co stworzyć najpierw

Zacznij od czystego, czytelnego występu: jedna osoba idąca, tańcząca, rzucająca zaklęcie lub obracająca się w kadrze. Przepuść to przez Poza i opisz postać, której sylwetka może wiarygodnie naśladować ten ruch — wiedźmę, opancerzonego rycerza, leśnego ducha lub stylizowaną istotę. Następnie użyj tego samego źródła przez Głębia lub HED. Zobaczenie, jakie informacje zachowuje każda kontrola, to najszybszy sposób na zrozumienie sześciu narzędzi i często ujawnia silniejsze rozwiązanie niż to, które planowałeś.

Try these prompts on your own shot.

Every example on this page was generated with ManifoldGen. Open the Studio and run the same structure on your idea.

Open Studio