Od Pozy do Wiedźmy: Sześć Nowych Sposobów Kontroli Wideo AI
Przekształć zwykły materiał filmowy w sygnał kontrolny pozy, głębi, krawędzi, linii lub maski, a następnie wygeneruj go ponownie jako nową postać lub świat. Wprowadziliśmy sześć narzędzi kontrolnych wideo MiniMax H3 i przetestowaliśmy pełną ścieżkę z rzeczywistym renderem od pozy do wiedźmy.
Wideo-do-wideo zazwyczaj wymaga od jednego modelu zachowania wszystkiego i zmiany wszystkiego naraz. Dlatego silne przeniesienie stylu może zgubić chód, spłaszczyć ruch kamery lub powoli zastąpić wykonawcę inną osobą. Nasze nowe narzędzia kontrolne H3 dzielą problem na dwie części: najpierw wyodrębniają istotną część klipu źródłowego, a następnie wykorzystują ten sygnał do kierowania nową generacją.
Uruchomiliśmy sześć ukierunkowanych przepływów pracy — Canny, Głębia, HED, MLSD, Poza i Inpainting wideo — na modelu MiniMax-H3-Fun KontrolaNet Union. Każde narzędzie akceptuje normalne wideo źródłowe. ManifoldGen automatycznie przygotowuje odpowiednie przejście kontrolne, lub możesz wyłączyć przetwarzanie wstępne i przesłać wideo kontrolne przygotowane gdzie indziej.
Test: zamień występ w leśną wiedźmę
Do testu uruchomienia użyliśmy krótkiego klipu sterującego pozami i poprosiliśmy o pełnowymiarową leśną wiedźmę w warstwowych szmaragdowych szatach, ze srebrnymi włosami i w oświetlonym księżycem starożytnym lesie. Wynik zachowuje oryginalny występ i synchronizację rąk, jednocześnie zastępując osobę, garderobę, oświetlenie i lokalizację.
INPUT
Source performance / pose control
PROMPT
A powerful forest witch performing the movement, full body, layered emerald robes and leather corset, silver hair, magical particles around her hands, moonlit ancient forest, cinematic fantasy realismOUTPUT — GENERATED WITH MANIFOLDGEN
Wynik leśnej wiedźmy — wygenerowany na produkcyjnym kontrolerze H3 · 2.3s
To jest rzeczywisty wynik produkcyjny, a nie makieta koncepcyjna. Kontrola pozy przenosi ruch ciała; prompt kontroluje nowy temat i świat.
Której kontroli powinieneś użyć?
| Kontrola | Co zachowuje | Najlepsze zastosowanie |
|---|---|---|
| Poza | Stawy ciała, gesty i synchronizacja ruchu | Zastąp spacerowicza, tancerza lub aktora magiem, stworzeniem lub nową postacią |
| Głębia | Ścieżka kamery, odległość, warstwy przestrzenne i objętość obiektu | Odbuduj lokalizację, zachowując oryginalny ruch 3D |
| Canny | Wyraźne sylwetki i ostre krawędzie | Transformacje graficzne, produkty, pojazdy i wyraźnie zarysowane obiekty |
| HED | Miękkie kontury i wewnętrzne detale organiczne | Twarze, tkaniny, stworzenia, ilustracje i ekspresyjne kształty |
| MLSD | Dominujące linie proste i geometria perspektywiczna | Architektura, pomieszczenia, ulice, plany filmowe i zaprojektowane środowiska |
| Inpainting | Wszystko poza dostarczoną maską | Zastąp garderobę lub rekwizyty, usuń obiekty lub dodaj zlokalizowane efekty |
Użyteczne rozróżnienie to to, czego nie możesz sobie pozwolić stracić. Wybierz Pozę, gdy występ jest święty, Głębokość, gdy kamera i objętość mają znaczenie, Canny dla odważnego kształtu, HED dla subtelnego konturu i MLSD dla skonstruowanej geometrii. Użyj Inpainting, gdy większość kadru jest już poprawna i tylko jeden obszar powinien się zmienić.
Wystarczy zwykłe wideo
Nie musisz uruchamiać OpenPoza, estymatora głębi ani detektora krawędzi przed przesłaniem. Pozostaw włączoną opcję „Wyodrębnij kontrolę z mojego normalnego wideo”, a worker wygeneruje czasowo wyrównane wideo kontrolne przed generacją. Zaawansowani użytkownicy mogą wyłączyć ten przełącznik, aby bezpośrednio wysłać już przygotowany pass Canny, Głębia, HED, MLSD lub Poza.
Prześlij klip źródłowy i pasujące wideo z maską. Białe obszary są regenerowane w czasie; czarne obszary pozostają zakotwiczone w oryginale. Stabilna maska zapewnia bardziej stabilną edycję.
Ustawienia, które mają znaczenie
- Siła kontroli decyduje o tym, jak ściśle nowe ujęcie podąża za przewodnikiem. Zacznij od wartości domyślnej; zmniejsz ją dla większej zmiany kreatywnej i zwiększ, gdy ruch lub geometria zaczynają się rozjeżdżać.
- Promptuj zamiennik, a nie źródło. Opisz nowy obiekt, garderobę, środowisko, światło, materiały i pożądane wykończenie.
- Użyj seeda podczas porównywania promptów lub wartości siły. Utrzymywanie go na stałym poziomie ułatwia ocenę wpływu zmienionego ustawienia.
- Zacznij od 480p na krótkim fragmencie. Gdy ruch i kadrowanie działają, przejdź do 576p lub 720p i wyrenderuj dłuższy klip.
Narzędzia startowe akceptują klipy do 15 sekund, z możliwością wyboru długości wyjściowej 3, 5, 8, 10 i 15 sekund. Rozdzielczości to 480p, 576p i 720p. Generowanie odbywa się jako trwałe zadanie asynchroniczne, więc długie renderowanie nie zależy od utrzymywania otwartego żądania przeglądarki.
Ceny w momencie uruchomienia
Przed wygenerowaniem strona wyświetla szacunkową cenę na podstawie czasu trwania i rozdzielczości. W momencie uruchomienia, przybliżone ceny dla 480p to 1,16 $ za 3 sekundy, 1,44 $ za 5 sekund, 1,88 $ za 8 sekund i 2,88 $ za 15 sekund. Renderowanie w 576p kosztuje około 1,35 razy więcej niż szacunkowa cena dla 480p, a w 720p około 2 razy więcej. Ostateczna opłata jest ustalana na podstawie rzeczywistego czasu pracy GPU, więc płacisz za wykorzystane zasoby obliczeniowe, a nie za zawyżony, stały limit.
Generowanie wideo z kontrolą stylu to praca wymagająca dużej ilości pamięci GPU. Przetestuj prompt i siłę kontroli na najkrótszym użytecznym fragmencie w 480p, a następnie zainwestuj w ostateczny czas trwania i rozdzielczość, gdy ruch będzie odpowiedni.
Dostępność i licencja modelu
Te sześć narzędzi korzysta z licencji społecznościowej MiniMax H3. Obecnie są one niedostępne w Stanach Zjednoczonych, Unii Europejskiej, Wielkiej Brytanii i Korei Południowej. Narzędzie sprawdza terytorium przed generowaniem i wymaga akceptacji licencji w interfejsie. Jeśli narzędzie jest dostępne w Twojej lokalizacji, zapoznaj się z załączoną licencją modelu, aby poznać ograniczenia dotyczące Twojego użytkowania.
Co stworzyć najpierw
Zacznij od czystego, czytelnego występu: jedna osoba idąca, tańcząca, rzucająca zaklęcie lub obracająca się w kadrze. Przepuść to przez Poza i opisz postać, której sylwetka może wiarygodnie naśladować ten ruch — wiedźmę, opancerzonego rycerza, leśnego ducha lub stylizowaną istotę. Następnie użyj tego samego źródła przez Głębia lub HED. Zobaczenie, jakie informacje zachowuje każda kontrola, to najszybszy sposób na zrozumienie sześciu narzędzi i często ujawnia silniejsze rozwiązanie niż to, które planowałeś.
Try these prompts on your own shot.
Every example on this page was generated with ManifoldGen. Open the Studio and run the same structure on your idea.