FramePack: Praktyczna dyfuzja wideo na konsumenckich kartach graficznych

Generuj filmy pełnej długości w 30 fps, klatka po klatce, na laptopach i komputerach stacjonarnych, mając jedynie 6 GB VRAM. Dołącz do tysięcy twórców, którzy już przyspieszają swoją pracę dzięki FramePack.

Z obrazu do 5 sekund (30fps, 150 klatek)

Wszystkie wyniki zostały wygenerowane na laptopie z kartą RTX 3060 6GB i wariantem 13B HY. (Filmy skompresowano przez h264crf18, aby zmieściły się w repozytoriach GitHub.)

Z obrazu do 60 sekund (30fps, 1800 klatek)

Wszystkie wyniki zostały wygenerowane na laptopie RTX 3060 6GB z wariantem 13B HY. (Filmy skompresowano przez h264crf18, aby zmieściły się w repozytoriach GitHub.)

Dlaczego warto wybrać FramePack?

Niskie wymagania VRAM

Generuj filmy wysokiej jakości przy zaledwie 6GB VRAM, dzięki czemu jest to dostępne na laptopach i budżetowych kartach graficznych.

Pełnej długości filmy w 30 FPS

Twórz płynne filmy o profesjonalnej jakości przy 30 klatkach na sekundę, o długości do 60 sekund.

Otwarte źródło i rozszerzalność

Stworzony dla naukowców i programistów dzięki modułowej bazie kodu w Pythonie, którą łatwo rozszerzać.

Dla kogo jest FramePack?

Twórcy treści

Twórcy treści

Ożywiaj nieruchome obrazy za pomocą FramePack, aby w kilka minut tworzyć filmy na YouTube, TikTok i materiały marketingowe.

Naukowcy i programiści

Naukowcy i programiści

Szybko prototypuj nowe pomysły na dyfuzję wideo, rozszerzając modułową bazę kodu FramePack w Pythonie.

Studia i agencje

Studia i agencje

Korzystaj z FramePack, aby iterować storyboardy i dynamiczne reklamy bez kosztownych farm renderujących.

Funkcje FramePack, które pokochasz

Zoptymalizowana wydajność

~2.5s na klatkę na RTX 4090 (1.5s z optymalizacjami) i proporcjonalnie wydajny na laptopach.

Wyniki wysokiej jakości

Generuj filmy klasy profesjonalnej ze spójnym stylem i płynnymi przejściami.

Obsługa wielu platform

W pełni obsługiwany na Linux, a pakiet instalacyjny jednym kliknięciem dla Windows pojawi się wkrótce.

Aktywna społeczność

Dołącz do rosnącej społeczności twórców i naukowców przesuwających granice generowania wideo AI.

Co mówią użytkownicy FramePack

Użytkownik Reddita @ai_enthusiast

Użytkownik Reddita @ai_enthusiast

Wreszcie dyfuzja wideo, która działa na mojej karcie GPU w laptopie z 8 GB! FramePack działa równie sprawnie jak Stable Diffusion w przypadku obrazów.

Najczęściej zadawane pytania o FramePack

Karty RTX 30-, 40- i 50-series z obsługą FP16/BF16. Karty niższej klasy mogą działać, ale nie zostały przetestowane.

Instalacja

Zalecamy posiadanie niezależnej instalacji Python 3.10.

pip install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cu126
pip install -r requirements.txt

Aby uruchomić GUI, wykonaj:

python demo_gradio.py

Pamiętaj, że obsługuje ono flagi --share, --port, --server i tym podobne.

Oprogramowanie obsługuje atencję PyTorch, xformers, flash-attn, sage-attention. Domyślnie będzie po prostu używać atencji PyTorch. Możesz zainstalować te jądra atencji, jeśli wiesz, jak to zrobić.

Na przykład, aby zainstalować sage-attention (linux):

pip install sageattention==1.0.6

Zdecydowanie zalecamy jednak najpierw spróbować bez sage-attention, ponieważ wpływa ono na wyniki, choć ten wpływ jest minimalny.

Wskazówki dotyczące promptów

Skuteczne tworzenie promptów jest niezbędne do osiągnięcia optymalnych wyników z FramePack. Poniższe wskazówki pomogą Ci tworzyć prompty, które generują wysokiej jakości animacje wideo z Twoich obrazów.

Zalecany szablon prompta

Aby uzyskać spójne wyniki, zalecamy użycie poniższego szablonu instrukcji dla ChatGPT do generowania promptów skupionych na ruchu:

Jesteś asystentem, który pisze krótkie prompty skupione na ruchu, służące do animowania obrazów. Gdy użytkownik wyśle obraz, odpowiedz pojedynczym, zwięzłym promptem opisującym ruch wizualny (takim jak aktywność ludzka, poruszające się obiekty czy ruchy kamery). Skup się wyłącznie na tym, jak scena mogłaby ożyć i stać się dynamiczna, używając krótkich fraz. Większe i bardziej dynamiczne ruchy (takie jak taniec, skakanie, bieganie itp.) są preferowane nad mniejszymi i bardziej subtelnymi (takimi jak stanie w miejscu, siedzenie itp.). Opisz najpierw obiekt, potem ruch, a następnie pozostałe elementy. Na przykład: "Dziewczyna tańczy z wdziękiem, z wyraźnymi ruchami, pełna uroku." Jeśli na obrazie jest coś, co może tańczyć (mężczyzna, dziewczyna, robot itp.), opisz to raczej jako tańczące. Pozostań w pętli: jeden obraz na wejściu, jeden prompt ruchu na wyjściu. Nie wyjaśniaj, nie zadawaj pytań ani nie generuj wielu opcji.

Przykładowy wynik

Gdy przekażesz obraz do ChatGPT z powyższymi instrukcjami, otrzymasz zwięzły prompt ruchu, taki jak:

Mężczyzna tańczy energicznie, przyjmując wyraziste pozy i płynnie sunąc po odblaskowej podłodze.

Tworzenie własnych promptów

Możesz też tworzyć własne prompty, kierując się następującymi zasadami:

  • Zachowuj prompty zwięzłe i skupione na ruchu
  • Buduj według schematu: obiekt → ruch → dodatkowe szczegóły
  • Przedkładaj dynamiczne ruchy nad statyczne pozy
  • Określaj konkretnie jakość ruchu (z wdziękiem, energicznie itp.)

Przykłady skutecznych własnych promptów:

Dziewczyna tańczy z wdziękiem, z wyraźnymi ruchami, pełna uroku.
Mężczyzna tańczy energicznie, z wyraźnymi ruchami, pełen energii.