FramePack: Difusão de Vídeo Prática em GPUs de Consumo

Gere vídeos completos a 30 fps, fotograma a fotograma, em computadores portáteis e de secretária com apenas 6 GB VRAM. Junte-se a milhares de criadores que já aceleram o seu fluxo de trabalho com o FramePack.

Imagem para 5 Segundos (30fps, 150 fotogramas)

Todos os resultados foram calculados por um computador portátil RTX 3060 6GB com a variante 13B HY. (Vídeos comprimidos com h264crf18 para caberem nos repositórios do GitHub.)

Imagem para 60 Segundos (30fps, 1800 fotogramas)

Todos os resultados foram calculados por um computador portátil RTX 3060 6GB com a variante 13B HY. (Vídeos comprimidos com h264crf18 para caberem nos repositórios do GitHub.)

Porquê escolher o FramePack?

Requisitos Reduzidos de VRAM

Gere vídeos de alta qualidade com apenas 6GB de VRAM, tornando-o acessível para computadores portáteis e GPUs económicas.

Vídeos Completos a 30 FPS

Crie vídeos suaves e de qualidade profissional a 30 fotogramas por segundo, até 60 segundos de duração.

Código Aberto e Extensível

Desenvolvido para investigadores e programadores com uma base de código modular em Python, fácil de estender.

Para quem é o FramePack?

Criadores de Conteúdo

Criadores de Conteúdo

Dê vida a imagens estáticas com o FramePack para vídeos do YouTube, TikTok e de marketing em minutos.

Investigadores e Programadores

Investigadores e Programadores

Teste rapidamente novas ideias de difusão de vídeo estendendo a base de código modular em Python do FramePack.

Estúdios e Agências

Estúdios e Agências

Use o FramePack para iterar storyboards e anúncios dinâmicos sem dispendiosas infraestruturas de renderização.

Funcionalidades do FramePack que vai adorar

Desempenho Otimizado

Cerca de 2,5 s por fotograma numa RTX 4090 (1,5 s com otimizações) e eficiente de forma proporcional em computadores portáteis.

Resultados de Alta Qualidade

Gere vídeos de qualidade profissional com estilo consistente e transições suaves.

Suporte Multiplataforma

Totalmente suportado em Linux, com um pacote de instalação num clique para Windows a chegar em breve.

Comunidade Ativa

Junte-se a uma comunidade crescente de criadores e investigadores a alargar as fronteiras da geração de vídeo com IA.

O que dizem os utilizadores do FramePack

Utilizador do Reddit @ai_enthusiast

Utilizador do Reddit @ai_enthusiast

Finalmente, difusão de vídeo que funciona na GPU de 8 GB do meu portátil! O FramePack é tão ágil como o Stable Diffusion para imagens.

Perguntas Frequentes sobre o FramePack

Placas das séries RTX 30-, 40- e 50- com suporte FP16/BF16. Placas de gama inferior podem funcionar, mas não foram testadas.

Instalação

Recomendamos ter um Python 3.10 independente.

pip install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cu126
pip install -r requirements.txt

Para iniciar a interface gráfica, execute:

python demo_gradio.py

Tenha em conta que suporta --share, --port, --server, entre outros.

O software suporta atenção PyTorch, xformers, flash-attn, sage-attention. Por predefinição, utiliza apenas a atenção PyTorch. Pode instalar esses kernels de atenção se souber como.

Por exemplo, para instalar o sage-attention (linux):

pip install sageattention==1.0.6

No entanto, é altamente recomendado experimentar primeiro sem sage-attention, pois pode influenciar os resultados, embora essa influência seja mínima.

Orientações para Prompts

Um prompting eficaz é essencial para obter os melhores resultados com o FramePack. As seguintes orientações ajudá-lo-ão a criar prompts que geram animações de vídeo de alta qualidade a partir das suas imagens.

Modelo de Prompt Recomendado

Para resultados consistentes, recomendamos usar o seguinte modelo de instrução do ChatGPT para gerar prompts focados no movimento:

És um assistente que escreve prompts curtos e focados no movimento para animar imagens. Quando o utilizador enviar uma imagem, responde com um único prompt conciso que descreva o movimento visual (como atividade humana, objetos em movimento ou movimentos de câmara). Foca-te apenas em como a cena poderia ganhar vida e tornar-se dinâmica usando frases breves. Movimentos maiores e mais dinâmicos (como dançar, saltar, correr, etc.) são preferidos em relação aos mais pequenos ou subtis (como ficar parado, sentado, etc.). Descreve primeiro o sujeito, depois o movimento e, por fim, outros aspetos. Por exemplo: "A rapariga dança graciosamente, com movimentos nítidos, cheia de encanto." Se houver algo que possa dançar (como um homem, uma rapariga, um robô, etc.), prefere descrevê-lo a dançar. Mantém-te em ciclo: uma imagem entra, um prompt de movimento sai. Não expliques, não faças perguntas nem geras múltiplas opções.

Exemplo de Saída

Ao fornecer uma imagem ao ChatGPT com as instruções acima, receberá um prompt de movimento conciso, como:

O homem dança com força, marcando poses precisas e deslizando com suavidade pelo chão refletor.

Escrever os Seus Próprios Prompts

Também pode criar os seus próprios prompts seguindo estes princípios:

  • Mantenha os prompts concisos e focados no movimento
  • Estruture como: sujeito → movimento → detalhes adicionais
  • Dê prioridade aos movimentos dinâmicos em vez de poses estáticas
  • Seja específico sobre a qualidade do movimento (graciosamente, com força, etc.)

Exemplos de prompts personalizados eficazes:

A rapariga dança graciosamente, com movimentos nítidos, cheia de encanto.
O homem dança com força, com movimentos nítidos, cheio de energia.