FramePack: Difusión práctica de vídeo en GPU de consumo

Genera vídeos completos de 30 fps, fotograma a fotograma, en portátiles y ordenadores de escritorio con solo 6 GB VRAM. Únete a miles de creadores que ya aceleran su flujo de trabajo con FramePack.

De imagen a 5 segundos (30fps, 150 fotogramas)

Todos los resultados se han generado con un portátil RTX 3060 6GB con la variante 13B HY. (Vídeos comprimidos con h264crf18 para caber en los repositorios de GitHub.)

De imagen a 60 segundos (30fps, 1800 fotogramas)

Todos los resultados se han generado con un portátil RTX 3060 6GB con la variante 13B HY. (Vídeos comprimidos con h264crf18 para caber en los repositorios de GitHub.)

¿Por qué elegir FramePack?

Bajos requisitos de VRAM

Genera vídeos de alta calidad con solo 6GB de VRAM, lo que lo hace accesible para portátiles y GPU económicas.

Vídeos completos de 30 FPS

Crea vídeos fluidos y de calidad profesional a 30 fotogramas por segundo, de hasta 60 segundos de duración.

Código abierto y extensible

Diseñado para investigadores y desarrolladores con una base de código Python modular y fácil de ampliar.

¿Para quién es FramePack?

Creadores de contenido

Creadores de contenido

Da vida a imágenes estáticas con FramePack para vídeos de YouTube, TikTok y marketing en cuestión de minutos.

Investigadores y desarrolladores

Investigadores y desarrolladores

Crea prototipos de nuevas ideas de difusión de vídeo rápidamente ampliando la base de código Python modular de FramePack.

Estudios y agencias

Estudios y agencias

Usa FramePack para iterar guiones gráficos y anuncios dinámicos sin granjas de renderizado costosas.

Características de FramePack que te encantarán

Rendimiento optimizado

~2.5s por fotograma en RTX 4090 (1.5s con optimizaciones) y proporcionalmente eficiente en portátiles.

Salida de alta calidad

Genera vídeos de nivel profesional con un estilo consistente y transiciones fluidas.

Compatibilidad multiplataforma

Totalmente compatible con Linux; el paquete de un clic para Windows llegará pronto.

Comunidad activa

Únete a una comunidad creciente de creadores e investigadores que amplían los límites de la generación de vídeo con IA.

Lo que dicen los usuarios de FramePack

Usuario de Reddit @ai_enthusiast

Usuario de Reddit @ai_enthusiast

¡Por fin, difusión de vídeo que funciona en la GPU de mi portátil de 8 GB! FramePack es tan ágil como Stable Diffusion para imágenes.

Preguntas frecuentes sobre FramePack

Tarjetas de las series RTX 30, 40 y 50 con soporte FP16/BF16. Las tarjetas de gama inferior pueden funcionar, pero no están probadas.

Instalación

Recomendamos tener un Python 3.10 independiente.

pip install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cu126
pip install -r requirements.txt

Para iniciar la interfaz gráfica, ejecuta:

python demo_gradio.py

Ten en cuenta que admite --share, --port, --server, etcétera.

El software admite la atención de PyTorch, xformers, flash-attn y sage-attention. De forma predeterminada, solo usa la atención de PyTorch. Puedes instalar esos kernels de atención si sabes cómo hacerlo.

Por ejemplo, para instalar sage-attention (linux):

pip install sageattention==1.0.6

Sin embargo, te recomendamos encarecidamente probar primero sin sage-attention, ya que influye en los resultados, aunque la influencia sea mínima.

Guía para escribir prompts

Escribir prompts eficaces es esencial para conseguir resultados óptimos con FramePack. Las siguientes pautas te ayudarán a crear prompts que generen animaciones de vídeo de alta calidad a partir de tus imágenes.

Plantilla de prompt recomendada

Para obtener resultados consistentes, recomendamos usar la siguiente plantilla de instrucciones para ChatGPT con el fin de generar prompts centrados en el movimiento:

Eres un asistente que escribe prompts cortos y centrados en el movimiento para animar imágenes. Cuando el usuario envíe una imagen, responde con un único prompt conciso que describa el movimiento visual (como actividad humana, objetos en movimiento o movimientos de cámara). Concéntrate solo en cómo la escena podría cobrar vida y volverse dinámica usando frases breves. Se prefieren los movimientos más grandes y dinámicos (como bailar, saltar, correr, etc.) frente a los más pequeños o sutiles (como quedarse quieto, sentarse, etc.). Describe primero el sujeto, luego el movimiento y después otras cosas. Por ejemplo: "La chica baila con gracia, con movimientos claros, llena de encanto." Si hay algo que pueda bailar (como un hombre, una chica, un robot, etc.), prefiere describirlo bailando. Mantente en un bucle: una imagen de entrada, un prompt de movimiento de salida. No expliques, no hagas preguntas ni generes varias opciones.

Ejemplo de salida

Cuando le proporciones una imagen a ChatGPT con las instrucciones anteriores, recibirás un prompt de movimiento conciso como este:

El hombre baila con potencia, marcando poses precisas y deslizándose con suavidad por el suelo reflectante.

Escribe tus propios prompts

También puedes crear tus propios prompts siguiendo estos principios:

  • Mantén los prompts concisos y centrados en el movimiento
  • Estructúralos así: sujeto → movimiento → detalles adicionales
  • Prioriza los movimientos dinámicos sobre las poses estáticas
  • Sé específico sobre la calidad del movimiento (con gracia, con potencia, etc.)

Ejemplos de prompts personalizados eficaces:

La chica baila con gracia, con movimientos claros, llena de encanto.
El hombre baila con potencia, con movimientos claros, lleno de energía.