FramePack : diffusion vidéo pratique sur GPU grand public

Générez des vidéos complètes de 30 fps, image par image, sur ordinateurs portables et de bureau avec seulement 6 GB VRAM. Rejoignez des milliers de créateurs qui accélèrent déjà leur flux de travail avec FramePack.

Image vers 5 secondes (30fps, 150 images)

Tous les résultats sont calculés par un ordinateur portable RTX 3060 6GB avec la variante 13B HY. (Vidéos compressées avec h264crf18 pour tenir dans les dépôts GitHub.)

Image vers 60 secondes (30fps, 1800 images)

Tous les résultats sont calculés par un ordinateur portable RTX 3060 6GB avec la variante 13B HY. (Vidéos compressées avec h264crf18 pour tenir dans les dépôts GitHub.)

Pourquoi choisir FramePack ?

Faibles besoins en VRAM

Générez des vidéos de haute qualité avec seulement 6 GB de VRAM, ce qui le rend accessible aux ordinateurs portables et aux GPU économiques.

Vidéos complètes à 30 FPS

Créez des vidéos fluides de qualité professionnelle à 30 images par seconde, d'une durée maximale de 60 secondes.

Open source et extensible

Conçu pour les chercheurs et les développeurs avec une base de code Python modulaire et facile à étendre.

À qui s'adresse FramePack ?

Créateurs de contenu

Créateurs de contenu

Donnez vie à vos images fixes avec FramePack pour des vidéos YouTube, TikTok et marketing en quelques minutes.

Chercheurs et développeurs

Chercheurs et développeurs

Testez rapidement de nouvelles idées de diffusion vidéo en étendant la base de code Python modulaire de FramePack.

Studios et agences

Studios et agences

Utilisez FramePack pour itérer sur les storyboards et les publicités dynamiques sans fermes de rendu coûteuses.

Des fonctionnalités FramePack que vous allez adorer

Performance optimisée

~2,5 s par image sur RTX 4090 (1,5 s avec optimisations) et proportionnellement efficace sur ordinateurs portables.

Sortie de haute qualité

Générez des vidéos de niveau professionnel avec un style cohérent et des transitions fluides.

Prise en charge multiplateforme

Entièrement pris en charge sur Linux, avec un package Windows en un clic bientôt disponible.

Communauté active

Rejoignez une communauté grandissante de créateurs et de chercheurs qui repoussent les limites de la génération vidéo IA.

Ce que disent les utilisateurs de FramePack

Utilisateur Reddit @ai_enthusiast

Utilisateur Reddit @ai_enthusiast

Enfin, une diffusion vidéo qui fonctionne sur le GPU 8 GB de mon ordinateur portable ! FramePack est aussi rapide que Stable Diffusion pour les images.

FAQ de FramePack

Les cartes RTX 30-, 40- et 50-series avec prise en charge FP16/BF16. Les cartes d'entrée de gamme peuvent fonctionner mais ne sont pas testées.

Installation

Nous recommandons d'avoir un Python 3.10 indépendant.

pip install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cu126
pip install -r requirements.txt

Pour démarrer l'interface graphique, exécutez :

python demo_gradio.py

Notez qu'il prend en charge --share, --port, --server, etc.

Le logiciel prend en charge l'attention PyTorch, xformers, flash-attn, sage-attention. Par défaut, il utilise simplement l'attention PyTorch. Vous pouvez installer ces kernels d'attention si vous savez comment faire.

Par exemple, pour installer sage-attention (linux) :

pip install sageattention==1.0.6

Cependant, il est fortement recommandé d'essayer d'abord sans sage-attention car cela influence les résultats, bien que l'influence soit minime.

Guide de rédaction des prompts

Une rédaction efficace des prompts est essentielle pour obtenir des résultats optimaux avec FramePack. Les directives suivantes vous aideront à créer des prompts qui génèrent des animations vidéo de haute qualité à partir de vos images.

Modèle de prompt recommandé

Pour des résultats cohérents, nous recommandons d'utiliser le modèle d'instructions ChatGPT suivant pour générer des prompts axés sur le mouvement :

Vous êtes un assistant qui rédige des prompts courts et axés sur le mouvement pour animer des images. Lorsque l'utilisateur envoie une image, répondez par un prompt unique et concis décrivant le mouvement visuel (comme une activité humaine, des objets en mouvement ou des mouvements de caméra). Concentrez-vous uniquement sur la manière dont la scène pourrait prendre vie et devenir dynamique à l'aide de phrases brèves. Les mouvements plus amples et plus dynamiques (comme danser, sauter, courir, etc.) sont préférés aux mouvements plus petits ou plus subtils (comme rester debout, s'asseoir, etc.). Décrivez d'abord le sujet, puis le mouvement, puis les autres éléments. Par exemple : "La fille danse avec grâce, des mouvements précis, plein de charme." S'il y a quelque chose qui peut danser (comme un homme, une fille, un robot, etc.), préférez le décrire comme dansant. Restez dans la boucle : une image en entrée, un prompt de mouvement en sortie. N'expliquez pas, ne posez pas de questions et ne générez pas plusieurs options.

Exemple de sortie

Lorsque vous fournissez une image à ChatGPT avec les instructions ci-dessus, vous recevrez un prompt de mouvement concis tel que :

L'homme danse avec puissance, adoptant des poses nettes et glissant avec fluidité sur le sol réfléchissant.

Rédiger vos propres prompts

Vous pouvez également élaborer vos propres prompts en suivant ces principes :

  • Gardez les prompts concis et axés sur le mouvement
  • Structure : sujet → mouvement → détails supplémentaires
  • Privilégiez les mouvements dynamiques aux poses statiques
  • Soyez précis sur la qualité du mouvement (avec grâce, puissance, etc.)

Exemples de prompts personnalisés efficaces :

La fille danse avec grâce, des mouvements précis, plein de charme.
L'homme danse avec puissance, des mouvements précis, plein d'énergie.