Fooocus
Mettre en avant des conseils d’utilisation et des outils de dessin IA open source générés localement
Étiquettes :Génération d’illustrations d’images par l’IAQu’est-ce que Fooocus ?
Fooocus est un outil de dessin IA gratuit, open source et fonctionnant en mode hors ligne sur le poste local. Basé sur Stable Diffusion XL, il simplifie les paramètres et les processus d’optimisation automatique, permettant aux utilisateurs de se concentrer principalement sur les prompts et le contenu visuel, sans avoir à maîtriser au préalable des samplers complexes, des diagrammes de nœuds ou des configurations de flux de travail.
La seule plateforme officielle de publication pour Fooocus est le dépôt GitHub géré par lllyasviel. De nombreux domaines indépendants portant le nom Fooocus sur Internet ne sont pas des sites officiels et peuvent offrir des services de hébergement, de abonnement ou de téléchargement tiers.
Les instructions de téléchargement et d’installation, les informations sur les versions ainsi que les annonces de sécurité doivent se référer au dépôt officiel.
État de maintenance actuel
Fooocus est actuellement en phase de support à long terme limité ; les équipes officielles se concentrent principalement sur la correction des erreurs et ne développent plus activement de nouvelles fonctionnalités majeures. Le projet est entièrement basé sur SDXL, et il n’y a pour l’instant aucun plan pour migrer vers ou intégrer de nouvelles architectures de modèles comme Flux.
Cela ne signifie pas que les fonctionnalités existantes ne peuvent pas être utilisées. Les utilisateurs qui ont besoin d’une génération locale stable de SDXL, d’une interface simple et d’un processus d’édition d’images mature peuvent toujours choisir Fooocus ;
Les utilisateurs qui souhaitent utiliser Flux, les modèles vidéo les plus récents ou l’automatisation de nœuds complexes trouveront plus adapté d’évaluer ComfyUI, WebUI Forge ou d’autres outils en développement continu.
Génération d’images à partir de texte et expansion automatique des prompts
Après que l’utilisateur ait saisi des instructions en langage naturel, des images SDXL peuvent être générées. Fooocus gère automatiquement une partie du échantillonnage, de la résolution, du chargement du modèle et des paramètres de qualité, et propose des paramètres courants tels que le style, la taille de l’image, le nombre d’images, la qualité et les instructions négatives.
Fooocus V2 utilisera un modèle GPT-2 local pour développer les prompts, ajoutant des détails visuels à des descriptions succinctes. Ce processus peut se faire hors ligne, mais le développement automatique n’est pas nécessairement adapté à chaque identité de marque ou personnage.
Lorsqu’une reproduction stable est nécessaire, il convient de conserver les prompts complets, la graine, le modèle, LoRA ainsi que les informations de version.
Préreglages de style et contrôle des prompts
Le système de style intégré permet d’appliquer rapidement des styles visuels tels que la photographie, le cinéma, l’illustration ou les anime, et prend en charge des prompts multi-lignes, des prompts négatifs ainsi qu’une syntaxe de poids. Par exemple, augmenter le poids d’un concept peut rendre les caractéristiques du sujet plus visibles.
Les préréglages conviennent pour une exploration rapide, mais la superposition de plusieurs styles peut entraîner des conflits. La cohérence du personnage, l’exactitude du texte, les détails des mains et les relations spatiales complexes nécessitent encore une génération répétée, des corrections locales ou l’aide d’images de référence.
Comparaison entre la version officielle et les préférences
| Version ou préréglage | Frais | Direction par défaut | Maintenance et scénarios d’application |
|---|---|---|---|
| Version locale officielle de Fooocus | Gratuit | Flux de travail local complet basé sur SDXL | Soutien officiel limité à long terme, se limitant aux correctifs de bugs |
| Préférences générales | Gratuit | Utilisation par défaut de la direction JuggernautXL v8 | Idéal pour la photographie générale, les illustrations conceptuelles et les illustrations |
| Préreglage réaliste | Gratuit | Utilisation par défaut de la direction realisticStockPhoto v2.0 | Idéal pour les personnes à l’aspect photographique et les scènes réalistes |
| Préférences d’animation Anime | Gratuit | Utilisation par défaut de la direction animaPencilXL v5 | Conçu pour les personnages 2D et les illustrations d’anime |
| Branche communautaire | Généralement gratuit ou tarifé par l’hébergeur | Possibilité d’ajouter des fonctions de contrôle ou de nouveaux modèles | Projet non officiel, les mises à jour, la sécurité et la compatibilité doivent être vérifiées indépendamment. |
Fooocus ne propose pas de abonnement cloud officiel, de forfaits de points ou de plans d’entreprise. Le coût du logiciel local est nul, mais les cartes graphiques, l’électricité, le stockage et l’hébergement de GPU tiers entraînent des dépenses.
Les frais de tout site en ligne portant le même nom ne représentent pas les prix officiels de Fooocus.
Variantes d’image et agrandissement
Avec « Upscale ou Variation » dans l’image d’entrée, il est possible de créer des variantes légères ou fortes à partir d’une image existante, ainsi que de l’agrandir de 1,5 fois ou de 2 fois. Les variantes légères restent plus proches de l’image originale, tandis que les variantes fortes interprètent à nouveau davantage les formes et les détails.
L’amélioration par l’IA ne se limite pas à l’interpolation traditionnelle ; elle peut redessiner les textures, les traits du visage et le texte. Les documents, les détails des produits, les logos ainsi que les images nécessitant une cohérence au niveau des pixels doivent être vérifiés un par un après la génération.
Redessin local et agrandissement
Inpaint permet aux utilisateurs de masquer les zones à modifier, puis de remplacer des objets, de corriger des visages, d’ajuster des vêtements ou d’éliminer des défauts à l’aide de prompts. Outpaint peut étendre le tableau de travail vers le haut, vers le bas, vers la gauche et vers la droite, permettant à l’IA de compléter le contenu en dehors du cadre.
Fooocus utilise son propre algorithme de redessin local et son modèle de contrôle. Lors de la première utilisation des fonctionnalités correspondantes, un patch de redessin local d’environ 1,28 GB sera téléchargé en plus, il convient donc de prévoir de l’espace réseau et sur disque.
Les images aux contours complexes, à la perspective stricte ou aux structures continues à travers plusieurs régions peuvent nécessiter de multiples masques et des synthèses post-production.
Image de référence pour le prompt
L’image prompt peut servir de référence pour guider la composition, les caractéristiques des personnages, le style ou la structure locale, et offre une capacité de contrôle orientée vers ControlNet. Plus l’intensité de la référence est élevée, plus le résultat est généralement proche de l’image d’entrée, mais cela peut également limiter les variations créatives ou amplifier les défauts de l’image originale.
Lors de l’utilisation de photos réelles, de matériel de marque et de personnages protégés par des droits d’auteur, l’utilisateur doit s’assurer des droits de portrait, des marques déposées et des autorisations nécessaires pour entraîner le modèle ; les outils de génération ne obtiennent pas automatiquement d’autorisations commerciales.
FaceSwap : changement de visage
L’intégration Fooocus, basée sur FaceSwap de InsightFace, permet d’appliquer les caractéristiques faciales de référence à l’image générée. Elle convient aux avatars créatifs et aux esquisses de personnages, mais les profils latéraux, les obstacles, les conditions lumineuses particulières et les différences d’âge peuvent réduire la similarité.
Il est interdit de créer des contenus d’identité trompeurs sans consentement. Lorsqu’il s’agit de personnes réelles, de publicités, de publications médiatiques ou à des fins commerciales, une autorisation explicite doit être obtenue et les informations relatives au traitement par l’IA doivent être indiquées.
Décrire la description déduite à partir de l’image
La fonction « Describe » peut analyser une image et générer une description en langage naturel ou des prompts adaptés à la création graphique, ce qui facilite la compréhension des éléments de l’image, permet de reconstituer rapidement des orientations similaires ou de créer des variantes. Le résultat obtenu est une synthèse de l’image par le modèle ; il ne restitue pas les prompts complets de l’auteur original, ni le modèle et ses paramètres.
Amélioration intelligente
La fonction Enhance peut utiliser des techniques de détection et de segmentation ciblées pour localiser dynamiquement des régions, puis affiner ou réparer les objets spécifiés. Le processus associé, en combinant les capacités de GroundingDINO et de SAM, est adapté pour améliorer les visages, les mains, les vêtements ou des objets locaux.
La détection automatique peut entraîner des omissions, des sélectionnements erronés ou des modifications des caractéristiques originales. Avant le traitement en masse, il convient d’abord de tester la portée du masque, les prompts d’amélioration et leur intensité à l’aide d’images représentatives.
LoRA, Embedding et modèles
Fooocus prend en charge les modèles SDXL, LoRA et Embedding, et permet également de configurer plusieurs dossiers de modèles ainsi que d’utiliser des ressources SDXL compatibles provenant de plateformes comme Civitai. LoRA est idéal pour compléter les personnages, les vêtements, le style et les concepts d’objets, tandis qu’Embedding est souvent utilisé pour contrôler les prompts ou les concepts négatifs.
Chaque modèle et LoRA dispose d’une licence indépendante ; la licence logicielle open source ne confère pas automatiquement le droit d’utiliser le modèle à des fins commerciales. Lors du téléchargement de modèles tiers, il convient également de faire attention aux fichiers malveillants, aux mots déclencheurs, aux versions du modèle de base et aux poids de recommandation.
Jokers et modifications en masse
Les wildcards peuvent remplacer aléatoirement des éléments dans un lexique, tandis que le traitement de tableaux et LoRA intégré aident les utilisateurs à générer des combinaisons de vêtements, de couleurs, d’objectifs et de personnages. Il convient bien à l’exploration de l’inspiration et à la création de matériel en masse, mais le nombre de combinaisons augmente rapidement ; il convient donc de contrôler l’échelle des tâches et de noter les paramètres qui fonctionnent bien.
Guide d’installation de Windows
- Accédez à la page de publication depuis le seul dépôt GitHub officiel et téléchargez le fichier compressé pour Windows.
- Décompressez le fichier complètement dans un répertoire ayant un chemin court et suffisamment d’espace.
- Exécutez run.bat pour démarrer les préférences générales ; utilisez le fichier de démarrage correspondant lorsque vous avez besoin des modèles par défaut en style anime ou réaliste.
- Lors du premier démarrage, le modèle SDXL sera téléchargé automatiquement ; une fois ce processus terminé, l’interface locale s’ouvrira dans le navigateur.
- Avant de générer, vérifiez le modèle, la taille de l’image, la qualité et le répertoire de sortie ; commencez d’abord par tester avec un petit nombre d’images.
Les fichiers de modèles téléchargés pour la première fois sont volumineux ; les logiciels antivirus, les proxies, les droits d’accès au disque ou des interruptions de connexion peuvent entraîner un échec du démarrage. Ne téléchargez pas de programmes réempaquetés depuis des sites aux noms similaires et non fiables.
Linux, macOS et Docker
Linux permet d’installer les dépendances et de démarrer l’environnement Python 3.10 selon les instructions officielles, et prend également en charge le déploiement via Docker. Les Mac Apple Silicon peuvent fonctionner avec PyTorch MPS, mais il s’agit d’une méthode non couverte par les guides officiels, et la vitesse est généralement inférieure à celle d’une carte graphique NVIDIA indépendante.
Pour les cartes graphiques AMD, on peut essayer DirectML sous Windows, et ROCm sous Linux ; il s’agit de solutions dont la compatibilité et les performances restent incertaines. La possibilité de fonctionner dépend de la carte graphique, des pilotes, du système ainsi que de la version de PyTorch.
Références aux exigences matérielles
| Équipement | Configuration de référence minimale | Explication |
|---|---|---|
| Série NVIDIA RTX 20 et ultérieures | 4 Go de mémoire vidéo, 8 Go de mémoire vive et espace d’échange activé | Direction préférée par les officiels : plus la mémoire vidéo est importante, mieux c’est pour les hautes résolutions et de multiples images. |
| Série NVIDIA GTX 10 | Il est généralement recommandé 8 Go de mémoire vidéo. | Vitesse et compatibilité limitées pour les architectures plus anciennes |
| Windows AMD | Environ 8 Go de mémoire vidéo | Lors des tests avec DirectML, la vitesse est généralement plus lente. |
| Linux AMD | Environ 8 Go de mémoire vidéo | Dans la direction ROCm, aucune évaluation d’intensité équivalente n’a été effectuée. |
| Apple Silicon | M1 ou M2 ainsi que la mémoire unifiée disponible | Fonctionnel, mais avec une vitesse inférieure aux cartes graphiques NVIDIA indépendantes grand public |
| Seulement CPU | Environ 32 GB de mémoire | On peut essayer, mais la vitesse de génération est très lente. |
Les besoins réels dépendent également de la résolution, du nombre d’unités par lot, du zoom, de ControlNet et de la taille du modèle. Le système doit utiliser des pilotes compatibles avec la version actuelle de PyTorch ; il ne convient pas de suivre les recommandations relatives aux anciennes versions de pilotes.
Téléchargement du modèle et espace disque
Les préreglages général, réaliste et anime téléchargeront des modèles SDXL différents, tandis que les fonctionnalités de redessin local, d’agrandissement, de détection de cible et de segmentation téléchargeront également des fichiers supplémentaires selon les besoins. Pour une utilisation complète, il convient de réserver des dizaines de GB d’espace et d’éviter de placer le répertoire des modèles sur un disque système à capacité insuffisante.
Accès au réseau local et sécurité
Les paramètres de démarrage permettent à l’interface d’écouter les adresses du réseau local, ou d’utiliser la fonction de partage de Gradio. Dans les deux cas, aucune authentification n’est prévue par défaut, et elles ne doivent pas être mises en ligne directement sur Internet.
Lorsqu’un accès à distance est nécessaire, il convient d’activer l’authentification de base auth.json, en combinaison avec un pare-feu, un proxy inversé, HTTPS et un contrôle d’accès.
Le téléchargement de fichiers, de modèles et d’extensions peut engendrer des risques. Dans un environnement multi-utilisateurs, il est nécessaire d’isoler les dossiers de sortie, de restreindre les sources de téléchargement, de mettre à jour régulièrement les dépendances et d’éviter d’exécuter avec des droits administrateurs.
Licence open source
Le code Fooocus est licencié sous la licence GPL-3.0. Lors de la modification et de la distribution du programme, il est nécessaire de respecter les exigences de la GPL concernant le code source et la licence.
Les images générées par logiciel ne deviennent pas automatiquement des œuvres sous licence GPL simplement en utilisant Fooocus, mais les droits sur ces images dépendent encore du matériel d’entrée, de la licence du modèle, de la licence LoRA et de la législation locale.
Guide d’utilisation de Fooocus
Créer des flux de travail professionnels réutilisables
- Établir une liste des couleurs de la marque, des polices, de la composition et des éléments interdits ;
- Tester séparément l’état actuel de maintenance, la génération d’images à partir de texte ainsi que l’élargissement automatique des prompts et les préférences de style et le contrôle des prompts ;
- Comparer la qualité, la vitesse et le coût à l’aide du même ensemble d’échantillons représentatifs ;
- Confier la retouche manuelle des bords complexes, du texte et des images de produits clés ;
- Uniformiser la nomenclature, les dimensions et l’état d’audit ;
- Traiter et publier en lot après un contrôle aléatoire ;
À qui s’adresse-t-il ?
- Débutants en génération d’images par IA souhaitant exécuter SDXL gratuitement localement ;
- Illustrateurs et créateurs de contenu qui ne souhaitent pas créer des diagrammes de nœuds complexes ;
- Utilisateurs ayant besoin de génération d’images à partir de texte, d’agrandissement d’images, de redessin local et d’zoom sur des images ;
- Utilisateurs individuels qui accordent de l’importance au traitement hors ligne et à la confidentialité des données ;
- Utilisateurs qui effectuent une génération légère avec des cartes graphiques NVIDIA à mémoire vidéo moyenne ou faible ;
- Équipes ayant besoin de créer rapidement des animations, des concepts réalistes et généraux.
Avantages principaux
- Gratuit, open source et fonctionne hors ligne ;
- L’interface et les paramètres sont plus faciles à maîtriser que les outils de nœuds complexes.
- Génération d’images, variations, agrandissement, redessin et extension sont regroupés dans une seule interface ;
- Fournit une expansion automatique des prompts, des préréglages de style et un contrôle de diverses images de référence ;
- Prend en charge LoRA, Embedding, FaceSwap et la description d’images ;
- Fournit la configuration minimale fonctionnelle pour les appareils NVIDIA avec 4 Go de mémoire vidéo.
Restrictions et précautions
- Le projet ne bénéficie actuellement que d’une maintenance à long terme limitée, le cœur étant réservé à SDXL, sans intégration native de nouvelles architectures telles que Flux ;
- Par rapport à ComfyUI, Fooocus est plus simple, mais il offre moins de possibilités de personnalisation des nœuds, d’automatisation et de contrôle avancé.
- La première téléchargement du fichier est volumineux, et les vitesses de fonctionnement d’AMD, Apple Silicon et CPU sont limitées ;
- Les résultats générés peuvent présenter des problèmes de cohérence en ce qui concerne les mains, le texte, la structure et les personnages ;
- L’utilisateur est responsable de vérifier lui-même les droits d’auteur, la sécurité et les licences commerciales concernant les modèles tiers, LoRA, les images de référence et les contenus en image réelle.
Questions fréquentes
Fooocus est-il gratuit ?
Gratuit. Le logiciel officiel local ne comporte ni abonnement, ni forfaits de points, ni services cloud payants ; les utilisateurs n’ont à assumer que les coûts de leur matériel, de leur stockage et d’électricité.
Quel est le site officiel de Fooocus ?
La seule source officielle est le dépôt GitHub géré par lllyasviel. Plusieurs domaines indépendants portant le même nom ont été clairement désignés par les autorités comme des sites non pertinents.
Fooocus prend-il en charge Flux ?
La version officielle n’est pas prise en charge. Le projet est basé sur SDXL, et il n’y a actuellement aucun plan pour migrer ou intégrer une nouvelle architecture de modèle.
Est-ce que 4 Go de mémoire vidéo suffisent ?
Les exigences minimales recommandées par NVIDIA sont de 4 Go de mémoire vidéo et 8 Go de mémoire vive, avec l’activation de l’espace d’échange, mais les résolutions élevées, de nombreuses images et une édition complexe augmentent considérablement la consommation de ressources.
Fooocus peut-il redessiner localement et agrandir l’image ?
Oui, cela prend en charge le redessin local masqué et l’extension de la toile dans quatre directions ; un fichier de modèle de redessin local supplémentaire sera téléchargé la première fois que vous l’utiliserez.
Fooocus est-il open source ?
Logiciel open source, le code est soumis à la licence GPL-3.0 ; les modèles, LoRA et les éléments d’entrée sont quant à eux soumis à des licences distinctes.
Numéro d’enregistrement de sécurité publique du Guangxi : 45132202000164