Krita AI Diffusion
Plug-in open source pour intégrer aux capacités de génération et d’édition de modèles de diffusion dans Krita
Étiquettes :Outils d’image IA couramment utilisésQu’est-ce que Krita AI Diffusion ?
Krita AI Diffusion est un plugin open source qui intègre directement l’IA générative dans le flux de travail de dessin de Krita. Les artistes peuvent continuer à utiliser les pinceaux, calques, zones de sélection, masques et outils de couleur de Krita, tout en ayant accès, depuis la barre latérale, à la génération d’images à partir de texte, au redessin local, à l’agrandissement, au contrôle des images de référence, au dessin en temps réel et à l’ultra-résolution.
Le plugin ne met pas en œuvre directement de grands modèles de diffusion, mais se connecte au backend de ComfyUI. Le backend peut être déployé localement à l’aide du guide d’installation, fonctionner sur un autre ordinateur ou serveur, ou encore utiliser le service GPU cloud Interstice.
Cette architecture permet de garder l’interface à l’intérieur de Krita, tout en conservant la possibilité de choisir entre un modèle local et des ressources de calcul à distance.
Génération d’images par IA et création sur toile
L’utilisateur saisit des prompts positifs et négatifs, choisit le style et le modèle de base, puis peut générer une image dans la zone du tableau de dessin actuel. Le résultat est ajouté au document sous forme de calque Krita, ce qui permet de continuer à dessiner à la main, de modifier les formes, d’ajuster les couleurs et de combiner des éléments, au lieu de ne pouvoir télécharger que le produit final depuis une page web indépendante.
La génération de prompts ne peut pas garantir une précision textuelle, des mains complexes ou une cohérence des personnages. Pour les projets professionnels, il convient de conserver les modèles, LoRA, seeds, paramètres de sampling et les fichiers sources de Krita afin de pouvoir les reproduire et les modifier.
Redessin partiel du district électoral
Après avoir délimité une zone à l’aide de l’outil de sélection aléatoire de Krita, on peut utiliser Fill pour ajouter des éléments, supprimer du contenu ou régénérer une partie de l’image. Le contexte aide l’IA à comprendre les couleurs, la perspective et la structure environnantes, ce qui est idéal pour corriger les visages, remplacer les vêtements, ajouter des accessoires et nettoyer l’image.
Les bords de la masque, le contexte et l’intensité influencent la transition. Lorsque de petites régions se trouvent sur un canvas très grand, il convient de fournir à l’IA suffisamment de contexte et de les traiter par étapes, afin d’éviter des ruptures de texture ou des changements de proportion.
Agrandissement de l’image et extension de la toile
Après avoir agrandi la toile, il suffit de sélectionner une zone vide pour que l’IA complète les bords ; c’est idéal pour transformer une image carrée en affiche horizontale, combler le corps d’une personne ou étendre l’arrière-plan. L’agrandissement devine du contenu en dehors de l’image originale et ne peut pas restituer la véritable zone de prise de vue.
Affiner la génération d’image
Refine interprète à nouveau les images existantes en ajustant l’intensité. Une faible intensité améliore principalement les textures et les détails, tandis qu’une forte intensité modifie la forme et la composition.
Les artistes peuvent guider l’IA pas à pas à l’aide de croquis manuels, plutôt que de générer directement l’image finale.
Le précision progressive est le mode de fonctionnement principal des plugins : on dessine d’abord les formes générales et les couleurs, puis on augmente la résolution et les détails localement, ce qui est généralement plus maîtrisable que de régénérer à plusieurs reprises l’ensemble du tableau à haute résolution.
Peinture en direct
La peinture en direct lit en continu la toile actuelle ou une zone spécifiée, interprétant en temps réel les traits du utilisateur pour former une image plus complète. Elle est idéale pour trouver la composition, les jeux de lumière et d’ombre, les matériaux et l’orientation des personnages, et les modifications du pinceau permettent d’obtenir rapidement un retour de l’IA.
Le mode en temps réel exige beaucoup de la carte graphique et de la vitesse de génération. En cas de délai trop élevé, il est possible de réduire la résolution, le nombre d’étapes ou d’utiliser des modèles plus rapides, puis d’effectuer un affinage en haute qualité une fois la direction déterminée.
Aide à la segmentation des régions
Regions permet de définir des prompts indépendants pour différentes zones de l’image, par exemple en utilisant des descriptions distinctes pour les personnages, le fond et les vêtements. Une fois les régions associées aux calques de Krita, l’utilisateur peut contrôler plus précisément les scènes à plusieurs éléments, au lieu de rassembler toutes les exigences dans un seul prompt.
Une superposition régionale ou des bordures trop rigides peuvent provoquer des conflits ; il convient de les ajuster en utilisant des masques doux, l’ordre des calques et des indications globales.
Contrôle précis avec ControlNet
Le plugin prend en charge les directions ControlNet telles que le graffiti, les lignes de contour, les bords Canny, la posture, la profondeur, les normales et la segmentation. L’utilisateur peut générer un graphique de contrôle à partir de la couche actuelle ou importer des références externes afin de contrôler la composition, les contours, la posture humaine et les relations spatiales.
Le modèle de contrôle doit être compatible avec l’architecture du modèle de base. ControlNet de SDXL ne peut pas être utilisé directement avec Flux ; une combinaison de modèles incorrecte peut entraîner un échec de chargement ou des résultats hors contrôle.
Figure de référence et adaptateur IP
Les images de référence peuvent guider le style, la composition, ainsi que les caractéristiques des personnages et des objets. Des capacités comme l’IP-Adapter permettent de maintenir une direction visuelle plus facilement que les simples prompts, mais un poids de référence trop élevé peut entraver la variation et même reproduire les défauts de l’entrée.
Lors de l’utilisation de personnes réelles, de marques, de personnages ou d’œuvres d’autrui, il convient de vérifier la portée de l’autorisation ; on ne doit pas confondre la possibilité technique de s’y référer avec l’obtention automatique de droits commerciaux.
Modèle de base pris en charge
| Architecture du modèle | Caractéristiques | Remarques sur les ressources et les licences |
|---|---|---|
| Flux 2 | Compréhension du texte et qualité d’image élevées, idéal pour une génération de haute qualité moderne. | Les exigences en termes de mémoire et de capacité de stockage sont élevées, et les différentes versions ne sont pas nécessairement entièrement ouvertes à un usage commercial. |
| Z-Image | Taille moyenne, orientation Turbo offrant vitesse et qualité réaliste | Il est nécessaire d’installer un modèle correspondant à la charge de travail et à l’éscalabilité. |
| Stable Diffusion XL | Maturité écologique, une grande variété de LoRA, ControlNet et modèles de style | Consomme généralement plus de mémoire vidéo que le SD 1.5 |
| Stable Diffusion 1.5 | Besoins en ressources faibles, modèle de contrôle et ressources communautaires abondantes | La résolution de base et la compréhension du texte sont inférieures à celles de la nouvelle architecture. |
| Illustrious | Adapté à l’illustration et à l’univers anime | LoRA et le modèle de contrôle doivent correspondre à l’infrastructure de base respective. |
Les architectures prises en charge par les plugins évoluent avec les mises à jour de version. Chaque Checkpoint, LoRA, ControlNet et IP-Adapter possède sa propre licence, ses mots déclencheurs et ses exigences en ressources ; il ne faut pas se baser uniquement sur la licence GPL du plugin pour déterminer l’autorisation commerciale de la création de contenu.
Style et LoRA
Style permet de sauvegarder les modèles de base, les templates de prompts, les paramètres d’échantillonnage et les combinaisons de modèles étendus, afin de reutiliser une direction visuelle cohérente dans les projets. LoRA peut être téléchargée sur un backend local ou distant via le choix d’un fichier, et il est possible de définir des mots déclencheurs ainsi qu’une intensité par défaut.
L’empilement de plusieurs LoRA peut entrer en interférence les uns avec les autres et augmenter l’utilisation de la mémoire vidéo. Pour une production professionnelle, il convient de conserver pour chaque style des combinaisons éprouvées ainsi que des exemples d’images.
Sur-résolution et traitement par blocs
Upscale peut utiliser des modèles d’upscaling pour augmenter la taille de l’image, et il est possible de choisir « Refine upscaled image » pour compléter les détails à l’aide de modèles de diffusion. Les grandes images sont divisées en tiles pour être traitées par blocs, afin d’éviter d’épuiser la mémoire vidéo d’un coup.
Les blocs peuvent présenter des joints, des textures répétées et des variations de style locales. Il convient d’examiner attentivement les visages, le texte et les motifs géométriques à l’agrandissement.
Modification des modèles d’édition et des instructions de texte
Les modèles d’édition compatibles permettent de modifier des images par une description textuelle, par exemple en ajustant la lumière, les couleurs, les vêtements ou les objets. Les modèles d’édition réduisent le nombre d’étapes nécessaires pour créer des masques manuels, mais peuvent également modifier des zones que l’utilisateur n’a pas demandées ; ils sont donc adaptés pour être testés d’abord sur une couche de copie.
Comparaison des méthodes de connexion et des coûts
| Mode de connexion | Coût du logiciel | Coûts principaux | Adéquat pour les utilisateurs |
|---|---|---|---|
| Installation automatique du backend local par le plugin | Gratuit | GPU propre, électricité, stockage et téléchargement de modèles | Utilisateurs individuels souhaitant simplifier l’installation et travailler hors ligne |
| Connecter ComfyUI existant | Gratuit | Maintenance autonome des nœuds, des modèles et de la compatibilité des versions | Il ya déjà des utilisateurs avancés de l’environnement ComfyUI |
| Création autonome de ComfyUI à distance | Extension gratuite | Coûts des serveurs ou GPU en cloud, sécurité et maintenance | Partage des ressources de calcul entre plusieurs appareils ou équipes |
| Interstice Cloud | Facturation selon le modèle de compte de service cloud | Génération et stockage de GPU dans le cloud, le montant est indiqué sur la page de facturation du service. | Utilisateurs sans carte graphique locale adaptée ou souhaitant commencer rapidement |
Krita et ses plugins sont tous deux disponibles gratuitement. Il n’y a pas de frais de abonnement officiel pour la version locale, mais le téléchargement des modèles nécessite généralement au moins 10 GB ; il n’est pas rare que l’installation de plusieurs modèles optionnels dépasse 50 GB.
Le montant actuel d’Interstice Cloud n’est pas affiché de manière stable dans le manuel public ; il convient de se connecter à la page du service pour vérifier le forfait, les quotas et les taxes régionales.
Guide d’installation
- Installez d’abord une version compatible de Krita.
- Téléchargez le paquet compressé du plugin depuis la version officielle sur GitHub, et ne téléchargez pas directement une capture du code source du dépôt à la place du paquet de publication.
- Utilisez l’importateur de plugins Python dans Krita pour installer et redémarrer le logiciel.
- Activez le panneau AI Image Generation dans Dockers de Settings.
- Cliquez sur Configure, puis choisissez l’installation automatique d’un backend local, la connexion à un ComfyUI existant, un serveur distant ou un service cloud.
- Téléchargez les charges de travail de base et les modèles optionnels selon les besoins, et testez d’abord avec des documents en faible résolution.
Matériel et plateforme locaux
L’interface des plugins fonctionne sous Windows, Linux et macOS, tandis que la liste des plateformes prises en charge par le backend de ComfyUI continue d’évoluer. Le projet teste principalement en continu les GPU NVIDIA sur Windows et Linux, qui constituent généralement la solution locale la plus stable.
La disponibilité d’AMD, d’Apple Silicon et d’autres backends dépend de PyTorch, de ComfyUI et de l’architecture du modèle. En cas de mémoire vidéo insuffisante, il est possible de réduire la taille de la toile, du batch et du modèle, ou d’utiliser une GPU à distance.
Seule la vitesse de la CPU est généralement lente.
Précautions concernant Flatpak et AppImage
Le sandbox de Krita pour Linux Flatpak peut empêcher l’installation de certains paquets backend ; le manuel officiel recommande plutôt d’utiliser AppImage lorsque une installation automatique locale est nécessaire. Il est également possible d’installer les backends dans un répertoire distinct et de se connecter par réseau.
Personnalisé compatible avec ComfyUI
Les utilisateurs avancés peuvent se connecter à leur propre serveur ComfyUI, mais les plugins utilisent des conventions spécifiques de nœuds et de flux de travail. Une erreur est générée lorsque les versions des composants ComfyUI, comfyui-tooling-nodes et comfyui-inpaint-nodes ne sont pas compatibles.
Après la mise à niveau du plugin, il convient de vérifier le backend en même temps.
Ce n’est pas un front-end universel qui affiche directement n’importe quel graphe de nœuds ComfyUI dans Krita. Les nœuds personnalisés ne pourraient pas être appelés par les workflows de plugins, et une version fonctionnelle fixe doit être utilisée en environnement de production.
Sécurité de l’accès à distance
ComfyUI à distance ne doit pas être exposé sur Internet sans authentification. Le déploiement en équipe nécessite un proxy inversé, HTTPS, une authentification, un pare-feu, des limites de taille de fichier et un répertoire de travail indépendant.
Le téléchargement de modèles et les nœuds personnalisés ne doivent être autorisés que depuis des sources fiables.
Confidentialité et données
Le backend local permet de conserver les prompts, la toile de dessin et le modèle sur son propre appareil. Le mode distant ou cloud envoie les images et paramètres nécessaires au serveur ; il convient de vérifier les politiques de conservation des données, d’utilisation pour l’entraînement et de suppression des services cloud avant de traiter des matériaux clients sensibles.
Licence open source
Krita AI Diffusion est licencié sous la licence GPL-3.0-or-later ; le code source, les problèmes signalés et les versions publiées sont tous accessibles dans le dépôt officiel GitHub. Krita lui-même est également un logiciel open source, mais les nœuds personnalisés de ComfyUI, les poids des modèles et les services cloud sont soumis à leurs propres licences respectives.
La création d’une image ne devient pas automatiquement une œuvre sous GPL simplement en utilisant un plugin GPL, mais son utilisation commerciale reste soumise au modèle, à LoRA, aux matériaux d’entrée et aux lois locales.
Guide d'utilisation de Krita AI Diffusion
Créer des flux de travail professionnels réutilisables
- Établir une liste des couleurs de la marque, des polices, de la composition et des éléments interdits ;
- Tester séparément la génération d’images à partir de texte et la création sur toile, la redessinée locale des zones sélectionnées ainsi que l’agrandissement d’images et l’extension de la toile ;
- Comparer la qualité, la vitesse et le coût à l’aide du même ensemble d’échantillons représentatifs ;
- Confier la retouche manuelle des bords complexes, du texte et des images de produits clés ;
- Uniformiser la nomenclature, les dimensions et l’état d’audit ;
- Traiter et publier en lot après un contrôle aléatoire ;
À qui s’adresse-t-il ?
- Illustrateurs qui souhaitent utiliser l’IA directement dans Krita ;
- Créateurs qui ont besoin d’une combinaison de dessin manuel et de réparation locale générative ;
- Utilisateurs de dessin local utilisant Flux, SDXL ou des modèles d’anime ;
- Concepteurs qui ont besoin de ControlNet, de prompts par zone et de contrôle via des images de référence ;
- Les équipes qui disposent déjà d’un serveur ComfyUI et souhaitent se connecter à un tableau de travail professionnel ;
- Utilisateurs qui accordent de l’importance à la confidentialité hors ligne et au code source ouvert.
Avantages principaux
- Les résultats de l’IA sont directement intégrés au flux de travail des calques et des zones de sélection dans Krita ;
- Libre et open source, possibilité de choisir un backend local, distant ou cloud ;
- Prend en charge plusieurs architectures de modèles de diffusion modernes et classiques ;
- Couvre la redessin local, l’agrandissement, la peinture en temps réel et l’ultra-résolution ;
- Fournit le contrôle ControlNet, les images de référence, les régions et le contrôle LoRA ;
- Conserver les outils de peinture numérique traditionnels pour des retouches manuelles.
Restrictions et précautions
- Les modèles locaux consomment beaucoup d’espace disque et de mémoire vidéo, et leur installation ainsi que leur compatibilité avec les versions sont plus complexes que celles des outils purement web.
- Les plugins, ComfyUI, les nœuds et les modèles doivent être mis à jour en même temps ; les performances et la stabilité sur les plateformes autres que NVIDIA varient considérablement.
- Les sorties d’IA peuvent encore présenter des erreurs de structure, de texte et de cohérence ;
- Le logiciel open source ne signifie pas que le modèle peut être utilisé librement à des fins commerciales, ni que les services cloud de tiers sont gratuits ou que les données restent entièrement locales ;
Questions fréquentes
Krita AI Diffusion est-il gratuit ?
Les plugins et l’exécution locale sont gratuits et open source ; le matériel propre, les GPU cloud ou Interstice Cloud entraînent des coûts correspondants.
Faut-il installer ComfyUI ?
Il est nécessaire de se connecter à un backend compatible, mais il est possible de laisser le plugin s’installer automatiquement, ou de se connecter à un ComfyUI existant ou distant, sans avoir à manipuler manuellement l’interface des nœuds.
Est-ce que cela prend en charge Flux et SDXL ?
Il prend en charge des architectures telles que Flux 2, Z-Image, SD 1.5, SDXL et Illustrious ; les fonctionnalités exactes dépendent de la version du plugin et des modèles installés.
Est-il possible de redessiner localement et d’agrandir l’image ?
Oui, les masques de Krita peuvent être utilisés directement pour créer des remplissages, supprimer des objets et étendre la toile.
Est-ce que c’est compatible avec macOS et AMD ?
L’interface des plugins prend en charge les plateformes courantes, mais les performances et la compatibilité du backend local dépendent de ComfyUI, PyTorch et du matériel ; Windows et Linux sous NVIDIA constituent les principaux chemins d’essai.
Le plugin est-il open source ?
Logiciel open source, sous licence GPL-3.0-or-later.
Numéro d’enregistrement de sécurité publique du Guangxi : 45132202000164