Krita AI Diffusion
Offener Plugin für Krita, das die Fähigkeiten zur Erstellung und Bearbeitung mit Diffusionsmodellen bereitstellt
Tags:Häufig verwendete AI-BildwerkzeugeWas ist Krita AI Diffusion?
Krita AI Diffusion ist ein Open-Source-Plugin, das kreative KI direkt in den Zeichnungsworkflow von Krita integriert. Künstler können weiterhin die Pinsel-, Schicht-, Auswahl-, Masken- und Farbwerkzeuge von Krita nutzen, während sie gleichzeitig Funktionen wie Bildgenerierung, lokales Übermalen, Bildvergrößerung, Referenzbildsteuerung, Echtzeitzeichnen und Superauflösung über die Seitenleiste aufrufen können.
Der Plugin selbst führt keine großen Diffusionsmodelle direkt aus, sondern verbindet sich mit dem Backend von ComfyUI. Das Backend kann entweder über den Installationsassistenten lokal bereitgestellt werden, auf einem anderen Computer oder Server laufen – oder auch die Interstice-Cloud-GPU-Dienste genutzt werden.
Diese Architektur ermöglicht es, die Benutzeroberfläche innerhalb von Krita zu belassen, während gleichzeitig die Wahl zwischen lokalen Modellen und entfernter Rechenleistung möglich bleibt.
Text-basierte Bildgenerierung und Malen auf Leinwand
Der Benutzer gibt positive und negative Anweisungen ein, wählt einen Stil sowie ein Basismodell aus – anschließend kann auf dem aktuellen Bildschirmbereich ein Bild erstellt werden. Das Ergebnis wird als Krita-Ebene in das Dokument eingefügt, wodurch weitere Bearbeitungen wie Zeichnen, Verformen, Farbanpassung und Komposition möglich sind, anstatt dass das fertige Bild nur von einer separaten Webseite heruntergeladen werden kann.
Die Erstellung von Prompten kann keine Genauigkeit bei den Texten sowie keine Konstanz bei komplexen Handbewegungen oder Charaktereigenschaften garantieren. Bei professionellen Projekten sollten Modelle, LoRA-Dateien, Seed-Werte, Sampling-Einstellungen sowie die Quelldateien von Krita gespeichert werden, um sie wiederherstellen und anpassen zu können.
lokales Neuziehen des Wahlkreises
Nachdem mit dem Auswahlwerkzeug von Krita ein Bereich markiert wurde, kann man „Fill“ verwenden, um Objekte hinzuzufügen, Inhalt zu entfernen oder Bereiche neu zu gestalten. Der Kontext hilft der KI dabei, die umliegenden Farben, Perspektiven und Strukturen zu verstehen – was sich gut eignet, um Gesichter zu reparieren, Kleidung zu ersetzen, Requisiten hinzuzufügen oder das Bild zu bereinigen.
Die Ränder der Maske, der Kontext sowie die Intensität beeinflussen die Nahtstelle. Wenn kleine Bereiche auf einem sehr großen Bildschirm liegen, sollte der KI ausreichender Kontext bereitgestellt werden und die Verarbeitung in Schritten erfolgen, um ein Zerreißen der Textur oder Veränderungen in den Proportionen zu vermeiden.
Erweiterung des Bildes und Ausdehnung des Canvas
Nach der Vergrößerung des Bildschirms kann man einen leeren Bereich auswählen, damit die KI die Ränder ergänzt. Dies eignet sich dazu, quadratische Bilder in horizontale Plakate umzuwandeln, Körperteile von Personen zu ergänzen oder den Hintergrund zu erweitern. Bei der Vergrößerung wird Inhalt außerhalb des ursprünglichen Bildes geschätzt – es ist jedoch nicht möglich, den tatsächlich aufgenommenen Bereich wiederherzustellen.
Refine – Verfeinerung von Bild zu Bild
Refine interpretiert die vorhandenen Bilder erneut durch eine anpassbare Intensität. Bei niedriger Intensität werden hauptsächlich Textur und Details verbessert, während bei hoher Intensität die Form und Komposition verändert werden.
Künstler können die KI schrittweise mit handgezeichneten Skizzen leiten, anstatt auf einmal das endgültige Bild zu erzeugen.
Die schrittweise Verfeinerung ist die zentrale Arbeitsmethode der Erweiterungen: Zunächst werden die groben Formen und Farben gezeichnet, anschließend wird die Auflösung sowie die Details in den jeweiligen Bereichen erhöht. Dies ist in der Regel besser kontrollierbar als das wiederholte Erstellen eines hochauflösenden Bildes insgesamt.
Live Painting Echtzeit-Malerei
Live Painting liest kontinuierlich vom aktuellen Bildschirm oder von einer bestimmten Zone und interpretiert die Bewegungen des Stifts des Benutzers in Echtzeit als ein vollständigeres Bild. Es eignet sich dazu, Kompositionen, Licht- und Schatteneffekte sowie Materialien und Charaktere zu entwickeln – dabei erhält man schnell Feedback von der KI bezüglich der Änderungen am Stift.
Der Echtzeitmodus erfordert eine leistungsstarke Grafikkarte sowie eine hohe Generierungsgeschwindigkeit. Bei zu großen Verzögerungen kann die Auflösung, die Anzahl der Schritte verringert oder ein schnelleres Modell verwendet werden, wobei erst nach Bestimmung der Richtung eine hochwertige Feinabstimmung erfolgt.
Hinweise zu den Regionen
Regions ermöglichen es, für verschiedene Bereiche des Bildes eigene Prompte festzulegen – beispielsweise unterschiedliche Beschreibungen für Personen, Hintergründe und Kleidung. Durch die Kombination von Regions mit den Ebenen in Krita kann der Benutzer Szenen mit mehreren Elementen präziser steuern, anstatt alle Anforderungen in einen einzigen Prompt zu packen.
Überlappungen der Bereiche oder zu strenge Grenzen können zu Konflikten führen; hier sollten weiche Masken, die Reihenfolge der Ebenen sowie globale Anweisungen zur Anpassung herangezogen werden.
Präzise Steuerung mit ControlNet
Der Plugin unterstützt ControlNet-Methoden wie Graffiti, Linienzeichnungen, Canny-Kanten, Körperhaltungen, Tiefe, Normale sowie Segmentierung. Die Benutzer können Kontrollgrafiken aus der aktuellen Schicht erstellen oder externe Referenzen importieren, um die Komposition, Konturen, Körperhaltungen und räumlichen Beziehungen zu steuern.
Das Steuerungsmodell muss mit der Architektur des Basismodells kompatibel sein. ControlNet von SDXL kann nicht direkt in Flux verwendet werden; eine falsche Kombination der Modelle führt zu Ladefehlern oder unkontrollierten Ergebnissen.
Referenzdiagramme und IP-Adapter
Referenzbilder können den Stil, die Komposition sowie die Eigenschaften von Personen und Objekten beeinflussen. Fähigkeiten wie IP-Adapter helfen dabei, die visuelle Richtung besser zu halten – im Vergleich zu reinen Prompten. Allerdings kann eine zu hohe Gewichtung der Referenzbilder zu einer Einschränkung der Variationen führen und sogar die Mängel des Eingabedaten wiederholen.
Bei der Verwendung von echten Personen, Marken, Charakteren sowie Werken Dritter muss die Gültigkeit der Genehmigungen überprüft werden. Eine technische Referenz darf nicht fälschlicherweise als automatische Gewährung von kommerziellen Rechten angesehen werden.
Unterstützte Grundmodelle
| Modellarchitektur | Eigenschaften | Hinweise zu Ressourcen und Lizenzen |
|---|---|---|
| Flux 2 | Starke Textverständnis- und Bildqualität, geeignet für die Erstellung hochwertiger Inhalte im modernen Stil. | Hohe Anforderungen an Speichergröße und Grafikspeicher; verschiedene Versionen sind möglicherweise nicht vollständig für kommerzielle Zwecke geeignet. |
| Z-Image | Mittelgroß, Turbo-Modus vereint Geschwindigkeit und realistische Qualität | Es ist notwendig, Modelle zu installieren, die zur Arbeitslast und zur Skalierbarkeit passen. |
| Stable Diffusion XL | Ökologisch ausgereift, reich an LoRA-, ControlNet- und Stilmodellen | Verbraucht in der Regel mehr Grafikspeicher als SD 1.5 |
| Stable Diffusion 1.5 | Geringe Ressourcenanforderungen, Kontrollmodell sowie reiche Gemeinschaftsressourcen | Die Grundauflösung sowie das Verständnis von Texten sind bei der neuen Architektur schwächer. |
| Illustrious | Geeignet für Illustrationen und Anime-Ökosysteme | LoRA und das Steuerungsmodell müssen zur entsprechenden Infrastruktur passen. |
Die von den Plugins unterstützten Architekturen ändern sich mit den Versionserweiterungen. Jedes Checkpoint, LoRA, ControlNet und IP-Adapter hat seine eigene Lizenz, Auslösewörter sowie Ressourcenanforderungen; die kommerzielle Lizenzierung der erzeugten Inhalte kann nicht allein anhand der GPL-Lizenz des Plugins beurteilt werden.
Style und LoRA
Style speichert das Basismodell, die Prompt-Vorlagen, die Sampling-Einstellungen sowie Kombinationen erweiterter Modelle, um eine konsistente visuelle Richtung in Projekten wiederverwenden zu können. LoRA kann über Dateiauswahl auf lokaler oder entfernter Backend-Plattform hochgeladen werden, wobei Triggerwörter und Standardstärken festgelegt werden können.
Mehrere überlappende LoRAs können sich gegenseitig stören und den Speicherverbrauch erhöhen. Bei der eigentlichen Erstellung sollten für jeden Stil getestete Kombinationen sowie Beispielbilder beibehalten werden.
Überauflösung und Blockverarbeitung
Upscale kann mithilfe von Upscaling-Modellen die Bildgröße erhöhen, und es ist möglich, mit dem Modul „Refine upscaled image“ weitere Details mit Diffusionsmodellen hinzuzufügen. Große Bilder werden in Tiles aufgeteilt, um zu vermeiden, dass der Arbeitsspeicher auf einmal überlastet wird.
Bei der Aufteilung in Blöcke können Nahtstellen, wiederholte Muster sowie lokale Stilunterschiede auftreten. Gesichter von Personen, Schriftzeichen und geometrische Muster müssen bei Vergrößerung besonders genau überprüft werden.
Bearbeitung von Modellen und Anpassung von Textanweisungen
Kompatible Edit-Modelle ermöglichen es, Bilder durch textbasierte Beschreibungen zu ändern – beispielsweise indem Lichtverhältnisse, Farben, Kleidung oder Objekte angepasst werden. Edit-Modelle reduzieren die Anzahl der manuellen MaskierungsSchritte, können jedoch gleichzeitig Bereiche verändern, die vom Benutzer nicht gewünscht sind. Sie eignen sich daher dazu, zunächst auf einer Kopie des Bildes getestet zu werden.
Vergleich der Verbindungsarten und Kosten
| Verbindungsart | Softwarekosten | Hauptkosten | Für Nutzer geeignet |
|---|---|---|---|
| Automatische Installation des lokalen Backends durch den Plugin | Kostenlos | Eigene GPU, Stromversorgung, Speicher und Modell-Download | Privatanwender, die eine vereinfachte Installation sowie den Betrieb ohne Internetverbindung wünschen |
| Verbindung mit dem vorhandenen ComfyUI | Kostenlos | Selbstwartung von Knoten, Modellen und Versionskompatibilität | Es gibt bereits fortgeschrittene Nutzer der ComfyUI-Umgebung. |
| Selbst erstellte ComfyUI aus der Ferne | Plugin kostenlos | Kosten für Server oder Cloud-GPUs, Sicherheit und Wartung | Rechenleistung für mehrere Geräte oder Teams teilen |
| Interstice Cloud | Abrechnung nach dem Cloud-Service-Konten-Modell | Cloud-GPU-Erstellung und -Speicherung, der Betrag richtet sich nach der Abrechnungsseite des Services | Benutzer ohne eine geeignete lokale Grafikkarte oder diejenigen, die schnell starten möchten |
Sowohl Krita als auch die Plugins können kostenlos verwendet werden. Es gibt keine offiziellen Abonnementgebühren für die lokale Nutzung, doch der Download der Modelle erfordert in der Regel mindestens 10 GB Speicherplatz. Es ist nicht ungewöhnlich, dass bei der Installation mehrerer zusätzlicher Modelle mehr als 50 GB benötigt werden.
Der aktuelle Betrag für Interstice in der Cloud wird nicht in den offiziellen Handbüchern angezeigt. Um Pakete, Limits sowie regionale Steuern zu überprüfen, muss man sich auf der Service-Seite einloggen.
Installationsanleitung
- Installieren Sie zunächst eine unterstützte Version von Krita.
- Laden Sie das komprimierte Plugin-Paket von der offiziellen GitHub-Release-Seite herunter – laden Sie nicht direkt den Quellcode des Repositoriums als Ersatz für das Release-Paket herunter.
- In Krita wird das Programm mithilfe des Python-Plugins-Importers installiert und neu gestartet.
- Aktivieren Sie im Bereich Dockers unter Settings das Panel für AI Image Generation.
- Klicken Sie auf „Konfigurieren“ und wählen Sie aus, ob der lokale Backend automatisch installiert werden soll, ob eine Verbindung zu einem bestehenden ComfyUI-System hergestellt werden soll, oder ob ein Remote-Server oder Cloud-Dienst verwendet werden soll.
- Laden Sie die Grundlasten und optionalen Modelle nach Bedarf herunter und testen Sie sie zunächst mit Dokumenten in niedriger Auflösung.
Lokale Hardware und Plattformen
Die Plugin-Oberfläche kann unter Windows, Linux und macOS laufen. Die von ComfyUI unterstützten Backend-Plattformen werden weiter erweitert. Im Vordergrund stehen weiterhin Tests mit NVIDIA-GPUs unter Windows und Linux – das ist in der Regel der stabilste lokale Ansatz.
Ob AMD, Apple Silicon und andere Backend-Lösungen verfügbar sind, hängt von PyTorch, ComfyUI sowie der Modellarchitektur ab. Bei unzureichender Grafikspeicherkapazität kann man das Bildformat, die Anzahl der Elemente pro Batch sowie die Größe des Modells verringern – oder auf eine entfernt liegende GPU ausweichen.
Nur die CPU ist in der Regel sehr langsam.
Achtung bei Flatpak und AppImage
Der Sandbox-Modus von Krita in der Linux-Flatpak-Version kann die Installation einiger Backend-Pakete verhindern. In den offiziellen Anleitungen wird empfohlen, bei einer automatischen lokalen Installation AppImage zu verwenden. Die Backend-Komponenten können auch in einem separaten Verzeichnis installiert und über eine Netzwerkverbindung zugänglich gemacht werden.
Custom ComfyUI-kompatibel
Fortgeschrittene Benutzer können ihren eigenen ComfyUI-Server verbinden, wobei die Plugins bestimmte Knoten und Workflow-Vorgaben nutzen. Es treten Fehler auf, wenn die Versionen von Komponenten wie ComfyUI, comfyui-tooling-nodes und comfyui-inpaint-nodes nicht übereinstimmen.
Nach dem Aufrüsten des Plugins sollte der Backend-Teil überprüft werden.
Es handelt sich nicht um eine universelle Benutzeroberfläche, die beliebige ComfyUI-Node-Diagramme direkt in Krita anzeigt. Benutzerdefinierte Knoten können möglicherweise nicht von Plugin-Workflows aufgerufen werden; in einer Produktionsumgebung sollte eine stabile, funktionierende Version verwendet werden.
Sicherheit bei Fernzugriffen
Eine entfernte ComfyUI-Instanz sollte ohne Authentifizierung nicht der Öffentlichkeit zugänglich gemacht werden. Für die Bereitstellung durch ein Team sind ein Reverse Proxy, HTTPS, Authentifizierung, Firewalls, Beschränkungen bezüglich der Dateigröße sowie separate Arbeitsverzeichnisse erforderlich.
Das Hochladen von Modellen sowie die Anpassung von Knoten sollten nur von zuverlässigen Quellen gestattet werden.
Privatsphäre und Daten
Der lokale Backend ermöglicht es, Prompts, das Canvas sowie die Modelle auf dem eigenen Gerät zu behalten. Im Remote- oder Cloud-Modus werden die notwendigen Bilder und Parameter an den Server gesendet. Vor der Verarbeitung sensibler Kundendaten sollten die Richtlinien bezüglich der Datenspeicherung, des Trainings sowie der Löschung in den Cloud-Diensten überprüft werden.
Open-Source-Lizenz
Krita AI Diffusion wird unter der Lizenz GPL-3.0-or-later bereitgestellt. Der Quellcode sowie Berichte zu Problemen und Versionen sind im offiziellen GitHub-Repositorium verfügbar. Krita selbst ist ebenfalls Open-Source-Software, doch die von ComfyUI bereitgestellten benutzerdefinierten Knoten, Modellgewichte sowie Cloud-Dienste unterliegen jeweils eigenen Lizenzen.
Das Erstellen von Bildern macht ein Werk nicht automatisch zu einem Werk unter der GPL, nur weil GPL-Plugins verwendet werden. Die kommerzielle Nutzung ist dennoch von den jeweiligen Modellen, LoRAs, den Eingabedaten sowie den geltenden Gesetzen abhängig.
Anleitung zur Verwendung von Krita AI Diffusion
Erstellung wiederverwendbarer professioneller Workflows
- Erstellung einer Liste mit den Markenfarben, Schriftarten, Kompositionselementen sowie verbotenen Elementen;
- Getrennt werden Bildgenerierung und Canvas-Kreation, lokale Übermalung von Auswahlbereichen sowie Bildvergrößerung und Canvas-Erweiterung getestet;
- Vergleichen Sie Qualität, Geschwindigkeit und Kosten mit derselben Gruppe von Referenzmaterialien;
- Komplexe Ränder, Texte sowie Bilder von wichtigen Produkten sollten von Menschen bearbeitet werden.
- Einheitliche Benennung, Größe und Prüfungsstatus;
- Nach Stichprobenkontrollen erfolgt die Massenverarbeitung und Veröffentlichung;
Für welche Nutzer geeignet?
- Illustratoren, die hoffen, AI direkt in Krita nutzen zu können;
- Kreative, die eine Kombination aus Handzeichnung und generativen lokalen Reparaturen benötigen;
- Benutzer, die lokal zeichnen und Flux, SDXL oder Anime-Modelle verwenden;
- Designer, die ControlNet, Segmentierungshinweise und Referenzbilder zur Steuerung benötigen;
- Teams, die bereits einen ComfyUI-Server haben und diesen mit einem professionellen Canvas verbinden möchten;
- Anwender, die Wert auf Offline-Privatsphäre und offene Quellcode legen.
Hauptvorteile
- Die Ergebnisse der KI werden direkt in den Krita-Layer- und Auswahlworkflows verwendet.
- Kostenlos und open source, es ist möglich, einen lokalen, entfernten oder cloud-basierten Backend auszuwählen;
- Unterstützung für verschiedene moderne und klassische Diffusionsmodellarchitekturen;
- Umfasst lokale Neuzuschnitte, Bildvergrößerung, Echtzeit-Zeichnen und Überauflösung;
- Bietet ControlNet, Referenzbilder, Regions und LoRA-Kontrolle;
- Beibehaltung traditioneller digitaler Zeichentools für manuelle Feinarbeit.
Einschränkungen und Hinweise
- Lokale Modelle verbrauchen viel Speicherplatz auf der Festplatte und im Grafikspeicher, und ihre Installation sowie Kompatibilität mit verschiedenen Versionen sind komplizierter als bei reinen Webwerkzeugen.
- Plugins, ComfyUI, Knoten und Modelle müssen entsprechend aktualisiert werden; die Leistung und Stabilität auf Plattformen außerhalb von NVIDIA weichen stark ab.
- Die Ausgaben von KI können weiterhin Struktur-, Text- und Kohärenzfehler aufweisen;
- Offene Quellen bedeuten nicht, dass die Modelle frei für kommerzielle Zwecke genutzt werden können, und es bedeutet auch nicht, dass Cloud-Dienste Dritter kostenlos sind oder dass die Daten vollständig lokal verbleiben.
Häufige Fragen
Ist Krita AI Diffusion kostenlos?
Plugins und die lokale Ausführung sind kostenlos und open source; eigene Hardware, Cloud-GPUs oder Interstice Cloud verursachen entsprechende Kosten.
Muss ComfyUI installiert werden?
Es muss ein kompatibler Backend-Anschluss hergestellt werden, doch es ist möglich, die Erweiterung automatisch zu installieren, oder man kann auf ein bereits vorhandenes oder entferntes ComfyUI zugreifen, ohne eine separate Node-Oberfläche bedienen zu müssen.
Wird Flux und SDXL unterstützt?
Es werden Architekturen wie Flux 2, Z-Image, SD 1.5, SDXL und Illustrious unterstützt; die genauen Funktionen hängen von der Version des Plugins sowie den installierten Modellen ab.
Kann man Teile neu zeichnen und das Bild erweitern?
Ja, die Auswahlmöglichkeiten in Krita können direkt zur Erstellung von Füllungen, zum Entfernen von Objekten sowie zur Erweiterung des Bildschirms verwendet werden.
Wird macOS und AMD unterstützt?
Die Plugin-Oberfläche unterstützt gängige Plattformen, doch die Leistung und Kompatibilität des lokalen Backends hängen von ComfyUI, PyTorch und der Hardware ab. NVIDIA unter Windows und Linux sind die Haupt-Testplattformen.
Ist der Plugin Open Source?
Open Source, unter Verwendung der GPL-3.0-or-later-Lizenz.
Guigong-Netzwerk-Sicherheitsnummer: 45132202000164