Tongyi Wanshang
Die unter Ali Tongyi geführte Plattform für multimodale visuelle Kreationen, die die Erstellung von Bildern und Videos umfasst.
Tags:Erstellung von AI-Bild-IllustrationenWas ist Tongyi Wanshang?
Tongyi Wanxiang ist eine multimodale visuelle Generierungsplattform aus der Alibaba Tongyi-Reihe; die englische Marke lautet Wan. Sie bietet gewöhnlichen Kreativen Online-Tools zur Erstellung von Bildern und Videos an, stellt außerdem über Alibaba Cloud Bai Lian APIs für Entwickler und Unternehmen bereit und veröffentlicht gleichzeitig in der offiziellen GitHub-Organisation einige open-source Video-Modelle, die lokal eingesetzt werden können.
Benutzer können visuelle Inhalte mit Texten, Bildern, Referenzfiguren, Referenzvideos oder vorhandenen Videos erstellen und bearbeiten. Die Anwendungsbereiche umfassen Kurzvideos, Werbung, Produktbilder für den E-Commerce, Filmvorschauen, Anime, digitale Personen sowie kreative Designs.
Stand dieser Überprüfung hat der Cloud-Mainstream bereits begonnen.Wan 2.7Die derzeitigen Fähigkeiten umfassen Videoerstellung aus Text, Videoerstellung aus Bildern, Videoerstellung unter Verwendung von Referenzbildern, Videobearbeitung sowie Bildererstellung aus Text, Bildergruppen, Mehrfachreferenzen und Bildbearbeitung.
Die in früheren Beschreibungen üblichen Begriffe wie „Wanxiang 2.1“ oder einfach nur „KI-Bildergenerierung“ spiegeln den aktuellen Stand des Produkts nicht mehr vollständig wider. Es ist wichtig zu beachten, dass Online-Kreativplattformen, die Alibaba Cloud BaiLian-API sowie offizielle Open-Source-Modelle drei verschiedene Verwendungsmöglichkeiten darstellen. Modellversionen, Abrechnungsmodi, Datenstandorte und Bereitstellungsanforderungen dürfen nicht miteinander verwechselt werden.
Wan 2.7 Video-Generierungsfähigkeit
- Stable Video Generation:Eingabe von Szene, Charakteren, Handlungen, Kamerawinkeln, Geräuschen und Stilbeschreibungen zur Erstellung von Videos. Wan 2.7 unterstützt sowohl die Erzählung mit einer als auch mit mehreren Kamerawinkeln; außerdem können Zeitabschnitte in den Anweisungen verwendet werden, um die einzelnen Szenen zu beschreiben. Es eignet sich für Werbeskripte, Filmsequenzen und Konzeptvorstellungen.
- Tusheng-Videos:Fotografien von Personen, Produktbilder, Illustrationen oder Szenen in dynamische Inhalte umwandeln – dabei die Hauptelemente und Komposition beibehalten und Bewegungen, Kamerabewegungen sowie Umweltveränderungen steuern. Die aktuelle Version 2.7 kann Videos mit Ton direkt erzeugen.
- Referenzvideo des Schülers:Durch die Verwendung von Referenzbildern oder -videos können Personen, Gegenstände, Kleidung sowie visuelle Merkmale beibehalten werden, wodurch eine fortlaufende Erzählung mit einer oder mehreren Charakteren möglich ist. Dies eignet sich für Kurzfilme zu IP-Produkten, Markenfiguren sowie Inhalte, bei denen eine Konsistenz über verschiedene Aufnahmen hinweg erforderlich ist. Allerdings können komplexe Verdeckungen und starke Drehungen immer noch zu einer Veränderung der Identität der Charaktere führen.
- Mehrere Kameras und lange Erzählungen:Das Modell kann auf der Grundlage von Anweisungen automatisch die Struktur der Kameraeinstellungen verstehen, oder es können für jeden Zeitabschnitt explizit die Bildgröße, die Bewegungen sowie die Übergänge festgelegt werden. Im Vergleich zur Erstellung der einzelnen Abschnitte separat ist diese Methode geeigneter, um den Rhythmus der Geschichte sowie die semantische Kontinuität zu bewahren.
- Audio-Video:Benutzer können Audio-Dateien hochladen, oder sie können das Modell anweisen, auf der Grundlage des Bildes automatisch Hintergrundmusik oder Soundeffekte zu erzeugen. Für die Eingabe von Audio werden gängige Audioformate unterstützt. Laut den API-Dokumentationen darf die Länge des Audios 2 bis 30 Sekunden betragen, und die Dateigröße darf 15 MB nicht überschreiten. Der Teil des Audios, der die Länge des Zielvideos überschreitet, wird abgeschnitten.
- Video-Editing:Wan 2.7 VideoEdit kann mithilfe von Textanweisungen und Referenzbildern bereits vorhandene Videos bearbeiten – beispielsweise durch den Austausch von Kleidung, Gegenständen oder visuellen Elementen. Die Bearbeitung wird nach der Länge des Eingangs- und Ausgangsmaterials abgerechnet. Bei ernsthaften Projekten sollte zunächst mit kurzen Videos getestet werden, ob die Stabilität sowie die Integration der Elemente in Ordnung sind.
Auflösung, Dauer und Steuerparameter
Die Wan 2.7 Video-Generierungs-API unterstützt 720P und 1080P. Zu den gängigen Bildformaten gehören 16:9, 9:16, 1:1, 4:3 und 3:4. Die Dauer einer einzelnen Generierung kann auf 2 bis 15 Sekunden eingestellt werden; standardmäßig sind es 5 Sekunden.
Die 16:9-Ausgabe in 720P beträgt 1280×720, bei 1080P ist es 1920×1080.
Das Modell unterstützt Anweisungen in Chinesisch und Englisch mit bis zu 5000 Zeichen, umgekehrte Anweisungen, zufällige Seed-Werte, intelligente Umformulierung von Anweisungen sowie einen Schalter für das „AI-generierte“ Wasserzeichen.
Die Dauer von Videoaufgaben wird in der Regel in Minuten angegeben. Die HTTP-Schnittstelle verwendet einen asynchronen Ablauf für die Ausführung der Aufgaben. Sowohl die Ergebnisse der Aufgaben als auch deren Identifikatoren haben eine Gültigkeitsdauer. Entwickler sollten daher regelmäßig nach den Ergebnissen suchen, diese herunterladen und speichern – anstatt die vorübergehenden Adressen als dauerhafte Speicherorte zu verwenden.
Das Festlegen eines zufälligen Samens kann die Wiederholbarkeit verbessern, doch da es sich um ein probabilistisches Modell handelt, kann nicht garantiert werden, dass das Ergebnis jedes Mal genau gleich ist.
Wan 2.7 Bilder erstellen und bearbeiten
Zu den Hauptbildfunktionen gehören Wan 2.7 Image sowie die hochwertigere Variante Wan 2.7 Image Pro. Die Flaggschiff-Version unterstützt Text-zu-Bild-Generierung, Erstellung von Bildserien aus Texten, Bild-zu-Bild-Generierung, Bildbearbeitung, mehrere Referenzbilder sowie interaktive Bearbeitung. Zudem wurde die Darstellung chinesischer und englischer Texte verbessert, ebenso wie die Konsistenz der Elemente in den Bildern. Außerdem werden komplexe Anweisungen besser umgesetzt und es ist möglich, die Bilder in mehreren Schritten zu bearbeiten.
Die Standardversion ist günstiger und eignet sich für Bilder in großen Mengen, Bilder für soziale Medien, Konzeptskizzen sowie schnelle Entwürfe; die Pro-Version ist besser geeignet für fertige Produkte, bei denen hohe Anforderungen an Texte, Personen oder Markenelemente bestehen.
Mehrere Bilder können gleichzeitig Informationen zu Personen, Produkten, Kleidung, Posen oder Stilen liefern, um eine einheitliche visuelle Serie zu erstellen. Die interaktive Bearbeitung ermöglicht es, die Komposition, den Hintergrund, die Materialien, das Licht sowie die einzelnen Elemente anhand der vorhandenen Bilder weiter zu verändern.
Es handelt sich immer noch nicht um ein traditionelles Bildbearbeitungsprogramm auf Pixelebene: Kleine Schriftzeichen, präzise Logos, Hände, komplexe Geometrien sowie mehrere Bilder in einer Reihe können Fehler aufweisen. Für kommerzielle Materialien ist eine manuelle Überprüfung sowie eine weitere Formatierung erforderlich.
Wie verwendet man die Online-Version von Tongyi Wanshang?
Normale Benutzer können auf Plattformen für die Erstellung von Inhalten Bilder oder Videos auswählen, Suchbegriffe eingeben und Referenzmaterialien hochladen. Anschließend können sie das Format, die Dauer, das Modell sowie die Auflösung festlegen. Es wird empfohlen, zunächst mit einer kürzeren Dauer oder einem Standardmodell die Komposition, die Bewegungen sowie die Hauptelemente zu überprüfen, bevor man die Auflösung erhöht, um das endgültige Produkt zu erstellen.
Die Anweisungen sollten den Hauptgegenstand, die Umgebung, die Handlung, die Kameraeinstellungen, das Licht, den Stil sowie die Tonqualität klar beschreiben. Bei Videos mit mehreren Einstellungen ist es am besten, jede Einstellung nach Zeitabschnitten zu beschreiben, um zu vermeiden, dass widersprüchliche Anforderungen gleichzeitig gestellt werden.
Die Online-Version bietet in der Regel eine Probierphase an, die mit Punkten, Mitgliedschaften oder Abo-Vorteilen abgerechnet wird. Die angebotenen Pakete können je nach Region, Konto sowie auf Web- und Mobilplattformen unterschiedlich sein. Auch die kostenlose Nutzungsmenge kann sich durch Marketingaktionen ändern. Deshalb sollten feste Punktzahlen oder Mitgliedspreise aus alten Anleitungen nicht als dauerhafte Preise angesehen werden.
Vor dem Kauf sollte man sich auf die Zahlungsseite nach dem Anmelden beziehen und darauf achten, ob für fehlgeschlagene Erstellungen, Wiederholungsversuche, Hochauflösung, Audio sowie Bearbeitungsfunktionen jeweils Gebühren anfallen.
Preise für die Aliyun BaiLian-API
Im Folgenden sind die offiziellen Originalpreise für das Gebiet Nordchina 2 (Peking) bei dieser Überprüfung aufgeführt – ohne Rabatte oder Aktionen. Neu eingeführte Modelle bieten in der Regel eine Probephase von 90 Tagen; die genauen Bedingungen entnehmen Sie bitte der Konsole.
| Paket oder Version | Preise, Limits und Kernvorteile |
|---|---|
| Wan 2.7 Image Pro | 0,50 Yuan pro Stück, kostenlos: 50 Stück. |
| Pro | Wan2.7ImagePro: 0,50 Yuan pro Bild, 50 Bilder kostenlos. Die Standardversion für den internationalen Einsatz in Singapur kostet etwa 0,224826 Yuan pro Bild, die Pro-Version etwa 0,562065 Yuan pro Bild; |
Die Standardversion der Bilder für die internationale Verwendung in Singapur kostet etwa 0,224826 Yuan pro Bild, die Pro-Version etwa 0,562065 Yuan pro Bild. Für Videos im Format 720P beträgt der Preis etwa 0,733924 Yuan pro Sekunde, bei 1080P sind es etwa 1,100886 Yuan pro Sekunde.
Die API-Schlüssel, Anfrageseiten und Datengebiete für die chinesische und internationale Region sind unterschiedlich; bei der Entwicklung müssen Modell, Schnittstelle und Schlüssel demselben Gebiet zugehören.
Die Preise können sich ändern; bei Serienbestellungen gelten die Rechnungen aus der Konsole sowie die aktuellsten Gebührenlisten.
Wichtige Punkte für die API-Anbindung
Entwickler können über die HTTP-Schnittstelle oder das DashScope SDK zugreifen. Videoaufgaben werden in der Regel nach dem Verfahren „Aufgabe erstellen – Status abfragen – Ergebnisse herunterladen“ ausgeführt; die Abfragen sollten nicht allzu häufig erfolgen.
In der Produktionsumgebung muss der API-Schlüssel geschützt werden, wobei Konkurrenz, Budget, Zeitlimits, Wiederholungsversuche bei Fehlern sowie Inhaltssicherung eingestellt werden müssen; die temporären Videodateien, die zurückgegeben werden, sollten rechtzeitig in einer eigenen Speicherlösung gespeichert werden.
Bei der Kostenschätzung müssen auch die Anzahl der Versuche, die Dauer der Eingabe, die Hochauflösung, der Speicherbedarf, die Bandbreite sowie die manuelle Nachbearbeitung berücksichtigt werden.
Bailian hat außerdem die Wan Agent Skills veröffentlicht, die es AI-Agenten mit Unterstützung für Skill-Mechanismen ermöglichen, Wan 2.7 zur Erstellung und Bearbeitung von Bildern zu nutzen. Zudem werden Beispiele dafür bereitgestellt, wie Präsentationen mithilfe von Dokumentenmodellen sowie dem Wan-Image-Modell erstellt werden können. Die Skills sind im Grunde genommen Abstraktionen von API-Aufrufen; es werden weiterhin ein Alibaba Cloud-Konto sowie eine API-Key benötigt. Damit ist keine kostenlose Nutzung des Cloud-Modells 2.7 auf lokaler Ebene möglich.
Open-Source-Modelle und Lizenzen
Tongyi Wanxiang ist nicht „gänzlich open source“. Die Online-Plattform sowie das Wan 2.7-Cloud-Modell gehören zu Hosted-Diensten;
Auf GitHub werden offiziell bestimmte Versionen des Modells, der Inferenzcode sowie Tools zur Anbindung bereitgestellt.
Ein aktuelles, repräsentatives Open-Source-Projekt ist Wan2.2. Der Code wird unter der Apache 2.0-Lizenz bereitgestellt. Es stehen Modelle mit 14 Milliarden Parametern zur Verfügung, die für die Erstellung von Videos aus Texten sowie von Videos aus Bildern genutzt werden können. Zudem gibt es ein 5-Milliarden-Parameter-Modell, das sowohl Videos aus Texten als auch aus Bildern verarbeiten kann. Die 5-Milliarden-Parameter-Version unterstützt eine Auflösung von 720P bei 24 Frames pro Sekunde und kann auf hochwertigen Consumer-Grafikkarten ausgeführt werden.
Die Behörden haben außerdem Wan2.2-Animate veröffentlicht, das zur Animation von Charakteren und zum Austausch von Figuren verwendet wird. Ebenfalls im August 2026 wurde Wan-Animate-2 veröffentlicht – dabei handelt es sich um ein Tool für die Erstellung von Logikskripten sowie Gewichtungsfaktoren. Wan-Animate-2 verbessert die Genauigkeit der Bewegungen, die Beibehaltung der Identität der Charaktere sowie die Kontrolle über die Sichtwinkel. Zudem bietet es Ansätze zur Optimierung für Echtzeitanwendungen. Auch dieses Tool wird unter der Apache 2.0-Lizenz bereitgestellt.
Für die Open-Source-Einsatzmöglichkeit sind weiterhin leistungsstarke GPUs, Speicherplatz zum Herunterladen der Modelle, ein Umfeld zur Ausführung der Modelle sowie Sicherheitsmaßnahmen erforderlich. Die Tatsache, dass Code und Gewichte verfügbar sind, bedeutet nicht, dass die Funktionen mit denen der neuesten Online-Version 2.7 vergleichbar sind – auch bedeutet es nicht, dass für alle Eingabedaten automatisch eine kommerzielle Lizenz vorliegt.
Anleitung zur Verwendung von Tongyi Wanshang
Eine grundlegende Aufgabe erledigen
- Bestimmen Sie das Publikum, die Plattform, das Format, die Dauer sowie die Informationen, die übermittelt werden müssen;
- In Tongyi Wanshang Skripte, Aufnahmen oder verwendbare Referenzmaterialien vorbereiten;
- Wählen Sie die Wan 2.7-Videogenerierungsfunktion aus, um eine kostengünstige Vorschau zu erstellen;
- Verwenden Sie Auflösung, Dauer und Steuerparameter, um Bild, Rhythmus, Untertitel und Ton anzupassen;
- Jedes Frame wird auf Personen, Texte, Logos, Mundbewegungen und die Richtigkeit der Fakten überprüft;
- Nach der Bestätigung der Lizenzen für Musik, Porträts und Materialien wird die Datei in der gewünschten Formatierung exportiert;
Erstellung wiederverwendbarer professioneller Workflows
- Erstellung von Skripten, Drehbüchern, Markenmaterialien und einer Liste der zu verbietenden Elemente;
- Einzige Parameter für die Videoerstellung von Wan 2.7 – Auflösung, Dauer sowie Steuerungsparameter – sowie für die Bilderstellung und -bearbeitung in Wan 2.7.
- Zuerst werden das Modell und die Obergrenze mit repräsentativen Aufnahmen getestet;
- Fehlerhafte Aufnahmen in eine manuelle Bearbeitung überführen oder neu erstellen;
- Einheitliche Untertitel, Lautstärke, Farben und Abspann-Copyright-Informationen;
- Erst nach Erfassung der Version und des Prüfers in Batch veröffentlichen;
Für welche Benutzer geeignet
- Kurzvideos und Content-Creater: Erstellung von Szenen, Animationen, MVs, Coverbildern und Materialien für soziale Medien.
- E-Commerce- und Werbeabteilung: Erstellung von Produktbildern, Modellpräsentationen, Werbeszenarien und Veröffentlichungsvideos.
- Film- und Spieleentwicklungsteam: Erstellung des Konzeptdesigns, Vorausvorführungen der Szenen, Darstellung der Charakterbewegungen sowie Präsentation der Welt.
- Designer und Marken-Team: Erstellung von visuellen Serien, mehreren Referenzbildern, Hintergrundbildern für Plakate sowie kreativen Vorschlägen.
- Entwickler und Unternehmen: Massenproduktion von Bildern und Videos über APIs oder Erstellung von Branchenanwendungen.
- Forscher und lokale Nutzer: Testen von offiziellen Open-Source-Modellen wie Wan2.2, Animate usw.
Vorteile
- Die Fähigkeiten für Bilder und Videos sind in derselben Modellfamilie zusammengefasst und umfassen Erstellung, Referenz und Bearbeitung.
- Das Verstehen chinesischer Anweisungen, die Darstellung chinesischer Schriftzeichen sowie der Zugang zu inländischen Cloud-Diensten sind recht einfach.
- Wan 2.7 kann auditive Videos mit einer Länge von 2 bis 15 Sekunden in maximaler 1080P-Auflösung erzeugen und unterstützt mehrere Kameras.
- Die API-Abrechnung ist transparent: Bilder werden pro Stück, Videos pro Sekunde abgerechnet. Die Einrichtung ist sowohl in chinesischen als auch in internationalen Regionen möglich.
- Offiziell werden gleichzeitig Hosting-Dienste, SDK/Skills sowie die Open-Source-Modell-Ökologie von Apache 2.0 gewartet.
Einsatzbeschränkungen und Hinweise
- KI-generiertes Inhalt kann Veränderungen in der Identität der Personen, Fehler bei den Händen, unlogische körperliche Bewegungen, Verzerrungen im Text, Inkonsistenzen zwischen Ton und Bild sowie abrupte Wechsel der Kameraposition aufweisen.
- Referenzvideos können die Konstanz verbessern, ersetzen aber nicht die manuelle Überprüfung von Schauspielern, Produkten und Markenmaterialien.
- Bei medizinischem, finanziellen, Nachrichten-, Bildungs- und Werbeinhalt muss die Richtigkeit überprüft werden; Bilder, die von Modellen erzeugt werden, dürfen nicht als echte Beweise angesehen werden.
- Bevor man echte Fotos, Geräusche, Videoausschnitte, Musik, Markenzeichen sowie Produktbilder hochlädt, muss man eine Genehmigung für das Bildrecht, die Urheberrechte oder das Markenrecht einholen.
- Es ist nicht zulässig, betrügerische, täuschende, ohne Zustimmung erstellte pornografische Inhalte oder andere rechtswidrige Inhalte zu erzeugen;
- Bei der öffentlichen Veröffentlichung müssen die geltenden Regeln zur Kennzeichnung von durch KI erzeugten Inhalten eingehalten werden;
- Unternehmen, die APIs nutzen, sollten außerdem die geografische Lage der Daten, die Aufbewahrung der Materialien, die Zugriffsrechte sowie das Risiko eines Schlüssellecks bewerten.
Häufige Fragen
Ist Tongyi Wanshang kostenlos?
Die Online-Version bietet in der Regel eine Probierphase an. Auch Alibaba Cloud BaiLian stellt für einige neu eingeführte Modelle eine begrenzte kostenlose Nutzungsdauer zur Verfügung; ab dem Überschreiten dieser Grenze wird nach Anzahl der Punkte, Mitgliedsstatus oder API-Nutzung abgerechnet.
Der tatsächliche Anspruch richtet sich nach der Seite nach dem Anmelden.
Welche ist die neueste Version von Tongyi Wanshang?
Die aktuelle Cloud-Plattform ist Wan 2.7 – sie umfasst Funktionen für Bildverarbeitung, Videoerstellung aus Texten, Videoerstellung aus Bildern, Videoerstellung anhand von Referenzvideos sowie Videobearbeitung. Wan2.2 ist die offiziell bevorzugte Open-Source-Version; beide Versionen haben unterschiedliche Anwendungsbereiche und Einsatzmöglichkeiten.
Wie lange können Videos mit Tongyi Wanshang erstellt werden?
Die Wan 2.7 Video-Generierungs-API unterstützt pro Aufruf Videos von 2 bis 15 Sekunden Länge und bietet die Optionen 720P oder 1080P. Längere Videos erfordern in der Regel die Erstellung in einzelnen Szenen, deren Erweiterung sowie die nachträgliche Bearbeitung.
Wie viel kostet die Tongyi Wanshang-API?
Für die Standardbilder im Format Wan 2.7 in Peking, China, beträgt der Preis 0,20 Yuan pro Bild, für das Pro-Format 0,50 Yuan pro Bild. Für Videos im Format 2.7 – egal ob generiert durch KI, aus Bildern oder als Referenzvideos – beträgt der Preis 0,60 Yuan pro Sekunde in 720P-Qualität und 1 Yuan pro Sekunde in 1080P-Qualität.
Preise für Aktivitäten und in internationalen Regionen können unterschiedlich sein.
Ist Tongyi Wanshang open source?
Online-Plattformen sowie das Wan 2.7-Cloud-Modell können nicht einfach als Open Source bezeichnet werden. Die speziellen Versionen Wan2.2, Wan2.2-Animate und Wan-Animate-2 machen den Code sowie die Gewichte öffentlich und verwenden dabei die Apache 2.0-Lizenz.
Guigong-Netzwerk-Sicherheitsnummer: 45132202000164