Tongyi Wanshang
Plateforme de création visuelle multimodale d’Alitongyi pour la génération d’images et de vidéos
Étiquettes :Génération d’illustrations d’images par l’IAQu’est-ce que Tongyi Wanshang ?
Tongyi Wanxiang est une plateforme de génération visuelle multimodale de la série Tongyi d’Alibaba, dont le nom de marque en anglais est Wan. Elle met à disposition des créateurs ordinaires des outils de génération d’images et de vidéos en ligne, propose également des API aux développeurs et aux entreprises via Alibaba Cloud BaiLian, et publie sur son organisation GitHub officielle certains modèles vidéo open source pouvant être déployés localement.
Les utilisateurs peuvent créer et modifier du contenu visuel à l’aide de texte, d’images, de personnages de référence, de vidéos de référence ou de vidéos existantes. Les domaines d’application incluent les vidéos courtes, la publicité, les images de produits en e-commerce, les prévisualisations de films, les animations, les avatars numériques et la conception créative.
Jusqu’à cette vérification, la ligne principale cloud est entrée dansWan 2.7Les capacités actuelles couvrent la génération de vidéos à partir de texte, la génération de vidéos à partir d’images, la génération de vidéos à partir de références, l’édition vidéo, ainsi que la génération d’images à partir de texte, les albums d’images, les références multiples et l’édition d’images.
Les expressions courantes dans les anciennes présentations, telles que « Wanxiang 2.1 » ou simplement « dessin par IA », ne reflètent plus pleinement la situation actuelle du produit. Il convient de noter que les plateformes de création en ligne, l’API Bai Lian d’Alibaba Cloud et les modèles open source officiels représentent trois modes d’utilisation distincts ; il ne faut pas confondre les versions des modèles, les modalités de facturation, la localisation des données et les exigences de déploiement.
Capacité de génération vidéo Wan 2.7
- Vidéo générée par IA :Entrez une description de scène, de personnages, d’actions, de plans, de sons et de style pour générer une vidéo. Wan 2.7 prend en charge la narration à un ou plusieurs plans, et il est également possible d’utiliser des indications temporelles dans les prompts pour décrire les séquences, ce qui le rend adapté aux scénarios publicitaires, aux extraits de films et aux prévisualisations de concepts.
- Vidéos TuSheng :Transformer des photos de personnes, des images de produits, des illustrations ou des scènes en contenu dynamique, tout en conservant le sujet et la composition, afin de contrôler les mouvements, les mouvements de caméra et les changements d’environnement. Actuellement, 2.7 permet de générer nativement des vidéos audio à partir d’images.
- Vidéo de référence étudiant :En utilisant des images ou des vidéos de référence pour conserver les personnages, les objets, les vêtements et les caractéristiques visuelles, il est possible de créer une narration continue avec un ou plusieurs personnages. Cela convient aux courts métrages basés sur des IP, aux personnages de marque et aux contenus nécessitant une cohérence d’une prise à l’autre, mais des occultations complexes et de grands changements de direction peuvent encore entraîner une perte d’identité.
- Plusieurs caméras et narration longue :Le modèle peut comprendre automatiquement la structure de la scène à partir des indications fournies, ou bien spécifier explicitement le plan, l’action et les transitions pour chaque segment temporel. Par rapport à une génération indépendante par segment, cette méthode permet de mieux maintenir le rythme de l’histoire et la continuité sémantique.
- Vidéo audio :Les utilisateurs peuvent télécharger des fichiers audio, ou faire en sorte que le modèle génère automatiquement de la musique de fond ou des effets sonores en fonction de l’image. Les fichiers audio acceptés sont ceux des formats courants ; selon la documentation de l’API, la durée de l’audio doit être comprise entre 2 et 30 secondes et le fichier ne doit pas dépasser 15 MB ; la partie excédant la durée prévue pour la vidéo sera tronquée.
- Montage vidéo :Wan 2.7 VideoEdit permet de modifier des vidéos existantes en fonction d’instructions textuelles et d’images de référence, par exemple pour remplacer des vêtements, des objets ou des éléments visuels. L’édition est facturée en fonction de la durée d’entrée et de sortie ; pour les projets professionnels, il convient d’abord de tester la stabilité du sujet et la fusion des bords à l’aide de courts clips.
Résolution, durée et paramètres de contrôle
L’API de génération de vidéos Wan 2.7 prend en charge 720P et 1080P, avec des formats courants tels que 16:9, 9:16, 1:1, 4:3 et 3:4. La durée d’une génération unique peut être définie de 2 à 15 secondes, avec une valeur par défaut de 5 secondes.
La sortie 16:9 en 720P est de 1280×720, et en 1080P, c’est 1920×1080.
Le modèle prend en charge des prompts en chinois et en anglais d’une longueur maximale de 5000 caractères, des prompts inversés, une graine aléatoire, une réécriture intelligente des prompts, ainsi qu’un interrupteur pour l’eau marquée « Généré par l’IA ».
La durée des tâches vidéo est généralement exprimée en minutes, et l’interface HTTP utilise un processus de tâches asynchrone. Les résultats des tâches ainsi que leurs identifiants ont une durée de validité ; les développeurs doivent donc effectuer régulièrement des requêtes de consultation, télécharger et sauvegarder les fichiers, plutôt que de considérer l’adresse des résultats temporaires comme un stockage permanent.
Fixer une graine aléatoire peut améliorer la reproductibilité, mais les modèles de génération étant probabilistes, il n’est pas possible d’assurer que les résultats soient identiques à chaque fois.
Wan 2.7 Génération et édition d’images
Les versions principales d’image comprennent Wan 2.7 Image et la version de plus haute qualité Wan 2.7 Image Pro. La version phare prend en charge la génération d’images à partir de texte, la création de séries d’images à partir de texte, la génération de séries d’images à partir d’images, l’édition d’images, des références multiples et une édition interactive, et améliore le rendu du texte en chinois et en anglais, la cohérence des sujets, le respect des instructions complexes et les modifications en plusieurs tours.
La version standard est moins chère et convient aux images en grande quantité, aux visuels pour les réseaux sociaux, aux esquisses conceptuelles et aux essais rapides ; Pro est plus adaptée aux produits finis nécessitant des exigences élevées en matière de texte, de personnages ou d’éléments de marque.
De nombreuses références visuelles peuvent fournir en même temps des informations sur les personnes, les produits, les vêtements, les postures ou le style, afin de créer une série visuelle cohérente. L’édition interactive permet de modifier weiterment la composition, l’arrière-plan, les matériaux, la lumière et les éléments locaux à partir d’images existantes.
Ce n’est toujours pas un logiciel de retouche traditionnel au niveau des pixels : les petits caractères, les logos précis, les mains, les formes géométriques complexes et les séries d’images continues peuvent présenter des erreurs ; les supports commerciaux nécessitent une vérification manuelle et une mise en page ultérieure.
Comment utiliser la version en ligne de Tongyi Wanshang
Les utilisateurs ordinaires peuvent choisir des tâches d’image ou de vidéo sur une plateforme de création en ligne, entrer des prompts et télécharger des matériaux de référence, puis définir la taille de l’image, la durée, le modèle et la résolution. Il est recommandé d’utiliser d’abord une durée plus courte ou un modèle standard pour valider la composition, les mouvements et le sujet, avant d’améliorer la résolution pour obtenir le produit final.
Les indications doivent préciser le sujet, l’environnement, l’action, la caméra, la lumière, le style et le son ; pour une vidéo à plusieurs plans, il est préférable de décrire chaque plan en fonction de la période temporelle, afin d’éviter de combiner des exigences contradictoires en même temps.
La version en ligne propose généralement une quantité d’accès d’essai, facturée en points, en abonnement ou en avantages liés à des événements. Les forfaits affichés peuvent varier selon la région, le compte, ainsi que la version web ou mobile, et la quantité d’accès gratuit peut également changer en fonction des promotions en cours ; par conséquent, les points fixes ou les prix d’abonnement indiqués dans les anciens tutoriels ne doivent pas être considérés comme des prix permanents.
Avant l’achat, il convient de se référer à la page de paiement après connexion, et de vérifier si les échecs de génération, les tentatives de réessai, la haute définition, l’audio ainsi que les fonctionnalités d’édition entraînent des frais supplémentaires.
Prix de l’API BaiLian d’AliCloud
Ci-dessous figurent les prix officiels originaux de la région Nord-Chine 2 (Pékin) au moment de cette vérification, sans prendre en compte les remises promotionnelles. Les modèles nouvellement lancés ou mis à disposition par Bai Lian offrent généralement une période d’essai valable pendant 90 jours ; les conditions exactes dépendent de la console.
| Forfait ou version | Prix, plafonds et avantages clés |
|---|---|
| Wan 2.7 Image Pro | 0,50 yuan par feuille, 50 feuilles gratuites. |
| Pro | Wan2.7ImagePro : 0,50 yuan par image, avec une quantité gratuite de 50 images. La version standard pour déploiement international à Singapour coûte environ 0,224826 yuan par image, et la version Pro environ 0,562065 yuan par image ; |
Pour les normes d’images déployées internationalement à Singapour, la version standard coûte environ 0,224826 yuans par image, et la version Pro environ 0,562065 yuans par image ; pour les vidéos 2,7, 720P coûte environ 0,733924 yuans par seconde, et 1080P environ 1,100886 yuans par seconde.
Les clés API, les adresses de requête et les régions des données diffèrent pour la zone Chine et la zone internationale ; lors du développement, il est impératif que le modèle, l’adresse de l’interface et la clé appartiennent à la même région.
Les prix seront ajustés ; pour les commandes en gros, il conviendra de se référer à la facture de la console et au dernier tableau de tarification.
Points clés d’intégration API
Les développeurs peuvent se connecter via une interface HTTP ou le SDK DashScope. Les tâches de vidéo s’exécutent généralement selon le flux « créer une tâche — consulter l’état — télécharger les résultats », et les consultations ne doivent pas être trop fréquentes.
L’environnement de production nécessite de protéger la clé API, en définissant la concurrence, le budget, les délais d’attente, les tentatives de réessai en cas d’échec et la modération du contenu ; les fichiers temporaires vidéo renvoyés doivent être sauvegardés en temps opportun dans un stockage propre.
Lors de l’estimation des coûts, il faut également prendre en compte le nombre d’essais et d’erreurs, la durée des données de référence, la résolution haute définition, le stockage, la bande passante et le travail de post-traitement manuel.
Bailian a également rendu publiques les Wan Agent Skills, qui permettent aux agents IA prenant en charge un mécanisme de compétences d’appeler Wan 2.7 pour la génération et l’édition d’images, et offre des exemples de création de présentations en combinant des modèles de documents avec le modèle d’image Wanxiang. Ces compétences sont essentiellement des encapsulations d’appels API ; un compte Alibaba Cloud et une clé API sont toujours nécessaires, ce qui ne signifie pas que l’on puisse exécuter gratuitement le modèle 2.7 en cloud localement.
Modèles open source et licences
Tongyi Wanshang n’est pas « entièrement open source ». La plateforme en ligne et le modèle cloud Wan 2.7 relèvent de services hébergés ;
GitHub officiel met à disposition des versions spécifiques du modèle, du code d’inférence et d’outils d’intégration.
Le projet open source représentatif actuel est Wan2.2, dont le dépôt est licencié sous la licence Apache 2.0. Il propose des modèles de 14 milliards de paramètres pour la génération de vidéo à partir de texte, de vidéo à partir d’images et des modèles mixtes, ainsi qu’un modèle de 5 milliards de paramètres capable de gérer simultanément la génération de vidéo à partir de texte et de vidéo à partir d’images. La version de 5 milliards de paramètres prend en charge 720P à 24 images par seconde et peut fonctionner sur des cartes graphiques grand public haut de gamme.
Les autorités ont également publié Wan2.2-Animate, destiné à l’animation des personnages et au remplacement des personnages, ainsi que Wan-Animate-2, dont les scripts de raisonnement et les poids seront mis à disposition en août 2026. Ce dernier améliore la fidélité des mouvements, le maintien de l’identité et le contrôle de la perspective par le texte, et propose une approche légère optimisée pour les seuils en temps réel ; il est également soumis à la licence Apache 2.0.
Le déploiement open source nécessite encore des GPU puissants, de l’espace pour télécharger les modèles, un environnement d’inference et une gouvernance de la sécurité ; le fait que « le code et les poids soient accessibles » ne signifie pas qu’ils offrent les mêmes fonctionnalités que la dernière version en ligne 2.7, ni que toutes les matières premières d’entrée disposent automatiquement d’une licence commerciale.
Guide d'utilisation de Tongyi Wanshang
Terminer une tâche de base
- Déterminer le public cible, la plateforme, l’aspect, la durée et les informations à communiquer ;
- Préparer des scripts, des plans ou des matériaux de référence utilisables dans Tongyi Wanshang ;
- Sélectionnez la capacité de génération vidéo Wan 2.7 pour créer une prévisualisation à bas coût ;
- Utiliser la résolution, la durée et les paramètres de contrôle pour ajuster l’image, le rythme, les sous-titres et le son ;
- Vérifier frame par frame les personnages, le texte, le logo, la forme des lèvres et l’exactitude factuelle ;
- Exporter selon les spécifications ciblées après confirmation de l’autorisation pour la musique, les portraits et les matériaux ;
Créer des flux de travail professionnels réutilisables
- Créer des scripts, des fiches de tournage, des matériaux de marque et une liste d’éléments interdits ;
- Unifier les paramètres pour la capacité de génération vidéo, la résolution, la durée et les paramètres de contrôle de Wan 2.7, ainsi que ceux pour la génération et l’édition d’images avec Wan 2.7 ;
- Testez d’abord le modèle et les limites avec des scènes représentatives ;
- Transférer les plans ratés pour un montage manuel ou une régénération ;
- Unifier les sous-titres, le volume, les couleurs et les informations de droits d’auteur en fin de film ;
- Enregistrez la version et l’auditeur avant de publier en masse ;
À qui s’adresse-t-il
- Vidéos courtes et créateurs de contenu : création de scènes narratives, d’animations, de clips vidéo, de couvertures et de contenus pour les réseaux sociaux.
- Équipe e-commerce et publicité : création d’images de scénarios produits, de présentations de mannequins, de storyboards publicitaires et de vidéos de diffusion.
- Équipe de cinéma, de vidéo et de jeux : réalisation de la conception conceptuelle, des prises de vue préliminaires, des animations des personnages et des démonstrations du monde.
- Designers et équipe de marque : création de séries visuelles, de références multiples, de fonds pour affiches et de propositions créatives.
- Développeurs et entreprises : génération en masse d’images ou de vidéos via des API, ou création d’applications sectorielles.
- Chercheurs et utilisateurs locaux : tester les modèles open source officiels tels que Wan2.2, Animate, etc.
Avantage
- Les capacités d’image et de vidéo sont regroupées au sein de la même famille de modèles, couvrant la génération, la référence et l’édition.
- La compréhension des prompts en chinois, l’affichage du texte chinois et l’accès aux services cloud nationaux sont plus faciles.
- Wan 2.7 peut générer des vidéos audio de 2 à 15 secondes, en résolution maximale 1080P, et prend en charge plusieurs caméras.
- La facturation API est transparente : les images sont facturées par pièce, les vidéos par seconde, et elle peut être déployée en Chine ou à l’international.
- L’organisation maintient en même temps les services de hébergement, les SDK/Skills ainsi que l’écosystème de modèles open source Apache 2.0.
Restrictions d'utilisation et précautions
- Le contenu généré par l’IA peut présenter une dérive dans l’identité des personnages, des erreurs sur les mains, des mouvements physiques irréalistes, des déformations du texte, un désaccord entre le son et l’image, ainsi que des changements brusques de plan.
- Les vidéos de référence peuvent améliorer la cohérence, mais elles ne peuvent pas remplacer l’examen manuel des contenus liés aux acteurs, aux produits et aux marques.
- Les contenus médicaux, financiers, journalistiques, éducatifs et publicitaires doivent également faire l’objet de vérifications factuelles ; les images générées par des modèles ne peuvent pas être considérées comme des preuves réelles.
- Avant de télécharger des photos de personnes réelles, des sons, des extraits vidéo, de la musique, des marques et des images de produits, il est nécessaire d’obtenir une autorisation pour les portraits, les sons, les droits d’auteur ou les marques ;
- Il est interdit de créer des contenus frauduleux, de simulation, pornographiques sans consentement ou tout autre contenu illégal ;
- Lors de la publication publique, il convient de respecter les règles d’identification des contenus générés par l’IA en vigueur ;
- Lorsqu’elles utilisent des API, les entreprises doivent également évaluer la localisation des données, la conservation des contenus, les droits d’accès et le risque de fuite de clés ;
Questions fréquentes
Tongyi Wanshang est-il gratuit ?
La version en ligne dispose généralement d’un quota d’essai, et Alibaba Cloud BaiLian offre également un quota gratuit limité pour certains modèles nouvellement activés ; au-delà de ce quota, des frais sont facturés en fonction des points, du statut de membre ou de l’utilisation de l’API.
Les droits réels sont déterminés selon la page affichée après connexion.
Quelle est la dernière version de Tongyi Wanshang ?
La version principale actuelle dans le cloud est Wan 2.7, qui couvre les images, la génération de vidéos à partir de texte, la génération de vidéos à partir d’images, la génération de vidéos à partir de références et l’édition vidéo. Wan2.2 est la série open source prioritaire officielle ; leurs utilisations et modes de déploiement diffèrent.
Juyi Wanshang peut-il générer des vidéos de quelle longueur ?
L’API Wan 2.7 pour la génération de vidéos prend en charge des séquences allant de 2 à 15 secondes par appel, avec une résolution de 720P ou 1080P en option. Pour des vidéos plus longues, il est généralement nécessaire de créer des plans séparés, de les étendre et de les monter ultérieurement.
Combien coûte l’API Tongyi Wanshang ?
Pour les images standard Wan 2.7 de la région de Pékin en Chine, le prix est de 0,20 yuan par image, et pour la version Pro, de 0,50 yuan par image ; pour les vidéos 2.7 générées à partir de texte, d’images ou de références en 720P, le prix est de 0,60 yuan par seconde, et en 1080P de 1 yuan par seconde.
Les prix peuvent varier en fonction des activités et des régions internationales.
Tongyi Wanshang est-il open source ?
Les plateformes en ligne et le modèle cloud Wan 2.7 ne peuvent pas être simplement qualifiés de logiciels libres. Les projets spécifiques tels que Wan2.2 officiel, Wan2.2-Animate et Wan-Animate-2 publient leur code et leurs poids, et sont soumis à la licence Apache 2.0.
Numéro d’enregistrement de sécurité publique du Guangxi : 45132202000164