Kling AI
Plateforme de création permettant la génération de vidéos, d’images et d’audio natif de haute qualité
Étiquettes :Outils vidéo IAQu’est-ce que Ke Ling AI ?
Keling AI est une plateforme de création de contenu multimodal lancée par Kuaishou, dont le nom en anglais est Kling AI. Elle offre un espace de travail complet pour la génération, l’édition et l’exportation de vidéos, d’images, d’audio, d’avatars numériques et d’effets visuels.
La série Kling 3.0 actuelle intègre encore davantage des scripts, des éléments de référence, des storyboards, des images et du son dans un même modèle. Les utilisateurs peuvent partir de texte, d’images, de références de personnages ou de vidéos existantes pour créer des publicités, des courts métrages, du contenu social et des plans conceptuels.
Fonctions principales de Ke Ling AI
- Génération de vidéos à partir de texte, avec possibilité de décrire le sujet, les actions, la scène, la caméra et le son ;
- Génération de vidéos à partir d’images, permettant aux personnages, produits ou scènes statiques de bouger de manière naturelle ;
- Kling 3.0 et 3.0 Omni prennent en charge des durées libres de 3 à 15 secondes ainsi que des storyboards intelligents ;
- L’audio original peut générer de manière synchronisée les dialogues, les sons d’ambiance, les bruits d’action et l’atmosphère ;
- Des références vidéo avec de multiples images ou personnages peuvent améliorer la cohérence entre les personnages et les objets ;
- Les frames de début et de fin, l’allongement vidéo, le contrôle du mouvement et le contrôle de la caméra facilitent une création précise ;
- Image 3.0 prend en charge la génération de texte en image, la génération d’image à partir d’une autre image, les séries d’images et des sorties en haute résolution ;
- La synchronisation labiale, les avatars numériques et les capacités de timbre sont adaptés aux voix off et au contenu de personnages ;
- Le tableau de storyboard dynamique est utilisé pour organiser les éléments, créer des nœuds et gérer des processus créatifs en plusieurs étapes ;
- L’API de plateforme ouverte permet d’intégrer des fonctionnalités telles que la vidéo, les images et l’audio dans les systèmes métier.
Kling 3.0 et 3.0 Omni
Kling 3.0 met l’accent sur le 1080p natif, des vidéos de 3 à 15 secondes, un storyboard intelligent et une synchronisation audio-visuelle. 3.0 Omni unifie davantage la compréhension multimodale, les références, la génération et l’édition, ce qui le rend adapté aux tâches impliquant plusieurs personnages, plusieurs plans et des instructions complexes.
15 secondes par fois ne correspondent pas à la création d’une vidéo complète en une seule fois ; il est possible d’allonger progressivement les segments à l’aide de l’extension Video, pour atteindre une durée totale du projet d’environ 3 minutes. L’allongement doit se faire en conservant le même modèle et le même mode, afin de réduire les dérives des personnages, de la lumière et du mouvement.
Vidéo générée à partir de texte et vidéo générée à partir d’image
La génération de vidéo à partir de texte convient de commencer par un concept, les prompts pouvant être organisés selon le sujet, l’environnement, les actions, la caméra, la lumière, le rythme et le son. La génération de vidéo à partir d’une image utilise la première image comme contrainte visuelle plus forte, ce qui est plus adapté aux produits, aux personnages et aux designs existants.
Si l’image elle-même présente des membres déformés, une perspective erronée ou du texte flou, elle sera souvent agrandie après génération. Il convient d’abord de corriger les images statiques, puis d’augmenter progressivement l’intensité du mouvement et la complexité de la caméra.
Audio original synchronisé avec les lèvres
Les modèles associés aux vidéos 2.6 et 3.0 permettent de générer en même temps des dialogues, des commentaires, des sons d’ambiance et des effets sonores d’action lors de la création des images. La génération native facilite davantage l’alignement du rythme que le montage a posteriori, mais les dialogues multiples, les prononciations en langue étrangère et les phrases longues nécessitent encore une écoute attentive.
La synchronisation labiale peut associer du texte à la voix ou à l’audio pour des vidéos existantes, et permet de désigner les visages cibles dans des scènes impliquant plusieurs personnes. Avant la publication, il convient de vérifier les mouvements des lèvres, la qualité du son, les droits sur le texte ainsi que les autorisations d’utilisation de la voix.
Références de personnages et cohérence
All-in-One Reference et Element Library permettent d’identifier les caractéristiques des personnages et des scènes à l’aide d’images sous différents angles ou de vidéos courtes de personnages. Ils conviennent bien pour des séries de courts métrages et des personnages de marque, mais les obstacles, les angles extrêmes et les transformations rapides peuvent encore entraîner une dérive identitaire.
Contrôle des mouvements, des plans et des frames de début et de fin
Le contrôle du mouvement permet de faire bouger les personnages à l’aide d’animations de référence, tandis que le contrôle de la caméra sert à créer des effets tels que le zoom avant/arrière, le balayage, le déplacement et la rotation. Les frames de début et de fin génèrent des transitions entre deux images spécifiées, idéales pour les changements de scène, les variations de produits et la narration visuelle.
Plus il y a de contraintes, ce n’est pas nécessairement plus stable ; des mouvements conflictuels, une composition et des instructions de caméra peuvent réduire les chances de succès. Les plans complexes conviennent d’être divisés en plusieurs segments courts, puis montés à l’aide de logiciels de post-production.
Génération d’images et toile animée par l’esprit
Le modèle d’image prend en charge le texte, les images de référence, diverses proportions et la génération en série, permettant de créer à l’avance les personnages, les scènes et les frames clés pour une vidéo. Le tableau de dessin intelligent place les éléments et les étapes de génération dans un espace visuel, facilitant les essais par branches et l’organisation des actifs.
Personnages numériques et effets visuels créatifs
La fonction de personnage numérique permet de générer des voix off à partir de matériel visuel et audio, idéale pour les cours, le marketing et les contenus multilingues. Les effets de template permettent d’utiliser rapidement des formats populaires, mais la homogénéisation est marquée ; les projets de marque devraient affiner davantage leur aspect visuel et leur narration.
Comparaison des capacités de l’IA Keling
| Capacité | Principales importations | Sortie principale | Scénarios d’application |
|---|---|---|---|
| Vidéo générée par modèle de langage | Scénario écrit et description des plans | Vidéo avec image ou audio | Concepts, publicité et courts métrages |
| Vidéos TuSheng | Images et indications d’action | Plan dynamique pour maintenir une référence visuelle | Produits, personnages et animations de affiches |
| Référence Omni | Personnages, scènes, plusieurs images ou vidéos | Contenu multi-caméras plus cohérent | Histoires en série et personnages de marque |
| Frame de début et de fin | Graphe de départ et graphe de fin | Transition continue entre deux frames | Transitions et démonstrations de changement |
| Synchronisation labiale | Vidéo, dialogues ou audio | Vidéo de correspondance des lèvres | Personnages numériques et dialogues de personnages |
| Prolongement de la vidéo | Il existe déjà des vidéos de Keling. | Ajout successif de segments | Objectif zoom et narration longue |
Membres de Ke Ling AI et valeur d’inspiration
Keling AI propose une combinaison d’essai gratuit, de abonnement et de rechargement de points d’inspiration. Le nom du compte, le montant offert, les accès prioritaires et les prix varient en fonction de la version chinoise, de la version internationale, du site web, de l’application store ainsi que des promotions ; il convient de se référer à la page d’achat officielle après connexion.
| Moyens de paiement | Prix ou règles | Utilisation principale | Période de validité |
|---|---|---|---|
| Utilisateurs gratuits | Selon l’activité du compte et l’affichage de la page | Découvrez des images, des vidéos et des modèles. | La limite gratuite est déterminée selon les règles de l’événement. |
| Membre individuel | Affichage en temps réel sur la page d’achat | Valeurs d’inspiration mensuelles, accès rapide, haute définition et suppression de watermark, etc. | Période d’abonnement |
| Équipe et entreprise | Forfait ou offre de vente | Espace d’équipe, allocation des ressources, gestion et production en série | Période du contrat ou de l’abonnement |
| Recharger la valeur d’inspiration | Dans la version chinoise, 1 yuan = 10 points d’inspiration | Déduction selon la tâche générée | 2 ans à partir de la date de rechargement |
| Valeur d’inspiration mensuelle du membre | Fourni avec le forfait | Création par l’IA pendant la période d’abonnement | 1 mois à partir de la date de distribution |
| Points d’inspiration pour chaque connexion quotidienne | Pendant la période de l’événement, montant variable | Expérience du jour | Zéro à minuit ce jour-là |
Une valeur d’inspiration est déduite au début de la tâche de génération ; si le système juge que la génération échoue, elle est annulée. Les différents types de tâches, modèles, résolutions, durées et modes entraînent des consommations différentes, et le compte utilise en priorité les crédits dont la date d’expiration est la plus proche.
La valeur d’inspiration ne peut pas être échangée contre de l’argent ou des abonnements ordinaires, ni transférée entre comptes personnels. Les administrateurs d’équipe et d’entreprise peuvent allouer les ressources dans les espaces correspondants conformément aux règles de la plateforme.
Prix de l’API de KeLing AI
La plateforme ouverte utilise des forfaits de ressources prépayés et un tarif par unité : 1 Unité correspond à 1 yuan sur la plateforme ouverte en Chine, et à 0,14 dollar américain dans les exemples de la plateforme internationale. Ce sont les tarifs de base actuels de l’API vidéo Kling 3.0 Turbo ; pour les autres modèles et fonctionnalités, veuillez consulter le tableau des prix de l’API en temps réel.
| Modèles et schémas | 720P | 1080P | 4K |
|---|---|---|---|
| Kling 3.0 Turbo audio | 0,8 unité/seconde | 1,0 unité/seconde | Pas encore marqué |
| Kling 3.0 Turbo silencieux | 0,6 unité/seconde | Se référer à la page des prix | Se référer à la page des prix |
| Autres modèles vidéo | Par modèle, mode et nombre de secondes | Par modèle, mode et nombre de secondes | Articles pris en charge par page de prix |
| Images, audio et édition | Facturation par feuille, par fois, par seconde ou selon une fonction spécifique | ||
Par exemple, pour 10 secondes en 720P avec son et 3.0 Turbo, la consommation de base est de 8 Units, tandis qu’en 1080P c’est 10 Units, sans prise en compte de réductions ou de différences de packs de ressources. Le prix de l’API est indépendant du statut de membre créateur personnel ; on ne peut pas supposer que les points d’inspiration du membre puissent être directement déduits du coût de l’API pour le développeur.
Guide d'utilisation de Keling AI
Générer une vidéo utilisable
- Déterminer la plateforme cible, le ratio, la durée et s’un son est nécessaire ;
- Écrire les indications en sujet, scène, action, plan, lumière et atmosphère ;
- Lorsqu’il y a des personnages ou des produits, préparez d’abord des références propres sous plusieurs angles ;
- Testez d’abord la composition avec une durée plus courte et des mouvements modérés ;
- Une fois la version stable choisie, ajoutez l’audio, les objectifs ou le mode professionnel ;
- Utiliser des prolongements ou des storyboards pour créer les plans suivants ;
- Après l’export, vérifiez les clignotements, la forme des lèvres, les mains, le texte, les droits d’auteur et les spécifications de la plateforme.
Créer une série de courts métrages avec des personnages cohérents
- Créer des références du personnage de face, de profil, de corps entier et d’expression ;
- Maintenir la cohérence des vêtements, de la coiffure, des accessoires et de la description des scènes ;
- Ajouter le rôle à la Bibliothèque d’éléments ou à la référence multimodale ;
- Diviser l’histoire en plusieurs plans de 3 à 15 secondes ;
- Changer seulement un mouvement principal ou une position à la fois ;
- Prolonger en utilisant le même modèle, la même taille d’image et les mêmes réglages de couleur ;
- Unifier le son, les couleurs, les sous-titres et le rythme dans le logiciel de montage.
Génération en masse via l’API
- Finaliser la création du compte, l’authentification et la configuration du paquet de ressources sur la plateforme ouverte ;
- Stocker la clé d’accès dans Secrets du serveur ;
- Soumettre le modèle, les prompts, les paramètres de durée et de résolution selon le document ;
- Enregistrer le numéro de la tâche et effectuer une consultation asynchrone ou recevoir les résultats ;
- Réessayer en cas d’échec, de délai dépassé, de limitation du trafic et de modération du contenu ;
- Enregistrer la consommation d’Unit par tâche et le coût de production du produit fini ;
- Après téléchargement, effectuer un contrôle de qualité avant de livrer ou de le publier en ligne.
À quels utilisateurs convient Keling AI ?
- Créateur de vidéos courtes : génération de scénarios, voix off, transitions et effets visuels ;
- Équipe publicité et e-commerce : création de vidéos produits et de clips marketing ;
- Professionnels du cinéma et de l’animation : répétition des plans, des prises de vue et des mouvements des personnages ;
- Concepteur : Transformer les affiches, les illustrations et les designs de personnages en contenu dynamique ;
- Équipe de l’éducation et de la formation : création de podcasts numériques et de segments explicatifs ;
- Équipe de jeu : Vérifier les scènes, les séquences intermédiaires et l’originalité des animations des personnages ;
- Développeurs et entreprises : génération en masse et intégration de workflows via des API.
Les avantages de Keling AI
- Vidéos, images, audio, avatars numériques et outils d’édition assez complets ;
- La série 3.0 prend en charge des plans plus longs, un audio natif et un découpage intelligent ;
- Les personnages, les scènes et les références multimatérielles aident à maintenir la cohérence ;
- Prend en charge plusieurs formats d’image, frames de début et de fin, extension et contrôle d’action ;
- Les modèles de pages web, mobiles et communautaires couvrent différentes façons de créer ;
- Les règles de niveau d’inspiration en Chine et le taux de conversion pour les recharges standards sont relativement clairs ;
- Fournir une API de plateforme officiellement ouverte et des documents sur la facturation par fonctionnalité.
Restrictions d'utilisation et précautions
- Les membres complexes, les obstacles multiples et les mouvements rapides peuvent encore provoquer des distorsions ;
- Les personnages, les costumes, la lumière et les détails peuvent varier d’une prise à l’autre ;
- Dans les dialogues originaux, il peut y avoir un décalage entre la prononciation, l’émotion ou les mouvements des lèvres ;
- La consommation par génération dépend du modèle, de la durée, du son et de la résolution ;
- Les points d’inspiration offerts aux membres expirent généralement au bout d’un mois et ne peuvent pas être accumulés sur le long terme.
- Recharger le niveau d’inspiration n’équivaut pas aux avantages réservés aux membres, tels que la haute définition ou l’élimination des watermarks.
- La création de vidéos nécessite encore du montage, du color grading, des sous-titres et un contrôle de qualité ;
- Les portraits de personnes réelles, les voix, les marques et les éléments protégés par le droit d’auteur doivent faire l’objet d’une autorisation préalable.
Utilisation commerciale, vie privée et sécurité du contenu
La possibilité d’utiliser les sorties de Keling AI à des fins commerciales dépend des accords d’utilisation actuels, des avantages offerts par les forfaits, des droits sur les matériaux fournis et de la législation en vigueur. La licence de la plateforme ne peut pas remplacer les autorisations tierces nécessaires pour l’utilisation de portraits, de voix, de musique, de marques, de matériel cinématographique et de références d’entraînement.
Les résultats de l’IA peuvent ressembler à des œuvres existantes ou contenir des éléments qui ne peuvent pas faire l’objet d’un enregistrement de droit d’auteur. Les publicités de haute valeur, les projets cinématographiques et les marques doivent conserver les prompts, les matériaux de référence, les archives de génération ainsi que les modifications manuelles, et faire l’objet d’une vérification juridique.
- Ne téléchargez que des images et des vidéos qui vous appartiennent, pour lesquelles vous disposez d’une autorisation ou dont l’utilisation est autorisée ;
- Il est interdit de cloner la voix d’une personne réelle ou de créer des avatars numériques trompeurs sans consentement explicite.
- Vérifier l’eau marquée, l’identité des personnes, les marques déposées et le contenu sensible avant la publication ;
- Indiquer si le contenu est généré ou synthétisé par l’IA en fonction des exigences de la plateforme et de la région ;
- Les clés API ne sont stockées que du côté serveur, avec des quotas et un contrôle d’accès définis ;
- Avant que les données confidentielles ne soient transférées dans le cloud, il convient de vérifier les conditions de confidentialité et le contrat d’entreprise.
API, GitHub et explications sur le logiciel open source
La plateforme ouverte CleverAI propose la génération de vidéos à partir de texte, la génération de vidéos à partir d’images, l’allongement de vidéos, la synchronisation des lèvres, ainsi que des API pour les images et autres médias, en utilisant un système de tâches asynchrones. Les comptes pour abonnés individuels, la plateforme ouverte nationale et les API internationales peuvent présenter des systèmes de ressources et de prix différents.
Le modèle central Keling 3.0, la plateforme de création en ligne et les services de raisonnement ne sont pas des projets open source. Kuaishou et l’équipe de recherche de Keling ont publié sur GitHub certains articles scientifiques et du code de recherche, mais cela ne permet pas de déployer en privé le modèle commercial actuel de Keling.
Questions fréquentes
Keling AI est-il gratuit ?
Il est possible de tester gratuitement certaines fonctionnalités ; les quotas quotidiens ou spécifiques aux activités sont indiqués sur la page du compte. Les modèles avancés, le passage rapide, la haute définition, la suppression des watermarks et une génération en grande quantité nécessitent généralement un abonnement ou des points d’inspiration.
Combien vaut l’inspiration ?
La conversion officielle chinoise standard est de 1 yuan renminbi égal à 10 unités d’inspiration ; des promotions peuvent offrir des avantages. La consommation réelle pour chaque génération varie en fonction du modèle, de la durée, du son et de la qualité.
Quelle est la longueur maximale d’une vidéo que Canling AI peut générer à la fois ?
La série Kling 3.0 peut générer des segments réussis de 3 à 15 secondes par tâche, avec une possibilité d’allongement progressif ; la durée totale d’un projet peut atteindre environ 3 minutes. La durée réellement utilisable est limitée par le modèle et les fonctionnalités.
Keling AI propose-t-il une API ?
La plateforme ouverte propose des fonctionnalités de vidéo, d’image, d’audio et d’édition, et facture en fonction de paquets de ressources ou d’unités. Les développeurs doivent calculer les coûts en se référant à la page des prix API en temps réel.
Keling AI est-il open source ?
Non, le modèle de génération du noyau Keling et la plateforme commerciale ne sont pas open source. Le dépôt de publications publié par l’équipe de recherche officielle n’est pas équivalent aux poids du modèle Kling 3.0 ou au service complet.
Numéro d’enregistrement de sécurité publique du Guangxi : 45132202000164