LALAL.AI
Valeur ajoutée gratuite
Guide complet des outils d’IA Outils audio IA

LALAL.AI

Plateforme utilisant l’IA pour séparer la voix, l’accompagnement et les pistes de différents instruments

Étiquettes :

Qu’est-ce que LALAL.AI ?

LALAL.AI est une plateforme de séparation des sources musicales et vocales basée sur des réseaux de neurones, capable de décomposer des audio ou vidéos mixés en voix humaine, accompagnement et stems de différents instruments. Elle propose également des outils tels que Voice Cleaner, suppression d’écho et de réverbération, séparation du chanteur et des harmonies, Voice Changer, Voice Cloner, etc., et est disponible sur le web, sur ordinateur, sur smartphone, en tant que plugin VST et via une API pour développeurs.

Il est adapté à la création d’accompagnements, au mixage, à l’échantillonnage, aux pistes d’exercice, au nettoyage des dialogues et à la réédition du contenu. La séparation par IA ne permet pas d’obtenir un enregistrement brut : lorsque plusieurs sons se superposent à la même fréquence et au même moment, le résultat peut encore présenter des interférences, des problèmes de phase, un son métallique et des pertes dans les hautes fréquences.

Vocal Remover : séparation de la voix et de l’accompagnement

Vocal Remover permet de séparer une chanson en deux pistes : la voix et l’accompagnement, afin d’utiliser celle-ci pour le karaoke, les exercices de reprise, les remix, l’extraction des dialogues et l’analyse de référence. L’utilisateur peut d’abord écouter une prévisualisation avant de décider s’il souhaite traiter le fichier et télécharger le résultat complet.

Lorsqu’il y a un fort réverbère sur le chanteur, un chœur multiple, une guitare déformée et que les fréquences vocales sont proches, des éléments vocaux peuvent persister dans l’accompagnement, et des cymbales ou des synthétiseurs peuvent également être intégrés aux voix séparées. Pour les projets destinés à une publication, il convient de comparer plusieurs paramètres de réseau et de traitement.

Séparation des 10 types de tiges

Les 10 types de séparation disponibles dans le cloud actuellement incluent : Vocal and Instrumental, Drums, Bass, Electric Guitar, Acoustic Guitar, Piano, Synthesizer, Voice and Noise, String Instruments et Wind Instruments.

L’utilisateur peut changer de destination pour le même fichier téléchargé, sans avoir à le télécharger à nouveau à chaque fois.

Ces options présentent généralement deux résultats distincts pour le Stem cible et le reste du contenu, et ne correspondent pas à la création d’un projet complet de 10 pistes en une seule fois. Le calcul des minutes actuelles est également multiplié par le nombre de types de séparation sélectionnés, ce qui entraîne une augmentation de la consommation lorsqu’on choisit plusieurs types de Stem en même temps.

Réseau neuronal Andromeda

Andromeda est le réseau Audio Transformer de nouvelle génération que LALAL.AI utilise actuellement en priorité ; il sert de choix par défaut pour les catégories Vocal and Instrumental, Voice and Noise ainsi que pour les outils associés, et a été étendu aux domaines Drums et Bass. Selon les données officielles, son volume de données d’entraînement est environ quatre fois supérieur à celui de Perseus, ce qui lui permet d’atteindre une vitesse de traitement jusqu’à 40 % plus élevée sur les benchmarks et une amélioration de l’SDR d’environ 10 %.

Ce sont les résultats des tests officiels, qui ne reflètent pas que chaque chanson voit son amélioration à un niveau identique. La plateforme conserve toujours des réseaux tels que Perseus et Orion pour comparer certaines tâches ;

L’utilisateur doit écouter des essais avec ses propres matériaux difficiles, et non se fier uniquement à l’ancienneté ou à la nouveauté du modèle.

Voice Cleaner Nettoyage de la voix

Voice Cleaner permet de séparer la voix du bruit dans les enregistrements, en réduisant la musique d’arrière-plan, le bourdonnement du micro, les sons explosifs, le bruit ambiant et autres perturbations. Il est idéal pour les podcasts, les interviews, les cours en ligne, les réunions ainsi que les dialogues de films et de séries.

Lorsque le bruit chevauche fortement la voix, ou que l’enregistrement a déjà subi du clipping, les résultats de nettoyage peuvent être déformés. Voice Cleaner n’est pas conçu pour réduire le bruit en temps réel lors des appels, et il ne peut pas restituer les informations vocales qui n’ont pas été capturées par le micro.

Écho et Réverb Rémoleur

Les outils de réduction d’écho et de réverbération permettent de rendre les voix, les chansons ou les dialogues vidéo aux sonorités trop pleines plus secs, ce qui facilite le remixage ou améliore la compréhension. Le Stem Splitter propose également des paramètres de contrôle de la réverbération vocale et des fonctionnalités de suppression d’écho.

Le réverbère peut lui-même faire partie d’une œuvre musicale ; en l’enlevant complètement, on modifie l’atmosphère, les résonances et le timbre. Il est conseillé de tester d’abord différentes intensités et de conserver le fichier original pour des comparaisons A/B.

Séparer les voix principales des chœurs de soutien

Le Lead/Back Splitter permet de séparer davantage le chanteur des harmonies, ce qui est idéal pour créer des pistes d’exercice, réorganiser les couches vocales et analyser l’arrangement. Le flux de travail officiel sur poste de travail et en cloud peut générer le chanteur, les harmonies ainsi que le reste du contenu correspondant.

Les harmonies, le chant en chœur, la superposition audiovisuelle et de nombreux effets réduisent la précision de la distinction. Les résultats de séparation ne permettent pas d’identifier un chanteur en particulier, ni d’obtenir automatiquement les droits d’utilisation d’une interprétation vocale.

Changeur de voix et Clonateur de voix

Voice Changer permet de modifier les voix dans de la musique, des enregistrements et des vidéos, le temps étant déduit au minute par minute de durée de sortie générée. Voice Cloner permet aux utilisateurs d’entraîner un ensemble vocal personnel à partir de leurs propres enregistrements, afin d’obtenir une voix synthétique cohérente.

Il est uniquement permis de cloner sa propre voix ou des voix pour lesquelles une autorisation explicite a été obtenue. Il est interdit d’utiliser la voix de célébrités, d’employés, de clients ou de personnes ordinaires à des fins de usurpation d’identité, de fraude, de tromperie ou de promotion commerciale sans consentement.

Les scènes sensibles doivent également être marquées pour la voix synthétique.

Format d’entrée et de sortie

Les formats audio pris en charge publiquement sur la version desktop incluent MP3, OGG, WAV, FLAC, AIFF, AAC et M4A, tandis que pour les vidéos on trouve AVI, MP4, MKV, MOV et M4V. Dans le cloud, les résultats audio peuvent être exportés en MP3, WAV, FLAC, OGG, AAC ou AIFF, ou bien le format d’origine peut être conservé par défaut.

Les artefacts de compression présents dans le fichier source perteux seront davantage amplifiés par le modèle de séparation. Pour une production musicale importante, il est préférable d’utiliser un fichier source sans perte, et de vérifier après téléchargement le taux d’échantillonnage, la profondeur de bit, le niveau de loudness, la synchronisation ainsi que la longueur des en-têtes et des pieds de fichier.

Plan gratuit Starter

Starter est gratuit à vie, offrant 10 minutes par mois dans la file d’attente Relaxed, une taille maximale de fichier de 200 MB et une prévisualisation gratuite des résultats, mais il n’est pas possible de télécharger les résultats complets et il ne prend pas en charge le traitement en masse. Il convient pour évaluer la qualité d’un court segment de matériel difficile, plutôt que pour mener à bien un projet officiel.

Starter ne dispose pas de Fast Queue. La Relaxed Queue traite les demandes en fonction de la capacité disponible du serveur, et le temps d’attente varie en fonction de la charge ;

Les minutes gratuites et leur état de renouvellement et d’utilisation sont indiqués selon le compte.

Comparaison des prix et des versions

Forfait ou versionPrix, plafonds et avantages clés
Prix d’abonnement LiteLe prix annuel de Lite est de 90 dollars, soit 7,5 dollars par mois. Le forfait actuel comprend une file d’attente Relaxed illimitée, 90 minutes par mois dans la file Fast, une taille maximale de fichier de 2 GB, le téléchargement des résultats complets et le traitement en masse, avec la possibilité de partager les crédits du compte sur Web, ordinateur et appareils mobiles. Lite ne comprend pas de plugins VST, de traitement local par Lyra ni d’API. Les utilisateurs qui ont besoin d’un traitement peu fréquent mais sans urgence peuvent compter sur une file d’attente Relaxed illimitée ; une fois les minutes Fast épuisées, le système passe automatiquement en mode Relaxed, avec une qualité identique mais une priorité de vitesse différente.
Prix de l’abonnement ProLe prix annuel Pro est de 180 dollars, soit 15 dollars par mois, et inclut une file d’attente Relaxed illimitée, 250 minutes par mois dans la file Fast Queue, 2 GB de stockage pour les fichiers, le téléchargement des résultats, le traitement en batch, l’accès en priorité aux nouvelles fonctionnalités, ainsi que des plugins VST, une API et un traitement local via Lyra sur ordinateur. Pro convient aux producteurs, développeurs et utilisateurs qui privilégient le traitement hors ligne. Le site officiel peut également afficher différents montants par mois ; le prix indiqué correspond au tarif annuel en vigueur ; les taxes, la monnaie et les promotions sont celles indiquées sur la page de paiement.

Prix d’abonnement Lite

Le prix annuel Lite est de 90 dollars, soit 7,5 dollars par mois. Le forfait actuel comprend une file d’attente Relaxed illimitée, 90 minutes par mois dans la file d’attente Fast, une taille maximale de fichier de 2 GB, le téléchargement des résultats complets et le traitement en batch, avec la possibilité de partager les crédits du compte sur Web, ordinateur et appareils mobiles.

Lite ne comprend pas de plugins VST, de traitement local Lyra ni d’API. Les utilisateurs ayant besoin de fréquences basses mais qui ne sont pas pressés peuvent compter sur la file d’attente Relaxed infinie ;

Une fois les minutes Fast écoulées, le système passe automatiquement en file Relaxed, avec une qualité identique mais une priorité de vitesse différente.

Prix de l’abonnement Pro

Le prix annuel Pro est de 180 dollars, soit 15 dollars par mois, et inclut une file d’attente Relaxed illimitée, 250 minutes par mois dans la file Fast Queue, 2 GB de stockage pour les fichiers, le téléchargement des résultats, le traitement en batch, l’accès prioritaire aux nouvelles fonctionnalités, ainsi que des plugins VST, une API et un traitement local via Lyra sur ordinateur.

Pro est adapté aux producteurs, développeurs et utilisateurs qui privilégient le traitement hors ligne. Le site officiel peut également afficher des montants différents par mois, tandis que le catalogue indique le tarif équivalent pour un abonnement annuel en cours d’année.

Les taxes, la monnaie et les promotions sont celles indiquées sur la page de paiement.

File rapide et file décontractée

Les deux files d’attente utilisent la même qualité de séparation. Au début de chaque mois de facturation, les tâches payantes consomment d’abord les minutes Fast ;

Une fois la limite Fast épuisée, l’utilisateur passe automatiquement en file Relaxed sans durée limitée ; il n’est pas possible de basculer manuellement entre les deux.

Les minutes Fast non utilisées ne sont pas reportées et sont réinitialisées au cycle suivant. En annulant, vous pouvez utiliser les fonctionnalités payantes et le solde jusqu’à la fin du cycle en cours, puis revenir au mode Starter ; les minutes Fast restantes deviennent invalides et vous ne disposez plus d’une file d’attente Relaxed illimitée.

L’abonnement n’est pas remboursable en fonction du temps restant.

Comment calculer les minutes ?

Le traitement standard est déduit en fonction de la durée du fichier. Vocal Remover et Stem Splitter sont calculés selon la formule « durée du fichier multipliée par le nombre de types de séparation sélectionnés » ; par exemple, pour une chanson de 10 minutes avec 3 types de stems sélectionnés, cela équivaut à 30 minutes.

Le changement de voix déduit le temps nécessaire à la génération du résultat.

Par conséquent, les minutes Fast ne correspondent pas simplement à la durée totale des chansons pouvant être téléchargées. Avant de lancer un traitement par lots de plusieurs stems, il convient d’abord de calculer le nombre de pistes cibles et, si nécessaire, de vérifier le réseau et les paramètres à l’aide d’une prévisualisation.

Top-Up minutes supplémentaires

Il est possible d’acheter des forfaits supplémentaires Fast Queue d’un usage unique sans changer de abonnement : Master 750 minutes pour 50 dollars, Premium 3000 minutes pour 190 dollars, Enterprise 5000 minutes pour 300 dollars. Les minutes supplémentaires, les fonctionnalités disponibles et le statut d’activation doivent être confirmés sur la page d’achat.

Les anciennes informations décrivaient souvent LALAL.AI comme des forfaits permanents à durée déterminée Lite, Plus et Pro, ce qui ne correspond plus aux tarifs affichés sur le site officiel actuel. Les options principales actuelles sont les abonnements Starter, Lite et Pro, complétés par des recharges Top-Up pour obtenir des minutes Fast supplémentaires.

Application de bureau

LALAL.AI Desktop prend en charge Windows 10/11, macOS 10.15 ou une version ultérieure, ainsi que Ubuntu 22.04 ou une version ultérieure. Les fonctionnalités en mode cloud sont similaires à celles du site web : il est possible de sélectionner en masse jusqu’à 20 fichiers audio ou vidéo, et de définir un répertoire de sortie local.

Les applications de bureau peuvent être téléchargées gratuitement, mais un compte payant est nécessaire pour un téléchargement complet. Le traitement en cloud nécessite une connexion Internet et consomme des minutes partagées.

Le compte peut être connecté sur plusieurs appareils.

Séparation de piste hors ligne locale Lyra

Les utilisateurs Pro peuvent utiliser le modèle local Lyra sur leur ordinateur de bureau : les fichiers ne sont pas uploadés sur le serveur, le traitement peut se faire hors ligne, et il n’y a pas de déduction des minutes Fast ou Relaxed ; une connexion Internet est uniquement requise occasionnellement pour valider l’abonnement. Lyra peut être activé simultanément sur un maximum de 3 ordinateurs.

Actuellement, Lyra locale prend en charge 7 catégories : Vocaux, Instrumental, Batterie, Bass, Piano, Guitare acoustique et Guitare électrique, ce qui est moins que les 10 catégories disponibles dans la version cloud, et elle ne dispose pas de toutes les options exclusives à la version cloud. Le matériel peut faire appel à une GPU ou à une NPU pour accélérer le traitement, et la vitesse réelle dépend du dispositif.

Plug-in VST

Le plugin VST fait partie de la solution Pro et permet d’extraire localement les stems directement dans des DAW compatibles, ce qui le rend adapté aux workflows de Logic, Ableton Live, FL Studio, Cubase, Reaper, etc. Le plugin utilise le modèle offline Lyra, ne télécharge pas d’audio et ne consomme pas de minutes.

Le format des plugins, la compatibilité avec les DAW, le système d’exploitation et le nombre de dispositifs autorisés doivent se référer à la page de téléchargement et au EULA. Les modèles hors ligne conviennent mieux pour des itérations rapides, tandis que les séparations finales complexes peuvent être comparées aux résultats en cloud d’Andromeda.

Application mobile

Des applications officielles pour iPhone, iPad et Android sont disponibles, permettant de télécharger des chansons et des vidéos, ainsi que de visualiser et de télécharger les résultats séparément. L’abonnement est partagé entre les minutes, le Web et la version desktop, et n’est pas délivré séparément pour chaque plateforme.

Les appareils mobiles conviennent pour une extraction et une écoute rapides, tandis que la gestion de fichiers volumineux, le traitement en masse et le montage professionnel sont généralement plus adaptés aux ordinateurs de bureau. Lors de l’achat via l’application store, le prix et l’endroit de gestion des abonnements peuvent différer de ceux sur le site web.

API

LALAL.AI propose une API publique v1 qui permet de télécharger des fichiers pour obtenir un ID de source, de soumettre des tâches de séparation, de consulter l’état, d’obtenir les résultats, ainsi que de supprimer les fichiers sources et les Stems sur le serveur. L’API couvre des fonctionnalités telles que plusieurs Stems, Voice Cleaner, Voice Changer, Voice Cloning, etc., et l’accès au plan Pro est disponible.

L’API s’authentifie à l’aide d’un jeton de licence. En environnement de production, le jeton doit être stocké du côté serveur, afin de gérer l’expiration des fichiers, les requêtes asynchrones, la concurrence, les tentatives de réessai en cas d’échec, les demandes de suppression et les déclarations de droits d’auteur des utilisateurs.

Pour des quantités élevées ou des produits intégrés, veuillez contacter les solutions commerciales.

GitHub et l’état open source

L’entité officielle OmniSale GmbH a publié sur GitHub des exemples d’API LALAL.AI ainsi que des ressources OpenAPI pour aider les développeurs à effectuer le téléchargement, la séparation, le nettoyage et la consultation des tâches. Ces exemples ne représentent pas une open source du modèle principal.

Les codes d’entraînement et les poids complets d’Andromeda, Perseus, Orion et Lyra ne sont pas publiés ; LALAL.AI relève globalement d’un service commercial propriétaire. Des projets open source similaires tels que Demucs n’ont aucun lien officiel avec LALAL.AI.

Droits d’auteur et utilisation commerciale

Les techniques de séparation ne créent pas pour les utilisateurs de droits d’auteur sur la chanson originale, la voix, l’accompagnement ou les échantillons. Pour les reprises, les remix, les bandes originales de films, les publicités, les données d’entraînement et les publications commerciales, il reste nécessaire d’obtenir des autorisations pour l’enregistrement, les paroles et la musique, la performance, l’identité artistique ainsi que les échantillons.

Même une extraction de quelques secondes peut constituer du matériel protégé. Les masters non publiés et les projets confidentiels font l’objet d’un traitement local prioritaire par Lyra Pro, avec vérification des conditions du produit et des exigences de sécurité de l’organisation.

Guide d'utilisation de LALAL.AI

Terminer une tâche de base

  1. Inscrivez-vous sur LALAL.AI et créez une clé API réservée uniquement à l’environnement de test ;
  2. Sélectionner le modèle en fonction du type d’entrée, du contexte, de la qualité, de la vitesse et du prix ;
  3. Appeler d’abord Vocal Remover pour séparer la voix et l’accompagnement, effectuer la demande minimale et vérifier la structure de retour ;
  4. Utiliser ensuite 10 types de Stem pour séparer les sorties en flux, les paramètres et les réponses aux exceptions ;
  5. Enregistrer les tokens, le nombre d’appels, le délai, le taux d’erreurs et le coût par appel ;
  6. Transférez la clé dans le gestionnaire de clés du serveur avant de l’intégrer à l’application officielle ;

Créer des flux de travail professionnels réutilisables

  1. Utiliser des clés et des quotas différents pour les environnements de développement, de test et de production ;
  2. Utiliser Vocal Remover pour séparer la voix du accompagnement, 10 types de séparation de stems et le réseau neuronal Andromeda pour créer un ensemble d’évaluation représentatif ;
  3. Définir les délais d’attente, la concurrence, les tentatives de réessai, le throttling et les plafonds budgétaires ;
  4. Effectuer des vérifications sur la sortie en ce qui concerne les faits, la sécurité, le format et les informations sensibles ;
  5. Surveiller les changements de version, de prix, de délai et de taux d’échec des modèles de surveillance ;
  6. Préparer des plans de dégradation du modèle, de coupure et de prise en main manuelle ;

À qui s’adresse-t-il ?

  • Musiciens qui créent des accompagnements pour karaoke, des remixs et des samples ;
  • Apprenants qui extraient des pistes d’entraînement pour la batterie, le basse, la guitare, le piano, etc. ;
  • Équipe chargée de nettoyer le contenu des dialogues, des podcasts et des enregistrements de cours ;
  • Un producteur qui a besoin de séparer le chanteur des harmonies, d’enlever le réverbère et de comparer plusieurs modèles ;
  • Utilisateurs professionnels qui créent des workflows via VST, des modèles locaux hors ligne ou des API.

Avantages du produit

  • Le cloud propose 10 types d’options Stem et diverses réseaux neuronaux ;
  • Couvre les pistes musicales, le réduction du bruit de voix, la suppression du réverbère et la séparation des couches vocales ;
  • Prend en charge le Web, les trois principaux systèmes d’exploitation de bureau, iOS et Android ;
  • Pro propose un traitement hors ligne Lyra sans décompte de minutes ainsi que VST ;
  • Le forfait payant offre une file d’attente Relaxed illimitée ;
  • Il existe une API officielle, des documents et des exemples officiels sur GitHub.

Restrictions et précautions

  • Le Starter gratuit ne permet pas de télécharger les résultats complets ;
  • Aucun report de minutes rapide, des frais supplémentaires Stem sont facturés en multipliant la durée du fichier par le nombre de types ;
  • Le temps d’attente de RelaxedQueue n’est pas fixe ;
  • La séparation par IA peut encore entraîner du bruit de couplage, des pertes de phase et de timbre ;
  • La Lyra locale n’appartient qu’à Pro et Stem avec moins de paramètres que dans le cloud ;
  • Le modèle central n’est pas open source, et l’utilisation des résultats obtenus ne confère pas automatiquement de droits d’auteur ni de licence commerciale.

Questions fréquentes

LALAL.AI est-il gratuit ?

Le Starter est gratuit à vie, avec 10 minutes par mois dans la file d’attente Relaxed ; il permet de télécharger et de prévisualiser, mais pas de télécharger le résultat complet. Un téléchargement complet nécessite Lite ou Pro.

Combien coûte LALAL.AI ?

Lite : 90 dollars par an, soit 7,5 dollars par mois ; Pro : 180 dollars par an, soit 15 dollars par mois.

Il existe également des recharges de 750, 3000 et 5000 minutes Fast.

Est-il possible de diviser en 10 pistes audio complètes d’un coup ?

La plateforme prend en charge la séparation de 10 types d’objets, mais généralement, elle génère le contenu en fonction du Stem sélectionné et du reste, et chaque type de séparation augmente la consommation en minutes ; il n’est donc pas possible de générer les 10 pistes complètes en une seule fois.

Peut-on l’utiliser hors ligne ?

Oui. Les utilisateurs Pro peuvent utiliser les modèles locaux de Lyra dans les applications de bureau ou VST ; l’audio n’est pas téléchargé et aucun temps d’utilisation n’est déduit, mais moins de stems sont disponibles en local par rapport au cloud.

LALAL.AI a-t-il une API ?

Oui. Pro met à disposition une API publique v1, avec des documents officiels, des spécifications OpenAPI et des exemples sur GitHub.

LALAL.AI est-il open source ?

Pas de code source open source. Seuls des exemples d’API et d’autres ressources d’intégration sont rendus publics par les développeurs ; les modèles clés tels qu’Andromeda et Lyra, ainsi que leurs poids, ne sont pas divulgués.

©️Droit d’auteur : Sauf indication contraire, tous les articles de ce site sont protégés par le droit d’auteur.Partage d’outils d’IATous les droits d’auteur sont réservés. Sans autorisation, aucune personne, média, site web ou groupe ne peut reproduire, copier ou diffuser de quelque manière que ce soit le contenu de ce site, ni créer de mirror sur des serveurs qui ne lui appartiennent pas. Dans le cas contraire, notre site se réserve le droit de poursuivre en justice les responsables conformément à la loi.

Outils similaires à LALAL.AI