DataRobot
DataRobot : rend la programmation avec l’IA plus efficace et plus simple
Étiquettes :Outils de programmation IAQu’est-ce que DataRobot ?
DataRobot est une plateforme d’IA d’entreprise fournie par DataRobot, Inc., destinée à la création, au déploiement, à l’exécution et à la gouvernance des modèles prédictifs, des applications d’IA générative et des workflows d’agents. Elle regroupe les expériences sur les données, l’enregistrement des actifs, le déploiement en production, la surveillance et l’approbation dans un environnement unifié, s’adressant principalement aux organisations qui ont besoin de gérer l’IA à grande échelle.
Le produit actuel utilise Workbench, Registry et Console comme espaces de travail principaux. Les utilisateurs peuvent effectuer des opérations via l’interface graphique du navigateur, ou automatiser les processus à l’aide d’un client en code, de la ligne de commande et de l’API REST.
Fonction principale
- Prédiction avec l’IA et AutoML : après l’importation de données structurées, de séries temporelles, de texte, d’images ou de données géospatiales, il est possible de traiter les données, de réaliser du engineering de caractéristiques, d’entraîner et d’optimiser des modèles, ainsi que de comparer plusieurs algorithmes et architectures.
- Tâches de modélisation spécialisées : prennent en charge des workflows de classification, de régression, de multi-étiquettes, de multi-classification, de prédiction de séries temporelles, de détection d’anomalies et de clustering, et sont adaptées à la prévision des besoins, à l’évaluation des risques, à la détection de la fraude et au contrôle qualité.
- Interprétation du modèle et vérification de la qualité : interpréter les prédictions à l’aide d’indicateurs tels que l’impact des caractéristiques, SHAP, LIME, les coefficients et les effets des caractéristiques, et offrir des fonctionnalités de détection des biais, d’ensemble de test externe et de génération automatique de documents de conformité.
- Expériences avec l’IA générative : il est possible de comparer les grands modèles de langage, les modèles d’embedding, les bases de données vectorielles, les rechercheurs et les prompts pour créer des applications RAG, de Q&A sur des documents, de Q&A sur des données et de génération de contenu ; la disponibilité des modèles spécifiques et des régions dépend du forfait et des paramètres configurés par l’administrateur.
- Développement d’agents : prise en charge de l’enregistrement des outils, de la registration des données, du stockage vectoriel, de composants prédéfinis ainsi que de modèles de frameworks tels que CrewAI, LangGraph, LlamaIndex, et possibilité d’intégrer des agents développés externement sur la plateforme.
- Évaluation et gouvernance : Il est possible de tester en parallèle des agents ou des workflows d’IA générative, afin de maîtriser les risques de production grâce au suivi, à l’historique des modifications, à l’approbation, aux tests de conformité, aux garde-fous et à l’intervention humaine.
- Déploiement et MLOps : Après enregistrement d’une version de modèle ou d’agent, il est possible de créer des services en batch ou en temps réel, de surveiller la précision, le dérive des données, les retards, la santé du service, les coûts ainsi que des indicateurs métier personnalisés, et de remplacer les versions sans interrompre le service.
- Applications d’IA : Il est possible d’utiliser des modèles d’applications, des applications sans code ou des applications personnalisées basées sur Streamlit, Flask, etc., afin que les utilisateurs métier puissent soumettre des données, consulter des prédictions et partager des résultats.
Entrée, traitement et sortie
| Étape | Contenu traitable | Résultat typique |
|---|---|---|
| Données et connaissances | Tableaux, bases de données, séries temporelles, texte, images, données géospatiales, documents et données vectorielles | Actifs de données réutilisables, caractéristiques, bases de données vectorielles et données d’entraînement |
| Modélisation prédictive | Champs cibles, fenêtres temporelles, contraintes métier et code personnalisé | Modèles de classification ou de régression, prédiction, interprétation, interfaces de notation et documents de conformité |
| IA générative | Mots-clés, documents, paramètres de recherche, LLM, modèles d’incorporation et données d’évaluation | Flux de travail RAG, applications de chat, indicateurs d’évaluation et de surveillance de la qualité |
| agent intelligent | Code, outils, données, flux de travail de frameworks externes et politiques de permissions | Agents déployables, traçage des appels, historique des approbations, alertes et résultats métier |
Les connecteurs couvrent les bases de données, entrepôts de données et systèmes de stockage d’objets courants, et fournissent des guides d’intégration pour AWS, Azure, Google Cloud et Snowflake, etc. Les connecteurs, modèles, ressources de calcul et cibles de déploiement réellement disponibles dépendent de la version, de la région, des licences organisationnelles ainsi que des paramètres d’administration.
Processus d'utilisation
- Demandez une mise à l’essai unique ou contactez le service des ventes pour créer une organisation, et choisissez entre un environnement SaaS hébergé, une VPC ou un environnement géré par vous-même en fonction des exigences en matière de conformité, de localisation des données et d’infrastructure.
- Créez un Use Case dans Workbench, puis importez les données en téléchargeant des fichiers ou en configurant des connecteurs ; pour les tâches d’IA générative et d’agents, il est également nécessaire de sélectionner des modèles, une base de connaissances, des outils et des identifiants.
- Choisissez la prédiction, l’IA générative ou les workflows d’agents pour entraîner, combiner, déboguer et comparer des solutions candidates dans une interface graphique ou un environnement de code.
- Évaluer les performances en utilisant un ensemble de validation, des indicateurs métier, des tests de conformité et des vérifications manuelles, afin de détecter les biais, les hallucinations, l’injection de prompts, la fuite d’informations personnelles et les risques de coûts.
- Enregistrer les modèles, applications ou agents qui ont réussi les tests dans le Registry, afin de conserver les versions, les métadonnées, les résultats des tests, l’état d’approbation et les documents associés.
- Déployer sur le calcul hébergé par DataRobot, des serveurs de prédiction dédiés ou un environnement externe, et générer des interfaces ou des applications partagées pouvant être appelées par les systèmes métier.
- Sur la console, observez la qualité, le dérive, le retard, les traces d’appels et la santé du service, configurez les alertes, les interventions et l’approbation, puis mettez à jour la version en fonction des retours en production.
Essai et mode payant
| Forfait ou version | Prix | Période de facturation | Droits ou crédit principal | Adéquat pour les utilisateurs |
|---|---|---|---|---|
| Self-Service SaaS Trial | 0 dollar | Une fois pour 30 jours calendaires | Jusqu’à 5 membres, uniquement des prédictions en lot, jusqu’à 15 bases de données vectorielles et 1000 appels à un LLM ; sans NVIDIA NIM ni GPU | Équipes souhaitant valider des workflows d’IA, d’apprentissage automatique ou d’IA générative |
| Solution de gestion d’entreprise | Contacter le service des ventes | Conformément au contrat | Fonctionnalités, threads de travail, raisonnement, LLM, GPU, niveau de support et de services déterminés selon la commande | Entreprises nécessitant le déploiement en production, la gouvernance et la collaboration organisationnelle |
| VPC ou solution auto-gérée | Cotation sur mesure | Conformément au contrat | Déploiement dans des clusters cloud ou matériels pour la gestion des clients, pouvant prendre en charge des clouds privés, des environnements souverains ou des réseaux isolés. | Les organisations ayant des exigences en matière de stockage des données, d’isolement ou de contrôle des infrastructures |
L’essai commence dès le jour de l’inscription ; les threads de modélisation sont attribués au compte et partagés entre les membres de l’organisation, tandis que certains modèles avancés et ressources de calcul ne sont pas disponibles. Une fois l’essai terminé, il est nécessaire de contacter le service des ventes pour obtenir une mise à niveau ; en l’absence de mise à niveau, les données et actifs de l’essai seront supprimés définitivement 30 jours après l’échéance.
Le plan officiel ne fixe pas de prix uniforme et public ; les devis varient en fonction du mode de déploiement, de l’utilisateur, des calculs, du raisonnement et de la portée des services. Les conditions de la plateforme en self-service stipulent que les frais déjà engagés ainsi que les Crédits achetés sont prépayés et non remboursables ; les contrats entreprises peuvent prévoir d’autres dispositions dans des cas de résiliation ou de correction spécifiques ; il convient de se référer à la commande réelle et au contrat avant l’achat.
API, client et répertoire de code
- Obtenez un token API dans votre compte et identifiez l’endpoint API de la région concernée ou de l’instance self-managed, afin d’éviter d’enregistrer le token dans des dépôts de code publics.
- L’authentification peut être effectuée à l’aide de l’API REST, de la CLI DataRobot ou du client Python, ou encore via l’OAuth configuré par l’organisation avec un fournisseur d’identité d’entreprise.
- Créer et gérer des ensembles de données, des projets, des modèles, des bases de données vectorielles, des applications, des déploiements, des tâches de prédiction et des actifs de surveillance via une interface.
- Appeler l’interface de déploiement dans des scripts automatisés ou des systèmes métier, et la mettre en ligne en intégrant des stratégies de limitation du trafic, de traitement des erreurs, d’audit et de rotation des clés.
| Projet | État actuel | Instructions d’autorisation |
|---|---|---|
| Plateforme DataRobot | Produits propriétaires commerciaux | Le droit d'utilisation est déterminé par les conditions d’essai, l’accord de plateforme ou le contrat d’entreprise. |
| REST API et CLI | Fourni | Un compte valide, un jeton et les permissions correspondantes sur la plateforme sont nécessaires. |
| Client Python | Publication publique | L’utilisation de l’Accord d’outil et d’utilité DataRobot ne doit pas être assimilée aux licences open source courantes. |
| Exemples et projets ouverts | Il existe plusieurs entrepôts publics | Certains entrepôts utilisent Apache 2.0 ou MIT ; les exemples communautaires ne sont pas nécessairement maintenus par DataRobot et doivent être vérifiés un par un pour chaque entrepôt. |
Les clients publics, les modèles ou les exemples de code ne signifient pas que l’entité de la plateforme est open source. Lorsque vous préparez à utiliser le code à des fins commerciales, à le modifier ou à le redistribuer, vous devez vérifier séparément les licences du répertoire cible et du paquet logiciel, plutôt que d’adopter la licence d’un autre projet DataRobot.
Plateforme de déploiement et intégration
| Méthode | Forme d’accès | Caractéristiques principales |
|---|---|---|
| Hébergement SaaS | Navigateur, API, client Python et CLI | L’infrastructure est gérée par DataRobot, la disponibilité régionale, fonctionnelle et des modèles peut varier. |
| Cloud privé virtuel | Environnement dédié à l’organisation | Insister sur l’isolement, le contrôle du réseau et la configuration au niveau de l’organisation |
| Déploiement auto-géré | Cluster Kubernetes cloud ou local pour les clients | Peut être déployé localement, dans un cloud privé, un environnement souverain ou un réseau isolé, avec une installation et une maintenance assurées par l’organisation. |
Aucune application native iOS/Android officielle ou extension Chrome publiée par DataRobot, Inc. n’a été confirmée pour l’instant ; l’application DataBot du même nom n’a aucun lien avec ce produit. La capacité des appareils mobiles à fonctionner correctement doit être vérifiée en fonction de la compatibilité du navigateur et des politiques de sécurité de l’organisation.
Confidentialité, sécurité et précautions relatives aux données
- La plateforme affirme chiffrer les données en transmission ainsi que les données statiques, et indique qu’elle est conforme aux normes ISO 27001 et SOC 2 Type II ; le SaaS à un seul locataire conforme à HIPAA n’est applicable que dans le cadre des produits et contrats correspondants.
- SaaS peut collecter des indicateurs tels que la fréquence de connexion, le nombre de déploiements et l’utilisation des fonctionnalités, et il analyse également les métadonnées des modèles, des projets et des ensembles de données après suppression des informations personnelles et des données clients.
- Lors de la clôture ou de la désactivation du compte, les données des clients sont supprimées et les indicateurs d’utilisation sont anonymisés, mais les informations personnelles telles que les coordonnées de contact et le profil utilisateur peuvent être conservées pour des raisons commerciales ou légales.
- Les prestataires de services de gestion, de stockage, de facturation, d’analyse et de support peuvent traiter des informations personnelles dans la mesure nécessaire à l’exécution de leurs obligations, et les services mondiaux peuvent également impliquer des transferts transfrontaliers.
- L’organisation doit effectuer des vérifications de légalité, de minimisation et de masquage des données avant leur téléchargement, et évaluer les données sensibles en tenant compte du protocole de traitement des données, de la liste des sous-traitants, des paramètres régionaux et de la politique de conservation.
- L’interprétation des modèles, les documents de conformité automatisée, les garde-fous et la surveillance ne peuvent pas remplacer l’examen juridique ou la vérification manuelle ; pour les décisions à haut risque, il reste nécessaire de définir des responsables, ainsi que des mécanismes d’approbation et de recours.
Adapté aux utilisateurs et aux scénarios typiques
- Équipe de science des données : comparaison batch de modèles, gestion d’expériences et génération automatique d’explications de modèles.
- Équipe d’ingénierie IA : mise en place de RAG, d’agents et de modèles personnalisés, avec livraison en production via un registre unifié.
- MLOps et équipes de plateforme : déploiement centralisé, surveillance, remplacement et gouvernance des modèles internes ou externes.
- Organisations réglementées : Mise en œuvre de procédures d’approbation, de traçabilité, de contrôle des écarts et de documents d’audit dans les secteurs financier, médical, manufacturier ou public.
- Équipe d’analyse des affaires et d’opérations : grâce à la mise en commun des capacités de prédiction d’utilisation des applications, de détection d’anomalies, de prévision de la demande et de question-réponse sur les données.
Limites des capacités
- La gamme de produits est large, et la mise en œuvre, les permissions, les connexions de données, les LLM ainsi que l’allocation des ressources de calcul sont complexes ; cela nécessite généralement une collaboration entre les équipes des données, du génie logiciel, de la sécurité et des affaires.
- L’essai ne propose que des prédictions en batch, et limite les appels aux membres, aux bases de données vectorielles et aux LLM ; il n’est donc pas possible d’en évaluer pleinement la capacité de raisonnement en temps réel, l’utilisation des GPU ou les coûts de production à grande échelle.
- La disponibilité des modèles, des bases de données vectorielles et des frameworks tiers varie en fonction de la région, de la version, des paramètres d’administration et du fournisseur ; il convient de vérifier la matrice de support actuelle avant la migration.
- La plateforme peut fournir des signaux de déviation, d’illusion, de dérive et de qualité de service, mais les résultats de détection ne garantissent ni l’exactitude ni la conformité.
- Le prix du plan pour les entreprises n’est pas encore divulgué ; les coûts liés au matériel, aux ressources cloud, aux services professionnels, aux appels aux LLM et aux fournisseurs externes devront être évalués séparément.
Questions fréquentes
DataRobot est-il uniquement utilisé pour l’AutoML ?
Non. Il offre toujours un modélage prédictif automatisé, tout en couvrant l’IA générative, RAG, le développement d’agents, la livraison d’applications, MLOps, la gouvernance et l’observabilité.
Y a-t-il une version gratuite permanente de DataRobot ?
Aucun forfait gratuit permanent n’a été confirmé pour l’instant. Ce qui est vérifiable actuellement, c’est une période d’essai autonome de 30 jours. Pour une utilisation permanente, il est nécessaire de contacter le service des ventes afin d’obtenir une mise à niveau.
L’essai inclut-il des prédictions en temps réel ?
Non inclus. Le compte d’essai ne propose que des prédictions en batch, ainsi qu’une base de données vectorielle, des appels à des LLM, et des limites sur les membres et les ressources de calcul.
DataRobot peut-il être déployé localement ?
Il est possible de choisir une mise en œuvre auto-gérée, ainsi que des solutions VPC, SaaS hébergé, des environnements privés ou souverains et des réseaux isolés ; l’architecture spécifique et la gamme de fonctionnalités supportées sont déterminées selon le plan d’entreprise.
DataRobot est-il un logiciel open source ?
Le noyau de la plateforme n’est pas un logiciel open source. Certains clients, modèles et dépôts d’exemples sont publics, mais les licences diffèrent, et le client Python utilise également un protocole d’outil propriétaire.
Que se passera-t-il avec les données une fois la période d’essai terminée ?
Si vous ne contactez pas le service des ventes pour une mise à niveau, les données et les ressources de la période d’essai seront supprimés définitivement 30 jours après l’échéance. Les modèles, documents et résultats que vous souhaitez conserver doivent être exportés selon les modalités autorisées avant l’échéance.
Numéro d’enregistrement de sécurité publique du Guangxi : 45132202000164