Ollama
Exécuter et appeler rapidement des modèles de langage grand ouvert sur l’ordinateur local ou dans le cloud
Étiquettes :Framework de développement d’IAQu’est-ce que Ollama ?
Ollama est un outil d’exécution local utilisé pour télécharger, exécuter et gérer des modèles de langage de grande taille. Une fois installé, il permet de récupérer des modèles tels que Qwen, Gemma, DeepSeek, gpt-oss, Llama, etc., par des commandes simples, afin de discuter ou de fournir une API depuis son propre appareil Windows, macOS ou Linux.
Il gère les fichiers de modèles, les versions quantifiées, le chargement en mémoire vidéo, le contexte et les services locaux, permettant aux développeurs de ne pas avoir à configurer manuellement des frameworks d’inférence complexes. Ollama propose également des modèles Cloud : les commandes et l’API sont similaires à celles des modèles locaux, mais l’inférence réelle est transférée automatiquement vers le cloud d’Ollama, ce qui permet d’exécuter des modèles volumineux que l’on ne peut pas installer localement.
Fonctionnalités clés
- Gestion des modèles locaux :Télécharger, exécuter, afficher et supprimer des modèles à l’aide des commandes pull, run, list, show et remove, en prenant en charge différentes quantités de paramètres et des versions quantifiées.
- API locale :Après l’installation, des fonctionnalités par défaut sont disponibles : génération, chat, Embedding, liste des modèles et interfaces de gestion ; un accès local n’exige généralement pas de clé API.
- Interface compatible OpenAI :Des méthodes compatibles telles que Chat Completions permettent d’intégrer facilement des applications existantes, des IDE et des outils d’agent.
- Modelfile:Définir le System Prompt, les modèles, les paramètres, l’Adapter et les informations de licence à partir d’un modèle de base pour créer des modèles personnalisés réutilisables.
- Outils et sortie structurée :Prend en charge l’appel d’outils, JSON Schema, l’entrée visuelle et les embeddings ; les fonctionnalités exactes dépendent du modèle.
- Modèle Cloud :En utilisant des modèles marqués de l’icône cloud ou en appelant directement l’API cloud, il est possible d’obtenir un contexte complet ainsi que les capacités des grands modèles, sans avoir besoin d’une GPU locale.
- Intégration des outils de développement :Il peut se connecter à Claude Code, Codex, OpenCode, OpenClaw, Zed ainsi qu’à diverses interfaces de chat, et simplifie la configuration grâce à ollama launch.
- Recherche sur le Web et Fetch :Le cloud fournit des API de recherche et de lecture de pages web pour compléter les modèles locaux ou cloud avec des données en temps réel.
Prix
| Forfait ou version | Prix, plafonds et avantages clés |
|---|---|
| Utilisation locale / Gratuit | 0 dollar : il n’y a pas de frais de abonnement à la plateforme pour télécharger le client et exécuter les modèles sur son propre appareil ; Cloud propose une quantité limitée gratuite et 1 modèle en parallèle. |
| Pro | 20 dollars par mois ou 200 dollars par an, avec un volume d’utilisation du cloud environ 50 fois supérieur à celui de Free, permettant d’exécuter simultanément 3 modèles cloud et de télécharger et partager des modèles privés. |
| Max | 100 dollars/mois, consommation de Cloud environ 5 fois supérieure à celle de Pro, 10 modèles simultanés ; les nouvelles abonnements sont temporairement suspendus, les utilisateurs existants conservent leurs droits. |
| Team | Période d’essai : 25 dollars/siège/mois, minimum 5 sièges, soit au moins 125 dollars/mois ; possibilité de partager la facture et d’utiliser un solde commun, mais il faut actuellement s’inscrire sur une liste d’attente. |
| Enterprise | Cotation sur mesure, avec des prix par quantité accrue, des contrats, un soutien pour les achats sécurisés et une planification du déploiement. |
Cloud n’est pas un paquet de tokens fixe, mais mesure la consommation en fonction du niveau du modèle, des entrées, des tokens de cache d’entrée et de sortie ; les différents modèles consomment des quantités différentes, allant du niveau léger 1 au niveau coûteux 4.
Les plans individuels sont soumis à une limite de sessions toutes les 5 heures et une limite hebdomadaire tous les 7 jours ; Pro et Max permettent d’acheter des crédits supplémentaires.
L’équipe consomme d’abord les ressources de ses membres ; au-delà, des frais sont prélevés sur le solde partagé selon les tarifs du modèle.
Matériel et coûts locaux
Le fait que le logiciel local soit gratuit ne signifie pas que l’inference n’a pas de coûts. Les fichiers de modèle peuvent occuper de quelques Go à plusieurs centaines de Go, et la vitesse ainsi que le contexte disponible dépendent de la mémoire vive, de la mémoire vidéo, de l’architecture GPU et de la quantification.
Les petits modèles peuvent fonctionner sur une CPU ou un dispositif de mémoire unifiée, tandis que les grands modèles nécessitent beaucoup de mémoire vidéo ou plusieurs GPU. Plus le contexte est long, plus l’occupation du cache KV est élevée.
Le déploiement officiel doit également prendre en compte l’électricité, les serveurs, la concurrence, la surveillance, les sauvegardes et le contrôle d’accès.
Confidentialité, logiciels libres et licences
Lors du fonctionnement en local, les responsables affirment qu’aucun message ou donnée utilisateur n’est visible ; il est possible de désactiver la fonction Cloud pour passer en mode uniquement local.
Lors de l’utilisation de Cloud, les messages et les réponses sont traités afin de fournir le service, mais selon la déclaration officielle, leur contenu n’est ni stocké ni enregistré, et n’est pas utilisé pour l’entraînement ; seuls des métadonnées limitées concernant les comptes et l’utilisation sont collectées.
Cloud est principalement hébergé aux États-Unis, mais peut également être routé vers l’Europe et Singapour.
La ligne de commande principale d’Ollama et son dépôt serveur sont soumis à la licence MIT. Il convient de noter que les fichiers de modèles possèdent chacun leur propre licence : certaines autorisent l’utilisation commerciale, tandis que d’autres restreignent l’usage, le nombre d’utilisateurs ou la redistribution.
Le fait que Ollama soit open source ne signifie pas que tous les modèles téléchargés à son moyen peuvent être utilisés librement à des fins commerciales ; les entreprises doivent examiner chaque carte de modèle et chaque licence individuellement.
L’open source des interfaces graphiques de bureau, du cloud et des services web ne peut pas non plus être simplement assimilé aux dépôts principaux.
Guide d'utilisation d’Ollama
Terminer une tâche de base
- Inscrivez-vous à Ollama et créez une clé API réservée uniquement à l’environnement de test ;
- Sélectionner le modèle en fonction du type d’entrée, du contexte, de la qualité, de la vitesse et du prix ;
- Appeler d’abord la gestion du modèle local pour effectuer la requête minimale et vérifier la structure de réponse ;
- Tester ensuite la sortie en flux, les paramètres et les réponses en cas d’erreur à l’aide de l’API locale ;
- Enregistrer les tokens, le nombre d’appels, le délai, le taux d’erreurs et le coût par appel ;
- Transférez la clé dans le gestionnaire de clés du serveur avant de l’intégrer à l’application officielle ;
Créer des flux de travail professionnels réutilisables
- Utiliser des clés et des quotas différents pour les environnements de développement, de test et de production ;
- Créer un ensemble d’évaluation représentatif en utilisant la gestion de modèles locaux, des API locales et des interfaces compatibles avec OpenAI ;
- Définir les délais d’attente, la concurrence, les tentatives de réessai, le throttling et les plafonds budgétaires ;
- Effectuer des vérifications sur la sortie en ce qui concerne les faits, la sécurité, le format et les informations sensibles ;
- Surveiller les changements de version, de prix, de délai et de taux d’échec des modèles de surveillance ;
- Préparer des plans de dégradation du modèle, de coupure et de prise en main manuelle ;
À qui s’adresse-t-il
- Développeurs qui souhaitent que les données restent sur l’appareil et utilisateurs sensibles à la vie privée
- Équipe pour développer un RAG local, des assistants de chat et de programmation ainsi que des agents
- Développeurs d’applications ayant besoin d’une API unifiée pour basculer entre les modèles locaux et cloud
- Apprendre aux utilisateurs la recherche et l’éducation sur les différents modèles open source et leurs effets de quantification
Sécurité et restrictions
- Par défaut, une API locale n’a pas besoin d’authentification et ne doit être associée qu’à des réseaux fiables ; elle ne doit pas être exposée directement à Internet.
- Les conteneurs, les serveurs distants et les environnements d’équipe doivent intégrer un proxy inversé, TLS, une authentification et une limitation de vitesse ;
- L’agent doit utiliser un environnement sandbox et des droits minimaux lorsqu’il se connecte à des terminaux ou à des systèmes de fichiers ;
- La sortie du modèle peut engendrer des hallucinations, produire du code non sécurisé ou divulguer des données sensibles présentes dans les prompts.
- La qualité des petits modèles est généralement inférieure à celle des modèles Cloud de pointe ;
- Il faut également vérifier l’origine du modèle, l’intégralité du fichier et la licence ;
- Les activités clés doivent disposer d’évaluations, de filtrage du contenu et de révision manuelle ;
Questions fréquentes
Ollama est-il complètement gratuit ?
Les clients locaux et l’inférence locale sont gratuits ; les utilisations avancées dans le cloud, les services d’équipe, ainsi que l’équipement et l’électricité propres nécessitent des coûts.
Ollama a-t-il besoin d’être connecté à Internet ?
La première fois que le modèle est téléchargé, une connexion Internet est nécessaire ; une fois téléchargé, le modèle local peut fonctionner hors ligne ; Cloud et Web Search nécessitent une connexion Internet.
Est-ce que c’est possible sans carte graphique ?
Il est possible d’exécuter certains petits modèles, mais à une vitesse plus lente. Pour les grands modèles manquant de mémoire, on peut utiliser des versions quantisées ou des modèles Cloud.
Numéro d’enregistrement de sécurité publique du Guangxi : 45132202000164