Higress
Valeur ajoutée gratuite
Agent intelligent IA AI Agent

Higress

Higress, outil intelligent axé sur les agents IA

Étiquettes :

Une phrase pour présenter

Higress est un gateway API natif pour l’IA, open source et basé sur Istio et Envoy, qui permet d’intégrer de manière unifiée les API de grands modèles, les agents IA, les serveurs MCP et les services de raisonnement Kubernetes, tout en assurant au niveau d’entrée le routage, la conversion de protocoles, les quotas, la sécurité, le cache ainsi que la gouvernance de l’observabilité.

Présentation des outils

Higress est né initialement au sein d’Alibaba pour résoudre des problèmes tels que la surcharge des gateways affectant les connexions longue durée, ainsi que le manque de balance de charge pour gRPC et Dubbo. Il a ensuite été intégré dans le CNCF Sandbox pour une gouvernance ouverte. Il peut servir à la fois de gateway AI, d’ingress Kubernetes, de gateway pour les microservices et de gateway de sécurité.

Au 23 août 2026, la dernière version stable du entrepôt principal est v2.2.4, et le code source est licencié sous la licence Apache-2.0. Le produit s’adresse aux équipes de développement de plateformes, à l’exploitation cloud-native, aux infrastructures d’IA et aux équipes de développement, et ne propose pas directement d’interface de chat ou de génération de contenu pour les utilisateurs ordinaires.

Positionnement central

PositionnementObjet d’accèsCapacités principalesUtilisateur typique
Gateway LLMModèle commercial, modèle personnalisé et interface compatible avec OpenAIProtocole unifié, équilibrage de charge, fallback, gouvernance des tokens et observabilitéÉquipe des plateformes et applications d’IA
Passerelle MCPService MCP natif et API REST existanteConversion de protocoles, authentification, limitation du débit, audit et routage des outilsÉquipe des services de plateformes et d’outils pour agents
Gateway de modèleCharge de travail de raisonnement KubernetesExtension d’inférence de l’API Gateway et sélection d’endpointÉquipe pour créer son propre cluster de raisonnement
Gateway IngressServices Kubernetes et trafic externeAPI Ingress, API Gateway, certificats et routage progressifÉquipe des plateformes cloud natives
Gateway de microservicesServices d’enregistrement tels que Nacos, ZooKeeper, Consul, Eureka, etc.Découverte de services, routage, adaptation de protocoles et gouvernanceÉquipe d’architecture de microservices
Passerelle de sécuritéTrafic Web, API, modèles et outilsWAF, authentification et autorisation, limitation du trafic, masquage des données et détection du contenuÉquipe de sécurité et de conformité

Fonction principale

Plus de 100 modèles d’agent unifié

Higress permet de regrouper les méthodes d’authentification, les structures d’interface et les noms de modèles provenant de différents fabricants en un point d’accès unique ; la page du produit indique actuellement que plus de 100 modèles populaires sont pris en charge. Cela permet de réduire le code spécifique à chaque fabricant, mais il reste nécessaire de gérer les différences entre les modèles en ce qui concerne les appels d’outils, le multimodalité, le contexte et le format des erreurs.

Routeur à plusieurs modèles et dégradation en cas de panne

Une équipe peut configurer plusieurs modèles ou plusieurs tokens d’authentification derrière le même routage, afin d’améliorer l’disponibilité par des mécanismes de polling, de charge balancing, de vérification de santé et de fallback. La dégradation ne permet que de réduire les points de défaillance uniques, sans garantir que la qualité des résultats, la longueur du contexte et les stratégies de conformité soient entièrement identiques pour différents modèles.

Équilibrage de charge de modèle adaptatif

La version v2.2.4 intègre un mode AdaptiveScore basé sur la pression en temps réel, qui permet de prendre en compte la concurrence au niveau du cluster grâce à Redis tout en conservant des stratégies de dégradation locales. Cette fonctionnalité convient aux clusters d’inférence à forte concurrence, mais l’disponibilité de Redis, les retards des métriques et les paramètres des stratégies influencent également les résultats de planification.

Pool de clés API et dégradation de token

Un même fournisseur de modèles peut configurer plusieurs clés API, et définir pour chaque token des seuils d’exception ainsi que des tests de récupération de la santé. Le pool de clés contribue à la capacité et au basculement en cas de panne, mais ne peut pas être utilisé pour contourner les restrictions de compte du fournisseur de modèles ou en violation des conditions de service.

Limitation de token et quotas

Higress ne limite pas le flux uniquement en fonction du QPS, mais aussi en fonction des tokens d’entrée et de sortie, du nombre de requêtes, de la concurrence et des paramètres définis pour les consommateurs. La version 2.2.4 prend en charge l’application cumulative de plusieurs règles de correspondance ; lors de la mise à niveau, il est nécessaire de vérifier la logique de première correspondance de l’ancienne version afin d’éviter des changements soudains des quotas.

Cache précis et cache sémantique

Le cache précis réutilise exactement les mêmes résultats de requête, tandis que le cache sémantique renvoie des réponses existantes en fonction de la similarité, ce qui permet de réduire les appels répétés au modèle, les coûts liés aux tokens et les délais. Le cache peut conserver des indications et des réponses sensibles, ou bien retourner des contenus erronés pour des questions apparemment similaires mais en réalité différentes ; il est donc nécessaire de mettre en place une isolation des locataires, des dates d’expiration et des règles d’exclusion.

Observabilité de l’IA

La surveillance peut calculer des indicateurs tels que le nombre de tokens entrants et sortants par seconde, la consommation de ressources par fournisseur et modèle, les délais, ainsi que le nombre d’appels réussis et échoués. La version v2.2.4 ajoute un compteur des échecs des LLM, comblant ainsi le manque de surveillance en l’absence de consommation de tokens pour les réponses d’erreur en mode flux et hors flux.

Traitement des prompts et des réponses aux demandes

Les plugins peuvent décorer les prompts, appliquer des modèles, enregistrer l’historique des conversations, identifier les intentions, forcer une sortie JSON et transformer les requêtes ou les réponses. La réécriture de la couche d’entrée affecte toutes les applications en aval ; il est nécessaire de tester les versions des modèles, la compatibilité des champs et les possibilités de rollback dans un environnement de production.

RAG et amélioration de la recherche

Higress peut se connecter à des bases de connaissances, à des services de recherche vectorielle et de recherche via des plugins, afin d’inclure les résultats de recherche dans les requêtes du modèle. Le gateway est chargé de l’orchestration, mais ne garantit pas automatiquement la qualité des documents, le taux de précision de la récupération, la correction des références ou le respect des droits de propriété intellectuelle.

Masquage des données d’IA et sécurité du contenu

Le plugin de masquage des données peut traiter les champs sensibles avant que la demande n’atteigne le modèle externe, tandis que le plugin de sécurité du contenu peut vérifier les entrées et les sorties. Certains plugins dépendent de services de sécurité externes ou de modèles développés en interne ; la version 2.2.4 intègre également l’intégration Qwen3Guard. Le taux de couverture réel dépend des règles, des modèles et du déploiement.

Traitement des requêtes et réponses en flux

Le plan de données Envoy et les extensions Wasm permettent un traitement en flux complet des corps de requêtes et de réponses, et peuvent gérer des protocoles tels que SSE. Les liaisons en flux imposent des exigences plus élevées en matière de délais d’expiration, de nettoyage des connexions, de statistiques sur les tokens et de gestion de la mémoire des plugins ; elles ne peuvent donc pas être testées uniquement avec des connexions courtes ordinaires.

Gouvernance unifiée MCP

Proxy MCP natif

Higress peut proxyer les serveurs MCP dispersés vers une entrée unique, permettant ainsi un traitement centralisé de l’authentification, d’une limitation du trafic à fine échelle, de la découverte des outils, de l’audit des appels et de l’observabilité. Le client n’a qu’à se connecter au gateway, mais une configuration incorrecte des permissions du gateway peut également exposer davantage d’outils à des utilisateurs qui ne devraient pas y avoir accès.

Conversion de l’API existante en MCP

Grâce au MCP Bridge et aux outils de conversion OpenAPI, les services REST ou web existants peuvent être mis à disposition en tant qu’outils MCP distants sans avoir à réécrire la logique métier. Après conversion automatique, il reste nécessaire de vérifier manuellement le nom de l’outil, les schémas des paramètres, l’authentification, le traitement des erreurs et les opérations dangereuses.

Compatibilité des versions du protocole

La version v2.2.4 intègre le support des normes MCP 2026-07-28, y compris les limites de requêtes sans état, la découverte fiable des outils, la validation des paramètres typés, la protection Origin et l’isolement des protocoles anciens et nouveaux. Avant la mise à niveau, des tests de compatibilité bout en bout doivent être effectués entre les versions du protocole côté client et côté serveur.

Interface de gestion MCP

Le serveur Higress Ops MCP peut être utilisé pour configurer et gérer les passerelles, et la nouvelle version impose une authentification Basic pour les opérations de débogage sensibles ainsi que pour la gestion d’Envoy. Le MCP destiné à l’opération dispose de droits élevés et doit être séparé des outils métier ordinaires, en utilisant des identifiants, des frontières réseau et des fonctions d’audit indépendants.

Inference Kubernetes et API Gateway

Higress prend en charge les API Ingress et Gateway, et a été mis à jour à la version v2.2.4 avec l’API Gateway v1.6.0, tout en intégrant les capacités de runtime de l’Inference Extension v1.4. Il peut diriger les ressources de routage Gateway vers un pool d’inference et effectuer des choix et des agrégations en fonction de l’état des points d’extrémité d’inference.

CapacitéSoutien actuelPrécautions à prendre
Ingress APIPeut servir de contrôleur d’entrée pour KubernetesCompatible avec de nombreuses annotations Nginx Ingress, mais aucune n’est entièrement équivalente.
Gateway APIPrend en charge des ressources telles que les Gateway standards et le routage.Vérifier les versions CRD et du contrôleur lors de la mise à niveau
Inference ExtensionSoutien en temps de exécution v1.4Il faut correspondre au pool de raisonnement, au sélecteur d’endpoint et aux ressources du cluster.
Version API Gatewayv2.2.4 utilise v1.6.0Les anciens clusters et les anciens CRD peuvent ne pas être compatibles.
Mise à jour de routageLa configuration prend effet en quelques millisecondes, sans nécessiter un reload au style Nginx.Il faut encore valider la propagation de la surface de contrôle et le rollback en cas d’anomalie.
CertificatPermet une délivrance et un renouvellement automatiques via Let’s EncryptLe DNS, la méthode de défi et le stockage des clés doivent être correctement configurés.

Gouvernance des microservices et des API traditionnelles

  • Découverte de services : possible de se connecter à des centres d’enregistrement tels que Nacos, ZooKeeper, Consul et Eureka.
  • Protocole : prend en charge le texte brut sur les pages web, la transmission chiffrée et gRPC, et peut être combiné avec MCP Bridge pour gérer des services tels que Dubbo.
  • Routeur : offre la réécriture, le déploiement progressif, la répartition du trafic, le charge balancing et la gestion des pannes.
  • Authentification : Fournit des stratégies telles que Key Auth, JWT, Basic, HMAC, OIDC, OAuth2 et authentification externe.
  • Protection : protection contre les attaques CC au niveau du WAF, des adresses IP ou des cookies, ainsi que limitation du trafic au niveau local ou en cluster.
  • Migration : compatible avec de nombreuses annotations Nginx Ingress, idéal pour une migration par étapes plutôt qu’un remplacement en une seule fois.
  • Console : Fournit une interface de gestion graphique, tout en permettant d’utiliser les ressources Kubernetes et la configuration automatisée.

Écosystème des plugins Wasm

Higress utilise WebAssembly comme principal mécanisme d’extension, permettant de développer des plugins en langages tels que Go, Rust et JavaScript, tout en réduisant les risques de sécurité mémoire grâce à l’isolation dans des sandbox. Les versions des plugins peuvent être mises à jour indépendamment et en temps réel, sans avoir à redémarrer tout le gateway.

Catégorie de pluginCapacité de représentationDépendances ou risques courants
Agent IAConversion de protocoles de modèles, équilibrage de charge et fallbackDifférences entre les fournisseurs de modèles, sécurité des clés et mappage des erreurs
Cache IACache de précision et sémantiqueStockage de données sensibles, réutilisation par les locataires et stratégie d’expiration
Gouvernance par tokensLimitation par jeton, quotas et statistiques des consommateursDifférences de dérivation et statistiques en flux incomplètes
Sécurité de l’IADésensibilisation, détection de contenu et protection contre les attaques par promptsFaux positifs, faux négatifs et frais de services de sécurité externes
Orchestration IAAgent, RAG, recherche, reconnaissance de l’historique et des intentionsFiabilité des services externes et pollution perçue
Authentification et vérificationKey, JWT, Basic, HMAC, OIDC et OAuth2Rotation des identifiants, décalage horaire et privilèges trop larges
Protection webModSecurity WAF et OWASP CRSOptimisation des règles, blocages erronés et coûts en ressources
Gestion du traficLimiter le trafic au niveau local ou du cluster, mise en gris et contrôle du cacheDépendance à l’état et conflits de stratégie chez Redis, etc.
Plug-in personnaliséTraiter des demandes et des réponses commerciales spécifiquesChaîne d’approvisionnement, limites du sandbox, performances et compatibilité des mises à jour

Mode de déploiement

Mode de déploiementEnvironnement de exécutionCaractéristiques principalesAdéquat pour les utilisateurs
Docker All-in-OneEnvironnement de conteneur Linux, macOS ou Windows uniqueDémarrage centralisé de la console, du gateway et de la configuration, expérience d’environ 5 minutesApprentissage local, PoC et sites simples
Déploiement indépendant avec Docker ComposeMachine virtuelle ou machine physiqueLes composants et les données sont plus faciles à séparer et à persister.Déploiement de petite taille non Kubernetes
Déploiement cloud-native HelmCluster Kubernetes standardUtilisation de CRD, Ingress, Gateway API et capacités élastiquesÉquipe de plateforme et cluster de production
Kubernetes localKind, Minikube, etc.Proche du modèle de ressources de production, facilitant l’intégration conjointeDéveloppement et tests d’intégration
Aliyun ServerlessServices cloud entièrement gérésSelon l’élasticité des appels, ressources sous-jacentes sans maintenance requiseEssai rapide et production dans les scénarios Serverless
Version exclusive instanciée d’AliyunInstance cloud exclusiveIsolation, spécifications, gouvernance et niveaux de service plus élevésEntreprises à cœur de métier, à forte concurrence ou soumises à des exigences de conformité strictes

Port Docker

PortUsage par défautRecommandations de production
8001Console de contrôle Higress UINe pas exposer directement le réseau public, ajouter une authentification et une liste blanche des réseaux
8080Entrée en clair du gatewayPrivilégier le redirigement ou la fermeture des entrées en clair dans l’environnement de production
8443Entrée de chiffrement du gatewayConfigurer les certificats de confiance, les politiques TLS et le renouvellement des clés

Docker : une introduction rapide

  1. Préparer un hôte de test pour prendre en charge les conteneurs et un répertoire de travail indépendant, et s’assurer que les ports 8001, 8080 et 8443 ne sont pas occupés.
  2. Choisissez le dépôt d’images Higress le plus proche de la zone de déploiement ; dans un environnement de production, utilisez une étiquette de version spécifique plutôt que d’utiliser constamment « latest ».
  3. Montez le répertoire persistant et lancez le conteneur All-in-One ; n’ouvrez les ports de la console que sur un réseau fiable.
  4. Dès l’accès initial à la console, configurez immédiatement l’authentification des administrateurs, les limites d’accès et les stratégies de sauvegarde.
  5. Ajoutez un fournisseur de modèle de test et une clé API aux droits minimaux, sans importer d’abord toutes les clés de production.
  6. Créer un routage IA, définir la mise en correspondance des modèles, l’authentification des consommateurs, la limitation par token et la dégradation en cas de panne.
  7. Tester les réponses normales et en flux, les erreurs, les temps d’attente et les solutions de secours à l’aide de demandes de petite échelle et non sensibles.
  8. Vérifiez les indicateurs de tokens, de délais, d’erreurs et de consommateurs, puis ajoutez progressivement le cache, la sécurité et les plugins MCP.
  9. Évaluer la migration vers Helm ou une version produite gérée uniquement après avoir vérifié la persistance et la restauration de la configuration.

Processus de déploiement Kubernetes

  1. Vérifier la matrice de compatibilité des versions de Kubernetes, Helm, Gateway API et Higress, et faire une sauvegarde des ressources Ingress existantes.
  2. Créer un espace de noms indépendant, un compte de service, une politique réseau et un dépôt d’images contrôlé pour Higress.
  3. Installez ou mettez à jour les CRD nécessaires, et vérifiez les avertissements de version incohérente lors du démarrage du contrôleur.
  4. Installer une version fixe avec Helm, configurer les dépôts d’images par région et restreindre l’exposition du panneau de contrôle et de la console.
  5. Migrez d’abord un nom de domaine à faible risque, et vérifiez un par un le comportement compatible des annotations Nginx Ingress.
  6. Configurer les routages Gateway, les services backend, les certificats et les plugins d’authentification, et effectuer des exercices de rollback.
  7. Ajouter des quotas de tokens, des délais d’attente, des tentatives de réessai, des mécanismes de coupure, des solutions de fallback et une fonction d’audit pour les grands modèles et le trafic MCP.
  8. Accéder à Prometheus, aux journaux et aux alertes, pour observer la propagation des configurations, les ressources côté données et les connexions longue durée.
  9. Une fois les tests de capacité, de défaillance, de sécurité et de mise à niveau achevés, on passe à un volume de production plus élevé.

Processus de configuration du gateway AI

  1. Listez les fournisseurs de modèles à connecter, les services d’inférence développés en interne, les agents et les serveurs MCP, et indiquez le niveau de sensibilité des données.
  2. Créer des clés, des identités de consommateur et des routages indépendants pour chaque environnement, afin d’éviter l’utilisation commune entre les tests et la production.
  3. Unifier le protocole de appel externe, tout en conservant les vérifications de compatibilité et les mécanismes de fallback pour les paramètres propres au modèle.
  4. Définir le QPS, la concurrence, le quota de tokens, le budget quotidien et les modèles autorisés pour chaque consommateur.
  5. Configurer le modèle préféré, le modèle de secours, les seuils de santé, les délais d’attente et le nombre maximal de tentatives.
  6. Activez le cache uniquement pour les requêtes pouvant être réutilisées en toute sécurité, et intégrez l’utilisateur, le locataire et les permissions dans la clé du cache.
  7. Activez la minimisation, le masquage des données et la protection contre les prompts à l’entrée, ainsi que la vérification des fuites de contenu et de données à la sortie.
  8. Enregistrer les modèles, les tokens, les délais, les échecs, les solutions de secours, les hits de cache et les appels aux outils MCP.
  9. Vérifier le comportement en cas d’indisponibilité du modèle, d’interruption de Redis, d’anomalies des plugins et de délai d’exécution excessif du service MCP par injection de pannes.

Vérification de mise en ligne du MCP

  1. Importer uniquement les opérations OpenAPI vérifiées, et supprimer les interfaces inutiles de suppression, de transfert, d’exécution et d’administration.
  2. Définir pour chaque outil un nom clair, une description, des paramètres typés, des champs obligatoires et une structure d’erreur.
  3. Séparer les outils en lecture seule des outils de modification, et ajouter une confirmation manuelle pour les opérations à haut risque.
  4. Utiliser l’identité du consommateur, les privilèges minimaux et l’isolation des locataires pour empêcher les modèles de partager des identifiants à haut niveau de privilèges.
  5. Vérifier l’origine, l’authentification, la limitation de vitesse, l’injection de paramètres, les délais d’expiration, les tentatives de réessai et l’identité.
  6. Outil de suivi des découvertes, paramètres, utilisateurs, résultats, erreurs et numéros d’audit des processus métier ultérieurs.
  7. Tester en même temps les clients MCP anciens et nouveaux afin d’éviter des incompatibilités implicites dues à la mise à niveau du protocole.
  8. Placer l’outil de gestion Higress Ops dans un réseau privé indépendant et activer une authentification forte.

Version communautaire et version Alibaba Cloud

La version communautaire de Higress est gratuite et open source ; les utilisateurs assument les coûts liés au serveur, au réseau, au stockage, à la surveillance, aux mises à jour et à la maintenance. Le gateway AI d’AliCloud propose, sur la base de Higress, des produits Serverless hébergés et des instances exclusives, avec une console cloud améliorée, de l’élasticité, des niveaux de service et un support commercial.

VersionFrais actuels du gatewayCapacités clés ou contraintesScénarios adaptés
Version communautaire de HigressLicence logicielle gratuiteCapacités de base complètes, possibilité de personnaliser les plugins Wasm ; les coûts d’infrastructure et de modèles sont à la charge de l’utilisateur, sans SLA commercial.Développement propre, développement secondaire et multi-cloud
Édition standard ServerlessPendant la phase de bêta test de la nouvelle version, le gateway lui-même est gratuit.50 QPS par défaut, entrée chiffrée par défaut sur la plateforme ; pas d’entrée publique indépendante, pas de prise en charge des noms de domaine personnalisés, des certificats, des politiques TLS ou de la configuration du protocole web de deuxième générationEssai, PoC, développement et services à faible trafic
Édition entreprise ServerlessPendant la phase de bêta test de la nouvelle version, le gateway lui-même est gratuit.500 QPS par défaut, entrée indépendante, nom de domaine personnalisé, certificats, politique TLS, protocole web de deuxième génération et SLA à 99,95 %Production officielle et services d’IA pour le public
Version ancienne de ServerlessFacturation du trafic CU sur demande et du trafic publicLes instances existantes continuent d’être utilisées, avec des capacités conformes aux spécifications initiales ; les nouveaux clients ont la priorité pour la nouvelle version.Les clients existants font une transition en douceur
Tarif payant exclusif par instanceFrais d’instance par heure, plus traitement des données et trafic Internet.Ressources exclusives, performances normalisées et gouvernance complète, libérables une fois utiliséesBesoins à court terme de haute qualité, en pic ou isolés
Abonnement mensuel exclusif par instanceFrais d’instance prépayés mensuellement, plus traitement des données et trafic Internet.L'utilisation à long terme de remises est généralement plus élevée, les spécifications et la région influencent le prix.Activité de production principale à long terme

Frontières gratuites de bêta test

La version bêta de Serverless ne couvre gratuitement que les frais liés au gateway lui-même ; le trafic entrant sur Internet est toujours facturé selon les tarifs de transfert de données cloud, tandis que les services de modèles, les journaux, la surveillance et autres produits cloud sont facturés séparément. Une fois la phase bêta terminée, un mode de facturation commerciale pourrait être mis en place ; les prix officiels et les offres promotionnelles devront être confirmés à nouveau dans la console.

Composition de la facturation de l’édition exclusive

La version exclusive par instance se compose d’une instance de gateway, du volume de traitement des requêtes et des réponses, ainsi que du trafic Internet ; le montant exact varie en fonction des spécifications, de la région, du type de réseau et de la période d’achat. Il n’existe pas de prix fixe unique qui puisse représenter tous les déploiements.

Logiciels libres, GitHub et licences

Le dépôt principal de Higress est actuellement entretenu par l’organisation higress-group ; l’ancien accès au dépôt d’Alibaba redirige vers cette nouvelle organisation. Le code source est sous licence Apache-2.0. Le dépôt principal fait l’objet d’une maintenance active, et la version v2.2.4 a été publiée le 13 août 2026.

ProjetStatut publicLicence ou instructionseffet
Entrepôt principal de HigressPublicApache-2.0Interface de contrôle, intégration du plan de données, CRD et plugins principaux
Wasm Go SDKPublicApache-2.0Développer un plugin Higress avec Go
Outil de conversion OpenAPI en MCPPublicApache-2.0Générer une configuration de service MCP à partir des opérations OpenAPI
ConsoleEntrepôt publicIl est nécessaire de vérifier les autorisations spécifiques selon les documents du entrepôt.Gestion et configuration graphique
StandaloneEntrepôt publicIl est nécessaire de vérifier les autorisations spécifiques selon les documents du entrepôt.Déploiement indépendant hors Kubernetes
Document du projetPublicCC-BY-4.0Utilisation, architecture et instructions pour les plugins
Portail AI d’AliCloudServices de gestion commercialeSoumis aux conditions du contrat de services cloudServerless, instances exclusives et SLA

Le logiciel open source ne signifie pas aucun coût.

Apache-2.0 autorise l’utilisation, la modification et la distribution du code principal, mais les entreprises doivent néanmoins se conformer aux exigences de la licence et au NOTICE, et assumer les coûts liés aux serveurs, aux appels de modèles, aux plugins externes, à la surveillance, à la sécurité ainsi qu’à l’exploitation du personnel. La version commerciale d’AliCloud ne peut pas non plus être considérée comme gratuite ou permettre de reproduire librement ses services en raison de l’utilisation d’un noyau open source.

Sécurité et confidentialité

En mettant en place son propre Higress, il est possible de conserver les prompts, les réponses, les clés et les données d’audit dans un réseau et des systèmes de stockage sous contrôle de l’entreprise, mais les requêtes peuvent néanmoins être redirigées vers des modèles externes, des moteurs de recherche, des bases de vecteurs ou des services de sécurité. Les limites réelles des données sont déterminées conjointement par le routage, les plugins et les fournisseurs en amont.

Aspect des risquesProblème possibleRecommandation
Clé API du modèleCoûts engendrés ou données exposées en cas de fuiteUtilisation de la gestion des clés, des principes du moindre privilège, de la rotation et des alertes en cas d’anomalie
Journal des suggestions et des réponsesContient des informations confidentielles personnelles, commerciales ou de codeMasquage par défaut, raccourcissement de la durée de conservation et restriction des droits de consultation
Cache de précision et sémantiqueRetour entre utilisateurs ou stockage à long terme de contenus sensiblesIsolation des locataires, attribution de droits par clé, chiffrement et expiration
Outil MCPLe modèle induit l’exécution d’opérations commerciales à haut risqueListe blanche des outils, confirmation manuelle, vérification des paramètres et audit
Plug-in WasmChaîne d’approvisionnement, vulnérabilités, épuisement des ressources ou modification logiqueRésumé fixe, vérification de la signature, restrictions de sandbox et déploiement progressif
ConsoleL’entrée des administrateurs est attaquée depuis Internet.Accès au réseau privé, authentification forte, plusieurs facteurs et liste blanche des réseaux
Plug-in de sécurité externeEnvoi des données à un service de test tiersSigner l’accord et confirmer les règles régionales, de formation et de rétention
Système d’observationLes étiquettes contiennent un token, un ID d’utilisateur ou du texte d’instruction.Restreindre les champs à forte cardinalité et nettoyer les étiquettes sensibles
Édition hébergée dans le cloudLes données, les journaux et le trafic sont influencés par la région cloud et les conditions du produit.Sélectionner la région et vérifier la conformité, les SLA et les sous-services

Avantages du produit

  • Une seule entrée gère simultanément les charges de travail d’inférence des API LLM, des Agents, de MCP et de Kubernetes.
  • Basé sur Istio et Envoy, adapté aux connexions longue durée, au SSE et au trafic AI à haute bande passante.
  • Prend en charge plus de 100 modèles populaires et offre un protocole unifié, un équilibrage de charge et une solution de secours.
  • Les mécanismes de limitation par jeton, les quotas, le cache et l’observabilité sont conçus directement en fonction des coûts et de la stabilité de l’IA.
  • Les agents MCP, la conversion des API existantes en MCP et l’audit réduisent la complexité de l’intégration des outils multi-équipes.
  • Compatible avec les API Ingress et Gateway, il peut s’intégrer aux systèmes d’entrée cloud natives existants.
  • Les plugins Wasm peuvent être développés dans divers langages, mis à jour de manière indépendante et mis à jour en temps réel.
  • Prend en charge le déploiement indépendant avec Docker, le déploiement cloud-native avec Helm et la version hébergée par Alibaba Cloud.
  • Le projet principal est sous licence Apache-2.0 et géré de manière ouverte par la communauté CNCF Sandbox.

Restrictions d'utilisation et précautions

  • Higress est une infrastructure, et non un produit de chat terminal ou de base de connaissances prêt à l’emploi.
  • Le déploiement en production nécessite de l’expérience en matière de passerelle, de Kubernetes, de réseau, de sécurité et d’observabilité.
  • La version communautaire ne dispose pas d’SLA commercial ; la réponse aux pannes, les mises à niveau et la capacité sont gérées par l’équipe interne.
  • Une interface unifiée ne peut pas éliminer les différences en termes de fonctionnalités, de qualité, de contexte et de format des erreurs des modèles.
  • Le recours à des modèles différents peut modifier les réponses, les résultats de conformité et les coûts.
  • Le cache sémantique peut retourner des réponses anciennes qui ne conviennent pas à l’utilisateur ou au contexte actuel.
  • Les statistiques Token dépendent de la réponse du fournisseur et de la méthode de segmentation des mots, et ne peuvent pas être considérées comme équivalentes à une facture.
  • Outil MCP relie le modèle à l’activité commerciale réelle, signalant que les injections peuvent se transformer en risques opérationnels concrets.
  • Certains plugins dépendent de Redis, de bases de données vectorielles, de services de recherche ou de services de sécurité externes, ce qui augmente les coûts et la surface d’erreur.
  • Les plugins Wasm personnalisés peuvent encore présenter des problèmes de logique métier, de chaîne d’approvisionnement et de consommation de ressources.
  • Lors de la mise à niveau vers v2.2.4, veillez aux changements de comportement tels que la sémantique du throttling multirègles.
  • CNCF Sandbox indique qu’il est entré dans une phase précoce de gouvernance de projet, ce qui n’équivaut pas au niveau de maturité Graduated.
  • Les prix et les fonctionnalités de la nouvelle version Serverless en bêta pourraient être ajustés une fois le produit commercialisé.
  • La version cloud gratuite ne comprend pas le trafic Internet, les modèles, les journaux, la surveillance ni les produits cloud associés.

Informations de base

ProjetContenu
Nom de l’outilHigress
Type d’outilPasserelle API nativement basée sur l’IA, passerelle MCP et passerelle d’accès cloud-native
Phase du projetCNCF Sandbox
Fondements techniquesIstio, Envoy, WebAssembly et API Kubernetes
Version stable actuellev2.2.4, publié le 13 août 2026
Licence du entrepôt principalApache-2.0
Licence du documentCC-BY-4.0
Portée du modèlePlus de 100 modèles majeurs
Capacité MCPProxy natif, conversion d’API existante, authentification, limitation du débit, audit et routage des outils
Mode de déploiementDocker, Docker Compose, Helm, Kubernetes et Alibaba Cloud
Mode d’extensionÉcrire des plugins Wasm en langages tels que Go, Rust, JavaScript, etc.
Prix de la version open sourceLa licence logicielle est gratuite, l’infrastructure et les services upstream sont à la charge de l’utilisateur.
Version commercialeAliyun Serverless et version exclusive instanciée
Est-ce open sourceOui
Fournir des services de cloud public ?Oui

Questions fréquentes

Higress est-il gratuit ?

Le code des modérateurs communautaires est sous licence Apache-2.0, ce qui permet de le mettre en place gratuitement, mais les serveurs, le réseau, les modèles, le stockage et l’exploitation ne sont pas gratuits. Pendant la phase de bêta test de la nouvelle version Serverless d’Aliyun, le gateway lui-même est gratuit, mais les autres services cloud et le trafic peuvent encore faire l’objet de frais.

Higress est-il un grand modèle ?

Non. Il se situe entre les applications et les modèles, les Agents, les outils MCP ou les services de raisonnement, et est chargé de l’interface et de la gouvernance, sans remplacer lui-même les modèles en amont pour générer du contenu.

Quels modèles sont pris en charge ?

La page du produit indique actuellement qu’il prend en charge plus de 100 modèles populaires, et peut gérer de manière unifiée les interfaces compatibles avec OpenAI ainsi que celles de nombreux fournisseurs nationaux et internationaux. La compatibilité multimodale, les appels d’outils et les paramètres doivent être testés selon les plugins des fournisseurs.

Est-il possible de ne pas utiliser Kubernetes ?

Oui. Docker All-in-One, Docker Compose et Standalone conviennent pour fonctionner indépendamment de Kubernetes ; la gestion à grande échelle, la persistance et la haute disponibilité doivent être conçues séparément.

Est-il possible de transformer une API ordinaire en outil MCP ?

Oui, il est possible de générer une configuration MCP à distance via le pont MCP et les outils de conversion OpenAPI. Une fois générée automatiquement, il est nécessaire d’examiner manuellement les opérations dangereuses, les paramètres, l’authentification et la documentation des outils.

Higress est-il identique au gateway AI d’Aliyun ?

Ce n’est pas exactement identique. Higress est un projet de la communauté open source, tandis qu’Aliyun AI Gateway propose, en s’appuyant sur ses capacités, du Serverless hébergé, des instances exclusives, une intégration cloud, des SLA et un support commercial.

La version standard Serverless peut-elle être utilisée en production ?

Il convient mieux aux faibles débits, aux essais et au développement, avec une valeur par défaut de 50 QPS, sans entrée indépendante ni nom de domaine personnalisé. Pour un service officiel destiné au grand public, il convient généralement d’évaluer l’édition entreprise ou l’édition exclusive par instance.

Higress réduira-t-il les coûts du modèle ?

Le cache, les quotas, le routage et les solutions de secours peuvent aider à réduire les gaspillages ou à choisir des modèles plus adaptés, mais ils ne garantissent pas nécessairement une baisse des coûts totaux. Il faut également prendre en compte les coûts liés aux passerelles, au cache, à la surveillance et à l’exploitation.

Higress est-il open source ?

Oui, le dépôt principal utilise Apache-2.0. Les licences et conditions relatives aux consoles associées, aux versions Standalone, aux plugins et aux services cloud commerciaux doivent être vérifiées séparément.

Résumé

Higress convient aux équipes de développement et de plateforme qui ont besoin d’une entrée unique pour gérer plusieurs modèles, des agents, des outils MCP et des API cloud natives. Il intègre la gouvernance des tokens, les mécanismes de fallback, le cache, la sécurité du contenu, l’observation en flux continu et l’audit MCP au niveau du gateway, tout en conservant les performances d’Envoy, les normes des Gateway API et les capacités d’extension Wasm.

Lors du choix, il faut distinguer la version communautaire open source d’Apache de la version hébergée par Alibaba Cloud, et prendre en compte les appels aux modèles, le trafic, les journaux, Redis, les plugins ainsi que l’opération et la maintenance dans le coût total. Lors du déploiement officiel, il convient également de vérifier en détail l’isolation du cache, la protection des clés, les principes de moindre privilège MCP, la compatibilité des mises à jour de version et les mécanismes de fallback en cas de panne, plutôt que de se contenter de mettre en place un proxy de modèle.

©️Droit d’auteur : Sauf indication contraire, tous les articles de ce site sont protégés par le droit d’auteur.Partage d’outils d’IATous les droits d’auteur sont réservés. Sans autorisation, aucune personne, média, site web ou groupe ne peut reproduire, copier ou diffuser de quelque manière que ce soit le contenu de ce site, ni créer de mirror sur des serveurs qui ne lui appartiennent pas. Dans le cas contraire, notre site se réserve le droit de poursuivre en justice les responsables conformément à la loi.

Outils similaires à Higress