Higress
Kostenloser Mehrwert
KI-Agenten AI Agent

Higress

Higress – ein intelligentes Tool, das sich auf KI-Agenten konzentriert.

Tags:

Eine kurze Beschreibung

Higress ist ein open-source API-Gateway, das auf Istio und Envoy basiert und für künstliche Intelligenz konzipiert ist. Es ermöglicht den einheitlichen Zugriff auf APIs großer Modelle, AI-Agenten, MCP-Server sowie Kubernetes-Inferenzdienste. Auf der Eingangsebene übernimmt es Aufgaben wie Routing, Protokollumwandlung, Quotenverwaltung, Sicherheit, Caching sowie Überwachung und Steuerung.

Einführung in die Tools

Higress entstand ursprünglich innerhalb von Alibaba, um Probleme wie die Überlastung der Gateways, die negative Auswirkung auf langfristige Verbindungen sowie unzureichende Lastverteilung bei gRPC und Dubbo zu lösen. Später wurde es in den CNCF Sandbox eingeführt, wo es unter offener Steuerung weiterentwickelt wird. Es kann sowohl als AI-Gateway als auch als Kubernetes-Ingress, Microservice-Gateway sowie als Sicherheitsgateway eingesetzt werden.

Stand dem 23. August 2026 ist die neueste stabile Version des Hauptlagers v2.2.4, wobei der Hauptcode unter der Apache-2.0-Lizenz steht. Das Produkt richtet sich an Teams für Plattformentwicklung, Cloud-Native-Betrieb, AI-Infrastruktur sowie an Entwicklergruppen und bietet keine direkten Chatten- oder Inhaltsgenerierungs-Oberflächen für normale Nutzer.

Kernpositionierung

PositionierungAnschlussobjektHauptfähigkeitenTypischer Benutzer
LLM-GatewayBusiness-Modelle, selbst entwickelte Modelle und OpenAI-kompatible SchnittstellenEinheitliche Vereinbarungen, Lastverteilung, Fallback-Mechanismen, Token-Verwaltung und ÜberwachungAI-Plattformen und Anwendungsteams
MCP-GatewayEigene MCP-Dienste und bestehende REST-APIsProtokollumwandlung, Authentifizierung, Bandbreitenbegrenzung, Auditing und Tool-RoutingAgent-Plattform und Tool-Service-Team
Modell-GatewayKubernetes-Inferenz-ArbeitsschichtenGateway API Inference Extension und EndpunktauswahlEigenes Team zur Erstellung von Inferenzclustern
Ingress-GatewayKubernetes-Dienste und externe VerbindungenIngress-API, Gateway-API, Zertifikate und schrittweiser RoutingCloud-Native-Plattform-Team
Microservice-GatewayRegistrierungsdienste wie Nacos, ZooKeeper, Consul, Eureka usw.Dienstfindung, Routing, Protokollanpassung und GovernanceMicroservices-Architektur-Team
SicherheitsgatewayWeb-, API-, Modell- und Tool-DatenverkehrWAF, Authentifizierung und Autorisierung, Limitierung des Datenverkehrs, Maskierung sowie InhaltserkennungSicherheits- und Konformitätsteam

Hauptfunktionen

Mehr als 100 Modelle in einem einheitlichen Agenten

Higress kann die Authentifizierungsverfahren, die Schnittstellengeometrien sowie die Modellnamen verschiedener Hersteller in einen einheitlichen Eingangsbereich zusammenfassen. Auf der Produktseite wird angegeben, dass mehr als 100 gängige Modelle unterstützt werden. Dadurch kann der Code, der speziell für jeden Hersteller entwickelt werden muss, reduziert werden. Dennoch müssen die Unterschiede zwischen den Modellen hinsichtlich der Toolaufrufe, der Multimodalität, des Kontexts sowie der Fehlerformatierung berücksichtigt werden.

Mehrmodell-Routing und Ausfallsicherung

Ein Team kann hinter derselben Route mehrere Modelle oder Authentifizierungstoken konfigurieren, um durch Polling, Lastverteilung, Gesundheitsüberwachung und Fallback die Verfügbarkeit zu erhöhen. Downgrade können nur einzelne Ausfallpunkte verringern und gewährleisten nicht, dass die Ausgabequalität, die Länge des Kontexts sowie die Konformitätsstrategien der verschiedenen Modelle vollständig identisch sind.

Anpassungsfähige Lastverteilung im Modell

In der Version v2.2.4 wurde das AdaptiveScore-Modell auf Basis des Echtzeit-Drucks hinzugefügt. Es ermöglicht es, die Konkurrenzlast auf Clusterebene mithilfe von Redis zu erfassen und gleichzeitig lokale Abschwächungsstrategien anzuwenden. Diese Funktion eignet sich für Cluster mit hoher Konkurrenzlast. Allerdings beeinflussen die Verfügbarkeit von Redis, Verzögerungen bei der Übermittlung von Metadaten sowie die Einstellungen der Strategien auch die Ergebnisse der Scheduling-Logik.

API-Schlüssel-Pool und Token-Downgrade

Derselbe Modellanbieter kann mehrere API-Schlüssel konfigurieren und für jeden Token Schwellenwerte für Abweichungen sowie Mechanismen zur Wiederherstellung der Funktionalität festlegen. Die Schlüsselpooling-Funktion unterstützt die Kapazitätsplanung und den Failover, kann jedoch nicht verwendet werden, um die Kontrollen des Modellanbieters zu umgehen oder die Nutzungsbedingungen zu verletzen.

Token-Beschränkungen und Quoten

Higress begrenzt den Datenfluss nicht nur nach QPS, sondern auch anhand von Eingangs- und Ausgabetokens, der Anzahl der Anfragen, der Konkurrenz sowie der Einstellungen für die Verbraucher. Version 2.2.4 unterstützt die gleichzeitige Anwendung mehrerer Regeln. Bei einem Upgrade muss man die Logik der ersten Treffer in der alten Version überprüfen, um plötzliche Änderungen bei den Quoten zu vermeiden.

Präziser Cache und semantischer Cache

Die präzise Cache-Wiederverwendung speichert exakt dieselben Anfragedaten, während der semantische Cache aufgrund der Ähnlichkeit bereits vorhandene Antworten zurückgibt. Dadurch können wiederholte Aufrufe des Modells, die Kosten für Tokens sowie Verzögerungen verringert werden. Der Cache kann sensible Informationen und Antworten speichern; außerdem kann er bei scheinbar ähnlichen, aber tatsächlich unterschiedlichen Fragen falsche Inhalte zurückgeben. Daher sind eine Trennung der Benutzer, Ablaufzeiten sowie Ausschlussregeln notwendig.

AI-Überwachbarkeit

Die Überwachung kann Kennzahlen wie die Anzahl der pro Sekunde eingegebenen und ausgegebenen Tokens, den Verbrauch von Ressourcen durch Anbieter und Modelle, Verzögerungen sowie Anzahl erfolgreicher und fehlgeschlagener Aufrufe ermitteln. In Version 2.2.4 wurde die Anzeige der Anzahl der fehlgeschlagenen LLM-Aufrufe hinzugefügt, wodurch die Lücken in der Überwachung bei fehlendem Tokenverbrauch bei fließenden sowie nicht-fließenden Fehlerreaktionen ausgeglichen wurden.

Verarbeitung von Prompten und Anfragenantworten

Plugins können Prompte verschönern, Vorlagen anwenden, gespeicherte Dialoge speichern, Absichten erkennen, eine JSON-Ausgabe erzwingen und Anfragen oder Antworten umwandeln. Änderungen in der Eingangsschicht beeinflussen alle nachgelagerten Anwendungen; im Produktivumfeld sollten Versionen der Vorlagen, Feldkompatibilität sowie Möglichkeiten zum Rollback getestet werden.

RAG und Suchverbesserung

Higress kann über Plugins auf Wissensdatenbanken, Vektorabfragesysteme und Suchdienste zugreifen und die Ergebnisse der Suche in Modelleingaben einbeziehen. Das Gateway ist für die Koordination zuständig, garantiert jedoch nicht automatisch die Qualität der Dokumente, die Genauigkeit der Treffer oder die Richtigkeit der Zitate sowie die Einhaltung von Urheberrechtsvorschriften.

Datenanonymisierung in KI und Inhaltssicherheit

Der Daten-Desensibilisierungs-Plugin kann sensible Felder vor dem Eingang in das externe Modell verarbeiten, während das Inhaltssicherheits-Plugin Eingaben und Ausgaben überprüft. Einige Plugins sind auf externe Sicherheitsdienste oder selbst entwickelte Modelle angewiesen; in der Version 2.2.4 wurde außerdem die Integration von Qwen3Guard hinzugefügt. Der tatsächliche Schutzniveau hängt von den Regeln, Modellen und der Implementierung ab.

Fließende Verarbeitung von Anfragen und Antworten

Die Envoy-Datenoberfläche sowie die Wasm-Erweiterungen ermöglichen eine vollständige, strömungsbasierte Verarbeitung von Anfrage- und Antwortinhalten. Zudem können Protokolle wie SSE verarbeitet werden. Strömungsbasierte Verbindungen erfordern höhere Anforderungen hinsichtlich Zeitüberschreitungen, der Verwaltung der Verbindungen, der Token-Statistiken sowie der Speicherverwaltung der Plugins. Sie können daher nicht einfach wie herkömmliche kurze Verbindungen getestet werden.

Einheitliche Verwaltung durch MCP

Eigener MCP-Proxy

Higress kann verteilte MCP-Server an einen zentralen Eingangspunkt weiterleiten, wodurch die Authentifizierung, eine feinabgestimmte Limitierung der Zugriffe, die Erkennung von Tools, die Überwachung von Aufrufen sowie die Überwachbarkeit zentral gesteuert werden können. Der Client muss sich nur mit dem Gateway verbinden – doch eine falsche Konfiguration der Berechtigungen am Gateway kann dazu führen, dass weitere Tools für Nutzer zugänglich gemacht werden, die eigentlich keinen Zugriff darauf haben sollten.

Bestehende API in MCP umwandeln

Mithilfe von MCP Bridge und OpenAPI-Umwandlungstools können bestehende REST- oder Webdienste ohne Neuimplementierung der Geschäftslogik als entfernte MCP-Tools bereitgestellt werden. Nach der automatischen Umwandlung ist dennoch eine manuelle Überprüfung der Toolnamen, Parameterstrukturen, Authentifizierung, Fehlerbehandlung sowie gefährlicher Operationen erforderlich.

Kompatibilität der Protokollversionen

V2.2.4 enthält die Unterstützung für den MCP-Standard vom 28.07.2026, einschließlich stateloser Anfragenbegrenzungen, zuverlässiger Tool-Entdeckung, typisierter Parameterüberprüfung, Origin-Schutz sowie Trennung von alten und neuen Protokollen. Vor dem Upgrade sollten End-to-End-Kompatibilitätstests für die Protokollversionen auf Client- und Serverseite durchgeführt werden.

MCP-Betriebsinterface

Der Higress Ops MCP Server kann zur Konfiguration und Verwaltung von Gateways verwendet werden. In der neuen Version wird für sensible Debugging-Funktionen sowie die Verwaltung über Envoy eine obligatorische Basic-Authentifizierung eingeführt. Der für den Betrieb verwendete MCP verfügt über hohe Berechtigungen und sollte von den üblichen Geschäftstools getrennt werden – dabei sollten eigene Anmeldeinformationen, Netzwerkgrenzen sowie Auditing-Mechanismen verwendet werden.

Kubernetes-Reasoning und Gateway-API

Higress unterstützt die Ingress-API und die Gateway-API. Bei der Aktualisierung auf Version 2.2.4 wurde die Gateway-API auf Version 1.6.0 geupgraded. Zudem wurden die Funktionalitäten der Inference Extension v1.4 hinzugefügt. Higress kann die Routing-Ressourcen des Gateways auf die Inferenz-Instanzen verweisen und je nach Status der Inferenz-Endpunkte entsprechend auswählen und aggregieren.

FähigkeitenAktuell unterstütztHinweise
Ingress APIKann als Eingangskontroller für Kubernetes verwendet werdenKompatibel mit einer Vielzahl von Nginx Ingress-Annotierungen, aber nicht jede ist vollständig äquivalent.
Gateway APIUnterstützung für Standard-Gateways und Routing-Ressourcen usw.Überprüfen Sie bei der Aktualisierung die CRD- und Controller-Versionen.
Inference ExtensionUnterstützung bei der Ausführung von v1.4Es müssen der Reasoning-Pool, der Endpoint-Selector sowie die Cluster-Ressourcen abgestimmt werden.
Gateway API-Versionv2.2.4 verwendet v1.6.0Alte Clustern und alte CRDs sind möglicherweise nicht kompatibel.
Route-UpdateDie Konfiguration tritt in Millisekunden in Kraft – es ist kein Neuladen im Nginx-Stil erforderlich.Es sollte weiterhin die Übertragung der Steuerflächen sowie ein fehlerfreies Rollback überprüft werden.
ZertifikatKann mit Let’s Encrypt für automatische Ausstellung und Verlängerung verbunden werden.DNS, das Challenge-Verfahren sowie die Speicherung der Schlüssel müssen richtig konfiguriert werden.

Microservices und die Verwaltung traditioneller APIs

  • Dienstfindung: Es ist möglich, sich mit Registrierungszentren wie Nacos, ZooKeeper, Consul und Eureka zu verbinden.
  • Protokolle: Unterstützung von unverschlüsseltem Webverkehr, verschlüsselter Übertragung sowie gRPC; zudem kann es in Kombination mit dem MCP Bridge zur Verarbeitung von Diensten wie Dubbo verwendet werden.
  • Routing: Bietet Überarbeitung, schrittweises Deployment, Traffic-Verteilung, Lastverteilung und Fehlerbehandlung.
  • Zertifizierung: Es werden Strategien wie Key Auth, JWT, Basic, HMAC, OIDC, OAuth2 sowie externe Zertifizierungsverfahren bereitgestellt.
  • Schutz: Es können CC-Schutzmaßnahmen auf der Ebene von WAF, IP oder Cookies sowie lokale oder clustergestützte Bandbreitenbeschränkungen eingesetzt werden.
  • Migration: Kompatibel mit einer Vielzahl von Nginx Ingress-Annotierungen, geeignet für eine schrittweise Migration anstelle eines einmaligen Ersatzes.
  • Konsole: Bietet eine grafische Steuerungsoberfläche; es ist weiterhin möglich, Kubernetes-Ressourcen sowie automatisierte Konfigurationen zu nutzen.

Wasm-Plugin-Ökosystem

Higress verwendet WebAssembly als Haupterweiterungsmethode. Es ist möglich, Plugins in Sprachen wie Go, Rust und JavaScript zu entwickeln. Durch die Sandbox-Isolierung werden die Risiken im Hinblick auf die Speichersicherheit verringert. Die Versionen der Plugins können unabhängig voneinander aktualisiert werden – ohne dass das gesamte Gateway neu gestartet werden muss.

Plugin-KategorieRepräsentationsfähigkeitHäufige Abhängigkeiten oder Risiken
KI-AgentenModellprotokollumwandlung, Lastverteilung und FallbackUnterschiede zwischen Modellherstellern, Schlüsselsicherheit und Fehlerrückführung
AI-CachePräzise und semantische CachingSpeicherung sensibler Daten, gemeinsame Nutzung durch Mieter und Ablaufstrategien
Token-GovernanceToken-Beschränkungen, Quoten und VerbraucherstatistikenUnterschiede in den Partizipformen und unvollständige fließende Statistiken
KI-SicherheitDesensibilisierung, Inhaltserkennung und Schutz vor Prompt-AttackenFalschmeldungen, Unterberichterstattung sowie Kosten für externe Sicherheitsdienste
AI-OrchestrierungAgent, RAG, Suchen, Erkennung von Geschichte und AbsichtZuverlässigkeit externer Dienste und Hinweise auf Kontamination
Zertifizierung und AuthentifizierungKey, JWT, Basic, HMAC, OIDC und OAuth2Passwortwechsel, Zeitunterschiede und zu umfassende Berechtigungen
Web-SchutzModSecurity WAF und OWASP CRSRegeloptimierung, Fehlblockaden und Ressourcenverbrauch
DatenflusssteuerungLokale oder clustergestützte Throttling, Graustufen- und Cache-SteuerungZustandsabhängigkeit und Strategiekonflikte wie bei Redis
Benutzerdefinierte PluginsBearbeitung spezifischer Geschäftsanfragen und -antwortenLieferketten, Sandbox-Grenzen, Leistung und Upgrade-Kompatibilität

Einrichtungsmethode

EinrichtungsmethodeLaufumgebungHauptmerkmaleFür Nutzer geeignet
Docker All-in-OneEinzige Containerumgebung für Linux, macOS oder WindowsKonsolen, Gateways und Konfigurationen werden zentral gestartet – eine Testphase von etwa 5 Minuten.Lokales Lernen, PoC und einfache Standorte
Unabhängige Bereitstellung mit Docker ComposeVirtuelle Maschine oder Bare MetalKomponenten und Daten lassen sich leichter trennen und persistieren.Kleine Deployments ohne Kubernetes
Helm-Cloud-Native-BereitstellungStandard-Kubernetes-ClusterVerwendung von CRD, Ingress, Gateway-API und SkalierbarkeitPlattformteam und Produktionscluster
Lokaler KubernetesKind, Minikube usw.Näher am Produktionsressourcenmodell – erleichtert die Zusammenarbeit.Entwicklung und Integrationstests
Aliyun ServerlessVollständig verwaltete Cloud-DiensteNach Anforderung an Flexibilität, wartungsfreie UnternehmensressourcenSchnelle Test- und Produktionsumgebung für Serverless-Szenarien
Aliyun Instance Exclusive EditionEigene Cloud-InstanzStärkere Isolation, Spezifikationen, Governance und ServicelevelKerngeschäfte, hochparallele oder streng regulierte Geschäftsprozesse

Docker-Porte

PorteStandardverwendungHerstellungsempfehlungen
8001Higress UI-KonsoleExponieren Sie das öffentliche Netzwerk nicht direkt, erhöhen Sie die Authentifizierung und erstellen Sie eine Whiteliste für das Netzwerk.
8080Gewöhnlicher Eingang für GatewayIm Produktionsumfeld sollte man bevorzugt auf die verschlüsselten Eingänge umsteigen oder diese deaktivieren.
8443Gateway-VerschlüsselungseingangKonfiguration von Zertifikaten für die Empfangsverifizierung, TLS-Strategien und Schlüsselwechsel

Schneller Einstieg in Docker

  1. Vorbereiten Sie einen Test-Host zur Unterstützung der Container sowie einen separaten Arbeitsverzeichnis und stellen Sie sicher, dass die Ports 8001, 8080 und 8443 nicht belegt sind.
  2. Wählen Sie ein Higress-Image-Repository in der Nähe des Bereichs, in dem es eingesetzt werden soll. Im Produktivumfeld sollte eine bestimmte Version angegeben werden, anstatt ständig „latest“ zu verwenden.
  3. Montieren Sie den persistenten Verzeichnis und starten Sie den All-in-One-Container – die Konsole-Ports werden nur in vertrauenswürdigen Netzwerken freigegeben.
  4. Sofort nach dem ersten Zugriff auf die Konsole sollten Authentifizierung für Administratoren, Zugriffsrichtlinien sowie Backup-Strategien konfiguriert werden.
  5. Fügen Sie einen Test-Modell-Anbieter sowie eine API-Schlüssel mit minimalem Berechtigungsgrad hinzu; importieren Sie nicht zuerst alle Produktivschlüssel.
  6. Erstellen Sie eine AI-Route und konfigurieren Sie Modellzuordnungen, Verbraucherauthentifizierung, Token-Limitierung sowie Fehlertoleranz.
  7. Testen Sie normale und strömende Antworten, Fehler, Zeitüberschreitungen sowie Fallbacks mit kleinen, unsensiblen Anfragen.
  8. Überprüfen Sie die Token-, Verzögerungs-, Fehler- und Verbraucherindikatoren, bevor Sie schrittweise Caching-, Sicherheits- und MCP-Plugins hinzufügen.
  9. Erst nach der Überprüfung der Persistenz und Wiederherstellung der Konfiguration sollte eine Migration zu Helm oder einer betriebenen Produktversion in Betracht gezogen werden.

Kubernetes-Deployment-Prozess

  1. Überprüfen Sie die Kompatibilitätsmatrix für Kubernetes, Helm, Gateway API und Higress sowie sichern Sie die vorhandenen Ingress-Ressourcen.
  2. Erstellen Sie für Higress einen eigenen Namespace, Service-Konten, Netzwerkpolicies sowie kontrollierte Image-Repositorys.
  3. Installieren oder aktualisieren Sie die erforderlichen CRDs und prüfen Sie die Warnung wegen einer Versionskonflikts beim Starten des Controllers.
  4. Installieren Sie eine feste Version mit Helm, konfigurieren Sie die Image-Repositorys nach Region und beschränken Sie die Sichtbarkeit der Steuerungsebene und der Konsole.
  5. Migrieren Sie zunächst eine Domain mit niedrigem Risiko und überprüfen Sie nacheinander das kompatible Verhalten der Nginx Ingress-Annotierungen.
  6. Konfigurieren Sie Gateway-Routing, Backend-Dienste, Zertifikate und Authentifizierungs-Plugins sowie führen Sie Rollback-Übungen durch.
  7. Für große Modelle und MCP-Datenverkehr Token-Quoten, Zeitüberschreitungen, Wiederholungsversuche, Circuit Breaker, Fallback-Mechanismen sowie Audits hinzufügen.
  8. Anbindung an Prometheus, Protokollierung und Alarme, zur Überwachung der Konfigurationsverbreitung, der Ressourcen im Datenbereich sowie der langfristigen Verbindungen.
  9. Nach Abschluss der Tests zur Kapazität, Zuverlässigkeit, Sicherheit und Aktualisierung wird die Nutzung auf den Produktionsverkehr ausgeweitet.

Prozess zur Konfiguration des AI-Gateways

  1. Listen Sie die zu integrierenden Modellanbieter, selbst erstellten Inferenzdienste, Agenten und MCP-Server auf und kennzeichnen Sie die Sensitivitätsstufe der Daten.
  2. Für jede Umgebung werden eigene Schlüssel, Verbraucheridentitäten und Routen erstellt, um eine Verwendung in Tests und in der Produktion zu vermeiden.
  3. Einheitliches Protokoll für externe Aufrufe, wobei die Kompatibilitätsprüfung sowie die Fallback-Verarbeitung für modellspezifische Parameter beibehalten werden.
  4. Einstellen Sie den QPS, die Konkurrenzfähigkeit, die Token-Limite, das tägliche Budget sowie die zulässigen Modelle für jeden Verbraucher.
  5. Konfigurieren Sie das bevorzugte Modell, das Ersatzmodell, die Gesundheitsschwellwerte, die Zeitüberschreitung sowie die maximale Anzahl an Wiederholungsversuchen.
  6. Aktivieren Sie die Caching-Funktion nur für Anfragen, die sicher wiederverwendet werden können, und berücksichtigen Sie Benutzer, Mieter sowie Berechtigungen als Teil der Caching-Schlüssel.
  7. Am Eingang werden Minimierung, Maskierung und Schutz vor Prompt-Angriffen aktiviert, am Ausgang wird eine Überprüfung auf Inhalt- und Datenlecks durchgeführt.
  8. Protokollierung von Modellen, Tokens, Verzögerungen, Fehlern, Fallback-Möglichkeiten, Cache-Erfolgen und MCP-Toolaufrufen.
  9. Über Fehlereinleitung wird das Verhalten bei Modellunverfügbarkeit, Redis-Unterbrechungen, Plugin-Fehlern und MCP-Dienst-Timeouts überprüft.

MCP-Online-Prüfung

  1. Importieren Sie nur die überprüften OpenAPI-Operationen und löschen Sie die nicht benötigten Schnittstellen für Löschung, Überweisung, Ausführung und Verwaltung.
  2. Definieren Sie für jedes Werkzeug einen klaren Namen, eine Beschreibung, typisierte Parameter, Pflichtfelder und eine Fehlerstruktur.
  3. Trennen Sie die Lesewerkzeuge von den Schreibwerkzeugen und fügen Sie für hochriskante Operationen eine manuelle Bestätigung hinzu.
  4. Durch Verwendung von Verbraucheridentitäten, minimalem Berechtigungsgrad und Tenant-Isolation wird verhindert, dass Modelle hochprivilegierte Anmeldeinformationen teilen.
  5. Überprüfung von Origin, Authentifizierung, Geschwindigkeitsbeschränkungen, Parameterinjektion, Timeout, Wiederholungsversuchen und Idempotenz.
  6. Das Protokollierungstool erfasst Entdeckungen, Parameter, Aufrufer, Ergebnisse, Fehler sowie die Nummern der nachgelagerten Geschäftsaudits.
  7. Testen Sie gleichzeitig die alten und neuen MCP-Clienten, um eine versteckte Inkompatibilität durch Protokoll-Upgrades zu vermeiden.
  8. Platzieren Sie das Higress Ops-Verwaltungstool in einem separaten Intranet und aktivieren Sie eine strenge Authentifizierung.

Community-Version und Alibaba Cloud-Version

Die Community-Version von Higress ist kostenlos und open source; die Nutzer tragen die Kosten für Server, Netzwerk, Speicher, Überwachung, Aktualisierungen sowie Wartung. Das Alibaba Cloud AI Gateway bietet auf Basis von Higress gehostete Serverless-Lösungen sowie dedizierte Instanzprodukte und fügt außerdem eine Cloud-Konsole, Flexibilität, Servicelevel-Absicherungen sowie kommerzielle Unterstützung hinzu.

VersionDerzeitige Kosten für das GatewayKernkompetenzen oder EinschränkungenPassende Szenarien
Higress Community-VersionSoftwarelizenz kostenlosVollständige Kernfähigkeiten, Wasm-Plugins können angepasst werden; Infrastruktur- und Modellkosten sind selbst zu tragen, es gibt kein kommerzielles SLA.Selbstentwicklung, Weiterentwicklung und Mehrcloud
Serverless Standard EditionWährend der Beta-Phase der neuen Version kostet das Gateway selbst 0 Euro.Standardmäßig 50 QPS, die Plattform verwendet eine standardmäßige Verschlüsselungsmethode; es gibt keinen separaten Zugang über das öffentliche Internet. Es werden keine benutzerdefinierten Domainnamen, Zertifikate, TLS-Strategien oder Konfigurationen für das zweite Webprotokoll unterstützt.Testen, PoC, Entwicklung und Geschäfte mit geringem Datenvolumen
Serverless Enterprise EditionWährend der Beta-Phase der neuen Version kostet das Gateway selbst 0 Euro.Standardmäßig 500 QPS, eigener Eingangspunkt, benutzerdefinierter Domainname, Zertifikate, TLS-Strategien, zweite Generation des Webprotokolls sowie eine SLA von 99,95%.Formelle Produktion und externe AI-Dienste
alte Version von ServerlessAbrechnung von CU nach Anfrage und öffentlicher DatenverkehrsmengeBestehende Instanzen werden weiterhin genutzt, die Leistung bleibt bei den ursprünglichen Spezifikationen; neue Kunden erhalten vorrangig die neuere Version.Bestehende Kunden wechseln reibungslos über
Instanzbasierte Exklusiv-Miete nach VerbrauchStundenweise Instanzgebühren zuzüglich Datenverarbeitung und InternetdatentransferEinsatz von Ressourcen exklusiv, standardisierte Leistung sowie umfassende Steuerung – nach Nutzung wieder frei gegebenKurzfristige Anforderungen an hohe Leistung, Spitzenwerte oder Isolierung
Exklusiver Monatsvertrag für InstanztypenMonatliche Vorauszahlung für die Instanzkosten sowie zusätzliche Gebühren für Datenverarbeitung und InternetnutzungLangfristige Nutzung von Rabatten ist in der Regel teurer; Spezifikationen und Region beeinflussen den Preis.Langfristige Kernproduktionsaktivitäten

Kostenlose Beta-Grenzen

Die kostenlose Testversion von Serverless umfasst nur die Kosten für das Gateway selbst; der Datenverkehr ins öffentliche Netz wird weiterhin nach den Preisen für die Cloud-Datenübertragung abgerechnet. Für Modellservices, Protokolle, Überwachungsfunktionen sowie andere Cloud-Produkte werden gesonderte Gebühren erhoben. Nach Abschluss der Testphase könnte eine kommerzielle Abrechnung eingeführt werden. Die endgültigen Preise und Angebote müssen in der Konsole erneut überprüft werden.

Kostenstruktur der Exklusivversion

Die Einzelnutzer-Version besteht aus einer Gateway-Instanz, der Verarbeitung von Anfragen und Antworten sowie dem Datenverkehr im öffentlichen Netzwerk. Der genaue Preis hängt von den Spezifikationen, dem Standort, der Netzwerktyp und der Kaufdauer ab. Es gibt keinen festen Preis, der für alle Deployment-Szenarien gilt.

Open Source, GitHub und Lizenzen

Das Hauptlager von Higress wird derzeit von der higress-group betreut. Der ursprüngliche Eingang zum Alibaba-Lager führt nun auf die neue Organisation. Die Hauptcodebasis verwendet die Lizenz Apache-2.0. Das Hauptlager wird aktiv gewartet; Version v2.2.4 wurde am 13. August 2026 veröffentlicht.

ProjektOffener StatusLizenz oder AnleitungWirkung
Higress-HauptlagerÖffentlichApache-2.0Steuerungsseite, Datenfluss-Integration, CRD und Kern-Plugins
Wasm Go SDKÖffentlichApache-2.0Entwicklung eines Higress-Plugins mit Go
OpenAPI-zu-MCP-WerkzeugÖffentlichApache-2.0Erstellen einer MCP-Dienstkonfiguration aus OpenAPI-Operationen
KonsoleÖffentlicher LagerplatzDie genauen Genehmigungen müssen anhand der Lagerdokumente überprüft werden.Grafische Verwaltung und Konfiguration
StandaloneÖffentlicher LagerplatzDie genauen Genehmigungen müssen anhand der Lagerdokumente überprüft werden.Unabhängige Bereitstellung ohne Kubernetes
ProjektdokumentationÖffentlichCC-BY-4.0Anleitung zur Verwendung, Architektur und Plugins
Aliyun AI-GatewayWirtschaftliche Hosting-DiensteGebunden durch Cloud-DienstleistungsverträgeServerless, dedizierte Instanzen und SLA

Open Source bedeutet nicht Kostenlosigkeit.

Apache-2.0 erlaubt die Verwendung, Änderung und Verteilung des Hauptcodes, doch Unternehmen müssen weiterhin den Lizenzbedingungen sowie den Anforderungen in der NOTICE-Kennzeichnung nachkommen und die Kosten für Server, Aufrufe von Modellen, externe Erweiterungen, Überwachung, Sicherheit sowie Wartung tragen. Auch die kommerzielle Version von Alibaba Cloud kann aufgrund der Verwendung eines Open-Source-Kernels nicht als kostenlos oder mit der Möglichkeit zur eigenen Kopieerstellung des Services angesehen werden.

Sicherheit und Privatsphäre

Durch die eigene Implementierung von Higress können Anfragen, Antworten, Schlüssel sowie Auditedaten innerhalb des vom Unternehmen kontrollierten Netzwerks und der Speicherung verbleiben. Dennoch können Anfragen weitergeleitet werden an externe Modelle, Suchmaschinen, Vektordatenbanken oder Sicherheitsdienste. Die tatsächlichen Datengrenzen werden durch Routing-Regeln, Plugins sowie die upstream liegenden Anbieter bestimmt.

RisikofaktorenMögliche ProblemeEmpfehlungen
Modell-API-SchlüsselKosten durch Datenleck oder Offenlegung von DatenVerwendung von Schlüsselverwaltung, Mindestrechten, Regelmäßiger Wechsel sowie Alarme bei Abweichungen
Hinweise und AntwortprotokolleEnthält persönliche, geschäftliche oder kodierte GeheimnisseStandardmäßige Maskierung, verkürzte Aufbewahrungsfrist und eingeschränkte Abfragemöglichkeiten
Präzision und semantische CachingRückgabe an mehrere Benutzer oder langfristige Speicherung sensibler InhalteMieterisolation, Berechtigungsverwaltung, Verschlüsselung und Ablaufdatum
MCP-ToolModell induziert die Ausführung von risikoreichen GeschäftsoperationenWhitelist für Tools, manuelle Überprüfung, Parametervalidierung und Auditing
Wasm-PluginLieferketten, Schwachstellen, Ressourcenerschöpfung oder logische ManipulationenFeste Zusammenfassung, Signaturverifizierung, Sandbox-Beschränkungen und schrittweises Veröffentlichen
KonsoleDer Administrator-Zugang wird aus dem öffentlichen Internet angegriffenInternes Netzwerkzugriff, strenge Authentifizierung, mehrfache Authentifizierungsmechanismen sowie Weißliste für das Netzwerk
Externe SicherheitsepplerDaten werden an Drittanbieter für Prüfdienste gesendetUnterschreiben des Abkommens und Bestätigung der Regeln bezüglich des Gebiets, der Ausbildung und der Beibehaltung.
BeobachtungssystemeDie Tags enthalten einen Token, eine Benutzer-ID oder Hinweistexte.Einschränkung von Feldern mit hohem Basiswert und Bereinigung sensibler Tags
Cloud-Hosting-VersionDaten, Protokolle und Traffic werden durch die Cloud-Region sowie die Produktbedingungen beeinflusst.Wählen Sie den Standort aus und überprüfen Sie Konformität, SLA sowie Unterdienste.

Vorteile des Produkts

  • Ein Eingangstyp verwaltet gleichzeitig LLM-APIs, Agenten, MCP sowie Kubernetes-Inferenzlasten.
  • Basierend auf Istio und Envoy – geeignet für langanhaltende Verbindungen, SSE sowie AI-Datenverkehr mit hoher Bandbreite.
  • Unterstützt mehr als 100 gängige Modelle und bietet ein einheitliches Protokoll, Lastverteilung sowie Fallback-Möglichkeiten.
  • Token-Beschränkungen, Quoten, Caching und Überwachung sind direkt auf die Kosten und Stabilität von KI ausgerichtet.
  • MCP-Proxy, Umwandlung bestehender APIs in MCP sowie Auditing verringern die Komplexität bei der Anbindung mehrerer Teams an Tools.
  • Kompatibel mit der Ingress-API und der Gateway-API – kann mit bestehenden cloudbasierten Eingangssystemen verbunden werden.
  • Wasm-Plugins können in verschiedenen Sprachen entwickelt werden, unabhängig aktualisiert und hot updated werden.
  • Unterstützung für eigenständige Docker-Deployment, cloudnative Helm-Deployment sowie die von Alibaba Cloud gehostete Version.
  • Das Hauptprojekt verwendet Apache-2.0 und wird von der CNCF Sandbox-Community unter offener Verwaltung betrieben.

Einsatzbeschränkungen und Hinweise

  • Higress ist eine Infrastruktur, kein sofort einsetzbares Terminal-Chat- oder Wissensdatenbank-Produkt.
  • Für die Produktimplementierung sind Erfahrungen in Gateway-Technologien, Kubernetes, Netzwerken, Sicherheit und Überwachung erforderlich.
  • Die Community-Version verfügt über kein kommerzielles SLA; die Reaktionszeit auf Störungen, Updates sowie die Kapazität werden von dem eigenen Team übernommen.
  • Eine einheitliche Schnittstelle kann die Unterschiede in den Funktionen, der Qualität, dem Kontext sowie den fehlerhaften Formatierungen der Modelle nicht beseitigen.
  • Der Wechsel auf unterschiedliche Modelle kann die Antworten, die Konformitätsergebnisse und die Kosten verändern.
  • Der semantische Cache kann alte Antworten zurückgeben, die für den aktuellen Benutzer oder Kontext nicht geeignet sind.
  • Die Token-Statistiken hängen von der Reaktion des Anbieters sowie von der Art der Worttrennung ab und können nicht direkt mit Rechnungen gleichgesetzt werden.
  • Das MCP-Tool verbindet das Modell mit der realen Geschäftswelt und weist darauf hin, dass Eingriffe zu tatsächlichen Betriebsrisiken werden können.
  • Einige Erweiterungen sind von Redis, Vektordatenbanken, Suchfunktionen oder externen Sicherheitsdiensten abhängig, was die Kosten und das Ausfallrisiko erhöht.
  • Kundenspezifische Wasm-Plugins können weiterhin Probleme in Bezug auf Geschäftslogik, Lieferketten und Ressourcenverbrauch aufweisen.
  • Beim Upgrade auf v2.2.4 sollten Sie auf Veränderungen in der Semantik der Regeln zur Bandbreitenbegrenzung und andere Verhaltensänderungen achten.
  • CNCF Sandbox befindet sich laut Angaben in der Anfangsphase der Projektverwaltung und entspricht somit noch nicht dem Grad der Reife „Graduated“.
  • Die Preise und Funktionen der neuen Version von Serverless im Beta-Zustand könnten nach der Kommerzialisierung angepasst werden.
  • Der kostenlose Cloud-Version umfasst nicht den Datenverkehr im öffentlichen Netz, Modelle, Protokolle, Überwachung sowie verbundene Cloud-Produkte.

Grundlegende Informationen

ProjektInhalt
Name des ToolsHigress
Arten von WerkzeugenKI-basierte API-Gateways, MCP-Gateways und cloudnative Eingangsgateways
ProjektphaseCNCF Sandbox
Technische GrundlagenIstio, Envoy, WebAssembly und Kubernetes API
Aktuelle stabile Versionv2.2.4, veröffentlicht am 13. August 2026
Lizenz für das HauptlagerApache-2.0
DokumentlizenzCC-BY-4.0
ModellumfangMehr als 100 gängige Modelle
MCP-FähigkeitenEigene Proxy-Server, Umwandlung bestehender APIs, Authentifizierung, Bandbreitenbegrenzung, Auditing sowie Tool-Routing
EinrichtungsmethodeDocker, Docker Compose, Helm, Kubernetes und Alibaba Cloud
ErweiterungsmöglichkeitenWasm-Plugins in Sprachen wie Go, Rust, JavaScript usw. schreiben
Preis für die Open-Source-VersionDie Software-Lizenz ist kostenlos, die Infrastruktur sowie die zugehörigen Dienstleistungen müssen selbst bereitgestellt werden.
Kommerzielle VersionAliyun Serverless und die dedizierte Instanzversion
Ob Open SourceJa
Wird ein öffentlicher Cloud-Service angeboten?Ja

Häufige Fragen

Ist Higress kostenlos?

Der Code für die Community-Version wird unter der Apache-2.0-Lizenz bereitgestellt, sodass er kostenlos verwendet werden kann. Allerdings sind Server, Netzwerk, Modelle, Speicher sowie Wartungsdienste nicht kostenlos. Während der Beta-Phase von Alibaba Cloud Serverless entstehen keine Kosten für das Gateway selbst; andere Cloud-Dienste sowie Datenverkehr können jedoch weiterhin Gebühren verursachen.

Ist Higress ein großes Modell?

Nein. Es befindet sich zwischen Anwendungen und Modellen, Agenten, MCP-Tools oder Inferenzdiensten und ist für die Anbindung sowie Verwaltung zuständig; es ersetzt nicht selbst die übergeordneten Modelle bei der Erstellung von Inhalten.

Welche Modelle werden unterstützt?

Auf der aktuellen Produktseite steht, dass mehr als 100 gängige Modelle unterstützt werden, und dass es möglich ist, sowohl die mit OpenAI kompatiblen Schnittstellen als auch die von verschiedenen inländischen und ausländischen Anbietern bereitgestellten Funktionen zu nutzen. Die genauen Anforderungen bezüglich Multimodalität, Aufruf von Tools sowie Parameterkompatibilität müssen durch Tests mit den Plugins der jeweiligen Anbieter überprüft werden.

Kann man auf Kubernetes verzichten?

Ja. Docker All-in-One, Docker Compose und Standalone eignen sich zum Betrieb ohne Kubernetes; für Produktionsumgebungen, Persistenz und hohe Verfügbarkeit muss man jedoch selbst Lösungen entwickeln.

Kann man eine gewöhnliche API in ein MCP-Tool umwandeln?

Ja, es ist möglich, eine entfernte MCP-Konfiguration über den MCP Bridge und Werkzeuge zur OpenAPI-Umwandlung zu erstellen. Nach der automatischen Erstellung müssen gefährliche Abläufe, Parameter, Authentifizierungsmechanismen sowie Anleitungen zu den Werkzeugen manuell überprüft werden.

Ist Higress dasselbe wie das Alibaba Cloud AI Gateway?

Es ist nicht genau dasselbe. Higress ist ein Projekt der Open-Source-Community, während das Alibaba Cloud AI Gateway auf seinen Fähigkeiten aufbaut, um Serverless-Lösungen, dedizierte Instanzen, Cloud-Integrationen, SLAs sowie kommerzielle Unterstützung anzubieten.

Kann die Standardversion von Serverless in der Produktion eingesetzt werden?

Es eignet sich besser für niedrigen Datenverkehr, Tests und die Entwicklung. Standardmäßig sind 50 QPS vorgesehen, es gibt keinen eigenen Eingang sowie keine Möglichkeit zur Anpassung des Domainnamens. Für den regulären Einsatz sollte in der Regel die Enterprise-Version oder eine dedizierte Instance-Version in Betracht gezogen werden.

Wird Higress die Kosten des Modells senken?

Caching, Quoten, Routing und Fallback können dazu beitragen, Verschwendung zu verringern oder geeignetere Modelle auszuwählen, doch sie garantieren nicht, dass die Gesamtkosten unbedingt sinken. Auch die Kosten für Gateways, Caching, Überwachung und Wartung müssen berücksichtigt werden.

Ist Higress Open Source?

Ja, der Hauptspeicher verwendet Apache-2.0. Die Lizenzen und Bedingungen für die zugehörigen Konsole, Standalone-Versionen, Plugins sowie kommerzielle Cloud-Dienste müssen separat überprüft werden.

Zusammenfassung

Higress eignet sich für Entwicklungs- und Plattformteams, die an einem zentralen Eingangspunkt mehrere Modelle, Agenten, MCP-Tools sowie cloudnative APIs verwalten müssen. Es bringt Token-Verwaltung, Fallback-Mechanismen, Caching, Inhaltssicherheit, strömungsbasierte Überwachung sowie MCP-Auditing auf die Gateway-Ebene und behält dabei die Leistungsfähigkeit von Envoy, die Standards der Gateway-API sowie die Erweiterungsmöglichkeiten durch Wasm bei.

Bei der Auswahl muss zwischen der Open-Source-Version der Apache-Community und der von Alibaba Cloud gehosteten Version unterschieden werden. Zudem sollten die Kosten für den Aufruf der Modelle, den Datenverkehr, die Protokolldaten, Redis, Plugins sowie die Wartung in die Gesamtkosten einbezogen werden. Beim eigentlichen Go-Live sollte außerdem besonders auf die Isolation des Caches, den Schutz der Schlüssel, die Mindestberechtigungen nach dem Prinzip MCP, die Kompatibilität bei Versionserhöhungen sowie Mechanismen zur Fehlerbehebung geachtet werden – anstatt sich nur auf die Funktion des Modell-Proxy zu konzentrieren.

©️ Urheberrechtshinweis: Sofern nicht anders angegeben, liegen die Urheberrechte an allen Artikeln auf dieser Website beiTeilen von AI-ToolsAlle Urheberrechte liegen bei uns. Ohne Genehmigung darf keine Person, kein Medienunternehmen, keine Website oder irgendeine Gruppe den Inhalt dieser Website kopieren, nachahmen oder auf andere Weise verbreiten. Ebenso ist es nicht gestattet, Spiegelseiten auf Servern zu erstellen, die nicht uns gehören. Andernfalls behalten wir uns das Recht vor, rechtliche Schritte gegen die Verantwortlichen einzuleiten.

Werkzeuge, die denen von Higress ähneln