Higress
Higress – ein intelligentes Tool, das sich auf KI-Agenten konzentriert.
Tags:AI AgentEine kurze Beschreibung
Higress ist ein open-source API-Gateway, das auf Istio und Envoy basiert und für künstliche Intelligenz konzipiert ist. Es ermöglicht den einheitlichen Zugriff auf APIs großer Modelle, AI-Agenten, MCP-Server sowie Kubernetes-Inferenzdienste. Auf der Eingangsebene übernimmt es Aufgaben wie Routing, Protokollumwandlung, Quotenverwaltung, Sicherheit, Caching sowie Überwachung und Steuerung.
Einführung in die Tools
Higress entstand ursprünglich innerhalb von Alibaba, um Probleme wie die Überlastung der Gateways, die negative Auswirkung auf langfristige Verbindungen sowie unzureichende Lastverteilung bei gRPC und Dubbo zu lösen. Später wurde es in den CNCF Sandbox eingeführt, wo es unter offener Steuerung weiterentwickelt wird. Es kann sowohl als AI-Gateway als auch als Kubernetes-Ingress, Microservice-Gateway sowie als Sicherheitsgateway eingesetzt werden.
Stand dem 23. August 2026 ist die neueste stabile Version des Hauptlagers v2.2.4, wobei der Hauptcode unter der Apache-2.0-Lizenz steht. Das Produkt richtet sich an Teams für Plattformentwicklung, Cloud-Native-Betrieb, AI-Infrastruktur sowie an Entwicklergruppen und bietet keine direkten Chatten- oder Inhaltsgenerierungs-Oberflächen für normale Nutzer.
Kernpositionierung
| Positionierung | Anschlussobjekt | Hauptfähigkeiten | Typischer Benutzer |
|---|---|---|---|
| LLM-Gateway | Business-Modelle, selbst entwickelte Modelle und OpenAI-kompatible Schnittstellen | Einheitliche Vereinbarungen, Lastverteilung, Fallback-Mechanismen, Token-Verwaltung und Überwachung | AI-Plattformen und Anwendungsteams |
| MCP-Gateway | Eigene MCP-Dienste und bestehende REST-APIs | Protokollumwandlung, Authentifizierung, Bandbreitenbegrenzung, Auditing und Tool-Routing | Agent-Plattform und Tool-Service-Team |
| Modell-Gateway | Kubernetes-Inferenz-Arbeitsschichten | Gateway API Inference Extension und Endpunktauswahl | Eigenes Team zur Erstellung von Inferenzclustern |
| Ingress-Gateway | Kubernetes-Dienste und externe Verbindungen | Ingress-API, Gateway-API, Zertifikate und schrittweiser Routing | Cloud-Native-Plattform-Team |
| Microservice-Gateway | Registrierungsdienste wie Nacos, ZooKeeper, Consul, Eureka usw. | Dienstfindung, Routing, Protokollanpassung und Governance | Microservices-Architektur-Team |
| Sicherheitsgateway | Web-, API-, Modell- und Tool-Datenverkehr | WAF, Authentifizierung und Autorisierung, Limitierung des Datenverkehrs, Maskierung sowie Inhaltserkennung | Sicherheits- und Konformitätsteam |
Hauptfunktionen
Mehr als 100 Modelle in einem einheitlichen Agenten
Higress kann die Authentifizierungsverfahren, die Schnittstellengeometrien sowie die Modellnamen verschiedener Hersteller in einen einheitlichen Eingangsbereich zusammenfassen. Auf der Produktseite wird angegeben, dass mehr als 100 gängige Modelle unterstützt werden. Dadurch kann der Code, der speziell für jeden Hersteller entwickelt werden muss, reduziert werden. Dennoch müssen die Unterschiede zwischen den Modellen hinsichtlich der Toolaufrufe, der Multimodalität, des Kontexts sowie der Fehlerformatierung berücksichtigt werden.
Mehrmodell-Routing und Ausfallsicherung
Ein Team kann hinter derselben Route mehrere Modelle oder Authentifizierungstoken konfigurieren, um durch Polling, Lastverteilung, Gesundheitsüberwachung und Fallback die Verfügbarkeit zu erhöhen. Downgrade können nur einzelne Ausfallpunkte verringern und gewährleisten nicht, dass die Ausgabequalität, die Länge des Kontexts sowie die Konformitätsstrategien der verschiedenen Modelle vollständig identisch sind.
Anpassungsfähige Lastverteilung im Modell
In der Version v2.2.4 wurde das AdaptiveScore-Modell auf Basis des Echtzeit-Drucks hinzugefügt. Es ermöglicht es, die Konkurrenzlast auf Clusterebene mithilfe von Redis zu erfassen und gleichzeitig lokale Abschwächungsstrategien anzuwenden. Diese Funktion eignet sich für Cluster mit hoher Konkurrenzlast. Allerdings beeinflussen die Verfügbarkeit von Redis, Verzögerungen bei der Übermittlung von Metadaten sowie die Einstellungen der Strategien auch die Ergebnisse der Scheduling-Logik.
API-Schlüssel-Pool und Token-Downgrade
Derselbe Modellanbieter kann mehrere API-Schlüssel konfigurieren und für jeden Token Schwellenwerte für Abweichungen sowie Mechanismen zur Wiederherstellung der Funktionalität festlegen. Die Schlüsselpooling-Funktion unterstützt die Kapazitätsplanung und den Failover, kann jedoch nicht verwendet werden, um die Kontrollen des Modellanbieters zu umgehen oder die Nutzungsbedingungen zu verletzen.
Token-Beschränkungen und Quoten
Higress begrenzt den Datenfluss nicht nur nach QPS, sondern auch anhand von Eingangs- und Ausgabetokens, der Anzahl der Anfragen, der Konkurrenz sowie der Einstellungen für die Verbraucher. Version 2.2.4 unterstützt die gleichzeitige Anwendung mehrerer Regeln. Bei einem Upgrade muss man die Logik der ersten Treffer in der alten Version überprüfen, um plötzliche Änderungen bei den Quoten zu vermeiden.
Präziser Cache und semantischer Cache
Die präzise Cache-Wiederverwendung speichert exakt dieselben Anfragedaten, während der semantische Cache aufgrund der Ähnlichkeit bereits vorhandene Antworten zurückgibt. Dadurch können wiederholte Aufrufe des Modells, die Kosten für Tokens sowie Verzögerungen verringert werden. Der Cache kann sensible Informationen und Antworten speichern; außerdem kann er bei scheinbar ähnlichen, aber tatsächlich unterschiedlichen Fragen falsche Inhalte zurückgeben. Daher sind eine Trennung der Benutzer, Ablaufzeiten sowie Ausschlussregeln notwendig.
AI-Überwachbarkeit
Die Überwachung kann Kennzahlen wie die Anzahl der pro Sekunde eingegebenen und ausgegebenen Tokens, den Verbrauch von Ressourcen durch Anbieter und Modelle, Verzögerungen sowie Anzahl erfolgreicher und fehlgeschlagener Aufrufe ermitteln. In Version 2.2.4 wurde die Anzeige der Anzahl der fehlgeschlagenen LLM-Aufrufe hinzugefügt, wodurch die Lücken in der Überwachung bei fehlendem Tokenverbrauch bei fließenden sowie nicht-fließenden Fehlerreaktionen ausgeglichen wurden.
Verarbeitung von Prompten und Anfragenantworten
Plugins können Prompte verschönern, Vorlagen anwenden, gespeicherte Dialoge speichern, Absichten erkennen, eine JSON-Ausgabe erzwingen und Anfragen oder Antworten umwandeln. Änderungen in der Eingangsschicht beeinflussen alle nachgelagerten Anwendungen; im Produktivumfeld sollten Versionen der Vorlagen, Feldkompatibilität sowie Möglichkeiten zum Rollback getestet werden.
RAG und Suchverbesserung
Higress kann über Plugins auf Wissensdatenbanken, Vektorabfragesysteme und Suchdienste zugreifen und die Ergebnisse der Suche in Modelleingaben einbeziehen. Das Gateway ist für die Koordination zuständig, garantiert jedoch nicht automatisch die Qualität der Dokumente, die Genauigkeit der Treffer oder die Richtigkeit der Zitate sowie die Einhaltung von Urheberrechtsvorschriften.
Datenanonymisierung in KI und Inhaltssicherheit
Der Daten-Desensibilisierungs-Plugin kann sensible Felder vor dem Eingang in das externe Modell verarbeiten, während das Inhaltssicherheits-Plugin Eingaben und Ausgaben überprüft. Einige Plugins sind auf externe Sicherheitsdienste oder selbst entwickelte Modelle angewiesen; in der Version 2.2.4 wurde außerdem die Integration von Qwen3Guard hinzugefügt. Der tatsächliche Schutzniveau hängt von den Regeln, Modellen und der Implementierung ab.
Fließende Verarbeitung von Anfragen und Antworten
Die Envoy-Datenoberfläche sowie die Wasm-Erweiterungen ermöglichen eine vollständige, strömungsbasierte Verarbeitung von Anfrage- und Antwortinhalten. Zudem können Protokolle wie SSE verarbeitet werden. Strömungsbasierte Verbindungen erfordern höhere Anforderungen hinsichtlich Zeitüberschreitungen, der Verwaltung der Verbindungen, der Token-Statistiken sowie der Speicherverwaltung der Plugins. Sie können daher nicht einfach wie herkömmliche kurze Verbindungen getestet werden.
Einheitliche Verwaltung durch MCP
Eigener MCP-Proxy
Higress kann verteilte MCP-Server an einen zentralen Eingangspunkt weiterleiten, wodurch die Authentifizierung, eine feinabgestimmte Limitierung der Zugriffe, die Erkennung von Tools, die Überwachung von Aufrufen sowie die Überwachbarkeit zentral gesteuert werden können. Der Client muss sich nur mit dem Gateway verbinden – doch eine falsche Konfiguration der Berechtigungen am Gateway kann dazu führen, dass weitere Tools für Nutzer zugänglich gemacht werden, die eigentlich keinen Zugriff darauf haben sollten.
Bestehende API in MCP umwandeln
Mithilfe von MCP Bridge und OpenAPI-Umwandlungstools können bestehende REST- oder Webdienste ohne Neuimplementierung der Geschäftslogik als entfernte MCP-Tools bereitgestellt werden. Nach der automatischen Umwandlung ist dennoch eine manuelle Überprüfung der Toolnamen, Parameterstrukturen, Authentifizierung, Fehlerbehandlung sowie gefährlicher Operationen erforderlich.
Kompatibilität der Protokollversionen
V2.2.4 enthält die Unterstützung für den MCP-Standard vom 28.07.2026, einschließlich stateloser Anfragenbegrenzungen, zuverlässiger Tool-Entdeckung, typisierter Parameterüberprüfung, Origin-Schutz sowie Trennung von alten und neuen Protokollen. Vor dem Upgrade sollten End-to-End-Kompatibilitätstests für die Protokollversionen auf Client- und Serverseite durchgeführt werden.
MCP-Betriebsinterface
Der Higress Ops MCP Server kann zur Konfiguration und Verwaltung von Gateways verwendet werden. In der neuen Version wird für sensible Debugging-Funktionen sowie die Verwaltung über Envoy eine obligatorische Basic-Authentifizierung eingeführt. Der für den Betrieb verwendete MCP verfügt über hohe Berechtigungen und sollte von den üblichen Geschäftstools getrennt werden – dabei sollten eigene Anmeldeinformationen, Netzwerkgrenzen sowie Auditing-Mechanismen verwendet werden.
Kubernetes-Reasoning und Gateway-API
Higress unterstützt die Ingress-API und die Gateway-API. Bei der Aktualisierung auf Version 2.2.4 wurde die Gateway-API auf Version 1.6.0 geupgraded. Zudem wurden die Funktionalitäten der Inference Extension v1.4 hinzugefügt. Higress kann die Routing-Ressourcen des Gateways auf die Inferenz-Instanzen verweisen und je nach Status der Inferenz-Endpunkte entsprechend auswählen und aggregieren.
| Fähigkeiten | Aktuell unterstützt | Hinweise |
|---|---|---|
| Ingress API | Kann als Eingangskontroller für Kubernetes verwendet werden | Kompatibel mit einer Vielzahl von Nginx Ingress-Annotierungen, aber nicht jede ist vollständig äquivalent. |
| Gateway API | Unterstützung für Standard-Gateways und Routing-Ressourcen usw. | Überprüfen Sie bei der Aktualisierung die CRD- und Controller-Versionen. |
| Inference Extension | Unterstützung bei der Ausführung von v1.4 | Es müssen der Reasoning-Pool, der Endpoint-Selector sowie die Cluster-Ressourcen abgestimmt werden. |
| Gateway API-Version | v2.2.4 verwendet v1.6.0 | Alte Clustern und alte CRDs sind möglicherweise nicht kompatibel. |
| Route-Update | Die Konfiguration tritt in Millisekunden in Kraft – es ist kein Neuladen im Nginx-Stil erforderlich. | Es sollte weiterhin die Übertragung der Steuerflächen sowie ein fehlerfreies Rollback überprüft werden. |
| Zertifikat | Kann mit Let’s Encrypt für automatische Ausstellung und Verlängerung verbunden werden. | DNS, das Challenge-Verfahren sowie die Speicherung der Schlüssel müssen richtig konfiguriert werden. |
Microservices und die Verwaltung traditioneller APIs
- Dienstfindung: Es ist möglich, sich mit Registrierungszentren wie Nacos, ZooKeeper, Consul und Eureka zu verbinden.
- Protokolle: Unterstützung von unverschlüsseltem Webverkehr, verschlüsselter Übertragung sowie gRPC; zudem kann es in Kombination mit dem MCP Bridge zur Verarbeitung von Diensten wie Dubbo verwendet werden.
- Routing: Bietet Überarbeitung, schrittweises Deployment, Traffic-Verteilung, Lastverteilung und Fehlerbehandlung.
- Zertifizierung: Es werden Strategien wie Key Auth, JWT, Basic, HMAC, OIDC, OAuth2 sowie externe Zertifizierungsverfahren bereitgestellt.
- Schutz: Es können CC-Schutzmaßnahmen auf der Ebene von WAF, IP oder Cookies sowie lokale oder clustergestützte Bandbreitenbeschränkungen eingesetzt werden.
- Migration: Kompatibel mit einer Vielzahl von Nginx Ingress-Annotierungen, geeignet für eine schrittweise Migration anstelle eines einmaligen Ersatzes.
- Konsole: Bietet eine grafische Steuerungsoberfläche; es ist weiterhin möglich, Kubernetes-Ressourcen sowie automatisierte Konfigurationen zu nutzen.
Wasm-Plugin-Ökosystem
Higress verwendet WebAssembly als Haupterweiterungsmethode. Es ist möglich, Plugins in Sprachen wie Go, Rust und JavaScript zu entwickeln. Durch die Sandbox-Isolierung werden die Risiken im Hinblick auf die Speichersicherheit verringert. Die Versionen der Plugins können unabhängig voneinander aktualisiert werden – ohne dass das gesamte Gateway neu gestartet werden muss.
| Plugin-Kategorie | Repräsentationsfähigkeit | Häufige Abhängigkeiten oder Risiken |
|---|---|---|
| KI-Agenten | Modellprotokollumwandlung, Lastverteilung und Fallback | Unterschiede zwischen Modellherstellern, Schlüsselsicherheit und Fehlerrückführung |
| AI-Cache | Präzise und semantische Caching | Speicherung sensibler Daten, gemeinsame Nutzung durch Mieter und Ablaufstrategien |
| Token-Governance | Token-Beschränkungen, Quoten und Verbraucherstatistiken | Unterschiede in den Partizipformen und unvollständige fließende Statistiken |
| KI-Sicherheit | Desensibilisierung, Inhaltserkennung und Schutz vor Prompt-Attacken | Falschmeldungen, Unterberichterstattung sowie Kosten für externe Sicherheitsdienste |
| AI-Orchestrierung | Agent, RAG, Suchen, Erkennung von Geschichte und Absicht | Zuverlässigkeit externer Dienste und Hinweise auf Kontamination |
| Zertifizierung und Authentifizierung | Key, JWT, Basic, HMAC, OIDC und OAuth2 | Passwortwechsel, Zeitunterschiede und zu umfassende Berechtigungen |
| Web-Schutz | ModSecurity WAF und OWASP CRS | Regeloptimierung, Fehlblockaden und Ressourcenverbrauch |
| Datenflusssteuerung | Lokale oder clustergestützte Throttling, Graustufen- und Cache-Steuerung | Zustandsabhängigkeit und Strategiekonflikte wie bei Redis |
| Benutzerdefinierte Plugins | Bearbeitung spezifischer Geschäftsanfragen und -antworten | Lieferketten, Sandbox-Grenzen, Leistung und Upgrade-Kompatibilität |
Einrichtungsmethode
| Einrichtungsmethode | Laufumgebung | Hauptmerkmale | Für Nutzer geeignet |
|---|---|---|---|
| Docker All-in-One | Einzige Containerumgebung für Linux, macOS oder Windows | Konsolen, Gateways und Konfigurationen werden zentral gestartet – eine Testphase von etwa 5 Minuten. | Lokales Lernen, PoC und einfache Standorte |
| Unabhängige Bereitstellung mit Docker Compose | Virtuelle Maschine oder Bare Metal | Komponenten und Daten lassen sich leichter trennen und persistieren. | Kleine Deployments ohne Kubernetes |
| Helm-Cloud-Native-Bereitstellung | Standard-Kubernetes-Cluster | Verwendung von CRD, Ingress, Gateway-API und Skalierbarkeit | Plattformteam und Produktionscluster |
| Lokaler Kubernetes | Kind, Minikube usw. | Näher am Produktionsressourcenmodell – erleichtert die Zusammenarbeit. | Entwicklung und Integrationstests |
| Aliyun Serverless | Vollständig verwaltete Cloud-Dienste | Nach Anforderung an Flexibilität, wartungsfreie Unternehmensressourcen | Schnelle Test- und Produktionsumgebung für Serverless-Szenarien |
| Aliyun Instance Exclusive Edition | Eigene Cloud-Instanz | Stärkere Isolation, Spezifikationen, Governance und Servicelevel | Kerngeschäfte, hochparallele oder streng regulierte Geschäftsprozesse |
Docker-Porte
| Porte | Standardverwendung | Herstellungsempfehlungen |
|---|---|---|
| 8001 | Higress UI-Konsole | Exponieren Sie das öffentliche Netzwerk nicht direkt, erhöhen Sie die Authentifizierung und erstellen Sie eine Whiteliste für das Netzwerk. |
| 8080 | Gewöhnlicher Eingang für Gateway | Im Produktionsumfeld sollte man bevorzugt auf die verschlüsselten Eingänge umsteigen oder diese deaktivieren. |
| 8443 | Gateway-Verschlüsselungseingang | Konfiguration von Zertifikaten für die Empfangsverifizierung, TLS-Strategien und Schlüsselwechsel |
Schneller Einstieg in Docker
- Vorbereiten Sie einen Test-Host zur Unterstützung der Container sowie einen separaten Arbeitsverzeichnis und stellen Sie sicher, dass die Ports 8001, 8080 und 8443 nicht belegt sind.
- Wählen Sie ein Higress-Image-Repository in der Nähe des Bereichs, in dem es eingesetzt werden soll. Im Produktivumfeld sollte eine bestimmte Version angegeben werden, anstatt ständig „latest“ zu verwenden.
- Montieren Sie den persistenten Verzeichnis und starten Sie den All-in-One-Container – die Konsole-Ports werden nur in vertrauenswürdigen Netzwerken freigegeben.
- Sofort nach dem ersten Zugriff auf die Konsole sollten Authentifizierung für Administratoren, Zugriffsrichtlinien sowie Backup-Strategien konfiguriert werden.
- Fügen Sie einen Test-Modell-Anbieter sowie eine API-Schlüssel mit minimalem Berechtigungsgrad hinzu; importieren Sie nicht zuerst alle Produktivschlüssel.
- Erstellen Sie eine AI-Route und konfigurieren Sie Modellzuordnungen, Verbraucherauthentifizierung, Token-Limitierung sowie Fehlertoleranz.
- Testen Sie normale und strömende Antworten, Fehler, Zeitüberschreitungen sowie Fallbacks mit kleinen, unsensiblen Anfragen.
- Überprüfen Sie die Token-, Verzögerungs-, Fehler- und Verbraucherindikatoren, bevor Sie schrittweise Caching-, Sicherheits- und MCP-Plugins hinzufügen.
- Erst nach der Überprüfung der Persistenz und Wiederherstellung der Konfiguration sollte eine Migration zu Helm oder einer betriebenen Produktversion in Betracht gezogen werden.
Kubernetes-Deployment-Prozess
- Überprüfen Sie die Kompatibilitätsmatrix für Kubernetes, Helm, Gateway API und Higress sowie sichern Sie die vorhandenen Ingress-Ressourcen.
- Erstellen Sie für Higress einen eigenen Namespace, Service-Konten, Netzwerkpolicies sowie kontrollierte Image-Repositorys.
- Installieren oder aktualisieren Sie die erforderlichen CRDs und prüfen Sie die Warnung wegen einer Versionskonflikts beim Starten des Controllers.
- Installieren Sie eine feste Version mit Helm, konfigurieren Sie die Image-Repositorys nach Region und beschränken Sie die Sichtbarkeit der Steuerungsebene und der Konsole.
- Migrieren Sie zunächst eine Domain mit niedrigem Risiko und überprüfen Sie nacheinander das kompatible Verhalten der Nginx Ingress-Annotierungen.
- Konfigurieren Sie Gateway-Routing, Backend-Dienste, Zertifikate und Authentifizierungs-Plugins sowie führen Sie Rollback-Übungen durch.
- Für große Modelle und MCP-Datenverkehr Token-Quoten, Zeitüberschreitungen, Wiederholungsversuche, Circuit Breaker, Fallback-Mechanismen sowie Audits hinzufügen.
- Anbindung an Prometheus, Protokollierung und Alarme, zur Überwachung der Konfigurationsverbreitung, der Ressourcen im Datenbereich sowie der langfristigen Verbindungen.
- Nach Abschluss der Tests zur Kapazität, Zuverlässigkeit, Sicherheit und Aktualisierung wird die Nutzung auf den Produktionsverkehr ausgeweitet.
Prozess zur Konfiguration des AI-Gateways
- Listen Sie die zu integrierenden Modellanbieter, selbst erstellten Inferenzdienste, Agenten und MCP-Server auf und kennzeichnen Sie die Sensitivitätsstufe der Daten.
- Für jede Umgebung werden eigene Schlüssel, Verbraucheridentitäten und Routen erstellt, um eine Verwendung in Tests und in der Produktion zu vermeiden.
- Einheitliches Protokoll für externe Aufrufe, wobei die Kompatibilitätsprüfung sowie die Fallback-Verarbeitung für modellspezifische Parameter beibehalten werden.
- Einstellen Sie den QPS, die Konkurrenzfähigkeit, die Token-Limite, das tägliche Budget sowie die zulässigen Modelle für jeden Verbraucher.
- Konfigurieren Sie das bevorzugte Modell, das Ersatzmodell, die Gesundheitsschwellwerte, die Zeitüberschreitung sowie die maximale Anzahl an Wiederholungsversuchen.
- Aktivieren Sie die Caching-Funktion nur für Anfragen, die sicher wiederverwendet werden können, und berücksichtigen Sie Benutzer, Mieter sowie Berechtigungen als Teil der Caching-Schlüssel.
- Am Eingang werden Minimierung, Maskierung und Schutz vor Prompt-Angriffen aktiviert, am Ausgang wird eine Überprüfung auf Inhalt- und Datenlecks durchgeführt.
- Protokollierung von Modellen, Tokens, Verzögerungen, Fehlern, Fallback-Möglichkeiten, Cache-Erfolgen und MCP-Toolaufrufen.
- Über Fehlereinleitung wird das Verhalten bei Modellunverfügbarkeit, Redis-Unterbrechungen, Plugin-Fehlern und MCP-Dienst-Timeouts überprüft.
MCP-Online-Prüfung
- Importieren Sie nur die überprüften OpenAPI-Operationen und löschen Sie die nicht benötigten Schnittstellen für Löschung, Überweisung, Ausführung und Verwaltung.
- Definieren Sie für jedes Werkzeug einen klaren Namen, eine Beschreibung, typisierte Parameter, Pflichtfelder und eine Fehlerstruktur.
- Trennen Sie die Lesewerkzeuge von den Schreibwerkzeugen und fügen Sie für hochriskante Operationen eine manuelle Bestätigung hinzu.
- Durch Verwendung von Verbraucheridentitäten, minimalem Berechtigungsgrad und Tenant-Isolation wird verhindert, dass Modelle hochprivilegierte Anmeldeinformationen teilen.
- Überprüfung von Origin, Authentifizierung, Geschwindigkeitsbeschränkungen, Parameterinjektion, Timeout, Wiederholungsversuchen und Idempotenz.
- Das Protokollierungstool erfasst Entdeckungen, Parameter, Aufrufer, Ergebnisse, Fehler sowie die Nummern der nachgelagerten Geschäftsaudits.
- Testen Sie gleichzeitig die alten und neuen MCP-Clienten, um eine versteckte Inkompatibilität durch Protokoll-Upgrades zu vermeiden.
- Platzieren Sie das Higress Ops-Verwaltungstool in einem separaten Intranet und aktivieren Sie eine strenge Authentifizierung.
Community-Version und Alibaba Cloud-Version
Die Community-Version von Higress ist kostenlos und open source; die Nutzer tragen die Kosten für Server, Netzwerk, Speicher, Überwachung, Aktualisierungen sowie Wartung. Das Alibaba Cloud AI Gateway bietet auf Basis von Higress gehostete Serverless-Lösungen sowie dedizierte Instanzprodukte und fügt außerdem eine Cloud-Konsole, Flexibilität, Servicelevel-Absicherungen sowie kommerzielle Unterstützung hinzu.
| Version | Derzeitige Kosten für das Gateway | Kernkompetenzen oder Einschränkungen | Passende Szenarien |
|---|---|---|---|
| Higress Community-Version | Softwarelizenz kostenlos | Vollständige Kernfähigkeiten, Wasm-Plugins können angepasst werden; Infrastruktur- und Modellkosten sind selbst zu tragen, es gibt kein kommerzielles SLA. | Selbstentwicklung, Weiterentwicklung und Mehrcloud |
| Serverless Standard Edition | Während der Beta-Phase der neuen Version kostet das Gateway selbst 0 Euro. | Standardmäßig 50 QPS, die Plattform verwendet eine standardmäßige Verschlüsselungsmethode; es gibt keinen separaten Zugang über das öffentliche Internet. Es werden keine benutzerdefinierten Domainnamen, Zertifikate, TLS-Strategien oder Konfigurationen für das zweite Webprotokoll unterstützt. | Testen, PoC, Entwicklung und Geschäfte mit geringem Datenvolumen |
| Serverless Enterprise Edition | Während der Beta-Phase der neuen Version kostet das Gateway selbst 0 Euro. | Standardmäßig 500 QPS, eigener Eingangspunkt, benutzerdefinierter Domainname, Zertifikate, TLS-Strategien, zweite Generation des Webprotokolls sowie eine SLA von 99,95%. | Formelle Produktion und externe AI-Dienste |
| alte Version von Serverless | Abrechnung von CU nach Anfrage und öffentlicher Datenverkehrsmenge | Bestehende Instanzen werden weiterhin genutzt, die Leistung bleibt bei den ursprünglichen Spezifikationen; neue Kunden erhalten vorrangig die neuere Version. | Bestehende Kunden wechseln reibungslos über |
| Instanzbasierte Exklusiv-Miete nach Verbrauch | Stundenweise Instanzgebühren zuzüglich Datenverarbeitung und Internetdatentransfer | Einsatz von Ressourcen exklusiv, standardisierte Leistung sowie umfassende Steuerung – nach Nutzung wieder frei gegeben | Kurzfristige Anforderungen an hohe Leistung, Spitzenwerte oder Isolierung |
| Exklusiver Monatsvertrag für Instanztypen | Monatliche Vorauszahlung für die Instanzkosten sowie zusätzliche Gebühren für Datenverarbeitung und Internetnutzung | Langfristige Nutzung von Rabatten ist in der Regel teurer; Spezifikationen und Region beeinflussen den Preis. | Langfristige Kernproduktionsaktivitäten |
Kostenlose Beta-Grenzen
Die kostenlose Testversion von Serverless umfasst nur die Kosten für das Gateway selbst; der Datenverkehr ins öffentliche Netz wird weiterhin nach den Preisen für die Cloud-Datenübertragung abgerechnet. Für Modellservices, Protokolle, Überwachungsfunktionen sowie andere Cloud-Produkte werden gesonderte Gebühren erhoben. Nach Abschluss der Testphase könnte eine kommerzielle Abrechnung eingeführt werden. Die endgültigen Preise und Angebote müssen in der Konsole erneut überprüft werden.
Kostenstruktur der Exklusivversion
Die Einzelnutzer-Version besteht aus einer Gateway-Instanz, der Verarbeitung von Anfragen und Antworten sowie dem Datenverkehr im öffentlichen Netzwerk. Der genaue Preis hängt von den Spezifikationen, dem Standort, der Netzwerktyp und der Kaufdauer ab. Es gibt keinen festen Preis, der für alle Deployment-Szenarien gilt.
Open Source, GitHub und Lizenzen
Das Hauptlager von Higress wird derzeit von der higress-group betreut. Der ursprüngliche Eingang zum Alibaba-Lager führt nun auf die neue Organisation. Die Hauptcodebasis verwendet die Lizenz Apache-2.0. Das Hauptlager wird aktiv gewartet; Version v2.2.4 wurde am 13. August 2026 veröffentlicht.
| Projekt | Offener Status | Lizenz oder Anleitung | Wirkung |
|---|---|---|---|
| Higress-Hauptlager | Öffentlich | Apache-2.0 | Steuerungsseite, Datenfluss-Integration, CRD und Kern-Plugins |
| Wasm Go SDK | Öffentlich | Apache-2.0 | Entwicklung eines Higress-Plugins mit Go |
| OpenAPI-zu-MCP-Werkzeug | Öffentlich | Apache-2.0 | Erstellen einer MCP-Dienstkonfiguration aus OpenAPI-Operationen |
| Konsole | Öffentlicher Lagerplatz | Die genauen Genehmigungen müssen anhand der Lagerdokumente überprüft werden. | Grafische Verwaltung und Konfiguration |
| Standalone | Öffentlicher Lagerplatz | Die genauen Genehmigungen müssen anhand der Lagerdokumente überprüft werden. | Unabhängige Bereitstellung ohne Kubernetes |
| Projektdokumentation | Öffentlich | CC-BY-4.0 | Anleitung zur Verwendung, Architektur und Plugins |
| Aliyun AI-Gateway | Wirtschaftliche Hosting-Dienste | Gebunden durch Cloud-Dienstleistungsverträge | Serverless, dedizierte Instanzen und SLA |
Open Source bedeutet nicht Kostenlosigkeit.
Apache-2.0 erlaubt die Verwendung, Änderung und Verteilung des Hauptcodes, doch Unternehmen müssen weiterhin den Lizenzbedingungen sowie den Anforderungen in der NOTICE-Kennzeichnung nachkommen und die Kosten für Server, Aufrufe von Modellen, externe Erweiterungen, Überwachung, Sicherheit sowie Wartung tragen. Auch die kommerzielle Version von Alibaba Cloud kann aufgrund der Verwendung eines Open-Source-Kernels nicht als kostenlos oder mit der Möglichkeit zur eigenen Kopieerstellung des Services angesehen werden.
Sicherheit und Privatsphäre
Durch die eigene Implementierung von Higress können Anfragen, Antworten, Schlüssel sowie Auditedaten innerhalb des vom Unternehmen kontrollierten Netzwerks und der Speicherung verbleiben. Dennoch können Anfragen weitergeleitet werden an externe Modelle, Suchmaschinen, Vektordatenbanken oder Sicherheitsdienste. Die tatsächlichen Datengrenzen werden durch Routing-Regeln, Plugins sowie die upstream liegenden Anbieter bestimmt.
| Risikofaktoren | Mögliche Probleme | Empfehlungen |
|---|---|---|
| Modell-API-Schlüssel | Kosten durch Datenleck oder Offenlegung von Daten | Verwendung von Schlüsselverwaltung, Mindestrechten, Regelmäßiger Wechsel sowie Alarme bei Abweichungen |
| Hinweise und Antwortprotokolle | Enthält persönliche, geschäftliche oder kodierte Geheimnisse | Standardmäßige Maskierung, verkürzte Aufbewahrungsfrist und eingeschränkte Abfragemöglichkeiten |
| Präzision und semantische Caching | Rückgabe an mehrere Benutzer oder langfristige Speicherung sensibler Inhalte | Mieterisolation, Berechtigungsverwaltung, Verschlüsselung und Ablaufdatum |
| MCP-Tool | Modell induziert die Ausführung von risikoreichen Geschäftsoperationen | Whitelist für Tools, manuelle Überprüfung, Parametervalidierung und Auditing |
| Wasm-Plugin | Lieferketten, Schwachstellen, Ressourcenerschöpfung oder logische Manipulationen | Feste Zusammenfassung, Signaturverifizierung, Sandbox-Beschränkungen und schrittweises Veröffentlichen |
| Konsole | Der Administrator-Zugang wird aus dem öffentlichen Internet angegriffen | Internes Netzwerkzugriff, strenge Authentifizierung, mehrfache Authentifizierungsmechanismen sowie Weißliste für das Netzwerk |
| Externe Sicherheitseppler | Daten werden an Drittanbieter für Prüfdienste gesendet | Unterschreiben des Abkommens und Bestätigung der Regeln bezüglich des Gebiets, der Ausbildung und der Beibehaltung. |
| Beobachtungssysteme | Die Tags enthalten einen Token, eine Benutzer-ID oder Hinweistexte. | Einschränkung von Feldern mit hohem Basiswert und Bereinigung sensibler Tags |
| Cloud-Hosting-Version | Daten, Protokolle und Traffic werden durch die Cloud-Region sowie die Produktbedingungen beeinflusst. | Wählen Sie den Standort aus und überprüfen Sie Konformität, SLA sowie Unterdienste. |
Vorteile des Produkts
- Ein Eingangstyp verwaltet gleichzeitig LLM-APIs, Agenten, MCP sowie Kubernetes-Inferenzlasten.
- Basierend auf Istio und Envoy – geeignet für langanhaltende Verbindungen, SSE sowie AI-Datenverkehr mit hoher Bandbreite.
- Unterstützt mehr als 100 gängige Modelle und bietet ein einheitliches Protokoll, Lastverteilung sowie Fallback-Möglichkeiten.
- Token-Beschränkungen, Quoten, Caching und Überwachung sind direkt auf die Kosten und Stabilität von KI ausgerichtet.
- MCP-Proxy, Umwandlung bestehender APIs in MCP sowie Auditing verringern die Komplexität bei der Anbindung mehrerer Teams an Tools.
- Kompatibel mit der Ingress-API und der Gateway-API – kann mit bestehenden cloudbasierten Eingangssystemen verbunden werden.
- Wasm-Plugins können in verschiedenen Sprachen entwickelt werden, unabhängig aktualisiert und hot updated werden.
- Unterstützung für eigenständige Docker-Deployment, cloudnative Helm-Deployment sowie die von Alibaba Cloud gehostete Version.
- Das Hauptprojekt verwendet Apache-2.0 und wird von der CNCF Sandbox-Community unter offener Verwaltung betrieben.
Einsatzbeschränkungen und Hinweise
- Higress ist eine Infrastruktur, kein sofort einsetzbares Terminal-Chat- oder Wissensdatenbank-Produkt.
- Für die Produktimplementierung sind Erfahrungen in Gateway-Technologien, Kubernetes, Netzwerken, Sicherheit und Überwachung erforderlich.
- Die Community-Version verfügt über kein kommerzielles SLA; die Reaktionszeit auf Störungen, Updates sowie die Kapazität werden von dem eigenen Team übernommen.
- Eine einheitliche Schnittstelle kann die Unterschiede in den Funktionen, der Qualität, dem Kontext sowie den fehlerhaften Formatierungen der Modelle nicht beseitigen.
- Der Wechsel auf unterschiedliche Modelle kann die Antworten, die Konformitätsergebnisse und die Kosten verändern.
- Der semantische Cache kann alte Antworten zurückgeben, die für den aktuellen Benutzer oder Kontext nicht geeignet sind.
- Die Token-Statistiken hängen von der Reaktion des Anbieters sowie von der Art der Worttrennung ab und können nicht direkt mit Rechnungen gleichgesetzt werden.
- Das MCP-Tool verbindet das Modell mit der realen Geschäftswelt und weist darauf hin, dass Eingriffe zu tatsächlichen Betriebsrisiken werden können.
- Einige Erweiterungen sind von Redis, Vektordatenbanken, Suchfunktionen oder externen Sicherheitsdiensten abhängig, was die Kosten und das Ausfallrisiko erhöht.
- Kundenspezifische Wasm-Plugins können weiterhin Probleme in Bezug auf Geschäftslogik, Lieferketten und Ressourcenverbrauch aufweisen.
- Beim Upgrade auf v2.2.4 sollten Sie auf Veränderungen in der Semantik der Regeln zur Bandbreitenbegrenzung und andere Verhaltensänderungen achten.
- CNCF Sandbox befindet sich laut Angaben in der Anfangsphase der Projektverwaltung und entspricht somit noch nicht dem Grad der Reife „Graduated“.
- Die Preise und Funktionen der neuen Version von Serverless im Beta-Zustand könnten nach der Kommerzialisierung angepasst werden.
- Der kostenlose Cloud-Version umfasst nicht den Datenverkehr im öffentlichen Netz, Modelle, Protokolle, Überwachung sowie verbundene Cloud-Produkte.
Grundlegende Informationen
| Projekt | Inhalt |
|---|---|
| Name des Tools | Higress |
| Arten von Werkzeugen | KI-basierte API-Gateways, MCP-Gateways und cloudnative Eingangsgateways |
| Projektphase | CNCF Sandbox |
| Technische Grundlagen | Istio, Envoy, WebAssembly und Kubernetes API |
| Aktuelle stabile Version | v2.2.4, veröffentlicht am 13. August 2026 |
| Lizenz für das Hauptlager | Apache-2.0 |
| Dokumentlizenz | CC-BY-4.0 |
| Modellumfang | Mehr als 100 gängige Modelle |
| MCP-Fähigkeiten | Eigene Proxy-Server, Umwandlung bestehender APIs, Authentifizierung, Bandbreitenbegrenzung, Auditing sowie Tool-Routing |
| Einrichtungsmethode | Docker, Docker Compose, Helm, Kubernetes und Alibaba Cloud |
| Erweiterungsmöglichkeiten | Wasm-Plugins in Sprachen wie Go, Rust, JavaScript usw. schreiben |
| Preis für die Open-Source-Version | Die Software-Lizenz ist kostenlos, die Infrastruktur sowie die zugehörigen Dienstleistungen müssen selbst bereitgestellt werden. |
| Kommerzielle Version | Aliyun Serverless und die dedizierte Instanzversion |
| Ob Open Source | Ja |
| Wird ein öffentlicher Cloud-Service angeboten? | Ja |
Häufige Fragen
Ist Higress kostenlos?
Der Code für die Community-Version wird unter der Apache-2.0-Lizenz bereitgestellt, sodass er kostenlos verwendet werden kann. Allerdings sind Server, Netzwerk, Modelle, Speicher sowie Wartungsdienste nicht kostenlos. Während der Beta-Phase von Alibaba Cloud Serverless entstehen keine Kosten für das Gateway selbst; andere Cloud-Dienste sowie Datenverkehr können jedoch weiterhin Gebühren verursachen.
Ist Higress ein großes Modell?
Nein. Es befindet sich zwischen Anwendungen und Modellen, Agenten, MCP-Tools oder Inferenzdiensten und ist für die Anbindung sowie Verwaltung zuständig; es ersetzt nicht selbst die übergeordneten Modelle bei der Erstellung von Inhalten.
Welche Modelle werden unterstützt?
Auf der aktuellen Produktseite steht, dass mehr als 100 gängige Modelle unterstützt werden, und dass es möglich ist, sowohl die mit OpenAI kompatiblen Schnittstellen als auch die von verschiedenen inländischen und ausländischen Anbietern bereitgestellten Funktionen zu nutzen. Die genauen Anforderungen bezüglich Multimodalität, Aufruf von Tools sowie Parameterkompatibilität müssen durch Tests mit den Plugins der jeweiligen Anbieter überprüft werden.
Kann man auf Kubernetes verzichten?
Ja. Docker All-in-One, Docker Compose und Standalone eignen sich zum Betrieb ohne Kubernetes; für Produktionsumgebungen, Persistenz und hohe Verfügbarkeit muss man jedoch selbst Lösungen entwickeln.
Kann man eine gewöhnliche API in ein MCP-Tool umwandeln?
Ja, es ist möglich, eine entfernte MCP-Konfiguration über den MCP Bridge und Werkzeuge zur OpenAPI-Umwandlung zu erstellen. Nach der automatischen Erstellung müssen gefährliche Abläufe, Parameter, Authentifizierungsmechanismen sowie Anleitungen zu den Werkzeugen manuell überprüft werden.
Ist Higress dasselbe wie das Alibaba Cloud AI Gateway?
Es ist nicht genau dasselbe. Higress ist ein Projekt der Open-Source-Community, während das Alibaba Cloud AI Gateway auf seinen Fähigkeiten aufbaut, um Serverless-Lösungen, dedizierte Instanzen, Cloud-Integrationen, SLAs sowie kommerzielle Unterstützung anzubieten.
Kann die Standardversion von Serverless in der Produktion eingesetzt werden?
Es eignet sich besser für niedrigen Datenverkehr, Tests und die Entwicklung. Standardmäßig sind 50 QPS vorgesehen, es gibt keinen eigenen Eingang sowie keine Möglichkeit zur Anpassung des Domainnamens. Für den regulären Einsatz sollte in der Regel die Enterprise-Version oder eine dedizierte Instance-Version in Betracht gezogen werden.
Wird Higress die Kosten des Modells senken?
Caching, Quoten, Routing und Fallback können dazu beitragen, Verschwendung zu verringern oder geeignetere Modelle auszuwählen, doch sie garantieren nicht, dass die Gesamtkosten unbedingt sinken. Auch die Kosten für Gateways, Caching, Überwachung und Wartung müssen berücksichtigt werden.
Ist Higress Open Source?
Ja, der Hauptspeicher verwendet Apache-2.0. Die Lizenzen und Bedingungen für die zugehörigen Konsole, Standalone-Versionen, Plugins sowie kommerzielle Cloud-Dienste müssen separat überprüft werden.
Zusammenfassung
Higress eignet sich für Entwicklungs- und Plattformteams, die an einem zentralen Eingangspunkt mehrere Modelle, Agenten, MCP-Tools sowie cloudnative APIs verwalten müssen. Es bringt Token-Verwaltung, Fallback-Mechanismen, Caching, Inhaltssicherheit, strömungsbasierte Überwachung sowie MCP-Auditing auf die Gateway-Ebene und behält dabei die Leistungsfähigkeit von Envoy, die Standards der Gateway-API sowie die Erweiterungsmöglichkeiten durch Wasm bei.
Bei der Auswahl muss zwischen der Open-Source-Version der Apache-Community und der von Alibaba Cloud gehosteten Version unterschieden werden. Zudem sollten die Kosten für den Aufruf der Modelle, den Datenverkehr, die Protokolldaten, Redis, Plugins sowie die Wartung in die Gesamtkosten einbezogen werden. Beim eigentlichen Go-Live sollte außerdem besonders auf die Isolation des Caches, den Schutz der Schlüssel, die Mindestberechtigungen nach dem Prinzip MCP, die Kompatibilität bei Versionserhöhungen sowie Mechanismen zur Fehlerbehebung geachtet werden – anstatt sich nur auf die Funktion des Modell-Proxy zu konzentrieren.
Guigong-Netzwerk-Sicherheitsnummer: 45132202000164