Eliminierung technischer Schulden mit PHPStan, Rector PHP und PHPUnit. Über 20 Jahre Praxiserfahrung in skalierbaren Backends.
- Aktualisiert:
- Autor:
- Roland Golla
Was ist das Envoy AI Gateway?
Inhalt
Envoy AI Gateway mit NCA: Schnelle Hilfe vom Experten
KI Traffic sauber steuern statt Wildwuchs verwalten
Finde das passende Angebot für dein Projekt
Anfrage-Konfiguration
Starten Sie Ihre Anfrage
Gesetzliche Konformität & Inklusion. Optimierung von Performance und Conversion durch radikal nutzerzentriertes, universelles Design.
Skalierbare KI-Systeme mit echtem Code Ownership. CI/CD, Backup-Strategien und Infrastruktur, die mit deinem Team wächst.
Anfrage-Konfiguration
Worauf liegt dein Fokus?
Wähle die Expertise, die dein Projekt jetzt am dringendsten benötigt.
Was Version 1.0 gebracht hat
- 16 Anbieter hinter einer einheitlichen API mit Übersetzung zwischen den Formaten
- MCP Gateway für Werkzeuge und Agenten, nicht nur für Modelle
- Multimodale und Audio Endpunkte
- Observability auf Enterprise Niveau
- Mandantenfähiges Routing mit Kontingenten pro Team
Erst lokal ausprobieren, dann ins Cluster
# lokal starten, ohne Cluster
aigw run config.yaml
# Anfrage gegen den lokalen Endpunkt
curl -s http://localhost:1975/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{"model":"qwen-local","messages":[{"role":"user","content":"Hallo"}]}'
Setup im Cluster: die Befehle der Reihe nach
# 1. Envoy Gateway mit den Werten fuer das AI Gateway
helm upgrade -i eg oci://docker.io/envoyproxy/gateway-helm \
--namespace envoy-gateway-system \
--create-namespace \
-f https://raw.githubusercontent.com/envoyproxy/ai-gateway/main/manifests/envoy-gateway-values.yaml
kubectl wait --timeout=2m -n envoy-gateway-system \
deployment/envoy-gateway --for=condition=Available
# 2. CRD Chart zuerst, dann das AI Gateway
helm upgrade -i aieg-crd oci://docker.io/envoyproxy/ai-gateway-crds-helm \
--namespace envoy-ai-gateway-system --create-namespace
helm upgrade -i aieg oci://docker.io/envoyproxy/ai-gateway-helm \
--namespace envoy-ai-gateway-system --create-namespace
kubectl wait --timeout=2m -n envoy-ai-gateway-system \
deployment/ai-gateway-controller --for=condition=Available
# 3. Beispiel ausrollen und testen
kubectl apply -f https://raw.githubusercontent.com/envoyproxy/ai-gateway/main/examples/basic/basic.yaml
kubectl port-forward -n envoy-gateway-system svc/envoy-ai-gateway-basic 8080:80
curl -s http://localhost:8080/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{"model":"qwen-local","messages":[{"role":"user","content":"Hallo"}]}'
Befehle und Parameter für den Alltag
# Routen und Backends anzeigen
kubectl get aigatewayroute -A
kubectl get aiservicebackend -A
kubectl get backendsecuritypolicy -A
kubectl get mcproute -A
# Warum greift eine Route nicht
kubectl describe aigatewayroute mein-route -n default
# Logs des Controllers
kubectl logs -n envoy-ai-gateway-system \
deployment/ai-gateway-controller -f
# ohne Konfiguration starten, Variablen genuegen
export OPENAI_API_KEY=sk-XXXX
aigw run
# Beispielkonfiguration fuer Ollama holen und anpassen
curl -o ollama.yaml \
https://raw.githubusercontent.com/envoyproxy/ai-gateway/main/examples/aigw/ollama.yaml
aigw run ollama.yaml
# ohne lokale Installation, per Docker
docker run --rm -p 1975:1975 \
-e OPENAI_API_KEY=$OPENAI_API_KEY \
envoyproxy/ai-gateway-cli run
Die zentralen Ressourcen im Überblick
| Ressource | Aufgabe | Typischer Einsatz |
|---|---|---|
| AIGatewayRoute | Regeln, welche Anfrage an welches Backend geht | Modellauswahl und Fallback definieren |
| AIServiceBackend | Beschreibt einen Anbieter oder ein eigenes Modell | Ollama, vLLM oder eine externe API einbinden |
| BackendSecurityPolicy | Verwaltet Zugangsdaten zum Backend | Schlüssel zentral halten statt in Anwendungen |
| MCPRoute | Leitet Werkzeugaufrufe an MCP Server | Agenten kontrolliert Zugriff auf Tools geben |
Das MCP Gateway ist der eigentliche Punkt
Wann es passt und wann nicht
Coding aus der Cloud, Datenverarbeitung im eigenen Netzwerk
1.0 is a commitment, not just another feature release.
Das Envoy AI Gateway in der NCA Praxis
NCA Vibe Coding Consulting
Roland Golla ist Entwickler aus Leidenschaft – seit über 20 Jahren. Er hat hunderte Projekte begleitet, von Legacy-Refactoring bis KI-Integration. Bei Vibe Coding verbindet er das Beste aus beiden Welten: Die Geschwindigkeit von KI-generiertem Code mit der Qualität professioneller Softwareentwicklung. Kein Bullshit, keine Agentur-Floskeln – direkte Hilfe von jemandem, der selbst täglich im Code steckt.
Häufige Fragen zum Envoy AI Gateway
Was ist das Envoy AI Gateway 2026?
Ein offenes Gateway für KI Verkehr, das als Schicht auf dem CNCF Projekt Envoy Gateway aufsetzt. Es stellt eine einheitliche OpenAI kompatible API über 16 Anbieter bereit, übersetzt zwischen den Formaten, verwaltet Zugangsdaten zentral und leitet über MCPRoute auch Werkzeugaufrufe von Agenten. Version 1.0 erschien am 23. Juni 2026.
Ist das Envoy AI Gateway 2026 produktionsreif?
Ja. Mit Version 1.0 gilt die Control Plane API als stabil, innerhalb der 1.x Reihe sind keine brechenden Änderungen ohne dokumentierten Migrationspfad vorgesehen. Getestet wurde vor dem Release bei Tetrate, Bloomberg und Nutanix unter echten Lasten. Version 1.1 folgte im August 2026 ohne nötige Migration.
Brauche ich 2026 Kubernetes für das Envoy AI Gateway?
Für den vollen Funktionsumfang ja, für erste Versuche nein. Mit der Binärdatei aigw lässt sich das Gateway lokal gegen eine Konfigurationsdatei starten. Formatübersetzung, Fallback und MCP könnt ihr so ohne Cluster ausprobieren. Kontingente pro Mandant und Routing über CRDs setzen dagegen ein Cluster voraus.
Was kam 2026 mit Version 1.1 dazu?
Version 1.1 erschien am 21. August 2026. Neu sind Token Zählung über Anbieter hinweg, Zugangsdaten pro Anfrage, Stream Idle Timeout mit Failover, Routing über MCP Hostnamen, Backend Auswahl über CEL Ausdrücke und optionales OpenTelemetry Tracing für generative KI. Ein Wechsel von 1.0 erfordert keine Änderung an den Ressourcen.
Envoy AI Gateway oder LiteLLM: was passt 2026 besser?
Das hängt am Betrieb, nicht an Funktionen. Läuft bereits ein Cluster mit Envoy, ist das AI Gateway eine Erweiterung des vorhandenen Proxys. Fehlt diese Basis, ist LiteLLM in einer Stunde eingerichtet und liefert Budgets und Kostentransparenz sofort. Ein Gateway ist kein guter Grund, Kubernetes einzuführen.
Welche Anbieter unterstützt das Gateway?
Mit Version 1.0 sind es 16 Anbieter mit Übersetzung zwischen den Formaten, darunter OpenAI, Anthropic, AWS Bedrock, Google Vertex und Azure OpenAI. Eigene Modelle über vLLM oder Ollama lassen sich als AIServiceBackend einbinden und stehen damit hinter demselben Endpunkt wie externe Dienste.
Was ist MCPRoute und wofür brauche ich das?
MCPRoute leitet Werkzeugaufrufe an MCP Server, so wie AIGatewayRoute Modellaufrufe leitet. Damit laufen Agentenzugriffe auf Datenbanken, Dateien oder interne Systeme durch dieselbe Kontrolle wie Modellanfragen. Wer nur den Modellzugang absichert, lässt bei Agenten die riskantere Hälfte offen.
Wie werden Zugangsdaten verwaltet?
Über BackendSecurityPolicy. Die Schlüssel liegen damit zentral am Gateway statt verstreut in Anwendungen und Umgebungsvariablen. Seit Version 1.1 lassen sich zusätzlich Zugangsdaten pro Anfrage übergeben, was bei mandantenfähigen Setups hilft, in denen jeder Kunde eigene Anbieterkonten mitbringt.
Wer steht hinter dem Projekt?
Das Projekt lebt in der Envoy Community. Der Anstoß kam von Bloomberg, das Routing von KI Verkehr mit derselben Verlässlichkeit lösen wollte wie normalen Verkehr. Maintainer sitzen bei Tetrate, Bloomberg und Nutanix. Die Basis Envoy Gateway ist ein Projekt der Cloud Native Computing Foundation.
Kostet das Gateway Latenz?
Wenig, weil es auf Envoy aufsetzt und keine zusätzliche Anwendungsschicht in einer langsameren Sprache einzieht. Gegenüber der Antwortzeit eines Modells fällt der Aufschlag kaum ins Gewicht. Relevant wird er erst bei sehr hohem Durchsatz oder bei Streaming mit engen Zeitbudgets.
Lässt sich das Gateway mit einem Router kombinieren?
Ja, und genau dafür ist es gebaut. Der vLLM Semantic Router läuft als Envoy Erweiterung über ext_proc und passt damit in dieselbe Architektur. Das Gateway regelt den Zugang, der Router entscheidet, welches Modell die einzelne Anfrage bekommt.
Wie begleitet Never Code Alone die Einführung?
Wir klären zuerst, ob die Plattform überhaupt zum Team passt, und schlagen sonst etwas Einfacheres vor. Danach bauen wir Routen zu lokalen und externen Modellen, hängen Observability daran und übergeben das Ganze dokumentiert. Wir starten mit einem kostenlosen Kennenlernen, schätzen den Aufwand und rechnen minutengenau ab.
Microsofts Open-Source-Framework für Multi-Agent-Systeme – autonome KI-Agenten, die miteinander kommunizieren und komplexe Aufgaben lösen.
Open-Source KI-Assistent mit 60.000+ GitHub Stars, der über WhatsApp, Telegram und andere Messaging-Apps gesteuert wird.