Eliminierung technischer Schulden mit PHPStan, Rector PHP und PHPUnit. Über 20 Jahre Praxiserfahrung in skalierbaren Backends.
- Aktualisiert:
- Autor:
- Roland Golla
Was ist LLM Routing?
Inhalt
LLM Routing mit NCA: Schnelle Hilfe vom Experten
Günstige Modelle nutzen, ohne Qualität zu verlieren
Finde das passende Angebot für dein Projekt
Anfrage-Konfiguration
Starten Sie Ihre Anfrage
Gesetzliche Konformität & Inklusion. Optimierung von Performance und Conversion durch radikal nutzerzentriertes, universelles Design.
Skalierbare KI-Systeme mit echtem Code Ownership. CI/CD, Backup-Strategien und Infrastruktur, die mit deinem Team wächst.
Anfrage-Konfiguration
Worauf liegt dein Fokus?
Wähle die Expertise, die dein Projekt jetzt am dringendsten benötigt.
Warum Routing der größte Kostenhebel ist
RouteLLM und Semantic Router im Vergleich
| Projekt | Ansatz | Reifegrad |
|---|---|---|
| RouteLLM | Klassifikatoren auf Präferenzdaten aus der Chatbot Arena, starkes gegen schwaches Modell | Forschungsframework mit OpenAI kompatiblem Server |
| vLLM Semantic Router | Signalgetriebenes Routing über einen Pool aus vielen Modellen, Caching und Klassifikatoren | Aktiv entwickelt, Version 0.3 seit Juni 2026 |
| Betrieb | RouteLLM als Bibliothek oder Server, Semantic Router als Envoy Erweiterung über ext_proc | Semantic Router passt in Kubernetes Setups |
| Einsatz bei NCA | Wir ordnen beide ein und messen gegen echten Verkehr, statt Benchmarks zu übernehmen | Editorial, kein Standard in unserem Stack |
RouteLLM: die Forschungsseite
RouteLLM einrichten: Befehle und Parameter
pip install "routellm[serve,eval]"
# OpenAI kompatibler Server, schwaches Modell lokal ueber Ollama
python -m routellm.openai_server \
--routers mf \
--strong-model gpt-4-1106-preview \
--weak-model ollama_chat/llama3 \
--config config.example.yaml
from routellm.controller import Controller
client = Controller(
routers=["mf"],
strong_model="gpt-4-1106-preview",
weak_model="ollama_chat/llama3",
)
response = client.chat.completions.create(
# mf Router mit Kostenschwelle 0.11593
model="router-mf-0.11593",
messages=[{"role": "user", "content": "Hallo"}],
)
# Schwelle so setzen, dass 20 Prozent ans starke Modell gehen
python -m routellm.calibrate_threshold \
--routers mf \
--strong-model-pct 0.2 \
--config config.example.yaml
vLLM Semantic Router: die Produktionsseite
Semantic Router einrichten: Befehle und Parameter
pip install vllm-sr
# Konfiguration pruefen, bevor irgendwas startet
vllm-sr validate config.yaml
# Router starten
vllm-sr serve --config config.yaml
# welche Modelle kennt die aktive Konfiguration
vllm-sr model list
curl -s http://localhost:8899/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{"model":"vllm-sr/auto","messages":[{"role":"user","content":"Hallo"}]}'
categories:
- name: code_generation
system_prompt: "Du bist ein erfahrener Entwickler."
use_reasoning: true
reasoning_effort: "medium"
model_scores:
- model: qwen3
score: 0.9
- name: general
use_reasoning: false
model_scores:
- model: qwen3
score: 0.5
Coding aus der Cloud, Datenverarbeitung im eigenen Netzwerk
Wann Routing lohnt und wann es schadet
Simply put, not all prompts require the same level of reasoning.
LLM Routing in der NCA Praxis
NCA Vibe Coding Consulting
Roland Golla ist Entwickler aus Leidenschaft – seit über 20 Jahren. Er hat hunderte Projekte begleitet, von Legacy-Refactoring bis KI-Integration. Bei Vibe Coding verbindet er das Beste aus beiden Welten: Die Geschwindigkeit von KI-generiertem Code mit der Qualität professioneller Softwareentwicklung. Kein Bullshit, keine Agentur-Floskeln – direkte Hilfe von jemandem, der selbst täglich im Code steckt.
Häufige Fragen zu LLM Routing
Was ist LLM Routing 2026?
Die Entscheidung, welches Modell eine einzelne Anfrage beantwortet. Ein Router schätzt die Schwierigkeit und leitet einfache Anfragen an ein günstiges oder lokales Modell, schwere an das starke. Ziel ist, Kosten zu senken, ohne die Qualität dort zu verlieren, wo sie gebraucht wird.
Was ist 2026 der Unterschied zwischen Router und Gateway?
Ein Gateway regelt den Zugang: Schlüssel, Budgets, Fallback, Protokollierung, einheitliche API. Ein Router regelt nur die Modellauswahl pro Anfrage. Die meisten Teams brauchen zuerst das Gateway, weil es Transparenz schafft. Der Router kommt danach, wenn klar ist, wohin die Kosten fließen.
Wie viel spart Routing 2026 wirklich?
Das hängt vollständig am Anfragemix. Die veröffentlichten Zahlen der Projekte stammen aus eigenen Benchmarks und lassen sich nicht übertragen. Bei Chatbots mit vielen einfachen Fragen ist der Effekt groß, bei Coding Agenten gering bis negativ. Messen auf dem eigenen Verkehr ist der einzige verlässliche Weg.
Ist RouteLLM 2026 produktionsreif?
Es ist ein Forschungsframework mit einem OpenAI kompatiblen Server, kein fertiges Produkt. Ausfallsicherung, Schlüsselverwaltung und Verbrauchszählung fehlen und müssen von einem Gateway kommen. Für Teams mit Engineering Kapazität ist es trotzdem ein solider Ausgangspunkt, weil Methodik und Trainingsdaten offenliegen.
Welchen Reifegrad hat der Semantic Router 2026?
Version 0.1 erschien im Januar 2026, Version 0.3 im Juni. Die Entwicklung ist schnell und wird von Red Hat getragen, eine stabile Schnittstellenzusage gibt es unterhalb von Version 1.0 aber nicht. Für Experimente und messbare Einsparungen reicht das, für kritische Ketten braucht es einen Upgrade Plan.
Kann ich Routing mit lokalen Modellen kombinieren?
Genau dafür lohnt es sich am meisten. Was ein lokales Modell beantwortet, kostet nichts extra und verlässt das eigene Netz nicht. Bei uns ist die günstige Stufe deshalb kein billiger Cloud Anbieter, sondern ein Modell über Ollama oder vLLM auf eigener Hardware.
Woher weiß der Router, welche Anfrage schwer ist?
Über Klassifikatoren. RouteLLM trainiert sie auf menschlichen Präferenzvergleichen aus der Chatbot Arena. Der Semantic Router arbeitet signalgetrieben mit Embeddings und weiteren Klassifikatoren, etwa für Sicherheit oder Faktenprüfung. In beiden Fällen ist es eine Schätzung, keine Garantie.
Was passiert, wenn der Router falsch entscheidet?
Dann bekommt eine schwere Anfrage ein zu kleines Modell und die Antwort wird schlechter, ohne dass jemand es merkt. Genau das ist das Hauptrisiko. Deshalb gehört zu jedem Routing eine Qualitätsmessung und ein Weg, einzelne Fälle wieder an das starke Modell zu schicken.
Brauche ich Kubernetes für Routing?
Nicht zwingend. RouteLLM läuft als Bibliothek oder als eigener Server. Der vLLM Semantic Router entfaltet seine Stärken dagegen als Envoy Erweiterung und passt damit in Cluster Setups, gerne zusammen mit dem Envoy AI Gateway. Ohne Cluster ist der Aufwand höher als der Nutzen.
Lohnt sich Routing für Coding Agenten?
Meistens nicht. Ein Agent hält Kontext über viele Schritte, und ein Modellwechsel mitten in der Aufgabe bricht diesen Faden. Die vermeintliche Ersparnis kippt schnell, wenn Ergebnisse nachgearbeitet werden müssen. Bei Massenauswertungen und Klassifikation ist das Bild umgekehrt.
Setzt Never Code Alone Router selbst ein?
Wir ordnen beide Projekte ein und prüfen sie gegen echten Verkehr, führen sie aber nicht als festen Bestandteil unseres Stacks. Unser Standard ist ein Gateway vor lokalen und externen Modellen. Routing kommt dazu, wenn die Zahlen zeigen, dass es sich rechnet.
Wie geht Never Code Alone bei der Einführung vor?
Zuerst Transparenz über ein Gateway, dann ein Vergleich derselben Anfragen gegen ein lokales Modell, danach Routen festlegen und Qualität weiter messen. Wir starten mit einem kostenlosen Kennenlernen, schätzen den Aufwand und rechnen minutengenau ab. Feste Pakete gibt es nicht.
Microsofts Open-Source-Framework für Multi-Agent-Systeme – autonome KI-Agenten, die miteinander kommunizieren und komplexe Aufgaben lösen.
Open-Source KI-Assistent mit 60.000+ GitHub Stars, der über WhatsApp, Telegram und andere Messaging-Apps gesteuert wird.