NCA Social Media
Aktualisiert:
Autor:
Roland Golla
Grüne Blaupause mit Code und HY3 Stempel, Schraubenschlüssel und Rakete

Was ist Hy3?

Hy3 ist ein offenes Coding Modell von Tencent. Es arbeitet als Mixture of Experts mit 295 Milliarden Parametern, von denen pro Token nur 21 Milliarden aktiv sind, und verarbeitet bis zu 256.000 Token Kontext.
Tencent hat Hy3 am 6. Juli 2026 unter Apache 2.0 veröffentlicht, nach einer Preview Ende April. Die Gewichte liegen auf Hugging Face und ModelScope, dazu gibt es eine FP8 Variante für kleineren Speicherbedarf. Das Modell gehört zur Hy Familie, die früher unter dem Namen Hunyuan lief.
Gebaut ist Hy3 für agentische Arbeit. Der Schwerpunkt beim Training lag auf verlässlichen Werkzeugaufrufen, stabilen Ausgabeformaten und langen Aufgabenketten. Es ist damit weniger ein Chatmodell als ein Motor für Agenten, die über viele Schritte hinweg Code lesen, ändern und prüfen. Nutzbar ist es unter anderem in OpenCode, Kilo Code, Cline und OpenClaw.

Hy3 mit NCA: Schnelle Hilfe vom Experten

Never Code Alone arbeitet täglich mit offenen Coding Modellen. Wir testen neue Releases gegen echte Symfony, PHP und Astro Projekte, messen was in Agenten Loops stabil bleibt und was nach zwanzig Tool Calls auseinanderfällt. Bei einem Modell wie Hy3 zählt nicht der Benchmark, sondern ob der Agent nach dem dritten Fehlversuch noch sauber weiterarbeitet. Genau das prüfen wir, bevor ein Modell bei uns in einen Workflow kommt.
Wir helfen Teams beim Vibe Coding Consulting und beim Onboarding von KI Agenten ins Team. Wir bauen Agentic AI Coding Guardrails für bestehende Projekte, beraten zu Datenschutz und DSGVO im Vibe Coding und zeigen in der Self Hosted KI Beratung, welcher Teil der Verarbeitung wirklich ins eigene Netz gehört. Wer bereits KI Code in Produktion hat, bekommt bei uns ein Codebase Audit für KI generierten Code.

Hy3 im eigenen Stack einordnen

Finde das passende Angebot für dein Projekt

Anfrage-Konfiguration

Starten Sie Ihre Anfrage

Projektart
Infos
Nachricht

Eliminierung technischer Schulden mit PHPStan, Rector PHP und PHPUnit. Über 20 Jahre Praxiserfahrung in skalierbaren Backends.

CORE EXPERTISE

Gesetzliche Konformität & Inklusion. Optimierung von Performance und Conversion durch radikal nutzerzentriertes, universelles Design.

BFSG COMPLIANT

Skalierbare KI-Systeme mit echtem Code Ownership. CI/CD, Backup-Strategien und Infrastruktur, die mit deinem Team wächst.

ENTERPRISE READY

Wofür Hy3 gut geeignet ist

Tencent hat beim Post Training an drei Stellen gearbeitet, die für Agenten wichtiger sind als ein Punkt mehr im Benchmark. Daraus ergibt sich ziemlich klar, wofür das Modell taugt.
Agenten mit vielen Werkzeugaufrufen. Fehlerhafte Tool Calls, die einen Agenten in Endlosschleifen schicken, wurden gezielt reduziert. Auf SWE-Bench Verified bleibt die Streuung über verschiedene Agenten Scaffolds wie CodeBuddy, Cline und KiloCode laut Tencent innerhalb von vier Prozent. Das Modell verhält sich also nicht komplett anders, nur weil der Harness wechselt. Welche Modelle bei MCP und Tool Handling sonst noch überzeugen, haben wir separat verglichen.
Frontend, CI/CD und Datenthemen. In einem Blindtest mit 270 Fachleuten lag Hy3 bei realen Arbeitsabläufen vorn, am deutlichsten in genau diesen drei Bereichen. Das passt zu unserer Erfahrung mit Modellen dieser Klasse: bei klar umrissenen Aufgaben sehr verlässlich, unruhig sobald der Kontext ausufert.
Lange Kontexte und Dokumentenarbeit. 256.000 Token reichen für ein mittleres Repository oder einen umfangreichen Vertrag am Stück. Bei Dokumentenaufgaben braucht Hy3 laut Tencent rund 47 Prozent weniger Token als GLM 5.2. Weniger Token heißt kürzere Wartezeit und günstigere Durchläufe.
Weniger erfundene Fakten. Das Leitprinzip im Training lautet sinngemäß: antworten, wenn die Grundlage da ist, Unsicherheit benennen, wenn sie fehlt. In internen Auswertungen fiel die Halluzinationsrate von 12,5 auf 5,4 Prozent. Das sind Herstellerzahlen, keine unabhängige Messung, aber die Richtung deckt sich mit den Rückmeldungen aus der Community.
Wofür Hy3 nicht taugt: als Ersatz für Qualitätssicherung. Ohne statische Analyse, Unit Tests und Guardrails im Sinne von Vise Coding produziert auch ein starkes Modell nur schneller Code, den niemand prüft. Und für sehr große Codebasen am Stück sind Modelle mit größerem Fenster die bessere Wahl.

Hy3 in Agenten und Editoren einbinden

Hy3 ist über die üblichen Wege erreichbar: über Tencent Cloud, über allgemeine Modell Gateways und über die offenen Gewichte bei einem Hoster deiner Wahl. In den meisten Coding Agents taucht es als reguläres Modell in der Auswahlliste auf.
In OpenCode reicht der Modellwechsel im Terminal:
Code:
          

opencode
/models
# Hy3 aus der Liste auswählen

Alternativ trägst du das Modell direkt in die Konfiguration ein. Die Anbindung läuft über einen OpenAI kompatiblen Endpoint, das Schema sieht überall ähnlich aus:
Code:
          

{
  "providers": {
    "beispiel": {
      "apiKey": "DEIN_KEY",
      "api": "openai-completions",
      "baseUrl": "https://dein-anbieter/v1",
      "models": [
        {
          "id": "hy3",
          "name": "Hy3",
          "reasoning": true,
          "contextWindow": 256000,
          "maxTokens": 64000
        }
      ]
    }
  }
}

Achte auf das tatsächliche Kontextfenster. Tencent nennt 256.000 Token, einzelne Anbieter setzen den Wert niedriger an. Wer ein großes Repository in einem Rutsch einliest, sollte den Wert prüfen, den der Client meldet, und nicht die Zahl aus dem Datenblatt annehmen. Die maximale Ausgabe liegt bei 64.000 Token.
Über LiteLLM als Proxy lassen sich mehrere Anbieter hinter einer Adresse bündeln und mit Budget Limits absichern. Das lohnt sich, sobald mehr als eine Person im Team mit demselben Modell arbeitet.

Datenschutz und Hosting bei Hy3

Die Lizenz ist das eine, der Weg zum Modell das andere. Wer Hy3 über einen Anbieter nutzt, muss zwei Fragen klären: Wo stehen die Server, und was passiert mit den Prompts. Beides steht in den Nutzungsbedingungen und unterscheidet sich je nach Zugangsweg deutlich.
Gerade bei kostenlosen Zugängen lohnt der Blick ins Kleingedruckte. Viele Gateways erlauben sich in Testphasen ausdrücklich, gesammelte Prompts zur Verbesserung des Modells zu nutzen. Das ist kein Skandal, sondern das Geschäftsmodell hinter Gratisangeboten. Man bezahlt mit dem eigenen Code.
Unsere Regel dazu gilt für jedes Cloud Coding Modell: Coding aus der Cloud, Datenverarbeitung im eigenen Netz. Der Agent arbeitet gegen eine lokale Entwicklungsumgebung mit Fake Daten. Keine Produktionsdatenbank, keine Kundendaten, keine Zugangsdaten im Kontext. Was das konkret bedeutet, steht in unserem Beitrag zu lokaler KI für Compliance.
Wer mehr Kontrolle braucht, hostet die offenen Gewichte in Europa. Apache 2.0 erlaubt das ohne Einschränkung nach Einsatzgebiet oder Region. TensorX als souveräner EU Inference Partner oder unser Infrastrukturpartner Conversis sind dafür der passende Weg. Die Auswahllogik dahinter haben wir in welches KI Modell ohne US Anbieter aufgeschrieben.

Die Architektur hinter Hy3

Hy3 ist ein Sparse Mixture of Experts Modell. Von 295 Milliarden Parametern insgesamt werden pro Token nur 21 Milliarden aktiviert. Ein Router wählt aus 192 Experten die besten acht aus, dazu kommt ein Shared Expert, der immer mitläuft. Das Modell hat 80 Transformer Layer und nutzt Grouped Query Attention mit 64 Heads über 8 KV Heads.
Dazu kommt ein separater MTP Layer mit 3,8 Milliarden Parametern. MTP steht für Multi Token Prediction und dient dem spekulativen Decoding: Das Modell rät mehrere Token voraus und verifiziert sie in einem Rutsch. In der Praxis heißt das kürzere Wartezeit im Agenten Loop.
Die entscheidende Zahl ist nicht 295 Milliarden, sondern 21 Milliarden. Die aktiven Parameter bestimmen Latenz und Kosten pro Token, die Gesamtgröße das Wissen. Deshalb liegt Hy3 in der Qualität nah an deutlich größeren Modellen, ohne deren Rechenaufwand mitzuschleppen. Die größere Einordnung dazu steht in unserem Beitrag zu chinesischen KI Modellen für AI Coding.
Den Denkaufwand steuerst du selbst. Ein direkter Modus antwortet ohne Zwischenschritte, zwei weitere Stufen schalten Chain of Thought dazu. Für Mathe, Refactorings und mehrstufige Aufgaben empfiehlt Tencent die höchste Stufe, für kurze Antworten die niedrigste. Wer das ignoriert, zahlt entweder mit Wartezeit oder mit Qualität.

Einsatzgebiete von Hy3 im Überblick

Einsatzgebiet Eignung Warum
Agenten mit vielen Tool Calls Sehr gut Stabile Werkzeugaufrufe, geringe Streuung über verschiedene Harnesses
Frontend und UI Arbeit Sehr gut Bester Bereich im Blindtest mit 270 Fachleuten
CI/CD und Automatisierung Gut Lange Aufgabenketten bleiben über viele Schritte stabil
Lange Dokumente und Repositories Gut 256K Kontext bei sparsamem Tokenverbrauch
Produktionscode ohne Quality Gates Ungeeignet Gilt für jedes Modell, nicht nur für Hy3

Hy3 selbst hosten: was realistisch geht

Die Gewichte sind offen, das heißt aber nicht, dass das Modell auf den Rechner unter dem Schreibtisch passt. Die volle Fassung liegt bei rund 598 GB, die FP8 Variante bei etwa 300 GB. Die offizielle Empfehlung für vLLM lautet acht GPUs der H200 oder MI300X Klasse.
Code:
          

vllm serve tencent/Hy3 \
  --tensor-parallel-size 8 \
  --speculative-config.method mtp \
  --tool-call-parser hy_v3 \
  --reasoning-parser hy_v3 \
  --enable-auto-tool-choice \
  --served-model-name hy3

Für ein normales Entwicklungsteam ist das keine Option. Wir sagen das bewusst deutlich, weil im Netz viel von lokalen Coding Modellen die Rede ist und dabei zwei völlig verschiedene Dinge vermischt werden.
Große Coding Modelle laufen aus der Cloud. Entweder über einen souveränen EU Anbieter, der die offenen Gewichte hostet, oder über ein Gateway. Lokal laufen die kleinen Modelle. Qwen3 Coder und Llama über Ollama reichen für Autovervollständigung, Commit Messages und kurze Refactorings. Welche das im Detail sind, steht in unserer Übersicht der besten Coder Modelle für lokale Nutzung.
Die Gewichte selbst findest du auf Hugging Face unter tencent/Hy3 sowie als Hy3-FP8. Die Apache 2.0 Lizenz erlaubt kommerzielle Nutzung ohne Einschränkung nach Einsatzgebiet oder Region.

Hy3 im Vergleich zu GLM, Kimi und MiniMax

Hy3 spielt in derselben Liga wie die anderen offenen Modelle aus China, hat aber ein eigenes Profil. Es ist kleiner als die Konkurrenz und liegt qualitativ trotzdem nah dran. Das macht es besonders für Setups interessant, in denen viele Durchläufe nacheinander laufen.
GLM 5.2 und 5.3 haben das größere Kontextfenster und sind bei uns über Z.ai im Einsatz. Kimi K3 ist deutlich größer und stärker bei sehr langen Ketten. MiniMax M3 punktet ebenfalls beim Kontext. DeepSeek und MiMo Code von Xiaomi runden das Feld nach unten ab.
Die Faustregel: Hy3 passt, wenn viele überschaubare Agenten Durchläufe anfallen und Tool Calls zuverlässig sitzen müssen. Es passt weniger, wenn ein einziges riesiges Repository am Stück verstanden werden soll. Für den Blick aufs gesamte Feld hilft unsere Übersicht der Vibe Coding Modelle und der Kostenvergleich der KI Anbieter.
Wichtig bleibt: Ein besseres Modell ersetzt keine Qualitätssicherung. Ohne statische Analyse, Unit Tests und Guardrails im Sinne von Vise Coding produziert auch Hy3 nur schneller Code, den niemand prüft.

New Apache 2.0 licensed model from Tencent in China

Simon Willison, Entwickler und Autor über LLMs – Simon Willison's Weblog

NCA Erfahrung mit offenen Coding Modellen

Wir wechseln Modelle regelmäßig. Was heute vorne liegt, ist im nächsten Quartal Mittelfeld. Deshalb bauen wir Projekte so, dass der Modellwechsel eine Konfigurationszeile ist und keine Migration. OpenCode macht das leicht, weil es keinen Anbieter fest verdrahtet.
Der wichtigere Teil liegt davor. Bevor ein Agent überhaupt Code anfassen darf, stehen bei uns die Qualitätsgates: statische Analyse mit PHPStan, Unit Tests mit PHPUnit, funktionale Tests und End to End Tests mit Cypress. Erst danach wird aufgeräumt. Das gilt für jedes Projekt, das aus dem Prototyp in die Produktion soll.
Bei bestehenden Altsystemen läuft die Arbeit bewusst manuell mit KI Unterstützung. Das Modell erklärt fremden Code, schreibt Testfälle und übernimmt Wiederholungsarbeit. Deterministische Werkzeuge wie Rector erledigen den mechanischen Teil im Dry Run. Über den Umbau entscheiden Menschen. Wie wir dabei vorgehen, steht im Codebase Audit und im Vibe Coding Security Audit.
Wer gerade erst anfängt, findet in den Top 10 Vibe Coding Tools 2026 einen Einstieg und im 1:1 Mentoring für Vibe Coder den direkten Weg. Für Teams passt eher der Blick auf KI Agenten im Team.
CYPRESS.IO Ambassador und IT Consultant für QA Engenieering und Qualität in PHP Projekten.

NCA Vibe Coding Consulting

Roland Golla ist Entwickler aus Leidenschaft – seit über 20 Jahren. Er hat hunderte Projekte begleitet, von Legacy-Refactoring bis KI-Integration. Bei Vibe Coding verbindet er das Beste aus beiden Welten: Die Geschwindigkeit von KI-generiertem Code mit der Qualität professioneller Softwareentwicklung. Kein Bullshit, keine Agentur-Floskeln – direkte Hilfe von jemandem, der selbst täglich im Code steckt.

Häufige Fragen zu Hy3

Die wichtigsten Fragen zu Hy3, zur kostenlosen Nutzung bei OpenCode Zen und zur Einordnung gegenüber anderen offenen Coding Modellen.

Wofür ist Hy3 2026 am besten geeignet?

Für agentische Arbeit mit vielen Werkzeugaufrufen. Tencent hat gezielt an der Stabilität von Tool Calls und Ausgabeformaten gearbeitet, damit Agenten nicht in Endlosschleifen laufen. In Blindtests mit 270 Fachleuten lag das Modell bei Frontend Entwicklung, CI/CD und Datenthemen vorn. Bei Dokumentenaufgaben braucht es laut Hersteller deutlich weniger Token als vergleichbare Modelle.

Wie groß ist das Kontextfenster von Hy3 2026?

Tencent nennt 256.000 Token, die maximale Ausgabe liegt bei 64.000 Token. Einzelne Anbieter setzen den Wert in ihrer Konfiguration niedriger an. Beide Angaben können korrekt sein, sie beschreiben unterschiedliche Ebenen: Modellfähigkeit gegen Anbieterkonfiguration. Prüfe im Zweifel den Wert, den dein Client tatsächlich meldet.

Welche Lizenz hat Hy3 2026?

Apache 2.0. Das ist eine sehr freizügige Lizenz ohne Einschränkung nach Einsatzgebiet oder Region. Kommerzielle Nutzung, Anpassung und eigenes Hosting sind erlaubt. Damit lässt sich das Modell auch bei einem europäischen Anbieter betreiben, wenn die Daten das Land nicht verlassen sollen.

Wie schlägt sich Hy3 2026 gegen GLM und Kimi?

Hy3 ist mit 295 Milliarden Parametern deutlich kleiner als Kimi K3 und liegt bei Coding Aufgaben trotzdem nah dran. GLM 5.2 und MiniMax M3 bieten das größere Kontextfenster. Für viele kurze Agenten Durchläufe passt Hy3 sehr gut, für eine sehr große Codebasis am Stück sind Modelle mit weiterem Fenster die bessere Wahl.

Eignet sich Hy3 2026 für Kundenprojekte?

Ja, wenn der Zugangsweg stimmt. Entscheidend ist nicht das Modell, sondern wo es läuft und was mit den Prompts passiert. Für Kundencode gilt bei uns: Coding aus der Cloud, Datenverarbeitung im eigenen Netz. Der Agent arbeitet gegen eine lokale Entwicklungsumgebung mit Fake Daten, und das Hosting läuft über einen Anbieter mit klarer Regelung zur Aufbewahrung.

Kann ich Hy3 auf meinem eigenen Rechner betreiben?

Praktisch nein. Die vollen Gewichte liegen bei rund 598 GB, die FP8 Variante bei etwa 300 GB. Die offizielle Empfehlung für vLLM lautet acht GPUs der H200 oder MI300X Klasse. Für lokale Nutzung eignen sich kleine Modelle wie Qwen3 Coder oder Llama über Ollama. Große Coding Modelle kommen aus der Cloud.

Wer steckt hinter Hy3?

Tencent, genauer das Hy Team. Die Modellfamilie hieß früher Hunyuan. Hy3 erschien am 6. Juli 2026 nach einer Preview Ende April und ist in Tencents eigenen Produkten wie CodeBuddy, WorkBuddy und Yuanbao im Einsatz. Die Gewichte liegen auf Hugging Face und ModelScope.

Was bedeutet Mixture of Experts bei Hy3 konkret?

Das Modell besteht aus 192 Experten plus einem Shared Expert. Ein Router wählt pro Token die acht passendsten aus. Dadurch sind nur 21 Milliarden der 295 Milliarden Parameter aktiv. Latenz und Rechenaufwand richten sich nach den aktiven Parametern, das Wissen nach der Gesamtgröße. Die große Zahl ist die Schlagzeile, die kleine bestimmt die Praxis.

Halluziniert Hy3 weniger als andere Modelle?

Tencent hat das Modell nach dem Grundsatz trainiert, nur zu antworten wenn die Grundlage da ist, und fehlende Belege zu benennen. In internen Auswertungen fiel die Halluzinationsrate von 12,5 auf 5,4 Prozent. Das sind Herstellerzahlen ohne unabhängige Prüfung. Ein Review durch Menschen ersetzt das nicht.

Was ist der Unterschied zwischen Hy3 und Hy3 Preview?

Hy3 Preview kam Ende April und war die erste öffentliche Fassung. Tencent hat danach Feedback aus über fünfzig Produkten gesammelt und das Post Training mit besseren Daten skaliert. Die Fassung vom 6. Juli legt bei Coding Benchmarks deutlich zu. Beide nutzen denselben Modellcode, ein vLLM Build für Preview bedient auch die finale Version.

Welchen Reasoning Modus soll ich bei Hy3 wählen?

Für kurze, direkte Antworten den Modus ohne Zwischenschritte. Für Mathe, Refactorings und mehrstufige Aufgaben die höchste Stufe. Wer immer auf Maximum fährt, wartet unnötig lange und verbrennt Token. Wer immer direkt antworten lässt, bekommt bei komplexen Aufgaben schwächere Ergebnisse. Der Modus gehört zur Konfiguration des Agenten, nicht in jeden einzelnen Prompt.

Ersetzt ein starkes Modell wie Hy3 Tests und Reviews?

Nein. Ein besseres Modell produziert schneller Code, nicht automatisch besseren. Bei uns stehen vor jedem Agenten die Qualitätsgates: statische Analyse, Unit Tests, funktionale Tests und End to End Tests. Erst danach wird aufgeräumt. Bei Altsystemen läuft die Arbeit bewusst manuell mit KI Unterstützung, über den Umbau entscheiden Menschen.