Eliminierung technischer Schulden mit PHPStan, Rector PHP und PHPUnit. Über 20 Jahre Praxiserfahrung in skalierbaren Backends.
- Aktualisiert:
- Autor:
- Roland Golla
Was ist Gemini 3.5 Flash?
Gemini 3.5 Flash ist Googles Frontier Modell für agentische und Coding Workflows, vorgestellt am 19. Mai 2026 auf der Google I/O in Mountain View. Das Flash Modell schlägt das eigene Frontier Modell Gemini 3.1 Pro auf Coding und Agent Benchmarks, läuft laut Google viermal schneller als andere Frontier Modelle und kostet deutlich weniger als GPT 5.5.
Seit dem 19. Mai 2026 ist Flash 3.5 verfügbar in der Gemini App, im AI Mode der Google Suche, in Google Antigravity 2.0, in Google AI Studio und über die Gemini API. Auf Terminal Bench 2.1 schafft das Modell 76,2 Prozent, auf MCP Atlas 83,6 Prozent und auf Finance Agent v2 57,9 Prozent.
Das Kontextfenster liegt bei einer Million Tokens, das Output Limit bei 64.000 Tokens. Vier Thinking Levels steuern Qualität, Kosten und Latenz pro Anfrage. Stand Oktober 2026 hat Google schnell nachgelegt: Gemini 3.6 Flash, 3.7 Flash und 3.8 Flash folgten zwischen Juli und September. Gemini 3.5 Flash bleibt aber die Generation, mit der Flash erstmals Pro auf Agent Benchmarks überholt hat.
Gemini 3.5 Flash mit NCA: Schnelle Hilfe vom Experten
Bei NCA arbeiten wir täglich mit aktuellen Frontier Modellen. Gemini gehört neben Claude Code, OpenCode und lokalen Modellen über Ollama zu unserem produktiven KI Stack. Jede neue Flash Version prüfen wir in echten Agent Workflows, bevor wir sie Teams empfehlen.
Wir helfen Teams, Gemini sinnvoll in Produkte und Workflows zu integrieren: mit Vibe Coding Consulting, mit der Auswahl im KI Tool Stack, mit der Einordnung gegen die GPT Modelle von OpenAI und Claude Sonnet 5 sowie beim Einstieg über Google AI Studio und Antigravity. Auch der Wechsel zwischen Flash Versionen inklusive Thinking Levels gehört dazu.
Gesetzliche Konformität & Inklusion. Optimierung von Performance und Conversion durch radikal nutzerzentriertes, universelles Design.
Skalierbare KI-Systeme mit echtem Code Ownership. CI/CD, Backup-Strategien und Infrastruktur, die mit deinem Team wächst.
Benchmarks: Wo Gemini 3.5 Flash 3.1 Pro schlägt
Das Flash Modell ist auf Coding und agentische Workflows optimiert und schlägt Gemini 3.1 Pro auf den Benchmarks, die nach echter Arbeit aussehen. Bei reinem Wissens Reasoning liegt 3.1 Pro vorn. Tabelle und Infografik darunter zeigen die Werte von Google textuell und visuell, damit sie für Screenreader Nutzer und sehende Leser gleich zugänglich sind.
Faustregel zum Release: Flash 3.5 für Agenten und Coding, 3.1 Pro für Recherche, Architekturentscheidungen und tiefes Reasoning. Das angekündigte Gemini 3.5 Pro ist bis Oktober 2026 nicht erschienen, stattdessen kamen weitere Flash Versionen.
Verfügbarkeit und Migration von Gemini 3 Flash Preview
Wer von Gemini 3 Flash Preview umsteigt, muss die Kosten neu kalkulieren. Gemini 3.5 Flash kostet über die API 1,50 USD pro Million Input Tokens und 9,00 USD pro Million Output Tokens, ein Vielfaches des Vorgängers. Thinking Tokens werden dabei als Output abgerechnet. Artificial Analysis hat bei realen Workloads sogar eine Verfünffachung der Gesamtkosten gemessen. Teams mit hohem Flash Volumen sollten das vor der Migration einplanen.
Verfügbar ist das Modell über die Gemini App, den AI Mode der Google Suche, Google Antigravity 2.0, Google AI Studio, Android Studio, die Gemini API, die Gemini Enterprise Agent Platform und Vertex AI. Wer heute neu startet, prüft zusätzlich die Nachfolger: Gemini 3.8 Flash kostet zum Start 0,75 USD pro Million Input Tokens, die Preise sollen sich laut Google zum Januar 2027 verdoppeln.
Thinking Levels und Antigravity 2.0 Integration
Gemini 3.5 Flash ersetzt den alten Integer Parameter thinking_budget durch die Variable thinking_level mit vier Stufen: minimal, low, medium (Default) und high. Wichtig bei der Migration: Der Default ist von high (Gemini 3 Flash Preview) auf medium gewechselt. Wer bisher mit dem höchsten Level gearbeitet hat, setzt thinking_level high explizit, sonst sinkt die Qualität spürbar. Höhere Levels kosten mehr Reasoning Tokens.
Die spannendste Integration ist Google Antigravity 2.0, das zum Release am 19. Mai 2026 auf Gemini 3.5 Flash umgestellt wurde. In Antigravity erreicht das Modell laut Google bis zu zwölffache Geschwindigkeit, über die öffentliche API wird die vierfache Geschwindigkeit genannt. Dazu kam die Managed Agents API: Entwickler starten damit Agenten in einer isolierten Linux Sandbox mit persistentem State. Mehr zu den Neuerungen steht im Eintrag Antigravity 2.0 Features.
Use Cases: Wofür Gemini 3.5 Flash gemacht ist
Gemini 3.5 Flash zielt auf Workflows, in denen Geschwindigkeit, Tool Calling und parallele Agents zählen. Auf der Google I/O ließ Google einen Schwarm Subagenten unter Antigravity 2.0 ein funktionierendes Betriebssystem bauen, inklusive lauffähigem Doom. Das war eine Demo, zeigt aber die Kategorie: Long Horizon Agent Workflows mit vielen Tool Calls in Folge.
Weitere Beispiele aus den Google Demos:
- Ein Builder Agent und ein Player Agent bauen gemeinsam ein Spiel im Self Improvement Loop
- Aus einer Textbeschreibung entsteht ein interaktives Hardware Mockup
- Mehrere Agents bauen parallel ein Branding mit Logo, Webseite und Pitchdeck
- Ein Agenten Team baut das AlphaZero Paper als spielbares Spiel nach
Im NCA Stack passen Gemini Flash Modelle gut zu Code Reviews ganzer Repositories, automatisierten MCP Tool Workflows, Multi Step Agents mit Symfony AI Mate oder agentischen Pipelines über den GitHub MCP Server. Wer mit DSGVO Anforderungen arbeitet, plant die Cloud Verarbeitung der Anfragen ein und weicht gegebenenfalls auf lokale Alternativen wie Ollama mit Qwen oder Llama aus.
Gemini 3.5 Flash im Vergleich zu Claude und GPT
Zum Release im Mai 2026 war die Lage klar: Googles Flash war das günstigste Frontier Modell mit starkem Agent Profil. Claude Opus 4.7 dominierte lange Tool Sessions und Multi Step Coding, GPT 5.5 führte bei Computer Use und hatte das größte Ökosystem. Claude Sonnet 4.6 lag auf reinen Coding Benchmarks in ähnlicher Klasse, kostete aber etwa das Doppelte.
Seitdem hat sich das Feld bewegt. Anthropic hat mit Claude Opus 5 und Claude Sonnet 5 nachgelegt, OpenAI mit GPT 6 Astra, Google mit den Flash Versionen 3.6 bis 3.8. Die Faustregel bleibt: Für agentische Pipelines mit hohem Volumen sind Gemini Flash Modelle stark, bei komplexen Refactorings mit langen Sessions liegen die großen Claude Modelle oft vorn. Wer noch günstiger werden will, prüft offene Modelle wie DeepSeek V4 oder lokale Setups mit llama.cpp und klärt Compliance separat.
Stand Oktober 2026: Gemini 3.6, 3.7 und 3.8 Flash
Google hat nach 3.5 Flash im Monatstakt nachgelegt. Laut Changelog der Gemini API kamen diese Versionen:
- 21. Juli 2026: Gemini 3.6 Flash mit besserer Token Effizienz und stärkerer Agent Planung, dazu 3.5 Flash Lite als günstige Option für Subagenten
- 13. August 2026: Gemini 3.7 Flash, laut Google das bisher stärkste Arbeitstier für Coding und Agents
- 2. September 2026: Gemini 3.8 Flash für lange Software Aufgaben, autonome Agents und komplexe Enterprise Workflows
Der Haken bei 3.8 Flash: Es baut auf 3.7 Flash auf und erreicht seine Werte vor allem durch mehr Thinking Tokens. Die Zeit bis zum ersten Token steigt deutlich. Für effizienzorientierte Workloads bleibt 3.7 Flash die bessere Wahl. Darüber hinaus hat Google am 30. September 2026 Gemini 4 Argon vorgestellt, zunächst nur für ausgewählte Sicherheitspartner. Einen Überblick über alle Varianten gibt unser Eintrag zur Gemini Familie 2026.
Welcome to Gemini 3.5 Flash, our most powerful model to date.
Die Gemini Familie 2026 im Überblick: Gemini 4 Argon, 3.8 Flash, 3.1 Pro, Omni Flash und Deep Think. Stärken, Verfügbarkeit und Use Cases im Vergleich.
Mehr erfahrenGemini Flash im NCA Stack: Einordnung aus der Beratung
Gemini Flash Modelle sind für agentische Pipelines ein starker Default. Bei jeder Migration zwischen Flash Versionen gilt: thinking_level bewusst setzen, Kosten pro Aufgabe messen, Qualität mit echten Aufgaben prüfen. Der Geschwindigkeitsvorteil in Antigravity 2.0 zahlt sich vor allem dort aus, wo parallele Subagenten viele Tool Calls in Serie absetzen.
In der Beratung achten wir darauf, dass Teams nicht in einen Vendor Lock in laufen. Wir bauen Vibe Coding Stacks so, dass das Modell austauschbar bleibt. Mehr dazu in unserem Vibe Coding Best Practices Guide und im Artikel zu Web MCP für portable KI Workflows. Wer Modelle lieber lokal betreibt, prüft den Weg über llama.cpp oder Ollama.
Wir helfen Teams, die passende Gemini Variante für den Use Case zu wählen und in bestehende Workflows zu bringen. Ein bewährtes Muster: ein starkes Reasoning Modell für Architekturentscheidungen, ein Flash Modell für die produktive Pipeline. Auch die Anbindung über den GitHub MCP Server, Symfony AI Mate oder Claude Code Plugins begleiten wir. Die Managed Agents API ist dabei für viele Szenarien der nächste logische Schritt.
Roland Golla ist Entwickler aus Leidenschaft – seit über 20 Jahren. Er hat hunderte Projekte begleitet, von Legacy-Refactoring bis KI-Integration. Bei Vibe Coding verbindet er das Beste aus beiden Welten: Die Geschwindigkeit von KI-generiertem Code mit der Qualität professioneller Softwareentwicklung. Kein Bullshit, keine Agentur-Floskeln – direkte Hilfe von jemandem, der selbst täglich im Code steckt.
Häufige Fragen zu Gemini 3.5 Flash
Hier beantworten wir die häufigsten Fragen zu Gemini 3.5 Flash, von Benchmarks und Preisen über Migration und Thinking Levels bis zur Integration mit Google Antigravity 2.0 und den Nachfolgern bis 3.8 Flash.
Googles Frontier Modell für agentische und Coding Workflows, vorgestellt am 19. Mai 2026 auf der Google I/O. Das Flash Modell schlägt Gemini 3.1 Pro auf Coding und Agent Benchmarks und läuft laut Google viermal schneller als andere Frontier Modelle. Inzwischen gibt es mit 3.6, 3.7 und 3.8 Flash bereits Nachfolger.
Vorstellung und allgemeine Verfügbarkeit fielen auf den 19. Mai 2026. Seitdem läuft das Modell in der Gemini App, im AI Mode der Google Suche, in Google Antigravity 2.0, in Google AI Studio und über die Gemini API. Das damals angekündigte Gemini 3.5 Pro ist bis Oktober 2026 nicht erschienen.
In der öffentlichen Gemini API läuft Flash 3.5 laut Google viermal schneller als andere Frontier Modelle, gemessen in Output Tokens pro Sekunde. In Google Antigravity 2.0 erreicht die interne Optimierung bis zu zwölffache Geschwindigkeit. Artificial Analysis maß rund 214 Tokens pro Sekunde bei thinking_level high.
Über die Gemini API kostet Gemini 3.5 Flash 1,50 USD pro Million Input Tokens und 9,00 USD pro Million Output Tokens. Thinking Tokens zählen als Output und machen bei komplexen Aufgaben einen großen Teil der Rechnung aus. Der Nachfolger 3.8 Flash startete im September 2026 mit 0,75 USD Input, die Preise sollen sich ab Januar 2027 verdoppeln.
Auf Terminal Bench 2.1 schafft das Flash Modell 76,2 Prozent, auf MCP Atlas 83,6 Prozent, auf Finance Agent v2 57,9 Prozent und auf CharXiv Reasoning 84,2 Prozent. Bei Humanity's Last Exam liegt der Score bei 40,2 Prozent, auf ARC AGI 2 bei 72,1 Prozent. Die Werte stammen von Google.
Flash 3.5 ist auf agentische und Coding Workflows optimiert, schneller und günstiger. Auf Terminal Bench 2.1, MCP Atlas und Finance Agent v2 schlägt es 3.1 Pro. Bei Humanity's Last Exam, ARC AGI 2 und Retrieval in langem Kontext liegt 3.1 Pro vorn. Für tiefes Reasoning bleibt Pro daher interessant.
Thinking Levels ersetzen den alten Parameter thinking_budget durch vier Stufen: minimal, low, medium (Default) und high. Höhere Levels investieren mehr Reasoning pro Anfrage und steigern die Qualität, kosten aber mehr Tokens und Latenz. Wichtig bei der Migration von 3 Flash Preview: Der Default ist von high auf medium gewechselt.
Drei Schritte: Erstens die Modell ID auf Gemini 3.5 Flash umstellen. Zweitens thinking_level explizit auf high setzen, da der Default jetzt medium ist. Drittens das Budget anpassen, da die Token Kosten deutlich gestiegen sind. Wer heute migriert, sollte direkt auch 3.7 oder 3.8 Flash testen.
Google hat schnell nachgelegt: Gemini 3.6 Flash und 3.5 Flash Lite erschienen am 21. Juli 2026, 3.7 Flash am 13. August, 3.8 Flash am 2. September. 3.8 Flash ist auf lange Software Aufgaben und autonome Agents ausgelegt, braucht aber mehr Thinking Tokens. Für effizienzorientierte Workloads empfiehlt Google weiter 3.7 Flash.
Zum Release schlug das Flash Modell GPT 5.5 auf mehreren agentischen und Coding Benchmarks und war deutlich günstiger. GPT 5.5 war stärker bei Computer Use und hat das größere Ökosystem. Inzwischen hat OpenAI mit GPT 6 Astra nachgelegt, ein fairer Vergleich braucht daher immer die aktuellen Versionen beider Anbieter.
Nein. Das Modell ist proprietär und läuft nur auf Googles Cloud Infrastruktur. Wer lokale Modelle braucht, setzt offene Alternativen wie Qwen, Llama oder DeepSeek über Ollama oder llama.cpp ein. Bei NCA helfen wir Teams beim Aufbau hybrider Stacks, die zwischen Cloud und lokalen Modellen wechseln können.
Eine Funktion der Gemini API, gestartet mit Flash 3.5 am 19. Mai 2026 als Public Preview. Mit einem API Call startet ihr einen Agenten, der plant, Tools nutzt und Code in einer isolierten Linux Sandbox bei Google ausführt. Sessions sind persistent und lassen sich später fortsetzen, Dateien und State bleiben erhalten.
Das Kontextfenster liegt bei einer Million Tokens Input, das Output Limit bei 64.000 Tokens. Die Nachfolger bis 3.8 Flash behalten diese Größen. Für Code Reviews ganzer Repositories und lange Dokumentenanalysen ist das ein klarer Vorteil, die Kosten für große Kontexte solltet ihr aber im Blick behalten.
Gemini 4 Argon ist Googles neues Frontier Modell, vorgestellt am 30. September 2026. Zum Start ist es nur für ausgewählte Sicherheitspartner verfügbar, nicht über die normale API oder App. Google nennt Stärken beim Finden und Patchen von Sicherheitslücken, beim Coding und bei Migrationen. Für den Alltag bleiben die Flash Modelle vorerst die relevante Wahl.
Stand Oktober 2026 sind Gemini 3.7 Flash und 3.8 Flash die aktuellen Kandidaten. 3.8 Flash ist stärker bei langen Agent Aufgaben, 3.7 Flash effizienter und schneller in der Antwort. Gemini 3.5 Flash bleibt eine solide Basis für bestehende Pipelines. Für tiefes Reasoning lohnt der Blick auf Gemini 3.1 Pro.