NCA Social Media
Erstellt:
Aktualisiert:
Autor:
Roland Golla
Grünes Terminal mit Code und Tiefsee-Fisch-Logo, Server-Rack und DSGVO-Schloss

Was ist DeepSeek Coding?

DeepSeek Coding bezeichnet die Open Source KI Modelle des chinesischen Unternehmens DeepSeek AI für Code Generierung, Debugging und Reasoning. Aktuelles Modell ist seit September 2026 DeepSeek V4.1 Flash, ein multimodales Modell mit einer Million Token Kontext und offenen Gewichten unter MIT Lizenz.
Die Architektur bleibt eine Mixture of Experts, ist aber neu gebaut. 552 Milliarden Backbone Parameter, davon aktiv nur 8 Milliarden beim Einlesen und 16 Milliarden beim Generieren. V4.1 Flash versteht Bilder und Text nativ. Der KV Cache schrumpft laut DeepSeek auf rund ein Viertel des Vorgängers. Das entlastet lange Agent Sessions spürbar.
Die V4 Generation vom April 2026 mit V4-Pro und V4-Flash läuft aus. V4-Flash ist abgelöst, Anfragen an V4-Pro leitet DeepSeek seit dem 14. September 2026 auf V4.1 Flash um. Für Teams in Europa bleibt eine Frage zentral: Die DeepSeek Cloud API überträgt Daten nach China. Unsere Regel lautet deshalb: Coding läuft über eine europäische Inferenz, echte Daten bleiben im eigenen Netzwerk.
Inhalt

DeepSeek mit NCA: Schnelle Hilfe vom Experten

Never Code Alone sitzt in Duisburg und arbeitet seit über 20 Jahren an Softwarequalität. Roland Golla ist Cypress Ambassador, hat zum TYPO3 Core beigetragen und spricht auf Konferenzen wie der code.talks und der International PHP Conference. Offene Modelle sind bei uns kein Trendthema: Wir betreiben lokale Inferenz über Ollama, prüfen neue Releases im echten Projekt und wissen, wo der Unterschied zwischen Benchmark und Alltag liegt.

Passend dazu unsere Leistungen: Vibe Coding Consulting für den Aufbau kontrollierter KI Infrastruktur, Vibe Coding Training für ganze Teams, CI/CD Pipelines die KI generierten Code automatisch prüfen, PHP Consulting für gewachsene Symfony Systeme und Vibe Coding Modelle als laufend gepflegter Überblick. Ein kostenloses Kennenlernen klärt in wenigen Minuten, ob wir passen, abgerechnet wird danach minutengenau.

DeepSeek sauber aufsetzen statt raten
Finde das passende Angebot für dein Projekt
Anfrage-Konfiguration
Starten Sie Ihre Anfrage
Projektart
Infos
Nachricht

Eliminierung technischer Schulden mit PHPStan, Rector PHP und PHPUnit. Über 20 Jahre Praxiserfahrung in skalierbaren Backends.

CORE EXPERTISE

Gesetzliche Konformität & Inklusion. Optimierung von Performance und Conversion durch radikal nutzerzentriertes, universelles Design.

BFSG COMPLIANT

Skalierbare KI-Systeme mit echtem Code Ownership. CI/CD, Backup-Strategien und Infrastruktur, die mit deinem Team wächst.

ENTERPRISE READY

Die DeepSeek Modellfamilie 2026: von V4 zu V4.1 Flash

DeepSeek hat im April 2026 einen harten Schnitt gemacht. Statt einzelner Spezialmodelle wie früher Coder V2, V3 und R1 gab es plötzlich zwei Modelle für alles: Chat, Code und Reasoning. Im September folgte der nächste Schritt mit einer komplett neuen Architektur.
DeepSeek V4-Pro war das Flaggschiff. 1,6 Billionen Parameter gesamt, 49 Milliarden aktiv pro Token. In der API blieb es Preview. Seit dem 14. September 2026 nimmt DeepSeek es vom Netz: Anfragen an deepseek-v4-pro landen bei V4.1 Flash, bis V4.1 Pro erscheint.
DeepSeek V4-Flash war das kleine, schnelle Modell. 284 Milliarden gesamt, 13 Milliarden aktiv. Am 31. Juli 2026 kam der Build V4-Flash-0731, neu post trainiert bei gleicher Architektur. Mit V4.1 Flash ist auch dieser Stand abgelöst.
DeepSeek V4.1 Flash ist das erste Modell einer neuen Architekturfamilie. Kern ist ein Causal Encoder Decoder Aufbau mit 20 Encoder und 20 Decoder Schichten. Dazu kommen Compressed Sparse Attention 2 und ein KV Cache im FP4 Format. Trainiert wurde auf rund 45 Billionen multimodalen Token. Den Reasoning Aufwand steuerst du stufenlos von 1 bis 100.
Laut DeepSeek schlägt das kleine Modell damit sogar das alte Flaggschiff V4-Pro. Unabhängig bestätigt ist das bisher nicht. Für die Praxis zählt ein anderes Detail: OpenCode unterstützt V4.1 Flash als offizieller Partner vollständig.
Und was ist mit Coder V2, V3 und R1? Die sind Geschichte. R1 hat im Januar 2025 die ganze Branche wachgerüttelt, Coder V2 war lange das dedizierte Code Modell mit 338 Sprachen. Für neue Projekte spielen beide keine Rolle mehr. Ein Blick auf die Konkurrenz lohnt trotzdem: GLM 5.2, Kimi K3 und Qwen3 Coder spielen in derselben Liga.
Die offenen Gewichte von V4.1 Flash liegen auf Hugging Face unter MIT Lizenz, dazu Anleitungen für vLLM und SGLang. Anders als beim 0731 Build ist der aktuelle Stand damit auch zum Herunterladen verfügbar. Wer echte Kontrolle über sein Modell will, hat jetzt die bessere Ausgangslage. Mehr Einordnung im Überblick zu chinesischen KI Modellen für AI Coding.

DeepSeek V4-Flash und V4.1 Flash im Vergleich laut DeepSeek

Merkmal V4-Flash 0731 V4.1 Flash
Backbone Parameter 284 Milliarden 552 Milliarden
Aktive Parameter pro Token 13 Milliarden 8 Milliarden Prefill, 16 Milliarden Decode
Eingaben Text Bild und Text
Kontext 1 Million Token 1 Million Token
KV Cache pro Token Referenzwert rund ein Viertel davon
Terminal Bench 2.1 82,7 90,6
DeepSWE v1.1 54,4 74,2
NCA KI Workshop für Developer

Agentic Coding im Team, nicht nur im Glossar

Ein Tag inhouse mit Benjamin Klein für Developer, Tester und Admins. Context Engineering, Harness, ADRs und zwei Hands on Blöcke mit KI Agenten in eurem Setup.

  1. 1
    Kostenloses Vorgespräch
    Stand, Rollen und Ziele klären
  2. 2
    Workshoptag bei euch
    Praxis am Vormittag, Hands on danach
  3. 3
    Praxistag optional
    Agenten im eigenen Projekt
Benjamin Klein
Benjamin Klein
Senior Consultant
Zum Workshop für Developer arrow_forward

Migration: alte API Namen und der Wechsel auf deepseek-flash

Das ist der Punkt, der 2026 die meisten Integrationen zerlegt hat. DeepSeek hat deepseek-chat und deepseek-reasoner am 24. Juli 2026 endgültig abgeschaltet. Wer sie noch aufruft, bekommt einen Fehler statt einer Antwort.
Mit V4.1 Flash kommt der nächste Umbau. Der aktuelle Modellname lautet deepseek-flash. Die Namen deepseek-v4-flash und deepseek-v4-pro leitet DeepSeek vorübergehend auf V4.1 Flash um. Die base_url bleibt, DeepSeek unterstützt weiter das OpenAI ChatCompletions Format und die Anthropic Schnittstelle.
Code:
          

# Seit dem 24. Juli 2026 abgeschaltet
model = "deepseek-chat"
model = "deepseek-reasoner"

# Nur noch Weiterleitung auf V4.1 Flash
model = "deepseek-v4-flash"
model = "deepseek-v4-pro"

# Aktuell
model = "deepseek-flash"

# base_url bleibt unveraendert
# OpenAI Format: https://api.deepseek.com
# Anthropic Format: https://api.deepseek.com/anthropic

Thinking und Non Thinking sind seit V4 kein eigenes Modell mehr, sondern ein Modus innerhalb desselben Modells. V4.1 Flash geht einen Schritt weiter und kennt einen stufenlosen Reasoning Aufwand von 1 bis 100. Für agentische Setups ist das sauberer, weil du den Denkaufwand pro Aufgabe wählst und der Kontext im Modell bleibt.

Benchmarks: von V4-Flash 0731 zu V4.1 Flash

Schon der Juli Build war ein Sprung. DeepSeek hat an der Architektur nichts geändert, nur neu trainiert. Und meldete auf allen neun veröffentlichten Agent und Coding Benchmarks bessere Werte als beim eigenen, deutlich größeren V4-Pro-Preview.
Der auffälligste Wert war Terminal Bench 2.1. Dort sprang V4-Flash von 61,8 im Preview auf 82,7. Bei DeepSWE ging es von 7,3 auf 54,4, also mehr als das Siebenfache in einem einzigen Post Training Zyklus.
V4.1 Flash legt noch einmal nach. Auf Terminal Bench 2.1 meldet DeepSeek 90,6, auf DeepSWE v1.1 74,2. In DeepSeeks eigener Tabelle liegt das Modell bei diesen beiden Werten knapp vor Opus 5.0 und GPT-5.6. Bei den schwereren Varianten Terminal Bench 3.0 und 4.0 liegt Opus dagegen klar vorn.
Wichtiger Vorbehalt. Alle Zahlen kommen von DeepSeek selbst. Gemessen wurde im Minimal Modus der hauseigenen DeepSeek Harness. Die Harness ist inzwischen offen, und für DeepSWE legt DeepSeek eine Anleitung zur Reproduktion bei. Das ist ein Fortschritt. Eine unabhängige Nachmessung ersetzt es nicht.
Passend zum Modell kam Harness 0.1.5. Die Version ist gezielt auf V4.1 Flash abgestimmt, im Standard, PTC und Minimal Modus. System Prompts lassen sich ändern, ohne den KV Cache zu verwerfen. Spannend ist DeepSeeks Vergleich der Agent Umgebungen: V4.1 Flash läuft in Claude Code, Codex, OpenCode und Pi mit wenigen Punkten Abstand zur eigenen Harness. Das Modell ist also nicht an DeepSeeks Werkzeug gebunden.
Was unabhängig von Benchmarks bleibt, ist die Effizienz. Weniger aktive Parameter und ein kleinerer KV Cache machen lange Agent Läufe mit vielen Iterationen realistischer. Genau das ist der Kern von Vibe Coding. Schon der 0731 Build brachte native Unterstützung für das Responses API Format und eine Anpassung an Codex.

Agent Benchmarks V4-Flash-0731 laut DeepSeek

Benchmark V4-Flash-0731 Einordnung
Terminal Bench 2.1 82,7 Preview lag bei 61,8, V4-Pro-Preview bei 72,1
DeepSWE 54,4 Preview lag bei 7,3, mehr als das Siebenfache
NL2Repo 54,2 Repository Aufgaben aus natürlicher Sprache
Cybergym 76,7 Sicherheitsnahe Coding Aufgaben
DSBench FullStack 68,7 Full Stack Software Engineering

DSGVO ist das größte Problem für europäische Teams mit DeepSeek

Hier hat sich seit 2025 nichts entspannt. Die Berliner Datenschutzbeauftragte meldete die DeepSeek App bei Apple und Google als rechtswidrigen Inhalt. Der Vorwurf: unrechtmäßige Datenübermittlung nach China ohne ausreichende Schutzgarantien. Sieben Landesdatenschutzbehörden führen seit Februar 2025 abgestimmte Prüfverfahren, Italien hatte den Dienst bereits temporär komplett blockiert.

Die Fakten im Überblick:

  • DeepSeek speichert Nutzerdaten auf Servern in China, inklusive Prompts, Chatverläufen und hochgeladenen Dateien
  • China hat keinen Angemessenheitsbeschluss der EU Kommission, Transfers dorthin brauchen zusätzliche Garantien
  • Es gibt keinen Auftragsverarbeitungsvertrag nach Artikel 28 DSGVO für Unternehmenskunden
  • Ein EU Vertreter nach Artikel 27 DSGVO fehlt, genau darum ging es im Prüfverfahren
  • Der Landesbeauftragte für den Datenschutz Niedersachsen sieht auch die Anforderungen der KI Verordnung als nicht eingehalten an

Was heißt das konkret? Wer die DeepSeek API oder die Weboberfläche nutzt, überträgt Daten nach China. Privat ist das eine persönliche Risikoabwägung. Im Unternehmen ist es ein Aufsichtsrisiko, und zwar nicht nur nach DSGVO: Auch Geschäftsgeheimnisse haben in einem Kanal ohne Vertragsgrundlage nichts verloren.

Die tragfähige Lösung trennt zwei Dinge. Coding läuft aus der Cloud, aber über eine Inferenz mit Vertragsgrundlage in Europa, etwa bei TensorX oder als Enterprise Option bei unserem Infrastrukturpartner Conversis in Duisburg. Die MIT Lizenz erlaubt solche gehosteten Setups ausdrücklich. Datenverarbeitung bleibt im eigenen Netzwerk. Gecodet wird gegen lokale Entwicklungsumgebungen mit anonymisierten Testdaten, nie gegen echte Kundendaten.

Ein Modell mit 552 Milliarden Parametern auf eigener Hardware zu betreiben, rechnet sich für praktisch kein Team. Nötig bleiben ein Vertrag mit dem Inferenzanbieter, ein Eintrag im Verarbeitungsverzeichnis und bei riskanter Verarbeitung eine Folgenabschätzung. Wie man solche Setups baut, zeigen wir im Vibe Coding Consulting und im Guide welches KI Modell ohne US Anbieter.

So ordnen wir DeepSeek gegen Claude Code und OpenCode ein

Der Vergleich ist 2026 schiefer, als er klingt. DeepSeek ist ein Modell, Claude Code und OpenCode sind Agents. DeepSeek testet V4.1 Flash selbst in beiden Umgebungen. Die eigentliche Frage lautet: Welches Modell läuft in welchem Agent?
Stärken von DeepSeek V4.1 Flash. Eine Million Token Kontext als Standard. Native Verarbeitung von Bildern. Offene Gewichte unter MIT Lizenz, damit ist eine gehostete Inferenz bei einem europäischen Anbieter rechtlich sauber möglich. Und ein kleiner KV Cache, der lange Agent Sessions entlastet.
Schwächen. Die DeepSeek Cloud API ist in Europa nicht sauber nutzbar. Die Benchmarkzahlen sind Herstellerangaben ohne unabhängige Prüfung. Bei den schweren Terminal Bench Varianten liegt das Modell deutlich hinter Opus. Und für eigene Hardware ist das Modell schlicht zu groß.
Unsere Einordnung: V4.1 Flash über eine europäische Inferenz für schnelles Prototyping und Agent Läufe in OpenCode, unserem Coding Agent im Alltag. Claude Code hat Stärken bei Teams, die schon im Anthropic Ökosystem arbeiten. In beiden Fällen gilt dieselbe Reihenfolge: erst Quality Gates mit statischer Analyse und Tests, dann KI, am Ende ein Mensch für Review und Sicherheit. Welche Modelle ohne US Anbieter passen, steht im Guide welches KI Modell ohne US Anbieter.

DeepSeek mit Ollama, Cloud Tags und europäischer Inferenz nutzen

Über Ollama sind die V4 Modelle verfügbar. Achtung beim Suffix: Die Tags mit cloud laufen auf Ollama Infrastruktur, nicht auf deinem Rechner. Für V4.1 Flash listet Hugging Face bereits Community Quantisierungen für Ollama, llama.cpp und LM Studio.
Ollama hat deepseek-v4-flash:0731-cloud Ende Juli 2026 in die eigene Cloud gestellt und dabei ausdrücklich die stärkeren agentischen Fähigkeiten als Grund genannt. Einen Tag später folgte ein Durchsatz Update. Dazu eine Million Token Kontext und drei wählbare Denkstufen: schnelle Antwort ohne Reasoning, normales Thinking und Max Thinking für harte Aufgaben.
Code:
          

# Build vom 31. Juli 2026
ollama run deepseek-v4-flash:0731-cloud

# Claude Code mit V4-Flash 0731 als Backbone
ollama launch claude --model deepseek-v4-flash:0731-cloud

# Hermes Agent
ollama launch hermes --model deepseek-v4-flash:0731-cloud

# OpenClaw
ollama launch openclaw --model deepseek-v4-flash:0731-cloud

# OpenCode
ollama launch opencode --model deepseek-v4-flash:0731-cloud

# Das alte Flaggschiff
ollama run deepseek-v4-pro:cloud

Der Punkt an diesen Zeilen: Du tauschst das Modell unter deinem Agenten aus, ohne den Agenten zu wechseln. Das gilt für Claude Code genauso wie für OpenCode, Hermes Agent und OpenClaw. Wer morgen ein anderes Backbone testen will, ändert genau ein Flag. Die Auswahl selbst haben wir in welches KI Modell auswählen ohne US Anbieter durchdekliniert.
Cloud ist nicht lokal. Das ist der Punkt, an dem viele Setups DSGVO technisch auseinanderfallen. Ollama Cloud ist ein US Anbieter, die DeepSeek API ein chinesischer. Für Coding in echten Projekten setzen wir deshalb auf eine europäische Inferenz wie TensorX oder Conversis, kombiniert mit lokalen Entwicklungsumgebungen ohne echte Daten. Community Experimente gibt es trotzdem: Ein llama.cpp Fork zielt mit 2 Bit Quantisierung der Experten auf MacBooks mit 128 GB RAM. Für produktive Arbeit ist das kein Weg.
Lokal sinnvoll sind kleine Modelle, etwa für Datenverarbeitung im eigenen Netzwerk. Welche davon wirklich taugen, haben wir in beste Coder Modelle für lokale Nutzung und Ollama Modelle 2026 durchgespielt. Wichtig ist auch das Tool Handling, dazu passt welche KI Modelle für MCP und Tool Handling taugen.

behaves very very well in the chat, frontier-model vibes

Salvatore Sanfilippo, Erfinder von Redis, GitHub antirez – README llama.cpp-deepseek-v4-flash

DeepSeek kritisch betrachtet: Was 2026 wirklich zählt

Die alte Frage lautete: Wie lange kann DeepSeek dieses Tempo finanzieren? Die Antwort ist seit Sommer 2026 klar. Das Unternehmen hat seine erste externe Finanzierungsrunde abgeschlossen. Geld ist kein Engpass mehr.
Interessanter als die Summe ist die Struktur. Die meisten Investoren kauften nicht direkt Anteile, sondern gingen in eine von Gründer Liang Wenfeng kontrollierte Limited Partnership, ohne Stimmrechte und mit fünf Jahren Sperrfrist. Der staatliche National Artificial Intelligence Industry Investment Fund dagegen investierte direkt, mit Stimmrechten und ohne Sperrfrist. Eine zweite Runde wurde begonnen und dann vorerst ausgesetzt.
Was daraus für die Bewertung folgt:
  • Staatsnähe: ein staatlicher Fonds mit Stimmrechten am Tisch ist ein härteres Faktum als jede Zensurdebatte
  • Benchmarks: eigene Zahlen auf eigener Harness bleiben eigene Zahlen, auch wenn die Harness jetzt offen ist
  • Offenheit: die MIT Lizenz ist das stärkste Argument, und mit V4.1 Flash liegt der aktuelle Stand auch als Download vor
  • Tempo: zwei Modellgenerationen in fünf Monaten bedeuten für Integrationen ständige Migrationsarbeit
Für Entwicklerteams heißt das: DeepSeek V4.1 Flash ist ein starkes Werkzeug im Kasten, kein Fundament. Wer damit produktive Software ausliefert, braucht Tests, Reviews und eine Infrastruktur, die er selbst kontrolliert. Genau daran arbeiten wir im Vibe Coding Consulting und in unseren Vibe Coding Best Practices.

Unsere Erfahrung mit offenen Modellen im Entwickleralltag

Bei Never Code Alone laufen KI Modelle im Terminal, jeden Tag. Wir arbeiten mit OpenCode als Coding Agent, mit kleinen Modellen lokal über Ollama und mit großen offenen Modellen aus der Cloud. Wir kennen den Unterschied zwischen einem beeindruckenden Benchmark und einem Modell, das im echten Projekt hält.

Der Punkt, an dem Teams scheitern, ist selten die Modellwahl. Es ist die Kette dahinter: Tests, die den generierten Code prüfen. Reviews, die jemand ernst nimmt. Eine CI Pipeline, die Fehler findet, bevor sie live gehen. Ohne das ist jedes Modell nur eine schnellere Art, Schulden aufzubauen.

Wo wir konkret helfen: bei der Einrichtung DSGVO konformer KI Infrastruktur, bei der Auswahl passender Vibe Coding Tools, im Vibe Coding Training für Teams, bei PHP Refactoring mit KI Unterstützung und im Frontend Development. Ein Überblick über unsere Werkzeuge steht unter NCA KI Tools.

CYPRESS.IO Ambassador und IT Consultant für QA Engenieering und Qualität in PHP Projekten.
NCA Vibe Coding Consulting

Roland Golla ist Entwickler aus Leidenschaft – seit über 20 Jahren. Er hat hunderte Projekte begleitet, von Legacy-Refactoring bis KI-Integration. Bei Vibe Coding verbindet er das Beste aus beiden Welten: Die Geschwindigkeit von KI-generiertem Code mit der Qualität professioneller Softwareentwicklung. Kein Bullshit, keine Agentur-Floskeln – direkte Hilfe von jemandem, der selbst täglich im Code steckt.

Häufige Fragen zu DeepSeek

Die wichtigsten Fragen zu DeepSeek V4.1 Flash, dem Wechsel der API Namen, DeepSeek Harness und dem DSGVO konformen Einsatz.
Was ist DeepSeek V4.1 Flash und seit wann gibt es das Modell 2026?

DeepSeek V4.1 Flash ist das aktuelle Modell von DeepSeek AI, offiziell gestartet im September 2026. Es ist ein multimodales Mixture of Experts Modell mit 552 Milliarden Backbone Parametern und einer Million Token Kontext. Es verarbeitet Bilder und Text nativ. Die Gewichte liegen offen auf Hugging Face unter MIT Lizenz.

Was ist mit DeepSeek V4-Pro und V4-Flash 2026 passiert?

Beide stammen aus der V4 Generation vom April 2026. V4-Flash ist abgelöst, der Modellname leitet vorübergehend auf V4.1 Flash weiter. Seit dem 14. September 2026 landen auch Anfragen an V4-Pro bei V4.1 Flash, bis DeepSeek V4.1 Pro veröffentlicht. Für neue Integrationen gilt der Name deepseek-flash.

Welche Rolle spielt DeepSeek Harness 2026 für V4.1 Flash?

DeepSeek Harness ist die offene Agent Runtime von DeepSeek. Version 0.1.5 ist auf V4.1 Flash abgestimmt, im Standard, PTC und Minimal Modus. DeepSeek misst seine Coding Benchmarks im Minimal Modus. Das Modell läuft laut DeepSeek aber auch in Claude Code, Codex, OpenCode und Pi mit wenigen Punkten Abstand.

Sind deepseek-chat und deepseek-reasoner 2026 noch nutzbar?

Nein. Beide API Namen wurden am 24. Juli 2026 endgültig abgeschaltet. Wer sie noch aufruft, bekommt keine Antwort mehr. Die V4 Namen deepseek-v4-flash und deepseek-v4-pro leiten aktuell auf V4.1 Flash weiter, der aktuelle Name ist deepseek-flash. Die base_url bleibt unverändert.

Ist DeepSeek 2026 DSGVO konform nutzbar?

Über die Cloud API und die Weboberfläche nicht. Daten gehen auf Server in China, es fehlen Auftragsverarbeitungsvertrag und EU Vertreter, mehrere deutsche Aufsichtsbehörden prüfen den Anbieter. Tragfähig ist eine gehostete Inferenz der offenen Gewichte bei einem europäischen Anbieter mit Vertrag, kombiniert mit lokalen Entwicklungsumgebungen ohne echte Daten.

Was unterscheidet V4.1 Flash von V4-Flash?

V4.1 Flash ist neu gebaut, nicht nur neu trainiert. Es hat 552 statt 284 Milliarden Backbone Parameter, aktiviert aber nur 8 Milliarden beim Einlesen und 16 beim Generieren. Neu sind native Bildverarbeitung, ein Causal Encoder Decoder Aufbau und ein KV Cache, der laut DeepSeek rund ein Viertel so groß ist.

Was bedeutet der stufenlose Reasoning Aufwand bei V4.1 Flash?

V4.1 Flash akzeptiert einen Reasoning Wert von 1 bis 100. Niedrige Werte liefern schnelle Antworten mit wenig Denkaufwand, hohe Werte mehr Genauigkeit bei mehr Rechenaufwand. DeepSeek misst seine Benchmarks mit dem Maximalwert 100. Für Agent Läufe lässt sich der Wert je Aufgabe passend wählen.

Was bedeutet ein Kontextfenster von einer Million Token in der Praxis?

Das Modell kann sehr große Codebasen am Stück lesen, statt sie in Häppchen zu bekommen. Cross File Reasoning über ganze Repositories wird damit realistisch. DeepSeek erreicht das über Sparse Attention und starke Kompression des KV Cache, was Rechenlast und Speicherbedarf bei langem Kontext senkt.

Kann ich DeepSeek V4.1 Flash lokal betreiben?

Die Gewichte stehen offen bereit, DeepSeek nennt vLLM und SGLang als Wege. Für eigene Hardware ist ein Modell mit 552 Milliarden Parametern trotzdem keine sinnvolle Option, der Aufwand rechnet sich für praktisch kein Team. Realistisch ist eine europäische Inferenz. Lokal laufen kompakte Modelle wie Qwen3 Coder über Ollama.

Was ist der Unterschied zwischen Ollama Cloud und lokalem Hosting?

Tags mit dem Suffix cloud laufen auf Ollama Infrastruktur, nicht auf dem eigenen Rechner. Der Prompt verlässt also das Netzwerk. Für DSGVO relevante Verarbeitung zählt nur echtes lokales Hosting kleiner Modelle oder eine Inferenz auf europäischer Infrastruktur, für die ein Vertrag existiert.

Sind DeepSeek R1 und Coder V2 noch eine Option?

Für neue Projekte nicht. R1 war Anfang 2025 der Durchbruch, Coder V2 lange das dedizierte Code Modell. Beide wurden von V3.2, V4 und jetzt V4.1 Flash abgelöst. Wer heute startet, sollte direkt mit V4.1 Flash arbeiten oder ein aktuelles offenes Konkurrenzmodell prüfen.

Wie verlässlich sind die Benchmark Angaben von DeepSeek?

Sie sind Herstellerangaben. Gemessen hat DeepSeek unter anderem im Minimal Modus der eigenen Harness, die inzwischen offen ist. Für DeepSWE liefert DeepSeek eine Anleitung zur Reproduktion mit. Bis unabhängige Labore nachmessen, bleiben die Zahlen plausibel, aber unbestätigt.

Welche Rolle spielt der chinesische Staat bei DeepSeek?

In der ersten Finanzierungsrunde investierte der staatliche National Artificial Intelligence Industry Investment Fund direkt, mit Stimmrechten und ohne Sperrfrist, während private Investoren über eine Partnership ohne Stimmrechte einstiegen. Für Unternehmen mit sensiblen Daten ist das ein relevanter Punkt in der Risikobewertung.