Der chinesische KI-Entwickler DeepSeek hat sein neues Flaggschiff-Modell V4-Flash veröffentlicht. Es verspricht deutlich schnellere Antwortzeiten bei geringeren Kosten – und könnte den Wettbewerb im KI-Markt weiter anheizen.
Berlin – DeepSeek hat am 31. Juli die Produktionsversion seines Modells V4-Flash-0731 unter der offenen MIT-Lizenz veröffentlicht. Für europäische Unternehmen und Entwickler ist das relevant: Das Modell verspricht eine kostengünstige Alternative zu US-Anbietern wie OpenAI oder Anthropic zu sein. Die Architektur setzt auf ein Mixture-of-Experts-Design (MoE), das für hohe Geschwindigkeit und Produktionslasten optimiert wurde.
Schnelle Architektur mit 284 Milliarden Parametern
Das Modell verfügt über insgesamt 284 Milliarden Parameter, von denen pro Token 13 Milliarden aktiv sind. Inklusive des DSpark-Moduls kommen 304 Milliarden zusammen. Der Kontextfenster umfasst eine Million Token, die maximale Ausgabe liegt bei 384.000 Token.
Erste Tests zeigen deutliche Leistungssteigerungen auf High-End-Hardware. Auf einem Cluster mit vier NVIDIA-B200-GPUs erreichte das Modell eine 2,98-fache Beschleunigung – ohne Qualitätsverluste. Auch auf zwei RTX-PRO-6000-Blackwell-GPUs mit 96 GB VRAM überzeugte die Coding-Leistung dank Tensor Parallelism.
Für den lokalen Betrieb variieren die Anforderungen je nach Quantisierungsstufe. Während einige Konfigurationen auf einem Mac mit 128 GB RAM laufen, empfehlen Branchenbeobachter mindestens 156 GB für optimale Performance. Wer professionell hosten will, sollte auf vier GB300-GPUs setzen.
Wer im Unternehmen innovative KI-Systeme wie DeepSeek einsetzt oder entwickelt, muss die rechtlichen Rahmenbedingungen der EU kennen. Dieser kostenlose Umsetzungsleitfaden bietet einen kompakten Überblick über alle Anforderungen, Pflichten und Fristen des AI Acts. EU AI Act in 5 Schritten verstehen: Fristen, Pflichten und Risikoklassen kompakt erklärt
DSpark-Modul: Bis zu 85 Prozent schneller
Das Herzstück der Geschwindigkeitsoptimierung ist das DSpark-Modul, das spekulatives Decoding ermöglicht. Es nutzt semi-autoregressive Generierung und eine konfidenzbasierte Verifikation. Laut DeepSeek steigert DSpark die Generierungsgeschwindigkeit um 60 bis 85 Prozent.
Allerdings: In vielen Downloads ist das Modul standardmäßig deaktiviert, um Speicher zu sparen. In lokalen Tests auf einem Mac Studio erhöhte die Aktivierung den Durchsatz von 23,1 auf 34,5 Token pro Sekunde – ein Plus von 49 Prozent. Der Preis dafür: rund 10 GB zusätzlicher Arbeitsspeicher.
Effizientes Speichermanagement durch Quantisierung
Das Modell unterstützt nativ FP4- und FP8-Quantisierung. Die Technologien Cross-System Attention (CSA) und Hybrid-Cache Attention (HCA) reduzieren den KV-Cache-Bedarf um bis zu 90 Prozent. Ein Kontext von einer Million Token belegt so nur etwa 6 GB VRAM bei FP8-Cache.
Experten warnen jedoch vor typischen Optimierungsfehlern: Integer-Quantisierung wie 8-Bit könne zu erhöhter Perplexität und Genauigkeitsverlusten führen. Für lokale Installationen stehen GGUF-Stufen von 2-Bit (102 GB) bis 8-Bit (162 GB) bereit.
Die rasante Entwicklung bei KI-Modellen führt auch zu neuen regulatorischen Anforderungen an die Dokumentation und Risikobewertung in Firmen. Erfahren Sie in diesem kostenlosen Report, welche Systeme als Hochrisiko gelten und wie Sie die Compliance-Vorgaben rechtssicher erfüllen. Welche KI-Systeme gelten als Hochrisiko – und was müssen Unternehmen jetzt konkret tun?
Preis-Leistungs-Verhältnis: Deutlich günstiger als Konkurrenz
Nach der Veröffentlichung gilt V4-Flash als eines der kosteneffizientesten großen KI-Modelle. Die API-Preise liegen bei 0,14 US-Dollar pro Million Input-Token und 0,28 US-Dollar pro Million Output-Token. Besonders günstig: gecachte Token kosten nur 0,0028 US-Dollar pro Million. Branchenanalysten sehen die Kosten deutlich unter denen von Konkurrenzmodellen wie GPT-5.6 Sol oder Claude Fable 5.
In Benchmarks zeigt das Modell starke Fortschritte bei Agenten-Fähigkeiten. Im Terminal-Bench-2.1 erreicht es 82,7 Punkte – eine deutliche Steigerung gegenüber den 61,8 Punkten der Preview-Version. Beim DeepSWE-Benchmark kletterte der Wert von 7,3 auf 54,4. Der Intelligence Index liegt bei 50, was dem Niveau von Gemini 3.6 Flash entspricht.

