DeepSeek pokazało model V4.1-Flash i wygląda na to, że nie chodzi wyłącznie o kolejną wariację nazwy. Według zapowiedzi z 10 września 2026 nowy model ma zużywać mniej pamięci, wypadać lepiej od V4-Pro i stopniowo przejąć jego miejsce w API.
TL;DR
- 552B-parametrowy MoE z nową architekturą Causal Encoder–Decoder
- Tylko 8B aktywnych parametrów na wejściu i 16B na wyjściu
- KV cache 4x mniejszy w HBM i 8x w SSD niż poprzednia generacja
- V4-Pro będzie przekierowywany na V4.1-Flash od 14 września
- Nowe ceny API obowiązują od 10 września 2026
Co DeepSeek zmieniło w V4.1-Flash?
DeepSeek opisuje V4.1-Flash jako model o wielkości 552 mld parametrów w architekturze Mixture-of-Experts. Najważniejsza zmiana to nowa architektura Causal Encoder–Decoder: na wejściu aktywuje się 8 mld parametrów, a na wyjściu 16 mld.
Według oficjalnego wpisu firmy z 10 września 2026 model dostał też natywne rozumienie obrazu. DeepSeek twierdzi również, że po zmianach w pretreningu i większej skali RL po treningu V4.1-Flash osiąga lepsze wyniki niż wcześniejsze modele firmy, w tym V4-Pro.
🚀 Introducing DeepSeek-V4.1-Flash: smarter, faster, more efficient.
🔹 Introducing the smallest model in our new architecture family, with native visual understanding.
🔹 Designed for greater capability, faster inference, higher throughput, and scaling to larger models.1/6 pic.twitter.com/wxJGiyX56o
— DeepSeek (@deepseek_ai) September 10, 2026
Jak DeepSeek liczy oszczędności pamięci i kosztów?
Najmocniejszy argument DeepSeek dotyczy pamięci. Firma podaje, że V4.1-Flash potrzebuje 4x mniejszego KV cache w HBM i 8x mniej miejsca na SSD niż poprzednia generacja.
To ma znaczenie głównie dla wdrożeń agentowych i długich sesji, gdzie koszt przechowywania kontekstu szybko zaczyna boleć bardziej niż sam token. DeepSeek od 10 września 2026 stosuje też nowe ceny API i zostawia podział na peak oraz off-peak, przy czym stawka off-peak ma wynosić połowę ceny peak. W praktyce dla części zespołów to może być ważniejsze niż same benchmarki, także przy rozliczeniach w złotówkach po stronie polskich firm korzystających z API.
Kiedy V4-Pro zniknie z API DeepSeek?
DeepSeek wycofuje V4-Flash oraz V4-Flash-Vision-Exp. Dla zachowania kompatybilności zapytania kierowane do deepseek-v4-flash są tymczasowo obsługiwane przez V4.1-Flash.
Firma podała też konkretny termin dla V4-Pro: od 4:00 UTC 14 września 2026 wszystkie zapytania do tego modelu będą automatycznie przekierowywane na V4.1-Flash i rozliczane według jego cennika. To ważne dla zespołów, które mają sztywno wpisane nazwy modeli w aplikacjach, bo migracja częściowo wydarzy się za nich.
Gdzie V4.1-Flash jest już dostępny?
DeepSeek podaje, że V4.1-Flash wspierają już partnerzy WorkBuddy, w tym CodeBuddy, oraz OpenCode. Model ma być też dostępny na Hugging Face razem z raportem technicznym, więc zainteresowani mogą od razu sprawdzić, jak firma opisuje jego budowę i wyniki.
To zresztą najciekawszy fragment całej zapowiedzi: nie sam benchmark, ale to, że DeepSeek próbuje przepchnąć nowy model jako domyślną opcję w swoim ekosystemie. Jeśli deklaracje o pamięci i kosztach utrzymają się w praktyce, V4.1-Flash może po prostu okazać się wygodniejszym wyborem niż V4-Pro.
