DeepSeek-V4.1-Flash má 552 miliard parametrů, při práci ale aktivuje jen 8 až 16 miliard
DeepSeek-V4.1-Flash využívá 552miliardový MoE model, ale při inferenci aktivuje jen 8 až 16 miliard parametrů. Firma uvádí i výrazně menší nároky na KV cache.
DeepSeek sice uvedl model V4.1-Flash, který kombinuje 552 miliard parametrů v architektuře Mixture of Experts (MoE), ale s výrazně nižším počtem parametrů aktivních při samotném zpracování dotazu. Při vstupu model používá 8 miliard aktivních parametrů, při generování odpovědi 16 miliard. Firma tím ukazuje směr, jak stavět velké jazykové modely s nižšími nároky na výpočetní infrastrukturu.
V4.1-Flash je podle DeepSeeku nejmenším modelem nové architekturní rodiny. Vedle práce s textem má nativní podporu multimodálních vstupů, včetně porozumění obrazu. Model je již dostupný přes rozhraní DeepSeek API.
Velký model nemusí zapojit všechny parametry
Označení 552 miliard parametrů vyjadřuje celkovou velikost modelu, ne rozsah výpočtu nutného pro každý požadavek. MoE architektura rozděluje model na specializované části a pro konkrétní úlohu aktivuje jen část z nich. DeepSeek u V4.1-Flash uvádí 8 miliard aktivních parametrů pro zpracování vstupu a 16 miliard při vytváření výstupu.
Právě rozdíl mezi vstupní a výstupní fází patří k hlavním rysům nové architektury, kterou firma nazývá Causal Encoder–Decoder. Při práci s dlouhým zadáním nebo rozsáhlým kontextem může být levnější vstupní část podstatná: model nejprve musí přečíst a vyhodnotit text, dokument či obrazový vstup a teprve poté postupně generuje odpověď. Vyšší počet aktivních parametrů pro výstup má podle zvoleného návrhu směřovat výpočetní kapacitu do fáze, kde model formulaci odpovědi skutečně vytváří.
Takové rozdělení může být relevantní pro provozovatele AI služeb i firmy, které modely nasazují ve vlastním prostředí. Náklady na velké modely neurčuje jen počet parametrů uvedený ve specifikaci, ale také počet parametrů zapojených při inferenci, propustnost systému a objem paměti potřebný pro obsluhu souběžných požadavků.
Čtvrtinové nároky na HBM pro KV cache
DeepSeek také uvádí, že KV cache (Key-Value cache) modelu V4.1-Flash potřebuje oproti předchozí generaci jen čtvrtinu paměti HBM a osminu prostoru na SSD. KV cache uchovává mezivýsledky z dosud zpracovaného kontextu, aby model při generování další části odpovědi nemusel opakovaně přepočítávat celý vstup.
Požadavky na tuto cache rostou zejména při delších kontextech a vyšším počtu souběžně obsluhovaných uživatelů. Nižší paměťová stopa proto může zvýšit počet požadavků, které obslouží stejná infrastruktura, nebo omezit potřebnou kapacitu akcelerátorů a úložišť.
>>> Číst a vkládat komentáře <<<