DeepSeek V4 comprimeix el context: així funcionen CSA i HCA
DeepSeek V4 combina compressió temporal, selecció dispersa i resums globals per treballar amb un milió de tokens reduint dràsticament la memòria cau KV.
Canal original
Jia-Bin Huang publica explicacions visuals sobre aprenentatge automàtic, visió per computador i l’arquitectura dels models d’intel·ligència artificial.
Visita el canalArxiu del canal
DeepSeek V4 combina compressió temporal, selecció dispersa i resums globals per treballar amb un milió de tokens reduint dràsticament la memòria cau KV.