DeepSeek V4 comprimeix el context: així funcionen CSA i HCA
DeepSeek V4 combina compressió temporal, selecció dispersa i resums globals per treballar amb un milió de tokens reduint dràsticament la memòria cau KV.
DeepSeek V4 admet un context d’un milió de tokens sense pagar el cost complet de comparar cada token amb tots els anteriors a totes les capes. La clau és una arquitectura híbrida que alterna dos mecanismes: Compressed Sparse Attention (CSA), que conserva detall seleccionant fragments rellevants, i Heavily Compressed Attention (HCA), que manté una vista global molt resumida.
El vídeo de Jia-Bin Huang ho explica des de l’atenció convencional fins a l’arquitectura final. El seu títol parla d’un 98% menys de memòria, però aquesta xifra necessita una referència concreta. L’informe oficial diu que DeepSeek-V4-Pro, amb un milió de tokens, utilitza el 10% de la memòria cau KV i el 27% dels FLOP d’inferència d’un sol token respecte de DeepSeek-V3.2: és a dir, un 90% menys de KV cache en aquesta comparació.
Per què el context llarg consumeix tanta memòria
En una capa d’atenció, cada estat ocult es projecta en tres vectors: consulta, clau i valor. La similitud entre la consulta del token actual i les claus anteriors produeix uns pesos; la suma ponderada dels valors incorpora el context a la representació.
Durant la generació no cal recalcular totes les claus i els valors, però sí conservar-los a la memòria cau KV. En atenció multi-head, el consum creix amb la longitud de la seqüència, el nombre de capes, el nombre de caps, la dimensió de cada cap i els bytes de precisió. Amb centenars de milers o milions de tokens, la cache pot convertir-se en el principal límit d’inferència.
Multi-Query Attention redueix molt aquest cost compartint una sola clau i un sol valor entre tots els caps de consulta. En l’exemple del vídeo, passar de 128 caps KV a un dona una reducció de 128 vegades per token. El preu és perdre capacitat per representar relacions diferents. GQA comparteix per grups i MLA comprimeix en un espai latent, però continuen actuant principalment sobre la dimensió dels caps.
DeepSeek comprimeix la dimensió temporal
V4 canvia la pregunta: en lloc de desar una entrada KV completa per cada posició, podem resumir diversos tokens en una sola entrada? Primer projecta l’estat ocult, de milers de dimensions, a un vector KV compartit de 512 dimensions.
Una mitjana simple de quatre tokens reduiria la longitud quatre vegades, però podria diluir el token més informatiu. El compressor aprèn, per tant, un pes dependent del contingut. Calcula puntuacions, hi aplica una funció softmax i produeix una suma ponderada.
El mecanisme encara és més fi: no assigna només un pes global a cada token, sinó pesos diferents per a cadascuna de les 512 dimensions. Una paraula pot aportar una característica semàntica i una altra, una característica posicional o sintàctica. El resum pot retenir parts diferents de cada vector.
Finestres solapades per evitar fronteres artificials
Si els grups fossin blocs independents de quatre tokens, el resultat dependria massa del punt on comença cada bloc. Una idea repartida entre el final d’un grup i l’inici del següent quedaria separada.
El compressor utilitza finestres solapades. Cada entrada pot contribuir a més d’un resum i la transició entre grups és més suau. Les ponderacions es tornen a calcular dins de cada finestra, de manera que una dada important no desapareix només perquè queda a la frontera.
En la branca CSA, aquesta compressió és moderada: quatre posicions es converteixen en una entrada. Els tokens més recents, que encara no formen un bloc complet, es mantenen en una finestra local sense comprimir. Així el model disposa de precisió immediata i d’un historial més compacte.
CSA: buscar primer i atendre després
Comprimir a una quarta part no elimina el cost d’examinar un milió de tokens. Cada consulta encara tindria centenars de milers d’entrades resumides. DeepSeek Sparse Attention hi afegeix un indexador lleuger que puntua les entrades comprimides i en selecciona només les més rellevants.
L’atenció completa s’executa sobre els blocs escollits i la finestra local, no sobre tot l’historial. Aquesta combinació rep el nom de Compressed Sparse Attention. La cerca dispersa abarateix el càlcul, mentre la compressió redueix tant la cache com l’espai que ha de rastrejar l’indexador.
El disseny incorpora normalització de consultes i entrades comprimides per estabilitzar els logits, codificació posicional rotatòria en una part dels vectors i attention sink logits: entrades apreses capaces d’absorbir massa d’atenció que, altrament, es concentraria de manera problemàtica.
Projeccions de rang baix per contenir els paràmetres
Els vectors de 512 dimensions per cap són més amples que els 128 habituals. Projectar directament l’estat ocult a tots els caps crearia una matriu de consultes enorme. V4 la factoritza en una projecció descendent cap a un latent més petit i una projecció ascendent cap a les consultes finals.
Segons el desglossament del vídeo, aquesta aproximació de rang baix necessita prop del 15,8% dels paràmetres de la matriu completa. La projecció de sortida pateix un problema semblant. El model divideix els caps en grups, redueix cadascun i torna a projectar el conjunt, amb aproximadament el 14,3% dels paràmetres d’una sortida densa equivalent.
Aquests percentatges descriuen dues matrius concretes, no la memòria total del model. Tampoc s’han de confondre amb la reducció oficial de la KV cache.
HCA: un resum global 128 vegades més curt
Heavily Compressed Attention és la segona peça. Resumeix cada 128 tokens en una sola entrada. Com que la seqüència resultant és molt curta, totes les consultes poden atendre densament tots els resums sense un indexador dispers.
HCA sacrifica resolució per donar una panoràmica barata de tot el document. CSA conserva detalls i recupera blocs específics. Juntes ofereixen dues escales de memòria: una de global i molt comprimida i una altra de selectiva amb més fidelitat.
En DeepSeek-V4-Pro, les primeres capes utilitzen HCA per barrejar informació llunyana des del principi. La part central alterna HCA i CSA, refinant repetidament resum global i detalls seleccionats. Una capa final d’atenció completa reintegra la representació a resolució de token abans de calcular la sortida.
Dos models, un milió de tokens
La versió Preview inclou DeepSeek-V4-Pro, amb 1,6 bilions de paràmetres totals i 49.000 milions d’actius, i DeepSeek-V4-Flash, amb 284.000 milions totals i 13.000 milions d’actius. Tots dos són models Mixture of Experts, admeten un milió de tokens i tenen pesos oberts sota llicència MIT.
Un context admès no és el mateix que memòria perfecta. La compressió és una transformació amb pèrdua, l’indexador pot no seleccionar el bloc correcte i les proves de recuperació no representen totes les tasques. L’arquitectura intenta compensar-ho amb solapament, escala local, resums globals i atenció final, però no pot garantir que cada detall d’un milió de tokens influeixi igual.
Què significa realment l’estalvi
La innovació no és una única reducció màgica del 98%, sinó una cadena de decisions: compartir KV, projectar a 512 dimensions, agrupar tokens, aprendre pesos per dimensió, solapar finestres, seleccionar blocs i alternar dos nivells de compressió.
El resultat oficial més fàcil de comparar és el de V4-Pro contra V3.2 a un milió de tokens: una desena part de memòria KV i una mica més d’una quarta part del càlcul per al token següent. És prou gran per canviar el cost del context llarg, però no fa gratuïta la inferència ni elimina les pèrdues de compressió.
DeepSeek V4 mostra una direcció clara: perquè els models llegeixin repositoris, historials i documents immensos, no n’hi ha prou d’ampliar la finestra. Cal decidir quina informació es desa exactament, quina es resumeix i quina mereix tornar a ser llegida amb tota la resolució.
Contrast i context
Fonts consultades
-
01
Jia-Bin Huang DeepSeek V4’s Secret: 98% Less Memory
- 02
- 03
-
04
Hugging Face Transformers Implementació i documentació de DeepSeek V4
Font de treball
Transcripció amb marques de temps
Consulta la transcripció
-
0:00
, obre el vídeo en una pestanya nova
DeepSeek V4's main architectural story is long-context efficiency. Standard attention projects hidden states into query, key and value vectors, computes similarity weights and adds a contextual residual, but inference memory grows linearly because previous keys and values must remain cached.
-
1:44
, obre el vídeo en una pestanya nova
Multi-head attention learns different token relationships with many query, key and value heads. Its KV cache cost multiplies head dimension, precision, heads, layers and sequence length. Multi-query attention shares one KV head across all query heads, dramatically reducing memory.
-
3:28
, obre el vídeo en una pestanya nova
Sharing all keys and values can reduce quality, inspiring GQA and MLA. DeepSeek V4 instead also compresses along sequence length. Each hidden state is projected into a 512-dimensional KV entry, and groups of entries are combined to shorten the cached sequence.
-
5:12
, obre el vídeo en una pestanya nova
A simple average could dilute an important token. The compressor learns content-dependent softmax weights, first conceptually as a scalar per token and then separately for every dimension. This lets different tokens contribute different features to the compressed entry.
-
6:56
, obre el vídeo en una pestanya nova
Non-overlapping groups create arbitrary boundaries. The token-level compressor therefore uses overlapping windows, allowing each KV vector to contribute to neighboring compressed entries and preserving information that spans the edge of a group.
-
8:40
, obre el vídeo en una pestanya nova
Compressed Sparse Attention begins with shared KV entries and applies four-to-one sequence compression. Queries attend to a local window plus selected compressed history. The architecture also has to manage unusually wide 512-dimensional vectors per head.
-
10:24
, obre el vídeo en una pestanya nova
Low-rank down and up projections reduce the large query matrix to about 15.8 percent of a full projection. A grouped output projection performs a similar factorization for the attention result, using about 14.3 percent of the corresponding full matrix's parameters.
-
12:08
, obre el vídeo en una pestanya nova
Even a four-times shorter history would be expensive if every query scanned it all. DeepSeek Sparse Attention uses a lightweight indexer to score compressed entries and choose the most relevant ones for full attention, producing CSA.
-
13:52
, obre el vídeo en una pestanya nova
CSA retains recent uncompressed tokens in a local window and adds normalization, partial rotary position embeddings and learned attention sinks for stability. Heavily Compressed Attention takes a complementary approach, summarizing every 128 tokens and attending densely to the much shorter result.
-
15:36
, obre el vídeo en una pestanya nova
DeepSeek V4 alternates HCA's broad global summaries with CSA's focused higher-resolution retrieval. Early layers establish global context, middle layers move between the two scales, and final full attention restores token-level precision for the output.