Qwen3.6 35B-A3B resol en local un crawler LTE que Gemma 4 no va poder completar
Una prova de gairebé quatre hores obliga Qwen3.6 a reconstruir el login d’un mòdem des de JavaScript minificat i extreure mètriques de ràdio en temps real.
Tema
Resums de vídeos per entendre millor aquest tema.
Una prova de gairebé quatre hores obliga Qwen3.6 a reconstruir el login d’un mòdem des de JavaScript minificat i extreure mètriques de ràdio en temps real.
Nemotron 3 combina Mamba-2, atenció, LatentMoE i predicció de diversos tokens per adaptar Nano, Super i Ultra a diferents GPU.
Una prova pràctica de LFM2.5-8B-A1B mostra un model local molt ràpid i capaç amb eines, però irregular en codi, coneixement i planificació.
Fahd Mirza prova Colibrì, un motor en C que manté la part densa de GLM‑5.2 a la RAM i carrega experts MoE des d’un SSD. Això permet iniciar un model gegant sense GPU, però no elimina els 372 GB de pesos ni el coll d’ampolla del disc: a la demostració, la velocitat passa de 0,03 a 0,15 tokens per segon quan s’escalfa la memòria cau.
Bijan Bowen prova Inkling, el primer gran model de Thinking Machines Lab: 975.000 milions de paràmetres totals, 41.000 milions d’actius, pesos Apache 2.0 i entrada de text, imatge i àudio. Les demos de codi queden lluny dels millors rivals, però la personalització i el desplegament empresarial són la seva aposta real.
Kimi K3 activa només 16 de 896 experts per token. Expliquem Stable LatentMoE, Kimi Delta Attention, Attention Residuals i els colls d’ampolla reals.