Tema

Mixture of Experts

Resums de vídeos per entendre millor aquest tema.

Intel·ligència artificial 27 de jul. 2026

Colibrì executa GLM‑5.2 de 744B sense GPU: com funciona i per què 25 GB de RAM no expliquen tota la història

Fahd Mirza prova Colibrì, un motor en C que manté la part densa de GLM‑5.2 a la RAM i carrega experts MoE des d’un SSD. Això permet iniciar un model gegant sense GPU, però no elimina els 372 GB de pesos ni el coll d’ampolla del disc: a la demostració, la velocitat passa de 0,03 a 0,15 tokens per segon quan s’escalfa la memòria cau.

Intel·ligència artificial 27 de jul. 2026

Inkling, el model obert de gairebé un bilió de paràmetres: no impressiona en codi visual, però apunta a l’empresa

Bijan Bowen prova Inkling, el primer gran model de Thinking Machines Lab: 975.000 milions de paràmetres totals, 41.000 milions d’actius, pesos Apache 2.0 i entrada de text, imatge i àudio. Les demos de codi queden lluny dels millors rivals, però la personalització i el desplegament empresarial són la seva aposta real.