Code Needle: el test que destapa les al·lucinacions dels LLM locals en codi
Alex Ziskind crea un benchmark de recuperació literal sobre codi real. La dada reveladora no és només quantes línies encerta cada model, sinó quantes se n’inventa.
Canal original
Alex Ziskind publica en anglès proves de maquinari, models locals, eines de programació amb IA i fluxos de treball per a desenvolupadors.
Visita el canalArxiu del canal
Alex Ziskind crea un benchmark de recuperació literal sobre codi real. La dada reveladora no és només quantes línies encerta cada model, sinó quantes se n’inventa.
NVIDIA porta RTX Spark a portàtils Windows amb fins a 128 GB unificats i CUDA. Alex Ziskind n'analitza el públic, els dubtes i el preu encara obert.
Alex Ziskind explica tres mesos de proves amb quatre equips Strix Halo. El coll d’ampolla no era l’amplada de banda: calien paral·lelisme tensorial, RDMA i un entorn ROCm compatible.
La prova del Beelink SER10 Max mesura CPU, compilació i IA local: Gorgon Point s’acosta a l’M4 Pro, però els resultats depenen molt del programari.
Una comparació de Wan 2.2 i LTX-2.3 mostra que Q4 sol ser el punt dolç, Q8 pot superar FP8 i l’àudio es degrada abans que la imatge.
Tres ASUS NUC 16 Pro reparteixen un Llama 3.3 70B i comparen CPU, GPU, NPU, Ethernet i Thunderbolt. El clúster suma memòria, però no sempre velocitat.
Alex Ziskind connecta dos AMD Ryzen AI Halo per executar models de fins a 397.000 milions de paràmetres. La prova compara la simplicitat de llama.cpp RPC amb el millor escalat de vLLM i RCCL.