Code Needle: el test que destapa les al·lucinacions dels LLM locals en codi
Alex Ziskind crea un benchmark de recuperació literal sobre codi real. La dada reveladora no és només quantes línies encerta cada model, sinó quantes se n’inventa.
Tema
Resums de vídeos per entendre millor aquest tema.
Alex Ziskind crea un benchmark de recuperació literal sobre codi real. La dada reveladora no és només quantes línies encerta cada model, sinó quantes se n’inventa.
Guia per comprovar la VRAM, instal·lar Ollama, descarregar Qwen i usar un model local amb agents de programació sense saturar el PC.
Bijan Bowen prova Ornith 1.0 en versions de 9B i 35B amb webs, escenes 3D i correccions agentives. El 35B MoE crea els resultats més atractius, però tots dos deixen errors funcionals i la comparació utilitza maquinari i precisions diferents.
Midudev analitza la possibilitat que Pequín limiti l’accés exterior als models xinesos més avançats. Les converses reguladores existeixen segons Reuters, però no hi ha un tancament general aprovat: el debat barreja pesos oberts, llicències comercials, exportació, inversió estrangera i sobirania tecnològica.
Monolith 1.0 afirmava tenir 1,57 bilions de paràmetres i superar GPT‑5.6. El seu propi repositori admet ara que els pesos inflaven un model de 7B.
Una prova pràctica de Qwen3.8 Max Preview mostra un gran frontend, però resultats febles en C++, CAD, microcontroladors i coherència espacial.