Claude Opus 4.8 en una prova real: millora o decepció?
midudev prova Opus 4.8 construint una app de subtítols: funciona, però no hi veu un salt clar i alerta sobre costos i workflows automàtics.
Tema
Resums de vídeos per entendre millor aquest tema.
midudev prova Opus 4.8 construint una app de subtítols: funciona, però no hi veu un salt clar i alerta sobre costos i workflows automàtics.
Pat Simmons compara Fable 5 i Opus 4.8 amb una botiga, un museu 3D i un joc d'estratègia. Fable guanya les tres proves, però costa més.
Two Minute Papers analitza la System Card d’Opus 4.8: menys afirmacions falses, més diligència amb el codi i límits en les avaluacions.
Bijan Bowen sotmet Claude Opus 4.8 a jocs, webs, animacions i simulacions 3D. Dos resultats són extraordinaris, però la resta mostren molta irregularitat.
GLM-5.2 i Claude Opus 4.8 creen un cub de Rubik i un joc 3D. Comparem funcionalitat, acabat visual, preu i els límits de la prova.
Pat Simmons compara Kimi K3 amb GPT-5.6 Sol, Claude Opus 4.8, GLM 5.2 i Kimi K2.7 en deu tasques de codi i treball creatiu. K3 guanya en 3D i gràfics animats, però falla en controls, àudio i textos comercials. És un salt enorme respecte de K2.7, no un vencedor universal.
Fable 5 construeix una app visualment més completa que Opus 4.8 en una demo patrocinada. Expliquem el flux real, què falta per validar i per què no és un benchmark.