Claude Opus 4.8 en una prova real: millora o decepció?
midudev prova Opus 4.8 construint una app de subtítols: funciona, però no hi veu un salt clar i alerta sobre costos i workflows automàtics.
midudev prova Claude Opus 4.8 en un projecte real i arriba a una conclusió més freda que Anthropic: funciona bé, però no detecta un salt clar respecte d’Opus 4.7. La demostració separa els benchmarks, les funcions noves i l’experiència de desenvolupar una aplicació.
El projecte és una eina local per generar i editar subtítols amb Whisper i WebGPU. Opus 4.8 l’ajuda, però algunes parts requereixen canvis manuals i el creador alterna Visual Studio Code amb Cursor. No és una comparació científica, sinó una prova de treball amb potencial i friccions.
1. Què anunciava Anthropic amb Opus 4.8
A 00:00, midudev repassa el llançament del 28 de maig de 2026. En aquell moment, Opus 4.8 passava a ser el model públic més potent d’Anthropic, per davant d’Opus 4.7, mentre el model Mythos encara era una previsualització restringida.
La presentació oficial de Claude Opus 4.8 el descriu com una millora en programació, tasques amb agents i treball professional. També incorpora control d’esforç a Claude.ai, un mode ràpid a 2,5 vegades la velocitat normal i els anomenats dynamic workflows a Claude Code.
A 01:05, el vídeo assenyala que qui vulgui comprovar els detalls pot consultar una System Card de més de 240 pàgines. Aquesta documentació és important perquè la taula promocional només resumeix les puntuacions. El Claude Opus 4.8 System Card descriu protocols, resultats de seguretat i limitacions que no caben en un gràfic.
midudev manté distància amb els benchmarks. A 02:03, observa que Opus 4.8 supera el predecessor en les proves publicades, però recorda que una puntuació agregada no explica si el model entendrà millor les instruccions d’un projecte concret.
2. L’honestedat és la millora més interessant
La novetat que més li crida l’atenció apareix a 02:59: Anthropic afirma que el model reconeix millor quan no sap resoldre una tasca. És una capacitat pràctica. Un agent que anuncia que ha corregit un error quan les proves encara fallen pot fer perdre més temps que un model menys brillant que exposa el bloqueig.
Anthropic informa que Opus 4.8 és aproximadament quatre vegades menys propens que Opus 4.7 a deixar sense comentar defectes del codi que ell mateix ha escrit. Aquesta formulació té límits: no significa que sigui quatre vegades més honest en qualsevol situació ni que els errors hagin desaparegut. És el resultat d’un conjunt d’avaluacions definit.
A 03:54, el vídeo també mostra una baixada en comportaments desalineats i una puntuació pròxima a Mythos Preview. midudev ho interpreta positivament, però no ho confon amb la seva prova posterior. Una mètrica de seguretat i l’experiència d’implementar una funció amb Web Workers mesuren problemes diferents.
La lliçó és que l’honestedat no es comprova només pel to de la resposta. En programació cal contrastar afirmacions amb el repositori, executar proves, revisar el diff i demanar al model que identifiqui què no ha pogut validar.
3. Dynamic workflows: centenars d’agents i una activació polèmica
A 04:49, midudev explica els dynamic workflows. Claude Code pot dividir una tasca de gran escala en fases, crear scripts i coordinar centenars de subagents en paral·lel. Anthropic els presenta per a migracions de bases de codi enormes, amb verificació final mitjançant les proves existents.
El problema inicial, segons els exemples recollits al vídeo, era l’activació massa fàcil. Escriure la paraula workflow en una petició podia iniciar aquest mode encara que l’usuari només parlés d’un workflow de GitHub. A 05:44, es mostren queixes de persones que veien aparèixer desenes d’agents i un consum sobtat de tokens.
Quan midudev grava, ja existeix una manera de desactivar la funció a la configuració. La seva crítica és de disseny: una capacitat cara i orientada a casos excepcionals hauria d’exigir una acció explícita, no dependre d’una paraula habitual. Una migració completa pot justificar 35 agents; una consulta ordinària, no.
A 06:32, el creador defensa que el mode estigui apagat per defecte o que s’activi amb una ordre inequívoca. La qüestió no és només econòmica. Més agents també impliquen més canvis simultanis, més superfície de revisió i més risc que una decisió incorrecta es repliqui.
4. Preus estables, però el pressupost continua important
Opus 4.8 conserva el preu normal del predecessor: 5 dòlars per milió de tokens d’entrada i 25 per milió de sortida. A 07:21, midudev considera positiu que el llançament no comporti una pujada. El mode ràpid costa 10 dòlars d’entrada i 50 de sortida, el doble de la tarifa normal.
El control d’esforç ofereix un altre eix. Anthropic recomana l’esforç alt com a equilibri general i permet nivells superiors per a tasques difícils. Això obliga a comparar models amb el mateix pressupost: un resultat millor després de gastar molts més tokens no equival necessàriament a una arquitectura més eficient.
A 08:19, la prova de midudev revela una dificultat quotidiana: Visual Studio Code expressa el cost en crèdits, no directament en multiplicadors o euros. Per a l’usuari és difícil anticipar la despesa real si desconeix com la plataforma converteix crèdits, tokens i tarifes del proveïdor.
5. La prova real: una aplicació de subtítols amb IA local
A 09:36, midudev dona el seu veredicte inicial: no ha percebut cap millora substancial respecte d’Opus 4.7 i, en algunes converses, li ha costat més fer-se entendre. Admet, però, que no pot separar completament el comportament del model del de la integració de Visual Studio Code.
La comparació amb Cursor reforça aquesta incertesa. A 10:10, diu que Cursor li ha ofert una experiència millor i que a Visual Studio Code alguns canvis quedaven sobreescrits. Això demostra per què «quin model és millor?» sovint és una pregunta incompleta: el gestor de context, les eines i la manera d’aplicar modificacions poden canviar el resultat.
L’aplicació que construeix, presentada a 10:59, detecta l’àudio, transcriu localment amb Whisper i WebGPU, permet editar el text i personalitzar mida, negreta, fons i posició. També incorpora desfer i refer canvis, ajustar la durada de cada subtítol i exportar el vídeo.
El projecte acaba funcionant, però la part relacionada amb Web Workers necessita intervenció manual. A 11:46, aquesta limitació serveix com a prova més valuosa que una demostració perfecta: Opus accelera una aplicació completa, però encara exigeix coneixement tècnic per diagnosticar els punts on s’encalla.
Conclusions
A 12:35, midudev aprova Claude Opus 4.8, però no el considera un salt qualitatiu. Valora el manteniment dels preus i la capacitat general, alhora que conserva dubtes sobre la comprensió d’instruccions en la seva sessió.
La prova no refuta els benchmarks d’Anthropic: simplement mesura una altra cosa. Les avaluacions agregades indiquen millores mitjanes; un projecte individual exposa friccions d’integració, cost, context i eines. Totes dues evidències són útils si no s’extrapolen més enllà del que poden demostrar.
El balanç més prudent és que Opus 4.8 és una actualització incremental amb una promesa rellevant d’honestedat, més control d’esforç i capacitat d’orquestració extrema. Per a midudev, però, el guany real no apareix automàticament: depèn de l’editor, del pressupost, de la supervisió i de la mena de problema que s’intenta resoldre.
Contrast i context
Fonts consultades
-
01
midudev Opus 4.8 no era lo que esperaba
-
02
Anthropic Introducing Claude Opus 4.8
-
03
Anthropic Claude Opus 4.8 System Card
Font de treball
Transcripció amb marques de temps
Consulta la transcripció
-
0:00
, obre el vídeo en una pestanya nova
más noticias, mejores noticias o no tan buenas noticias, no lo sé, cómo lo quieren ver, porque ha salido Opus 4.8, la gente de Anthropic el 28 de mayo anunció Cloud Opus 4.8 su modelo público más potente, porque ya sabéis que tiene a Mizos, pero todavía no está disponible para el público. Ahora mismo Opus sigue siendo el modelo público más potente que tiene la gente de Anthropic. Así que pasan de Cloud Opus 4.7 y llegan al Opus 4.8. Dicen que está construido por encima de Opus 4.7 con mejoras en todos los benchmarks. Ahora lo veremos, que es un colaborador más efectivo y que está disponible hoy mismo por el 28 de mayo, hoy estamos a 1 de junio por el mismo precio. Además, Opus 4.8 viene con nuevas funcionalidades. Ahora en cloud.aiai, AI en la página web, básicamente podéis controlar cuánto esfuerzo va a poner Cloud en cada tarea. Y además Cloud Code tiene una nueva funcionalidad que se llama Dynamic Worflows, que luego hablaremos de esta porque ha venido con polémica también,
-
1:05
, obre el vídeo en una pestanya nova
eh, ha venido con polémica y un nuevo modo fast mode, ¿vale? modo rápido por si no tienes paciencia, pero sí que tienes dinero, que puede hacer que trabaje el modelo en 2,5x, pero que dice que es más caro, pero es tres veces más barato que en los modelos anteriores. O sea, el modo rápido es más caro que el normal, pero es tres veces más más barato de lo que lo era anteriormente. Es que antes era absurdamente caro, era un 25x, una salvajada lo caro que era. Bueno, pues aquí tengo las capacidades de Opus 4.8. Si os gusta y sois muy frikis, que sepáis que tenéis al System Car, que esto es un PDF de cuántas lí cuántas páginas, 240 páginas. Vale, por si queréis leeros pues todas las cosas, cómo lo han estado revisando todos los benchmarks, pues si queréis saber pues casos de uso, cómo lo han comparado, bla bla bla. Aquí hay un montón de datos, datos, datos, datos. Está está super bien, pero bueno, nosotros ya lo queremos digerido. Y aquí tenemos las capacidades de Opus 4.8
-
2:03
, obre el vídeo en una pestanya nova
comparados con el resto. Y ojo porque hay novedad. Anthropic entra a la batalla. Esto es una cosa que antes yo no recuerdo o que o que pasara o que no pasaba mucho. Yo no recuerdo que antes fuese así. Por ejemplo, en Cloud Opus 4.7 cuando Ah, sí, no, sí que lo tenemos por aquí. Ah, ah, ah, sí que lo tenemos. Nada, nada. Pues nada, mira, ponía aquí Mizos preview. Nada, nada. No recordaba, no recordaba que lo comparaba con la competencia. Yo pensaba que lo comparaban siempre con los suyos anteriores, pero no, no. Totalmente, totalmente lo comparan. Bueno, pues amigos, fijaos, Opus 4.8 lo compara con Opus 4.7, es mejor en todo, o sea, mejor en todos los benchmarks, que ya sabéis que yo de benchmarks ya no es que no no sé, a mí los benchmars no me dicen mucha cosa. De hecho, ahora daré mi opinión de Opus 4.8, no os preocupéis. GPT 5.5 sigue siendo mejor enentic terminal coding, ¿vale? con un 4% mayor, todo el resto está peor y Gemini 3.1 Pro que se está quedando pues a la zaga, se está
-
2:59
, obre el vídeo en una pestanya nova
quedando por detrás del resto en general, bastante por detrás en algunos, fíjate en agentic muy muy por detrás, o sea, ya puedes espabilar Google a ver si lo sacan lo sacan a finales de este mes, se supone. Entonces, bueno, pues aquí tenemos Opus 4.8, mejora en todo, pero ¿dónde se ve que realmente tenemos la mejora? En la honestidad. Por fin tenemos un modelo inteligencia artificial que dice ser honesto, aunque dicen que entrenan todos sus modelos para que sean honestos. En este caso dice que Opus 4.8 es más honesto en el sentido de que si no es capaz de saber algo, si se da cuenta que no sabe solucionar algo o lo que sea, pues es como que te lo va a decir. ¿Sabes que dice que un problema general de la inteligencia artificial es que muchas veces pues salta conclusiones que con confianza te dice, "Sí, sí, he hecho progreso, he hecho esto y tal, no sé cuánto." Y luego pues te lo tienes que creer. Pues di, "Sí, sí, lo he arreglado." Pero según ellos, Opus 4.8
-
3:54
, obre el vídeo en una pestanya nova
och es la primera vez que es cuatro veces cuatro veces más posible que sea honesto y que te diga, "Oye, no sé hacerlo, no lo he solucionado, no sé cómo tendría que abordar esto." ¿Vale? Entonces, mira, aquí tenemos, por ejemplo, el comportamiento que está desalineado, está al nivel de Mizos preview y cómo ha bajado con una puntuación de 1 al 10. Fijaos que antes estaba en el 2,5 aproximadamente, después ha bajado al 1,8. Claro, cuanto menos mejor. ¿Qué más han lanzado este día de hoy? Eh, la gente de Out 4.8, los Dynamic Workflows, bueno, Dynamic Workflows, que esto está en Cloud Code for Enterprise, en Team y en los planes Max. Lo digo porque si no lo ves es porque estás utilizando la suscripción de pobre, ¿vale? La que utilizo yo, la suscripción de pobre. Entonces, por eso seguramente no te no te va a funcionar. Y es que aquí tenemos los dynamic workflows en Cloud Code y esto ha sido bastante polémico. Los workflows, que es interesante la idea, esto lo que te
-
4:49
, obre el vídeo en una pestanya nova
ayuda es a crear pues esas tareas que sean muy complicadas para que las puedas hacer de punta a punta, o sea, terminarla del todo. Y esto lo que hace es que Cloud dinámicamente genera unos scripts para ejecutar cientos de subagentes en paralelo. Cientos, eh, no uno, dos, no, cientos en una sola sesión. Y claro, por ejemplo, imagínate que quieres hacer una migración de Riaaca Solid, pues esto lo que hace es como partirse el trabajo en un montón de agentes, hacer un montón de fases, se vuelve como loco, como loco. Y claro, ahí podéis ver toda la de tokens que vas quemando, todos los agentes. Mirad aquí, 35 agentes. Obviamente esto no está pensado para cualquier tarea. Pero, ¿cuál ha sido la polémica? Pues la polémica es que este modo se activaba cuando tú simplemente escribías la palabra workflow. O sea, tú escribías la palabra workflow y ya se activaba. Dice, "Así que cada vez que digo la palabra workflow en Cloud Code, digamos cuando estoy creando un nuevo Workflow de
-
5:44
, obre el vídeo en una pestanya nova
GitHub. Intenta entrar en modo workflow activando docenas de subagentes para completar mi tarea. cosa estúpida." Dice, "Esto es una elección de diseño bastante extraña. ¿Quién pensó que esto era buena idea?" Es que es verdad. O sea, tú le podías poner un prom y automáticamente si detectaba la palabra workflow decía, "Ah, ya está activado, venga, para adelante." Ya lo han arreglado. O sea, ya arreglado de que se puede desactivar. Eh, ves, hay gente que se estaba quejando, pero es que fijaos que dice dentro del workflow y encima te lo pone como en narcoiris y dice, "Ah, sí, Wflow, venga a quemar tokens." Pam, venga, toma 100.000 tokens quemados. O sea, brutal, ¿eh? Dice, "Quiero hacer esto. Me gustaría crear no sé qué sé cuánto. Invocado dentro delflow." Vale, y ya está. He dicho workflow. Hala, pues venga, a quemarte, a quemarte. Ya dice, "Aprecio el comentario." Por ahora puedes desactivarlo por prom. ¿Ves? Lo tienes que desactivar así. Tienes que ir a
-
6:32
, obre el vídeo en una pestanya nova
config y lo tienes que desactivar. Lo tienes que desactivar tú a mano, si no estás Eh, eh, no sé, yo creo que este tipo de cosas en todo caso tendría que estar desactivado por defecto. No, no sé. Estas ideas yo sé que bueno, las tienen ellos, obviamente para que así te gasten los tokens, pero ¿cómo vas a poner una palabra tan evidente en el mundo de la promoción como es Wflow para activar un modo que te puede quemar la casa entera? O sea, es una cosa salvaje. Qué bueno que se pueda desactivar, ¿vale? Pero no sé, creo que hubiera sido buena idea que estuviera desactivado por defecto y que se tuviera que activar con un comando como se ha tenido que hacer hasta ahora. No sé, por si no lo sabéis, la reescritura de B resulta que lo hicieron con estos dynamic workflows. Dice que toda reescritura de B, Jarred Summer utilizó las dynamic workflows para pasar B de thick a RAS, que ya sabemos cómo lo hizo tan rápido. Lo hizo así y teniendo tokens infinitos, como os podéis imaginar. Bueno, esto es Opus
-
7:21
, obre el vídeo en una pestanya nova
4.8. Entre todas las cosas y disponibilidad y tal, lo más interesante, yo creo, aparte de las mejoras, es que el precio sigue siendo el mismo. No ha cambiado el precio respecto a Opus 4.7. Buena noticia, porque normalmente estaba subiendo los precios de las APIs cada vez que salía un nuevo modelo. En este caso parece ser que no. Sigue siendo lo mismo. $ por cada millón de tokens de input, $25 por cada output por millón de tokens. Y el fast mode pasa a ser simplemente el doble, o sea, un 2X que está bastante bien de precio. O sea, ahora si activas el modo rápido tienes que son $10 por millón de tokens en input y $50 por millón de tokens el output. Bueno, pues ahí ahí lo tenéis, Opus 4.8. Ahora, la pregunta del millón, eh, ¿vale? Bueno, lo primero que os tengo que comentar, si lo mira, lo voy a poner por aquí, hecho una pequeña aplicación que tenía ganas de hacer y que sepáis que lo he tenido que hacer la mitad con Visual Studio Code y la otra mitad con cursor. ¿Por
-
8:19
, obre el vídeo en una pestanya nova
qué? Porque no me daba con Visual Studio Code no me daba. Y para que veáis que tampoco con Visual Studio Code hecho tanto trabajo, creo que tengo por aquí un poco eh lo que es el chat, ¿vale? Entonces, veis ahí más o menos cada conversación han sido dos o tres proms, ¿vale? para os hagáis un poco la idea. Entonces, fijaos que empecé hace 8 horas y aquí 5 horas. Pues claro, ya veis ahí un poco el uso que os decía que pues que ha sido una pasada, ¿no? Que todo lo que lo que ha estado utilizando de de créditos y todo esto. Entonces est utilizando Opus 4.8 y fijaos que aquí ya ni siquiera ni siquiera te pone el 2x y ya no te dice nada, ya solo te dice coste alto, te va a costar la vida. Ya en Visual Studio Code ahora no te dice si es 1x, 2X, 50X, simplemente te dice coste por 1,00ón y te dice entrada 500 créditos. Entré 50 créditos, resultado 2,500 créditos. Eso es todo lo que te dice. Punto. Ya está. ¿Sabes? No te dice te habla por créditos, pero es que por créditos es como muy difícil de
-
9:13
, obre el vídeo en una pestanya nova
entender. Y fijaos que GPT 5.5 y Opus pues tienen más o menos el mismo precio, que a mí me sorprende. De hecho, GPT 5.5 es más caro, es más caro que Opus 4.8. Me sorprende que Microsoft, siendo un accionista de Open AI, no hayan podido conseguir mejor precio. No sé. yeminite 3.5 flash. Fijaos que es más barato, pero que también es bastante caro, ¿eh? Va por créditos. Es así, créditos, créditos. Bueno, total que he estado utilizando Opus 4.8 y os vengo a dar un poco mis opiniones. Tengo que deciros una cosa que a ver si os encuentro la conversación, porque he tenido una conversación que me ha costado la vida que me entendiese. Mira que le he hablado bien, eh, está quedando muy bien, o sea, le hablo bien y tal. Oye, tengo que decir que primero yo no he detectado ninguna mejora sustancial con Opus 4.7. cero, o sea, he detectado cero. Y, de hecho me ha sorprendido que en ciertas cosas me ha funcionado peor. Yo ya no sé si soy yo, si es la inteligencia artificial, pero me da la
-
10:10
, obre el vídeo en una pestanya nova
sensación que si me hubieran dicho que era Opus 4.5 me lo hubiera creado, que ahora alguien me me vendrá y me dirá, "No, pero yo digo que con este proyecto, que un proyecto que al final ha quedado bastante bonito, también voy a decir otra cosa polémica. Me sabe mal, eh, pero voy a decir una cosa polémica. Creo que Cursor está a otro nivel ahora mismo respecto a Visual Studio Code. Ya no es el problema de la suscripción, es el problema de que a nivel de experiencia de desarrollo, a nivel de cómo funcionan los modelos y tal, en Visual Studio Code, de vez en cuando me estaba machacando los cambios yo, madre mía, qué desastre, qué desastre, tío. Nada, nada, mucho mejor Cursor, ¿eh? Cuando he trabajado con Cursor, mucho mejor, tío, mucho, mucho mejor. En fin, que igualmente, igualmente, bueno, he hecho este proyecto, ¿vale? Este proyectillo es una tontería, pero es para ponerle subtítulos a cualquier vídeo utilizando inteligencia artificial. Entonces, eh esto es inteligencia artificial en local
-
10:59
, obre el vídeo en una pestanya nova
porque yo le pongo muchas muchos subtítulos a muchos vídeos y yo no tenía ganas de pagar a nadie. Entonces esto lo que hace es que tú puedes eh configurar los subtítulos, lo detecta automáticamente, el audio de entrada y el de salida. Esto es totalmente de código abierto, por cierto, que no lo he subido el repo todavía, creo, pero lo subiré. Entonces, genera los subtítulos. Esto funciona en mi máquina, en local utilizando web GPU, utilizando Whisper, utilizando modelos en local. Y ahora si todo va bien y no me peta el stream porque estoy utilizando inteligencia artificial y tal, bueno, pues debería hacer la transcripción y vais a ver que además he hecho un editor para que podáis, ¿ves? Un editor donde puedes cambiar eh pues el estilo de los subtítulos. Los subtítulos los puedes customizar más todavía, los puedes hacer más grandes, los puedes eh hacer que estén negrita, que tengan un background, los puedes poner arriba, en medio, abajo. Total, esto es una herramienta
-
11:46
, obre el vídeo en una pestanya nova
que me he hecho un poco para mí, eh, que además pues aquí tienes pues eh para ver el editor de vídeo y tal y puedes pues cambiar aquí lo que sea, ¿no? Aquí pues le puedes decir, esto es un subtítulo. Jajaja. Ahí puedes cambiar subtítulo y lo que puedes hacer es descargarte el vídeo con los subtítulos y ya está. Así que nada, la verdad es que al final lo he conseguido hacer. tenía la idea bastante clara. He tenido que hacer algunos cambios a mano, sobre todo el tema de Wake Workers, Opus 4.8, pues no era capaz, no era capaz de sacarlo y no funcionaba y no había manera, tío. Pero bueno, creo que ha quedado bastante bien. Además, le he puesto para deshacer, ¿vale? Si por ejemplo quieres rehacer o puedo hacer control Z y deshace los cambios. Puedes hacer esto más pequeño por si quieres que los subtítulos pues a veces salgan, a veces no salgan. Los puedes eliminar también, se puede hacer cositas, se pueden hacer. Esto lo he hecho con Opus 4.8. Opus 4.8 está muy bien, o sea, no digo que sea
-
12:35
, obre el vídeo en una pestanya nova
mal modelo, pero realmente tampoco me parece un salto cualitativo y de hecho me ha costado, me ha costado que a veces me entienda, tío. Eh, no he tenido esta sensación, por ejemplo, con GPT 5.5 o con Opus 4.8. O sea, que no sé, tío. Me ha sorprendido que le le estaba costando entenderme. Era como que, ¿qué le pasa? ¿Qué te pasa, tío? Reacciona. ¿Que te estoy hablando en chino o qué? No sé, no me entiendes. O sea, era un poco tener que preguntarle. Entonces, ya no sé si ha sido Visual Studio Code o si es el modelo, ¿sabes? Tampoco puedo diferenciar, pero funciona bastante bien. Así que le vamos a dar una aprobada al Opus 4.8. Además, han mantenido precios muy bien, las cosas como son. Perfecto. Así que nada, ahí os lo subiré, os subiré el proyecto. Ya tengo la el dominio y todo, así que muy pronto os lo dejo por aquí.