Claude Fable 5: el salt tècnic i el límit que inquieta
Dot CSV Lab prova Claude Fable 5 i analitza el rendiment, el preu, els filtres de seguretat i el risc d’intervenir sense avisar.
Claude Fable 5 és el primer model de classe Mythos que Anthropic posa a l’abast del públic general. En l’anàlisi de Dot CSV Lab, la potència del model queda clara tant en els resultats publicats com en dues proves de creació de programari. El dubte no és si el salt tècnic existeix, sinó quines condicions imposa l’empresa per poder oferir una capacitat que considera especialment delicada.
El llançament introdueix una divisió poc habitual. Fable 5 i Mythos 5 parteixen del mateix model, però Fable incorpora classificadors i redireccions per limitar tasques de ciberseguretat, biologia, química i destil·lació. Mythos conserva més capacitat en aquests àmbits i queda restringit a organitzacions autoritzades. El vídeo també detecta un problema de confiança en la primera versió de la política: Anthropic plantejava intervenir de manera no visible en algunes consultes sobre desenvolupament avançat d’IA.
1. Fable i Mythos comparteixen cervell, però no les mateixes barreres
A 01:09, Carlos Santana explica la nova jerarquia. Mythos se situa per damunt d’Opus com a categoria de màxima capacitat. Fable 5 és, segons Anthropic, un model d’aquesta classe adaptat per a ús general; Mythos 5 és la versió destinada inicialment a ciberdefensors, proveïdors d’infraestructura i programes d’accés de confiança.
La presentació oficial de Fable 5 i Mythos 5 diu que comparteixen el mateix model subjacent. La diferència principal són les salvaguardes. Quan una petició de Fable activa determinats classificadors, el sistema pot fer que respongui Claude Opus 4.8. Per a la majoria de consultes això no passa: Anthropic afirma que més del 95% de les sessions inicials no activaven el canvi.
Aquest disseny intenta evitar una alternativa més pobra: negar tota consulta que comparteixi vocabulari amb un ús perillós. Tanmateix, una tasca defensiva i una d’ofensiva poden assemblar-se. Revisar codi per trobar una vulnerabilitat serveix tant per reparar-la com per explotar-la. La qualitat del producte depèn, doncs, del model principal i també del classificador que decideix qui el pot utilitzar.
2. La seguretat no és només una negativa al final de la resposta
A 04:13, l’anàlisi entra en els sistemes de protecció. Anthropic descriu classificadors separats per detectar intents d’abús, inclosos els jailbreaks. El sistema cobreix ciberseguretat, biologia i química, i també peticions que l’empresa interpreti com un intent de destil·lar les capacitats del model per entrenar-ne un altre.
El document tècnic de seguretat de Fable 5 i Mythos 5 reuneix les avaluacions de capacitat, alineament i risc. Les xifres continuen sent proves seleccionades pel fabricant, però ajuden a entendre per què Anthropic no tracta Fable com una actualització convencional de Claude.
Hi ha una contrapartida de privacitat. El trànsit de models Mythos-class requereix una retenció de trenta dies per detectar atacs complexos i falsos positius. Anthropic afirma que no utilitza aquestes dades per entrenar models i que limita i registra l’accés humà, però el canvi afecta clients que valoraven opcions de retenció reduïda. Potència, seguretat i tractament de dades formen part del mateix contracte.
3. Els benchmarks impressionen; les proves pràctiques miren el criteri
A 05:56, el vídeo repassa resultats de programació, treball de coneixement, visió i ciència. Anthropic presenta Fable 5 com el seu model general més capaç i destaca que manté el fil en feines autònomes llargues. També publica casos de socis que parlen de migracions de codi, anàlisi financera i prototips completats en menys torns.
Cal llegir aquests exemples com a evidència del llançament, no com una comparació independent definitiva. Cada prova utilitza eines, pressupostos de raonament i criteris diferents. Una puntuació elevada pot indicar capacitat, però no explica per si sola si el model entén una petició ambigua, revisa els seus errors o entrega una interfície mantenible.
Per això Santana passa a dos encàrrecs concrets. A 16:18, demana un Snake dins un hexàgon rotatori, amb entrenament per IA. Fable l’entrega en un sol intent i, sense que li ho demanin, revisa la sintaxi, obre el navegador i executa mil segons de simulació per comprovar que l’agent aprèn. Aquesta verificació proactiva és la diferència que més destaca.
A 19:10, demana un clon mínim de Notion. En 25 o 30 minuts, Fable crea pàgines, tipus de maquetació i taules editables. Encara necessita iteracions, però Santana el troba més proper al producte que buscava que un intent anterior amb moltes més intervencions. No prova que Fable guanyi sempre; sí que un model més car pot sortir a compte si arriba abans a una solució verificable.
4. El preu converteix Fable en una eina per a tasques seleccionades
A 12:02, arriba el cost. En el llançament, Anthropic fixava Fable 5 i Mythos 5 en 10 dòlars per milió de tokens d’entrada i 50 per milió de sortida. És menys de la meitat del preu de Mythos Preview, però continua sent una tarifa elevada quan un agent llegeix grans repositoris, genera moltes iteracions o manté context durant hores.
La comparació correcta no és només el preu per token. Un model car pot acabar costant menys si resol una feina en menys torns i evita reprocessar context. També pot resultar molt més car si el pressupost de raonament creix sense millorar l’entrega. La mètrica útil és el cost d’una tasca verificada.
Anthropic va anunciar un desplegament gradual als plans de subscripció i disponibilitat per consum a l’API. Per a un equip, això suggereix una estratègia selectiva: reservar Fable per a decisions difícils, migracions grans o revisions complexes i utilitzar models més econòmics per a operacions repetitives.
5. El precedent perillós és intervenir sense que l’usuari ho sàpiga
La crítica central apareix a 21:51. En el text inicial del llançament, Anthropic diferenciava les barreres visibles de ciberseguretat o biologia d’una intervenció sobre treball relacionat amb el desenvolupament de models avançats. Aquesta última podia alterar l’ajuda sense avisar de manera clara l’usuari.
El problema no és només que una empresa limiti el seu servei. És que una resposta aparentment normal pot haver estat degradada. Un investigador podria atribuir el mal resultat a la seva hipòtesi, al codi o a les dades sense saber que el proveïdor havia intervingut. També apareix un conflicte d’interès: el laboratori que competeix a la frontera decideix quina recerca d’altres actors rep tota la capacitat.
La política va canviar després de les crítiques. La pàgina oficial actual diu que l’usuari serà informat quan una consulta es redirigeixi a Opus 4.8, i la fitxa actual de Claude Fable explica el mecanisme de fallback. Aquesta correcció reforça precisament la lliçó del vídeo: una salvaguarda discutible es pot debatre i auditar quan és visible; una intervenció secreta converteix qualsevol resposta en una dada incerta.
Conclusions
Fable 5 amplia el tipus de feina que es pot delegar a Claude: programació de llarg recorregut, prototips visuals, anàlisi i ús d’eines. Les proves de Dot CSV Lab donen una mirada més útil que un rànquing aïllat perquè obliguen el model a convertir una instrucció en un sistema que es pot inspeccionar.
Alhora, el llançament recorda que el producte inclou molt més que els pesos del model. Inclou classificadors, canvis de model, preu, retenció de dades i regles d’accés. La seguretat pot justificar límits estrictes, però aquests límits han de ser recognoscibles. Si no sabem quin sistema ha respost ni si la seva capacitat ha estat reduïda, tampoc podem avaluar amb rigor el resultat.
Contrast i context
Fonts consultades
- 01
-
02
Anthropic Claude Fable 5 and Claude Mythos 5
- 03
-
04
Anthropic Claude Fable
Font de treball
Transcripció amb marques de temps
Consulta la transcripció
-
0:00
, obre el vídeo en una pestanya nova
Antropik ha presentado por fin su nuevo modelo Cloud Mitos 5. Modelo que llevábamos esperando de de hace un par de meses de la anunciad de Mitos Preview y que hoy por fin podemos decir que sí que ya llegan nuestras manos para poder empezar a utilizarlo. ¿Cómo? Ah, que no, no es mitos, el que llegas y no. Fable. Fable 5 es el modelo que públicamente todos nosotros podríamos utilizar y que tiene alguna ligera diferencia con el Mitos y con los Mitos Preview que conocimos. Pero que aún así cumple con las expectativas y es un modelo sorprendente que empuja la frontera de capacidades trayéndonos y lo podemos decir si margen de duda el que esa hasta la fecha el modelo más potente jamás entrenado. Un modelo que como veremos ahora no solo cumple con la expectativa de lo que se presentó como mitos previos sino que incluso mejora sus capacidades. A un precio de más bastante competente, que a mí personalmente me ha sorprendido y que por tanto haría de toda esta realista, pues algo digno de celebrar, excepto por que Antropik ha hecho algo muy antropik y bueno, atraído un precio deente que también vamos a comentar y que debería de recuperarnos a todos. Pero en vez de más por lo más importante, que es analizar qué train estos dos nuevos modelos. El día 9 de junio de 2020 y 26, Antropixtra de Cloud Fable 5 y Cloud Mitos 5. Como digo inaugurando la saga 5 de Modelos Tantropixtra, atrasqueada la saga de Modelos 4.5. 6.7 y 4.8, que salió hace menos de 12 manos. Y ahora lo que nos llega para uso general es este nuevo modelo Cloud Fable 5. que como viene indica que anthropic es un modelo de la categoría de mitos pero en este caso con guarda raíles con medidas de seguridad implementadas para que aquellos puntos más delicados que más preocupaba le equipo de anthropic pues no tengamos acceso porque si recordáis la trama de asunpar de meses con el anuncio de mitos previo
-
1:59
, obre el vídeo en una pestanya nova
El problema por el cual antropic públicamente decía que no quería sacar este modelo era porque era muy peligroso y en cuestiones de cyber seguridad, por ejemplo, pues habían comprobado que su modelo mitos previo era capaz de encontrar vulnerabilidades bugs en infraestructura básica en navegadores en sistemas operativos y que solo hacía potencialmente un modelo muy peligroso de ser liberado para uso general. Y esto fue algo que yo no me terminé de creer. Y en el propio vídeo sobre mitos previo, os lo comente. Una cosa es lo que Antropi que nos quiera contar y que puede ser cierto que exista este miedo ante un modelo que sea más peligroso, eso es una realidad que dentro de Antropi que se puede estar viviendo. Pero esto tenemos que separar lo también del relato de una empresa que está aquí para ser dinero, para vendernos a nosotros el uso de estos modelos. Y que es sentido económico tiene por tanto entrenar un modelo tan caro y tan costoso, sino lo vas a ofrecer a tus usuarios por ser potencialmente peligroso. Y la realidad es, y lo comenté en aquel vídeo que Antropik por el Medabril estaba sufriendo las escases de computación tras el éxito que, los modelos 4.5 y 4.6 había cosechado y por tanto no tenían computación suficiente. para poder brindar un modelo tan caro y tan pesado como era mitos previo. Y aquí mucha gente lo interpretó de forma equivocada que Antropi que nos estaba diciendo que por tanto no iba a sacar amitos como uso general, porque era muy peligroso, pero la realidad es que se observamos los tweets que la propia compañía publicó con la salida con el anuncio de mitos previo, si nos indicaban que su objetivo, y también lo comente, sería pues en algún momento sacar un modelo de la categoría de mitos que fuera seguro a escala. y que también pudieran desplegarlo cuando tuvieran la computación suficiente. Computación suficiente que llegó como agua en el desierto como exigeno bajo el mar cuando antropics cerro el acuerdo durante el mes de mayo con SpaceX para poder utilizar su computación. No es lo que nuestro acuerdo con SpaceX nos permitirá incrementar sustancialmente nuestra capacidad en computación.
-
4:03
, obre el vídeo en una pestanya nova
Esto es lo que ha permitido que Antropi no tenga tantas caídas cuando lo utilizamos, como hace un par de meses y también que hoy estamos hablando de la salida de este modelo de categoría mitos. Eclar una vez, resolver el problema de la computación, también lo que tienen que resolver esta idea de que mitos serán muy peligroso y por tanto tienen que sacar una versión que sea segura. Y esa versión segura es feybol. Feybol 5 es la versión que todos nosotros vamos a poder utilizar que es exactamente el mismo modelo que mitos. 5 es decir, mismo modelo Pero en este caso, el modelo que nosotros estamos utilizando va a tener unas salva guardas que van a hacer, pues una serie de modelos clasificadores que estudian el prompt que tú le estás pidiendo a fei bol para verificar que no le estés pidiendo tareas relacionadas con ciberseguridad, con biología, con química o destilación de modelos. Si es de fuera del caso, estos clasificadores lo que van a hacer es que tu prompt no sea ejecutado por fei bol 5 por el modelo de categoría mitos, sino que se va a lanzar con el siguiente modelo más potente que es. opus 4.8. Y algo importante y que casi parece obvio que en dicana aquí pues esto será informado a los usuarios cuando curra, de ser cuando tu prompto no haya ido a facebook, sino que haya ido a opos 4.8 se te notificará. Pero para que no quede dudas, efectivamente, fei bol y mitos son el mismo modelo, son los mismos parámetros, son los mismos pesos, mismo rendimiento, con la diferencia de que fei bol sin coba estar limitado simplemente a aquellas tareas que no sean potencialmente peligrosas es el nice guy que es muy inteligente que te pueda ayudar con muchas tareas, pero te va a decir, no, con esto no te pueda ayudar que me parece un tema un poco delicado
-
5:42
, obre el vídeo en una pestanya nova
Mientras que mitos es la versión sin censura con todo su potencial, incluso para trabajar en aquellos temas mantelicados, y al que solo va a tener acceso a través del proyecto Glasswing pues a que ya empresas que Antropik consideren. Explicado esto, ahora sí la gran pregunta es Carlos. Rinde mitos, Facebook, cómo nos prometieron hace unos meses y la respuesta es que no, porque Rinde mejor. hubo mucha gente que dudaba que la no salida de mitos, pues podría significar que realmente ese modelo no tuviera capacidad de jej y que fuera toda una cuestión de marketing and tropic, pero la realidad es que con el modelo ahora sobre la mesa y viendo de nuevo los datos y el documento de más de 300 páginas de la sistem card podemos comprobar que efectivamente estamos ante una nueva categoría frontera de modelos de inteligencia artificial y lo podemos ver claramente aquí en la tabla de benchmark, donde tenemos columna para mitos y feybol compartida, donde comparan con el rendimiento de mitos previdas, un par de meses y luego con opos 4.8, GPS 5.5 y y M9 3.1 Pro. Lo modelo flanterá de cada una de estas compañías. Y vemos que en programación agéntica donde, bueno, pues, vamos a que todas estas empresas están capturando gran parte del valor de lo que los usuarios. Estamos dispuestos a pagar ya en abril mitos previdos sorprendió enormemente al dar un salto bastante notable de 77,8% sobre lo que sus competidores podrían lograr. Veniendo de una época donde este benchmark, ese WBbench propuesto ha tenido un progreso muy continuado, era muy raro ver un salto escalonado no continuo de casi casi 20 puntos por centuales. Y si esta edad o no sorprendía, obviamente ver que ahora esta nueva versión incluso lo mejora pues no deja de ser bastante bastante sorprendente. 80,3% en este benchmark. Y luego tenemos otros altos bastante abruptos en este benchmark aquí llamado Frontier Code Diamond, que es un benchmark que no os debería de sonar.
-
7:38
, obre el vídeo en una pestanya nova
Y digo que no lo tenéis que conocer porque este es un nuevo benchmark que se publicó hace solo dos días por parte de Co-Nision, la empresa atrás de Vin y que viene a poner sobre la mesa un nuevo benchmark una nueva forma de evaluar a los modelos en programación agentica que sea más rigoroso y que podamos portanto confiar más en ello. porque historicamente hemos venido confiando en benchmarks como www.bench que luego OpenEye y verificó y que vio que había algunas pruebas que eran equivocadas, saliendo www.beadyfight o traverseión pues un poco más pulido, un poco más rigurosad, luego a partir de ahí salió www.bench Pro que vení intentar solucionar problemas también de los evaluaciones anteriores sobre esta misma premisa en las semanas pasadas hemos visto la salida de Deep www. que es otro benchmark, pues que intenten incluso mejorar más todavía todo esto y como digo el 8 de junio recibimos la llegada de Frontier Code que si o interesa tiene un blog bastante interesante donde explican pues todas las mejoras que introducen para que este benchmark sea realmente e rigurosora hora de darnos una señal que nosotros podamos confiar pues para entender cómo van mejorando los modelos de este una mejor definición de las tareas con las que lo vamos a evaluar a mayor diversidad de código con el que se está testando para que los modelos no se es que en un tipo del lenguaje de programación frente a otros es decir es un benchmark más riguroso y un benchmark que por tanto recibimos con las manos abiertas porque hoy es pues si tenemos una mejor forma de evaluar los modelos la señal que vamos a recibir pues no va a permitir entender cuál es el mejor modelo este benchmark cuando salió frontier code hace dos días no es colocó a cloud opus muy por delante de GPT 5.5 sobre este benchmark, que como vemos está lejos de ser saturado la versión dialamont, el frontier que utiliza el más complicado, vemos que el modelo pues está todavía por aquí, pero hoy es un salto frente al resto de competidores que bajo la premisa de este benchmark.
-
9:29
, obre el vídeo en una pestanya nova
Club Opus 4.8 poses un mejor modelo para programación agéntica. Y como digo esto ya empezó a generar mucho ruido el 8 de junio en diantes de la salida de mitos. Y cuáles nuestras sorpresas ahora que cuando vemos en la tabla de benchmarks el benchmark que aparece el estado en segunda posición justamente este frontera Code Diamond, donde Cloudmittos ofay vol consigue un 30 por ciento. más que duplicando el rendimiento de Opus 4.8. y no pongo en duda que el rendimiento de fey bol sea el que este benchmark nos indica porque ya podido comprar barques un excelente modelo de programación y otros benchmarks así lo respaldan pero no voy a negar que a mí pues me hace dudar que justamente el día anterior surja un nuevo benchmark que luego al día siguiente aparece el estado en primera posición en segunda posición en la tabla de benchmarks de anthropic que justamente favorece la compañía, pues obviamente hay un cierto relato que ha intentado establecer, pero bueno no quita que el resultado que consiguié este modelo en este preciso benchmark es sorprendente. Aparte de esto el resto de Benz Marks como podéis esperar, pues son sorprendentes, vemos algunos que conocemos todos, pues humanitilás texams ya estamos rosando el 65% con el uso de herramientas, aquí a la parcola que conseguían mitos previos, son par de meses pero fijados la diferencia con respecto al resto de competidores y cuando vamos viendo pues tanto en biología como en matemáticas como en física pues el modelo que tenemos entre manos es mucho más potente que cualquier alternativa. Porque ahora hemos que en el paradigma del test en computer puedes dejar a los modelos razonar más tiempo y hasta más computación y que por tanto pues no cuesta más no suele dar más rendimiento. Y aquí donde he visto quizás la fotografía de imagen que más por me hace confiar en el rendimiento de este modelo y es esta pedazo curva, creciente, esta pendiente que tiene el modelo que lo que no viera confirmar es que en este paradigma del test en computer dejar
-
11:27
, obre el vídeo en una pestanya nova
pensar al modelo durante más tiempo si nos otorga muchas mejoras en rendimiento ¿vale? si lo comparamos, por ejemplo, con cloth opus 4.8 incluso con GPT 5.5 para este benchmark que veníamos comentando fijamos como GPT 5.5 apenas tiene rendimientos crecientes cuando aumentas la computación se aplana completamente no consigue despegar o pusí parece que consigue capturar cierto rendimiento pero este crecimiento de aquí que no parece ni siquiera saturar podría incluso de bloquear antropi con una nueva línea de computación dejar que el modelo se gapenzando más y seguramente conseguiremos mejor resultados en este benchmark es sorprendente Y a parte de esto no fijamos también que lo que yo llaman la configuración LOW en la que el modelo va a pensar menos, fijados como aquí está a un coste superior de lo que sería el modo HIGH de OPUS, pero que he visto a la perspectiva de lo que nos ofrece el modelo en cuanto a rendimiento fijados que este punto LOW pues se encontraría a un mismo rendimiento que el punto HIGH y extra HIGH, pero a un precio a un coste mucho más parato. Lo cual. Por las conclusiones que nos deja es que evidentemente estamos ante un modelo mucho, mucho, mucho, más potente y que es una categoría superior a lo que los modelos opus que hasta ahora era la frontera de Antropic no podía no frecer. Y esto es algo que cuando vamos a la SystemCard que es la que recoge pues todas las evaluaciones y todos los test cantropic H, pues se sigue replicando. De nuevo en www.pro podemos como la curva de mitos. 5 está muy por encima de lo que nos ofrece Clot.os 4.8 son ligas diferente como venimos comentando. En benchmarks de conocimiento general como Humanity Last Exam que también hemos comentado antes. Podemos ver muy interesante. No solo la diferencia de la curva te costa entre opos 4.8 y el.
-
13:11
, obre el vídeo en una pestanya nova
nuevos mitos, sino también la diferencia entre mitos 5 y lo que era mitos previo hace un par de meses. Donde vemos que el rendimiento está a la paga, está 2 curvas, pues casi casi, tienen la misma altura pero fijados como in despasamientos, es la izquierda que no refleja que, de alguna forma antropica encontrado, eficiencia, a la hora de ofrecer este modelo. Y donde vemos que, para un mejor rendimiento, pues ahora tenemos un coste sustancialmente más bajo. Y esto es algo que también se reflejan el precio, al que no llega al modelo que no es tan caro como salunción mitos, pero vio que era un por 5 del precio de opus, sino que en este caso pues lo tenemos simplemente al doble de precio de opus 4.8 que, a mi gusto, está justificado. Y creo que es un punto dulce que se justifica cuando no nos cuenta que a estos niveles estas mejoras en inteligencia lo que se traduce llegar antes a soluciones funcionales, a soluciones que son correctas. Se me for ejemplo trabajar con Fable 5 me va a permitir llegar a una solución correcta antes que estar trabajando y tracciones y tracciones con opos 4.8 al final del día cuando hacen las cuentas pues te cuadra lo en nombre. Y otra cosa que quiero comentar es que sí es cierto que estamos ya con cotas de precios que son muy galas, son muy costosas, pero para no perder un poco la perspectiva, quiero que fijé que se bajamos aquí a modelos que ya están deprecados, encontramos poderos como opus 4.1 que salió en agosto de 2020 y 5 que se fijáis tiene. un precio por input y por output que es más costoso. Obviamente aquí estamos comparando veras con manzanas porque la forma de utilizar los modelos como fievo, el cinco en bucle, agente y cojabras son mucho más intensivos en el uso de tokens. También es cierto que estos tokens nos aportan mucho más valor que lo que nos aportaba un token de 4.1, pero lo que voy es que no estamos tampoco tan lejos de la esquema de precio con el que trabajábamos hace un año. Aunque esto es hablando del coste de los modelos, porque si hablamos de disponibilidad, si antes hacía la metafora con un
-
15:08
, obre el vídeo en una pestanya nova
el capítulo de Mr. Robot, realmente donde nos encontramos en la serie en la que estamos es en Breaking Bad. Porque aquí en tropical decidido ofrecernos a febol 5 como lo hacen los mejores pendidores de meta-sul. Y es, ¿qué vamos a tener disponible al modelo durante estos próximos días con nuestra suscripción de Antrópics? Se ha de $22, de 100, de 200, vais a poder utilizar febol 5 y testear la bondad es que este modelo ofrece que son muchas. Sin coste, extra y una vez te tienen enganchado, una vez te tienen ya queriendo seguir utilizando este modelo, el 23 de junio, visperades, anjuán, van a quitar feos 5 de todos los planes y solo lo vamos a poder utilizar pagando créditos de uso extra decir un pago complementario que haremos a nuestras suscripciones d'antrópica. El motivo que yo justifican, depende de la capacidad de computación que yo estén ganó de no me lo termino de creer, porque realmente el pico de uso lo vamos a encontrar en estos primerotías que es cuando más gente deforma intensiva utiliz al modelo, pero bueno, no dicen que después del 23 de junio será con disponibilidad de capacidades, según ello vayan viendo que en un futuro restable será en el acceso a febo al 5 a través de las suscripciones. Así que mientras tanto, Tuka darle caña. Tuka des dearlo y exprimir al máximo el rendimiento y lo que veja a comprobar es que no se falta ni siquiera ver tanto su benchmarks es que este modelo es superior. Funciona mejor, sin duda, y esto lo he podido comprobar incluso con PROMS que, a día de hoy, ya están completamente saturados, resueldos por todos los modelos disponibles, pero encuentro diferencia de comportamiento que son muy interesantes fijados. El típico PROMS de El Snake jugando dentro de un exágono rotatorio era un PROMS que, bueno, los modelos de programación agéntica poco a poco se iban acercando, pero todavía seguían fallando, seguían presentando algún tipo de bug, y actualmente, ya esto se resuelve sin mayor problema.
-
16:57
, obre el vídeo en una pestanya nova
Un implementación donde tenemos a la serpiente donde incluso sí aumentamos la velocidad de simulación pues no hay problemas donde la serpiente sale fuera del exágono que querá uno de los principales books que los otros modelos solían cometer y donde tenemos implementado incluso pues el entrenamiento con inteligencia artificial que es otro de los requisitos que dentro de este prompt se pide. Hasta aquí como digo pues un resultado bastante funcional que no se diferencia en cierto de lo que otros modelos frontera a día de hoy nos permitan ofrecer. Pero una cosa que me ha llamado mucho la tensión ha sido en el proceso de desarrollo del propio modelo de Fable 5 trabajando en esta tarea. Quiero que fijéis cómo el proceso es, pues sí, primero tengo que comprobar skills de cómo hacer el diseño web, perfecto, pues va trabajando, basiendo la implementación, va colocando todos los elementos esto es lo que un modelo típico, pues no solía trabajar, pero muy interesante una vez terminada de programarlo, lo siguiente que hace es muchas verificaciones para ver que todo funciona como toca. Y que esto ya se empieza a diferenciar a lo que otros modelos como digo, pues normalmente hacen. Bueno, vale, que me hago una verificación de las Intaxis de Yavascript, ok, que me hago una comprobación en el propio navegador de que todo está correcto, ok. Pero esto, si no lo había visto antes, si es que el modelo llegado a Japón punto de hijo vale, hay un proceso donde una inteligencia artificial, una algoritmo queula, en vada a aprender a jugar al juego, voy a lanzar una simulación de mil segundos para comprobarse realmente este sistema que hemos implementado funciona. Vamos a ver si el sistema aprende. Y efectivamente podemos ver cómo en su proceso de implementación OneShot, sin haberle pedido ningún otro prompt, pues ha ejecutado una semulación física donde comprova que efectivamente el sistema está aprendiendo que, por tanto, todo lo que nos tiene que ofrecer, funciona correctamente. Esta forma de autogrificar su trabajo, de hacer esto, bucles de verificación de forma inteligente y de forma proactiva es parte de lo que haza estos modelos fronteras, pues algo mucho más capaz, agenticamente, a la hora de implementar algo.
-
18:51
, obre el vídeo en una pestanya nova
Y como digo esto es marca de la casa de este feo vols 5 que no he visto con otros modelos trabajando en este pront. Y si tenéis curiosidad, lanzar este pront y que lo ejecute y correctamente One Shot ha costado en torno a un 10% de mi cuota de 5 horas en un plan de 100 dólares lo cual puede. Me parece razonable. Y por enseñaros otro ejemplo que está relacionado con lo que comentaba antes de que con modelos más inteligentes podemos llegar y te rando menos a soluciones correctas antes y por tanto esto es un ahorro he probado un prompt que es quiero que crees un clon perfecto de nooción con la mayoría de funcionalidades que lo hacen útil y este es un prompt que estoy probando porque es algo que ya con Codex experimentado durante un tiempo de crear un clon pues para mi uso personal para poder del ligarme de los costes de estar pagando una suscripción mensual a nooción Y como digo es un proyecto que con CodeX estuve experimentando y que llegado un resultado que es pues bastante funcional que todavía tiene haristas por pulir pero que si lo he conseguido implementar ha sido a través de primero plantear un goal, es decir una métrica la que yo le digo a CodeX quiero que este es trabajando y terán de comprobando los resultados para ver que lo que está implementando es correcto y que ha sido un proceso de iteración repetido en el tiempo, es decir con mucho uso de tokens Y donde en algunos casos también he tenido que intervenir en este loop de ejecución porque algunas cosas estaban implementando no como yo quería pues tienes que intervenir y por tanto estar trabajando y gastando más y más tokens. Con lo cual he dicho, oye, y si le pido feybol que me haga exactamente esto, quiero un clon de noo y no con todas las funcionalidades, pero algo que sea, mínimo viable a ver cómo lo implementa a ver si se acerca lo que yo estoy buscando y fijados que traes 25-30 minutos trabajando no más. Esto es lo que me ha implementado y es mucho más parecido, mucho más cercano con la funcionalidad de mínimas que yo necesito de lo que tiene que ser un clon de no-o-ion.
-
20:48
, obre el vídeo en una pestanya nova
Todavía con la implementación de codex tengo muchas cosas que no se parecen a lo que aquí me ha implementado mi amigo Fable, pero fijados como tenemos pues toda la funcionalidad básica que al final para mí es la posibilidad de crear nuevas páginas de poder tener acceso a lo diferente tipo de maquetación, crear páginas, crear tablas, poder modificarlas, es decir, sí. A mí me dicen que estoy trabajando a mi mismo entro de nousión, pues me lo podría crear. Todo bastante, bastante funcional para hacer como digo algo que se ha hecho eh One Shot. Y como digo un trabajo que me ha llevado 25 o 30 minutos, Juan Shot que ahora tendría que seguir iterando para mejorar, pero que no se compara con el tiempo dedicado con la cantidad de toque en sus utilizados que me ha llevado una implementación similar que quizás podría ser nota en perfecta en Codex. Hasta aquí está claro que estamos trabajando con un modelo que es excelente, que es un modelo frontera sin lugar a dudas donde en cualquier benchmark que le lanzemos en la... mayoría de benchmarks, consideran resultados que dominan al resto de la competencia. El problema es que aquí también con esta realiza Antrópica de Chow algo muy antropic, que como decía el principio, esta vez un presidente que es muy preocupante. En concreto, nos estamos refiriando algo que aparece en su sistema card Antropic. ha implementado nuevos sistemas de intervención que limitan la efectividad de los modelos de clod para el desarrollo e implementación de modelos del lenguaje frontera. Por ejemplo, que le pideja a febol que te implemente un pipeline de preentrenamiento, o una infraestructura entrenamiento distribuida, o que te optimise una acelerador de Machine Learning, porque lo necesitas. En estos casos, el modelo ni siquiera va a ser como hacía en ocasiones anteriores de puesaltar a opus4.8 y que sea ese modelo que te responde a sino que activamente van a estar aplicando medidas de sabotaje en las propias capacidades del modelo para responder estas peticiones.
-
22:45
, obre el vídeo en una pestanya nova
ya se ha modificando el prom de luz o ario, con pectores que cambien el comportamiento del modelo para hacerlo peor. Es decir, estamos hablando que si tú le pidejamos del o cualquiera que antropic considera esta relacionada con la implementación de modelos fronteras, ellos activamente te lo van a sabotar. Y si eso no fuera poco... A diferencia de las interpensiones que hemos comentado antes, donde te avisa al usuario. Oye, esta petición no nos ha gustado, te dejamos que la responda opos 4.8, te avisa a lo de ello. En este caso este tipo de sabotaje va a ser invisible al usuario. Es decir, tú no vas a saber si en algún momento antropic está o no está saboteando la cuer y que tú le pidas. Esto es gravísimo. no sé, no sé, hacen el capítulo salvaje que me parece y por suerte gran parte de la comunidad en internet, estás saltando muchísimo con esto porque esta vez es un presidente que como digo es muy grave que me puede parecer ya grave el sabotaje, pero sobre todo me parece grave el que sea invisible a los usuarios que yo que te estoy pagando a Tientropic por un producto, no me permitas extraer la máxima capacidad porque esto te puede afectar a Tic como competencia. Ellos obviamente lo camuflan todo en esta hora que hace siempre antropic de lo hacemos por la seguridad del mundo, porque no queremos que otros que nos damos nosotros desarrollen esta tecnología, pero no. tiene sentido, esto es como si yo me pongo a trabajar en un proyecto en mi ordenador de un nuevo tipo ordenador y apel pues a boté a mi capacidad de utilizar rol sistema operativo empieza a relentizarme el ordenador. Si estoy lanzando una compañía de telecomunicaciones de repente pues coge movistar o botáfón ni empiezan a sabotearme la fibra no tienes sentido. Y hacer esto además de forma no transparente decir que yo no sé panisiquiera cuando tú me estás saboteando
-
24:34
, obre el vídeo en una pestanya nova
implica que yo tengo que confiar en que tus sistemas de detección de salvaguardas son correctos. Y yo lo siento antropic, pero es que si yo cojo aquí, por ejemplo, la sistem card que esto es una cosa que me gusta hacer, cojo el documento que ellos sacan y le pregunto al propio modelo pues, oye, que encuentras interesante, que funciona que no funciona la sistem card, un documento PDF y le pregunto, ¿qué datos? Interestantes encuentras de Facebook sin con el siguiente documento. Lo que acaba de suceder es lo que habéis visto en pantalla. Le he puesto el documento y me dice suititititititititititititititititititititititititititititititititititititititititititititititititititititititititititititititititititititititititititititititititititititititititititititititititititititititititititititititititititititititititititititititititititititititititititititititititititititititititititititititititititititititititititititititititititititititititititititititititititititititit usando modelos de frontera para proyectos de trabajo personales donde entreno inteligencia artificial. ¿Cómo voy a saber yo que cuando estoy entrenando una rende uranada cuando estoy optimizando un modelo no estoy obteniendo el máximo partido y no estoy siendo saboteado a través de modificaciones del pronta, a través de modificar el comportamiento del modelo. Estamos locos. Me parece que aquí, anthropic, se leído completamente de las manos. Y creo que la respuesta tan frontal que está recibiendo por parte de la comunidad, creo que va a servir para que recapaciten y modificen esto, porque realmente es una línea roja preocupante que están planteando, e hace que por mucho que me ofrezca el modelo fronteran más avanzado, realmente no quiera trabajar con él. y entiendo porque lo hacen lo hacen por el miedo a que otras compañías, empresas chinas como ha venido sucediendo de estilo en el conocimiento de estos modelos tan caros y tan útiles que nos están afresiendo para entrenar modelos o pensores, si estos se convierte en la norma, podemos ver una afectación directa a los modelos o pensores que nos siguen llegando y que nos estamos beneficiando y que permiten que toda la economía flore es lo que antropic desea y es algo a lo que entre todos tenemos que ponernos.
-
26:36
, obre el vídeo en una pestanya nova
Entendré es por tanto que el resultado de esta salida de este nuevo modelo se algo agridulse. El lo positivo es una señal inequívocada que todavía el paradigma de los modelos del lenguaje con testa en compute sigue ofreciendo frutos seguimos escalando las capacidades de los modelos. Cada mes tenemos modelos más potentes que están integrados en nuestro día a día nuestra forma de trabajar y que por tanto no vuelve a todo el mundo mucho más eficiente, mucho más capaces y por tanto mucho más productivos a la hora de afrontar nuestro trabajo, eso genial pero por maravillosas que sean estas tecnologías como consumidores no podemos permitir que se establezcan medidas que sean tan injustas para nosotros que al final somos los usuarios que estamos pagando. chicos chicas, hasta aquí en mi análisis preliminar de la salida de mitos, de feybol, modelo que ya podéis empezar a utilizar, que podéis empezar a testar, yo voy a estar trabajando mucho con él, si no me están saboteando los susos que haga pues os traeré más conclusiones en un futuro donde podamos incluso compararlo con lo que. OpenEye y puedas sacar aproximadamente G75.6. Se está volviendo complicada la competencia para Google y para OpenEye, porque no tengo tan claro que hayan entrenado pues modelos fronteras tan grandes y potentes como lo que ha hecho antropic, así que bueno, con un ojo puesto a lo que pueda hacer el movimiento de los competidores y con toda la actualidad de la inteligencia artificial que como ya sabéis, os lo contaré siempre todo por aquí. En el canal. donde todo la actualidad está y también en el canal principal. Dots de CW, donde explicamos un poquito más cómo funciona todo esto de la ya. Nos vemos en el próximo vídeo.