Intel·ligència artificial Robòtica aprenentatge automàtic LeWorldModel Yann LeCun World models JEPA SIGReg

LeWorldModel de Yann LeCun: una IA que aprèn a predir el món amb només 15 milions de paràmetres

JF Calero presenta LeWorldModel com una alternativa als models cada cop més grans. El treball aprèn dinàmiques visuals, planifica accions i redueix molt el cost d’entrenament.

La indústria de la intel·ligència artificial ha convertit la mida en una de les seves mètriques principals: més paràmetres, més dades, més acceleradors i centres de dades més grans. JF Calero dedica el vídeo a una línia de recerca que apunta en una altra direcció. LeWorldModel, o LeWM, és un model visual compacte que intenta aprendre com evoluciona un entorn i utilitzar aquesta representació per planificar accions.

El treball té Yann LeCun entre els autors i segueix la família d’arquitectures JEPA que fa anys que defensa. El resultat més cridaner és que el model publicat té aproximadament 15 milions de paràmetres i es pot entrenar en hores amb una sola GPU. Això no significa que hagi substituït els grans models de llenguatge ni que sigui una intel·ligència general. Resol un problema diferent, en entorns de control visual concrets, i encara és una recerca inicial.

El límit d’escalar només amb text

Els models de llenguatge aprenen regularitats a partir d’enormes col·leccions de text i prediuen la continuació més probable. Aquesta estratègia ha produït sistemes molt útils per escriure, programar i raonar amb informació simbòlica, però no els dona automàticament una comprensió física del món.

Per actuar amb fiabilitat, un robot o un agent necessita anticipar conseqüències: si empeny un objecte, si gira massa tard o si una superfície és inestable. Entrenar aquesta capacitat únicament a partir de vídeos crus és difícil perquè els píxels contenen molt soroll i detalls irrellevants. Predir cada píxel futur obliga el sistema a dedicar recursos a textures i variacions que potser no importen per prendre una decisió.

LeCun proposa aprendre una representació abstracta. En lloc de reconstruir la imatge exacta, el model intenta predir com canviarà l’estat latent important de l’escena.

Què és una arquitectura JEPA

JEPA són les sigles de Joint-Embedding Predictive Architecture. La idea és codificar l’observació actual i l’observació futura en un espai de característiques, i entrenar un predictor perquè anticipi la representació futura a partir de l’estat present i de l’acció executada.

Aquest espai latent pot ignorar detalls impredictibles que no afecten l’acció. Per exemple, no cal reproduir cada reflex d’una pilota per aprendre que continuarà avançant i rebotarà contra una paret. El model ha de conservar la informació física útil i descartar soroll.

LeWorldModel fa aquest aprenentatge d’extrem a extrem: l’encoder, el predictor i la representació es desenvolupen conjuntament a partir de seqüències visuals. Després, el sistema pot imaginar diferents accions en l’espai latent i escollir la que l’apropa més a un objectiu.

Dues pèrdues i un entrenament més estable

Un dels problemes d’aquestes arquitectures és el col·lapse representacional. Si l’encoder assigna la mateixa representació a totes les imatges, la predicció sembla perfecta però el model no ha après res. Altres sistemes eviten aquest resultat amb xarxes auxiliars, normalitzacions i diversos termes de pèrdua que cal ajustar.

El treball de LeWM utilitza dos objectius principals: l’error de predicció del següent embedding i un regularitzador gaussià anomenat SIGReg. Aquest regularitzador força les representacions a mantenir diversitat i una distribució útil. Segons els autors, el disseny redueix de sis a un els hiperparàmetres de pèrdua que cal ajustar i aconsegueix un entrenament estable.

La simplicitat és rellevant perquè abarateix la reproducció dels experiments. Un model de 15 milions de paràmetres entrenat en hores és accessible a més laboratoris que una arquitectura que exigeix milers d’acceleradors. Tot i això, el cost dels experiments publicats no és directament comparable al d’un assistent generalista: la tasca, les dades i l’objectiu són molt més acotats.

Aprendre física sense etiquetes explícites

En les visualitzacions del treball, la representació latent captura propietats com la posició, la velocitat o les interaccions entre objectes encara que aquestes variables no s’hagin proporcionat com a etiquetes. També pot detectar sorpresa quan el futur observat no coincideix amb el que havia anticipat.

Aquesta capacitat és útil per a robòtica i agents autònoms. Un sistema pot provar internament diverses seqüències d’accions abans de moure’s, sense haver d’executar-les totes al món real. Els autors informen que la planificació pot ser fins a 48 vegades més ràpida que en alternatives comparades, amb resultats competitius en tasques de control en dues i tres dimensions.

Les xifres provenen dels entorns experimentals del mateix article. No demostren encara que el model pugui conduir un cotxe, controlar un robot domèstic o gestionar un entorn obert amb la mateixa eficàcia. El salt entre simulacions i situacions reals continua sent un dels reptes centrals de la disciplina.

Per què pot importar a la indústria

Calero connecta aquesta recerca amb el cost creixent de la cursa de la IA. Si una part del progrés pot venir de millors objectius d’aprenentatge i no només de més càlcul, la demanda futura d’infraestructura podria evolucionar d’una manera menys lineal del que pressuposen moltes inversions.

La implicació, però, no és que els centres de dades quedin obsolets. Els models eficients solen ampliar el nombre d’usos possibles i poden acabar generant més demanda agregada. A més, LeWM no competeix directament amb un model que conversa, consulta documents o genera codi: ofereix una peça potencial per a sistemes que han d’entendre i predir entorns.

També podria complementar models multimodals grans. Un agent generalista podria encarregar el raonament visual i físic a un món latent especialitzat, mentre reserva el llenguatge per interpretar instruccions i explicar decisions.

Una pista prometedora, no una revolució demostrada

LeWorldModel és interessant perquè combina tres qualitats poc habituals: una arquitectura relativament simple, un cost d’entrenament modest i resultats de planificació convincents en benchmarks. També reforça la tesi de LeCun que la intel·ligència necessita models del món i no pot dependre només de predir paraules.

Encara falten replicacions independents, proves a gran escala i experiments en entorns físics complexos. També cal comprovar si la mateixa estabilitat es manté quan augmenten la resolució, la durada de les seqüències i la varietat de situacions.

Per això, el titular prudent no és que LeWM “salvi” la IA, sinó que ofereix una ruta diferent. Si aquesta ruta escala, podria fer que robots i agents aprenguessin amb menys dades etiquetades, planifiquessin més de pressa i utilitzessin el càlcul d’una manera més eficient. El valor del projecte dependrà de si aquests resultats compactes es mantenen quan el món deixa de ser un benchmark controlat.

Contrast i context

Fonts consultades

2 fonts
  1. 01
  2. 02

Font de treball

Transcripció amb marques de temps

10 fragments
Consulta la transcripció
  1. 0:00 , obre el vídeo en una pestanya nova

    Durante los últimos tres años, toda la industria de la inteligencia artificial ha apostado miles de millones de euros a una sola idea. Una idea que un hombre llevaba avisando desde hace tiempo de que podía estar equivocada. Ese hombre no es un cualquiera, es Jan Lecun, uno de los tres padres de la inteligencia artificial moderna. Y hace una semana, su grupo de investigadores ha publicado un trabajo que le da la razón, con un modelo que cabe en una sola tarjeta gráfica, que se entren a en unas horas y que entiende la física del mundo mejor que si estemas que han costado, una absoluta fortuna. Si esto se confirma no cambia un producto, cambia las reglas del juego y de paso, puede cambiar también donde está el dinero. Vamos a entenderlo todo desde cero. ¿Qué tal mis queridos amigos? ¿Cómo estáis? Bienvenidos a un nuevo vídeo en el canal Manuel. Hoy además estrenando un nuevo escenario que espero que nos acompaña durante mucho tiempo tanto este canal como para el cascarón de nuez, con sus ligeras y sutiles variaciones que iréis viendo en el entorno. Pero bueno, el tema está súper interesante y de hecho yo te lo comentaba en el directo que hice hace 24 horas y que te voy a recomendar al final de este vídeo. El mundo de la inteligencia artificial podría tener un primer cambio de paradigma importante en los próximos tiempos. Hay quien dice de una manera poca lítica que los modelos actuales basados en los LLMS y la forma que hay de entrenar la inteligencia artificial está o soleto o está condenado a muerte. Bueno, no hay que ser tan radical quizá de esa vida, pero también te puedo decir que en el medio y en el largo plazo esto podría ser así. Con el vagado así que tengo yo personalmente tanto en el mundo de la automoción, como en el mundo de la imagen digital, hay unos paralelismos clarísimos entre esos mundos y el mundo de la eficiencia, si me permiteis.

  2. 1:27 , obre el vídeo en una pestanya nova

    Este exabrupto que no existe de la inteligencia artificial. En este vídeo vamos a ver porque este cambio de paradigma puede ser muy importante y es que quien está dentro de este juego de esta película no es precisamente como te digo un cualquiera. Vamos a verlo. Por esta la fecha, la idea dominante en el mundo de la inteligencia artificial ha sido un esloca una frase que además es muy americano. Haclo más grande. Dale más potencia, dale más GPUs, alimenta este monstruo con más electricidad. Básicamente el entrenamiento de las inteligencias artificiales actuales se basa en disparar cañonazos cada vez con un calibre más grande, o lo que es lo mismo, utilizar miles de millones de parámetros para alimentar modelos monstruosamente grandes que necesitan la electricidad de una ciudad pequeña. y esto, si ahí doy escalando hasta llegar una situación lactual en la que estamos hablando ya de modelos, de tamaño, de centros de datos y de consumo de energías que van rozándolo disparatado. Y esta bola de nieve parece que no para de crecer no para de hacerse más grande. Pero alguien muy respetado como ya tenemos desvelado, ya enlecuno de los padres de la IA, ha dicho lo que es un secreto a voces. ¿Qué esto es? tremendamente ineficiente y que además, llegado hasta cierto punto que es el actual, comienza a ser no solo ineficiente, sino también inescalable. Y que habría que intentar encontrar otras vías para poder mejorar la eficiencia en el entrenamiento de los modelos de datos de la inteligencia artificial.

  3. 2:55 , obre el vídeo en una pestanya nova

    Vamos a intentar hacerlo de una manera comprensible. La inteligencia artificial, la actualmente, se basa en modelos que lo que buscan, es predecir cuál es la palabra, cuál es el pixel que mejor engancha o pega con el anterior. Y eso supone un consumo de recursos vestial. Imagínate que tenemos un jardín, bueno, la inteligencia artificial actual, todo el CSP. tiene que intentar conocer y imaginar cómo esa realidad para reproducirla Pixel a Pixel. Cada hoja cada fina hoja de hierba, cada elemento del jardín, como puede ser un banco, como puede ser un árbol, tiene que ir reproduciendo lo ya sea por palabras o por píxeles de una manera con un nivel de precisión verdaderamente, vestial lo cual como digo estremendamente con su midor de recursos. Así que en cierta medida está condenada a intentar reproducir la realidad con la máxima exactitud, pero siempre de una manera predicativa. ¿Qué es lo que dice Lecun? Pues dice Mirio Ustedes, si miramos la fotografía de este jardín nos encontramos con un zsp, nos encontramos cofectivamente que hay un árbol y un banco donde se entarse. A lo mejor le podíamos decir a la inteligencia artificial que hay zsp, hay un banco y hay un árbol y con eso ya tendríamos suficiente información como para poder reproducir este lugar. Y esto que parece tan simple, dicho así rápidamente, le ha puesto un nombre la Már de Xótico, la Már de XTR, que se llama Jepa. vamos a ver exactamente qué significa y que supone. Jepas son las siglas de arquitectura, predictiva de envebido con Junto. Olvida te del nombre, quedate con la idea que es muy bonita, si en lugar de obligar a laía a pintar el mundo, píxela, píxela, jepa, le obliga a predecir lo que va a pasar, pero en una especie de espacio de ideas, esto es como una suerte despacio mental que está comprimido y que es abstracto. Vamos a intentar entenderlo con un ejemplo. Si yo empujo un vaso hacia el borde de esta mesa,

  4. 4:23 , obre el vídeo en una pestanya nova

    Tú no necesitas imaginar cada pixel del cristal que ayéndose. Tu cerebro directamente sabe que se va a caer y el cristal se va a romper. Trabajas con un concepto no con la imagen con millones de píxeles. Eso es exactamente lo que intenta hacer jepa. Pero decir, ¿qué es lo que va a pasar a nivel de idea? No a nivel de reproducción fotográfica o textual. Sobre papel esto es suena perfecto, es mucho más eficiente, es mucho más parecido, como razónamos los humanos. Pero ojo, porque esa misma libertad de astraher lo que hace a Jeepa tan eficiente es justo lo que abre la puerta a su gran debilidad. Y durante años esa debilidad fue un fallo que parecía imposible de resolver. Fíjate de lo que estamos hablando, estamos diciendo que la inteligencia artificial actual estremendamente ineficiente entre comillas y que por eso necesitamos tanta potencia de computo y tanta energía, precisamente porque se tiene que asegurar de que no se está equivocando y que está reproduciendo lo que nosotros le pedimos de una manera fiel. Y lo que propone el modelo G-PA es completamente lo contrario, es decir, hacer que la realidad se convierta en algo abstracto y a continuación intenta reproducirla. Pero esto tiene un problema muy grave de simplificación y no solamente eso.

  5. 5:50 , obre el vídeo en una pestanya nova

    haciendo este mensaje de nuevo, más simple, el problema de esto es lo que se llama a montonamiento ofusión negativa, es decir que al final la inteligencia artificial como un mal estudiante como un estudiante peresoso a que le pides que te reproduzca el mundo en unas pocas palabras y al final lo que hace es apelotornando acumulando todo en un rincón de tal manera que el árbol el csp y el mismísimo banco o un balón, un niño y un campo de fútbol acaban siendo todo lo mismo precisamente porque han sido solapados a la que va a siendo amontonados. Es exactamente el mismo problema de la complejidad, pero al revés, un exceso de simplificación nos lleva a una reproducción del universo completamente desvirtuada. Con esta nueva propuesta de modelo, el problema es que los ingenieros se volvían loco, porque tenían que desarrollar. tantos parches, tantos trucos matemáticos y mucha capacidad de computo justamente para que no se le desordenara la mesa, para que no se le desordenara la fotografía y se acabaran confundiendo los términos. Y justamente el modelo Jefa de Lecun parece que han contrado la solución a este problema, ni excesivas simplificación ni matar moscas a cañorazos. Y como lo hace, con un modelo al que han llamado Sir Rech, que lo que hace es,encialmente, es distribuir la información de una manera lógica. y que funciona. Y para eso utilizan un modelo gausiano, una forma de organizar la información conforma de campana de gauz, ese modelo matemático tradicional que le permite asegurar la precisión del modelo.

  6. 7:18 , obre el vídeo en una pestanya nova

    pero sin tener que recurrir a una potencia de computo tan vestia. Es algo así como coger un motor estadounidense que en los años 70 consumía 25 litros a los 100 y conseguir la misma potencia de ese motor americano de 200 caballos con un moderno 4-cylindro europeo al que se le ha puesto un turbo compressor y una serie de soluciones más o menos sencillas para conseguir la misma potencia de salida final pero con un consumo de combustible muy bajo. O por ejemplo todo lo que es la tecnología weblet para la imagen. A lo que ahora permite que yo puedo estar grabando este vídeo en 4K, 6K, 8K y que hace años era absoluta ciencia ficción porque no teníamos la capacidad de poder comprimir la imagen hasta unos niveles en los que se pudiera reproducir con un nivel de nitidez tal como tenemos hoy en día. En definitiva lo que está proponiendo el equipo de lecun que no lo ha hecho él solo y lo que ha propuesto en este paper es un modelo para comprimir la información que maneja, la inteligencia artificial que sea mucho más eficiente que el que tenemos actualmente. Bueno, me permiten que te cuente una cosa que me ha despejado la mesa para centrarme lo que te quiero contar precisamente. porque es tan importante tener en cuenta el nivel de la velocidad de la evolución de estas tecnologías y que aunque ya están tremendamente capitalizadas o están capitalizadas estas empresas que están empezando a salir a bolsa es muy importante estar muy bien diversificados si queremos invertir en determinados segmentos como es el de la inteligencia artificial que sigue prometiendo crecimientos y rendimientos muy elevados en el futuro. Yo lo que te recomiendo precisamente es que busques la manera de poner los huevos en distintos

  7. 8:46 , obre el vídeo en una pestanya nova

    dos testos de que tengas una cardera que toque varios sectores, en el caso de la IA, uno pues una buena solución, pues es el precisamente tirar de ETFs que están expuestas en mayor o menor intensidad al inteligencia artificial. Las hay más especializadas aquí en el vídeo va a seguir viendo algunas de las que yo toco y trabajo dentro de la plataforma fridon 24 que es precisamente la fin tech que yo utilizo para hacer todas mis inversiones y quien te está ofreciendo este vídeo. Enfrido en 24 si quieres invertir en inteligencia artificial ya sea en las acciones de compañías directamente o en bolsas de ETF con mayor o menor exposición puedes hacerlo tienes más de 3.677F a tu disposición de todos los sectores que te puedas imaginar yo principalmente me centra en automosión, en tecnología, inteligencia artificial, en todo lo que se infraestructura y material, es principalmente y aquí tienes una buena ristra de hecho, las que te estoy mostrando en pantalla que están específicamente dedicadas a la IA, te las voy a poner en la descripción del vídeo para que puedas verla igualmente con mayor a menos intensidad hasta la misma mua que es una de las grandes, que son referencias a nivel mundial más capitalizadas y con menores comisiones. En el primer comentario del vídeo, también la descripción tiene su un ellace para que abra a su cuenta con frito en 24, si quieres hacerlo con mi propio enlace, además ahora con la huel compromo en función del depósito que gaba, se puedes beneficiar de regalo directo de acciones, tantas más como grande sea tu depósito. Eso, entrando en feo en 24 en el primer comentario o la descripción del vídeo con mi propio enlace. En términos numericos se supone que el modelo que han desarrollado

  8. 10:13 , obre el vídeo en una pestanya nova

    es capaz de funcionar solamente con 15 millones de parámetros. Lo cual es una simplificación vestial. Se supone que es 48 veces más eficiente que los modelos actuales. Y eso abre la puerta y esto es lo importante. A que este sistema pueda funcionar pueda correr sobre una tarjeta gráfica normal sin tener que recurrir a las costosísimas GPUs de envide que hoy en día estamos utilizando. Esto más o menos implica que con 200 veces menos piezas en el púflé. Podríamos reproducir un nivel de complejidad equivalente al de los modelos de inteligencia artificial que actualmente estamos utilizando basados en la tecnología que todos tenemos en nuestros ordenadores o nuestros super computadores. Entonces, la gran pregunta ha aparejado lo que acabo de comentar es, hoy hay entonces la hija generativa tal y como la conocemos va a desaparecer es un desastre, no, no tan rápido. Los modelos que tenemos actualmente siguen funcionando muy bien para muchas cosas, pero este nuevo tipo de compresión de la inteligencia artificial y de su entrenamiento puede generar un gran avance sobre todo en materia de entender bien la realidad física y también a la hora de planificar tareas o de razónar.

  9. 11:41 , obre el vídeo en una pestanya nova

    Y esto efectivamente tiene potencia a la medio y largo plazo para suponer un cambio de paradigma en una parte importante de la gestión de la inteligencia artificial. Y esto me lleva también a pensar algo que no está demostrado ni está comprobado, pero que se puede inferir. Emboz visto otras veces en el pasado. como una mejora, una eficiencia, ciencia, de una tecnología, provoca el efecto jibons, en lugar de reducir el consumo de estos productos lo que hace, se aumentarlo. Es decir, sin el futuro este nuevo modelo, al que por cierto han bautizado como le UVWM, acaba funcionando como prometen lo que cabe esperar, es que estos centros de datos gigantes tengan muchísima más capacidad de procesamiento para un nivel de instalación y de energía electricado. O lo que es lo mismo. ese aumento de la potencia va a hacer que los centros de datos sigan, hipotéticamente, creciendo, al mismo ritmo, solo que ahora ofreca un poder de computación superior. Y, por lo tanto, este producto se acabaría democratizando por un lado, siendo más económico, por ende, o igualmente siendo mucho más potente, es súper potente con lo cual tendríamos una inteligencia artificial todavía más potente de lo que habíamos imaginado con estos nuevos modelos. Esto por supuesto es una suposición por mi parte, es una predicción, pero a lo largo de la historia historia y desde que empezó la revolución industrial cuando Gibbon, observó este fenómeno en los telares en los que cuando se aumentaba su eficiencia y tenían menos consumo de vapor en lugar de comprar menos telares, lo que hacían los industriales y los empresarios era comprar más telares para producir más porque podían permitirse el lujo de comprar más con el aumento de la eficiencia, bueno pues cabría esperar algo parecido con la inteligencia artificial y ojo porque le cum crey tanto en este proyecto que él y el equipo en el que se ha dado rodeado ha creado una start-up propia

  10. 13:09 , obre el vídeo en una pestanya nova

    nueva, le cum de joven meta en el año 2025, dejando igualmente un vacío importante en ese lugar, y ha creado una start-up, que nada menos que ha conseguido mil millones de dólares de financiación para desarrollar este nuevo tipo de tecnología. O sea que no estamos hablando ni de teorías ni estamos hablando de enseñaciones. Ahora toca ponerlo en la práctica, pero que sepas que ya están trabajando en ello. Bueno, queridos amigos, ya vosotros que os parece todo esto. A mí como mínimo me parece interesante. Y creo, eso si lo creo sinceramente que al inteligencia artificial le queda mucho para mejorar su eficiencia en cuanto a su capacidad para procesar con menos recursos tanto por la parte del hardware como consecuentemente por la electricidad que consume. Me encantaría leer vuestros comentarios, me encantaría leer que os parece este modelo de lecún en le USB-M y el modelo GPA y en definitiva estaré muy atentos porque podría superar. un cambio de paradigma que también puede cambiar las reglas del juego en lo que se supone a los grandes popes de la inteligencia artificial que son los que marcan el paso a nivel de valoración en el mundo de la economía y por supuesto en el mundo de la bolsa. Hasta el siguiente vídeo, querida familia. Adiós.