ESP32 i IA física: per què un xip barat pot executar models al dispositiu
Els ESP32 no poden executar un ChatGPT complet, però sí models TinyML per reaccionar amb poca latència, sense núvol i amb un cost molt baix.
Un ESP32 costa pocs euros i té una potència ínfima al costat d’un centre de dades. Tot i així, pot ser una peça important de la “IA física”: sistemes que capten informació amb sensors, prenen una decisió concreta i actuen sobre el món real.
El vídeo d’IoT Lab explica per què els microcontroladors poden executar models petits directament al dispositiu. La idea és sòlida, però cal separar tres coses: el suport real de Google i Espressif per a TinyML, l’aposta de NVIDIA per la robòtica i la connexió més especulativa que l’autor fa amb els agents d’Anthropic.
1. Del xat al món físic
Quan escrivim a un assistent com ChatGPT o Claude, el dispositiu envia una petició a un servidor, el model la processa i la resposta torna per internet. L’ordinador o el mòbil fan d’interfície; el càlcul més exigent passa al núvol.
Un robot, una alarma o una màquina industrial no sempre poden esperar aquest viatge. A 01:00, el vídeo posa dos exemples:
- un robot que ha de frenar en una fracció de segon;
- un sensor amb una bateria petita que no pot transmetre dades constantment.
Executar la inferència al mateix dispositiu redueix la latència, limita el trànsit de xarxa i permet continuar funcionant sense connexió. Aquest enfocament s’anomena edge AI. Quan la intel·ligència percep, raona i actua en entorns reals, també es parla d’IA física.
2. El “moment ChatGPT” de la robòtica
L’autor situa el canvi al CES de Las Vegas de gener de 2026. NVIDIA hi va anunciar nous models, eines i infraestructura per a IA física, i Jensen Huang va declarar que el “moment ChatGPT” de la robòtica ja havia arribat.
A 01:45, el vídeo ho relaciona amb Cosmos, els models de món de NVIDIA, i amb demostracions de fabricants com Boston Dynamics i Hyundai. Aquests sistemes busquen que robots i vehicles entenguin escenes, planifiquin accions i provin comportaments en simulació abans d’actuar.
No és, però, el mateix tipus de model que pot cabre en un ESP32. Els models de NVIDIA s’entrenen i s’executen amb una infraestructura molt més potent. El microcontrolador apareix en un altre extrem de la cadena: pot llegir un sensor, reconèixer un patró simple o activar un actuador de manera barata i immediata.
3. Per què l’ESP32 encaixa en aquesta arquitectura
Si la IA física s’ha de desplegar en fàbriques, camps, edificis o ciutats, no tots els punts de captació poden costar centenars d’euros. A 02:59, IoT Lab defensa que fan falta dispositius:
- prou barats per instal·lar-ne molts;
- eficients per treballar amb bateria;
- connectats a sensors i actuadors;
- capaços de respondre localment;
- compatibles amb eines de desenvolupament accessibles.
La família ESP32 d’Espressif compleix bona part d’aquests requisits. Integra microcontrolador i connectivitat, disposa d’un ecosistema molt ampli i es pot programar per capturar temperatura, vibració, so, imatge o presència.
El preu exacte depèn del model, la placa, la memòria i el distribuïdor. Dir que “un ESP32 costa dos euros” és una simplificació possible per a alguns mòduls, no una tarifa universal.
4. TinyML: models acotats, no un ChatGPT en miniatura
La prova més concreta del vídeo arriba a 04:00. Espressif manté una integració de TensorFlow Lite Micro —avui dins de l’ecosistema LiteRT— per executar inferència en els seus xips. El repositori públic inclou exemples de detecció de persones, reconeixement de paraules i altres tasques.
També incorpora ESP-NN, una biblioteca amb operacions optimitzades per aprofitar millor el maquinari. Les taules del projecte mostren reduccions molt grans del temps d’inferència en exemples concrets, però no hi ha un únic multiplicador aplicable a qualsevol model.
El terme clau és TinyML. Un microcontrolador pot:
- detectar una paraula d’activació;
- classificar sons o gestos;
- identificar una persona en una imatge petita;
- trobar patrons de vibració que indiquin una avaria;
- decidir si cal obrir una vàlvula o enviar una alerta.
No pot allotjar un model de llenguatge gegant comparable amb els serveis de núvol. La memòria, la capacitat de càlcul i el consum imposen límits estrictes. Cal entrenar o adaptar el model en una màquina més potent, quantificar-lo i desplegar-ne una versió petita per a una funció definida.
5. Avantatges de fer la inferència en local
El vídeo resumeix els beneficis a 09:18. El primer és la velocitat: no cal esperar una API remota. El segon és la disponibilitat: una instal·lació agrícola o una màquina en una zona sense cobertura pot continuar treballant.
També hi ha avantatges de cost i privacitat. Si el dispositiu classifica localment una vibració o una imatge, evita enviar totes les dades i pagar una petició per cada mostra. Mantenir la informació al lloc d’origen pot reduir l’exposició, encara que la seguretat final dependrà del firmware, les claus, les actualitzacions i la xarxa.
L’opció més realista sovint és híbrida. L’ESP32 resol la decisió immediata i envia al núvol només un resultat, una alerta o les mostres excepcionals. Un sistema central pot fer l’anàlisi complexa, coordinar dispositius i actualitzar els models.
6. Anthropic i MCP: una connexió possible, no una inversió en ESP32
Després de 06:47, l’autor entra en la part que ell mateix qualifica d’especulativa. Relaciona el Model Context Protocol (MCP) d’Anthropic amb el pas dels agents d’IA des del xat cap a eines, bases de dades i sistemes reals.
MCP és efectivament un estàndard obert perquè aplicacions d’IA es connectin de manera estructurada amb eines externes. Anthropic el va donar el desembre de 2025 a l’Agentic AI Foundation, un fons de la Linux Foundation cofundat amb Block i OpenAI.
D’aquí no es pot deduir que Anthropic estigui invertint en ESP32 ni comprant microcontroladors. MCP pot arribar a interactuar amb una passarel·la IoT que controli dispositius, però el protocol i el xip ocupen capes diferents. La relació que proposa el vídeo és una arquitectura plausible, no un acord anunciat.
Conclusions
L’ESP32 no és el “ChatGPT de la IA física” ni substituirà el centre de dades. El seu valor és més discret i pràctic: posar una mica d’inferència allà on es produeixen les dades i on cal actuar de pressa.
NVIDIA confirma que la robòtica i els models que entenen el món real són una prioritat industrial. Espressif demostra que tasques de TinyML es poden optimitzar per a microcontroladors econòmics. Anthropic, amb MCP, facilita que els agents utilitzin eines externes, però la connexió directa amb aquest maquinari encara és una interpretació de l’autor.
La tendència important és l’arquitectura distribuïda: models grans al núvol, models petits al límit i dispositius connectats que converteixen una decisió digital en una acció física.
Contrast i context
Fonts consultades
- 01
- 02
- 03
- 04
Font de treball
Transcripció amb marques de temps
Consulta la transcripció
-
0:00
, obre el vídeo en una pestanya nova
Esto de aquí es un SP32 que puede llegar a costar unos 2 € o menos y en los próximos minutos te voy a demostrar con nombres, fechas, incluso un repositorio de GitHub que este chip de 2 € que veis por aquí es una de las piezas que más está persiguiendo las grandes empresas que mueven miles y millones de euros como Google, Antropic, los creadores de Cloue o incluso Nvidia. Y antes que nada, para entender el porqué de lo que te estoy diciendo y por qué este SP32 tiene tanta importancia, hay que poner en contexto de cómo estamos interactuando con la inteligencia artificial a día de hoy. Y como muchos seguramente sabéis, nosotros vamos a dedicarnos a hablar por un chat, como puede ser pues este chat GPT, el chat de Cloula, herramientas similares. Todo nuestro mensaje se enviará como una petición a un servidor gigante, a estos centros de datos inmensos. Cuando llega allí, hay un modelo gigante que procesa ese mensaje y da una respuesta y después esa respuesta vuelve hacia ti. Tu portátil OPC no hace nada, solo el centro de datos que te da la respuesta que tiene el modelo y tú lo recibes. Pero hay un tipo de inteligencia artificial que no puede funcionar así y es la que necesita percibir y actuar justo en un momento sin ese viaje de ida
-
1:08
, obre el vídeo en una pestanya nova
y de vuelta a los centros de datos para que el modelo lo procese y te dé una respuesta. Por ejemplo, un robot en una fábrica no puede esperar para decidir si tiene que frenar en 300 milisegundos y esperar esa ida y vuelta. Tiene que hacerlo al momento, casi que en tiempo real. O por ejemplo, un sensor que está funcionando con una pila de botón y no puede estar constantemente hablando con la inteligencia artificial que hay en la nube en esos centros de datos. A esta necesidad que hay de que la inteligencia artificial esté más en el borde, en el propio dispositivo y no en esos centros de datos, se le llama HI o como concepto mucho más general la IA física. Y aquí es donde entra esa primera pieza de todo el puzzle que vamos a ver en este vídeo. Este enero de 2026 en el CES de Las Vegas, una de las ferias más importantes relacionados con la tecnología, donde obviamente hay inteligencia artificial. Jensen Juan, creo que se pronuncia así, el CEO de Envidia, para entendernos, dijo literalmente que estamos viviendo el Chat GPT de la IA física. O en otras palabras, él cree que lo que pasó con Chat GPT en el mundo del software cuando apareció y todo el mundo se dio cuenta de la utilidad que tiene, está sucediendo ahora con la IA física, con máquinas que entienden, razonan e interactúan en el mundo real. Esto suena
-
2:15
, obre el vídeo en una pestanya nova
mucho a IoT, el tema principal de este canal, que es dotar a los sitios de sensores o incluso a los propios objetos para que interactúen con el mundo físico, pero añadiendo esta capa de inteligencia que le puede dar la inteligencia artificial. Nvidia presentó ahí Cosmos, un modelo entrenado con 20 millones de horas de vídeo del mundo físico para que los robots aprendan a moverse por él, incluso predecir lo que va a pasar. Y no solo fue envidia, también habían empresas como Boston Dynamics, esta tan conocida de los robots que seguro que habéis visto alguna vez, que también tenía estos speech y estas demos que son habituales de como los robots interactúan con el mundo físico o por ejemplo empresas también grandes como Hyundai, que también decían que estaban utilizando este tipo de stack. Y aquí, después de escuchar toda esta información, nos viene la siguiente pregunta a la cabeza. Vale, pues si la inteligencia artificial claramente el siguiente paso es que pase a estar en el mundo real, en el mundo físico, que tenga sensores, que interactúe, que se mueva por las fábricas, por las casas, por las calles, esos ojos y esas manos, los sensores, no pueden valer miles y miles de euros. debería ser algo baratísimo para que realmente sea producible a gran escala y
-
3:21
, obre el vídeo en una pestanya nova
en masividad, incluso que les dure mucho la batería, que lo pueden gestionar. Y en ese punto probablemente es donde muchos de los que seguíis este canal ya vivimos, ya estamos haciendo proyectos IoT en el que colocamos sensores y dispositivos que interactúan con el mundo físico y quizá no tienen esta inteligencia, pero sí que tenemos esa primera capa de esa infraestructura para poder comunicarnos y entender lo que estamos poniendo en el mundo físico, en los escenarios realmente que acabo de mencionar ahora, en fábricas, en agricultura, en ciudades. Y todo pasa otra vez, volvemos a lo mismo, por este cacharrito de aquí, por un SP32. Y aquí yo voy a dejar de hablar de datos en general y voy a dar datos concretos porque Google ya ha apostado por algo así. Google tiene un framework que se llama tensor flow light micro, que seguro que a muchos os suena, pero que ahora lo han rebautizado con un nombre y se llama Light RT for Microcontrollers, que está específicamente diseñado para meter modelos de inteligencia artificial en estos cacharritos baratos de aquí, en estos microcontroladores. Y resulta que la empresa que fabrica estos chips, estos SP32, que es la empresa Expressif, ha trabajado codo con codo con Google en este framework, específicamente para
-
4:30
, obre el vídeo en una pestanya nova
poder sacarle el máximo partido al SP32 S3, el cual también tenemos en un vídeo en este canal. Y quiero dejarlo claro, eh, no es que simplemente funcione también para el SP32 S3, no, no va de eso. Hay un repositorio público que se llama SPTF Lite Micro, donde han escrito kernels a medida que aprovechan las instrucciones vectoriales que tiene el SP32 S3 y consiguen entre cuatro y ocho veces más velocidad. ¿En qué? Pues en las típicas multiplicaciones de matrices y convolución que tiene un SP32 normal, o sea, bajando la tierra. Google ha dedicado ingeniería de verdad, que no es un comunicado de prensa, a que un chip como este de 3 € barato pueda detectar una palabra de activación, reconocer un gesto o clasificar incluso lo que ve una cámara, pero todo sin necesidad de hablar con la nube en el propio hardware. Y esto conecta con cosas que he hecho yo en proyectos y en vídeos de este canal, como por ejemplo cuando vimos cómo poníamos el modelo de Yema 4 nuevo de Google en una Raspberry P, porque obviamente Google ya ha estado toqueteando y jugando con todas estas cosas, solo que esto del microcontrolador es llevado ya al extremo, a lo más básico. Una Raspberry Pie te cuesta bastante más, pero todo pasa por la misma idea. Tener estos modelos muy pequeños y optimizados en
-
5:45
, obre el vídeo en una pestanya nova
hardware mucho más barato y sin necesidad de hablar con la nube. Por cierto, si todo esto te está gustando, te atrae, tengo una comunidad llamada IoT Builders donde enseño IoT, es decir, cómo vamos a pasar de esta infraestructura, de poner sensores que controlan cosas en el mundo físico, que digitalizan y además también le podríamos añadir la capa de inteligencia artificial. De hecho, tengo un módulo de formación dentro de la comunidad solo de inteligencia artificial y no es el típico de voy a abrir chat GPT y voy a ponerle un prompt, no, no hablo de todas las capas que hay de inteligencia artificial, las ramas que hay y qué cavidad tienen dentro de proyectos IoT. Y lo primero que hago es hacer una llamada con la persona que entra para saber su caso específico y poder orientarle hacia dónde tiene que ir o qué contenido consumir dentro de la plataforma de Yote Builders, porque hay mucha formación y quizá abruma un poco y no sabes por dónde tirar, pero eso no va a ser un problema porque en esa llamada, como digo, vamos a ver qué es lo que tú necesitas. Tiene el precio que tiene una suscripción barata normal, como puede ser Netflix, así que tampoco te vas a gastar un dineral. Échale un vistazo y seguimos con el vídeo. Y ahora voy con la parte quizá un poco más especulativa
-
6:49
, obre el vídeo en una pestanya nova
del vídeo, porque también he puesto en la miniatura y en el título a Antropic, que es los creadores de cloue que si bien no invierten en el hardware, es decir, no hacen cosas como las que acabo de mencionar con Google, sí que es verdad que han hecho muchas cosas que puede ser que vayan orientadas hacia todo este tema del hardware, donde hay modelos en el propio hardware y no en la nube. Por ejemplo, Antropic ha creado lo que para mí es la primera advertencia que el mundo va hacia eso del mundo físico, controlar el mundo físico y no tanto un chat GPT que te controle o que te sepa decir algo del trabajo que es el MCP, el Model Context Protocol. Para quien no lo sepa, es un estándar abierto para que un modelo de inteligencia artificial pueda usar herramientas externas de forma ordenada. por ejemplo, interactuar con una API, con una base de datos o llamar a cualquier otro sistema externo en lugar de solo generar texto. Y en diciembre de 2025 hace no tanto, donaron ese MCP para que dejase de ser el protocolo de contexto de Antropic y fuese algo mucho más global. De hecho, se donó a la Linux Foundation para que sea algo mucho más abierto para todo el mundo, como puede ser HTTP o TCP en su día. ¿Y por qué te estoy contando esto en un vídeo de SP32? pues que por lo que
-
8:02
, obre el vídeo en una pestanya nova
se está viendo, la idea de fondo que hay en toda esta industria es que los agentes de IA dejen de limitarse a hablarte por un chat y empiecen a actuar sobre sistemas reales, sobre sistemas del mundo físico. Así que en algún punto de toda esta cadena tiene que haber un dispositivo barato conectado que pueda ser desplegable a escala y que sea realmente el encargado de conectarse con el mundo físico, con los sensores y actuadores, por ejemplo, que mida la temperatura, que abra una válvula, que detecte que hay alguien en una sala. Y ese dispositivo, en la mayoría de situaciones en el mundo real que se hacen a día de hoy, pasa por este sensor tan barato como lo es el SP32. No te estoy diciendo que Antropic esté comprando contenedores de SPS 32, pero sí que es verdad que tal y como lo estamos viendo cómo está funcionando y hacia dónde va el mundo de la inteligencia artificial y los agentes de ella, pasa por tener este hardware barato que controle el mundo físico y hoy por hoy lo más parecido, como digo, es el SP32. Vale, aquí viene la parte útil y la que realmente quiero que entiendas porque quizá alguno ya está pensando que en este cacharrito de aquí va a haber un chat GPT como el que hay cuando tú interactúas por chat, como hacemos normalmente. Y la verdad es que
-
9:08
, obre el vídeo en una pestanya nova
ni de lejos este cacharrito de aquí es imposible que llegue a tener nunca el poder de computación que tienen estos servidores donde están estos modelos gigantescos. Lo que se pretende es que este tipo de dispositivos puedan hacer acciones acotadas muy bien, sin necesidad de estar hablando con la nube. Por ejemplo, detectar como se dice una palabra o clasificar un sonido o una imagen o incluso detectar vibraciones de un motor y avisar cuándo se va a estropear. Y aquí seguramente también habrá gente pensando, "Vale, pero si realmente el modelo que hay en la nube es mucho mejor, ¿por qué tendría que pensar en meter inteligencia en este SP32? complicarme la vida cuando ya lo puedo hacer hablando por las APIs, con la nube, con los grandes modelos, incluso van a ser mucho mejores. Pues la realidad es que es así, pero es que no estás viendo realmente la imagen completa y realmente la funcionalidad por la que deberíamos usar este tipo de hardware. Y es que, como digo, primero que hablar con la nube tiene esa latencia que es mucho más lenta que la que vamos a tener si colocamos el modelo dentro de este hardware. va a ser casi instantáneo si lo colocamos en un SP32 o en una Raspberry P. Por otro lado, quizá no tengas ni cobertura, porque sí, obviamente que en la situación de estar
-
10:18
, obre el vídeo en una pestanya nova
en tu casa con tu portátil y hablando con CHGT, pues seguramente tengas internet y todo sea favorable y muy bueno. Pero si vamos a colocar este tipo de modelos y necesitamos esta inteligencia en zonas agrónomas, que no hay ni siquiera internet ni cobertura, sitios en la montaña o zonas en las que ni de broma vamos a tener internet y buena cobertura, pues tener estos modelos en local en el propio hardware nos solucionan la vida. Incluso por el mero hecho de que te estás ahorrando pagar pues una suscripción o estas cuotas que te dan por gastar tokens, ya que lo tienes todo en local, es tuyo y no estás hablando con nadie en la nube. Así que resumiendo, la IA física va a tener bastante importancia en los próximos años y es importante que al menos metas un poco la cabeza y aprendas a cómo funciona todo esto. Y como digo, y hay empresas como Google que han invertido dinero en hacer estos frameworks para poder trabajar en estos cacharros tan pequeños y tan baratos. Así que en el caso de que te haya quedado esta curiosidad por hacer algo así, tener un modelo en el propio hardware barato, te dejo por aquí un vídeo en el que hice justamente eso. Cogí un modelo de Google que salió hace no mucho, Yema 4 y lo despliegué en una Raspberry Rrypi. Así que te veo por ahí.