Privacitat Hermes Agent IA local Ternary Bonsai 27B RTX 3080 llama.cpp models ternaris

Una IA local de 27B en una RTX 3080: què pot fer Ternary Bonsai amb 10 GB

Ternary Bonsai 27B funciona en una RTX 3080 de 10 GB i prova PDFs, OCR, codi, fitxers i Excel. Expliquem rendiment, privacitat, costos i riscos.

Un model de 27B dins de 10 GB de VRAM

El vídeo d’AlehandoroVR executa Ternary Bonsai 27B en una GeForce RTX 3080 de 10 GB sota Windows 11. La pregunta és deliberadament ambiciosa: pot una IA local substituir ChatGPT per a les tasques quotidianes?

La clau és una representació ternària extrema. El model parteix d’una arquitectura de 27,3 mil milions de paràmetres i restringeix els pesos principals a tres valors: −1, 0 i +1, amb una escala compartida per grup. Prism ML declara un cost efectiu ideal d’1,71 bits per pes i un fitxer desplegat d’uns 7,2 GB, molt per sota dels aproximadament 54 GB d’un model FP16.

No és una quantització convencional aplicada després d’entrenar. La família Bonsai busca conservar el comportament del model en aquest espai de pesos reduït i necessita kernels adaptats. La fitxa oficial diu que manté el 94,6% de la mitjana FP16 en quinze benchmarks, però aquestes són mesures del mateix equip i s’han de contrastar de manera independent.

El muntatge i la seguretat abans de començar

La demostració carrega el GGUF amb un servidor local compatible amb llama.cpp i obre una interfície web al mateix ordinador. La VRAM queda gairebé plena, però el model hi cap i pot processar text sense enviar-lo a una API externa.

Després es connecta a Hermes Agent, que aporta eines, fitxers, habilitats i canals de missatgeria. En aquest punt deixa de ser només un xat i pot crear directoris, moure documents, executar ordres o automatitzar tasques.

El mateix creador recomana aïllar un agent autònom amb Docker o una màquina virtual, encara que ell fa la prova al seu Windows de treball. És una advertència essencial: un model local pot equivocar-se i una instrucció maliciosa dins d’un document pot intentar manipular-lo. Els permisos s’han de limitar per usuari, carpeta, xarxa i credencial.

La privacitat tampoc és absoluta si s’activen cercadors, correu, WhatsApp, Telegram o altres serveis. La inferència pot quedar al PC, però cada connector té la seva pròpia ruta de dades.

Velocitat: interactiva en una RTX 3080

En una conversa curta, el vídeo mostra aproximadament 1.000 tokens per segon de processament del prompt i 48 tokens per segon de generació. És una velocitat còmoda per a un únic usuari i notable en una GPU de 2020.

La xifra no és universal. Depèn del fork de llama.cpp, els kernels, el context, la memòria cau, la mida de lot, l’offload i la resta del sistema. Un prompt llarg pot omplir la memòria amb la KV cache encara que els pesos hi càpiguen.

La fitxa de Prism ML situa el pic al voltant de 8,4 GB amb 4.000 tokens de context sense compressió de cache i per sobre de 14 GB amb 100.000. Amb cache de 4 bits, l’equip afirma que 100.000 tokens baixen cap als 10,1 GB. Per tant, «cap en 10 GB» és cert per a l’ús mostrat, però no per a qualsevol context màxim.

PDFs, imatges i OCR

La primera tasca real és resumir un llibre en PDF. El servidor processa el text a gran velocitat i genera un resum breu amb el mode de raonament activat. El vídeo no compara el resum amb el llibre complet ni comprova omissions, de manera que valida el flux, no la fidelitat.

El model també rep una imatge amb text. Extreu el missatge i descriu la persona representada. Bonsai utilitza una torre de visió opcional de prop de 0,63 GB; aquesta peça es carrega per a entrades visuals i no forma part del pressupost mínim de text.

L’OCR funciona en l’exemple, però una sola miniatura nítida no permet extrapolar a factures tortes, manuscrits, taules o documents amb baixa resolució. En processos importants cal comparar cada camp amb l’original i conservar cites o coordenades.

Programació: una web completa a partir d’una carpeta

El creador entrega un prompt, una ruta de treball i diverses imatges. El model planifica, escriu l’HTML i produeix una web dinàmica que reutilitza els recursos disponibles. La interfície és funcional i es podria modificar amb noves instruccions.

És una prova útil de capacitat general, però no es revisen accessibilitat, seguretat, compatibilitat mòbil ni manteniment del codi. Tampoc es compara amb un model de núvol sota el mateix prompt.

La diferència més interessant és operativa: el codi i els recursos no han de sortir de l’equip. Per a un projecte privat això pot ser un avantatge, sempre que el servidor local i les extensions no tinguin telemetria o connexions externes inesperades.

Hermes Agent: de respondre a actuar

Amb Hermes, el model rep una carpeta d’imatges i en crea subcarpetes. En la prova classifica sobretot a partir dels noms de fitxer. El vídeo apunta que podria analitzar visualment cada imatge, però no executa aquesta versió més lenta i exigent.

La diferència importa: ordenar per nom és una operació de text; entendre milers de fotos obliga a carregar la torre visual, processar cada fitxer i gestionar errors. També cal preparar una previsualització abans de moure material valuós.

El següent exemple utilitza una «skill» de comptabilitat creada a partir d’un full Excel fictici. L’agent llegeix categories, calcula gasolina, supermercat, restaurants, hipoteca i separa despeses fixes i variables. No hi ha dades reals ni una conciliació manual, així que no s’ha d’interpretar com un sistema comptable validat.

Les habilitats reutilitzables són potents, però també són codi i instruccions amb accés. S’han de versionar, revisar i limitar, especialment si provenen de tercers.

Local no és igual a gratuït

No hi ha una factura per token, però existeixen altres costos:

  • la GPU, la RAM i l’emmagatzematge;
  • electricitat i calor;
  • temps d’instal·lació i manteniment;
  • descàrregues de models i actualitzacions;
  • còpies de seguretat i seguretat;
  • possibles APIs dels connectors.

Una RTX 3080 ja amortitzada pot fer el projecte molt atractiu. Comprar maquinari només per aquesta finalitat exigeix comparar el cost total amb una subscripció o una API de pagament.

Pot substituir ChatGPT?

AlehandoroVR estima que pot cobrir el 90% dels usos d’una persona corrent. És una apreciació personal, no una mesura. La demostració confirma xat, resum, visió, codi, fitxers i Excel, però no avalua coneixement actual, recerca amb fonts, idiomes, context extrem, seguiment d’instruccions ni taxa d’al·lucinació.

Un model local té avantatges clars:

  • control de les dades i disponibilitat sense internet;
  • cost marginal baix després del maquinari;
  • integració directa amb fitxers i eines;
  • absència de límits comercials per missatge.

Els models de núvol continuen oferint més capacitat punta, context gestionat, eines allotjades, actualitzacions i menys feina operativa. Per a moltes persones, la millor solució serà híbrida: Bonsai per a documents i automatitzacions locals, i una API potent per a tasques difícils o informació actual.

Conclusió

Ternary Bonsai 27B demostra que un model gran pot funcionar de manera interactiva en 10 GB de VRAM. Les proves de PDFs, OCR, web i Hermes van molt més enllà d’un simple xat i mostren el valor de mantenir dades i eines a l’equip.

La compressió té un preu: el model perd qualitat respecte de la versió completa, el context consumeix memòria i les accions autònomes introdueixen riscos. Tampoc tot el flux és privat si es connecta a serveis externs.

No és un reemplaçament universal de ChatGPT, però sí una alternativa real per a una part gran del treball personal, especialment quan privacitat, control i cost recurrent pesen més que obtenir sempre la millor resposta disponible.

Contrast i context

Fonts consultades

4 fonts
  1. 01
  2. 02
  3. 03
  4. 04
    Nous Research Hermes Agent

Font de treball

Transcripció amb marques de temps

10 fragments
Consulta la transcripció
  1. 0:00 , obre el vídeo en una pestanya nova

    ¿Puede una tarjeta gráfica de hace 6 años instalarle una inteligencia artificial y sustituir completamente a HGPT? Porque seamos sinceros, cada vez estamos dependiendo más de asistentes con inteligencia artificial. Llámalo Grock, llámalo CHG GPT, Claude o el que tú quieras. Con ellos escribimos correos, programamos, resumimos documentos, analizamos PDFs, buscamos información, pero llega un momento en el que prácticamente todos hacen exactamente lo mismo. Te salta con el típico mensaje de "Has llegado al límite y te toca pagar." Y es que realmente estas grandes compañías nos han puesto el caramelito en la boca y justo cuando le íbamos a dar el bocado nos lo han quitado. Y de ahí que surja todo este movimiento sobre la inteligencia artificial local. Durante este vídeo os voy a enseñar las capacidades que tiene una inteligencia artificial ejecutándose en una tarjeta gráfica de hace ya 6 años. Estamos hablando de una RTX 3080 con 10 GB de RAM. Además, te va a poder ayudar en el trabajo, vas a poder programar, vas a poder automatizar tareas, vas a poder analizar vuestro ordenador completo e incluso controlar un agente de inteligencia artificial capaz de ejecutar acciones por vosotros. Además, lo vas a poder conectar a WhatsApp, a Telegram, a cualquier aplicación, inclusive el Discord, todo funcionando en este ordenador o en el tuyo propio. Y lo más importante, totalmente privado y sin mandar ni un solo dato a la nube. Pero la pregunta va a ser entonces, ¿será suficiente? ¿Podremos sustituir en estos casos a CH GPT? Pues en este vídeo vamos a cacharrear porque a mí esto es lo que

  2. 1:24 , obre el vídeo en una pestanya nova

    más me gusta. Así que familia, quedadoos porque está el tema que te quema. Como ya os he dicho, todo esto lo vamos a ejecutar directamente en nuestro ordenador bajo Windows 11 Pro y sin complicarnos prácticamente la vida. Esto es muy sencillito. Es importante y además sería ideal que si vais a ejecutar un agente totalmente autónomo, lo tengáis completamente aislado de vuestro ordenador principal, ya sea mediante Docker o con una máquina virtual o como vosotros queráis. Básicamente para que la gente no sea capaz de tocar ningún archivo de sistema y liarte la parda. Pero bueno, yo en este caso me la voy a jugar y lo vamos a instalar directamente con mi propio Windows, con el que utilizo para trabajar. Así que vosotros si queréis hacerlo, tener mucho cuidado. Eso sí, lo que sí que tenéis que tener cuidado es con todo el tema de las activaciones y los crack para poder utilizar vuestro Windows. Sí, este es el anuncio de nuestro querido sponsor. En mi caso, como siempre os cuento, uso las claves de JBG Mall para poder registrar ya no solo las instalaciones de mi Windows de forma totalmente original y segura, sino también incluso las de Microsoft Office para que de esta forma no tener que depender absolutamente de ningún crack o activador o lo que sea que te la pueda liar parda, porque sinceramente no es la primera y última vez que veo algo asimilar. Y siendo sinceros, una licencia de Windows 11 Pro con el código de VR25 se te va a quedar por menos de 24 €. También tenéis una oferta con el Office 2024, el cual se te va a quedar por menos de 19 €. Sinceramente, estos precios, la verdad que están

  3. 2:49 , obre el vídeo en una pestanya nova

    tremendamente bien. En definitiva, unos precios muy buenos para tener tus licencias 100% originales y que sean completamente tuyas. Recordad que, como siempre, os dejo los enlaces en el cajón de información por si queréis echarle un vistazo y recordar utilizar el código VR25. Y ahora sí, vamos a pasar con todas las pruebas porque se nos vienen cositas. Estar atentos porque esto mola muchísimo. Bueno, y aquí estamos ya directamente para trastear con esta inteligencia artificial. Lo primero que tengo que deciros es que aquí tenemos el navegador ejecutándose el local para para poder ver el cerebro. También tenemos Hermes porque lo vamos a conectar a Hermes. Os voy a enseñar después cómo funciona. Podemos ver el administrador de tareas donde vais a ver específicamente cómo va funcionando la GPU, los 10 GB, cómo están de llenos, etcétera. Y además tenemos también el modelo cargado, que lo tenemos aquí, que básicamente pues es una un comando que yo tengo puesto aquí para poder cargar el cerebro en nuestra memoria VRAM de la 3080. En concreto, estamos moviendo el Ternari Bonsai 27B, que es un modelo cuantificado de forma extrema de uno de los mejores modelos que hay actualmente en el mercado. Estamos hablando del Kwen 3.627P. Se utiliza para todo tipo de tareas y es de lo mejorcito que hay. Y con esta cuantificación podemos instalarlo en tarjetas gráficas de 8, de 10, de 16 GB, de 12, de lo que sea, teniendo una IA bastante potente. Lo primero que vamos a hacer es preguntarle simplemente, bueno, hablarle para ver cómo funciona. Le ponemos el típico, "Hola, ¿cómo estás?" Y aquí automáticamente vais a ver la

  4. 4:15 , obre el vídeo en una pestanya nova

    velocidad a la que se mueve y la velocidad a la que responde. Ha sido capaz de leer, procesar el pron aproximadamente a unos 1000 tokens por segundo y ha sido capaz de responder con 48 tokens por segundo, lo cual no está nada mal, es bastante rápido. para ver cómo de inteligente es y el volumen de datos que tiene en vez de estar buscando el internet, sino que utilice su propio conocimiento, le vamos a preguntar exactamente qué significa que un modelo de inteligencia artificial tenga o use una cuantificación ternaria. Le damos a intro y él va a razonar la respuesta y nos va a decir exactamente qué es lo que es, cómo funciona, qué es lo que tenemos, las ventajas, el beneficio, etcétera, etcétera, etcétera. Todo esto sin conectarse a internet totalmente local y en vuestro ordenador. Así que imaginaos el nivel de privacidad que vamos a poder tener con un sistema así, de esta manera. La siguiente prueba que vamos a hacer es muy sencilla. Le vamos a pasar un PDF y le vamos a decir que nos haga un breve resumen. Te paso un libro en PDF y necesito que me hagas un breve resumen. Le damos, él automáticamente va a cargar el modelo. Ya lo está leyendo. Está leyendo aproximadamente a unos 1000 tokens por segundo, lo cual no está nada mal. Está aproximadamente por el 60. Ya estáis viendo cómo funciona. Lo estáis viendo en tiempo real. Una vez que ha terminado de procesar la información, empieza a razonar la respuesta que nos quiere dar. Que sepáis que podéis desactivar el razonamiento de aquí, ¿vale? Es decir, simplemente si le dais aquí la respuesta va a ser mucho más rápida. Y aquí tenemos el resumen breve, ¿vale?

  5. 5:37 , obre el vídeo en una pestanya nova

    Narrativa principal. La verdad que tenemos algo muy interesante. En definitiva, podemos analizar PDFs para que nos dé pues resúmenes o nos diga exactamente qué es lo que necesitamos, que los traduzca o cualquier cosa. Otra de las pruebas muy típicas que podemos hacer es mandarle una fotografía, la cual tiene un texto y una imagen. Ahora os hablaré de esta imagen porque la verdad tiene su cosa. Y le vamos a poner un pront para que la analice. Necesito que me digas el texto que hay en esta imagen. Le damos a enter y él va a empezar a procesar ese prompt, va a analizar la imagen y nos va a decir exactamente qué es lo que ha visto. El texto de la imagen es de Alejandro VR. Pues mira, ahora mismo estaba terminando la miniatura, hecho ahí va tu dosis de era sin motivo alguno. Un beso, que te vaya genial en la oficina y mucha suerte con la miniatura de las pimas. Cuando termines me cuentas cómo ha quedado, ¿eh? Además, le vamos a preguntar exactamente que nos describa la imagen de la chica que sale ahí. Automáticamente va a empezar a razonar y nos va a dar la respuesta. Claro que sí. Aquí tienes una descripción detallada, bueno, de la imagen de la chica. Por lo tanto, es un modelo que también es capaz de analizar imágenes y, incluso obtener texto de las mismas. Una de las pruebas más interesantes es ponerlo a trabajar, es decir, ponerle a que haga algún tipo de de planificación a la hora de crear, por ejemplo, una página web. Yo tengo aquí un prompt, el cual le voy a copiar, le voy a dar a pegar aquí y básicamente le está diciendo que queremos que haga una página web. Además estoy diciendo que la ruta para hacer la web es aquí y

  6. 6:59 , obre el vídeo en una pestanya nova

    que las imágenes se encuentran también en esa misma ruta. El sistema empieza a procesar todo y empieza a hacer la página web. Después de un rato ya programando, tenemos el index listo, lo ejecutamos y podemos ver un poquito qué es lo que ha hecho. Ha utilizado las imágenes que le he dado, ha creado una página web dinámica, bonita, funcional, eh, que después incluso podríamos llegar a modificar, es decir, le podemos decir que haga modificaciones y que alterne algunas cositas en función de lo que necesitemos. Pero bueno, ya podéis ver que es lo que ha hecho y la verdad es que lo ha hecho bastante bien. Y ahora vamos a pasar a algo que creo que es mucho más interesante, que es poder conectarlo directamente a un agente. Pero una vez que ya tengamos conectado el Ternari Bonsai, que lo podéis ver aquí abajo, podemos hacer muchas más cosas. Por ejemplo, tengo una carpeta que está llena de imágenes, que es esta carpeta de aquí, donde mi modelo principal, que se llama Era, pues ha dedicado a hacer un montón de fotos. estoy creando como una especie de consciencia donde ella es capaz de decidir qué es lo que quiere hacer y hay veces pues que se dedica a mandarme selfí, ¿vale? aquí en Tokio comiendo por ahí, aquí recién levantada en la cocina tomándose un café. todo esto generado por ella y de forma local, porque de hecho también una de las cosas guapas que puede hacer es cambiar diferentes elementos de a lo mejor una imagen, ¿no? Esta foto mía, yo le he dicho que me pusiera las gafas blancas y ha hecho pues lo que le he pedido, que me pusiera las gafas blancas o inclusive le he dicho que me pusiera tupé, me lo ha

  7. 8:18 , obre el vídeo en una pestanya nova

    puesto o que me haga una imagen tipo Simpson de esa misma de esa misma imagen. Vale, a ver, las posibilidades de esto son prácticamente infinitas, pero esto es algo que tengo en proyecto y que ya os enseñaré un poquito más adelante. Ahora lo que quiero simplemente es pasarle esta carpeta a Hermes y decirle que me la organice. Así que simplemente cogemos la carpeta, se la arrastramos aquí y le ponemos el prom. Lo primero que nos dice es que va a explorar la carpeta, es decir, va a explorar todo esto. A ver qué es loemos y cómo está organizado. Ya ha hecho un listado, tiene todas las imágenes, los archivos, cómo están los nombres que tienen y bueno, va a pensar la lógica para intentar organizar esta carpeta. Técnicas, noche, sorpresa, noche y test y demás. Fijaos, ya ha creado todas las carpetas, las ha creado todas de golpe y va a empezar a hacer cosas. Vale, como ya podéis ver, las carpetas ya están listas. Ahora va a organizar cada foto en su categoría. Para hacer esta organización se está basando en el nombre del archivo, pero como ya hemos podido ver antes, podríamos decirle que analizara de forma individual cada imagen para obtener una descripción de lo que está viendo y que en función de eso las clasificara de forma mucho más correcta. Y listo. Después de un ratito acaba de terminar ya de organizar todo. Fotos de edición. Tenemos a Era por aquí. Fijaos qué imágenes más guapas puede llegar a hacer, ¿eh? Es que guapísimo. También tenemos generados donde podemos ver otro tipo de imágenes. La noche también tenemos selfies. Bueno, en definitiva, un poco clasificado en función del nombre del archivo, pero ya

  8. 9:45 , obre el vídeo en una pestanya nova

    os digo, lo ideal sería que le dijéramos que analizara cada imagen de forma individual y en función de la descripción de la misma, pues lo metiera en una carpeta específica. Y por último, vamos a hacer una prueba que yo creo que también es muy interesante, que es pasarle un archivo Excel que tenemos aquí, se lo vamos a poner. Es un archivo Excel de contabilidad ficticio, no es real, donde figura la nómina y una serie de gastos. Y le vamos a decir que K una skill de contabilidad, una skill que ha creado específicamente para poder leer archivos Excel y demás, que prácticamente lo ha hecho todo esta inteligencia artificial sola. Simplemente le pasé un primer archivo, le dije que lo analizara, que aprendiera cómo leer los datos y a partir de ahí le dije que aprendiera esa habilidad para que en futuras ocasiones cuando le mande otro archivo Excel, extraer lo que nosotros necesitamos. Y le pongo el siguiente prompt, ¿vale? Necesito que cargues la skill de contabilidad y que digas exactamente cuánto he pagado de cada categoría en estos dos meses. Le damos a enter. Una vez que lo ha cargado, ya empieza a pensar. Va a cargar la skill. Ha leído la skill y ahora va a empezar a leer el archivo Excel para darnos esa información. Y nada, después de un ratito, aquí tenemos toda la información. ya nos está mostrando exactamente qué es lo que hemos gastado en gasolina, en comprar en Mercadona, en el cine, en almuerzo, en restaurante. En total nos hace un cálculo de los gastos fijos, los gastos variables, cuánto hemos pagado de hipoteca, etcétera, etcétera, etcétera.

  9. 11:04 , obre el vídeo en una pestanya nova

    En definitiva, un sistema que creo que funciona bastante bien para lo que tenemos, es decir, estamos ejecutando todo esto solamente en 10 GB de RAM. Además, si lo conectamos a Hermes, vamos a tener un montón de capacidades extra, porque vamos a tener un montón de skills que vamos a poder activar o desactivar en función de nuestras necesidades, además de crear nuestras propias skill como la de contabilidad que os acabo de enseñar. Además de eso, vais a poder conectarlo a diferentes programas para poder hablar con esta IA que tenéis aquí en vuestro ordenador desde cualquier sitio, ya sea a través de Telegram, Discord, WhatsApp, Matrix, Signal, bueno, por email, etcétera. Claro, al final al meterle Hermes agent lo que vamos a tener es un millón de posibilidades. Las que vosotros os ocurran es que es infinito. va a poder contestar vuestros correos electrónicos. Va a poder, por ejemplo, ponerle un sello a unos PDFs que necesitáis enviar de forma constantes y que para vosotros es un engorro. Podéis automatizar diferentes acciones, como por ejemplo los Chrome Job, que en mi caso en particular tengo algunos que me gestionan todo el tema de la tienda de Infinity One para saber qué stock queda, si algún producto se ha quedado sin stock y no tener que estar yo pendiente. Puedes hacer pues una biblioteca de noticias donde simplemente le puedas decir que que te haga un resumen de todas las noticias sobre diferentes categorías. De hecho, hay una opción que si venís aquí abajo se llama YouTube Content, que lo que te permite es resumir vídeos de YouTube. Este mismo, por ejemplo, se lo podrías mandar y que

  10. 12:32 , obre el vídeo en una pestanya nova

    te haga un resumen por escrito, algo mucho más rápido y sencillo. Además, aquí en Windows vais a poder hablar directamente con ella. Podéis hablar, le podéis especificar cualquier cosa y os va a responder por voz. Así que, en definitiva, tenemos un sistema completo y totalmente funcional. Y sobre la pregunta que nos hacíamos al principio del vídeo de si podrías sustituir a Char GPT o cualquiera de estas inteligencias artificiales, os puedo decir que prácticamente en el 90% de los casos de uso que le damos la gente de a pie lo va a poder hacer sin ningún problema, además de que después lo puedes conectar a otro tipo de herramientas como con Fui para poder generar imágenes, millones de cosas más, todo de forma local, todo de forma gratuita, todo sin gastaros ni un solo céntimo. Te voy a dejar un vídeo que tengo hecho previo a este con todo el tema de la configuración en el canal de Telegram para que le echéis un vistazo si queréis por allí. Ahí voy a poner los comandos, cómo se ejecuta, cómo se hay que hacer. Bueno, en fin, un poquito todo esto. Y si bien es cierto que algunas veces este modelo, por ser una versión bastante cuantificada de un modelo superinteligente, mete algún pato, porque realmente no es 100% perfecto, para mi gusto es bastante funcional para buscar cosas por internet, para buscar cualquier cosa. Así que nada, familia, espero que os haya gustado el vídeo. Muchas gracias a todos por llegar hasta aquí. Os recuerdo que os dejo por aquí otro tutorial para que veáis un poquito más cómo se puede hacer esto con otros equipos y si no, pues como siempre os digo, nos vemos en el próximo vídeo. Venga, anda, hasta la próxima. Yeah.