Executar un model d’intel·ligència artificial al propi ordinador permet treballar sense connexió, evitar tarifes per consulta i mantenir prompts o codi dins la màquina. Dev Knives mostra un recorregut pràctic: comprovar quin model pot assumir el maquinari, instal·lar Ollama, descarregar Qwen i connectar-lo a OpenCode o Claude Code.
La instal·lació és senzilla; escollir bé el model no ho és tant. La memòria, la quantització, el context i el tipus de tasca determinen si l’experiència serà fluida. “Local” tampoc garanteix per si sol privacitat absoluta: cal revisar les eines que envolten el model i qualsevol telemetria o servei extern.
1. Per què executar IA en local
A 00:00, el vídeo enumera tres motivacions. La primera és el cost: un model descarregat no cobra per token. La segona és la confidencialitat: consultes, documents i repositoris no han d’anar a un proveïdor d’API. La tercera és la disponibilitat: després de la descàrrega es pot treballar sense internet.
Hi ha contrapartides. El maquinari, l’electricitat i el temps també tenen cost. Els models petits acostumen a ser menys capaços que els serveis de frontera, sobretot en tasques llargues o agentives. L’usuari assumeix actualitzacions, còpies, seguretat i llicències.
Convé distingir “pesos oberts” d’“open source”. Alguns models permeten baixar els pesos, però imposen condicions d’ús o no publiquen dades i procés d’entrenament. Abans d’integrar-los en un producte comercial s’ha de llegir la llicència concreta.
2. VRAM, RAM i quantització
A 01:54, Dev Knives obre CanIRun.ai, una eina de Midudev que detecta o permet introduir el maquinari i ordena models per compatibilitat i qualitat. En el seu equip hi ha 16 GB de VRAM i la web proposa variants que hi poden cabre.
La VRAM és la memòria de la targeta gràfica; no és la RAM general. Si tots els pesos i la memòria de treball caben a la GPU, la generació sol ser molt més ràpida. Si Ollama ha de repartir el model entre GPU, RAM i CPU, pot continuar funcionant, però amb una caiguda notable de velocitat.
La mida en paràmetres no equival directament als gigabytes. Una quantització Q4 representa els pesos amb menys bits i ocupa molt menys que la precisió original, a canvi d’una pèrdua de qualitat. A més, el context consumeix memòria mitjançant la memòria cau KV: un model que arrenca amb un prompt curt pot quedar sense recursos quan un agent hi afegeix molts fitxers.
La FAQ d’Ollama explica que el programa avalua la VRAM necessària i disponible quan carrega un model. CanIRun és un bon filtre inicial, no una garantia: altres aplicacions, la gravació de pantalla i la longitud real del context canvien el resultat.
3. Instal·lar Ollama i descarregar el model correcte
A 06:58, el tutorial descarrega Ollama per a macOS. També hi ha versions per a Windows i Linux. Després de la instal·lació, l’ordre ollama mostra la línia d’ordres.
El flux bàsic és curt:
ollama pull qwen3.5:9b
ollama run qwen3.5:9b
El nom exacte pot canviar segons el catàleg. L’etiqueta després dels dos punts és important: pot seleccionar 9B, 27B, una quantització o una variant afinada. Escriure només el nom acostuma a baixar l’etiqueta predeterminada, que no necessàriament és la recomanada per al nostre ordinador.
A 07:33, el model del vídeo ocupa uns 6,6 GB. Aquesta xifra és la descàrrega, no tot el consum durant la inferència. Cal deixar marge per al context, el sistema operatiu i l’agent.
Una vegada baixat, ollama run obre un xat al terminal. Altres ordres útils són ollama list per veure models i ollama rm per eliminar-ne un. El vídeo encerta a recomanar una variant còmoda abans que la més gran que amb prou feines arrenca.
4. Connectar Ollama a un agent de programació
A 09:15, Dev Knives utilitza la funció ollama launch per iniciar OpenCode amb el model local. Ollama va presentar aquesta ordre precisament per configurar eines com OpenCode, Claude Code o Codex sense haver de preparar manualment cada endpoint.
L’agent pot llegir fitxers, proposar edicions i executar ordres, mentre Ollama respon a través d’un servidor local compatible. En la demostració, OpenCode intenta llistar projectes i Claude Code mostra el model personalitzat en el selector. Funciona, però lentament: la gravació i dues eines obertes saturen l’equip.
La qualitat d’un xat curt no prediu el rendiment agentiu. Programar exigeix seguir instruccions, usar eines, mantenir context i produir formats correctes. Alguns models generals entren en bucles o fallen en les crides encara que conversin bé. És preferible triar una variant entrenada per a codi i provar-la en una còpia del repositori.
També s’han de limitar permisos. Un model local no envia el prompt al núvol, però un agent amb accés al terminal pot esborrar fitxers, executar scripts o contactar serveis externs. Cal revisar cada ordre, usar control de versions i evitar secrets dins el context.
5. Privacitat i rendiment: què s’ha de verificar
A 11:27, el vídeo torna a la documentació i mostra variants afinades. Un model “uncensored” no és necessàriament millor per programar ni més segur; només modifica el comportament de resposta. S’ha de comprovar l’autor, la llicència, la procedència dels fitxers i les avaluacions.
Per confirmar que tot continua local, es pot desconnectar temporalment la xarxa després de descarregar els pesos, observar connexions i desactivar integracions al núvol. OpenCode, extensions de l’editor, MCPs o eines de cerca poden tenir les seves pròpies polítiques. La privacitat del model no cobreix automàticament tota la cadena.
Per mesurar rendiment, Ollama permet observar si el model està totalment a la GPU, parcialment descarregat a CPU i quants tokens genera per segon. La prova útil ha d’incloure el context que es farà servir, no només “hola”. Si l’ordinador queda bloquejat, reduir mida, quantització o context sol ser millor que esperar indefinidament.
Conclusions
El tutorial redueix el procés a una seqüència assequible: identificar la memòria disponible, seleccionar una quantització realista, instal·lar Ollama, fer pull i run, i connectar l’endpoint local a l’agent.
La decisió clau arriba abans de la instal·lació. Un model modest que respon de manera estable és més útil que un de gran que desborda la memòria. I una configuració local només compleix la promesa de privacitat quan també es controlen l’agent, les extensions, les eines i la xarxa. Amb aquests límits clars, Ollama és una porta d’entrada pràctica a la IA local.
Contrast i context
Fonts consultades
- 01
-
02
CanIRun.ai Can your machine run AI models?
- 03
-
04
Ollama Ollama FAQ
Font de treball
Transcripció amb marques de temps
Consulta la transcripció
-
0:00
, obre el vídeo en una pestanya nova
Quizá no quieres pagar más por suscripciones a la inteligencia artificial. Tal vez lo que quieres es que estas grandes empresas no se queden con tus datos cada vez que le haces una consulta y pues a lo mejor es algo delicado y no quieres que lo sepan o es tu código y no te apetece compartirlo con ninguna empresa o simplemente te apetece trastear con inteligencia artificial local y no sabes cómo se hace, no sabes si tu PC puede hacerlo o no y te apetece tener ese modelo en local y poder usarlo cuando tú quieras. incluso cuando estás en un avión con un portátil utilizando inteligencia artificial. Wow. Pues si eres uno de estos casos, en efecto, este vídeo es para ti, porque en este vídeo te voy a enseñar cómo ejecutar cualquier modelo de inteligencia artificial en tu ordenador. Vale, me da igual cuando veas el vídeo, aunque haya salido un modelo nuevo. Vamos a ver, porque se puede hacer con cualquiera que sea open source.
-
0:52
, obre el vídeo en una pestanya nova
Y te voy a enseñar una cosa que no todo el mundo está enseñando, no sé por qué, y es cómo saber qué modelo, justamente qué modelo puedes ejecutar en tu ordenador y cuál no. Importante esto. También te voy a enseñar cómo usar esos modelos en local en herramientas como Open Code o Cloud Code, es decir, en agentes de inteligencia artificial que están a la orden del día para programar. Si no los conoces, no te preocupes porque te lo explico más adelante. Así que bueno, si algo de esto te interesa, quédate que comenzamos ya. Hola a todos, mi nombre es Edu. Bienvenidos a mi canal. Si no me conocíais, aquí me tenéis. Podéis seguirme, como no, en mis redes sociales. Os invito a hacerlo. Y sobre todo en Discord, donde estamos creando una comunidad poco a poco, granito a granito. Y que os invito a uniros con el enlace este que tenéis aquí y también en la descripción. No me enrollo más, por favor. Si os gusta este vídeo, suscribíos porque sé que no estáis
-
1:47
, obre el vídeo en una pestanya nova
suscritos muchos y eso me mina la moral. Pero vamos a empezar con el tema del vídeo, o sea, es tal cual lo que habéis oído. Vamos al grano, parte por parte. Venga, al ordenador. Bien, amigos, pues lo primero y lo más importante a la hora de ejecutar un modelo es saber, obviamente, si tu ordenador puede o no puede ejecutarlo. Entonces, veo que mucha gente explica esto de diferentes maneras. te explica cómo funciona el tema de la V RAM, te da unas aproximaciones, unos consejos y [música] está muy bien, ¿vale? Pero eh bueno, esas explicaciones a veces te sienten de bien poco si tú te ilusionas y quieres correr un modelo en específico y lo pues mira, te pones a probarlo y te falla todo. Entonces, para ahorrarnos esto vamos a utilizar este recurso que es una maravilla, pero de verdad os lo digo, una maravilla. Está hecho por una persona de la comunidad, una persona española que se llama Me Dudev, que muchos lo conoceréis y quien no lo
-
2:40
, obre el vídeo en una pestanya nova
conozca es una persona que yo admiro sinceramente y es una página web que directamente suele detectar eh tu equipo, ¿vale? Si no lo detecta, lo podemos cambiar. Fijaos que yo en efecto tengo un Apple M2, pero si en el caso de que no sea este de vuestro equipo, tenéis otra gráfica o lo que sea, lo podéis cambiar. Y con esto ya nos va a decir una aproximación de qué modelos podemos correr. Lo primero importante, asegurarnos de que esto esté bien configurado. Vamos a hacer zoom aquí y vemos que de V RAM, ojito, V RAM no es la RAM, ¿vale? Es es la RAM que tiene la tarjeta gráfica. En este caso, el mío tiene 16 GB. Si esto está mal, le podemos dar más. Pues primero nos aseguramos de que esto está bien. Una vez puesto aquí vamos a ver un ranking. Y en este ranking nuestro querido amigo Midev lo ha hecho muy bien porque no solo nos pone el modelo que mejor podemos ejecutar, sino también el modelo que mejor valorado está. Es decir, si hay un modelo que a lo mejor
-
3:37
, obre el vídeo en una pestanya nova
podemos ejecutar de sobra, pero no tiene muchas capacidades, no tiene sentido ponerlo por encima. Así que esto lo que hace es como una media. De todas formas, si os interesa, aquí está muy bien explicado qué es lo que ha hecho, cómo lo ha hecho. O sea, la verdad es que se lo ha detallado aquí. Si queréis mirarlo podéis ver. El caso es que para mi caso no recomienda usar Yama 3.1, en concreto el que tiene 8 billones de parámetros. Pero si no queréis llama, por ejemplo, el modelo Quen, en mi caso también me me lo recomienda la casi a la misma nota, un 70. A partir de ahí está bien. Este de decente yo ya no lo recomendaría porque ya degrada mucho la experiencia y obviamente pues los que los que están en rojo ni se ocurran. Digo lo de Quen porque ahora es muy famoso, todo el mundo quiere ejecutar Quen, pues en mi caso en mi ordenador podría ejecutar Quen 3.5 con 9 billones de parámetros. Luego, aparte, imaginaos que no, yo tengo una 5080,
-
4:37
, obre el vídeo en una pestanya nova
que es lo que tengo en el otro ordenador, que también tiene 16 GB de V RAM. Pues en este caso muy similar, eh, lo que pasa que sí que lo puedo ejecutar mejor, va un poquito más fluido. Y bueno, aquí me salen más, pero en mi caso tenemos estos de aquí. Entonces, una vez decidido aquí, fijaos que también nos pone el [música] tiempo que tiene el modelo. Este tiene 2 meses y lo que ocupa, ¿vale? 5 GB. Perfecto. Una vez decidido, podemos entrar dentro y nos lleva a Hugin Face, a Oyama, que es lo que vamos a utilizar. Nos detalla todo mucho, ¿vale? Pero bueno, no nos interesan mucho más datos. nos interesa ir a Oyama porque Oyama es la herramienta que vamos a utilizar. Pero antes un mensaje de nuestro sponsor y es que como buenos programadores o emprendedores que sois, muchas veces os habéis encontrado en la situación de querer buscar personas para vuestro proyecto, inversores, gente que lo pruebe, no sé, buscar personas adecuadas para vuestro proyecto.
-
5:30
, obre el vídeo en una pestanya nova
Y la verdad es que es un dolor de cabeza porque tienes que ir buscando en LinkedIn, en X, por todos los sitios y al final no encuentras nada. Pero vivimos en la era digital. Vivimos en la era de la inteligencia artificial y por eso hoy os presento Lesi, que es un buscador con inteligencia artificial, obviamente, que te ayuda a buscar perfiles reales de gente que existe y que te puede [música] servir para lo que quieras. Lesi es muy sencillo de utilizar, o sea, simplemente entras, te ves la interfaz esta con el chat y escribes en lenguaje natural el tipo de personas que quieres buscar. le dejas ahí que busque y que se tire el rato que sea necesario y te encuentra un listado, fijaos, de personas, [música] pero muchísimas personas de diferentes fuentes, eh, no solo de LinkedIn. Con esto ahora tú puedes ir persona por persona, mandarle un email desde la propia aplicación, exportar sus datos, ver su perfil de LinkedIn, de Twitter, de donde sea,
-
6:24
, obre el vídeo en una pestanya nova
exportar todas las personas. Puedes hacer lo que quieras. Tienes un listado de esas personas que has buscado con lenguaje natural y sin romperte la cabeza. Encima puedes filtrar por países, por [música] muchas cosas. De verdad, es muy top. Lo que antes nos podría llevar horas, días o o no conseguirlo, ahora lo hacemos en segundos. Y todo [música] esto gracias a si queréis probarlo con un descuento exclusivo, os dejo un enlace en la descripción. Dicho esto, muchas gracias a Lesi AI por patrocinar este vídeo y volvemos [música] con el tutorial. Así que primero hay que instalar Seoyama. Para instalarse Oyama es muy sencillo. Vamos a su página de descarga y aquí, como veis, eh, tiene para Macos, Linux [música] y Windows. No hay excusa para nadie. En mi caso, estoy en el Mac, así que voy a descargármelo. Voy a venir aquí, me voy a venir a la terminal y voy a ejecutar esto y voy a dejar que lo ejecute. La verdad ha sido superrápido. Ya está ejecutado.
-
7:24
, obre el vídeo en una pestanya nova
Ahora podemos hacer o llama. Y aquí veríamos los comandos de Oyama. Sí quiere funcionar. Correcto. Ya funciona. Y nos dice chatear con un modelo, iniciar cloud code, iniciar Hermes, iniciar codex, iniciar pi. Bueno, estos son los harnesses. Vale, vamos a salir, no me interesa todavía. Lo que quiero hacer es [música] descargar un modelo. En este caso sería con oyama pool. ¿Y qué modelo vamos a descargar? Pues muy fácil, el que hemos visto. En nuestro caso decía que era el Quen 3.5 con 9 billones de parámetros. Si pulsamos aquí en Oyama nos lleva directamente a la descarga de Oyama. Y es que aquí ya nos sale el el este para ejecutarlo. En nuestro caso, vamos a descargarlo primero con un pol ejecutaremos. El pool al final lo que tiene que hacer es descargar. Fijaos que aquí pone 6,6 GB. Entonces esto puede llevar un rato ya dependiendo de vuestra conexión. Ahora ya lo tenemos listo y quería deciros antes otra cosa y es que no sé si os habréis fijado,
-
8:23
, obre el vídeo en una pestanya nova
aquí abajo nos pone una tabla con los modelos. En nuestro caso se ha descargado el de 9 billones de parámetros porque es el último, pero si a vosotros os recomienda que os va mejor con otro, por ejemplo, con 27 billones, tenéis que poner esto en la descarga, ¿vale? Es importante que indiquéis el parámetro. En nuestro caso, pues mira, ha da la casualidad. Entonces, dicho esto, ya está instalado. Ahora, ¿qué vamos a hacer? Lo bueno, lo podemos ejecutar tal cual. Vamos a probar a ejecutarlo a ver a ver qué es lo que tarda. En principio ya lo tenemos. Vamos a escribirle hola. Y y fijaos cómo está pensando. Okay, el usuario ha dicho hola en español. Eh, está pensando nos dice ahí, pero todavía no ha contestado. Eh, está ahí thinking. Ahí está. ¿En quién puedo ayudarte? Vale, perfecto, funciona bien. Ahora lo que nos interesa a nosotros es poder implementarlo en herramientas para poder programar, que al final es de lo que va al canal
-
9:14
, obre el vídeo en una pestanya nova
y es lo que nos interesa. No sé si ya muchos conoceréis Cloud Code, obviamente doy por hecho que [música] lo conocéis. Y también tenemos una alternativa que es Open Code. Realmente hay muchas más alternativas. Hay muchos harness que hemos visto antes que se listaban ahí todos y ya haré un vídeo en el canal sobre ello, pero bueno, vamos a ir a lo importante que es cómo instalarlo en uno de estos. Y si estáis espabilados, ya lo habréis visto que aquí te dice cómo instalarlo. O sea, si tienes Cloud Code, lo hacemos con este comando de aquí, que sería launch cloud model, este de aquí. Y si tenemos open code sería este de aquí. Yo personalmente a día de hoy recomiendo Open Code, pero sí que es verdad que están apareciendo nuevos que vale la pena mirarlos. Así que vamos a asociarlo con Open Code y daos cuenta que ya nos aparece aquí el Open Code abierto con Oyama. Y pues bueno, yo que sé, le voy a decir, me puedes listar los proyectos de esta
-
10:07
, obre el vídeo en una pestanya nova
carpeta y que se ponga ahí. Mientras lo va haciendo y vamos viendo cómo funciona, porque ya está funcionando, o sea, ya el tutorial ya está. Eh, deciros que Open Code lo podéis descargar pues también desde su página web. Es lo mismo a día de hoy. Todo se instala con un CUR, ¿vale? Si venís aquí os pondrá cómo descargarlo. Y aparte también este, si estáis en Windows interfaz gráfica y interfaz web. A mí sinceramente no me gusta mucho, pero nosotros lo utilizamos en un vídeo para programar desde el móvil. Os dejo por ahí el vídeo porque no sé, a la gente le gustó, quizá a vosotros os interesa el caso. Aquí estamos con con esto y como vemos va un poco lento, va un poquillo lentillo. Luego si quisiéramos usarlo también en Cloud Code, lo mismo. Podemos ejecutar Cloud Code con esto de aquí, traumam, y venimos aquí y se ejecutaría. A lo mejor me estoy cargando el rendimiento. Correcto. Aquí estamos. Vamos a ver aquí en model.
-
11:02
, obre el vídeo en una pestanya nova
Fijaos, si pongo barra model. Fijaos que aquí pone Opuset, Haiku y custom, ¿vale? y son todos el mismo porque, bueno, esto es un como un apaño que se hace, pero ya tendríamos el Cloud Code también funcionando con una guía a local que podríamos usar en un avión o no sé, da igual en casa, pero sin gastar dinero de APIs, aunque bueno, hay muchas alternativas de APIs gratis que también podéis aprender en este canal si me seguís, pero el caso el vídeo de hoy, esto es lo que nos interesaba. En open code se ha quedado aquí medio muerto, pero bueno, ya hemos visto que nos funciona. Por cierto, otra cosa, aquí en la página de la documentación de Oyama podéis ver también comandos útiles que os pueden servir, como por ejemplo, fijaos, aquí hemos visto ya el pull, hay otro que sería para borrar. Si ya os habéis cansado un modelo y os ocupa espacio y no lo queréis, con un RM. También podéis listar los modelos y, bueno, eh,
-
11:55
, obre el vídeo en una pestanya nova
podéis iniciar sesión o cerrar sesión. Como veis, hay muchas cosas que os recomiendo que le echéis un vistazo porque es muy sencillito de entender y os servirá un montón. Yo, por mi parte, esto sigue pensando. Había parado aquí. Mi ordenador está al máximo, máximos históricos, ¿vale? Ya al grabar el vídeo y tal no no lo aguanta mucho, pero como veis ya está, no tiene más. Y otra cosa que se me olvidó mencionar es que también existen otros modelos que no son los genéricos. Por ejemplo, aquí hemos visto que me ha recomendado el de Quen, pero hay versiones fine tuneadas que te pueden interesar también. [música] Entonces, por ejemplo, si a mí en este caso me ha recomendado el de 9 millones de parámetros y quiero una versión fine tuning, por ejemplo, el de Quen oncensores, ¿vale? que en teoría no tiene censura. No lo sé, no lo he probado. Pues sería tan fácil como buscarlo no llama. Escribimos ahí en el buscador, nos aseguramos que tenga la
-
12:47
, obre el vídeo en una pestanya nova
misma cantidad de parámetros, que sea el mismo modelo, pero f tuneado y ya está. Si coincide, pues nos lo instalamos y listo, podemos usarlo. Como veis, mi PC se ha puesto a tope al usarlo. Sí que es verdad que estaba grabando, que tenía muchas cosas abiertas y tal. A ver, realmente yo intentaría ir por lo seguro instalar 100% un modelo que os vaya bien, porque si no no sirve de nada. O sea, si no podéis, no podéis. O sea, no os hagáis ilusiones con modelos que queréis ejecutar, porque si no se puede, no se puede. Y ya está. Creo que no me dejo nada. Esto ha sido todo el vídeo. Si tenéis alguna duda, dejarla en los comentarios. Habré hecho un blog también para explicarlo, aunque creo que en el vídeo ha quedado bastante claro. Y nos vemos en los comentarios que me gusta leeros, me gusta que me digáis cosillas. y yo responder. Muchas gracias por todo el apoyo que me estáis dando y nosotros nos vemos en otro vídeo. Venga, hasta luego, chicos.