Kimi K3 Models oberts Moonshot AI infraestructura IA programació amb IA agents de codi benchmarks IA

Kimi K3 i el retorn dels models oberts: què canvia quan els pesos no depenen d’un sol proveïdor

Kimi K3 s’acosta als models tancats en codi i agents. Analitzem els benchmarks, les demos de midudev, la lentitud, els límits i el valor real dels pesos oberts.

Per què Kimi K3 ha generat tanta expectació

Kimi K3 és un model de 2,8 bilions de paràmetres totals, visió nativa i una finestra d’un milió de tokens. Moonshot AI l’ha dissenyat per a programació agentiva de llarga durada, treball de coneixement i raonament, i va anunciar els pesos complets per al 27 de juliol de 2026.

El vídeo de midudev analitza l’onada d’entusiasme que va seguir el llançament i hi afegeix una experiència poc habitual: havia provat el model amb accés anticipat durant una setmana. La seva lectura és positiva, però no acrítica. K3 produeix prototips sorprenents i s’acosta a models tancats de frontera; al mateix temps és lent, proactiu fins a l’excés i car per als estàndards dels models xinesos anteriors.

La novetat més important no és només una puntuació. És que un model amb pesos oberts entra a competir en qualitat, preu i capacitat agentiva amb serveis que fins ara només es podien consumir a través d’un proveïdor.

Benchmarks: senyal potent, veredicte provisional

Les taules mostrades situen K3 prop de Claude Fable 5 i GPT-5.6 Sol en proves de codi i agents. També apareix al capdamunt de Frontend Code Arena, una comparació cega en què les persones trien entre dues interfícies sense saber quin model les ha generat.

Aquest resultat és rellevant perquè mesura preferència humana sobre una sortida visible. Encara així, una arena pot patir biaixos de mostra, variació entre prompts o intents de manipular votacions. I els benchmarks publicats per Moonshot utilitzen diferents entorns d’agent i l’esforç de raonament màxim.

Artificial Analysis ofereix una lectura més agregada: K3 obté 57 punts en el seu índex i es troba entre els models capdavanters, però és lent i molt verbós. La mateixa Moonshot admet que el rendiment global encara queda per sota de Fable 5 i GPT-5.6 Sol. Per tant, «competeix amb els millors» és defensable; «els supera en tot» no ho és.

També cal desconfiar de les estimacions de mida dels models tancats que apareixen al vídeo. OpenAI, Anthropic o Google no sempre publiquen el nombre de paràmetres, i les xifres atribuïdes per tercers no són especificacions oficials.

El preu és de frontera, no de ganga

L’API oficial costa 3 dòlars per milió de tokens d’entrada sense memòria cau, 0,30 amb encert de memòria cau i 15 per milió de sortida. És més barata que alguns rivals premium, però representa una pujada clara respecte de generacions anteriors de Kimi.

El cost per token no explica el cost per tasca. Si K3 genera molt text, fa molts passos o triga més a arribar a una resposta correcta, la factura i el temps poden superar els d’un model amb tarifes més altes. Per això midudev valora els gràfics que creuen intel·ligència, preu i cost real de completar una prova.

Per a una empresa, la mètrica útil és quantes tasques verificades completa amb un pressupost i un termini concrets. Per a un particular, els plans de subscripció i els límits de peticions poden ser més determinants que el preu de l’API.

Les demostracions: jocs, 3D i una refactorització

El creador mostra diversos prototips fets durant l’accés anticipat. Un joc de trets al navegador incorpora compra d’armes, enemics, marcador, recàrrega i col·locació d’una bomba després de dos prompts. Una altra escena representa un forat negre amb so, rotació i un mode de desplaçament. L’acabat no és comercial, però la quantitat d’interacció generada amb poca instrucció és notable.

En directe també demana millorar l’arquitectura d’un CRUD. K3 prepara un pla, separa rutes, repositoris i models, utilitza TypeScript, introdueix dependències i afegeix proves. No construeix una arquitectura sofisticada, però transforma una base senzilla en un projecte més mantenible.

Aquestes demos mesuren velocitat de prototipatge i amplitud, no correcció completa. No es revisen seguretat, accessibilitat, cobertura de tests, rendiment sostingut ni manteniment per un altre equip. Un joc que funciona dos minuts o un CRUD ben separat encara necessita una auditoria abans de producció.

El gran problema inicial: capacitat i velocitat

Quan K3 es va obrir al públic, Moonshot va reconèixer que la demanda s’apropava al límit de les GPU disponibles. Segons el material comentat, l’empresa va aturar temporalment noves subscripcions per prioritzar els clients existents. Midudev havia tingut una experiència més estable durant l’accés anticipat i va notar la degradació després del llançament.

Aquesta diferència és important. Un model pot ser excel·lent en una prova controlada i oferir una experiència pitjor quan el servei està saturat. La latència depèn del model, però també de la cua, la capacitat del proveïdor, la longitud del context i les eines.

Els límits de peticions d’alguns serveis tercers també poden deixar curta una subscripció si l’agent consumeix moltes crides. Abans d’integrar-lo cal mesurar disponibilitat, concurrència, límits, temps de resposta i política davant d’una saturació.

Les limitacions que Moonshot reconeix

La documentació oficial identifica tres advertiments:

  • K3 és sensible a la conservació de l’historial de raonament;
  • canviar de model enmig d’una sessió pot tornar inestable la generació;
  • tendeix a prendre decisions massa proactives quan troba ambigüitats;
  • l’experiència d’usuari encara té una distància visible respecte de Fable 5 i GPT-5.6 Sol.

La proactivitat explica part de la seva lentitud: davant d’un problema menor, pot ampliar l’abast en lloc de preguntar. En treball real convé definir fitxers permesos, criteris d’acceptació, pressupost de passos i accions que necessiten confirmació.

El model també funciona millor en entorns que conserven correctament el seu historial, com Kimi Code. Connectar-lo a altres agents és possible, però la compatibilitat del protocol pot afectar la qualitat.

Què significa realment tenir els pesos oberts

«Pesos oberts» no vol dir que un ordinador domèstic pugui executar 2,8 bilions de paràmetres. Vol dir que altres operadors amb prou infraestructura poden allotjar el model, optimitzar-lo per al seu maquinari i oferir-lo en regions o condicions diferents.

Això pot aportar:

  • més competència entre proveïdors;
  • menys dependència d’una única API;
  • desplegaments en jurisdiccions concretes;
  • optimitzacions pròpies de rendiment;
  • més possibilitats d’investigació i adaptació.

No equival necessàriament a programari lliure complet. Cal llegir la llicència, les restriccions comercials, la documentació d’entrenament i les obligacions de distribució. Tampoc elimina el cost: emmagatzemar i servir un model d’aquesta escala exigeix una infraestructura enorme.

Kimi, Qwen i la nova competència

El vídeo també comenta Qwen 3.8 i futurs models de GLM com a part d’una onada xinesa de models grans. En el moment de la gravació, algunes xifres i dates es presenten com anuncis o rumors, no com una prova independent. La comparació sòlida haurà d’esperar pesos, llicències, APIs estables i avaluacions reproductibles.

La idea de fons sí que es manté: els models oberts ja no arriben necessàriament molts mesos tard en codi o agents. I no tots han de cabre en una GPU de consum per tenir impacte; un operador especialitzat pot servir-los com a API.

Conclusió

Kimi K3 representa un pas important perquè combina rendiment de frontera amb la possibilitat que diversos proveïdors en serveixin els pesos. Les proves de midudev mostren un agent capaç de crear jocs, experiències 3D i refactoritzacions amb molta autonomia.

La lletra petita és igualment clara: és lent, verbós, exigent en infraestructura i encara queda per sota dels millors models tancats en experiència global. El llançament també va exposar límits de capacitat.

Per adoptar-lo, convé comparar-lo en un repositori propi, amb tests, costos i temps mesurats. L’obertura amplia opcions; no converteix automàticament el model en local, barat o fiable.

Contrast i context

Fonts consultades

4 fonts
  1. 01
  2. 02
  3. 03
  4. 04

Font de treball

Transcripció amb marques de temps

18 fragments
Consulta la transcripció
  1. 0:00 , obre el vídeo en una pestanya nova

    Química 3. A ver, la semana pasada se lanzó Química 3, dice, "Inteligencia de frontera abierta, 2,8,000 millones de parámetros, no, 2,8 billones de parámetros, porque fijaos que son trillones en inglés y por eso la traducción es billones en español, perdón, eh, un millón de contexto multimodal nativo con Kimi Delta Tension que permite hasta 6,3x de codificación más rápida en contextos de 1 millón de tokens. Residuales de atención, 25% mayor eficiencia. Diseñado para codificación agentiva de largo horizonte y flujos de trabajo autoevalua evolutivos. Ya lo tenéis disponible en kimi.com, Kimywor, Kimy Code y la API de Kimi, pesos abiertos para el 27 de julio de 2026. O sea, dentro de 7 días a partir de este momento donde estamos grabando este vídeo, a partir de hoy, dentro de 7 días vamos a tener este modelo con pesos abiertos para el que pueda, que no podrá cualquier persona, obviamente, lo pueda instalar en sus servidores o lo pueda revender. O sea, que hay una cosa que me sorprende mucho sobre esto que la gente no entiende y se pone muy pesada y es que dicen, "Ya, pero esto no lo puedes instalar en tu máquina. Es que esto, a ver, ya lo sabemos, amigo, ya lo sabemos. No puedes instalar Química 3 en cualquier máquina, pero el tema de que sea de pesos abiertos, lo que significa es que no se centraliza el proveedor en un solo lugar. Quiero decir, empresas cerradas como Open AI pueden llegar a acuerdos en concreto con, por ejemplo, con Microsoft, con, yo que sé, con AWS para permitir que den servicio de su modelo o no. Pero en el caso de Kimi, lo bueno es que este modelo lo podría ofrecer cualquiera. Si tú tuvieses la capacidad suficiente de cómputo, lo podrías hacer. Y esto pues desbloquea bastante, bastante. No significa que tú lo tengas

  2. 1:48 , obre el vídeo en una pestanya nova

    que ejecutar en tu máquina. Creo que la gente como que confunde un poco, o sea, que sea de pesos abiertos no significa que forzosamente sea para tu máquina. los benchmarks que nos gustan los benchmarks. Aquí tenemos de código y fijaos cómo se coloca en este bastante cerca de Fable 5 y de GPT 5.6 Sol en Frontier por encima de 5.6 sol. Kimy Code Bench, que este es un benchmark interno suyo, solo por debajo de Fable 5, en el Terminal Bench por encima de Fable y de Opus. En el program bench por encima de GPT 5.6 y de Fable 5. Madre mía. Madre mía. O sea, a nivel de ver los benchmarks, verlo bien arriba, alucinas. O sea, dices, "Ostras, ojo, que aquí hay cosas." Que luego ya os digo yo que a mí los benchmarks no me fío de ellos y tal, pero sí que hay algún benchmark que a mí personalmente me gusta, me gusta más. Vale, este es uno de mis favoritos porque creo que las cosas tal y como las enseña, oye, pues tiene bastante bastante sentido. El tema es que aquí tienes inteligencia, velocidad y coste por tarea, que es información muy interesante para saber si realmente, claro, porque puede ser muy inteligente, pero también es muy caro. Fijaos que en inteligencia, que al final esto es una mezcla de más de un benchmark. Tenemos a Fable 5, el primero, GPT 5.6 Sol Max, el segundo y el tercero Secuela Kimica 3, un modelo de pesos abiertos que viene desde China. Y claro, si veis y cambiamos a la al tema de lo que sería el coste por tarea, es que Kimi es el tercero, pero es que es más barato que GPT 5.6, no mucho más barato, como podéis ver aquí, no es mucho más barato, eso sí, porque luego lo comento esto, ¿eh? Pero química 3 es verdad que es más barato, es verdad que utiliza que el precio de la API es más barato, pero a la hora de terminar tareas le cuesta más tiempo que por

  3. 3:37 , obre el vídeo en una pestanya nova

    ejemplo GPT 5.6. Pero claro, fijaos con la diferencia con Anthropic, el de Fable 5 es mucho más caro también que GPT 5.6. Bueno, yo recomiendo mucho más este benchmark porque creo que tiene más sentido a la hora de comparar. Mira, por ejemplo, este está muy chulo porque te dice el precio total eh de ejecutar todo el la tarea de índice, pero incluso puedes ver cuánto ha costado todo el benchmark. te sale $2,500, $8,000, está bastante chulo. Bueno, pues este está bien porque al final como agrupa un montón y lo ejecutan ellos mismos, pues está muy pero que muy interesante. Y luego tenemos este cuadrante, creo que es este cuadrante, este cuadrante donde arriba a la izquierda estarían los que son los más, o sea, cuanto más arriba a la izquierda esté, más interesante es. ¿Por qué? Porque es muy inteligente y es muy barato. Y fijaos que hay dos que se habla muy poco. Y ojo, cuidado, ¿eh? GPT 5.6 Luna Max y Grock 4.5, que yo creo que es una de las es una de las grandes sorpresas. Está muy bien, pero claro, también está bastante cerca. Química, no, química no, química 3 no está tan cerca, está a lejillos, pero está más cerca que, por ejemplo, GPT 5.6 Sol, que está muy cerca de inteligencia y Fable 5. Básicamente lo que te quiere decir es que este cuadrante verde verde es donde está la calidad precio para que nos entendamos, ¿vale? Entonces, siguiendo con química 3, para que entendamos un poquito esto, hay una estimación que esto hay que pillarlo un poco con pinzas. Eh, según Junong, estos son los modelos, el tamaño de los modelos de forma estimada. Por ejemplo, GPT Luna dice que serían 400,000 millones de parámetros. GLM, Anthropic Sonet y Gemini Flash serían 1 billón. GPT Terra, Deepsic 4 Pro y Grock 4.5 sería 1,6 billones. Luego tendríamos Opus, GPT Sol y Kimica 3, que sería de 3 billones. Claro, química 3 sí que sabemos que más

  4. 5:29 , obre el vídeo en una pestanya nova

    o menos es de 3 billones porque lo dicen ellos, o sea, lo han dicho ellos, ¿no? Y no hay no hay mucha historia, ¿vale? 3 billones. Y luego, finalmente tendríamos Mizos y Fable, supuestamente, esto no está confirmado ni mucho menos, que dicen que son 6 billones, que por eso sería tan caro. Cuanto más grande es el modelo, pues normalmente más caro es. Entonces, ya podemos ver que se abre la veda en que los chinos están haciendo modelos no solo de pesos abiertos, sino que además muy grandes, tan grandes como los modelos frontera, porque hasta ahora habían hecho algunos modelos, pero el más grande era de un billón más o menos, ¿vale? O sea, más o menos de un billón. Dice, ¿qué significa los parámetros? Los billones de parámetros. Para que lo entendamos rápido, ¿vale? Es una hipersimplificación. Pongamos que son como las neuronas que tiene el cerebro. Entonces, cuanto más neuronas tiene, no son exactamente neuronas, pero para que me entiendas, como el número de neuronas que tendría ese modelo internamente. Por lo tanto, digamos que tiene mucha más información y tiene como más inteligencia, aunque obviamente una persona tiene puede tener cerebro muy grande y luego no no significa que sea más listo, pero ya me entiendes, para que más o menos lo podamos apreciar. Entonces, ¿qué ha pasado con química 3 ahora que sabes un poquito todo esto? pues que que la ha reventado, o sea, que este fin de semana la gente se ha vuelto loca con Kimi. Por ejemplo, aquí tenemos el Guille que dice, "Kimi K3 es el mejor modelo con rendimiento en Nextg Org Evals, por delante de Fable, alcanzando una tasa de éxito comparable en menos tiempo. Esta es la primera vez que un modelo abierto supera todos los modelos propietarios en este exhaustivo benchmark de ingeniería web. Obviamente dice, "Los benchmar no siempre cuentan

  5. 7:01 , obre el vídeo en una pestanya nova

    toda la historia, aunque esta es una señal importante que se suma las crecientes evidencias de que este podría ser un momento de avance para los modelos abiertos y ningún modelo ha alcanzado todavía el 100% de complitud en este conjunto de evaluaciones. Pero aquí podéis ver donde tenéis elxer rate con agents.md o sin agents.md, podéis ver cuánto tiempo ha tardado también, ¿vale? Lo podéis ver aquí, cuánto tiempo ha tardado, qué agente han utilizado y podéis ver pues cuánto ha tardado en hacer cada una de las tareas. Ojo, tela marinera. O sea, el tema es que mucha gente de repente se ha puesto a probar Kimi y claro, hemos tenido la sorpresa de ha quedado el tercero en Artificial Analysis, luego el coste por tarea se ha puesto a que sea la mitad. Claro, es verdad que respecto al Kimi anterior, fijaos la subida, Kimi K2.6, 6, aunque este no es el anterior. El anterior era el Kimik 2.7 Code, si no me equivoco. Yo creo que había uno, el Kimik 2.7 Code, si no me equivoco. Yo juraría que había otro, eh, Kimik 2.7 Code. ¿Veis? Sí, sí, sí. Kimik 2.7 Code. No sé si no lo han lo añadieron por algo. No sé si aparece y no lo veo, pero bueno. Aquí está Kimica K 2.6. Claro, fijaos que se ha triplicado el precio. Se ha triplicado el precio, pero claro, se ha triplicado el precio, pero porque ha subido bastante la inteligencia también de del modelo, o sea, es que es normal. A cuanto más inteligencia, pues ya sabemos que tiene más coste. Número uno en frontend arena. Otra benchmark muy interesante porque lo que tiene frontend arena es que es transparente, o sea, quiero transparente, es a ciegas. Este benchmark es a ciegas. O sea, Química 3 ahora es el número uno en front Code Arena con 1679 puntos pasando a Cloud Fable 5. Y fijaos la diferencia que le ha metido ahí. Fronen arena, por si lo queréis ver, porque a lo mejor dicen,

  6. 8:47 , obre el vídeo en una pestanya nova

    "Ah, no sé qué." Está muy bien porque al final son benchmarks a ciegas. O sea, tú no sabes lo que estás votando, sino que directamente lo que haces es decir, "Vale, voy a votar. ¿Y cuál es el mejor de los dos?" Este. Vale, pues ya está. Entonces, fijaos aquí que tenemos entre los diferentes en web depreso con diferencia y esto es lo que realmente llama mucha atención, pero Arena se bota con correos temporales, echa la ley, echa la trampa. Aunque también es verdad, a lo mejor la gente de Kimy se ha vuelto loca a votar. Puede ser. Sinceramente, yo creo que la gente de Arena, aunque puedas hacer este tipo de cosas, seguramente lo controlarán o intentarán controlarlo porque es que si no no tendría ningún tipo de sentido y perdería toda la gracia, ¿no? Y es bastante fácil de de demostrar, ¿eh? Si no tenemos esto, claro, lo que comenta por aquí es que el precio ha subido cinco veces respecto a Kim K 2.7. $ por millón de tokens de input, $15 por millón de tokens de salida. Esto no es un precio económico, no es un precio del típico modelo de No, es un precio de frontera, un precio como los que pueden tener Openía y tal. Kimi directamente está compitiendo, no está compitiendo con otros modelos chinos, aquí está compitiendo con Opus, está compitiendo con GBT 5.6 Terra Sol en cuanto a precio, más con Terra que con Sol, en cuanto a precio, digo, eh, para que lo entendamos, a este precio bastante bueno por el costo está muerto. Rinde a la vanguardia o el precio es una broma. Claro, es que si es verdad que tiene ese nivel, el precio está muy bien, pero ojo que te voy a contar toda la historia porque esto no es tan fácil, ¿eh? Porque bueno, ya veis que no es barato, pero es verdad que sigue siendo más barato. Pero hay otra cosa que no cuenta la historia y es la velocidad. De hecho, tengo por

  7. 10:33 , obre el vídeo en una pestanya nova

    aquí unas cuantas demos porque yo desde hace más de una semana que tengo acceso a Kimi K3. Desde hace más de una semana. Ahora os voy a contar una funa que me han intentado hacer el otro día. Ha salido Química 3, se siente como un nuevo momento deepsek para el mundo de la esto realmente una vez que yo he estado probando que me parece increíble. O sea, me pareció, dije, ostras, me sorprendió. Vale, llevo una semana usándolo con acceso anticipado y programando y está al nivel de Cloudopus 4.8. Ojuro que está al nivel, aunque ahora os diré un poco la letra pequeñita para que lo tengáis en cuenta. A veces incluso se siente superior y es verdad porque encima de más le puedes pedir más cosas de temas de ciberseguridad, vulnerabilidades sin miedo a que te derive. Compitiendo con GPT 5.6 Sol y Fable 5 cuesta la mitad que Opus. Es enorme. Será un modelo abierto a partir del 27 de julio. El precio. Los modelos abiertos ya no están se meses por detrás de los cerrados. Es que no somos conscientes dónde estamos. Ahora compiten directamente, ¿vale? Y puse esto. ¿Qué pasó? Este es el tweet de lo que me dijo. Me lo dijo Juan Pablo Moreno. Supuestamente llevas una semana usándolo con acceso anticipado y programando. Vale, porque dije que llevaba una semana. Lo que no entiendo es una cosa. Si química 3 salió ayer, ¿qué haces tú publicando esta noticia un día después? Lo más normal es esto que publicas hoy lo publicaras ayer junto con el lanzamiento de Kimica 3. Pero Juan Pablo ya no se queda ahí porque dice, "Hostia, eh," dices, "Bueno, al menos el tío pues se queda ahí y ya está." Pero no, llegó a insinuar, ya que estaba mintiendo. Vale, me decía por aquí, "Yo no hablo de divulgar antes, hablo de divulgar después de que salió la noticia. Él se demoró 24 horas o más en divulgar. Piensas, si eres alguien

  8. 12:13 , obre el vídeo en una pestanya nova

    con ese privilegio, aprovechas y das la noticia de una hora o minutos después de que sale la noticia. Exactamente. Fue hace 21 horas que que publiqué yo este tweet. Es decir, que si fuera cierto lo que él afirma, no esperarías al otro tweet para hacer la publicación que él él hace. Para mí esa publicación de él tiene parte de mentira. Vamos a ver. Mirad, esto es el correo oficial y para que veáis, voy a voy a recargar, eh, de Moonshot AI de Kimy, ¿vale? con para la firma del NDA, que esto es del 13 de julio. Igualmente, ya tuve acceso, ya tuve acceso antes, me lo dieron antes incluso de firmar Na, pero bueno, para que veáis que no es mentira, voy a refrescar, ¿vale? Para que se vea que ahí sale el correo, ahí lo tenéis, ¿vale? Ahí lo tenéis. Segundo, porque es que es impresionante. Yo ya tenía un montón de demos, de hecho podemos ver incluso los días que utilicé las últimas demos que hice, el Black Hall. El Midw Strike, el Neon Tetris. De hecho, vamos a ver Midw Strike, ya que estamos. Hice un Counter Strike, un Midw Strike, dos proms, porque el primer prom tuve que arreglar un error. Primero que tiene lo de comprar y todo, ¿eh? Tienes lo de comprar. Vamos a comprar la desericle, ¿vale? Eh, quita esto. Luego tienes lo del lo de la puntuación y todo. Puedes bajar, o sea, fijaos que la mirilla funciona bien. Obviamente a tema de diseño es bastante mejorable. Ya os digo que le di. Ojo, ojo, ojo. No me lo he cargado yo. Qué cabrón. Bueno, puedes poner las bombas y todo. Puedes poner las bombas en dos proms. O sea, lo que me sorprendió. Ay, qué rata, qué rata, qué rata, tío. Y mira lo de la cámara. No sé, no sé. O sea, tremendo, tremendo, tremendo. Pero apunta bien, hombre. Pero si me ha hecho ahí la rata la set, tío. Ha hecho la seta el desgraciado. Mira, aquí tenéis todos los

  9. 14:08 , obre el vídeo en una pestanya nova

    para el menú. No sé qué. La última puede cambiar la la Oh, míralo, mira, mira esos que cómo se van las ratas, ¿eh? Ojo. Oh, oh, hala, otra vez me ha quitado, me lo ha quitado. Mira, puede recargar. Me lo ha quitado. Este es uno. Vamos con Vamos con otros. El de Black Hall. Bueno, el de Black Hall también. Mira. y le pone sonido, tío. Está muy chulo, ¿eh? O sea, química 3 me ha sorprendido porque hace cosas muy chulas, ¿eh? Muy chulas. Bueno, aquí podéis girar. Es como un agujero negro, ¿vale? Y te puedes te puedes eh pues alejar y tal y le puedes dar a warp. Mira esto. A ver, que lo que sorprende realmente es como que la calidad de las cosas que hace, tío. E hice un crut, cosas así, pero lo realmente sorprendente es la calidad que hace, ¿sabes? O sea, lo ves y dices, "Hostia, eh, no está nada pero que nada mal." Eh, mira, aquí tenéis un crud bastante fácil. En este caso es un solo promp y no ha hecho una muy buena arquitectura y tal. Entonces vamos a pedirle para que lo veamos en funcionamiento. Voy a decirle, lo pongo en modo yolo, ¿vale? Química uno, aquí lo tenemos, y le voy a decir, eh, mejora la arquitectura para hacerla mucho más escalable y mantenible con buenas prácticas, ¿vale? Lo que es hablar en inglés y tal, español, todo esto perfecto. ¿Cuál es el problema que le veo a química 3, por lo menos mientras yo lo he estado utilizando? El problemilla que tiene, que no sé si mejorará, es el tema de la velocidad, o sea, los tokens por segundo. Cuando lo utilizas a veces se nota que le cuesta, ¿sabes? Yo entiendo que es por un motivo que ellos mismos han dicho y es que están a saco con el tema de la GPU, o sea, no les da la vida. De hecho, Química 3 ha recibido más amor de lo que esperábamos y nuestra GPU lo están sintiendo. En las últimas 48 horas la

  10. 16:07 , obre el vídeo en una pestanya nova

    demanda ha estado cerca de los límites de nuestra capacidad. Para proteger la experiencia de los suscriptores existentes, estamos pausando temporalmente las nuevas suscripciones y priorizando la computación para los miembros actuales. Los usuarios suscritos existentes no se ven afectados. Y por eso, amigos, si intentáis ir a utilizar química 3 y a suscribiros, os vais a encontrar con una sorpresa y es que no os podéis suscribir, no os va a dejar suscribiros. Así que malas noticias. Lo bueno que como está disponible en otros lugares, por ejemplo, lo puedes utilizar en Open Code Go, pues ahí como ya lo han puesto, podrías suscribirte a Open Code Go y directamente ahí pues darle un tiento. El problema que como podéis ver, aunque ahora tienes un 2x de uso, solo tenéis disponibles 220 peticiones en el límite de 5 horas. Solo 220. La diferencia con el resto es bastante bastante brutal, ¿eh? Como os digo, el problema que yo le veo, mira, pero ¿por qué ha? Ah, porque me ha hecho un plan. Vale, pues aquí tenemos el plan y tal. Digo, si he puesto el yolo, ¿para qué? Bueno, pues aquí tenemos el plan. De verdad, muy pero que muy sorprendente la calidad del código, las cosas que hace para cosas 3D, o sea, para hacer juegos 3D, increíble, ¿eh? Cuando lo probéis os va a volar la cabeza y ahí sí que vais a ver un poco momento. Guow. Aquí tenéis la buena noticia que también lo tenéis disponible en Open Gold. Lo malo es eso, que los límites al menos por semana, el de química 3 es solo de 250 y al mes solo te da 490 llamadas. Es bastante poco, ¿eh? Es que se te acaba pronto. Así que vas a tener que ir cambiando de modelo en Open Coo o se te va a quedar corto y ya ves que en 5 horas tienes 220 ahora temporalmente, pero pronto van a ser solo 110 por semana, 250. O sea,

  11. 17:58 , obre el vídeo en una pestanya nova

    poquito, poquito. Es que se nota que es mucho más caro, ¿eh? Bueno, pues ahí podéis ir viendo cómo está ya haciendo cambios. A ver si podemos ver los cambios por aquí. Vale, ya podemos ver un poco las tareas, ¿vale? Con la configuración, con Typescript. Mira, me ha puesto aquí unos módulos de http para separar. Mira, modelo, repositorio, rutas. M, de verdad, os va a sorprender mucho, ¿eh? Ahora, lo que os digo, ha habido problemas un poco con el tema de la velocidad. Yo la semana en la que tuve acceso no tuve problemas. Por ejemplo, el Counter Strike tardó bastante bastante en hacerse, pero porque ha hecho mucho código, pero en cambio en cuanto lo han abierto, fuf, ha costado, eh, ha costado. Así que nada, a ver qué tal. A ver qué tal. Tengo mucha curiosidad para ver qué os parece. A ver qué os parece. Dicho esto, tengo que comentaros de Kimi unas cuantas cosas más. Lo primero, el fundador. No, fundador no es eh cofundador puede ser. Eh, Chun Chang. Ahora no sé si es cofundador o pero total. Chuchan dice, claro, hay mucha gente que Moonshot en su propio blog post dice esto, limitaciones, que ha sido entrenado para guardar el historial de pensamiento y que entonces eh pues que tengas cuidado con el harness que utilizas, no sé qué, no sé cuánto y que tienes que intentar evitar cambiar a química 3 en mitad de una sesión, ¿vale? y luego que es demasiado proactivo y eso sí que es verdad y es una de las razones por las que se ve que a veces tarda más de la cuenta en hacer las tareas. es como que si encuentra un pequeño problema empieza a darle vueltas y tal y yo creo que eso es bastante mejorable y es lo que os digo que le cuesta ahí un poco todavía que no tarde tanto. Pero luego dice, aunque es bastante competitivo el modelo

  12. 19:44 , obre el vídeo en una pestanya nova

    en en general, [música] todavía hay un gap que se nota en la experiencia del usuario comparado con Clow Fable 5 y GPT 5.6 Sol. Esto lo dicen ellos, ¿eh? Esto es la gente de Moonshot en su propio blog que comenta esto. Ellos mismos no lo ven al nivel de GPT 5.6 Sol y de Clow Fable 5. Yo creo que es verdad que no está al nivel, pero tampoco está muy lejos, que eso es lo lo realmente sorprendente. Ahora, ¿qué es lo que pasa? Pues que el propio alguien de de Moonshot ya ha contestado ante este tweet y ha dicho, "Ojo y espera a Kimika 3.1." y acaban de sacar el tres. Luego sobre esto de que las suscripciones las han parado y todo esto, tengo que comentar este post que dicen que hay dos tipos de compañías y estoy de acuerdo que cuando se quedan sin capacidad hay cómputo para atender nuevos clientes. Hay empresas como Moonshot que detiene los nuevos ingresos sin retrasos para los clientes existentes. Y dice Anthropic reduce el 50% del uso de los clientes existentes para atender a los nuevos. Eso te dice todo lo que necesitas saber de sobre por qué Anthropic odia el código abierto. No sé si tendrá que ver que por qué es eso que odia el código abierto, pero sí que es verdad que oye, respeto a Moonshot para que a la mínima que ha visto que no puede soportar nuevos usuarios, ha parado las suscripciones porque la verdad es que se estaba notando que no estaba funcionando tan fino. Mira, en este caso ya ha terminado, o sea, es que creo que está mejorando la velocidad. Eh, bueno, aquí podemos ver cómo ha separado también tema base de datos. Bueno, es una base de datos bastante sencilla. Al final es un crow bastante sencillo. Tampoco es que tenga mucha historia. A ver, aquí, mira, create task repository. Vale, claro. Y esto hasta que no llegga aquí no lo ejecuta. Me gusta mucho que haya utilizado funciones

  13. 21:28 , obre el vídeo en una pestanya nova

    sino clases, ¿vale? Que la haya hecho funcional, me gusta. Y aquí, a ver, el TAS repository, mira, lo pasa. O sea, que aquí tiene inyección de dependencias. No ha hecho una arquitectura sagonal, ni mucho menos, pero al menos es verdad que sí que ha separado y mira, le ha puesto aquí unos cuantos tests, así que bueno, buena pinta. Buena pinta, la verdad. Eh, cosas buenas que además tiene esto. Lo puedes utilizar en Codex. Fíjate que puedes con Kimi o outx. Ahí lo puedes elegir. Fijaos que lo tiene elegido. O out o API lo puedes elegir. Así que lo puedes conectar, realmente lo puedes conectar con Clow Code, con Codex, con el que te dé la gana. Y además, además eh una cosa que es interesante, que es lo que os comentaba al principio, que sea de pesos abiertos, lo bueno es que si química 3 le faltan GPUs por lo que sea, porque no pueden con la demanda, lo bueno es lo que dice Chiao Q y es la fundadora de Ticon AI, que es una empresa que está en Redwood City. Bueno, total, la belleza de los pesos abiertos es que cuando química 3 carece de GPUs, cuando no tiene infraestructura, muchas nubes neocloud con GPUs pueden sumarse. Kimi lanzará sus pesos el 27 de julio, alojar Kimy K3 y monetizar. Por eso necesitamos un mercado libre. Y es que es verdad y eso es una de las cosas buenas de los pesos libres que yo no entiendo por qué mucha gente dice, "No, es que claro, si no lo puedo hospedar en mi máquina no sirve para nada." No, amigo, no significa eso. O sea, lo que significa realmente es que esto lo que vas a poder hacer es no estar atado a una empresa, porque al final utilizar Química 3 lo puedes utilizar en cualquier provider que te dé la por supuesto el acceso y normalmente como va a haber más competencia te va a dar más

  14. 23:04 , obre el vídeo en una pestanya nova

    posibilidades. Aquí tenemos Rohan dice las empresas estadounidenses como Modal, Firewall y Baseten, que estos son empresas por ejemplo Firws, AI, esto es un una web que te da inferencia de inteligencia artificial, ¿vale? Y entonces te da acceso a modelos como, por ejemplo, química 2.7 que pondrán química 3. Te lo dan a un precio bastante atractivo, pero es que además te lo da desde servidores de Estados Unidos y a una velocidad bastante buena, que es que esto es muy pero que muy interesante. Podrán servir química 3 con un costo 10 veces menor que el de sus competidores chinos porque tienen acceso a chips avanzados de Nvidia y AMD. Claro, es que en China es difícil acceder a los chips de Nvidia y por lo tanto no van a poder utilizarlos para servir sus propios modelos, que seguro que alguno utilizan, ¿vale? Pero es verdad que esto eh es una ventaja competitiva que te da gente de Estados Unidos. Hay cierta iranía en esta. Gran parte de la investigación, el desarrollo del modelo se ha trasladado a China, pero una vez que el modelo se optimiza para hardware de próxima generación como la arquitectura Rubin de Nvidia, su costo operativo podría reducirse de 10 a 100 veces. Esto lo dice el cofundador de Stability AI. También es verdad que hay una cosa que no se tiene muy en cuenta, no tengo datos, ¿vale? Pero habría que ver cuál es el coste realmente de la electricidad, porque es verdad que el coste de la GPUs y tal es importante, el tener acceso a la GPU es importante, pero ¿cuál es el coste que enfrentan estas empresas de electricidad en China? Porque no lo tengo muy claro. A nivel doméstico sé que la electricidad en China es bastante barato y yo me imagino que a nivel de Claro, hay que tener el coste, hay que tener en cuenta todo, son GPUs. Entonces, no sé si la electricidad le puede salir a cuenta a China, porque

  15. 24:38 , obre el vídeo en una pestanya nova

    sé que en Estados Unidos es un tema que les cuesta bastante más. Claro, en China está instalando un montón de batería solar, creo que también tienen bastante nuclear, entonces puede ser que eso le dé una ventaja respecto a esto que muchas veces pues no se tiene en cuenta y creo que es importante también. Si esto te parece poco porque dices, bueno, pues ya está, vale, Kimi, pues no es que ha salido también Quen. Quen 3.8 también ha llegado esta semana y también un modelo de 2,4 billones de parámetros solo por debajo de Fable 5, según ellos. ya está disponible en Alibaba Token Plan y también va a ser de código abierto y ya han dicho que además van a lanzar más de un modelo de diferentes tamaños, o sea, que este es el más grande como el más avanzado, pero la idea es que van a estar lanzando más que los modelos abiertos te ofrezcan casi lo mismo que los mejores modelos por la mitad de precio. Bueno, es que ahí está lo bueno. Claro, ves, este es el tema que yo no entiendo estos comentarios. Dice, "2,4 billones de pesos abiertos impresiona, pero casi nadie va a servir ese monstruo. El impacto real de Quen no es el modelo gigante que descargas y no puedes correr. Son las versiones cuantizadas y chicas que sí caben en tu GPU abierto que no puedes ejecutar es abierto de nombre. No se puede reducir el mundo a lo que tú puedes ejecutar en tu GPU. entiendo lo que quiere decir, pero no entiendo a qué viene. Es que acabo de pon un ejemplo. Firewars AI, por ejemplo, el hecho de que tú no lo puedes ejecutar en tu máquina no significa que no te pueda venir una empresa de infra como por ejemplo Fireworks y te pueda ofrecer, por ejemplo, pues mira, Quen 3.7 Plus y ellos sí que te lo puedan te lo puedan revender o te lo hospeden y te lo dejen a un precio muy atractivo. Es que te lo

  16. 26:12 , obre el vídeo en una pestanya nova

    pueden dejar a un precio muy atractivo y claro, si te dan Quen 3.8 Och, donde además lo puedes ejecutar desde diferentes providers, no estás atado a un proveedor cerrado, ¿sabes? Como no solo puede ser en Open AI. El hecho de que sea abierto significa que no solo lo va a poder lanzar uno, sino que lo vas a poder lanzar en diferentes sitios y además de eso lo vas a poder tener disponible geográficamente en diferentes sitios, lo cual es más interesante. No sé, o sea, no entiendo, entiendo lo que quiere decir, pero no entiendo a qué viene. Porque yo no he dicho ni siquiera en mi en mi post digo, "Lo puedes instalar en tu máquina." No, es que no digo nada de eso. Y pero muchas veces mucha gente lo reduce a si no lo puedo ejecutar en mi máquina no me sirve. Pero a ver, es que son pesos abiertos y la gracia es que lo podamos tener más de un sitio. No sé, no sé, es un poco es un poco raro este comentario porque veo que se repite mucho. Bueno, si no tiene suficiente con Quen 3.8 también va a llegar ya y está pues es que eh hay rumores muy fuertes. GLM 5.5, GLM 5.3 se lo van a saltar y va a llegar GLM 5.5 5 que lanzaría en agosto, que sería de un billón de de más de un billón de parámetros también acercándose y nada, también contexto. Pues nada, ya veis que madre mía, cómo está la cosa, cómo está la cosa. Con todo esto os voy a contar cuáles son mis modelos favoritos. No he probado todavía Quen, todavía no lo he probado, por lo tanto no cuenta, pero esta semana entre todos los modelos que está utilizando, estos son mis modelos favoritos. Tareas simples GPT 5.6 Luna Max. Código diario GPT 5.6 Sol Medium. Yo sé que esto parece muy freaky el hecho del max, el medium y tal, pero todo esto está estudiado y de hecho, hoy mismo cuando termine el directo, voy a publicar un vídeo en YouTube donde pruebo GPT 5.6 y te explico por qué.

  17. 28:01 , obre el vídeo en una pestanya nova

    Esto te lo explico para que lo entiendas. Luego, problemas complejos, GPT 5.6 Sol Max, calidad, velocidad, Grock 4.5. Me ha sorprendido mucho Grock 4.5, eh, o sea, he alucinado muy fuerte con Grock, especialmente utilizándolo con Grock Build. He alucinado. Lo tengo que probar más, pero me ha sorprendido un montón. Eh, no sé si es por el modelo, no sé si es por los centros de datos, no tengo ni idea, pero me parece espectacular. Para interfaces eh UI, Fable 5, vulnerabilidades y seguridad. Otra funada que me ha venido, otra funada. Vulnerabilidades y seguridad. Mucha gente en muchos sitios, en todos los lugares a la vez me acusaban que era mentira, que si era bite. Me decían, "Si no se puede utilizar Fable 5 para vulnerabilidades y seguridad, mentiroso, no sé qué. Cómo se nota que la lista la ha escrito eh CH GPT, pero si trabajar con ciberseguridad en Fable te deriva a Opus 4.8", me dicen. Y esto no es verdad. Te quiero mucho, Alexis, porque sé que no lo dices con mala intención. Mirad, lo podéis probar vosotros mismos porque yo lo uso mucho para eso. Audita la seguridad de mis end points y asegúrate que no tenga vulnerabilidades. Y te lo va a hacer perfectamente. Te lo va a hacer perfectamente. O sea, no vas a tener ningún problema. No te va a sacar de Fable 5. Lo va a hacer de principio a fin, sin problemas. No vas a tener ningún problema de es que no no no te va a decir nada. Ahora, si tú le pones algo como como esto, ¿cómo puedo atacar este sitio web para explotar sus vulnerabilidades? Entonces sí que te va a sacar. Vale, sí que te va a sacar, pero hacer la prueba vosotros con Fable 5, ¿eh? Cualquier API que tengáis, le pides, revisa estas vulnerabilidades, mejora la defensa de esto, evita que puedan hacer esto, no sé qué, no sé cuánto, no tiene ningún

  18. 29:42 , obre el vídeo en una pestanya nova

    problema. No hay ningún problema. Y no sol, no tiene ningún problema, es s super bueno. Eh, claro, si le dices, "Soy hacker, soy hacker maligno y lo que quiero es que encuentres una vulnerabilidad aquí para atacar este banco." Sí, te saca. Pero yo sé que mucha gente se ha quedado con esto en la cabeza, no lo ha probado más, pero no es que de verdad, o sea, yo lo utilizo un montón para esto y es que además lo hace muy bien. Pero a ver, no solo Alexis me lo dice, que Alexis, por ejemplo, yo sé que no me lo dice a malas, sé que no me lo dice a malas, pero hay algún otro que sí que me lo decía un poco. Es byete el post Fable no se puede usar para nada de vulnerabilidades y seguridad. Pero, ¿por qué me escribes si no lo has probado? Tú no lo has probado. Lo has leído en un artículo, lo has leído por ahí. No sabes de qué estás hablando, tío. O sea, el Bite es tu twist, cabrón, porque no sabes de qué estás hablando. Ni la has probado. No sé, igual sí que la ha probado y es verdad, es verdad que sobre todo al principio, el primer día, el primer día que lo abrieron es verdad que era bastante más tiquis miikis, o sea, pero es que yo lo he usado un montón, pero bueno, no sé, no sé, no sé, la gente no me cree. Ahora es verdad que tengo una amiga que que ya trabaja en química y esto sí que es verdad que ella me lo dice, que temas de su trabajo te no puede preguntarle absolutamente nada. Eh, de tema de química, eso sí que dice que es imposible, que se lo puedes preguntar como te dé la gana, que no hay forma, eso sí. Pero mira, en tema de vulnerabilidad, ya os digo yo que sí que que no hay ningún problema. Tú le dices una auditoría, mejora, no sé qué para tema de defensa, ningún problema. Al menos en mi caso, y ya os digo yo que lo está utilizando un montón. [música] [música]