Intel·ligència artificial Programació Models de llenguatge Kimi K3 Moonshot AI benchmarks vibe coding

Kimi K3: gran salt en programació, però no supera GPT-5.6 ni Fable 5 en tot

Kimi K3 té 2,8 bilions de paràmetres i un milió de tokens de context. Analitzem els benchmarks, dues proves de codi, el preu i els límits reals.

Què és Kimi K3

Kimi K3 és el nou model de Moonshot AI i un salt de mida considerable: té 2,8 bilions de paràmetres totals, una finestra de context d’un milió de tokens i entrada nativa de text i imatges. El vídeo de Fazt el presenta com un rival de GPT-5.6 Sol i Claude Fable 5 i en prova dues capacitats de programació: un tauler de finances personals i un joc tridimensional inspirat en Mario Kart.

La xifra de 2,8 bilions necessita context. K3 és un model de mescla d’experts, o MoE. No activa tots els paràmetres per a cada token, sinó 16 de 896 experts segons la documentació de Kimi. Per tant, la mida total no equival directament al cost de cada resposta ni permet comparar la qualitat amb un model dens només comptant paràmetres.

També és important delimitar la multimodalitat. K3 pot entendre text, imatges i, segons el fabricant, contingut visual dins de fluxos d’agents. La seva API, però, retorna text o codi: no és per si mateix un generador d’imatges o de vídeo comparable a un model específic de creació audiovisual.

L’arquitectura i el context d’un milió de tokens

Moonshot destaca dues peces tècniques: Kimi Delta Attention i Attention Residuals. La primera busca fer més eficient l’atenció en seqüències llargues; la segona permet recuperar representacions de diferents profunditats del model en comptes d’acumular-les sempre de la mateixa manera. K3 també utilitza una arquitectura Stable LatentMoE molt dispersa.

La finestra d’un milió de tokens permet, en teoria, introduir repositoris grans, molts documents o converses llargues en una sola sessió. Això no prova que el model recordi amb la mateixa precisió qualsevol detall situat en qualsevol punt del context. Per valorar-ho calen proves específiques de recuperació, raonament a llarga distància i consistència, no només la mida màxima anunciada.

Kimi adverteix, a més, que el model és sensible a l’historial de raonament. Si l’eina que l’executa no conserva correctament aquest historial, o si es canvia de model enmig d’una sessió, la qualitat pot tornar-se inestable. El fabricant recomana un entorn compatible com Kimi Code i instruccions explícites per limitar decisions massa proactives.

Els benchmarks no diuen que superi tots els rivals

La lectura prudent és que K3 entra al grup capdavanter, però no domina totes les proves. La mateixa Moonshot afirma que el rendiment global encara queda per sota de Claude Fable 5 i GPT-5.6 Sol. En canvi, publica resultats molt competitius en programació de llarga durada, optimització de kernels, treball de coneixement i tasques que combinen codi amb visió.

Artificial Analysis li atorga 57 punts en el seu índex d’intel·ligència i el situava setè entre 190 models en el moment de la consulta. És una fotografia d’un conjunt concret d’avaluacions, no una classificació universal. Els resultats poden variar segons l’agent, les eines, el nivell de raonament, el límit de torns i la manera de puntuar.

La comparació és especialment delicada perquè Moonshot publica els resultats de K3 amb l’esforç de raonament màxim i diferents arnesos segons la prova. Un model pot guanyar en desenvolupament de programari i perdre en latència, seguiment d’instruccions o experiència d’ús. «Competeix amb» és una descripció defensable; «és millor que» requereix especificar en quina tasca i sota quines condicions.

Primera prova: un tauler de finances atractiu però incomplet

Fazt demana una aplicació de finances personals amb Next.js, una base de dades SQLite, gràfics, pressupostos, despeses i un disseny polit. Kimi treballa durant uns quaranta minuts i genera una interfície visualment convincent, amb targetes, gràfics, navegació i dades de demostració.

El resultat serveix com a prova de prototipatge frontal: el model interpreta bé l’estètica i estructura moltes pantalles sense intervenció constant. Tanmateix, el vídeo no troba una via clara per afegir dades noves. Que existeixin fitxers de base de dades o codi servidor no garanteix que el flux complet de crear, editar i persistir moviments estigui acabat.

Tampoc es mostren proves automatitzades, validació de formularis, autenticació, control d’accés, migracions o una revisió de seguretat. En una aplicació financera real, aquestes parts són més importants que l’aparença. La demostració confirma que K3 accelera un primer prototip; no valida un producte preparat per guardar informació sensible.

Segona prova: un joc 3D funcional, però encara bàsic

El segon encàrrec és un joc tridimensional de curses amb una pista, rivals, objectes, comptavoltes, posicions i un minimapa. Després d’aproximadament mitja hora, Kimi entrega una experiència jugable al navegador amb elements visuals que recorden el prompt.

La prova mostra bona capacitat per coordinar Three.js, interfície i lògica elemental en una sola generació llarga. També deixa veure el límit: la conducció i l’acabat són bàsics, i una partida curta no permet comprovar col·lisions extremes, comportament dels rivals, rendiment sostingut o errors de reinici.

Per passar de demostració a projecte mantenible caldria inspeccionar l’arquitectura, executar proves, revisar dependències i iterar sobre controls, accessibilitat i rendiment. El vídeo avalua sobretot si el model pot produir ràpidament una idea visible, no la qualitat interna del programari.

Preu baix per token no sempre vol dir tasca barata

L’API oficial costa 3 dòlars per milió de tokens d’entrada sense memòria cau, 0,30 dòlars amb encert de memòria cau i 15 dòlars per milió de tokens de sortida. Són tarifes competitives per a un model d’aquesta mida, però el cost final depèn de quants tokens generi i de quantes iteracions necessiti.

Artificial Analysis mesura uns 32,6 tokens de sortida per segon i descriu K3 com un model lent i molt verbós. En la prova agentiva AA-Briefcase va quedar segon, darrere de Fable 5, però va consumir una mitjana elevada de torns i tokens. Això il·lustra una diferència clau: una tarifa baixa pot acabar en una factura i un temps superiors si l’agent treballa durant molta estona o produeix massa text.

Abans d’adoptar-lo convé mesurar el cost per tasca completada, la taxa d’èxit al primer intent i el temps fins a un resultat verificat. El preu per milió de tokens, tot sol, no respon cap d’aquestes tres preguntes.

Conclusió

Kimi K3 és un model ambiciós i especialment atractiu per a programació agentiva, interfícies i treball amb context extens. Les dues proves del vídeo mostren que pot convertir prompts amplis en prototips visuals complexos amb poca supervisió.

La demostració no acredita que superi GPT-5.6 Sol o Claude Fable 5 en general. El mateix fabricant reconeix un desavantatge global, i les dades independents apunten a una combinació de gran capacitat, velocitat moderada i molta verbositat. El tauler financer, a més, queda funcionalment incomplet malgrat el bon aspecte.

Per a desenvolupadors, la millor manera d’avaluar-lo és donar-li una tasca pròpia amb criteris verificables: tests, restriccions de seguretat, límit de cost i temps. K3 sembla un competidor real, però el valor no es decideix per la mida del model ni per una captura bonica, sinó per la proporció de feina correcta que entrega sense haver-la de refer.

Contrast i context

Fonts consultades

4 fonts
  1. 01
  2. 02
  3. 03
  4. 04

Font de treball

Transcripció amb marques de temps

10 fragments
Consulta la transcripció
  1. 0:00 , obre el vídeo en una pestanya nova

    Hace unas horas ha salido Kimi 3, que es la versión más actualizada del modelo de Kimi, este modelo multimodal que permite generar desde texto, imágenes, videos y también código. Y bueno, el día de hoy mucho se ha estado hablando acerca de lo que puede generar, que para sorpresa está saltando bastante en los benchmark a tal punto que está alcanzando a Cloud Fable 5 o incluso GPT 5.6 Sol. Y bueno, para hacer una demo el día de hoy voy a mostrarles alguno que otro ejemplo, además de también poder resumirles de qué se trata este nuevo modelo. Vamos a empezar. Coders, cuando una aplicación ya está en producción, uno de los retos más importantes es detectar problemas antes de que los usuarios los encuentren. Por ejemplo, una página que deja de cargar, una API que empieza a responder lentamente o un flujo dentro de la aplicación que simplemente deja de funcionar. Y esperar a que los usuarios reporten estos problemas no siempre es la mejor estrategia. Aquí es donde entra el synthetic monitoring. Esta técnica consiste en simular interacciones con tu aplicación de forma automática, como si fueran usuarios reales. Por ejemplo, puedes configurar pruebas que verifiquen

  2. 0:54 , obre el vídeo en una pestanya nova

    periódicamente si una página carga correctamente, si un formulario funciona o si una API está respondiendo como debería. Y esas pruebas se ejecutan desde distintas ubicaciones y de forma constante, lo que permite detectar problemas de disponibilidad o rendimiento antes de que afecten a los usuarios reales. Y para resolver esto, puedes utilizar Open Manager Nexus, en donde puedes configurar este tipo de monitoreo para páginas web, API y aplicaciones completas. Además, cuando ocurre un problema, puedes recibir alertas en tiempo real, lo que ayuda a reaccionar rápidamente. Y lo genial es que puedes implementar Open Manager Nexus tanto en la nube como en tu propia infraestructura. Además, ahora mismo tienes disponible una prueba gratuita de 30 días desde su página oficial. Así que aprovechen esta oportunidad y prueben todas las funciones utilizando el enlace que les dejo en la descripción. Muy bien, empecemos primero leyendo un poco acerca de lo que sería el anuncio de este nuevo modelo de Kimi llamado K3, que es básicamente el sucesor de K2.7. Ahora, lo que más ha llamado la atención entre todas las cosas o por qué se está nombrando tanto este modelo en internet es principalmente porque ahora está

  3. 1:50 , obre el vídeo en una pestanya nova

    compitiendo con los modelos más grandes. Es decir, en Kimica 2.7 nosotros comparáamos ese modelo con GPT 5.3 u Opus 4.7. Entonces, al salir Química 3 se esperaría que compita con Opus 4.8 o GPT 5.5, pero de hecho no. Y es que ha dado un salto enorme y ahora se la está comparando con GPT 5.6 Sol y Fable 5, que son los modelos más grandes y más producidos que hay a este momento. Lo que quiere decir que esa distancia de 6 meses en el que iban los modelos chinos detrás de los modelos más populares, pues en realidad no lo es tanto. Y a este punto sorprende bastante que un modelo que estaba casi en las últimas listas fuera del ranking 10 de muchos benchmark, ahora está compitiendo con estos dos modelos de aquí, casi similar a lo que pasó con GLM 5.2 dos hace algunas semanas atrás, pero bueno, de forma resumida, este es un modelo nuevo que llega a los 3 trillones de parámetros y para lograr, digamos, aumentar un poco su velocidad, sobre todo porque es un modelo grande, tienen una nueva forma de implementar lo que sería la decodificación de tokens al momento de la entrada y es justamente con estas nuevas formas que se llama Delta attention y attention residuals. Lo que significa en la práctica es que

  4. 2:50 , obre el vídeo en una pestanya nova

    también tenemos un millón de tokens en una ventana de contexto y que esto nos permite poder aplicarlo en tareas de larga duración como pueden ser ejecución de asistentes o ejecución de código o razonamiento y básicamente tareas de agentes. Aunque bueno, una forma de medir todo esto es utilizando algún benchmark que no viene por parte de la misma empresa. Entonces, también tenemos Artificial Analysis, que es un benchmark que mide múltiples modelos en distintos tipos de áreas. Y por ejemplo, cuando hablamos de inteligence o inteligencia, sobre todo al momento de escribir código o hacer tareas agénticas, lo que ha pasado con este modelo, simplemente si lo comparamos con uno de sus precesores, que es 2.6, por ejemplo, ha hecho un salto casi a la par de estar ahora con GPT 5.6 y Fable. Y bueno, esto no tan solamente al momento de generar códigos, seno que de nuevo también al momento de utilizarse en tareas para poder hacer ejecución de programas o de nuevo tareas relacionadas con agentes en general. Aunque bueno, algo muy importante con todo esto es justamente saber qué tan caro es y de hecho no es un modelo tan costoso para ser un modelo que está compitiendo con esos modelos grandes.

  5. 3:47 , obre el vídeo en una pestanya nova

    Obviamente la respuesta puede variar, pero solamente para darnos una idea y midiendo el costo. Pueden ver aquí que este es un poco más caro que lo que sería GLM 5.2, pero sigue siendo más barato que Opus 4.8, por ejemplo. Y bueno, igual también mucho más barato que GPT. Aunque bueno, otra métrica también muy importante en cuanto al modelo es la velocidad de respuesta. Y bueno, este modelo ya se conocía que no era muy rápido. De hecho, si ustedes han llegado a utilizar K2.7 saben que sí es un modelo que puede ser bastante decente, pero en cuanto a velocidad pues hay modelos mucho más baratos. Incluso un descendiente de este que puede ser composer 2.5 es más veloz en mi opinión y se nota. Y en este caso no ha mejorado tanto en este aspecto, así que al menos por velocidad no esperen un cambio enorme. Pero bueno, al final lo que importa es la generación de código y qué tan bueno es. Así que vamos a ver algunos ejemplos. Y bueno, para poder probarlo, ya lo tienen disponible en lo que sería su suscripción de Kimi.com o pueden utilizarlo en aplicaciones como Kimy Word, Kimi Code o Kimi API. Y bueno, solamente para darles un número exacto, en este caso según su propia documentación, el millón de tokens de

  6. 4:41 , obre el vídeo en una pestanya nova

    entrada cuesta alrededor de $3 y la salida cuesta alrededor de 15. De nuevo, colocándolo muy por detrás lo que sería 5.5 y 4.8 y obviamente muy por detrás lo que sería Fable 5. En cuanto a precios estamos hablando. Y bueno, para empezar a utilizarlo, en mi caso voy a estar probándolo desde Kimi, desde Kimi Code, su herramienta o harness. Y bueno, desde aquí ya pueden empezar a cambiar el modelo, simplemente escriben slash model y con esto van a empezar a ver estas opciones. Tenemos ahora la opción de K3. Y por cierto, si quieren saber cómo utilizar Kimi Code o quieren crear algunos ejemplos, ya he creado videos anteriormente utilizando este harness, así que también lo voy a dejar en la descripción. Pero bueno, vamos a pedir una aplicación un poco extensa y voy a pegar aquí un texto grande y básicamente le voy a pedir un dashboard de finanzas personales que nos permita manejar distintas cuentas, marcar objetivos financieros y básicamente tener un registro de los ingresos, retiros y demás operaciones que se pueden hacer desde una cuenta. Entonces, vamos a ver qué tanto se puede demorar para un pr de este estilo. No es una planificación, pero tampoco es un prqueño. Y bueno, por cierto, aquí si también quieren hacer

  7. 5:36 , obre el vídeo en una pestanya nova

    que simplemente lo implemente, pueden escribir aquí un yolo y con eso simplemente va a empezar a responderse las preguntas por él mismo. Muy bien, después de aproximadamente unos 40 minutos más o menos, aquí ha pasado la generación del proyecto y en teoría la razón de por qué se ha demorado tanto es que he implementado cada uno de los módulos y también lo que sería backend y frontend. Y bueno, lo que ha generado es esto de aquí, que de hecho no se ve nada mal. Ya ha colocado datos demo, ya tenemos aquí secciones para poder tener incluso gráficas y bueno, en cuanto a UI se ve bastante bien. Ahora, en este caso, este es un modelo sin ningún tipo de skill adicional, es decir, este es el modelo tal cual responde. Y bueno, esta es una de las cosas que también se está remarcando bastante en redes sociales y es que en el benchmark de Front Code Arena, incluso lo que ha pasado es que Kimica 3 está mucho mejor que Fable 5 y 5.6 sol. Eso quiere decir que para tareas de frontend pues realmente supera esos modelos y se nota realmente en el primer pronto, aunque de nuevo esto le ha tomado mucho tiempo generarlo. Y otra cosa que no veo por aquí es justamente la forma de poder añadir datos. Al

  8. 6:32 , obre el vídeo en una pestanya nova

    parecer hecho como simplemente frontend para poder visualizar cosas y no hay ninguna forma aparente de poder añadir datos adicionales. Y bueno, en cuanto al código lo que quiera generar es una aplicación de Next en donde está la API, están las aplicaciones de frontend y en cuanto a la base de datos, como no ha sido muy explícito de qué base de datos debería utilizar, al parecer aquí ha elegido SQLite y bueno, en realidad no ha añadido muchos paquetes, es básicamente Nex en sus últimas versiones, lo cual está bastante bien, es decir, este modelo ya considera versiones modernas, al menos de estos frameworks. Lo siguiente que también incluido son los paquetes para hacer linting y para poder obviamente utilizar TypeScript y bueno, no son versiones viejas ni nada de eso, entonces está bastante decente como para producir código realmente al menos de aplicaciones frontend. Y bueno, para hacer un segundo ejemplo, vamos a pedirle ahora crea un juego en 3D al estilo de Mario Kart, por ejemplo, solamente que vamos a decirle debe haber métricas de velocidad y un escenario realista. Vamos a ver qué es lo que crea. Y bueno, si esperamos alrededor de unos 30 minutos más y un poco más

  9. 7:23 , obre el vídeo en una pestanya nova

    incluso, vamos a ver que aquí ha generado otra vez otro proyecto y vamos a comprobarlo. De hecho, aquí me ha dado una URL y esto es lo que ha generado. Básicamente es un proyecto bastante básico utilizando 3GS obviamente, pero este es un modelo que obviamente es mucho más barato que lo que es GPT 5.6 Se y bueno, por allí también podríamos hacer una comparación en uno de estos días justamente con los otros modelos, pero incluso ha cumplido con la idea del pron inicial, que es justamente ver en la parte superior izquierda lo que sería el tiempo, la velocidad y a la parte derecha hay como justamente un mapa y está bastante bien. De hecho es un primer pron, simplemente no he hecho más modificaciones. Sí se ha demorado, eso sí, aunque incluso algo que también pueden notar es que estoy utilizando el esfuerzo máximo. De hecho, si venimos aquí y coloco slash effort y doy un enter, van a ver que solamente tengo disponible el modo max. Entonces, esto quiere decir que a medida que vayan saliendo las variaciones de este modelo, pues podríamos obtener modelos que responden más rápido o quizás nos den una que otra variación adicional. Pero bueno, de momento es lo que tenemos y de nuevo no está nada mal. incluso para

  10. 8:18 , obre el vídeo en una pestanya nova

    tareas de frontend este modelo está bastante bien y en mi opinión no lo he probado tanto con lógica, es decir, no he visto lo que ha generado, no se ve nada mal de hecho, pero voy a esperar aún así algunos días para ver algunos ejemplos y sobre todo también traerles una actualización de lo que sería Química 3. Y bueno, básicamente este ha sido el video del día de hoy. Está bastante impresionante el modelo, sobre todo para tareas de fronte me ha gustado bastante y aún no lo he podido probar incluso con lo que sería tareas en paralelo o con sus subagentes, pero ya lo voy a ir probando en el transcurso esta semana. Y bueno, esto acaba de salir, así que también pueden probarlo utilizando tanto Kimy Code o suscripciones de otros harness que pueden estar por allí. Y bueno, si tienen una duda o cualquier sugerencia también pueden dejar en los comentarios. Nos vemos en un siguiente video. Y eso ha sido todo por el video del día de hoy. Si quieres conocer más, te dejo en pantalla mis enlaces sociales y mi web fast.def donde puedes reservar asesorías personalizadas de cualquier tema. Y no te olvides de dejarme un comentario, ya sea de una duda o una sugerencia para el siguiente video. Nos vemos en un próximo