Intel·ligència artificial Models oberts Kimi K2.7 GLM 5.2

GLM-5.2 i Kimi K2.7: l’ofensiva de la IA xinesa

Midudev compara GLM-5.2 i Kimi K2.7 Code, dos models xinesos oberts i barats, i explica per què els benchmarks i Rio 3.5 exigeixen prudència.

Dos models xinesos en un mateix cap de setmana

Midudev dedica el vídeo a dos llançaments que resumeixen la velocitat del sector xinès de la intel·ligència artificial: GLM-5.2, de Z.ai, i Kimi K2.7 Code, de Moonshot AI. Tots dos posen el focus en la programació i els agents, ofereixen els pesos del model i competeixen amb preus d’API molt més baixos que els serveis de gamma alta dels laboratoris nord-americans.

El creador no els presenta com a guanyadors automàtics. El seu argument és més interessant: quan un model costa una fracció d’un altre, no necessita igualar-lo en totes les proves per convertir-se en una alternativa útil.

La segona meitat del vídeo introdueix un contrapunt. El cas de Rio 3.5 mostra com les etiquetes “obert”, “propi” i “nou” poden simplificar una història tècnica molt més complexa. Per això el resum separa les afirmacions comercials, els resultats publicats pels mateixos fabricants i la informació que es pot comprovar als repositoris.

GLM-5.2 aposta pel context d’un milió de tokens

Z.ai descriu GLM-5.2 com el seu model principal per a tasques de llarga durada. La fitxa oficial destaca una finestra de context d’un milió de tokens, més capacitat per mantenir treballs extensos i diferents nivells d’esforç de raonament. L’objectiu no és només respondre una pregunta de codi, sinó conservar prou context per actuar durant moltes passes sobre un projecte.

Midudev remarca que el model es distribueix amb llicència MIT i que també es pot consumir mitjançant els plans de Z.ai. Aquesta combinació permet provar-lo com a servei i, per a qui disposi d’una infraestructura molt gran, desplegar-ne els pesos. “Obert” no vol dir que executar-lo localment sigui fàcil: és un model enorme i queda lluny de l’abast d’un ordinador domèstic convencional.

La fitxa de Z.ai atribueix part de la millora a IndexShare, una tècnica que reutilitza l’indexador entre capes d’atenció dispersa per reduir el càlcul en contextos llargs. També publica una bateria extensa de resultats en raonament, programació i ús d’eines. Són dades útils per entendre què pretén optimitzar el model, però continuen sent avaluacions seleccionades i configurades pel proveïdor.

Kimi K2.7 Code redueix el raonament i accepta vídeo

Kimi K2.7 Code és un model especialitzat en programació construït sobre Kimi K2.6. Moonshot AI declara que consumeix aproximadament un 30% menys de tokens de raonament que el predecessor i que millora la finalització de tasques llargues d’enginyeria de programari. La seva arquitectura de mescla d’experts té un bilió de paràmetres totals, 32.000 milions d’actius i un context de 256.000 tokens.

El vídeo també destaca un mode d’alta velocitat anunciat per al servei. La promesa de generar centenars de tokens per segon és rellevant en un agent de codi: una resposta correcta pot resultar poc pràctica si cada iteració interromp el flux de treball. Tanmateix, la velocitat real depèn de la mida del context, la càrrega del proveïdor i la quantitat de raonament necessària.

La fitxa oficial confirma una altra diferència notable: K2.7 Code accepta text, imatges i vídeo a l’API oficial. També conserva el raonament entre torns i està pensat per treballar amb Kimi Code CLI. Els pesos porten una llicència MIT modificada, amb una obligació de marca per a productes comercials que superin determinats llindars d’ús o ingressos; per tant, convé llegir la llicència abans d’equiparar-la sense matisos a una MIT estàndard.

El preu canvia la pregunta que cal fer

Midudev compara el preu anunciat de Kimi amb el d’alguns models tancats i planteja una pregunta simple: si costa cinc vegades menys, és cinc vegades pitjor? La seva resposta és que no. Encara que un model líder resolgui més casos difícils, una alternativa prou bona pot ser més rendible per a autocompletat, revisions rutinàries, prototips o agents que fan moltes crides.

Els proveïdors canvien plans, descomptes, límits, memòria cau i velocitats, i el cost final també inclou les repeticions causades per errors. Per comparar serveis de manera honesta cal mesurar una tasca pròpia: quant costa arribar a una solució que passa les proves, quantes intervencions humanes necessita i quant triga.

Els plans de subscripció agregats, com els que donen accés a diversos models des d’una sola eina, encara compliquen més la comparació. Poden ser una porta d’entrada econòmica, però tenen quotes, polítiques de privadesa i disponibilitat diferents de l’API original. La relació qualitat-preu és el centre del vídeo; no una recomanació universal d’un proveïdor concret.

Per què els benchmarks s’han d’agafar amb pinces

GLM-5.2 i Kimi K2.7 publiquen taules on s’apropen o superen models occidentals en proves determinades. Midudev les observa amb escepticisme, sobretot quan cada llançament tria conjunts, eines i nivells de raonament diferents. Una puntuació pot mesurar molt bé una habilitat concreta i dir molt poc sobre el repositori, el llenguatge o l’equip real que té davant l’usuari.

La fitxa de Kimi ajuda a veure el problema: explica que K2.7, GPT-5.5 i Claude Opus 4.8 es van executar amb eines i modes d’esforç específics. Aquesta transparència és positiva, però també confirma que el resultat no és una propietat immutable del model. El bastiment de l’agent, el missatge de sistema, el pressupost de tokens i la possibilitat de repetir intents canvien la classificació.

Les arenes cegues, on una persona vota entre respostes sense conèixer el model, aporten una altra perspectiva. Encara així, mesuren preferències dels participants i poden barrejar tasques molt diferents. El consell pràctic del vídeo és conservar els benchmarks com a filtre inicial i exigir una prova directa abans de canviar una eina de producció.

Rio 3.5 revela què hi pot haver darrere d’un model “propi”

El cas final és Rio 3.5 Open 397B, publicat pel compte de l’Ajuntament de Rio de Janeiro. A primera vista, les xifres i el relat d’un gran model municipal van generar sorpresa. La fitxa actual de Hugging Face, però, explica que es construeix fusionant Nex-N2-Pro i Qwen3.5-397B-A17B, i aplicant després destil·lació a partir d’un model més fort.

La mateixa fitxa reconeix que inicialment es va pujar per error la versió base fusionada en lloc del resultat destil·lat final i anuncia una nova càrrega. Aquesta dada no implica que una fusió sigui inútil ni falsa: combinar pesos, ajustar-los i avaluar-los pot requerir feina real. Sí que obliga a descriure’n clarament la procedència i a no confondre una adaptació amb un model entrenat des de zero.

L’Ajuntament ja havia presentat Rio 3 Open com una família amb llicència MIT orientada a la sobirania tecnològica i al processament local. Aquesta política pública és separable del problema concret de traçabilitat de Rio 3.5. Els dos fets poden coexistir: hi ha una aposta institucional per models oberts i, alhora, una publicació que necessitava més claredat sobre l’origen i la versió dels pesos.

La competència oberta beneficia qui construeix programari

El missatge que queda no és que la IA xinesa ja hagi derrotat tots els models tancats. És que GLM-5.2 i Kimi K2.7 Code redueixen la distància en tasques importants mentre pressionen preus, llicències i velocitat. Per a desenvolupadors, això amplia la possibilitat de triar un model diferent segons el cost, la privadesa, la latència o la dificultat del problema.

La millor resposta és adoptar un procés de prova, no una nova fe. Cal definir casos reals, executar-los amb el mateix agent i pressupost, validar el codi amb proves i registrar cost i temps. També s’ha de comprovar la llicència i la procedència dels pesos abans d’incorporar-los a un producte.

Midudev resumeix aquesta acceleració amb entusiasme, però el vídeo acaba justament on ha de fer-ho una anàlisi responsable: els models nous poden tenir molt bona pinta i continuar requerint verificació. L’obertura facilita inspeccionar i experimentar; no substitueix ni la traçabilitat ni una avaluació independent.

Contrast i context

Fonts consultades

6 fonts
  1. 01
  2. 02
  3. 03
    Z.ai a Hugging Face Fitxa oficial de GLM-5.2
  4. 04
    Moonshot AI a Hugging Face Fitxa oficial de Kimi K2.7 Code
  5. 05
    Ajuntament de Rio de Janeiro a Hugging Face Fitxa de Rio 3.5 Open 397B
  6. 06

Font de treball

Transcripció amb marques de temps

12 fragments
Consulta la transcripció
  1. 0:00 , obre el vídeo en una pestanya nova

    El tema de los chinos amigos, es una cosa que le es lo porque es que se espectacular. Este fin de semana no ha salido un modelo de ejencer de visual. Han salido dos, dos modelos chinos de inteligencia artificial. Pauza dramática. Los dos modelos que han salido es GLM 5.2 que dice la gente de ceta EY que es la empresa que está detrás. La inteligencia de MIRD se abierta accesible y estar disponible para construir, para darle poderes a todos los desarrolladores en todo el mundo. Dice que GLM 5.2 ya está disponible en todos los GLM Co-Dimplan, para todos sus usuarios de LITEPRO, MAX, TIM, BLAPLA. Vamos a ver los planes de GLM. Claro, es que el LITEPA no no pone antes de ponir a cuánto te daba LITEPA. Claro, está cosa, lo recorte y llegan a todos amigos.

  2. 0:50 , obre el vídeo en una pestanya nova

    Pero antes te decía cuánto usaba cuánto tenía. Y básicamente era, pues quiera como cuatro veces lo que te daba directamente de CloudCode o antropi que en este caso, ¿no? Pero la calidad preció que tienen brutal. Y en este caso, la gente de ceta EY encima se haga su propio CloudCode que tampoco está mal. Lo malo, pues que claro, yo muchas veces lo que yo prefiero en estos casos. A mejor, con OpenCode, lo buenos que tú tienes la suscripción está de Zen. No, de Zen no, la de GO, que cuesta. Cinco dolares, el primer mes lo os son 10 dólares. Y esto normalmente ya te ha acceso a un montón de modelos chinos. El tema es realmente es interesante. Bueno, pues fijaos, eh, capacidad es de código, contexto de un millón de tokens, a pizza, bo servirios lanzan la semana que viene, o sea, todavía no está en app.

  3. 1:35 , obre el vídeo en una pestanya nova

    Y el modelo también va a ser de código abierto, la semana que viene bajo licencia mid o sea, de código abierto. También soporta dos niveles de esfuerzo de pensamiento, alto y máximo. ¿Por qué noticias GLAM5.2? GLAM5.2 es completamente abierto. A la inteligencia fronteriza pertenecia a todos. Oye la resistción repentina de cierto modelo fronterizos, hablando de ClubFayball 5, es profundamente lamentable. En un momento en el que acceso a modelos fronterizos, se corta brutalmente por razones. No técnicas. Estamos aún más convencidos de una cosa, la ciencia debe ser global. Baya, cocheja, más bestia. El camino, hacia la inteligencia artificial general, nunca debe estar encerrado por alto muros siempre hemos creido que la inteligencia de la inteligencia general debe ser la piedra anguelapa que toda la humanidad explore como laborativa de los líneas de la inteligencia de resuelva de desafíos complejos.

  4. 2:23 , obre el vídeo en una pestanya nova

    GLAM5.2 es el modelo de código abierto más capaz de setar y hay hasta la fecha. No sólo tiene un contexto de un mio de tokens, sino que también mantiene un legal contigo en la finalización de pendiente de tareas de horizonte largo. Esto es que tu agente esté haciendo tareas ahí, durante mucho tiempo. Pero porcibando un solido soporte fundamental. También continuando haciendo nuestro motor para crear modelo que modelo que modificación doméstico más fuerte. Porque claro, hasta que dice, bueno, no está mal, pero os han salido los benchmarks. En diferentes benchmarks de estos públicos, como es el de Bridgebench que también os digo, no es el más popular del mundo del Bridgebench que estos son benchmark de Estados Unidos. También os digo, yo la verdad es que no me lo termino de creer mucho porque muchas veces yo veo esta cosa por ejemplo de UI y te dice que de UI, el que tiene mejor

  5. 3:07 , obre el vídeo en una pestanya nova

    puntuaciones, Cloud Sonet 4.6. De seguridad, GPS5.4. Un poco raro, son cosas raras. Entonces, ¿cómo se supone que lo hace de nuevo? Ya os digo esto, Benzbar, lo que hace es que, bueno, te dan 2 o 4 o 8, te dan diferentes, como diferentes soluciones y tú, sin saber cuál es cuál tienes que votar, cuál es la que más te ha gustado, cuál es la que crees que es mejor. De forma transparente, tu no sabe cuál es la que ha generado cuál, te es que decir, la que más me gusta es esta. Que según esta gente, en el día tanto en razónamiento, como en vez de parecer que ha tenido mejor puntuación que el resto por encima de Cloud Fable 5. Esto ya os digo en este, si ya lo son que pillarlo con pinzas y imagina test.

  6. 3:49 , obre el vídeo en una pestanya nova

    Pero aún así, el tema es que tiene muy buena pinta. ¿Por qué? Ostra si ya era el anterior, era bastante bueno, imagina test, estamos hablando de una mejora del anterior y la calidad prece que te suendaré esto por el brutal. El tema es, ha sacado Kimi, ha sacado Kimi, Kimi, Kados, 07, mirando los Benzmas, con Kimi, Kados, 07, Koud, por cada vez está enfocado al código. Bueno, a ver, según el Benzmas, en algunos está más cerca, más lejos, y tal, está cerca y ya no está al nivel, ya os digo. En este caso sí que se compara con GP5.5, y opos 4.8, se compara así mismo, respeto a Kimi, Kados.6, que fue un modelo muy bueno que tuvo, muy pero que muy buena críticas. Y en este caso es que es mejor en todo. Pero es que además han sacado un modo que es High Speed.

  7. 4:39 , obre el vídeo en una pestanya nova

    Que es el mismo modelo, el mismo modelo de Code, pero que lo que hace es sacar toques de 180 a 266 toques por segundo. Lo cual hace que para experiencia de código extremo, sea todavía mavestia. Y aquí podemos ver también las capacidades de código agéntico como a mejorado respeto a Kimi, Kados.6, como lo podéis utilizar, es la apicompatible con la de OpenEye, y además combina toda las capacidades multis modelos, que puedes seguir. Imagines, le puedes pasar, incluso pues le puedes pasar hasta un vídeo, le va a detar aquí te es todo el código. Yo amigos, sólo es digo una cosa. Los chinos no paran. Fijaos en el precio que tiene. O sea, Kimi cada dos puntos que te cote, tiene un input prize cuando hace catch miss de un dólar. Y el output de 4 dólares.

  8. 5:25 , obre el vídeo en una pestanya nova

    Claro, es que tú este precio si lo comparas. Que con fei bol me parece un poco que no tengo mucho sentido. Pero si lo comparas con opos, el tema es que es 5 veces más barato. Aquí lo tenéis opos 4.8, el input son 5 dólares. Y el output 25 dólares es que es una barbaridad. Entonces la pregunta del millones, es 5 veces peor. Es 5 veces peor este modelo respecto a opos 4.8 y ya os digo yo que no. Entonces hay gente que dice que han podido sacar esto modelo porque han destilado. Pues fei bol que puede ser. A ver yo siempre se ha dicho tema benchmark, que cualquier benchmark ya sea los de GLAM, los de Kimi, los de minimax, los de anthropic, los de GPT, yo los benchmark la verdad no me dice a absolutamente nada.

  9. 6:08 , obre el vídeo en una pestanya nova

    Creo que puede ser sentido como referencia cuando se comparan con sí mismo, pero yo la verdad es que no me fío. O sea, me me da igual. O sea, me me sale que LMS5.2 o Kimi en sus benchmark es mejor que opos 4.8. Y hasta que yo no lo provee, bueno, me lo creo. Así que o me dice que si igual y yo ya sé que no es igual. Vesa aquí por ejemplo, en este benchmark parece que llega casi a opos 4.8. Es que los benchmark sinceramente, mirás. Por ejemplo aquí que está por encima, pero esto es cada benchmark, además es una historia porque este benchmark es MCP Mark Verified. O sea, veas a ver exactamente que hace. Y muchas veces muchos benchmark tienen sus cosas. No sé si habéis visto que está hacia la noticia del millón.

  10. 6:49 , obre el vídeo en una pestanya nova

    El modelo de inteligencia artificial que ha sacado la alcaldía de río de janeiro. No, tengo una broma. Río de janeiro ha sacado un modelo que se llama río 3.5. Pues, claro que la gente se ha vuelto a locar. Mira que tenemos fast. Esto es una locura en el mundo de lopensos. La alcaldía de río de janeiro. A través de soemprán municipal de informática y plan río. Acaba de lanzar un modelo llamado río 3.5 o p. 3.277.000 mía de parámetros. Modelo de Microsoft Fesper basado en cuentres.5. Con licencia mit totalmente abierta que supera su base y compete con lo mejor infrontera un municipio de la sirenión soltando un mostro. Cabasão. Como podéis imaginar este modelo al final, no es que han creado un modelo. Ya es verdad que dice que está basado en cuentres y todo esto.

  11. 7:43 , obre el vídeo en una pestanya nova

    Mirando los benchmark, tenian los benchmark que se te iba a la cabeza. La gente decía pero como tiene estos benchmark tan espectaculares. Como ha llegado tal, lejos esto. Río se presentó un modelo y tal en 30 segundos. Río se pronunció como un modelo jamborándolo en un brasileño. Pero es un merch de pesos de dos modelos o pensos. La fusión de teta de 60 g de la red se lanzó desde junio. El rendimiento río real pero la distribución no ha calpa el alma de transferencia. Claro lo que ha pasado es que han utilizado un modelo de una compañía china que es NEX AG que lo lanzó los dos de junio que tenía justamente estos millones de parámetros con la gramí marquete tura y tal. Entonces claro, al final es que en realidad es una fusión entre dos modelos.

  12. 8:24 , obre el vídeo en una pestanya nova

    Se presentó como un desarrollo propio, pero al final es un desarrollo propio. ¿Qué es que han poco daqueada? La que da manera. La que afinaza se aliaba una buena porque en realidad lo que identificaba NEX dentro del modelo había quitado el sistema de río. Entonces mal asuntos. En el áncambio al nombre que hacía un modelo y poca cosa más. Y luego, ves el benchmark y tampoco te puede fiar. Es lo que tienes.