Intel·ligència artificial Programació Kimi K3 Models oberts Moonshot AI

Kimi K3: què aporta el model de 2,8 bilions de paràmetres

Kimi K3 promet pesos oberts, un milió de tokens de context i 2,8 bilions de paràmetres. Resumim l’arquitectura, els benchmarks i els límits reals.

Moonshot AI ha presentat Kimi K3, un model de 2,8 bilions de paràmetres totals, context d’un milió de tokens i entrada multimodal. El vídeo de Fireship en fa una introducció ràpida i provocadora: l’interès no és només la mida, sinó la promesa d’alliberar-ne els pesos i la proximitat amb els models propietaris més potents.

Hi ha, però, una precisió temporal imprescindible. En el moment d’aquesta publicació, 26 de juliol de 2026, Kimi K3 ja es pot utilitzar als serveis de Kimi i per API, però Moonshot situa l’alliberament complet dels pesos el 27 de juliol. Per tant, encara no es pot descriure com un model de pesos oberts ja descarregable; és un llançament amb aquesta obertura anunciada.

1. Què és exactament Kimi K3?

Fireship presenta el model des de l’inici com un salt important per als models oberts (00:00). Les especificacions publicades per Moonshot són:

  • 2,8 bilions de paràmetres totals;
  • una finestra de context d’un milió de tokens;
  • comprensió nativa de text i imatges;
  • orientació a programació de llarga durada, recerca i treball amb eines;
  • arquitectura Mixture of Experts o MoE.

En català, el trillion anglès correspon a un bilió —10 elevat a 12—, no a un “trilió”. La xifra descriu la mida total del sistema, però no equival al càlcul executat per cada token.

2. 896 experts, però només 16 actius per token

El vídeo explica l’arquitectura MoE a partir del minut 00:46. Kimi K3 disposa de 896 experts encaminats i n’activa 16 per token. Aquesta sparsitat permet augmentar molt la capacitat total sense executar tota la xarxa en cada pas.

Moonshot atribueix una millora aproximada de 2,5 vegades en eficiència d’escalat respecte de Kimi K2 a una combinació de:

  • Kimi Delta Attention (KDA), una forma d’atenció híbrida pensada per reduir el cost de les seqüències llargues;
  • Attention Residuals, que recupera representacions de diferents profunditats en lloc d’acumular-les sempre de manera uniforme;
  • Stable LatentMoE, responsable de l’encaminament entre experts;
  • entrenament conscient de quantització amb pesos MXFP4 i activacions MXFP8.

Són afirmacions i resultats del fabricant. El mateix blog oficial avisa que el detall tècnic complet arribarà amb l’informe del model. Fins que no hi hagi pesos, codi, metodologia i reproduccions independents, cal separar l’arquitectura anunciada del que tercers han pogut comprovar.

3. “Obert” no vol dir fàcil d’executar a casa

Fireship aborda l’autohostatge a 01:35: encara que els pesos siguin públics, un model de 2,8 bilions de paràmetres queda molt lluny d’una GPU domèstica. La mateixa Moonshot recomana configuracions de 64 acceleradors o més per a desplegaments eficients.

La quantització redueix la memòria necessària, però no elimina la necessitat de:

  • carregar un conjunt gegantí de pesos;
  • comunicar experts entre diversos acceleradors;
  • mantenir memòria per al context i les memòries cau;
  • disposar d’una capa de servei, observabilitat i control de costos.

L’obertura dels pesos és rellevant perquè laboratoris, núvols i empreses amb infraestructura poden allotjar-lo o adaptar-lo. No significa que qualsevol usuari el pugui instal·lar en un portàtil, ni que l’API deixi de tenir valor.

4. Els benchmarks són prometedors, no una sentència

La part central del vídeo repassa resultats a partir de 01:54. Moonshot mostra K3 molt competitiu en programació agentiva, feina de coneixement, navegació i creació d’interfícies. Artificial Analysis el situa entre els models capdavanters del seu índex, però per sota dels dos sistemes propietaris que Moonshot mateix identifica com a referència general.

El detall important arriba a 02:15: no tots els resultats són directament comparables. En algunes files, K3 utilitza Kimi Code; altres models s’han executat amb Claude Code, Codex o entorns de tercers. També canvien l’esforç de raonament, els límits de temps, els fallbacks i el maquinari.

Per interpretar bé una taula cal preguntar:

  • qui ha executat cada prova;
  • amb quin agent o harness;
  • quants intents s’han permès;
  • quin cost i quina latència ha tingut la tasca;
  • si el conjunt de dades és públic o privat;
  • si els resultats han estat reproduïts per una entitat independent.

El mateix anunci de Moonshot reconeix que K3 encara queda per darrere dels millors models propietaris en rendiment global i experiència d’ús. Aquesta cautela és més informativa que comptar només les cel·les on queda primer.

5. Molts paràmetres no equivalen automàticament a més qualitat

Els 2,8 bilions són una dada arquitectònica, no una puntuació d’intel·ligència. En un MoE només una fracció dels experts participa en cada token. A més, la qualitat depèn de les dades, l’entrenament, l’ajust posterior, les eines, el context i l’avaluació.

Fireship també assenyala que K3 pot ser lent i verbós i cita una mètrica d’al·lucinacions elevada en la fotografia del rànquing que consulta (02:33). Aquestes xifres canvien quan evolucionen el model o la metodologia, però recorden una regla útil: una puntuació agregada alta no garanteix respostes fiables en una aplicació concreta.

Per adoptar-lo, una empresa hauria de crear un conjunt propi de casos, mesurar errors factuals, validar el codi generat, registrar el model i la configuració utilitzats i comparar el cost total per resultat correcte.

6. La demanda ja ha exposat el coll d’ampolla

El vídeo explica a 01:23 que l’allau de demanda va obligar Kimi a limitar noves subscripcions. Associated Press va recollir que Moonshot prioritzava els clients existents mentre ampliava capacitat.

Aquest episodi mostra les dues cares de l’estratègia. Una API pròpia permet controlar l’experiència i cobrar pel servei, però requereix moltíssima infraestructura. Uns pesos descarregables permeten que tercers aportin còmput i distribució, encara que no resolguin la complexitat tècnica del model.

El preu oficial anunciat per l’API és de 0,30 dòlars per milió de tokens d’entrada quan hi ha encert de memòria cau, 3 dòlars sense memòria cau i 15 dòlars per milió de tokens de sortida. El cost real dependrà de la longitud de les respostes, l’ús d’eines, les repeticions i la taxa d’encert de la memòria cau.

7. Pesos oberts no és necessàriament codi obert

El vídeo utilitza sovint “open source”, però el terme més prudent és pesos oberts. La definició 1.0 de l’Open Source Initiative exigeix, a més dels paràmetres, accés suficient al codi i a la informació sobre les dades per estudiar, modificar i reproduir el sistema.

Moonshot ha promès publicar els pesos. En la informació disponible abans del 27 de juliol, encara no s’ha documentat prou tot el procés d’entrenament per donar per fet que compleix aquesta definició més exigent. És una diferència important per a recerca, auditoria, llicències i traçabilitat.

8. La batalla és també comercial i geopolítica

A partir de 03:00, Fireship interpreta K3 com una pressió sobre els laboratoris nord-americans i sobre possibles restriccions als models xinesos. Aquesta és la part més opinativa del vídeo.

La competència oberta pot reduir preus, facilitar desplegaments privats i evitar dependència d’un únic proveïdor. Alhora, un model de frontera distribuït sense control central planteja qüestions de seguretat, procedència de les dades i responsabilitat. Cap d’aquests debats queda resolt per un benchmark.

La millor lectura no és que la Xina “hagi guanyat” ni que els models tancats hagin deixat de tenir sentit. Kimi K3 demostra que la distància entre ecosistemes s’ha reduït i que la forma de distribuir un model pot ser tan estratègica com la seva puntuació.

Conclusions principals

Kimi K3 combina una escala extraordinària amb una arquitectura molt dispersa: 896 experts, 16 d’actius per token, context d’un milió i capacitats multimodals. Les primeres proves el situen prop de la frontera i especialment fort en programació i feina agentiva.

Les limitacions són igualment clares. Els pesos encara estaven programats per a l’endemà d’aquest article, executar-lo localment exigeix infraestructura de centre de dades i moltes comparacions provenen del fabricant o utilitzen entorns diferents.

La notícia duradora no és només el nombre “2,8 bilions”. És que un laboratori xinès vol convertir un model gairebé de frontera en infraestructura que altres puguin allotjar, adaptar i incorporar als seus productes. Quan els pesos siguin efectivament disponibles, començarà la comprovació independent de debò.

Contrast i context

Fonts consultades

7 fonts
  1. 01
  2. 02
  3. 03
  4. 04
  5. 05
  6. 06
  7. 07

Font de treball

Transcripció amb marques de temps

10 fragments
Consulta la transcripció
  1. 0:00 , obre el vídeo en una pestanya nova

    Last week, Chinese AI Lab Moonshot dropped Kimi K-3, a massive open-source monster that instantly parameter mocked every other open-model in existence. And not just that, it has open-AI and anthropic terrified, because it's trust me for a benchmark performance is on par with, and in some cases, beating Claude Fable and GPT 5.6 soul. And that's crazy, because just a few weeks ago, the government was telling you these models were too dangerous for the common man to use. It only took the Chinese a few weeks to match their performance, and then and then give away all the weights for free. But Big AI is not too happy about this.

  2. 0:32 , obre el vídeo en una pestanya nova

    And there are already calls to ban Chinese models completely in the United States. In today's video, we'll take a look at the massive breakthrough that is Kime K3 and find out what it means for the future of artificial intelligence. It is July 22nd, 2020, 6, and you're watching the code report. Like CloudFable and GBT5.6 sole, Kime K3 is a native multi-model mixture

  3. 0:51 , obre el vídeo en una pestanya nova

    of experts model with a 1 million token context window and a staggering 2.8 trillion parameters and is optimized for jobs like long horizon reasoning and of course coding. One interesting characteristic of K3 as a mixture of experts model is that it has 896 total experts of which exactly 16 activate per token, which means it works just like a big corporation

  4. 1:12 , obre el vídeo en una pestanya nova

    where 16 good programmers do all the work while 880 other managers sit there and do nothing. But apparently this works out well for Kimmy because it makes scaling about 2.5 times more efficient than K2. Despite these gains in efficiency, Kimmy was so popular upon release that their GPUs ran out of juice and they had to start turning away paying customers. And as of making this video, all the paid plans are currently sold out. That's unfortunate,

  5. 1:35 , obre el vídeo en una pestanya nova

    but in theory you could self-host the model because the weights are open. The weights are expected to be released on July 27, but there's no chance in hell you'll be able to run it on your little gaming GPU. To run a monster like this, you'll need a massive array of data center caliber GPUs. But in theory, if you could do that, you would have unlimited access to a a favel, sole caliber model. And that would be amazing because the benchmark situation with K3 is pretty wild. K3 is ranked number one on front end coderina at a 1,679 ELO, which puts it ahead of favel 5 in GPT 5.6 sole. In addition, it lands in the top three on the artificial analysis and intelligence index.

  6. 2:10 , obre el vídeo en una pestanya nova

    And if we look at every other coding benchmark, it's at least very competitive with the other frontier models. But you should never trust the trust me bro benchmarks, because many of the K3 numbers were produced with Moonshot's own Kimmy code harness, while competitors ran in different harnesses. That could make Kimmy look slightly better at coding, but to their credit, Moonshot admits that K3 still trails fable and GPT 5.6 sole overall, especially on benchmarks like humanities last exam, where it's down by about 10 points. On top of that, artificial analysis measured a 51% hallucination rate, which is definitely not a good thing, especially when it

  7. 2:43 , obre el vídeo en una pestanya nova

    comes to coding. In addition, it also tends to spit out way more tokens than it needs to, which could ultimately end up costing you more money despite the model itself being cheaper. When it comes to things like UI design and data visualization, it's extremely impressive for an open model, but in my opinion, it's still one step behind Fable and GPT Soul. But one of the most interesting things about this release is the geopolitics surrounding it. But recently at the World AI Conference, China's Communist Party, became the loudest advocate for free and open artificial intelligence. Meanwhile, in the land of the free, Silicon Valley wants to regulate and gatekeep it, by pushing the fear narrative that it's about to take all of our jobs. In Washington,

  8. 3:20 , obre el vídeo en una pestanya nova

    they're reportedly considering antitulist Chinese AI labs and OpenAI's Dean Ball argued that open weights aren't here at least decelerationist. What? What are you talking about, man? A coincidence that's very similar to the argument Steve Ball were used to make in the 90s about Linux when he said Linux is communism and also coincidentally, both of these guys have balls in in their names. Frontier labs don't like open models, simply because they divert the flow of money from them to someone else. As of today, the odds the US government bands Chinese models is only sitting at 29% on polymarket, but that could change quickly if they determine one of these models is responsible for some kind of cyber attack. But the best thing about K3 is that it pushes the arms race forward.

  9. 4:01 , obre el vídeo en una pestanya nova

    Ali Baba also just released Q1 3.8, which itself has 2.4 trillion parameters and open weights. And I think this model might finally be the one that gets the UI right for horse But before you let AI slot out your UI, you need to check out Mobbin.com, the sponsor of today's video. I've been using Mobbin for over five years now because it provides highly detailed breakdowns of every screen and thousands of popular web and mobile apps. And they just launched an MCP server, which connects your AI agent to over 600,000 screens and user flows from apps in every category. This gives your agent real world references so it can design high quality UI for your

  10. 4:37 , obre el vídeo en una pestanya nova

    specific use case. Instead of just spitting out generic, purple gradient vibes law, it also lets you do DPUI research, like you can feed it your prototype and your agent will use Mobins library to provide a ranked list of other apps that do it better. You can also ask it how your competitors handle things like onboarding and paywalls, and it'll show you every screen in their full user flow. So if you're tired of your UI's looking like the same as everyone else, I'd highly recommend trying out Mobin at the link below. This has been the code report, thanks for watching, and I will see you in the next one.