Intel·ligència artificial OpenAI Kimi K3 Models oberts Andrej Karpathy Artificial Analysis GPT-5.6 Sol GPT-5.6 Inferència GPT-5.6 Luna Automillora recursiva Matthew Berman

GPT-5.6 es torna més barat? Què hi ha darrere la retallada del 80%

OpenAI abaixa un 80% el preu de GPT-5.6 Luna i afirma que Sol va ajudar a reduir el cost d'inferència. Expliquem què va millorar i per què no és encara automillora recursiva plena.

OpenAI ha reduït un 80% el preu de GPT‑5.6 Luna només unes setmanes després de presentar la família GPT‑5.6. El model passa a costar 0,20 dòlars per milió de tokens d'entrada i 1,20 dòlars per milió de tokens de sortida. GPT‑5.6 Terra baixa un 20%, fins a 2 i 12 dòlars respectivament, mentre que el preu estàndard de GPT‑5.6 Sol no canvia.

Matthew Berman destaca una dada encara més suggeridora: OpenAI afirma que el seu model més potent, Sol, va ajudar els enginyers a trobar millores que redueixen el cost de servir la família. El vídeo ho descriu com a «automillora recursiva». És un avanç real cap a la recerca automatitzada, però encara no és un model que es reentrena, modifica els seus propis pesos i produeix autònomament un successor més intel·ligent.

Resposta curta: GPT‑5.6 s'ha fet més barat ell mateix?

En un sentit limitat, GPT‑5.6 Sol va ajudar a millorar el sistema que l'executa. Va analitzar dades operatives, va proposar i provar estratègies d'encaminament, va optimitzar kernels de GPU i va participar en centenars d'experiments sobre el model auxiliar utilitzat en la decodificació especulativa. OpenAI atribueix a aquest treball una reducció del 20% del cost integral de servei i més d'un 15% de millora en l'eficiència de generació de tokens.

Però la millora no equival a una IA que hagi canviat tota sola el seu model principal. Els humans van definir l'objectiu, l'entorn d'experimentació i els criteris; van validar els canvis i van decidir desplegar-los. La manera més precisa de descriure-ho és «enginyeria d'inferència assistida per IA» o «recerca automatitzada sota supervisió».

Els canvis de preu

Model Preu anterior per 1 M de tokens Preu nou per 1 M de tokens Canvi anunciat
GPT‑5.6 Luna, entrada 1,00 $ 0,20 $ −80%
GPT‑5.6 Luna, sortida 6,00 $ 1,20 $ −80%
GPT‑5.6 Terra, entrada 2,50 $ 2,00 $ −20%
GPT‑5.6 Terra, sortida 15,00 $ 12,00 $ −20%
GPT‑5.6 Sol estàndard Sense canvi Sense canvi 0%

OpenAI també ha introduït un mode ràpid per a Sol: fins a 2,5 vegades més velocitat al doble del preu estàndard. L'opció anterior oferia aproximadament 1,5 vegades la velocitat pel mateix multiplicador de cost.

Això millora el rendiment temporal per dòlar respecte de l'antic mode prioritari, però no és literalment una reducció del preu per token. El client continua pagant el doble; rep més velocitat i pot completar abans una càrrega sensible a la latència.

1. Luna, Terra i Sol: tres nivells amb funcions diferents

La família GPT‑5.6 està dividida en tres nivells:

  • Sol és el model insígnia per a treball professional complex, recerca, codi i tasques amb molta autonomia;

  • Terra busca un equilibri entre capacitat i cost per al treball quotidià;

  • Luna està orientat a gran volum, velocitat i càrregues sensibles al preu.

L'estratègia permet triar quanta intel·ligència es compra per a cada pas. Un agent pot utilitzar Luna per classificar, extraure o revisar milers d'elements i escalar a Sol només quan troba un cas difícil. La retallada reforça aquest patró: no pretén que Luna substitueixi Sol en tot, sinó que moltes accions deixin de necessitar el model més car.

2. Preu per token i cost per tasca no són el mateix

Berman insisteix encertadament que comparar només el preu per milió de tokens pot portar a una conclusió equivocada. Un model econòmic que produeix respostes molt llargues, fa més intents o resol menys casos pot acabar costant més.

OpenAI defineix el cost per tasca satisfactòria amb una fórmula simple:

  1. sumar el cost complet d'executar el treball;

  2. comptar quantes tasques han superat el nivell de qualitat requerit;

  3. dividir el cost total pel nombre d'èxits.

El marc publicat per OpenAI recorda que també s'han d'incloure el temps humà de revisió, els reintents i la feina per corregir errors. Un model frontera pot ser més barat en una tasca rutinària si l'encerta a la primera; un model petit pot guanyar quan el procés és estable, fàcil de verificar i repetit milions de vegades.

Exemple simplificat

Model hipotètic Cost per intent Taxa d'èxit Cost directe per tasca correcta
Model A 0,06 $ 60% 0,10 $
Model B 0,12 $ 95% 0,126 $

El model A continua sent lleugerament més barat abans d'afegir revisió i reintents. Si cada error requereix cinc minuts d'una persona, el model B podria resultar molt més econòmic. El cost per token només és una peça de la decisió.

3. Què diuen les proves d'Artificial Analysis?

El vídeo utilitza l'índex d'Artificial Analysis, que combina avaluacions de raonament, codi, ciència i treball amb agents. En el llançament inicial, Luna amb esforç màxim obtenia una puntuació propera a models més cars i costava aproximadament un 80% menys per tasca que Sol.

Amb el nou preu, Berman situa Luna al voltant de sis cèntims per tasca de l'índex, davant de quantitats superiors per a GLM‑5.2, Claude Sonnet, Claude Opus o GPT‑5.6 Sol. La imatge general és clara: Luna ocupa una zona molt competitiva de capacitat per dòlar.

Les xifres exactes s'han d'interpretar amb cautela per tres motius:

  • el cost depèn del nombre de tokens que el model va generar en aquesta bateria concreta;

  • el nivell d'esforç canvia tant la puntuació com la despesa;

  • una mitjana de proves no prediu necessàriament el rendiment en el codi, els documents o les eines d'una empresa determinada.

Artificial Analysis és una comparació externa útil, però no elimina la necessitat de provar els models amb casos reals, una resposta esperada i un criteri de qualitat propi.

4. On va trobar eficiència GPT‑5.6 Sol?

L'article tècnic d'OpenAI sobre la millora de preu i rendiment descriu tres àrees principals.

Kernels de producció

Un kernel és una peça de programari molt optimitzada que executa operacions numèriques sobre la GPU. Petites millores en moviment de memòria, paral·lelisme o fusió d'operacions poden estalviar molt de còmput quan es repeteixen per milions de peticions.

OpenAI diu que Sol, utilitzat amb Codex, va ajudar a identificar feina que es podia precalcular, evitar o executar en paral·lel, i va reescriure i optimitzar kernels de producció. L'empresa atribueix al conjunt de millores una reducció del 20% del cost integral de servei.

Equilibri i encaminament

Un sistema distribuït ha de repartir les peticions entre moltes GPU i servidors. Si algunes màquines queden saturades mentre d'altres estan infrautilitzades, augmenten la latència i el cost.

Sol va ajudar a analitzar trànsit de producció, trobar desequilibris abans ignorats, provar estratègies noves i ajustar heurístiques. Això no significa necessàriament que el model llegeixi de manera indiscriminada el text personal de cada usuari; «trànsit» també pot referir-se a traces, mètriques, formes de càrrega i dades operatives.

Decodificació especulativa

La decodificació especulativa utilitza un model auxiliar més petit per proposar diversos tokens ràpidament. El model principal els comprova i n'accepta els correctes. Si les prediccions del model auxiliar són bones, el sistema genera text amb menys treball del model gran.

Sol va dissenyar i executar centenars d'experiments sobre la mida, l'estructura i les característiques d'aquest model auxiliar. OpenAI afirma que el resultat va millorar més d'un 15% l'eficiència de generació de tokens.

5. És automillora recursiva?

Depèn de la definició. En un sentit ampli, un model contribueix a fer més eficient la infraestructura que executa models de la mateixa família. El coneixement obtingut pot abaratir més experiments futurs, que al seu torn poden generar noves millores. Hi ha un bucle real.

En el sentit fort que s'utilitza en els debats sobre una explosió d'intel·ligència, encara no. Per parlar d'automillora recursiva plena esperaríem un sistema que pogués:

  • proposar canvis substancials en el model principal;

  • entrenar o modificar autònomament els seus pesos;

  • validar de manera fiable que el successor és millor i segur;

  • desplegar-lo o utilitzar-lo per repetir el procés;

  • mantenir el progrés a través de moltes generacions amb poca intervenció humana.

El cas d'OpenAI mostra automatització de recerca i enginyeria dins d'un perímetre definit. És important perquè redueix una de les barreres del cicle, però no demostra que totes les altres hagin desaparegut.

6. La connexió amb autoresearch d'Andrej Karpathy

Berman compara el procés amb autoresearch, el projecte obert d'Andrej Karpathy. El repositori dona a un agent un petit sistema real d'entrenament de models. L'agent modifica un únic fitxer, entrena durant cinc minuts, comprova una mètrica, conserva o descarta el canvi i repeteix l'experiment.

El disseny és deliberadament acotat:

  • una sola GPU;

  • un sol fitxer modificable;

  • un pressupost temporal fix per prova;

  • una mètrica comparable;

  • un historial de canvis que es pot revisar.

Aquestes limitacions són part de l'èxit. Convertir una pregunta oberta en un bucle amb experiments barats i una mètrica clara facilita que l'agent trobi millores. Escalar el mètode a un model frontera és molt més difícil: una sola prova pot costar milions, les mètriques poden entrar en conflicte i una millora en una prova pot degradar seguretat o capacitats en una altra.

Karpathy es va incorporar a Anthropic el maig del 2026 per treballar en preentrenament. Això reforça la tendència cap a laboratoris on els models participen cada vegada més en la recerca que crea la següent generació.

7. «Analitza els teus prompts constantment»? El matís de privacitat

El vídeo imagina Sol observant constantment milions de prompts d'usuaris per buscar ineficiències. La comunicació pública disponible no permet afirmar-ho d'aquesta manera.

OpenAI diu que, per defecte, no utilitza les entrades ni les sortides de ChatGPT Business, Enterprise, Edu o de l'API per entrenar o millorar els models. Els clients de l'API poden acceptar voluntàriament compartir dades. Els serveis per a particulars poden utilitzar converses per millorar els models si l'usuari no ho desactiva.

La documentació de controls de dades de l'API també diferencia contingut, registres de prevenció d'abusos, estat de l'aplicació i metadades operatives. Alguns registres poden conservar contingut durant un període limitat, mentre que les organitzacions elegibles poden configurar retenció zero.

Per tant, optimitzar-se amb «trànsit de producció» no s'ha de traduir automàticament per «llegir tots els teus prompts». La privacitat depèn del producte, la configuració, el consentiment i el tipus de dada utilitzada en l'anàlisi.

8. Per què Sol no ha baixat de preu?

Berman especula que OpenAI ha mantingut el preu de Sol perquè és el producte amb més marge i una font important d'ingressos. És una hipòtesi empresarial plausible, però no hi ha dades públiques que mostrin quina part dels ingressos de l'API aporta cada model.

També hi ha altres explicacions possibles:

  • la demanda de Sol pot superar l'oferta disponible;

  • les millores poden haver-se concentrat en Luna i Terra;

  • el model insígnia pot necessitar una infraestructura més cara encara després de l'optimització;

  • OpenAI pot voler segmentar el mercat i mantenir un preu superior per a les tasques de màxim valor;

  • els estalvis poden destinar-se a ampliar capacitat o finançar la següent generació.

Sense informació de costos i ús per model, atribuir-ho només al marge és especulatiu.

9. La pressió de Kimi K3 i els models oberts

El vídeo relaciona la retallada amb Kimi K3, el model de pesos oberts de Moonshot AI. Kimi s'acosta als models propietaris en diverses proves i permet que múltiples proveïdors n'optimitzin la inferència.

L'obertura pot accelerar millores perquè investigadors i empreses d'arreu experimenten amb quantització, kernels, memòria cau, encaminament i maquinari. Però tampoc garanteix que el cost per tasca sigui menor. Kimi pot necessitar més tokens, i allotjar un model enorme exigeix moltes GPU.

El repositori oficial de Kimi K3 publica els pesos i la informació tècnica. Aquesta disponibilitat pressiona els laboratoris tancats perquè baixin preus o ofereixin una qualitat clarament superior. Que la retallada d'OpenAI sigui una resposta directa a Kimi és una inferència de Berman, no una motivació confirmada per OpenAI.

10. Què canvia per a un usuari o una empresa?

La nova tarifa pot alterar l'arquitectura d'un producte amb molts agents, però convé mesurar abans de migrar.

Un procés raonable és:

  1. seleccionar un conjunt representatiu de tasques reals;

  2. definir què significa una resposta correcta;

  3. mesurar tokens, temps, reintents i revisió humana;

  4. provar diversos nivells d'esforç de Luna, Terra i Sol;

  5. calcular el cost per tasca que supera el llindar de qualitat;

  6. reservar el model més potent per als casos que el necessiten;

  7. repetir la prova quan canvien preus o versions.

La retallada anunciada afecta l'API i el consum de crèdits associat a alguns productes. No implica automàticament una reducció del preu de totes les subscripcions de ChatGPT ni que cada usuari disposi de cinc vegades més quota.

Conclusions

La notícia té dues capes. La primera és comercial i immediata: Luna costa un 80% menys, Terra un 20% menys i Sol ofereix un mode més ràpid. Això pot canviar de debò el pressupost d'aplicacions que executen milions de tasques.

La segona és tecnològica: un model frontera ja pot contribuir materialment a optimitzar kernels, encaminament i models auxiliars que redueixen el cost de la seva pròpia infraestructura. És un exemple important de recerca automatitzada, però anomenar-lo automillora recursiva plena elimina les parts que encara depenen d'enginyers, experiments controlats, verificació i desplegament humà.

El senyal més rellevant no és que la IA s'hagi tornat autònomament millor d'un dia per l'altre. És que la quantitat de treball d'enginyeria que pot automatitzar ha augmentat prou perquè els estalvis arribin ràpidament al preu. Si aquest cicle es repeteix, el cost per tasca —no només la puntuació del model— serà un dels principals camps de competència de la IA.

Preguntes freqüents

Quin és el nou preu de GPT‑5.6 Luna?

0,20 dòlars per milió de tokens d'entrada i 1,20 dòlars per milió de tokens de sortida, una reducció del 80% respecte del preu inicial.

GPT‑5.6 Terra també baixa?

Sí. Passa a 2 dòlars per milió de tokens d'entrada i 12 dòlars per milió de tokens de sortida, un 20% menys.

GPT‑5.6 Sol és més barat?

El preu estàndard no ha baixat. El nou mode ràpid ofereix fins a 2,5 vegades la velocitat pel doble del preu, una millora de rendiment respecte de l'anterior opció prioritària.

Sol va modificar els seus propis pesos?

No hi ha cap indicació pública que ho fes. Va ajudar a optimitzar programari de producció, estratègies d'encaminament i el model auxiliar de decodificació sota supervisió humana.

És el començament de l'automillora recursiva?

És una peça inicial del procés: automatitzar experiments i enginyeria que fan més eficient la IA. No és encara un bucle autònom que creï successivament models principals més intel·ligents.

Luna és sempre la millor opció?

No. És especialment atractiu per volum i tasques verificables. Sol o Terra poden resultar més econòmics quan eviten errors, reintents o revisió humana en problemes difícils.

Contrast i context

Fonts consultades

9 fonts
  1. 01
  2. 02
  3. 03
  4. 04
  5. 05
  6. 06
  7. 07
  8. 08
  9. 09

Font de treball

Transcripció amb marques de temps

338 fragments
Consulta la transcripció
  1. 0:00 , obre el vídeo en una pestanya nova

    Open AAI just dropped their prices by

  2. 0:02 , obre el vídeo en una pestanya nova

    80%. And that's awesome, but it's also

  3. 0:06 , obre el vídeo en una pestanya nova

    not even the most impressive thing. They

  4. 0:09 , obre el vídeo en una pestanya nova

    used their best model, GPT 5.6 Soul, to

  5. 0:13 , obre el vídeo en una pestanya nova

    improve itself, to find efficiency

  6. 0:16 , obre el vídeo en una pestanya nova

    gains. That's how they were able to drop

  7. 0:18 , obre el vídeo en una pestanya nova

    the price so much. I have so many

  8. 0:20 , obre el vídeo en una pestanya nova

    thoughts about this because this is

  9. 0:22 , obre el vídeo en una pestanya nova

    essentially recursive self-improvement

  10. 0:25 , obre el vídeo en una pestanya nova

    and there are so many implications.

  11. 0:27 , obre el vídeo en una pestanya nova

    Let's go through them. First, let me

  12. 0:30 , obre el vídeo en una pestanya nova

    show you the news. So, here's Sam Alman.

  13. 0:32 , obre el vídeo en una pestanya nova

    Major price cuts today. An 80% drop for

  14. 0:36 , obre el vídeo en una pestanya nova

    GPT 5.6 Luna. Luna is the smallest of

  15. 0:40 , obre el vídeo en una pestanya nova

    the three models in the GPT 5.6 family.

  16. 0:43 , obre el vídeo en una pestanya nova

    And it's actually really good. And when

  17. 0:46 , obre el vídeo en una pestanya nova

    I show you the charts comparing it to

  18. 0:48 , obre el vídeo en una pestanya nova

    other models, including Fable, you're

  19. 0:50 , obre el vídeo en una pestanya nova

    going to be even more excited about this

  20. 0:52 , obre el vídeo en una pestanya nova

    price drop. So now it's 20 cents per

  21. 0:56 , obre el vídeo en una pestanya nova

    million input tokens and $1.20 per

  22. 0:59 , obre el vídeo en una pestanya nova

    million output tokens, which is

  23. 1:01 , obre el vídeo en una pestanya nova

    incredibly inexpensive. That is cheaper

  24. 1:04 , obre el vídeo en una pestanya nova

    than the frontier open-source models

  25. 1:07 , obre el vídeo en una pestanya nova

    coming out of China. And I know I've

  26. 1:09 , obre el vídeo en una pestanya nova

    been talking a lot about this before. It

  27. 1:11 , obre el vídeo en una pestanya nova

    is not strictly about the price per

  28. 1:13 , obre el vídeo en una pestanya nova

    token. What is more important and really

  29. 1:16 , obre el vídeo en una pestanya nova

    only important is the cost per task

  30. 1:19 , obre el vídeo en una pestanya nova

    completed. And the reason is is because

  31. 1:23 , obre el vídeo en una pestanya nova

    for example, Kimmy K3 is half the price

  32. 1:26 , obre el vídeo en una pestanya nova

    of 5.6 soul, but it takes twice as many

  33. 1:30 , obre el vídeo en una pestanya nova

    tokens to accomplish that same task.

  34. 1:33 , obre el vídeo en una pestanya nova

    Thus, they're effectively the same

  35. 1:35 , obre el vídeo en una pestanya nova

    price. Now, for GPT 5.6 Terra, which is

  36. 1:39 , obre el vídeo en una pestanya nova

    their middle model between Luna and

  37. 1:41 , obre el vídeo en una pestanya nova

    Soul, there is a 20% price drop. Now, it

  38. 1:45 , obre el vídeo en una pestanya nova

    is $2 per million input, $12 per million

  39. 1:48 , obre el vídeo en una pestanya nova

    output. Now, GPT 5.6 6 sold. The big

  40. 1:51 , obre el vídeo en una pestanya nova

    model, the model that was able to

  41. 1:54 , obre el vídeo en una pestanya nova

    achieve some of these performance gains

  42. 1:56 , obre el vídeo en una pestanya nova

    did not get a price drop. Well, not

  43. 1:59 , obre el vídeo en una pestanya nova

    exactly. So, what we did get is a fast

  44. 2:02 , obre el vídeo en una pestanya nova

    mode in the API. You get 2 and 1/2 times

  45. 2:05 , obre el vídeo en una pestanya nova

    the speed for 2x the price. Same

  46. 2:08 , obre el vídeo en una pestanya nova

    intelligence. Well, that sounds nice,

  47. 2:10 , obre el vídeo en una pestanya nova

    but it doesn't sound like a price

  48. 2:12 , obre el vídeo en una pestanya nova

    decrease. Well, it kind of is.

  49. 2:14 , obre el vídeo en una pestanya nova

    Previously, the fast mode options were 1

  50. 2:18 , obre el vídeo en una pestanya nova

    and 1/2 times faster for two times the

  51. 2:21 , obre el vídeo en una pestanya nova

    cost. Now, we get two and a half times

  52. 2:24 , obre el vídeo en una pestanya nova

    faster for two times the cost. Same cost

  53. 2:27 , obre el vídeo en una pestanya nova

    increase for fast mode, but much faster.

  54. 2:31 , obre el vídeo en una pestanya nova

    That is effectively a price decrease.

  55. 2:33 , obre el vídeo en una pestanya nova

    And so, let's look at this. This is the

  56. 2:35 , obre el vídeo en una pestanya nova

    artificial analysis intelligence index.

  57. 2:37 , obre el vídeo en una pestanya nova

    And what we're seeing on the y-axis over

  58. 2:39 , obre el vídeo en una pestanya nova

    here is the overall intelligence index

  59. 2:41 , obre el vídeo en una pestanya nova

    score. And importantly, and I'm so glad

  60. 2:45 , obre el vídeo en una pestanya nova

    that Sam Alman shared this metric, cost

  61. 2:48 , obre el vídeo en una pestanya nova

    per task on the X-axis. Now, look at

  62. 2:52 , obre el vídeo en una pestanya nova

    this. What you want to see on this chart

  63. 2:55 , obre el vídeo en una pestanya nova

    is as high up as possible and to the

  64. 2:58 , obre el vídeo en una pestanya nova

    left as possible. And what do we see

  65. 3:01 , obre el vídeo en una pestanya nova

    here? GPT 5.6 Luna sitting right there.

  66. 3:05 , obre el vídeo en una pestanya nova

    Now, each of these dots represents

  67. 3:07 , obre el vídeo en una pestanya nova

    different thinking efforts. This top one

  68. 3:09 , obre el vídeo en una pestanya nova

    is the max. So, GPT 5.6 6 Luna Max. Now,

  69. 3:13 , obre el vídeo en una pestanya nova

    what we see is it is slightly ahead in

  70. 3:16 , obre el vídeo en una pestanya nova

    terms of overall intelligence to GLM 5.2

  71. 3:19 , obre el vídeo en una pestanya nova

    Max, which is an open-source model out

  72. 3:22 , obre el vídeo en una pestanya nova

    of China. And because it's all the way

  73. 3:25 , obre el vídeo en una pestanya nova

    over here, it is a fraction of the

  74. 3:27 , obre el vídeo en una pestanya nova

    price. So, GLM 5.2 Max looks like it's

  75. 3:30 , obre el vídeo en una pestanya nova

    coming in around 25 or 28 cents per

  76. 3:33 , obre el vídeo en una pestanya nova

    completed task, whereas GPT 5.6 Luna is

  77. 3:37 , obre el vídeo en una pestanya nova

    coming in at about 6 cents. Again, a

  78. 3:40 , obre el vídeo en una pestanya nova

    fraction of the price and it's slightly

  79. 3:43 , obre el vídeo en una pestanya nova

    ahead. Here's Claude Opus 5 low coming

  80. 3:46 , obre el vídeo en una pestanya nova

    in slightly lower than GLM 5.2, slightly

  81. 3:49 , obre el vídeo en una pestanya nova

    lower than 5.6 Luna, but it is really

  82. 3:53 , obre el vídeo en una pestanya nova

    expensive at about 40 cents per task

  83. 3:56 , obre el vídeo en una pestanya nova

    completion. So, Luna is just going to be

  84. 3:59 , obre el vídeo en una pestanya nova

    an absolute workhorse of a model. And

  85. 4:01 , obre el vídeo en una pestanya nova

    all of that is great, but that's not the

  86. 4:04 , obre el vídeo en una pestanya nova

    crazy part. The crazy part is they used

  87. 4:07 , obre el vídeo en una pestanya nova

    their Frontier model, GPT 5.6 6 soul to

  88. 4:10 , obre el vídeo en una pestanya nova

    find all of these performance gains that

  89. 4:13 , obre el vídeo en una pestanya nova

    allowed them to drop the price of their

  90. 4:14 , obre el vídeo en una pestanya nova

    other models. So just yesterday after

  91. 4:17 , obre el vídeo en una pestanya nova

    deployment we apply GPT 5.6 Soul to

  92. 4:20 , obre el vídeo en una pestanya nova

    advance the frontier of efficiency by

  93. 4:22 , obre el vídeo en una pestanya nova

    making itself more efficient to run. The

  94. 4:25 , obre el vídeo en una pestanya nova

    results 20% lower serving cost from

  95. 4:28 , obre el vídeo en una pestanya nova

    production GPU kernel improvements 15%

  96. 4:30 , obre el vídeo en una pestanya nova

    better token generation efficiency from

  97. 4:33 , obre el vídeo en una pestanya nova

    improved speculative decoding. And if

  98. 4:36 , obre el vídeo en una pestanya nova

    you don't know what that means, it

  99. 4:37 , obre el vídeo en una pestanya nova

    doesn't really matter. It just means

  100. 4:39 , obre el vídeo en una pestanya nova

    that they were able to improve the

  101. 4:40 , obre el vídeo en una pestanya nova

    overall efficiency of the model. And

  102. 4:42 , obre el vídeo en una pestanya nova

    they actually wrote up an entire blog

  103. 4:44 , obre el vídeo en una pestanya nova

    post about the technical details, the

  104. 4:46 , obre el vídeo en una pestanya nova

    specific performance improvements that

  105. 4:48 , obre el vídeo en una pestanya nova

    were discovered by GPT 5.6 Soul. I'm not

  106. 4:51 , obre el vídeo en una pestanya nova

    going to go too deep into it, but I want

  107. 4:53 , obre el vídeo en una pestanya nova

    to read a few of these quotes because it

  108. 4:55 , obre el vídeo en una pestanya nova

    is stunning. Throughout the entire

  109. 4:57 , obre el vídeo en una pestanya nova

    article, they're saying, "Yeah, 5.6

  110. 5:00 , obre el vídeo en una pestanya nova

    discovered it." Check this out. So 5.6

  111. 5:02 , obre el vídeo en una pestanya nova

    six soul in Codeex helps us analyze

  112. 5:04 , obre el vídeo en una pestanya nova

    production traffic, identify previously

  113. 5:07 , obre el vídeo en una pestanya nova

    overlooked sources of imbalance, test

  114. 5:09 , obre el vídeo en una pestanya nova

    new routing strategies, and constantly

  115. 5:10 , obre el vídeo en una pestanya nova

    tune these heruristics. And so just

  116. 5:13 , obre el vídeo en una pestanya nova

    imagine this, every time you submit a

  117. 5:15 , obre el vídeo en una pestanya nova

    prompt to chat GPT, and then imagine

  118. 5:19 , obre el vídeo en una pestanya nova

    that multiplied by the millions of

  119. 5:21 , obre el vídeo en una pestanya nova

    people that do that per day, GPT 5.6 Six

  120. 5:24 , obre el vídeo en una pestanya nova

    soul with codeex is just constantly

  121. 5:26 , obre el vídeo en una pestanya nova

    looking at the production data,

  122. 5:28 , obre el vídeo en una pestanya nova

    constantly looking at your prompts,

  123. 5:30 , obre el vídeo en una pestanya nova

    constantly looking at where the

  124. 5:32 , obre el vídeo en una pestanya nova

    inefficiencies are and coming up with

  125. 5:35 , obre el vídeo en una pestanya nova

    potential improvements, testing those

  126. 5:38 , obre el vídeo en una pestanya nova

    improvements and iterating over and over

  127. 5:40 , obre el vídeo en una pestanya nova

    again. And if that sounds familiar, that

  128. 5:43 , obre el vídeo en una pestanya nova

    is also known as a loop. The goal of the

  129. 5:47 , obre el vídeo en una pestanya nova

    loop being to improve the efficiency of

  130. 5:49 , obre el vídeo en una pestanya nova

    the model. And so this really shows the

  131. 5:51 , obre el vídeo en una pestanya nova

    power of loops, which I've been talking

  132. 5:52 , obre el vídeo en una pestanya nova

    a lot about lately. In fact, I made a

  133. 5:55 , obre el vídeo en una pestanya nova

    loopy skill that you can install that

  134. 5:58 , obre el vídeo en una pestanya nova

    helps you create and discover loops for

  135. 6:00 , obre el vídeo en una pestanya nova

    your prompts. I published the skill and

  136. 6:03 , obre el vídeo en una pestanya nova

    you can try it out. And the sponsor of

  137. 6:05 , obre el vídeo en una pestanya nova

    today's video, Hyper Agent. I'm going to

  138. 6:07 , obre el vídeo en una pestanya nova

    drop a link down below to my published

  139. 6:09 , obre el vídeo en una pestanya nova

    skill so you can get it directly in

  140. 6:11 , obre el vídeo en una pestanya nova

    Hyper Agent. Hyper Agent is awesome

  141. 6:13 , obre el vídeo en una pestanya nova

    because it is like a team of always on

  142. 6:16 , obre el vídeo en una pestanya nova

    agents working for you and you can use

  143. 6:18 , obre el vídeo en una pestanya nova

    models from any provider including the

  144. 6:19 , obre el vídeo en una pestanya nova

    model we're talking about today which is

  145. 6:21 , obre el vídeo en una pestanya nova

    GPT 5.6 Luna. You can use Kimmy K3. You

  146. 6:25 , obre el vídeo en una pestanya nova

    can also use GLM 5.2 fast. All the

  147. 6:28 , obre el vídeo en una pestanya nova

    models are available very easy for you

  148. 6:30 , obre el vídeo en una pestanya nova

    to try out. Each agent gets its own

  149. 6:33 , obre el vídeo en una pestanya nova

    cloud environment with its own login

  150. 6:35 , obre el vídeo en una pestanya nova

    completely connected to the tools that

  151. 6:37 , obre el vídeo en una pestanya nova

    you already use. This is much more than

  152. 6:39 , obre el vídeo en una pestanya nova

    a chatbot. And of course, an agent can

  153. 6:42 , obre el vídeo en una pestanya nova

    delegate to sub agents. Very organized

  154. 6:45 , obre el vídeo en una pestanya nova

    and very costefficient. And with the

  155. 6:48 , obre el vídeo en una pestanya nova

    marketplace, it's basically like an app

  156. 6:50 , obre el vídeo en una pestanya nova

    store, but for agents, and of course,

  157. 6:53 , obre el vídeo en una pestanya nova

    you can find my loopy skill in the

  158. 6:55 , obre el vídeo en una pestanya nova

    marketplace for free. So, go find my

  159. 6:57 , obre el vídeo en una pestanya nova

    skill on the marketplace. Link down

  160. 6:59 , obre el vídeo en una pestanya nova

    below. You get $500 in credits to try it

  161. 7:02 , obre el vídeo en una pestanya nova

    out. So, thanks again, Hyper Agent. Now,

  162. 7:04 , obre el vídeo en una pestanya nova

    back to the video. We also use Soul to

  163. 7:06 , obre el vídeo en una pestanya nova

    optimize the model's forward pass, the

  164. 7:08 , obre el vídeo en una pestanya nova

    computation that transforms inputs into

  165. 7:10 , obre el vídeo en una pestanya nova

    next token predictions. They also found

  166. 7:13 , obre el vídeo en una pestanya nova

    work that can be precomputed, avoided or

  167. 7:15 , obre el vídeo en una pestanya nova

    parallelized. And it even rewrote and

  168. 7:18 , obre el vídeo en una pestanya nova

    optimized our production kernels. So

  169. 7:21 , obre el vídeo en una pestanya nova

    just imagine having all the power of

  170. 7:24 , obre el vídeo en una pestanya nova

    this frontier model running 24 hours a

  171. 7:26 , obre el vídeo en una pestanya nova

    day, highly parallelized, looking for

  172. 7:29 , obre el vídeo en una pestanya nova

    optimizations at all times. This is the

  173. 7:32 , obre el vídeo en una pestanya nova

    power of loops. But this is also the

  174. 7:34 , obre el vídeo en una pestanya nova

    power of recursive self-improvement. And

  175. 7:36 , obre el vídeo en una pestanya nova

    this also makes me a little bit nervous.

  176. 7:39 , obre el vídeo en una pestanya nova

    This is the point at which I look and I

  177. 7:41 , obre el vídeo en una pestanya nova

    say, well, if the top two leading AI

  178. 7:45 , obre el vídeo en una pestanya nova

    labs, OpenAI and Anthropic, already have

  179. 7:47 , obre el vídeo en una pestanya nova

    such a big lead and they have momentum

  180. 7:51 , obre el vídeo en una pestanya nova

    and we are at the beginning of recursive

  181. 7:53 , obre el vídeo en una pestanya nova

    self-improvement. How does anybody else

  182. 7:55 , obre el vídeo en una pestanya nova

    catch up? And that's a question I'm

  183. 7:56 , obre el vídeo en una pestanya nova

    trying to navigate every day. Now listen

  184. 7:59 , obre el vídeo en una pestanya nova

    to this. It improved its own draft model

  185. 8:01 , obre el vídeo en una pestanya nova

    by designing and running hundreds of

  186. 8:03 , obre el vídeo en una pestanya nova

    experiments on its architecture, testing

  187. 8:05 , obre el vídeo en una pestanya nova

    changes in size, structure, and

  188. 8:07 , obre el vídeo en una pestanya nova

    features. Now, does that sound familiar?

  189. 8:09 , obre el vídeo en una pestanya nova

    That sure sounds like Karpathy's auto

  190. 8:12 , obre el vídeo en una pestanya nova

    research project. A few months ago,

  191. 8:14 , obre el vídeo en una pestanya nova

    Andre Karpathy, one of the most

  192. 8:16 , obre el vídeo en una pestanya nova

    well-known AI researchers in all of the

  193. 8:19 , obre el vídeo en una pestanya nova

    industry and also now an anthropic

  194. 8:22 , obre el vídeo en una pestanya nova

    employee, published this open- source

  195. 8:24 , obre el vídeo en una pestanya nova

    repo in which he basically described

  196. 8:27 , obre el vídeo en una pestanya nova

    what is a loop and the objective is

  197. 8:30 , obre el vídeo en una pestanya nova

    improve the efficiency of training a

  198. 8:32 , obre el vídeo en una pestanya nova

    brand new LLM from scratch. And the

  199. 8:35 , obre el vídeo en una pestanya nova

    crazy thing is the model came up with

  200. 8:37 , obre el vídeo en una pestanya nova

    its own experiments, ran the

  201. 8:39 , obre el vídeo en una pestanya nova

    experiments, reviewed and analyzed the

  202. 8:42 , obre el vídeo en una pestanya nova

    output of the experiment and then

  203. 8:44 , obre el vídeo en una pestanya nova

    iterated over and over again and it was

  204. 8:47 , obre el vídeo en una pestanya nova

    actually able to find real improvements

  205. 8:49 , obre el vídeo en una pestanya nova

    that Karpathy himself could not find.

  206. 8:52 , obre el vídeo en una pestanya nova

    Now he was applying this to a small

  207. 8:55 , obre el vídeo en una pestanya nova

    language model. Imagine you have the

  208. 8:57 , obre el vídeo en una pestanya nova

    compute of open AI and imagine you have

  209. 9:00 , obre el vídeo en una pestanya nova

    one of the best models on the planet and

  210. 9:02 , obre el vídeo en una pestanya nova

    this loop, this auto research loop gets

  211. 9:05 , obre el vídeo en una pestanya nova

    run 24 hours a day. This is truly an

  212. 9:09 , obre el vídeo en una pestanya nova

    automated AI researcher. Now back to

  213. 9:12 , obre el vídeo en una pestanya nova

    this chart, you need to be using Luna.

  214. 9:15 , obre el vídeo en una pestanya nova

    Luna was already a fantastic model and

  215. 9:17 , obre el vídeo en una pestanya nova

    now you can run it on max mode and it is

  216. 9:20 , obre el vídeo en una pestanya nova

    so inexpensive. This is a major major

  217. 9:24 , obre el vídeo en una pestanya nova

    upgrade to all of our lives. Now, the

  218. 9:26 , obre el vídeo en una pestanya nova

    one thing we didn't get is a reduction

  219. 9:28 , obre el vídeo en una pestanya nova

    in price for Soul. And I was thinking

  220. 9:30 , obre el vídeo en una pestanya nova

    about why. They almost certainly were

  221. 9:33 , obre el vídeo en una pestanya nova

    able to ek out performance gains,

  222. 9:36 , obre el vídeo en una pestanya nova

    efficiency gains for their biggest

  223. 9:38 , obre el vídeo en una pestanya nova

    model, Soul. But why didn't they reduce

  224. 9:41 , obre el vídeo en una pestanya nova

    the price? They were able to drop the

  225. 9:43 , obre el vídeo en una pestanya nova

    price of Luna substantially. They

  226. 9:45 , obre el vídeo en una pestanya nova

    dropped the price of Terra by 20%, but

  227. 9:48 , obre el vídeo en una pestanya nova

    nothing for Soul. Well, here's my

  228. 9:51 , obre el vídeo en una pestanya nova

    thinking. I think they actually were

  229. 9:53 , obre el vídeo en una pestanya nova

    able to find major efficiency gains for

  230. 9:56 , obre el vídeo en una pestanya nova

    Soul. But Soul is their cash cow. That

  231. 10:00 , obre el vídeo en una pestanya nova

    is where the majority of revenue comes

  232. 10:02 , obre el vídeo en una pestanya nova

    from. It is not from the workhorse

  233. 10:04 , obre el vídeo en una pestanya nova

    models. Although the total volume of

  234. 10:06 , obre el vídeo en una pestanya nova

    tokens might favor Luna and Terra,

  235. 10:10 , obre el vídeo en una pestanya nova

    although I'm not sure almost certainly

  236. 10:12 , obre el vídeo en una pestanya nova

    the vast majority of revenue comes from

  237. 10:14 , obre el vídeo en una pestanya nova

    the best models, not the workhorse

  238. 10:16 , obre el vídeo en una pestanya nova

    models. And so with those efficiency

  239. 10:19 , obre el vídeo en una pestanya nova

    gains that they probably got for Soul,

  240. 10:21 , obre el vídeo en una pestanya nova

    they're just able to increase their

  241. 10:23 , obre el vídeo en una pestanya nova

    margins that much more. Now, what may

  242. 10:26 , obre el vídeo en una pestanya nova

    have caused them to focus so much on

  243. 10:28 , obre el vídeo en una pestanya nova

    efficiency and dropping the price? Well,

  244. 10:32 , obre el vídeo en una pestanya nova

    it's probably this Kimmy K3, the Chinese

  245. 10:36 , obre el vídeo en una pestanya nova

    open source model that was just released

  246. 10:38 , obre el vídeo en una pestanya nova

    that is extremely good, near the

  247. 10:40 , obre el vídeo en una pestanya nova

    frontier, but it's also much less

  248. 10:42 , obre el vídeo en una pestanya nova

    expensive. Now, keep in mind, Kimmy K3

  249. 10:45 , obre el vídeo en una pestanya nova

    generally takes twice as many tokens to

  250. 10:46 , obre el vídeo en una pestanya nova

    accomplish the same task and it's half

  251. 10:48 , obre el vídeo en una pestanya nova

    the price. So, it's effectively the same

  252. 10:51 , obre el vídeo en una pestanya nova

    price, but a lot of people look at the

  253. 10:53 , obre el vídeo en una pestanya nova

    price per token and think, "Wow, that is

  254. 10:55 , obre el vídeo en una pestanya nova

    cheaper." But the other thing is as more

  255. 10:58 , obre el vídeo en una pestanya nova

    inference providers get their hands on

  256. 11:00 , obre el vídeo en una pestanya nova

    Kimmy K3 and more researchers try to

  257. 11:04 , obre el vídeo en una pestanya nova

    figure out how to get more efficiency

  258. 11:06 , obre el vídeo en una pestanya nova

    out of it, more people will be looking

  259. 11:08 , obre el vídeo en una pestanya nova

    at Kimmy K3 and other open- source

  260. 11:10 , obre el vídeo en una pestanya nova

    models. And the rate at which they will

  261. 11:13 , obre el vídeo en una pestanya nova

    discover new efficiency gains will be

  262. 11:15 , obre el vídeo en una pestanya nova

    higher than what a small closed team can

  263. 11:18 , obre el vídeo en una pestanya nova

    do. And so I think Open AAI is probably

  264. 11:21 , obre el vídeo en una pestanya nova

    just trying to get ahead of that. But

  265. 11:23 , obre el vídeo en una pestanya nova

    here's how crazy this price reduction

  266. 11:25 , obre el vídeo en una pestanya nova

    is. Look at this. This is the cost per

  267. 11:28 , obre el vídeo en una pestanya nova

    intelligence index task on artificial

  268. 11:31 , obre el vídeo en una pestanya nova

    analysis. We have all the way at the top

  269. 11:33 , obre el vídeo en una pestanya nova

    at $2.75. Claude Fable 5. Then here's

  270. 11:37 , obre el vídeo en una pestanya nova

    GPT5.6

  271. 11:39 , obre el vídeo en una pestanya nova

    6 Soul Max at $1.54, much less

  272. 11:42 , obre el vídeo en una pestanya nova

    expensive. Kimmy K3 coming in at 72. And

  273. 11:46 , obre el vídeo en una pestanya nova

    now here's GPT 5.6 Luna Max at 6.6

  274. 11:53 , obre el vídeo en una pestanya nova

    as compared to all the way up here,

  275. 11:56 , obre el vídeo en una pestanya nova

    $2.75. Now, obviously, Fable 5 is much

  276. 11:59 , obre el vídeo en una pestanya nova

    more capable, but the price difference

  277. 12:01 , obre el vídeo en una pestanya nova

    is astounding. And you can really see

  278. 12:03 , obre el vídeo en una pestanya nova

    that in this graph. Here's GPT 5.6 6

  279. 12:06 , obre el vídeo en una pestanya nova

    Luna Max coming in at 6 cents. Here's

  280. 12:09 , obre el vídeo en una pestanya nova

    GLM 5.2 coming in at 26 cents. Gro 4.5

  281. 12:13 , obre el vídeo en una pestanya nova

    coming in at 50 cents. And these are all

  282. 12:17 , obre el vídeo en una pestanya nova

    basically the same intelligence. And you

  283. 12:20 , obre el vídeo en una pestanya nova

    can just see 5.6 Luna is in a land of

  284. 12:22 , obre el vídeo en una pestanya nova

    its own. And this green quadrant top and

  285. 12:25 , obre el vídeo en una pestanya nova

    to the left is the best. So again,

  286. 12:28 , obre el vídeo en una pestanya nova

    comparable to basically the same

  287. 12:31 , obre el vídeo en una pestanya nova

    intelligence as Claud Sonnet 5 Max, but

  288. 12:34 , obre el vídeo en una pestanya nova

    a fraction of the price. Claud Sonnet 5

  289. 12:37 , obre el vídeo en una pestanya nova

    Max is $1.80

  290. 12:39 , obre el vídeo en una pestanya nova

    per task completed versus 6 cents. Now,

  291. 12:42 , obre el vídeo en una pestanya nova

    I want to speculate for a little bit.

  292. 12:45 , obre el vídeo en una pestanya nova

    What I actually think might be happening

  293. 12:47 , obre el vídeo en una pestanya nova

    is the two major closed source frontier

  294. 12:51 , obre el vídeo en una pestanya nova

    labs, OpenAI and Anthropic, this is

  295. 12:54 , obre el vídeo en una pestanya nova

    their playbook going forward. They train

  296. 12:56 , obre el vídeo en una pestanya nova

    these massive models, really

  297. 12:59 , obre el vídeo en una pestanya nova

    inefficient, massive, expensive to serve

  298. 13:02 , obre el vídeo en una pestanya nova

    models. And then from that, they use it

  299. 13:05 , obre el vídeo en una pestanya nova

    to bake almost as good, but far more

  300. 13:08 , obre el vídeo en una pestanya nova

    efficient and far less expensive models

  301. 13:10 , obre el vídeo en una pestanya nova

    for the rest of us to use. And yes, I

  302. 13:13 , obre el vídeo en una pestanya nova

    said for the rest of us because I

  303. 13:15 , obre el vídeo en una pestanya nova

    actually think there's a pretty good

  304. 13:17 , obre el vídeo en una pestanya nova

    chance, especially for Anthropic, that

  305. 13:20 , obre el vídeo en una pestanya nova

    they do not release their absolute

  306. 13:23 , obre el vídeo en una pestanya nova

    frontier models like Fable publicly

  307. 13:26 , obre el vídeo en una pestanya nova

    anymore, or at least they wait a very

  308. 13:29 , obre el vídeo en una pestanya nova

    long time. We already know Anthropic had

  309. 13:31 , obre el vídeo en una pestanya nova

    Fable all the way back in January,

  310. 13:34 , obre el vídeo en una pestanya nova

    months before they released it publicly.

  311. 13:36 , obre el vídeo en una pestanya nova

    And so I think this is actually a pretty

  312. 13:38 , obre el vídeo en una pestanya nova

    strong strategy for these AI labs. Train

  313. 13:41 , obre el vídeo en una pestanya nova

    the biggest best model you can. Then use

  314. 13:44 , obre el vídeo en una pestanya nova

    that to train smaller versions of it.

  315. 13:47 , obre el vídeo en una pestanya nova

    Highly capable but much less expensive.

  316. 13:50 , obre el vídeo en una pestanya nova

    Make a ton of revenue for that. And then

  317. 13:53 , obre el vídeo en una pestanya nova

    use that revenue to train your next big

  318. 13:55 , obre el vídeo en una pestanya nova

    model. And at the same time that biggest

  319. 13:57 , obre el vídeo en una pestanya nova

    model is training the next biggest model

  320. 14:01 , obre el vídeo en una pestanya nova

    and nobody else has access to it. This

  321. 14:03 , obre el vídeo en una pestanya nova

    might be recursive self-improvement.

  322. 14:05 , obre el vídeo en una pestanya nova

    This might mean that anthropic and open

  323. 14:07 , obre el vídeo en una pestanya nova

    AI cannot be caught. They already have

  324. 14:10 , obre el vídeo en una pestanya nova

    too much momentum. They already have the

  325. 14:12 , obre el vídeo en una pestanya nova

    best models training the next best

  326. 14:14 , obre el vídeo en una pestanya nova

    model. They have all the compute and

  327. 14:17 , obre el vídeo en una pestanya nova

    they have all the ingredients in the

  328. 14:18 , obre el vídeo en una pestanya nova

    world. And that's why I'm such a big

  329. 14:20 , obre el vídeo en una pestanya nova

    proponent of open source. I think

  330. 14:22 , obre el vídeo en una pestanya nova

    open-source is the only thing putting

  331. 14:24 , obre el vídeo en una pestanya nova

    competitive pressure on these two labs.

  332. 14:27 , obre el vídeo en una pestanya nova

    And one last thing, having such a

  333. 14:29 , obre el vídeo en una pestanya nova

    substantial price drop might change the

  334. 14:31 , obre el vídeo en una pestanya nova

    math on which provider you go with,

  335. 14:34 , obre el vídeo en una pestanya nova

    Anthropic or Open AAI. Who are you going

  336. 14:37 , obre el vídeo en una pestanya nova

    to pay your subscription to? I actually

  337. 14:39 , obre el vídeo en una pestanya nova

    made an entire video about this exact

  338. 14:41 , obre el vídeo en una pestanya nova

    topic, so it can help you decide.