GPT-5.6 es torna més barat? Què hi ha darrere la retallada del 80%
OpenAI abaixa un 80% el preu de GPT-5.6 Luna i afirma que Sol va ajudar a reduir el cost d'inferència. Expliquem què va millorar i per què no és encara automillora recursiva plena.
OpenAI ha reduït un 80% el preu de GPT‑5.6 Luna només unes setmanes després de presentar la família GPT‑5.6. El model passa a costar 0,20 dòlars per milió de tokens d'entrada i 1,20 dòlars per milió de tokens de sortida. GPT‑5.6 Terra baixa un 20%, fins a 2 i 12 dòlars respectivament, mentre que el preu estàndard de GPT‑5.6 Sol no canvia.
Matthew Berman destaca una dada encara més suggeridora: OpenAI afirma que el seu model més potent, Sol, va ajudar els enginyers a trobar millores que redueixen el cost de servir la família. El vídeo ho descriu com a «automillora recursiva». És un avanç real cap a la recerca automatitzada, però encara no és un model que es reentrena, modifica els seus propis pesos i produeix autònomament un successor més intel·ligent.
Resposta curta: GPT‑5.6 s'ha fet més barat ell mateix?
En un sentit limitat, GPT‑5.6 Sol va ajudar a millorar el sistema que l'executa. Va analitzar dades operatives, va proposar i provar estratègies d'encaminament, va optimitzar kernels de GPU i va participar en centenars d'experiments sobre el model auxiliar utilitzat en la decodificació especulativa. OpenAI atribueix a aquest treball una reducció del 20% del cost integral de servei i més d'un 15% de millora en l'eficiència de generació de tokens.
Però la millora no equival a una IA que hagi canviat tota sola el seu model principal. Els humans van definir l'objectiu, l'entorn d'experimentació i els criteris; van validar els canvis i van decidir desplegar-los. La manera més precisa de descriure-ho és «enginyeria d'inferència assistida per IA» o «recerca automatitzada sota supervisió».
Els canvis de preu
| Model | Preu anterior per 1 M de tokens | Preu nou per 1 M de tokens | Canvi anunciat |
|---|---|---|---|
| GPT‑5.6 Luna, entrada | 1,00 $ | 0,20 $ | −80% |
| GPT‑5.6 Luna, sortida | 6,00 $ | 1,20 $ | −80% |
| GPT‑5.6 Terra, entrada | 2,50 $ | 2,00 $ | −20% |
| GPT‑5.6 Terra, sortida | 15,00 $ | 12,00 $ | −20% |
| GPT‑5.6 Sol estàndard | Sense canvi | Sense canvi | 0% |
OpenAI també ha introduït un mode ràpid per a Sol: fins a 2,5 vegades més velocitat al doble del preu estàndard. L'opció anterior oferia aproximadament 1,5 vegades la velocitat pel mateix multiplicador de cost.
Això millora el rendiment temporal per dòlar respecte de l'antic mode prioritari, però no és literalment una reducció del preu per token. El client continua pagant el doble; rep més velocitat i pot completar abans una càrrega sensible a la latència.
1. Luna, Terra i Sol: tres nivells amb funcions diferents
La família GPT‑5.6 està dividida en tres nivells:
-
Sol és el model insígnia per a treball professional complex, recerca, codi i tasques amb molta autonomia;
-
Terra busca un equilibri entre capacitat i cost per al treball quotidià;
-
Luna està orientat a gran volum, velocitat i càrregues sensibles al preu.
L'estratègia permet triar quanta intel·ligència es compra per a cada pas. Un agent pot utilitzar Luna per classificar, extraure o revisar milers d'elements i escalar a Sol només quan troba un cas difícil. La retallada reforça aquest patró: no pretén que Luna substitueixi Sol en tot, sinó que moltes accions deixin de necessitar el model més car.
2. Preu per token i cost per tasca no són el mateix
Berman insisteix encertadament que comparar només el preu per milió de tokens pot portar a una conclusió equivocada. Un model econòmic que produeix respostes molt llargues, fa més intents o resol menys casos pot acabar costant més.
OpenAI defineix el cost per tasca satisfactòria amb una fórmula simple:
-
sumar el cost complet d'executar el treball;
-
comptar quantes tasques han superat el nivell de qualitat requerit;
-
dividir el cost total pel nombre d'èxits.
El marc publicat per OpenAI recorda que també s'han d'incloure el temps humà de revisió, els reintents i la feina per corregir errors. Un model frontera pot ser més barat en una tasca rutinària si l'encerta a la primera; un model petit pot guanyar quan el procés és estable, fàcil de verificar i repetit milions de vegades.
Exemple simplificat
| Model hipotètic | Cost per intent | Taxa d'èxit | Cost directe per tasca correcta |
|---|---|---|---|
| Model A | 0,06 $ | 60% | 0,10 $ |
| Model B | 0,12 $ | 95% | 0,126 $ |
El model A continua sent lleugerament més barat abans d'afegir revisió i reintents. Si cada error requereix cinc minuts d'una persona, el model B podria resultar molt més econòmic. El cost per token només és una peça de la decisió.
3. Què diuen les proves d'Artificial Analysis?
El vídeo utilitza l'índex d'Artificial Analysis, que combina avaluacions de raonament, codi, ciència i treball amb agents. En el llançament inicial, Luna amb esforç màxim obtenia una puntuació propera a models més cars i costava aproximadament un 80% menys per tasca que Sol.
Amb el nou preu, Berman situa Luna al voltant de sis cèntims per tasca de l'índex, davant de quantitats superiors per a GLM‑5.2, Claude Sonnet, Claude Opus o GPT‑5.6 Sol. La imatge general és clara: Luna ocupa una zona molt competitiva de capacitat per dòlar.
Les xifres exactes s'han d'interpretar amb cautela per tres motius:
-
el cost depèn del nombre de tokens que el model va generar en aquesta bateria concreta;
-
el nivell d'esforç canvia tant la puntuació com la despesa;
-
una mitjana de proves no prediu necessàriament el rendiment en el codi, els documents o les eines d'una empresa determinada.
Artificial Analysis és una comparació externa útil, però no elimina la necessitat de provar els models amb casos reals, una resposta esperada i un criteri de qualitat propi.
4. On va trobar eficiència GPT‑5.6 Sol?
L'article tècnic d'OpenAI sobre la millora de preu i rendiment descriu tres àrees principals.
Kernels de producció
Un kernel és una peça de programari molt optimitzada que executa operacions numèriques sobre la GPU. Petites millores en moviment de memòria, paral·lelisme o fusió d'operacions poden estalviar molt de còmput quan es repeteixen per milions de peticions.
OpenAI diu que Sol, utilitzat amb Codex, va ajudar a identificar feina que es podia precalcular, evitar o executar en paral·lel, i va reescriure i optimitzar kernels de producció. L'empresa atribueix al conjunt de millores una reducció del 20% del cost integral de servei.
Equilibri i encaminament
Un sistema distribuït ha de repartir les peticions entre moltes GPU i servidors. Si algunes màquines queden saturades mentre d'altres estan infrautilitzades, augmenten la latència i el cost.
Sol va ajudar a analitzar trànsit de producció, trobar desequilibris abans ignorats, provar estratègies noves i ajustar heurístiques. Això no significa necessàriament que el model llegeixi de manera indiscriminada el text personal de cada usuari; «trànsit» també pot referir-se a traces, mètriques, formes de càrrega i dades operatives.
Decodificació especulativa
La decodificació especulativa utilitza un model auxiliar més petit per proposar diversos tokens ràpidament. El model principal els comprova i n'accepta els correctes. Si les prediccions del model auxiliar són bones, el sistema genera text amb menys treball del model gran.
Sol va dissenyar i executar centenars d'experiments sobre la mida, l'estructura i les característiques d'aquest model auxiliar. OpenAI afirma que el resultat va millorar més d'un 15% l'eficiència de generació de tokens.
5. És automillora recursiva?
Depèn de la definició. En un sentit ampli, un model contribueix a fer més eficient la infraestructura que executa models de la mateixa família. El coneixement obtingut pot abaratir més experiments futurs, que al seu torn poden generar noves millores. Hi ha un bucle real.
En el sentit fort que s'utilitza en els debats sobre una explosió d'intel·ligència, encara no. Per parlar d'automillora recursiva plena esperaríem un sistema que pogués:
-
proposar canvis substancials en el model principal;
-
entrenar o modificar autònomament els seus pesos;
-
validar de manera fiable que el successor és millor i segur;
-
desplegar-lo o utilitzar-lo per repetir el procés;
-
mantenir el progrés a través de moltes generacions amb poca intervenció humana.
El cas d'OpenAI mostra automatització de recerca i enginyeria dins d'un perímetre definit. És important perquè redueix una de les barreres del cicle, però no demostra que totes les altres hagin desaparegut.
6. La connexió amb autoresearch d'Andrej Karpathy
Berman compara el procés amb autoresearch, el projecte obert d'Andrej Karpathy. El repositori dona a un agent un petit sistema real d'entrenament de models. L'agent modifica un únic fitxer, entrena durant cinc minuts, comprova una mètrica, conserva o descarta el canvi i repeteix l'experiment.
El disseny és deliberadament acotat:
-
una sola GPU;
-
un sol fitxer modificable;
-
un pressupost temporal fix per prova;
-
una mètrica comparable;
-
un historial de canvis que es pot revisar.
Aquestes limitacions són part de l'èxit. Convertir una pregunta oberta en un bucle amb experiments barats i una mètrica clara facilita que l'agent trobi millores. Escalar el mètode a un model frontera és molt més difícil: una sola prova pot costar milions, les mètriques poden entrar en conflicte i una millora en una prova pot degradar seguretat o capacitats en una altra.
Karpathy es va incorporar a Anthropic el maig del 2026 per treballar en preentrenament. Això reforça la tendència cap a laboratoris on els models participen cada vegada més en la recerca que crea la següent generació.
7. «Analitza els teus prompts constantment»? El matís de privacitat
El vídeo imagina Sol observant constantment milions de prompts d'usuaris per buscar ineficiències. La comunicació pública disponible no permet afirmar-ho d'aquesta manera.
OpenAI diu que, per defecte, no utilitza les entrades ni les sortides de ChatGPT Business, Enterprise, Edu o de l'API per entrenar o millorar els models. Els clients de l'API poden acceptar voluntàriament compartir dades. Els serveis per a particulars poden utilitzar converses per millorar els models si l'usuari no ho desactiva.
La documentació de controls de dades de l'API també diferencia contingut, registres de prevenció d'abusos, estat de l'aplicació i metadades operatives. Alguns registres poden conservar contingut durant un període limitat, mentre que les organitzacions elegibles poden configurar retenció zero.
Per tant, optimitzar-se amb «trànsit de producció» no s'ha de traduir automàticament per «llegir tots els teus prompts». La privacitat depèn del producte, la configuració, el consentiment i el tipus de dada utilitzada en l'anàlisi.
8. Per què Sol no ha baixat de preu?
Berman especula que OpenAI ha mantingut el preu de Sol perquè és el producte amb més marge i una font important d'ingressos. És una hipòtesi empresarial plausible, però no hi ha dades públiques que mostrin quina part dels ingressos de l'API aporta cada model.
També hi ha altres explicacions possibles:
-
la demanda de Sol pot superar l'oferta disponible;
-
les millores poden haver-se concentrat en Luna i Terra;
-
el model insígnia pot necessitar una infraestructura més cara encara després de l'optimització;
-
OpenAI pot voler segmentar el mercat i mantenir un preu superior per a les tasques de màxim valor;
-
els estalvis poden destinar-se a ampliar capacitat o finançar la següent generació.
Sense informació de costos i ús per model, atribuir-ho només al marge és especulatiu.
9. La pressió de Kimi K3 i els models oberts
El vídeo relaciona la retallada amb Kimi K3, el model de pesos oberts de Moonshot AI. Kimi s'acosta als models propietaris en diverses proves i permet que múltiples proveïdors n'optimitzin la inferència.
L'obertura pot accelerar millores perquè investigadors i empreses d'arreu experimenten amb quantització, kernels, memòria cau, encaminament i maquinari. Però tampoc garanteix que el cost per tasca sigui menor. Kimi pot necessitar més tokens, i allotjar un model enorme exigeix moltes GPU.
El repositori oficial de Kimi K3 publica els pesos i la informació tècnica. Aquesta disponibilitat pressiona els laboratoris tancats perquè baixin preus o ofereixin una qualitat clarament superior. Que la retallada d'OpenAI sigui una resposta directa a Kimi és una inferència de Berman, no una motivació confirmada per OpenAI.
10. Què canvia per a un usuari o una empresa?
La nova tarifa pot alterar l'arquitectura d'un producte amb molts agents, però convé mesurar abans de migrar.
Un procés raonable és:
-
seleccionar un conjunt representatiu de tasques reals;
-
definir què significa una resposta correcta;
-
mesurar tokens, temps, reintents i revisió humana;
-
provar diversos nivells d'esforç de Luna, Terra i Sol;
-
calcular el cost per tasca que supera el llindar de qualitat;
-
reservar el model més potent per als casos que el necessiten;
-
repetir la prova quan canvien preus o versions.
La retallada anunciada afecta l'API i el consum de crèdits associat a alguns productes. No implica automàticament una reducció del preu de totes les subscripcions de ChatGPT ni que cada usuari disposi de cinc vegades més quota.
Conclusions
La notícia té dues capes. La primera és comercial i immediata: Luna costa un 80% menys, Terra un 20% menys i Sol ofereix un mode més ràpid. Això pot canviar de debò el pressupost d'aplicacions que executen milions de tasques.
La segona és tecnològica: un model frontera ja pot contribuir materialment a optimitzar kernels, encaminament i models auxiliars que redueixen el cost de la seva pròpia infraestructura. És un exemple important de recerca automatitzada, però anomenar-lo automillora recursiva plena elimina les parts que encara depenen d'enginyers, experiments controlats, verificació i desplegament humà.
El senyal més rellevant no és que la IA s'hagi tornat autònomament millor d'un dia per l'altre. És que la quantitat de treball d'enginyeria que pot automatitzar ha augmentat prou perquè els estalvis arribin ràpidament al preu. Si aquest cicle es repeteix, el cost per tasca —no només la puntuació del model— serà un dels principals camps de competència de la IA.
Preguntes freqüents
Quin és el nou preu de GPT‑5.6 Luna?
0,20 dòlars per milió de tokens d'entrada i 1,20 dòlars per milió de tokens de sortida, una reducció del 80% respecte del preu inicial.
GPT‑5.6 Terra també baixa?
Sí. Passa a 2 dòlars per milió de tokens d'entrada i 12 dòlars per milió de tokens de sortida, un 20% menys.
GPT‑5.6 Sol és més barat?
El preu estàndard no ha baixat. El nou mode ràpid ofereix fins a 2,5 vegades la velocitat pel doble del preu, una millora de rendiment respecte de l'anterior opció prioritària.
Sol va modificar els seus propis pesos?
No hi ha cap indicació pública que ho fes. Va ajudar a optimitzar programari de producció, estratègies d'encaminament i el model auxiliar de decodificació sota supervisió humana.
És el començament de l'automillora recursiva?
És una peça inicial del procés: automatitzar experiments i enginyeria que fan més eficient la IA. No és encara un bucle autònom que creï successivament models principals més intel·ligents.
Luna és sempre la millor opció?
No. És especialment atractiu per volum i tasques verificables. Sol o Terra poden resultar més econòmics quan eviten errors, reintents o revisió humana en problemes difícils.
Contrast i context
Fonts consultades
- 01
- 02
-
03
OpenAI A scorecard for the AI age
-
04
Artificial Analysis GPT-5.6 benchmarks across Intelligence, Speed and Cost
-
05
Andrej Karpathy — GitHub autoresearch: AI agents running research automatically
- 06
-
07
OpenAI API Data controls in the OpenAI platform
- 08
-
09
Moonshot AI — GitHub Kimi K3: Open Frontier Intelligence
Font de treball
Transcripció amb marques de temps
Consulta la transcripció
-
0:00
, obre el vídeo en una pestanya nova
Open AAI just dropped their prices by
-
0:02
, obre el vídeo en una pestanya nova
80%. And that's awesome, but it's also
-
0:06
, obre el vídeo en una pestanya nova
not even the most impressive thing. They
-
0:09
, obre el vídeo en una pestanya nova
used their best model, GPT 5.6 Soul, to
-
0:13
, obre el vídeo en una pestanya nova
improve itself, to find efficiency
-
0:16
, obre el vídeo en una pestanya nova
gains. That's how they were able to drop
-
0:18
, obre el vídeo en una pestanya nova
the price so much. I have so many
-
0:20
, obre el vídeo en una pestanya nova
thoughts about this because this is
-
0:22
, obre el vídeo en una pestanya nova
essentially recursive self-improvement
-
0:25
, obre el vídeo en una pestanya nova
and there are so many implications.
-
0:27
, obre el vídeo en una pestanya nova
Let's go through them. First, let me
-
0:30
, obre el vídeo en una pestanya nova
show you the news. So, here's Sam Alman.
-
0:32
, obre el vídeo en una pestanya nova
Major price cuts today. An 80% drop for
-
0:36
, obre el vídeo en una pestanya nova
GPT 5.6 Luna. Luna is the smallest of
-
0:40
, obre el vídeo en una pestanya nova
the three models in the GPT 5.6 family.
-
0:43
, obre el vídeo en una pestanya nova
And it's actually really good. And when
-
0:46
, obre el vídeo en una pestanya nova
I show you the charts comparing it to
-
0:48
, obre el vídeo en una pestanya nova
other models, including Fable, you're
-
0:50
, obre el vídeo en una pestanya nova
going to be even more excited about this
-
0:52
, obre el vídeo en una pestanya nova
price drop. So now it's 20 cents per
-
0:56
, obre el vídeo en una pestanya nova
million input tokens and $1.20 per
-
0:59
, obre el vídeo en una pestanya nova
million output tokens, which is
-
1:01
, obre el vídeo en una pestanya nova
incredibly inexpensive. That is cheaper
-
1:04
, obre el vídeo en una pestanya nova
than the frontier open-source models
-
1:07
, obre el vídeo en una pestanya nova
coming out of China. And I know I've
-
1:09
, obre el vídeo en una pestanya nova
been talking a lot about this before. It
-
1:11
, obre el vídeo en una pestanya nova
is not strictly about the price per
-
1:13
, obre el vídeo en una pestanya nova
token. What is more important and really
-
1:16
, obre el vídeo en una pestanya nova
only important is the cost per task
-
1:19
, obre el vídeo en una pestanya nova
completed. And the reason is is because
-
1:23
, obre el vídeo en una pestanya nova
for example, Kimmy K3 is half the price
-
1:26
, obre el vídeo en una pestanya nova
of 5.6 soul, but it takes twice as many
-
1:30
, obre el vídeo en una pestanya nova
tokens to accomplish that same task.
-
1:33
, obre el vídeo en una pestanya nova
Thus, they're effectively the same
-
1:35
, obre el vídeo en una pestanya nova
price. Now, for GPT 5.6 Terra, which is
-
1:39
, obre el vídeo en una pestanya nova
their middle model between Luna and
-
1:41
, obre el vídeo en una pestanya nova
Soul, there is a 20% price drop. Now, it
-
1:45
, obre el vídeo en una pestanya nova
is $2 per million input, $12 per million
-
1:48
, obre el vídeo en una pestanya nova
output. Now, GPT 5.6 6 sold. The big
-
1:51
, obre el vídeo en una pestanya nova
model, the model that was able to
-
1:54
, obre el vídeo en una pestanya nova
achieve some of these performance gains
-
1:56
, obre el vídeo en una pestanya nova
did not get a price drop. Well, not
-
1:59
, obre el vídeo en una pestanya nova
exactly. So, what we did get is a fast
-
2:02
, obre el vídeo en una pestanya nova
mode in the API. You get 2 and 1/2 times
-
2:05
, obre el vídeo en una pestanya nova
the speed for 2x the price. Same
-
2:08
, obre el vídeo en una pestanya nova
intelligence. Well, that sounds nice,
-
2:10
, obre el vídeo en una pestanya nova
but it doesn't sound like a price
-
2:12
, obre el vídeo en una pestanya nova
decrease. Well, it kind of is.
-
2:14
, obre el vídeo en una pestanya nova
Previously, the fast mode options were 1
-
2:18
, obre el vídeo en una pestanya nova
and 1/2 times faster for two times the
-
2:21
, obre el vídeo en una pestanya nova
cost. Now, we get two and a half times
-
2:24
, obre el vídeo en una pestanya nova
faster for two times the cost. Same cost
-
2:27
, obre el vídeo en una pestanya nova
increase for fast mode, but much faster.
-
2:31
, obre el vídeo en una pestanya nova
That is effectively a price decrease.
-
2:33
, obre el vídeo en una pestanya nova
And so, let's look at this. This is the
-
2:35
, obre el vídeo en una pestanya nova
artificial analysis intelligence index.
-
2:37
, obre el vídeo en una pestanya nova
And what we're seeing on the y-axis over
-
2:39
, obre el vídeo en una pestanya nova
here is the overall intelligence index
-
2:41
, obre el vídeo en una pestanya nova
score. And importantly, and I'm so glad
-
2:45
, obre el vídeo en una pestanya nova
that Sam Alman shared this metric, cost
-
2:48
, obre el vídeo en una pestanya nova
per task on the X-axis. Now, look at
-
2:52
, obre el vídeo en una pestanya nova
this. What you want to see on this chart
-
2:55
, obre el vídeo en una pestanya nova
is as high up as possible and to the
-
2:58
, obre el vídeo en una pestanya nova
left as possible. And what do we see
-
3:01
, obre el vídeo en una pestanya nova
here? GPT 5.6 Luna sitting right there.
-
3:05
, obre el vídeo en una pestanya nova
Now, each of these dots represents
-
3:07
, obre el vídeo en una pestanya nova
different thinking efforts. This top one
-
3:09
, obre el vídeo en una pestanya nova
is the max. So, GPT 5.6 6 Luna Max. Now,
-
3:13
, obre el vídeo en una pestanya nova
what we see is it is slightly ahead in
-
3:16
, obre el vídeo en una pestanya nova
terms of overall intelligence to GLM 5.2
-
3:19
, obre el vídeo en una pestanya nova
Max, which is an open-source model out
-
3:22
, obre el vídeo en una pestanya nova
of China. And because it's all the way
-
3:25
, obre el vídeo en una pestanya nova
over here, it is a fraction of the
-
3:27
, obre el vídeo en una pestanya nova
price. So, GLM 5.2 Max looks like it's
-
3:30
, obre el vídeo en una pestanya nova
coming in around 25 or 28 cents per
-
3:33
, obre el vídeo en una pestanya nova
completed task, whereas GPT 5.6 Luna is
-
3:37
, obre el vídeo en una pestanya nova
coming in at about 6 cents. Again, a
-
3:40
, obre el vídeo en una pestanya nova
fraction of the price and it's slightly
-
3:43
, obre el vídeo en una pestanya nova
ahead. Here's Claude Opus 5 low coming
-
3:46
, obre el vídeo en una pestanya nova
in slightly lower than GLM 5.2, slightly
-
3:49
, obre el vídeo en una pestanya nova
lower than 5.6 Luna, but it is really
-
3:53
, obre el vídeo en una pestanya nova
expensive at about 40 cents per task
-
3:56
, obre el vídeo en una pestanya nova
completion. So, Luna is just going to be
-
3:59
, obre el vídeo en una pestanya nova
an absolute workhorse of a model. And
-
4:01
, obre el vídeo en una pestanya nova
all of that is great, but that's not the
-
4:04
, obre el vídeo en una pestanya nova
crazy part. The crazy part is they used
-
4:07
, obre el vídeo en una pestanya nova
their Frontier model, GPT 5.6 6 soul to
-
4:10
, obre el vídeo en una pestanya nova
find all of these performance gains that
-
4:13
, obre el vídeo en una pestanya nova
allowed them to drop the price of their
-
4:14
, obre el vídeo en una pestanya nova
other models. So just yesterday after
-
4:17
, obre el vídeo en una pestanya nova
deployment we apply GPT 5.6 Soul to
-
4:20
, obre el vídeo en una pestanya nova
advance the frontier of efficiency by
-
4:22
, obre el vídeo en una pestanya nova
making itself more efficient to run. The
-
4:25
, obre el vídeo en una pestanya nova
results 20% lower serving cost from
-
4:28
, obre el vídeo en una pestanya nova
production GPU kernel improvements 15%
-
4:30
, obre el vídeo en una pestanya nova
better token generation efficiency from
-
4:33
, obre el vídeo en una pestanya nova
improved speculative decoding. And if
-
4:36
, obre el vídeo en una pestanya nova
you don't know what that means, it
-
4:37
, obre el vídeo en una pestanya nova
doesn't really matter. It just means
-
4:39
, obre el vídeo en una pestanya nova
that they were able to improve the
-
4:40
, obre el vídeo en una pestanya nova
overall efficiency of the model. And
-
4:42
, obre el vídeo en una pestanya nova
they actually wrote up an entire blog
-
4:44
, obre el vídeo en una pestanya nova
post about the technical details, the
-
4:46
, obre el vídeo en una pestanya nova
specific performance improvements that
-
4:48
, obre el vídeo en una pestanya nova
were discovered by GPT 5.6 Soul. I'm not
-
4:51
, obre el vídeo en una pestanya nova
going to go too deep into it, but I want
-
4:53
, obre el vídeo en una pestanya nova
to read a few of these quotes because it
-
4:55
, obre el vídeo en una pestanya nova
is stunning. Throughout the entire
-
4:57
, obre el vídeo en una pestanya nova
article, they're saying, "Yeah, 5.6
-
5:00
, obre el vídeo en una pestanya nova
discovered it." Check this out. So 5.6
-
5:02
, obre el vídeo en una pestanya nova
six soul in Codeex helps us analyze
-
5:04
, obre el vídeo en una pestanya nova
production traffic, identify previously
-
5:07
, obre el vídeo en una pestanya nova
overlooked sources of imbalance, test
-
5:09
, obre el vídeo en una pestanya nova
new routing strategies, and constantly
-
5:10
, obre el vídeo en una pestanya nova
tune these heruristics. And so just
-
5:13
, obre el vídeo en una pestanya nova
imagine this, every time you submit a
-
5:15
, obre el vídeo en una pestanya nova
prompt to chat GPT, and then imagine
-
5:19
, obre el vídeo en una pestanya nova
that multiplied by the millions of
-
5:21
, obre el vídeo en una pestanya nova
people that do that per day, GPT 5.6 Six
-
5:24
, obre el vídeo en una pestanya nova
soul with codeex is just constantly
-
5:26
, obre el vídeo en una pestanya nova
looking at the production data,
-
5:28
, obre el vídeo en una pestanya nova
constantly looking at your prompts,
-
5:30
, obre el vídeo en una pestanya nova
constantly looking at where the
-
5:32
, obre el vídeo en una pestanya nova
inefficiencies are and coming up with
-
5:35
, obre el vídeo en una pestanya nova
potential improvements, testing those
-
5:38
, obre el vídeo en una pestanya nova
improvements and iterating over and over
-
5:40
, obre el vídeo en una pestanya nova
again. And if that sounds familiar, that
-
5:43
, obre el vídeo en una pestanya nova
is also known as a loop. The goal of the
-
5:47
, obre el vídeo en una pestanya nova
loop being to improve the efficiency of
-
5:49
, obre el vídeo en una pestanya nova
the model. And so this really shows the
-
5:51
, obre el vídeo en una pestanya nova
power of loops, which I've been talking
-
5:52
, obre el vídeo en una pestanya nova
a lot about lately. In fact, I made a
-
5:55
, obre el vídeo en una pestanya nova
loopy skill that you can install that
-
5:58
, obre el vídeo en una pestanya nova
helps you create and discover loops for
-
6:00
, obre el vídeo en una pestanya nova
your prompts. I published the skill and
-
6:03
, obre el vídeo en una pestanya nova
you can try it out. And the sponsor of
-
6:05
, obre el vídeo en una pestanya nova
today's video, Hyper Agent. I'm going to
-
6:07
, obre el vídeo en una pestanya nova
drop a link down below to my published
-
6:09
, obre el vídeo en una pestanya nova
skill so you can get it directly in
-
6:11
, obre el vídeo en una pestanya nova
Hyper Agent. Hyper Agent is awesome
-
6:13
, obre el vídeo en una pestanya nova
because it is like a team of always on
-
6:16
, obre el vídeo en una pestanya nova
agents working for you and you can use
-
6:18
, obre el vídeo en una pestanya nova
models from any provider including the
-
6:19
, obre el vídeo en una pestanya nova
model we're talking about today which is
-
6:21
, obre el vídeo en una pestanya nova
GPT 5.6 Luna. You can use Kimmy K3. You
-
6:25
, obre el vídeo en una pestanya nova
can also use GLM 5.2 fast. All the
-
6:28
, obre el vídeo en una pestanya nova
models are available very easy for you
-
6:30
, obre el vídeo en una pestanya nova
to try out. Each agent gets its own
-
6:33
, obre el vídeo en una pestanya nova
cloud environment with its own login
-
6:35
, obre el vídeo en una pestanya nova
completely connected to the tools that
-
6:37
, obre el vídeo en una pestanya nova
you already use. This is much more than
-
6:39
, obre el vídeo en una pestanya nova
a chatbot. And of course, an agent can
-
6:42
, obre el vídeo en una pestanya nova
delegate to sub agents. Very organized
-
6:45
, obre el vídeo en una pestanya nova
and very costefficient. And with the
-
6:48
, obre el vídeo en una pestanya nova
marketplace, it's basically like an app
-
6:50
, obre el vídeo en una pestanya nova
store, but for agents, and of course,
-
6:53
, obre el vídeo en una pestanya nova
you can find my loopy skill in the
-
6:55
, obre el vídeo en una pestanya nova
marketplace for free. So, go find my
-
6:57
, obre el vídeo en una pestanya nova
skill on the marketplace. Link down
-
6:59
, obre el vídeo en una pestanya nova
below. You get $500 in credits to try it
-
7:02
, obre el vídeo en una pestanya nova
out. So, thanks again, Hyper Agent. Now,
-
7:04
, obre el vídeo en una pestanya nova
back to the video. We also use Soul to
-
7:06
, obre el vídeo en una pestanya nova
optimize the model's forward pass, the
-
7:08
, obre el vídeo en una pestanya nova
computation that transforms inputs into
-
7:10
, obre el vídeo en una pestanya nova
next token predictions. They also found
-
7:13
, obre el vídeo en una pestanya nova
work that can be precomputed, avoided or
-
7:15
, obre el vídeo en una pestanya nova
parallelized. And it even rewrote and
-
7:18
, obre el vídeo en una pestanya nova
optimized our production kernels. So
-
7:21
, obre el vídeo en una pestanya nova
just imagine having all the power of
-
7:24
, obre el vídeo en una pestanya nova
this frontier model running 24 hours a
-
7:26
, obre el vídeo en una pestanya nova
day, highly parallelized, looking for
-
7:29
, obre el vídeo en una pestanya nova
optimizations at all times. This is the
-
7:32
, obre el vídeo en una pestanya nova
power of loops. But this is also the
-
7:34
, obre el vídeo en una pestanya nova
power of recursive self-improvement. And
-
7:36
, obre el vídeo en una pestanya nova
this also makes me a little bit nervous.
-
7:39
, obre el vídeo en una pestanya nova
This is the point at which I look and I
-
7:41
, obre el vídeo en una pestanya nova
say, well, if the top two leading AI
-
7:45
, obre el vídeo en una pestanya nova
labs, OpenAI and Anthropic, already have
-
7:47
, obre el vídeo en una pestanya nova
such a big lead and they have momentum
-
7:51
, obre el vídeo en una pestanya nova
and we are at the beginning of recursive
-
7:53
, obre el vídeo en una pestanya nova
self-improvement. How does anybody else
-
7:55
, obre el vídeo en una pestanya nova
catch up? And that's a question I'm
-
7:56
, obre el vídeo en una pestanya nova
trying to navigate every day. Now listen
-
7:59
, obre el vídeo en una pestanya nova
to this. It improved its own draft model
-
8:01
, obre el vídeo en una pestanya nova
by designing and running hundreds of
-
8:03
, obre el vídeo en una pestanya nova
experiments on its architecture, testing
-
8:05
, obre el vídeo en una pestanya nova
changes in size, structure, and
-
8:07
, obre el vídeo en una pestanya nova
features. Now, does that sound familiar?
-
8:09
, obre el vídeo en una pestanya nova
That sure sounds like Karpathy's auto
-
8:12
, obre el vídeo en una pestanya nova
research project. A few months ago,
-
8:14
, obre el vídeo en una pestanya nova
Andre Karpathy, one of the most
-
8:16
, obre el vídeo en una pestanya nova
well-known AI researchers in all of the
-
8:19
, obre el vídeo en una pestanya nova
industry and also now an anthropic
-
8:22
, obre el vídeo en una pestanya nova
employee, published this open- source
-
8:24
, obre el vídeo en una pestanya nova
repo in which he basically described
-
8:27
, obre el vídeo en una pestanya nova
what is a loop and the objective is
-
8:30
, obre el vídeo en una pestanya nova
improve the efficiency of training a
-
8:32
, obre el vídeo en una pestanya nova
brand new LLM from scratch. And the
-
8:35
, obre el vídeo en una pestanya nova
crazy thing is the model came up with
-
8:37
, obre el vídeo en una pestanya nova
its own experiments, ran the
-
8:39
, obre el vídeo en una pestanya nova
experiments, reviewed and analyzed the
-
8:42
, obre el vídeo en una pestanya nova
output of the experiment and then
-
8:44
, obre el vídeo en una pestanya nova
iterated over and over again and it was
-
8:47
, obre el vídeo en una pestanya nova
actually able to find real improvements
-
8:49
, obre el vídeo en una pestanya nova
that Karpathy himself could not find.
-
8:52
, obre el vídeo en una pestanya nova
Now he was applying this to a small
-
8:55
, obre el vídeo en una pestanya nova
language model. Imagine you have the
-
8:57
, obre el vídeo en una pestanya nova
compute of open AI and imagine you have
-
9:00
, obre el vídeo en una pestanya nova
one of the best models on the planet and
-
9:02
, obre el vídeo en una pestanya nova
this loop, this auto research loop gets
-
9:05
, obre el vídeo en una pestanya nova
run 24 hours a day. This is truly an
-
9:09
, obre el vídeo en una pestanya nova
automated AI researcher. Now back to
-
9:12
, obre el vídeo en una pestanya nova
this chart, you need to be using Luna.
-
9:15
, obre el vídeo en una pestanya nova
Luna was already a fantastic model and
-
9:17
, obre el vídeo en una pestanya nova
now you can run it on max mode and it is
-
9:20
, obre el vídeo en una pestanya nova
so inexpensive. This is a major major
-
9:24
, obre el vídeo en una pestanya nova
upgrade to all of our lives. Now, the
-
9:26
, obre el vídeo en una pestanya nova
one thing we didn't get is a reduction
-
9:28
, obre el vídeo en una pestanya nova
in price for Soul. And I was thinking
-
9:30
, obre el vídeo en una pestanya nova
about why. They almost certainly were
-
9:33
, obre el vídeo en una pestanya nova
able to ek out performance gains,
-
9:36
, obre el vídeo en una pestanya nova
efficiency gains for their biggest
-
9:38
, obre el vídeo en una pestanya nova
model, Soul. But why didn't they reduce
-
9:41
, obre el vídeo en una pestanya nova
the price? They were able to drop the
-
9:43
, obre el vídeo en una pestanya nova
price of Luna substantially. They
-
9:45
, obre el vídeo en una pestanya nova
dropped the price of Terra by 20%, but
-
9:48
, obre el vídeo en una pestanya nova
nothing for Soul. Well, here's my
-
9:51
, obre el vídeo en una pestanya nova
thinking. I think they actually were
-
9:53
, obre el vídeo en una pestanya nova
able to find major efficiency gains for
-
9:56
, obre el vídeo en una pestanya nova
Soul. But Soul is their cash cow. That
-
10:00
, obre el vídeo en una pestanya nova
is where the majority of revenue comes
-
10:02
, obre el vídeo en una pestanya nova
from. It is not from the workhorse
-
10:04
, obre el vídeo en una pestanya nova
models. Although the total volume of
-
10:06
, obre el vídeo en una pestanya nova
tokens might favor Luna and Terra,
-
10:10
, obre el vídeo en una pestanya nova
although I'm not sure almost certainly
-
10:12
, obre el vídeo en una pestanya nova
the vast majority of revenue comes from
-
10:14
, obre el vídeo en una pestanya nova
the best models, not the workhorse
-
10:16
, obre el vídeo en una pestanya nova
models. And so with those efficiency
-
10:19
, obre el vídeo en una pestanya nova
gains that they probably got for Soul,
-
10:21
, obre el vídeo en una pestanya nova
they're just able to increase their
-
10:23
, obre el vídeo en una pestanya nova
margins that much more. Now, what may
-
10:26
, obre el vídeo en una pestanya nova
have caused them to focus so much on
-
10:28
, obre el vídeo en una pestanya nova
efficiency and dropping the price? Well,
-
10:32
, obre el vídeo en una pestanya nova
it's probably this Kimmy K3, the Chinese
-
10:36
, obre el vídeo en una pestanya nova
open source model that was just released
-
10:38
, obre el vídeo en una pestanya nova
that is extremely good, near the
-
10:40
, obre el vídeo en una pestanya nova
frontier, but it's also much less
-
10:42
, obre el vídeo en una pestanya nova
expensive. Now, keep in mind, Kimmy K3
-
10:45
, obre el vídeo en una pestanya nova
generally takes twice as many tokens to
-
10:46
, obre el vídeo en una pestanya nova
accomplish the same task and it's half
-
10:48
, obre el vídeo en una pestanya nova
the price. So, it's effectively the same
-
10:51
, obre el vídeo en una pestanya nova
price, but a lot of people look at the
-
10:53
, obre el vídeo en una pestanya nova
price per token and think, "Wow, that is
-
10:55
, obre el vídeo en una pestanya nova
cheaper." But the other thing is as more
-
10:58
, obre el vídeo en una pestanya nova
inference providers get their hands on
-
11:00
, obre el vídeo en una pestanya nova
Kimmy K3 and more researchers try to
-
11:04
, obre el vídeo en una pestanya nova
figure out how to get more efficiency
-
11:06
, obre el vídeo en una pestanya nova
out of it, more people will be looking
-
11:08
, obre el vídeo en una pestanya nova
at Kimmy K3 and other open- source
-
11:10
, obre el vídeo en una pestanya nova
models. And the rate at which they will
-
11:13
, obre el vídeo en una pestanya nova
discover new efficiency gains will be
-
11:15
, obre el vídeo en una pestanya nova
higher than what a small closed team can
-
11:18
, obre el vídeo en una pestanya nova
do. And so I think Open AAI is probably
-
11:21
, obre el vídeo en una pestanya nova
just trying to get ahead of that. But
-
11:23
, obre el vídeo en una pestanya nova
here's how crazy this price reduction
-
11:25
, obre el vídeo en una pestanya nova
is. Look at this. This is the cost per
-
11:28
, obre el vídeo en una pestanya nova
intelligence index task on artificial
-
11:31
, obre el vídeo en una pestanya nova
analysis. We have all the way at the top
-
11:33
, obre el vídeo en una pestanya nova
at $2.75. Claude Fable 5. Then here's
-
11:37
, obre el vídeo en una pestanya nova
GPT5.6
-
11:39
, obre el vídeo en una pestanya nova
6 Soul Max at $1.54, much less
-
11:42
, obre el vídeo en una pestanya nova
expensive. Kimmy K3 coming in at 72. And
-
11:46
, obre el vídeo en una pestanya nova
now here's GPT 5.6 Luna Max at 6.6
-
11:53
, obre el vídeo en una pestanya nova
as compared to all the way up here,
-
11:56
, obre el vídeo en una pestanya nova
$2.75. Now, obviously, Fable 5 is much
-
11:59
, obre el vídeo en una pestanya nova
more capable, but the price difference
-
12:01
, obre el vídeo en una pestanya nova
is astounding. And you can really see
-
12:03
, obre el vídeo en una pestanya nova
that in this graph. Here's GPT 5.6 6
-
12:06
, obre el vídeo en una pestanya nova
Luna Max coming in at 6 cents. Here's
-
12:09
, obre el vídeo en una pestanya nova
GLM 5.2 coming in at 26 cents. Gro 4.5
-
12:13
, obre el vídeo en una pestanya nova
coming in at 50 cents. And these are all
-
12:17
, obre el vídeo en una pestanya nova
basically the same intelligence. And you
-
12:20
, obre el vídeo en una pestanya nova
can just see 5.6 Luna is in a land of
-
12:22
, obre el vídeo en una pestanya nova
its own. And this green quadrant top and
-
12:25
, obre el vídeo en una pestanya nova
to the left is the best. So again,
-
12:28
, obre el vídeo en una pestanya nova
comparable to basically the same
-
12:31
, obre el vídeo en una pestanya nova
intelligence as Claud Sonnet 5 Max, but
-
12:34
, obre el vídeo en una pestanya nova
a fraction of the price. Claud Sonnet 5
-
12:37
, obre el vídeo en una pestanya nova
Max is $1.80
-
12:39
, obre el vídeo en una pestanya nova
per task completed versus 6 cents. Now,
-
12:42
, obre el vídeo en una pestanya nova
I want to speculate for a little bit.
-
12:45
, obre el vídeo en una pestanya nova
What I actually think might be happening
-
12:47
, obre el vídeo en una pestanya nova
is the two major closed source frontier
-
12:51
, obre el vídeo en una pestanya nova
labs, OpenAI and Anthropic, this is
-
12:54
, obre el vídeo en una pestanya nova
their playbook going forward. They train
-
12:56
, obre el vídeo en una pestanya nova
these massive models, really
-
12:59
, obre el vídeo en una pestanya nova
inefficient, massive, expensive to serve
-
13:02
, obre el vídeo en una pestanya nova
models. And then from that, they use it
-
13:05
, obre el vídeo en una pestanya nova
to bake almost as good, but far more
-
13:08
, obre el vídeo en una pestanya nova
efficient and far less expensive models
-
13:10
, obre el vídeo en una pestanya nova
for the rest of us to use. And yes, I
-
13:13
, obre el vídeo en una pestanya nova
said for the rest of us because I
-
13:15
, obre el vídeo en una pestanya nova
actually think there's a pretty good
-
13:17
, obre el vídeo en una pestanya nova
chance, especially for Anthropic, that
-
13:20
, obre el vídeo en una pestanya nova
they do not release their absolute
-
13:23
, obre el vídeo en una pestanya nova
frontier models like Fable publicly
-
13:26
, obre el vídeo en una pestanya nova
anymore, or at least they wait a very
-
13:29
, obre el vídeo en una pestanya nova
long time. We already know Anthropic had
-
13:31
, obre el vídeo en una pestanya nova
Fable all the way back in January,
-
13:34
, obre el vídeo en una pestanya nova
months before they released it publicly.
-
13:36
, obre el vídeo en una pestanya nova
And so I think this is actually a pretty
-
13:38
, obre el vídeo en una pestanya nova
strong strategy for these AI labs. Train
-
13:41
, obre el vídeo en una pestanya nova
the biggest best model you can. Then use
-
13:44
, obre el vídeo en una pestanya nova
that to train smaller versions of it.
-
13:47
, obre el vídeo en una pestanya nova
Highly capable but much less expensive.
-
13:50
, obre el vídeo en una pestanya nova
Make a ton of revenue for that. And then
-
13:53
, obre el vídeo en una pestanya nova
use that revenue to train your next big
-
13:55
, obre el vídeo en una pestanya nova
model. And at the same time that biggest
-
13:57
, obre el vídeo en una pestanya nova
model is training the next biggest model
-
14:01
, obre el vídeo en una pestanya nova
and nobody else has access to it. This
-
14:03
, obre el vídeo en una pestanya nova
might be recursive self-improvement.
-
14:05
, obre el vídeo en una pestanya nova
This might mean that anthropic and open
-
14:07
, obre el vídeo en una pestanya nova
AI cannot be caught. They already have
-
14:10
, obre el vídeo en una pestanya nova
too much momentum. They already have the
-
14:12
, obre el vídeo en una pestanya nova
best models training the next best
-
14:14
, obre el vídeo en una pestanya nova
model. They have all the compute and
-
14:17
, obre el vídeo en una pestanya nova
they have all the ingredients in the
-
14:18
, obre el vídeo en una pestanya nova
world. And that's why I'm such a big
-
14:20
, obre el vídeo en una pestanya nova
proponent of open source. I think
-
14:22
, obre el vídeo en una pestanya nova
open-source is the only thing putting
-
14:24
, obre el vídeo en una pestanya nova
competitive pressure on these two labs.
-
14:27
, obre el vídeo en una pestanya nova
And one last thing, having such a
-
14:29
, obre el vídeo en una pestanya nova
substantial price drop might change the
-
14:31
, obre el vídeo en una pestanya nova
math on which provider you go with,
-
14:34
, obre el vídeo en una pestanya nova
Anthropic or Open AAI. Who are you going
-
14:37
, obre el vídeo en una pestanya nova
to pay your subscription to? I actually
-
14:39
, obre el vídeo en una pestanya nova
made an entire video about this exact
-
14:41
, obre el vídeo en una pestanya nova
topic, so it can help you decide.