GPT-Realtime-2, Translate i Whisper: els nous models de veu d’OpenAI explicats
Dot CSV prova GPT-Realtime-Translate i el mode de veu estàndard de ChatGPT. Repassem què ofereixen realment GPT-Realtime-2, Translate i Whisper, i què ha canviat des del vídeo.
OpenAI va presentar el 7 de maig de 2026 tres models d’àudio per a desenvolupadors: GPT-Realtime-2, GPT-Realtime-Translate i GPT-Realtime-Whisper. Dot CSV Lab els prova i després ensenya una manera d’obtenir més capacitat de raonament al mode de veu estàndard de ChatGPT. Són dues novetats relacionades, però no són el mateix producte.
Els tres models nous s’utilitzen mitjançant la Realtime API i serveixen per construir aplicacions. El «truc» del vídeo, en canvi, canvia la configuració de Voice dins de ChatGPT i aprofita un flux per torns: primer transcriu la veu, després respon un model de text i finalment sintetitza l’àudio. A més, el panorama ha canviat des de l’enregistrament: el juliol de 2026 OpenAI va començar a desplegar GPT-Live-1 com a nova experiència Voice.
Tres models, tres tasques diferents
GPT-Realtime-2 és el model conversacional. OpenAI el descriu com el seu primer model de veu amb raonament de classe GPT-5, pensat per gestionar peticions difícils, mantenir context, cridar eines i continuar una conversa amb baixa latència. «Classe GPT-5» no identifica necessàriament un model de text concret ni permet equiparar-lo automàticament a GPT-5.5.
GPT-Realtime-Translate està especialitzat en traducció oral en directe. Admet més de setanta idiomes d’entrada i tretze de sortida, i retorna àudio traduït i fragments de transcripció mentre encara rep la veu original.
GPT-Realtime-Whisper és un sistema de reconeixement de veu en streaming. Transcriu mentre la persona parla i està orientat a subtítols, actes de reunions, assistència, classes i agents que necessiten interpretar àudio continu.
Separar les funcions permet escollir el cost i el comportament adequats. Una aplicació de subtítols no necessita generar veu; un intèrpret pot prioritzar la traducció; un agent de suport necessita raonar i utilitzar eines.
La demostració de traducció en francès i japonès
Dot CSV construeix una interfície senzilla a partir del material per a desenvolupadors d’OpenAI. Selecciona un idioma de destí, activa el micròfon i parla en castellà. La pantalla va mostrant text mentre se sent una versió francesa; després repeteix l’exercici en japonès.
El creador explica el flux com una cadena de tres passos: transcripció, traducció i síntesi. El model oficial Translate està dissenyat perquè aquesta experiència sigui contínua i retorni veu i deltes de text abans que acabi tota la intervenció. Això redueix la sensació d’esperar una traducció completa.
Una demo favorable no mesura tots els casos. Accents, soroll, noms propis, solapament de veus i terminologia especialitzada poden alterar el resultat. OpenAI anuncia idiomes compatibles, però una aplicació real encara necessita proves amb les llengües, micròfons i dominis dels seus usuaris.
Què aporta GPT-Realtime-2 al model de veu
El llançament no es limita a fer que la veu soni més natural. GPT-Realtime-2 amplia el context de 32.000 a 128.000 tokens, permet ajustar l’esforç de raonament i millora l’ús d’eines. Pot fer crides en paral·lel i verbalitzar frases breus com «deixa’m comprovar-ho» mentre treballa, de manera que l’agent no queda en silenci.
OpenAI també destaca la recuperació davant d’errors, la comprensió de vocabulari especialitzat i el control del to. Són qualitats importants en suport al client: no basta donar una resposta correcta si el sistema perd una correcció, pronuncia malament un codi o talla la conversa en cridar una API.
Dot CSV interpreta l’actualització com el salt d’un assistent de conversa a una interfície capaç d’actuar. Aquesta és també la direcció de l’anunci oficial: veu per consultar context, utilitzar eines i completar tasques, no només per intercanviar frases.
El «truc» del vídeo utilitza Voice Standard
Al maig, el creador entra a la configuració de veu de l’aplicació mòbil i selecciona intel·ligència estàndard en lloc de l’experiència avançada. Després obre una conversa amb GPT-5.5 Instant seleccionat. La interfície antiga respon amb una pausa més perceptible, però hereta més capacitats del xat de text i, a la demostració, consulta Calendar i Gmail autoritzats.
El mecanisme sacrifica immediatesa. En Voice Standard, l’àudio es transcriu abans que ChatGPT generi la resposta; no és una conversa àudio-a-àudio nativa com la Realtime API. El benefici és que el torn passa pel model i el context configurats al xat.
També cal evitar una falsa prova que apareix al vídeo: preguntar al model quin model és o deduir-lo només pel tall de coneixement. Una resposta correcta sobre un esdeveniment no certifica l’encaminament intern; pot procedir de context, memòria, eines o simplement d’una autodescripció equivocada. La interfície i la documentació del compte són fonts més fiables.
El test del rentat de cotxes mostra la diferència
Dot CSV fa una pregunta deliberadament senzilla: si el cotxe és brut i el rentat és a cinc minuts, cal anar-hi caminant o conduint? Una primera resposta diu clarament que s’ha de portar el cotxe. Una altra versió divaga sobre caminar, estalviar combustible i tornar-lo a buscar.
L’exemple no és un benchmark, però il·lustra què busca el creador: menys ornament i més comprensió de l’objectiu implícit. En veu, una resposta llarga sembla encara més lenta que en text perquè no es pot escanejar amb la vista. La qualitat inclou saber contestar breument quan el problema és trivial.
Quan torna al mode estàndard, el vídeo mostra consultes a un calendari i a correus connectats. Aquestes accions depenen dels permisos, del pla, de la regió i de les integracions disponibles; no s’han d’assumir per a tots els comptes ni per a tots els modes de veu.
Actualització: ChatGPT Voice ja ha canviat
La guia actual d’OpenAI diferencia Live, Advanced i Standard. Live és la nova experiència desplegada el 8 de juliol de 2026, amb GPT-Live-1 als plans de pagament i GPT-Live-1 mini al gratuït. Pot escoltar i parlar alhora, utilitzar cerca web i memòria, mostrar resultats visuals i combinar text i imatges dins del mateix xat.
Advanced conserva l’experiència anterior i algunes funcions mòbils com vídeo o pantalla compartida. Standard continua sent el mode per torns que transcriu abans de generar la resposta. Les opcions visibles varien segons pla, regió, versió i configuració de l’espai de treball.
Aquesta actualització fa que els passos exactes del vídeo ja no siguin una recepta universal. La idea continua sent útil —triar entre naturalitat en temps real i un flux transcrit amb més context—, però els noms i models disponibles han evolucionat.
API i ChatGPT no s’han de confondre
GPT-Realtime-2, Translate i Whisper són peces perquè un desenvolupador creï el seu propi producte. Ha de gestionar sessions, permisos, eines, seguretat, privadesa i indicació clara que l’usuari parla amb una IA. ChatGPT Voice és una aplicació acabada, amb una selecció de funcions i límits que OpenAI pot actualitzar independentment.
El vídeo encerta a assenyalar el potencial: interpretació oral, transcripció immediata, consultes a eines i assistents capaços d’actuar sense teclat. La lectura correcta, però, no és que un botó secret converteixi qualsevol Voice en GPT-Realtime-2. El llançament important és una família nova per a l’API; el «truc» és una ruta diferent dins de ChatGPT, i la nova generació Live ja n’ha tornat a moure la frontera.
Contrast i context
Fonts consultades
- 01
- 02
-
03
OpenAI Developers GPT-Realtime-Translate model
-
04
OpenAI Help Center ChatGPT Voice
-
05
OpenAI Help Center ChatGPT release notes
Font de treball
Transcripció amb marques de temps
Consulta la transcripció
-
0:00
, obre el vídeo en una pestanya nova
OpenAI presenta tres modelos de voz para la API: GPT-Realtime-Whisper para transcripción en directo, GPT-Realtime-Translate para traducción de voz y GPT-Realtime-2 para conversación con razonamiento de clase GPT-5. El creador distingue este lanzamiento para desarrolladores del modo Voice de ChatGPT.
-
1:45
, obre el vídeo en una pestanya nova
La demostración oficial combina transcripción, traducción y voz sintetizada. Dot CSV monta una interfaz a partir del ejemplo para desarrolladores, selecciona francés como idioma de destino y habla en castellano mientras la aplicación produce una traducción oral.
-
3:30
, obre el vídeo en una pestanya nova
La prueba se repite en japonés. La transcripción aparece palabra a palabra y la traducción se genera en directo. Tras presentar Whisper y Translate, el vídeo se centra en GPT-Realtime-2, descrito oficialmente como un modelo de voz con razonamiento de clase GPT-5.
-
5:15
, obre el vídeo en una pestanya nova
El creador quiere una voz capaz de resolver peticiones más difíciles y mantener una conversación natural. Primero prueba el modo avanzado que tenía disponible en ChatGPT: el asistente dice que no accede al calendario y afirma tener un corte de conocimiento de junio de 2024.
-
7:00
, obre el vídeo en una pestanya nova
La voz avanzada no responde sin búsqueda a una pregunta sobre las elecciones de 2024 y se identifica como GPT-4o. El vídeo propone cambiar en la aplicación móvil a inteligencia estándar y seleccionar GPT-5.5 Instant en la conversación para usar el flujo de voz antiguo.
-
8:45
, obre el vídeo en una pestanya nova
El modo estándar muestra una interfaz en blanco y negro y tarda más antes de hablar. El asistente se identifica como GPT-5.5, aunque reconoce que no puede demostrar criptográficamente el modelo interno. El creador busca indicios indirectos en el comportamiento y el conocimiento.
-
10:30
, obre el vídeo en una pestanya nova
La voz contesta quién ganó las elecciones de 2024 y resuelve que, para lavar un coche, hay que llevarlo conduciendo aunque el lavadero esté cerca. La demostración compara esa respuesta directa con otra que mezcla caminar, ahorrar combustible y distintos tipos de lavado.
-
12:15
, obre el vídeo en una pestanya nova
Dot CSV considera menos coherente la respuesta que divaga. Vuelve al modo estándar con el modelo seleccionado y muestra el acceso autorizado a contexto conectado: pide los eventos de una semana de mayo y después consulta correos que parecen importantes.
-
14:00
, obre el vídeo en una pestanya nova
El creador valora la combinación de inteligencia, herramientas y voz, aunque sigue prefiriendo la naturalidad de una demo de Sesame. Imagina una voz más expresiva junto con un modelo avanzado y capacidades de agente, y espera una actualización integrada de ChatGPT.
-
15:45
, obre el vídeo en una pestanya nova
La conclusión mira hacia interfaces de voz que traduzcan, consulten repositorios, utilicen aplicaciones y naveguen con órdenes habladas. El autor pide cautela con el entusiasmo, pero interpreta los modelos de la API como un avance importante y anticipa más novedades de Voice.