Productivitat Intel·ligència artificial HeyClicky Dictat per veu macOS Privadesa Assistents d’IA Veu a text

Dictat amb context de pantalla: HeyClicky vol escriure el correu, el prompt i l’anunci que encara no saps formular

HeyClicky presenta un dictat per a Mac que combina veu, captura de pantalla i memòria personal per redactar directament dins de Gmail, Claude Code, Google Slides o altres aplicacions. La idea és més potent que una simple transcripció, però obliga a entendre què s’envia al núvol i a quins proveïdors.

El dictat convencional resol una tasca molt concreta: l’usuari parla i l’ordinador converteix aquells sons en paraules. La funció que HeyClicky ensenya en aquest vídeo de dos minuts intenta anar un pas més enllà. L’aplicació mira què hi ha a la pantalla, escolta una instrucció informal i escriu al camp actiu una resposta que tingui sentit dins d’aquell context.

La diferència sembla petita, però canvia el tipus de feina. Ja no cal pronunciar el text final paraula per paraula. Es pot dir «respon aquest correu, dona-li les gràcies i pregunta-li per a què utilitza el producte» i deixar que el sistema redacti el missatge. O es pot demanar que interpreti un error tècnic de Claude Code i que escrigui un bon prompt de continuació al terminal.

La idea central és aquesta: el dictat deixa de ser una còpia de la veu i es converteix en una capa d’intenció entre la persona i qualsevol aplicació del Mac.

Com funciona la demostració

El creador comença amb el mode més tradicional. Manté premudes les tecles Fn i Control, parla i les paraules apareixen en temps real al quadre de text on té el cursor. A Apple Notes, per exemple, enumera tres tasques que ha de lliurar.

Ell mateix admet que molts productes ja fan això. La novetat arriba quan l’usuari no sap exactament què vol escriure. En comptes de dictar una frase acabada, formula una petició sobre el contingut que veu. HeyClicky combina tres elements:

  • la veu, que expressa l’objectiu;
  • la pantalla, que aporta el document, correu o conversa actual;
  • la memòria del producte, que intenta conservar l’estil i les preferències de l’usuari.

El resultat s’insereix directament al camp actiu. No cal copiar una resposta des d’un xat separat, canviar de finestra ni tornar a explicar tot el context.

Exemple 1: respondre un correu sense redactar-lo

La primera demostració contextual té lloc a Gmail. A la pantalla hi ha un correu i el creador no sap ben bé com contestar-lo. Demana a HeyClicky que agraeixi el missatge i pregunti pels casos d’ús del producte.

Uns segons després apareix una resposta completa al quadre de Gmail. Segons el vídeo, el text intenta sonar com l’usuari gràcies als records que l’assistent conserva sobre ell.

Aquest flux elimina diverses petites friccions: seleccionar el correu, copiar-lo a un model, redactar un prompt, revisar la resposta i enganxar-la de nou. El valor no és només estalviar pulsacions; és evitar el canvi mental entre l’aplicació on es treballa i una interfície de xat.

Però «en la meva veu» és una promesa que s’ha de comprovar. Una demostració no ensenya com respon el sistema davant d’un client enfadat, una dada confidencial o una conversa amb matisos. Abans d’enviar res, continua sent necessari revisar destinataris, fets, to i compromisos adquirits.

Exemple 2: convertir una confusió tècnica en un prompt

La segona escena és més interessant perquè no demana un text social. El creador té Claude Code obert i afirma que no entén l’explicació tècnica que apareix al terminal. Demana a HeyClicky dues coses: que escrigui un prompt de continuació adequat i que li expliqui el problema perquè pugui aprendre.

L’assistent interpreta el contingut visible i insereix la pregunta següent. En la demostració, Claude havia indicat que el pas següent era construir l’aplicació amb Xcode.

Aquí el context visual fa de pont entre una persona no tècnica i una eina especialitzada. En lloc d’haver de descriure l’error o pronunciar símbols de codi, l’usuari pot assenyalar-lo indirectament amb «això que hi ha aquí».

El risc és que una resposta plausible no sigui necessàriament correcta. En desenvolupament, un prompt mal plantejat pot modificar fitxers, executar ordres o orientar el projecte en una direcció equivocada. Cal llegir el text abans d’executar-lo i mantenir confirmacions per a accions amb efectes reals.

Exemple 3: una diapositiva pensada per a Y Combinator

HeyClicky també incorpora el concepte d’«habilitats». El vídeo activa una habilitat de Y Combinator i demana que transformi la frase principal d’un pitch deck en una obertura que pugui agradar a l’acceleradora. El text s’escriu a Google Slides.

La combinació d’habilitat, pantalla i veu permet afegir una pauta especialitzada sense incloure-la cada vegada al prompt. És semblant a aplicar una plantilla editorial sobre el material obert.

No hi ha, però, una fórmula garantida per convèncer un inversor. Una habilitat pot recordar bones pràctiques —claredat, concreció, problema i client—, però no valida el mercat, la tracció ni les xifres del projecte. L’usuari ha de vigilar que el text no exageri allò que l’empresa encara no ha demostrat.

Altres usos que mostra HeyClicky

Al final, el vídeo enumera alguns comportaments observats entre els usuaris:

  • redactar anuncis a Google Ads;
  • millorar un currículum;
  • contestar missatges de Slack o LinkedIn;
  • reformular presentacions;
  • preparar indicacions per a eines de programació.

Tots comparteixen el mateix patró: la informació necessària ja és a la pantalla, però l’usuari necessita convertir-la en una resposta, una síntesi o una instrucció.

La funció està disponible en producció en el moment del vídeo. El mateix creador avisa que encara té errors i que l’equip la millora diàriament. Aquesta advertència és important: el vídeo és una presentació del fabricant, no una prova independent de precisió, latència o compatibilitat.

En què es diferencia del dictat del Mac

macOS ja permet introduir text parlant allà on es pot escriure. Apple també ofereix Control per Veu per navegar, prémer botons i editar text. En configuracions compatibles, part del dictat general es pot processar al dispositiu.

HeyClicky no competeix només en reconeixement de veu. El seu avantatge proposat és interpretar la pantalla i generar un text nou. Si l’usuari diu exactament la frase que vol escriure, el dictat del sistema pot ser suficient i ofereix una superfície de dades més limitada. Si l’usuari vol que el programari entengui un correu, adapti el to o proposi el següent prompt, necessita un model generatiu i el context corresponent.

La tria, per tant, no és només «quin transcriu més ràpid». És si la tasca requereix transformar informació o simplement passar-la de veu a text.

El punt delicat: què surt de l’ordinador

La pàgina principal de HeyClicky diu que només mira la pantalla quan l’usuari prem la drecera i que les captures no s’emmagatzemen. També explica que conserva resums de text bàsics per mantenir context i que el compte i les dades es poden suprimir.

La política de privadesa concreta més el recorregut. L’aplicació captura localment la pantalla i la veu després de l’acció de prémer per parlar, però envia aquestes dades al servidor intermediari de HeyClicky. Des d’allà, captures, transcripcions i prompts poden ser transmesos a proveïdors d’IA de tercers, entre els quals la política cita Anthropic, OpenAI, Deepgram i Cerebras.

Això no significa que el producte observi contínuament l’escriptori ni que vengui les dades; la companyia afirma el contrari. Sí que significa que «la captura no es desa» no és equivalent a «la captura no surt del Mac». Per produir la resposta, el contingut es processa en infraestructura externa.

La diferència importa quan a la pantalla hi ha:

  • dades personals de clients;
  • informació sanitària, jurídica o financera;
  • contrasenyes, claus d’API o codis de recuperació;
  • repositoris privats;
  • contractes i documents interns;
  • converses de terceres persones que no esperen aquesta transmissió.

Permisos i bones pràctiques

Apple permet controlar quines aplicacions poden enregistrar la pantalla i l’àudio del sistema des de Privadesa i Seguretat. La mateixa documentació d’Apple recorda que, quan es dona accés a una aplicació de tercers, la informació queda sotmesa als termes i a la política d’aquell proveïdor.

Per utilitzar una eina d’aquest tipus amb criteri convé:

  1. limitar el permís de pantalla a l’aplicació concreta;
  2. evitar activar-la davant de secrets o dades de tercers;
  3. comprovar la captura o el context que s’enviarà, si la interfície ho permet;
  4. revisar cada text abans d’enviar-lo o executar-lo;
  5. desactivar el permís quan ja no es necessita;
  6. consultar les polítiques internes abans d’utilitzar-la en una empresa;
  7. comprovar periòdicament quines memòries o resums conserva el compte.

Una drecera conscient —mantenir tecles premudes— és millor que una observació permanent, però no elimina el risc d’activar-la a la finestra equivocada.

Què falta saber després del vídeo

La demostració no aporta mesures comparables de la latència anunciada, taxa d’errors, idiomes compatibles ni comportament amb pantalles complexes. Tampoc mostra què passa quan hi ha diverses finestres, text parcialment ocult, informació contradictòria o una instrucció ambigua.

Abans d’adoptar-la per treball recurrent seria útil provar:

  • noms catalans, castellans i tècnics;
  • correus llargs amb diversos interlocutors;
  • terminals amb secrets visibles;
  • correccions i desfer canvis;
  • aplicacions que no siguin les de la demostració;
  • textos que exigeixin cites o exactitud numèrica;
  • la supressió efectiva de la memòria del compte.

També cal separar velocitat de qualitat. Escriure una resposta en cinc segons només és un guany si la revisió no obliga a refer-la sencera.

Valoració final

El dictat amb context de pantalla és una evolució lògica de la veu a text. Resol un problema real: sovint sabem què volem aconseguir, però no tenim formulada la frase exacta. En aquest espai entre la intenció i el text, veure l’aplicació actual pot ser molt més útil que un xat buit.

HeyClicky ho exemplifica bé amb Gmail, Claude Code i Google Slides. La funció pot reduir canvis de finestra i fer accessibles fluxos tècnics a més persones. Alhora, la mateixa capacitat que la fa útil —veure allò que l’usuari veu— és la que exigeix més prudència.

El millor ús no és deixar que l’assistent enviï o executi sense supervisió. És tractar-lo com un primer redactor situat dins del flux de treball: rep context quan se li dona permís, proposa el text i retorna el control a la persona. Si aquesta última revisió es manté i l’usuari entén on viatgen les dades, el salt respecte del dictat tradicional és considerable.

Contrast i context

Fonts consultades

5 fonts
  1. 01
  2. 02
  3. 03
  4. 04
  5. 05

Font de treball

Transcripció amb marques de temps

4 fragments
Consulta la transcripció
  1. 0:00 , obre el vídeo en una pestanya nova

    Hey, so today we're adding dictation to a clicky. All you gotta do is press and hold FN plus control, start talking, and whatever you're saying will stream in as text into whatever text box your cursor is on. For example, if I'm an Apple Notes, I can just say today I have to ship three things. First, skills, second memory, and third, this bug that this one user gave about dictation. So that's pretty cool and honestly many products already do this exact thing today, but here's the thing when I'm writing I often don't really know what I even want to say So check this out. We're shipping screen a wear dictation. It's pretty cool I'm interested in anything like you before and I want to show you let's say I want to write a reply to this email, but I'm not quite sure what I want to say I can just say

  2. 0:30 , obre el vídeo en una pestanya nova

    Hey, clicky. Type a reply to this email and say something like, thanks, appreciate you and asking what his use cases are for the product. And this would take like five seconds, but it'll actually generate a reply directly in my text box in Gmail. I paste it to your reply. And it'll be in my voice based on Hey, clicky's memories of me. This is magical because one, we're using the context of the actual screen to write the reply. And two, it's as if I can write.

  3. 1:00 , obre el vídeo en una pestanya nova

    while having a conversation. Even if I don't know what I want to say, hey, click the I'm not technical and I have no idea what Claude is talking about here. Can you type a follow-up prompt in the terminal and also explain it to me so I can learn? I've pasted in a good follow-up prompt. Claude said the next step is to build the app in Xcode and this whole screen dictation feature gets so much more powerful with skills. You can activate a skill like our Y-Combinator skill directly in the product and then you can say, hey, clicky, this is the one line up from my pitch deck. Type something good that Y-C would appreciate as the first opener slide on my Google slides here. And it'll just do it.

  4. 1:30 , obre el vídeo en una pestanya nova

    We've been seeing our users use screen-aware dictation for tons of different things. People using it in Google ads to help them write better ad copy, people getting help on writing their resume, and lots of people just using it to reply to messages on Slack, LinkedIn, stuff like that. So that's it. This is in production right now. It's a little bit buggy, but we're making a better every single day. Let's know what you think, and enjoy.