Agents d’IA RAG Open Knowledge Format OKF Google Cloud Markdown

Open Knowledge Format: una carpeta Markdown substitueix el RAG?

Google proposa OKF per representar coneixement en Markdown i YAML. Expliquem què resol, per què és portable i per què no elimina el RAG.

Open Knowledge Format (OKF) proposa representar coneixement com una carpeta de fitxers Markdown amb metadades YAML i enllaços. Google Cloud el presenta com un format obert, portable i independent del proveïdor perquè persones, agents, catàlegs i cercadors puguin produir i consumir els mateixos paquets.

El títol del vídeo diu que Google «ha trencat el RAG», però la conclusió és excessiva. OKF resol com empaquetar i intercanviar coneixement; no decideix com trobar el fragment pertinent, mantenir-lo al dia ni demostrar que és correcte. De fet, la documentació oficial inclou explícitament un índex de cerca entre els possibles consumidors.

1. El problema que intenta ordenar

A 00:40, CodeSimple descriu informació empresarial dispersa entre bases de dades, processos, peticions de canvi i memòria de persones. El RAG acostuma a dividir documents, crear representacions vectorials i recuperar fragments semblants quan arriba una pregunta.

Aquest patró és útil, però cada consulta pot obligar el model a reconstruir relacions que ja havia inferit. També hi ha costos d’indexació, infraestructura i supervisió. La resposta alternativa és mantenir una capa de coneixement duradora: pàgines sintetitzades i enllaçades que es poden revisar com codi.

No tots els RAG són iguals ni necessiten una base vectorial cara. Una cerca lèxica, jeràrquica o híbrida també pot recuperar fitxers. Per això la comparació «carpeta contra RAG» barreja emmagatzematge, curació i recuperació.

2. De l’LLM Wiki a l’especificació de Google

A 01:45, el vídeo relaciona OKF amb el patró LLM Wiki d’Andrej Karpathy. La idea és que el model llegeixi fonts, construeixi una wiki Markdown i actualitzi resums i referències en lloc de començar de zero a cada conversa.

Google Cloud formalitza una part d’aquesta intuïció. A 03:05, apareix OKF: un bundle és un directori i cada document representa un concepte. La ruta funciona com a identificador, els enllaços Markdown expressen relacions i el frontmatter conté camps estructurats.

La versió 0.1 exigia essencialment un camp type. La versió 0.2, publicada el juliol de 2026, afegeix senyals sobre fonts, credibilitat, generació, verificació, estat i caducitat.

3. Per què una carpeta és atractiva

El primer avantatge és la llegibilitat: una persona pot obrir el fitxer i un model el pot incorporar directament al context. El segon és Git: diferències línia per línia, historial, revisió i reversió funcionen sense una plataforma especial.

El tercer és la portabilitat. Un paquet es pot comprimir, muntar en un sistema de fitxers, publicar en un servidor estàtic o importar en una eina. YAML conserva els camps que interessa filtrar; Markdown permet prosa, esquemes i exemples.

A 04:25, el vídeo destaca els índexs jeràrquics. Un agent pot navegar de manera progressiva i carregar només la branca pertinent, en lloc d’introduir tota la biblioteca al context.

4. OKF no substitueix automàticament la recuperació

La pròpia especificació diu que un consumidor pot ser un LLM, una interfície, un graf o un índex de cerca. Si hi ha milers de documents, encara cal una política per escollir quins s’obren. Aquesta política pot ser navegació per índexs, paraules clau, graf, embeddings o una combinació.

OKF pot millorar el material que recupera un RAG: conceptes més nets, citacions, relacions i procedència. També pot servir sense vectors en corpus petits. Però no existeix una prova universal que «una carpeta supera una base vectorial» en precisió, latència i cost.

Format i recuperació són capes complementàries. El guany s’ha de mesurar amb preguntes representatives, respostes de referència i fallades conegudes.

5. Actualització, confiança i semàntica

A 05:45, CodeSimple identifica tres límits. Primer, una data no és un procés: algú o algun agent ha de detectar canvis, revalidar pàgines i resoldre contradiccions. Segon, un LLM pot trencar Markdown, inventar enllaços o degradar una síntesi.

Tercer, un camp de text lliure no crea una ontologia compartida. Dos equips poden usar noms diferents per al mateix tipus i complir igualment l’especificació. OKF facilita transportar la caixa, però acordar què significa el contingut continua essent governança.

La versió 0.2 respon parcialment amb procedència, verificació i stale_after. Són senyals perquè un consumidor decideixi en què confiar, no garanties que les fonts siguin bones o que la revisió s’hagi fet bé.

6. Quina relació té amb MCP i Google Cloud

El vídeo distingeix encertadament OKF d’MCP. Un protocol connecta models amb eines i recursos; OKF defineix una forma possible del coneixement que viatja o es consulta. Tampoc és una tècnica de SEO: els fitxers poden ser privats i pensats només per als agents interns.

Google acompanya l’especificació amb un agent de referència que llegeix metadades de BigQuery, rastreja documentació autoritzada i redacta conceptes amb cites, més un visualitzador HTML. Knowledge Catalog pot ingerir OKF, però el format no exigeix compte de Google, Gemini ni BigQuery.

Conclusions

OKF és menys revolucionari i més útil del que suggereix el titular. No elimina RAG ni bases vectorials; ofereix una superfície d’intercanvi simple perquè el coneixement curat no quedi atrapat en una plataforma. Markdown, YAML, Git i enllaços redueixen fricció i faciliten que humans i agents comparteixin artefactes.

El repte important es desplaça a la curació: qui actualitza, quina font preval, quan caduca una afirmació i com es prova una resposta. En un projecte petit, una carpeta pot ser suficient. En una organització gran, probablement serà el corpus sobre el qual encara treballaran cerques, índexs i controls de qualitat.

Contrast i context

Fonts consultades

4 fonts
  1. 01
  2. 02
  3. 03
    GoogleCloudPlatform · GitHub Open Knowledge Format
  4. 04
    Andrej Karpathy · GitHub Gist LLM Wiki

Font de treball

Transcripció amb marques de temps

14 fragments
Consulta la transcripció
  1. 0:00 , obre el vídeo en una pestanya nova

    Durante los últimos dos años, y le preguntaba a cualquier equipo de inteligencia artificial como darle memoria a un modelo, todos te daban la misma respuesta. Trose a tus documentos en miles de pedazos, convierte cada pedazo en un vector numérico y guarda lo todo en una base de datos especializada carísima de mantener. Esta primavera, alguien con muchísima credibilidad en el mundo de la Ia, rompió ese consenso con una frase casi ridícula de simple. Olvídate de la base de datos usa una carpeta de archivos de texto,

  2. 0:28 , obre el vídeo en una pestanya nova

    y para sorpresa de todos esa carpeta rindió mejor que el sistema sofisticado, ahora Google tomó esa idea informal, y la convirtió en una especificación con nombre oficial, Open Knowledge Format, WOKF, y media comunidad de desarrolladores está diciendo lo mismo. Es la idea más obvious que se les había pasado por alto durante todo este tiempo, porque existía la versión complicada.

  3. 0:50 , obre el vídeo en una pestanya nova

    El conocimiento de cualquier empresa vive disperso, La definición de un indicador está guardada en una base de datos. La lógica que la calcula está enterrada en un proceso automatizado, el motivo del último cambio que he doado en una solicitud de cambio de hace medio año, y una buena parte del conocimiento real, solo existe en la memoria de un ingeniero que ya no trabaja ahí, la respuesta técnica a ese chaos se llamó Rág,

  4. 1:14 , obre el vídeo en una pestanya nova

    recuperación aumentada por generación, dividez los documentos en fragmentos, los transformas envectores que representan su significado aproximado, Y los archivas en una base vectorial, cuando llega una pregunta el sistema busca los fragmentos más parecidos y se los entrega al modelo. Funciona, pero no acumula nada. Cada pregunta arranca de cero. El modelo recibe fragmentos sueltos y tiene que reconstruir otra vez, las mismas conexiones que ya había resuelto una hora antes. El proyecto que le dio la vuelta a todo, la persona detrás de la idea original fue Andrés Carpási, cofundador de OpenAI, y es responsable de inteligencia artificial en Tesla.

  5. 1:52 , obre el vídeo en una pestanya nova

    En abril subió a GitHub un proyecto pequeño bautizado como LLMWIKI, su propuesta invierte por completo la lógica del RAC. En vez de que el modelo reconstruya el conocimiento cada vez que alguien pregunta algo, ese conocimiento se construye una única vez dentro de una carpeta de textos planos en las a dos entre sí. Una inciclopé de arriba que el modelo recorre igual que un programador recorre un repositorio de código, y aquí está el detalle que casi todo el mundo entiende al revés. La carpeta no le escribe a tú, la escribe la IA. Tu solo aportas material nuevo y hace buenas preguntas, el modelo se encarga de resumir,

  6. 2:27 , obre el vídeo en una pestanya nova

    cruzar referencias y mantener al día una documentación que ningún equipo humano logras obtener por mucho tiempo. Carpási lo resumió así. Obsidian es el entorno de trabajo, el modelo es quien programa y el wiki es la base de código. La carpeta te pertenece a ti, quien la mantiene es la máquina. Google convierte la idea en Standard, el 12 de junio Google Cloud tomó ese concepto nacido en la comunidad y publicó su propia especificación formal, es una especificación mínima,

  7. 2:54 , obre el vídeo en una pestanya nova

    un bandel es simplemente una carpeta. Cada archivo dentro representa un concepto único, una tabla, un indicador, un procedimiento, cualquier unidad de conocimiento. La ruta del archivo funciona como su identificador. Los enlaces entre archivos arman un grafo, sólo hay dos nombres de archivos reservados, uno que lista el contenido de la carpeta y otro que registra el historial de cambios y sólo existe una regla realmente obligatoria, archivo debe declarar que tipo de elemento representa mediante un único campo. Además, la especificación exige que cualquier herramienta que lea un bandel sea tolerante hasta el extremo,

  8. 3:28 , obre el vídeo en una pestanya nova

    tiene que ignorar campos que no reconocen, aceptar en las errores y seguir funcionando aunque se tope con archivos que no sabe interpretar. Es un estandar corporativo cuya principal virtud es exigir casi nada. Se podría implementar en una tarde, eso sí, Google se quedó con la carpeta, pero descartó la parte más interesante de la propuesta original. Las instrucciones sobre cómo la Ia debía mantener ese Wiki con vida, tres motivos por los que funciona mejor. Primero, el momento en que ocurre el razonamiento, en Ragn el modelo piensa cuando llega la pregunta, en el Wiki es trabajo ya se hizo antes al construir la carpeta. Paga

  9. 4:04 , obre el vídeo en una pestanya nova

    el costo una sola vez y después solo le es el resultado. Segundo, la memoria limitada del modelo. Una empresa grande puede acumular miles de archivos. El indice pequeño que vive en cada la carpeta, le permite al modelo ubicar exactamente el archivo que necesita sin tener que cargar el resto. Tercero, todo este texto plano. Los archivos viven en control de versiones como cualquier proyecto de software. Se comparan, se revisan, se comprimen, se pueden mandar a un modelo funcionando sin conexión en una laptop. Nada de servidores ni claves de acceso. Si se sabe saber ir un archivo de texto, ya sabes usar el sistema completo. Dos aclaraciones

  10. 4:38 , obre el vídeo en una pestanya nova

    rápidas, esto no compite con mcp, que es el canal por donde viaja la información en tiempo real, ok, efe es apenas el contenido que va dentro de ese canal, y tampoco tiene relación con el posicionamiento en buscadores, no ayuda a que te encuentren en Google. Está pensado para guardar conocimiento privado que alimenta tus propios agentes. Las grietas del sistema, el primer problema es que la especificación no define ningún mecanismo para actualizar la información. Existe un campo de fecha, pero un campo no reemplaza un proceso real, cuando una sola persona cuida su propia carpeta, todo va bien.

  11. 5:10 , obre el vídeo en una pestanya nova

    En cuanto varios equipos comparten la misma documentación, el contenido empieza a quedarse viejo en cuestión de semanas. Nadie se hace cargo de renovarlo, y el agente termina contestando contatos que ya no son ciertos. El segundo problema es todavía más curioso. Toda la propuesta assume que la Ia será una bibliotecaria impecable. En la práctica, los modelos del lenguaje son bastante torpes escribiendo grandes volúmenes de mar da un limpio. Rompen encabezados, arruinan el formato e inventan en las esas y archivos que que jamás existieron. La respuesta de Google no fue a regular eso sino ordenar que cualquier

  12. 5:42 , obre el vídeo en una pestanya nova

    lector tolere esos errores. Eso no es una solución esa pena es contener el daño. El problema de fondo llega al final. El formato estandariza el empaque no el significado. El único campo obligatorio es una etiqueta de texto libre, un equipo puede escribir tabla de BigQuery, otro simplemente tabla y un tercero activo relacional. Los tres cumple en la especificación al pie de la letra y sin embargo ninguno habla el mismo idioma que los otros. Puede cambiar la caja a cualquier lado, ponerte de acuerdo sobre lo que haya dentro sigue siendo tarea tuya. El origen que Google preferiría no destacar, o que

  13. 6:15 , obre el vídeo en una pestanya nova

    y e fenózaleo del laboratorio de inteligencia artificial de Google, vino del equipo de BigQuery, los conjuntos de datos de ejemplo se distribuyen mediante BigQuery. La herramienta oficial para generar bandels con resobregemini y el lugar más cómodo para guardar esos bundels terminados resulta ser justamente el producto de gestión de conocimiento que la compañía acaba de de renombrar, en el mismo momento del lanzamiento, se quedará como estándar? Difícil saberlo todavía. El día de la numsio, casi nadie fuera de Google lo estaba usando, y un estándar con un solo usuario sigue siendo en el fondo una simple sugerencia. Bien podría terminar sumándose

  14. 6:50 , obre el vídeo en una pestanya nova

    a la larga lista de proyectos que Google abandonó con el tiempo, pero la idea que hay detrás ya ganó, la industria pasó dos años completos y gastó su más enorme de dinero convenciéndose de quedarle memoria a una máquina exigía infraestructura compleja. Al final una carpeta sencilla llena de archivos de texto lo hizo mejor. Páselo que pase con el formato oficial es alexión ya no se va a olvidar.