Intel·ligència artificial RAG LLM AI Engineering Chip Huyen arquitectura de programari

«AI Engineering»: com construir sistemes d’IA que funcionin

Resum d’AI Engineering, de Chip Huyen: avaluació, seguretat, RAG, ajust fi, encaminament de models, memòria cau i agents en producció.

AI Engineering, de Chip Huyen, no és un manual per aprendre a conversar amb un xatbot ni una guia per programar més ràpid amb un assistent. És un llibre sobre com construir productes que incorporen models fundacionals i portar-los a producció amb criteris de qualitat, seguretat, cost i latència. BettaTech en resumeix la tesi: fer una crida a una API és fàcil; convertir-la en un sistema fiable és feina d’enginyeria.

El llibre, publicat per O’Reilly i orientat a un nivell intermedi o avançat, recorre avaluació, selecció de models, enginyeria de prompts, RAG, ajust fi, memòria cau, encaminament i agents. El vídeo n’extreu una arquitectura progressiva i una regla que travessa tots els capítols: abans de millorar una aplicació d’IA cal definir què significa que funcioni bé.

1. Enginyeria d’IA no és entrenar un model

A 00:00, BettaTech delimita el públic del llibre. No explica com crear una skill, dominar Codex o automatitzar l’entorn personal. Estudia productes com un xat d’atenció, un cercador intern o un agent que executa accions dins d’un sistema.

Chip Huyen diferencia l’enginyeria d’aprenentatge automàtic, que pot incloure desenvolupar i entrenar models, de l’enginyeria d’IA, que construeix aplicacions sobre models fundacionals existents. La primera pregunta no és quin model comprar, sinó quin problema de negoci es vol resoldre i si la IA aporta prou valor per compensar-ne els riscos.

Els models són probabilístics: poden donar respostes diferents a la mateixa entrada i produir errors plausibles. Això no és una incidència excepcional que desaparegui amb un prompt més llarg; és una propietat que l’arquitectura ha de gestionar.

2. Avaluar abans d’optimitzar

A 05:14, el resum entra en el nucli del llibre: l’avaluació. Huyen proposa examinar tots els components, crear una guia amb criteris explícits i escollir mètodes i dades adequats per puntuar-los.

Si una aplicació extreu un currículum i després identifica l’ocupador actual, cal provar tant l’extracció com la inferència final. Mirar només la resposta completa amaga on s’ha produït l’error. És l’equivalent a combinar proves unitàries, integració i recorreguts d’extrem a extrem.

Els criteris poden incloure rellevància, correcció factual, cites, seguretat, format i cost. Una rúbrica amb exemples ajuda a convertir paraules ambigües en decisions repetibles. Un model pot actuar com a jutge, però el llibre també contempla funcions deterministes i revisió humana: cap mètode serveix igual per a tots els criteris.

3. Enginyeria de prompts i defenses

A 09:06, el vídeo separa l’enginyeria de prompts de les fórmules virals del tipus «actua com un expert». En producció, el repte és aconseguir instruccions consistents, sortides estructurades i una frontera clara entre dades, ordres del sistema i contingut de l’usuari.

La injecció de prompts pot fer que una aplicació abandoni la seva funció, reveli instruccions o intenti accedir a informació inadequada. Les defenses inclouen limitar eines i permisos, validar entrades i sortides, ocultar secrets, registrar traçabilitat i sotmetre les accions sensibles a aprovació. Un filtre textual per si sol no constitueix una barrera completa.

4. RAG: recuperar bé abans de respondre

A 12:00, BettaTech explica la generació augmentada amb recuperació. El sistema busca documents rellevants i els aporta al model perquè construeixi la resposta sobre informació seleccionada. La qualitat depèn tant del generador com del mecanisme de cerca.

La coincidència de paraules és útil, però confon significats diferents. Els embeddings representen fragments com vectors i permeten cercar proximitat semàntica, sovint mitjançant veïns més propers. Encara així, una base vectorial no garanteix la veritat: documents antics, fragments mal tallats o una consulta deficient produeixen un context deficient.

A 17:37, apareix el compromís entre precisió i cobertura. Recuperar més documents pot reduir omissions però afegir soroll; recuperar-ne pocs pot ser net però deixar fora una font decisiva. La prioritat depèn del cost de cada tipus d’error.

5. Quan ajustar el model i quan millorar el context

El llibre distingeix RAG d’ajust fi. RAG és adequat quan cal aportar coneixement actualitzable i citar documents. L’ajust fi modifica el comportament del model i pot ajudar amb estils, formats o tasques molt específiques. No és una manera segura d’injectar fets que canviaran sovint.

A 19:31, el vídeo també tracta la inferència. Reutilitzar prefixos o contextos amb memòria cau pot reduir cost i latència quan moltes consultes comparteixen instruccions i documents. La mètrica pertinent no és només el preu per token, sinó el cost per tasca resolta i el temps que espera l’usuari.

6. Les cinc etapes d’una arquitectura de producció

A 21:50, BettaTech reconstrueix la progressió final. La base és una crida directa al model. La primera ampliació és enriquir el context, per exemple amb RAG. La segona introdueix baranes de seguretat a l’entrada i la sortida.

La tercera afegeix una passarel·la de models: una consulta simple pot anar a un model ràpid i econòmic, mentre una tasca multimodal difícil rep més capacitat. La quarta incorpora memòries cau en la recuperació o la generació. La cinquena dona capacitat d’actuar mitjançant eines.

No totes les aplicacions necessiten arribar al cinquè nivell. Cada capa aporta control, però també més punts de fallada, observabilitat i manteniment. L’arquitectura correcta és la mínima que compleix els requisits mesurats.

Conclusions

El principal mèrit d’AI Engineering és convertir un conjunt de tècniques de moda en un procés d’enginyeria. Comença pel cas d’ús, assumeix que el model s’equivocarà, divideix el sistema en components avaluables i només després introdueix RAG, encaminament, memòria cau o agents.

Per a un desenvolupador, el missatge pràctic és exigent però útil: una demostració que respon bé no és encara un producte. Cal un conjunt d’avaluació propi, dades governades, permisos mínims, límits de cost, mètriques de latència i supervisió dels efectes reals. El llibre no promet eliminar aquesta feina; explica com fer-la visible i sistemàtica.

Contrast i context

Fonts consultades

3 fonts
  1. 01
  2. 02
  3. 03

Font de treball

Transcripció amb marques de temps

15 fragments
Consulta la transcripció
  1. 0:00 , obre el vídeo en una pestanya nova

    Hay muchísimo contenido que te enseña a utilizar la inteligencia artificial para programar más rápido, pero este libro va de algo muy distinto, va de cómo construir sistemas que incorporan inteligencia artificial en el producto. Bienvenido a la serie del Club de lectura con BetaTech, una serie de libros en las que analizamos libros técnicos y resumimos sus ideas principales. Y en este vídeo vamos a analizar ella y en genirín de chip huyen, tal como pediste sin Instagram prácticamente la mitad de vosotros. Y vamos a ver, los conceptos clave que se comparten en este libro para construir sistemas que usan laía de una manera robusta, eficiente y segura. Y al final, compartiré mi parte favorita de este libro, un arquitectura paso a paso de un sistema completo con ella. Empezamos. Y quiere insistir en el que el foco de este libro no es desarrollar con inteligencia artificial. No es un libro para aprender a utilizar CloudCode. No es un libro para aprender a utilizar Codex. No es un libro para hacerte más productivo con herramientas de ella para desarrolladores. Es un libro para incorporar y a en productos de software. Por ejemplo, si quieres desarrollar un chatbot para tu arquitectura para tu producto, quieres que los usuarios pueden hacer preguntas, quieres, por ejemplo, construir un sistema de agentes automático que realiza ciertas acciones. cuando ocurre algo en tu sistema, es telíbro, te enseñas técnicas y arquitecturas para ello. Pero no te va a enseñar a construir skills, a desarrollar MCPs, ni a cómo optimizar tu entorno de trabajo para el uso con inteligencia artificial. Quiero dejar claras esta diferencia, porque si vas buscando herramientas y productividad, en este libro, no es lo que vas a encontrar. Entonces, gran parte de lo que explica este libro es todo el ecosistema que hay alrededor de utilizar modelos de inteligencia artificial para realizar ciertas tareas o desarrollar ciertas características.

  2. 1:49 , obre el vídeo en una pestanya nova

    Y quizá tú, cuando escuches esto, piensas, vale, pero ya tenemos a piz de antropi, que tenemos a piz de openai, contra las que podemos hacer llamadas y incorporar cosas de ían en nuestro sistema. Pero eso sería la arquitectura más básica. Hay un montón de elementos, un montón de técnicas, un montón de patrones, que va bien conocer si queremos hacer cositas un poquito más avanzadas. Y no solamente eso, sino que además tenemos que valorar, si realmente merece la pena o no incorporaría. Me gusta mucho el inicio de este libro porque dice lo siguiente. La primera cosa que nos tenemos que preguntar es que queremos construir. Como toda decisión de negocio, construir una aplicación de IA nos va a meter responde a riesgos u oportunidades. Ya partirle aquí, pues en el libro tenemos definidos una serie de posibles riesgos o posible es casos de uso que pueden ser interesantes para ser solucionados con inteligencia artificial. Entre ellos, por ejemplo, tenemos que los competidores y hasta notilizando ella, y si no lo hacemos nosotros, nos vamos a quedar obsoletos. O también que le hecho de incorporar y a en esta parte del proceso del sistema, nos va a ofrecer un gran bus de productividad o mayor beneficio. prácticamente las primeras 50 páginas de este libro están enfocadas en eso. en saber analizar y decidir cuando tiene sentido no utilizar la IA y donde le podemos sacar mayor provecho. También es un libro que enseña algunos de los fundamentos sobre que son los modelos de IA. Pero no se trata de un libro de Machine Learning. De hecho, chip huyen deja la diferencia bastante clara, dice textualmente que la ingeniería de Machine Learning implica desarrollar modelos de Machine Learning. La ingeniería de IA utiliza esos modelos que ya existe. Estos modelos que podemos ver los como las LLM o los grandes modelos multimodales es lo que durante el libro Chip llama modelos fundacionales. Es decir, modelos ya entrenados como podrían ser opus, sonet, GT, algunos de ellos con un modelo específico para ciertas modalidades otros multimodales que nosotros, como ingenieros, podemos aprovechar en nuestros sistemas para construir algo. Y deja claro, una de las principales limitaciones que tiene el uso de ella en sistema de software,

  3. 4:01 , obre el vídeo en una pestanya nova

    que es su naturalesa probabilística. Los modelos de inteligencia artificial no dejan de ser modelos estadísticos, no tienen por que darte la solución correcta siempre. Ni siquiera tienen por que darte la misma solución, se le hace la misma pregunta. En el libro se dice que, la forma en la que los modelos de ellas seleccionan las respuestas, los hacen probabilísticos. y esta naturaleza probabilística puede causar incoticicencias y alucinaciones. Esto no es que el modelo sea erróneo que funciona mal, es parte de la naturaleza de la arquitectura de los modelos de inteligencia artificial. Y es por ello que gran parte de este libro explica la importancia de tener buenos métodos de evaluación. Cuando nosotros incorporamos un sistema probabilístico dentro de un sistema que queremos que sea capaz de responder dudas o de realizar incluso acciones por nosotros, queremos poder evaluar que también lo hace, queremos ponerle algún tipo de métrica, algún número para nosotros saber si estamos mejorando, o estamos empeorando, con las diferentes técnicas que nosotros podemos aplicar. Porque, al final, como en todo, para poder construir algo que funcione bien, primero necesitamos definir y evaluar qué significa bien. Es decir, como sabemos que si tenemos un sistema de IA, de un chat pod para soporte de usuarios, le estamos dando las respuestas correctas a los usuarios. Si no disponemos de un sistema de evaluación que nosotros controlemos, cada cambio que nos dosa a la arquitectura no deja de ser una puesta. Sería algo similar a los testes de software. Si no tenemos testes de nuestro software, cada vez que nosotros hacemos un cambio en una línea, podemos estar causando errores impredecibles.

  4. 5:34 , obre el vídeo en una pestanya nova

    Pues exactamente lo mismo en la ingeniería de ella. Y en este libro se explica bastante en detalle con un montar arquitecturas de evaluación de estos sistemas. Chip define el pipeline de evaluación en tres pasos. El primer paso es evaluar todos los componentes de un sistema. Al final las aplicaciones de Ia pueden ser complejas en el mundo real. Y no queremos solamente evaluar el resultado final de una petición a la Ia. Queremos también poder evaluar cada paso intermedio. No te preocupes, veremos al final una arquitectura completa de Ia, para que se entiende exactamente que significa esto de los pasos intermedios. Pero para hacerlos sencillo. En el libro se explica un ejemplo muy claro en el que tenemos un sistema de inteligencia artificial en el que les suves el currículo de un candidato para una oferta laboral y te saca cuál es el trabajo actual que tiene. Esto es la dividido en dos pases, primero una fase donde se saca el contenido, la información de ese currículo y una segunda fase en la que se saca el empleador actual de todo el resultado anterior. Las razones por las que esto puede fallar puede depender de cualquiera de estos dos puntos. Por lo tanto tenemos que ser capaces de evaluar cada uno de ellos de manera independiente. Sería como por ejemplo hacer un test de diferentes funciones en vez de hacer solamente un test de todo el flujo final. El segundo paso sería generar una guía de evaluación. Es decir, ¿qué queremos evaluar? ¿Qué criterios tenemos? Por ejemplo, queremos evaluar la relevancia de la información que le damos al usuario, como medimos ese concepto de relevancia. queremos evaluar que en verdad nuestro sistema de ella de resultados que sean factualmente correctos, como evaluamos que eso es cierto, queremos poner las citas de dónde has sacado la información. Queremos evaluar la seguridad, queremos evitar que el modelo se atóxico, que el modelo transmita negatividad, que permita preguntar y de respuestas a cosas inseguras. Lo que nos dice Chip es que por cada criterio que nosotros seleccionemos, le tenemos que asignar una serie o una especie de puntuación.

  5. 7:31 , obre el vídeo en una pestanya nova

    podemos definir una puntuación entre 0 y 1, entre 0 y 10, entre 0 y 5. Y con esto nos creenamos una rubrica de ejemplos. Es decir, si tenemos una respuesta con 0 de toxicidad como luce. Si tenemos una respuesta tóxica o insegura también como luce. Creenamos una serie de ejemplos para dar imagen, dar sentido a cada una de estas puntuaciones. Una vez tenemos los ejemplos, los criterios y la rubrica, lo que podemos hacer es ir a la fase 3 de la evaluación. que es definir cómo lo vamos a evaluar. Ya que entramos ya en un mundo super complejo en el que podemos incorporar un montón de elementos. E insisto que cada criterio pueden necesitar o requerir diferentes métodos de evaluación. Uno de los conceptos que se explica en ese desarrollo en este libro es utilizar un juez de inteligencia artificial. En el que si tiene los criterios bendé finidos, las puntuaciones y los ejemplos para ser capaz de alimentar para utilizarlo como método de evaluación. Pero eso es un ejemplo. puedes incorporar funciones clásicas de código para que realigen ese tipo de puntuaciones o incluso, esto también queda claro en el libro incorporar una fase de evaluación humana. Con todo esto tendríamos todo lo que sería las guías o la pipeline de evaluación para poder medir que también implementamos nuestro sistema de inteligencia artificial y si resuelven los problemas que nosotros hemos querido resolver. Pero también se explican un montón de técnicas en este libro sobre qué ajustes nosotros podemos hacer en nuestro sistema para mejorar estas evaluaciones. Una de estas técnicas es lo que como un mente que se bura se escucha de alguna vez, se que uno hace como prompt engineering o ingeniería de prompts. E cuidado antes de que te llevas a la cabeza, no estoy hablando de la ingeniería de prompts típica que se ve en redes sociales, no escribe el prompt diciendo le que dejen que ser un el rol no se que actúa como un desarrollador senior etcétera. Estamos hablando de prompt engineering a nivel de ingeniería de software.

  6. 9:27 , obre el vídeo en una pestanya nova

    Obviamente, hay una parte del libro que nos explica cómo escribir buenos proms para ajustar los diferentes modelos a que hagan lo que nosotros queremos. Pero también hay unas excciones muy interesantes sobre seguridad en los proms. ¿Cómo nosotros podemos evitar lo que se conoce como Prom Injection? Y es que al final si nosotros desarrollamos sistemas de Ia, en los que el usuario puede lanzar proms, entramos en riesgo de que el usuario nos acaba generando respuestas que no queremos dar. Pueba bastante sonado el caso de McDonalds, en el que cuando lanzaron su chatbot con inteligencia artificial, le podía preguntar que te escribiera un escrib en piso. Y el chatbot, en vez de decirte que él no tenía ni idea que él era simplemente un chatbot de una cadena de comida rápida, pues directamente te escribía un escrib. Y esto es un prompting chechón que puede parecer bastante inocente. Al final, no está filtrando información, no está haciendo nada que no tenga que hacer. Simplemente no han enfocado bien el modelo para que actúa como tiene que actuar. Por la imaginate que en vez de pedirle que teagones que empaison esto tuviera ciertas implicaciones en el vaco en demás donals y le pudiera expedir que te dijeras, por ejemplo, el stock de las diferentes tiendas y te saltara en la respuesta. Y creme, es más común de lo que crees, McDonalds fue un ejemplo bastante famoso, pero también ocurrió en otra empresa como por ejemplo al campo. Algo muy similar en el que puedes pedirle que teagones que empaison y te lo responde. Para evitar todo esto, en el libro se explican bastante técnicas como por ejemplo, Prone en Genevill, en Defensive. Y en esta sección te explica básicamente cómo evitar, por ejemplo, que un usuario malicioso te robe el prompt que tú tienes confío a tanto sistema, como evitar que un usuario malicioso le pidan a la gente de ella que haga cosas maliciosas y también como evitar que un usuario malicioso robe información interna que no debería salir al alo. Y me da muy bien a ver sacado el concepto de información, porque uno de los limitantes principales cuando desarrollamos sistemas de inteligencia artificial es cerca a pasar de darle la información necesario, es decir, en el ejemplo de McDonald's anterior, seguramente si tenen un chatbot pues tenemos que alimentar ese chatbot con precios de diferentes hamburguesos diferentes menús, ubicaciones de los locales, por si uno se nos pregunta cuál es el McDonald's que tengo más cerca, información nutricional incluso quizás de los ingredientes, en definitiva de alguna forma tenemos que ser capaces de tener una base de datos con información para

  7. 11:40 , obre el vídeo en una pestanya nova

    que el modelo sea capaz de consultar, ya que también entra que si lo tenemos que una base de datos de alguna forma tenemos que ser capaces de ser actualmente consistentes. Es decir, que la Ia no alucine lo que no existen o no alucine a muroguezas que tanto existen. Aquí es donde entra como un mente el concepto de RRH, de las cilas de retrieval, argumented, generación, en español, generación aumentada con consultas. básicamente, puedes entender el drag como un sistema en el que tenemos por un lado, una capacidad de consultar una base de datos para obtener información y otro sistema que utilita estos datos para generar una respuesta. De esta manera, somos capaces de generar las respuestas basándonos solamente en la información necesaria. Ya que es donde entra el punto más importante de los drag, la calidad del sistema de Ia con drag está directamente relacionada con la calidad del sistema de queries contra la base de datos, del sistema de obtención y curado de información. Es decir, ¿qué algoritmos y cómo nosotros implementamos este retrieve? Va a ser una de las partes más importantes de nuestro sistema. En el libro, se explican algunos algoritmos muy interesantes sobre cómo podemos hacer este retrieve. Que no son algoritmos nuevos, son algoritmos que se llevan utilizando en estadística y en Machine en la R$1,1 de años. Entre ellos y el masinozente sería el buscar elementos en función de palabras que aparecen o no. Es decir, si yo tengo un montón de documentos PDF en mi base de datos y que ahora hacer un retribal sobre conceptos de redes neuronales, voy a buscar la palabra redes neuronales en los diferentes documentos y los que la incluyan, va a estar en la parte de mi contexto relevante. Pero esto tiene algunos problemas. Como se yo que estoy encontrando PDC es o documentos que realmente están relacionados con redes neuronales enían y no en redes neuronales del cerebro, biológicas, de ciencia de medicina. Estas unas de las mayores limitaciones de buscar mediante términos. Y es por ello que se crearon lo que se conoce hoy en día y que seguro que has leído en internet los embeddings. Los embeddings no son otra cosa que una representación numérica, como si fuera un vector de números, de diferentes elementos de una base edatos, por ejemplo, PDFs, de parrafos, de diferentes textos, de diferentes entidades, que yo puedo agrupar de alguna manera mediante estos números, dándole valores en función, pues de la temática,

  8. 14:12 , obre el vídeo en una pestanya nova

    de la semántica, de la importancia, de varios valores que yo puedo definir y guardarlos en una base edatos para luego poder hacer un retribal con algoritmos mucho más potentes. Esto lo que me permite es que si yo voy a buscar estos embeddings, estos números, estos vectors, a la base edados, con mi petición, los vectors que vayan a encontrar van a tener codificada esta información semántica. Uno de los algoritmos más sencillos para hacer esta petición esta cuery es el que se conoce como KNK, Nirest, Neibors, los K, vecinos, más cercanos. Y es que tú puedes entender un embedding muy sencillo de dos dimensiones como simplemente una gráfica en 2D, donde cada uno de estos puntos sería una fuente un elemento dentro de mi base de datos. Es decir, de alguna forma yo he agarrado toda mi base de conocimiento, la he convertido a vectors de dos dimensiones y lo he plasmado en este gráfico 2D. Cuando yo ahora voy a hacer un prompt y convierto indexo este prompt para saber qué vector este modo que buscar lo que voy a hacer es plasmarlo en esta gráfica y seleccionar los C, pueden ser los 5, los 7, los 10 más cercanos. Directamente, en este caso, muy sencillito, con una distancia euclida. De esta forma, fíjate que puedo hacer una petición y obtener el contexto más importante o que más se adapta a mi necesidades. Y por lo tanto, el drag con embedings es algo que se utiliza muchísimo en la mayoría de sistemas con inteligencia artificial. Esto básicamente sería la implementación, en la implementación muy sencilla, que nosotros tendríamos en la parte del retriever. es decir, los dos agarraríamos la parte del retriever y de la base de datos y le añadiríamos también el elemento de la base de datos vectorial. La base de datos vectorial es la base de datos que guarda los embeddings. A parte de esto tendríamos lo que traduce un documento normal a mi vector y por lo tanto generíamos este enlace entre el vector al que yo he accedido y el documento final. Y obviamente también cada vez que la base de datos general guarda una información se tiene que guardar en el vector de Vx.

  9. 16:20 , obre el vídeo en una pestanya nova

    Es decir, la dirección contraria a lo que habíamos en un retribar. Y con esto tendríamos un ejemplo, una explicación de cómo funcionan realmente los sistemas de rack. Ahora bien, nos queda una pieza clave para poder determinar que nuestro sistema de retriba funciona correctamente. Y es como medimos realmente que nuestra agrupación que nuestros en verdens que nuestros vectors, esas X que habíamos puesto en la gráfica, realmente están donde tienen que estar y me responden cuando me tienen que responder. ¿Cómo podemos medir todo eso? Como habíamos hecho antes, no puedo mejorar lo que no puedo medir? Pues básicamente con dos métricas super importantes que si es estudio de la inteligencia artificial ahora o en el pasado seguro que te suena. La prequisión y el rico. Imagínate que estás desarrollando un sistema de inteligencia artificial para detectar enfermedades. En enfermedades chungas, de estas que te cambien la vida, de estas que quizá no sale de ahí. Obviamente no vas a poder tener una prefición de el 100%. En el que cuando tú yagnosticas, que alguien tienes enfermedad, seguro que la tiene. Y que cuando yagnosticas que no la tiene, seguro que no la tiene. Recordemos que la IA tiene una naturaleza probabilística, por lo tanto, tiene cierto punto de error. Aquí, es donde tú como ingenero de IA, o como ingenero de Machine Learning, cuando ustedes entrenándome de los, tienes que tomar una serie de decisión. La más importante es que es más aceptable. En esta aplicación que estoy teniendo es mejor tener falsos positivos o falsos negativos. En la ejemplo de la detección de la enfermedad lo más probable es que sea mejor tener falsos positivos. Porque si tienes falsos positivos luego la gente que no tiene la enfermedad

  10. 17:55 , obre el vídeo en una pestanya nova

    que le has dicho que quizá la tiene le puede hacer pruebas más exhaustivas para acabar de determinar si la tiene uno, es decir, el coste de tener un error preferiendo falsos positivos es mucho más barato y asumible que el coste de tener falsos negativos, porque si alguien que tiene la enfermedad, tu sistema la dice que no la tiene, pues el coste va a ser que no va a recibir tratamiento. Este varemos esta elección es lo que se conoce como la elección entre precisión y rical, y es uno de los factores clave que tienes que hacer cuando desarrollas y sistemas de ella. En RAC pasa lo mismo que es más aceptable de para mi sistema. Que me lleguen más documentos de la cuenta, pero algunos de ellos no sean aplicables a mi prom, o que me lleguen menos documentos, pero que todos los que me lleguen sean aplicables, aunque haya dejado algunos importantes sobre la mesa. A nivel de formular matemática, la precisión se define como lo siguiente. ¿Qué por centaje de todos los documentos que se han obtenido son relevantes a la cuery? Y el ricol sería lo contrario. De todos los documentos relevantes a la cuery, cuántos se han obtenido. que hemos dicho antes, mides falsos positivos contra falsos negativos. Entonces, teniendo todas estas herramientas, puede parecer que es mucho, pero este libro va mucho más allá. A veces utilizar RAC no es suficiente y quieres poder personalizar de una forma más profunda el modelo, y no solamente con la información, a la que tenia acceso, sino también con su comportamiento. Aquí es donde este libro te enseña conceptos para hacer FINE TUNING de Modelas. Un ejemplo de ¿Por qué querridos hacer FINE TUNING de Modelas sería? Por ejemplo, para ayudarle a que te generen mejor Jason, te generen mejor código o adaptarlo a situaciones específicas que quizás el modelo no tiene tan profesionalizadas. Hoy en día tenemos modelos muy generales, que han sido entrenados con un montón de información, pero también tenemos modelos adecuados a tareas específicas, como podrían ser, por ejemplo, los modelos especializados en código. En este libro se define muy bien, cuando merece la penacer de la oficción de la FFXII o cuando merece la pena utilizar drags. Y explica su retodo algunas técnicas que se han utilizado para hacer FFXII de diferentes

  11. 20:01 , obre el vídeo en una pestanya nova

    modelos de los novor ejemplos de GPS. Pero más allá del FFXII que quizá no es algo que vayamos a hacer tan comúnmente como ingenieros inteligencia artificial, en este libro se enseña a cómo se optimiza la inferencia. Ponto un ejemplo. Imagínate que tienes un sistema con drag en el que estás obteniendo un montón de documentos para responder preguntas de costo-mer-serviz, pues tienen usuarios que están en soporte, haciendo preguntas de cosas que son repetidas constantemente. Cuando abrir, cuando es el siguiente lanzamiento, tengo problemas con mi aplicación que compraye. La mayoría de respuestas o generaciones que se van a hacer sobre estos prons, van a utilizar documentos que tú ya estás mandando constantemente a la I. Una de las técnicas que explicas de libro para optimizar la inferencia es utilizar que aches de inferencia. Ya que como digo muchos de estos documentos de estos tokens, que tú estás mandando al inteligencia artificial, lo estás mandando un aillotra vez. Esto es lo que se conoce como prompt catch and. Y es importante conocerlo porque, por ejemplo, en la mayoría de appes de ese de cas de Ia como por ejemplo, la de Andrópick, de cobran diferente por prompts catcha dos, es decir, toque en schachados o toque en nuevos. En definitiva, como puedes ver, este es un libro super completo de ingeniería con Ia. En ningún momento nos explica como implementar MCPS New Skills, nos está enseñando a ser ingeniero con esta nueva herramienta que ha aparecido de la inteligencia artificial para mejorar nuestros propios sistemas. Pero es cierto que, hasta este punto, en el libro, hemos ido viendo piezas soldas. Y es aquí donde creo que empieza mi parte favorita. La parte en la que chip huyen, nos explica, vas o a paso como luce una arquitectura completa, con todas las piezas necesarias para tener un sistema de inteligencia artificial en producción, que por cierto antes de empezar con el paso a paso, recuerda que la

  12. 21:43 , obre el vídeo en una pestanya nova

    decision de que libros hacemos en este club de lectura, la tiene estú, si votas, en mi Instagram. El besencuando vamos haciendo consultas para que tú puedes votar el siguiente libro a revisar, así que por favor veis directamente a mi Instagram síganme y eso detento para las siguientes stories. En el libro se definen 5 etapas en cualquier arquitectura de inteligencia artificial. La más básica, seguramente la que ya conoces, que es hacer las llamadas directamente al SDK del modelo, hacer las llamadas al app. El usuario es que era un prompt, lo mandas al app y mandas a respuesta de vuelta. Y hemos visto que esto puede tener riesgos. Pronto, enjection, no está optimizada la caché por lo que quizás estamos pagando más de la cuenta. No tenemos ningún sistema de rack incorporado, sería lo inicial. Que también es cierto que puede ser lo que, a ti, en tu caso de uso, sea suficiente o lo principal, con lo que pueda empezar a trabajar. Obviamente esto va a tener data de estas limitaciones, muchos puntos de mejora. En el libro se define que el punto 1 que tendríamos que añadir a esta arquitectura básica sería toda la mejora del contexto. Aquí es donde por ejemplo, entraría un sistema de rax incorporamos este sistema antes de mandar el mensaje al modelo y atendríamos una mejora notable en lo que sería el enrecicimiento de nuestros prompts y el de dar el contexto del cuadro al modelo de I. Después de esto, entraríamos en la segunda fase en la fase de los guarda raíles y seguridad. Por ejemplo, imagínate que tú haces un prón y sin querer, le mandas un toque emprivado a la Ia. Y aquí están o quieres mandarle a la Appidian Tropic, tu toque emprivado de Stripe, para que yo que sé, se acaba de filtrando el cabo de unos años. Es por ello que ya desuerdarraíles tanto en la entrada, como en la salida del modelo. Estos guardarraíles pueden ser funciones, donde simplemente puestengas algunas comprobaciones, que se eliminen estos toques, que se eliminen nombres de usuario privados.

  13. 23:32 , obre el vídeo en una pestanya nova

    como digo, para luego no mandar solo al modelo, y los guarda raíles de salida podrían ser, por ejemplo, evaluaciones de toxicidad, si el modelo ha contestado algo que puede ser, racista, ser tóxico para los usuarios o ser muy negativo, tú lo puedes comprobar directamente allí. Se los hauría pedido que le devuelvo en un Jason y tú comprevas que la output no es un Jason, pues también puede ser una razón para no mandarle eso a los usuarios, porque va a ser un error. Como ves, a medida que vamos añadiendo más elementos en nuestro sistema de ella, las cosas se van complicando. Y quizá no siempre el mismo modelo va a ser útil para las mismas acciones. O quizá consideramos que para cierres acciones no sale más a cuento utilizar un modelo más barato, mientras que para otras no sale a cuento utilizar un modelo más caro. Aquí es donde entra la siguiente fase en la evolución de arquitectura que nos define este libro, que es el añadir un router de modelos, lo que se conoce como un ene como un modelo gateway. Un modelo gateway lo que puede decidir, por ejemplo, es que si yo tengo una petición de un usuario, que no sabe cómo restaurar la contraseña, pues quizás simplemente con un modelo muy barato, que tenga acceso a las FAC, de mi página web o al link, restaurar contraseña, directamente pagando muy poco le puedo devolver la respuesta de adonde tiene que ir y que tiene que hacer. Ahora bien, si un usuario ha subido un afoto y me está pidiendo un análisis avanzado sobre lo que aparece en ella, quizá es el modo de los sencillo y barato no me sirve y me tengo que ir o un modelo caro. Por lo tanto, añadimos una capa antes de ir a la petición al modelo que, con cierta lógica, nos determina hacia que modelo tenemos que ir. Lo que se conoce como hemos dicho como modelo gateway. La lógica de este gateway de modelo puede ser tan compleja como quieras. Puedes utilizar un modelo muy barato que analice el prompt y con cierta reglas de termine, hacia que otro modelo tiene que ir puedes guardarte cuánto lleva a gastado a nivel monetario en cada modelo para dirigir al más barato o al que en ese momento tenga más accesibilidad. Pues de esto mismo generarte reglas de que si el usuario ha introducido el prompt en cierta pantalla, vaya a un modelo o a otro, o en función de lo que el usuario se leccione en un selector en la UI. La lógica que es que nos implementar dependenteramente de ti. Al final lo importante es que tengas esta capa para poder dirigir el tráfico como turn necesites.

  14. 25:46 , obre el vídeo en una pestanya nova

    Sería como un enginx, pero de modo de los de ellas. A partir de aquí, el siguiente punto recomendable en este libro sería incorporar las cachés para optimizar el coste y la imprencia. Sería la fase 4 de la evolución de una arquitectura. Las cachés las podemos incorporar tanto en la capa de construcción de contexto, en la capa de este rack, en la capa en la que vamos a las bases de datos, obtener los documentos y los rectores, también para hacer que las cuérisa la base de datos, pues sean un poquito más eficientes, o incluso también a nivel de prompt. nosotros podríamos llegar a guardarnos de alguna manera en un embedding, el prompt que nos han enviado y si vemos que nos están enviando otro prompt que es muy parecido, muy similar a nivel de distancia de otro que ocurren el pasado y tengo la respuesta guardada porque no puedo enviarle exactamente la misma respuesta, sino tengo información personal en ella. Es por ello que podemos añadir caches en diferentes puntos para cumplir con diferentes necesidades. Si lo añadimos en la parte de Rack y de construcción del contexto, estamos acelerando todo el flujo, porque obtenemos los datos más rápido. Ahora bien si lo ponemos en la parte de la cual y del prompt, lo que hacemos es por un lado, todo más rápido y por otro no se arromó hasta. Finalmente, y esto sería ya la fase 5 la última que viene definida en la evolucion arquitectónica de este libro es añadir capacidades agenticas. Y es que hasta ahora, has visto cómo te sabere un sistema en el que los usuarios pregunta y la IA responde, pero si queremos añadirle capacidades agenticas, podemos hacer que esta respuesta de la IA nos lance herramientas o acciones sobre nuestro sistema. Es decir, básicamente lo que hacemos es que, si nos responde, por ejemplo, que se tiene que realizará una acción en vez de esperar que lo suario la haga, directamente, la hacemos de manera automática. Con todo esto, ya tendrías una arquitectura muy alto nivel, obviamente, sobre cómo podría lucir un sistema de IA completo en cualquiera de las plataformas o productos que tu puedes en esta resarrolla. Hay muchísimas más en este libro, ¿vale? Esto es la arquitectura

  15. 27:39 , obre el vídeo en una pestanya nova

    luego también explica que métricas puedes utilizar para medir, por ejemplo, el tiempo medio al primer token de respuesta que recibe el usuario, que básicamente me diría todo el tiempo que tarda en hacer este proceso y en definitiva va traduciendo todo lo que son las métricas clásicas de desarrollo de ápis, por ejemplo la latencia, o el tiempo al primer fixel, o el tiempo a la primera interacción de una página web a sistemas de inteligencia artificial, a cómo los puedes medir y cómo los puedes mejorar. Como digo, este es un libro bastante profundo, es un libro de alto nivel técnico, es un libro que requiere, de bastante conocimiento técnico, aunque sí que es cierto que cada concepto te lo vas aplicando poco a poco, pero es denso. Tampoco es un libro que te vayan enseñar diferentes sistemas de redes neuronales, ni cómo funcionan un transformer, ni es un libro de estadística. Tienen que quedar claro que es un libro de cómo implementar IA, que ya existe modelos fundacionales en sistemas productivos, como hemos visto en este día ahora. A una sí, si quieres ir un poquito más a los fundamentos y quieres ver, pues ¿qué es una red neuronal o alto nivel como los LMS utiliza en redes normales para funcionar? Te dejo un vídeo por aquí en el que hablo de algunos conceptos básicos que te van a ayudar a acabar de entender todo lo que has visto en este vídeo. Si mucho más, espero que este vídeo te apareció interesante si ha sido así por favor de jamer un like, dale al hype y suscríbete a mi canal. En otro olvides, nos vemos en la siguiente vídeo con más informática. hasta otra.