{"id":1393,"date":"2025-10-30T10:42:08","date_gmt":"2025-10-30T09:42:08","guid":{"rendered":"https:\/\/germanmallo.com\/?p=1393"},"modified":"2026-10-05T08:15:46","modified_gmt":"2026-10-05T06:15:46","slug":"fin-tecnologia-rag","status":"publish","type":"post","link":"https:\/\/germanmallo.com\/en\/fin-tecnologia-rag\/","title":{"rendered":"\u00bfSe acerca el fin de la tecnolog\u00eda RAG?"},"content":{"rendered":"<p>&nbsp;<\/p>\n<p><em>Cuando la optimizaci\u00f3n de tokens y el procesamiento horizontal sacuden el paradigma<\/em><\/p>\n<p>La inteligencia artificial ha llegado a un punto de inflexi\u00f3n. Por un lado, los recursos computacionales son cada vez m\u00e1s eficientes; por otro, las estrategias para abaratar costes y aligerar contextos se multiplican. Gracias a herramientas como <a href=\"https:\/\/germanmallo.com\/en\/deepseek-ocr-vision-text-compresion-ia\/\" target=\"_blank\" rel=\"noopener\">Deepseek OCR<\/a> y arquitecturas \u201ctoken-friendly\u201d, cada vez vemos m\u00e1s casos de manejo de grandes vol\u00famenes de tokens optimizado. Y tras lidiar a diario con la tecnolog\u00eda RAG en mi trabajo, me surgen muchas preguntas\u2026 \u00bfestamos a las puertas del fin de la era de la <a href=\"https:\/\/cloud.google.com\/use-cases\/retrieval-augmented-generation?hl=es\">Retrieval Augmented Generation<\/a> (RAG)?<\/p>\n<p><!--more--><\/p>\n<h2 id=\"la-promesa-de-rag\">La promesa de RAG<\/h2>\n<p>La magia de RAG radica en su capacidad para sintetizar enormes masas de datos, seleccionando \u201cchunks\u201d (o fragmentos) a dedo para ahorrarnos tokens y enfocarnos en lo relevante. La t\u00e9cnica ha permitido:<\/p>\n<ul>\n<li>Extraer vectores de embeddings de una colecci\u00f3n documental.<\/li>\n<li>Hacer chunking (segmentaci\u00f3n) de los textos para adaptarlos al contexto del modelo.<\/li>\n<li>Mantener una base vectorial (vectorstore) que sirve como \u201cmemoria\u201d para las consultas.<\/li>\n<li>Dar respuestas contextualizadas incluso con informaci\u00f3n \u201cexterna\u201d al modelo base (no vista en el entrenamiento).<\/li>\n<\/ul>\n<p>En efecto, RAG ha sido la estrategia elegida para muchas arquitecturas de IA empresarial y de productos: permite que modelos relativamente ligeros respondan a preguntas sobre datos propios de la organizaci\u00f3n, sin tener que reentrenar un LLM gigantesco para cada dominio.<\/p>\n<h2 id=\"los-retos-que-conviene-reconocer\">Los retos que conviene reconocer<\/h2>\n<p>Pero como cualquier tecnolog\u00eda en crecimiento, RAG tiene sus \u201cperos\u201d. Y tras trabajar con ella d\u00eda a d\u00eda, los he ido constatando:<\/p>\n<ul>\n<li><strong>Configuraci\u00f3n inicial compleja<\/strong>: embeddings, strategies de chunking, vectorstores, conectores a m\u00faltiples fuentes\u2026 requieren mucha puesta a punto.<\/li>\n<li><strong>Mantener los datos frescos<\/strong>: sincronizaci\u00f3n manual o scripts personalizados para actualizar la base documental y vectorial.<\/li>\n<li><strong>Multiplicidad de fuentes<\/strong>: cada conector a diferentes sistemas\/documentos puede generar fricci\u00f3n de mantenimiento.<\/li>\n<li><strong>Reranking y optimizaci\u00f3n continua<\/strong>: hacer que los documentos m\u00e1s relevantes aparezcan depende de experimentaci\u00f3n constante (y de m\u00e9tricas, feedback de usuario, etc.).<\/li>\n<li><strong>Tiempos de respuesta y \u201cruido\u201d<\/strong>: uno de los grandes cuellos de botella es el tiempo. La conexi\u00f3n al almac\u00e9n vectorial, la b\u00fasqueda en s\u00ed misma, y sobre todo el procesamiento de informaci\u00f3n irrelevante. Algunas veces la cadena RAG incluye documentos que nunca deber\u00edan haber sido considerados \u2014 el modelo se entretiene con \u201cruido\u201d que no aporta valor, lo cual alarga tiempos de proceso y puede perjudicar UX.<\/li>\n<\/ul>\n<p>En definitiva: aunque RAG sigue siendo muy \u00fatil, cada vez me da \u201ccosas que pensar\u201d sobre su sostenibilidad y situaci\u00f3n futura.<\/p>\n<h2 id=\"-por-qu-podr-amos-estar-acerc-ndonos-al-fin-de-rag-\">\u00bfPor qu\u00e9 podr\u00edamos estar acerc\u00e1ndonos al fin de RAG?<\/h2>\n<p>El motor que impulsa este posible cambio es la mejora horizontal de la IA: optimizar para que los contextos sean m\u00e1s grandes, los tokens m\u00e1s baratos, y hace que los modelos puedan asumir tareas antes consideradas imposibles sin RAG. Algunas pistas:<\/p>\n<ul>\n<li>Los avances en gesti\u00f3n de tokens permiten que modelos robustos puedan <strong>almacenar cap\u00edtulos enteros de libros en su ventana de contexto<\/strong>, proces\u00e1ndolos a velocidades incre\u00edbles.<\/li>\n<li>Herramientas de orquestaci\u00f3n ligera (por ejemplo, contenedores Docker que sirven para IA, OCR, preprocesamiento de texto masivo) permiten que la barrera de entrada sea menor y que el flujo de datos\/inferencia sea m\u00e1s fluido.<\/li>\n<li>Si un modelo ya puede \u201cleer\u201d mucho m\u00e1s del contexto sin fragmentar, la necesidad de una etapa expl\u00edcita de b\u00fasqueda + vectores + chunking se reduce.<\/li>\n<li>A esto se a\u00f1ade la tendencia hacia \u201cmodelos de contexto largo\u201d y sistemas que engloban documentos completos, memoria integrada, y menos componente externo de b\u00fasqueda.<\/li>\n<\/ul>\n<p>Entonces: si dejamos que mecanicemos estos avances, \u00bfestamos presenciando el declive de RAG como t\u00e9cnica dominante?<\/p>\n<h2 id=\"-significa-eso-que-rag-va-a-morir-ma-ana-\">\u00bfSignifica eso que RAG va a morir ma\u00f1ana?<\/h2>\n<p>No necesariamente. Mi reflexi\u00f3n es m\u00e1s matizada:<\/p>\n<ul>\n<li>RAG seguir\u00e1 siendo <strong>muy relevante<\/strong> en contextos donde hay muchas fuentes heterog\u00e9neas, donde la latencia no es tan cr\u00edtica, donde el coste de contexto largo a\u00fan es prohibitivo o donde convenga externalizar la memoria.<\/li>\n<li>Pero s\u00ed es probable que RAG pierda protagonismo <strong>en aquellos escenarios donde los modelos de contexto largo, optimizados para tokens, y las arquitecturas internas sean asequibles y eficientes<\/strong>.<\/li>\n<li>En resumen: pasaremos de \u201cRAG como est\u00e1ndar\u201d a \u201cRAG como uno de los patrones posibles\u201d, a su vez acompa\u00f1ado (o reemplazado) por flujos donde el modelo engloba mayor parte del contexto directamente.<\/li>\n<\/ul>\n<h2 id=\"-qu-debe-hacer-quien-est-trabajando-con-ia-hoy-\">\u00bfQu\u00e9 debe hacer quien est\u00e9 trabajando con IA hoy?<\/h2>\n<p>Para no quedarse obsoleto, recomiendo tres l\u00edneas de acci\u00f3n:<\/p>\n<ol>\n<li><strong>Invertir en aprender y experimentar con modelos de contexto largo<\/strong>: explorar arquitecturas que permitan meter m\u00e1s texto de golpe, leer libros completos, documentos amplios, etc.<\/li>\n<li><strong>Optimizar los flujos de token y preprocesamiento<\/strong>: utilizar OCR, contenedores ligeros, pipelines eficientes para reducir \u201cruido\u201d en el contexto.<\/li>\n<li><strong>Revisar la estrategia de RAG como parte de un conjunto m\u00e1s amplio de opciones<\/strong>: no depender exclusivamente de RAG, sino plantear arquitecturas h\u00edbridas que puedan mutar cuando el coste de contexto sea suficientemente bajo.<\/li>\n<\/ol>\n<h2 id=\"conclusi-n\">Conclusi\u00f3n<\/h2>\n<p>La IA ya no s\u00f3lo est\u00e1 corriendo hacia modelos m\u00e1s grandes, sino hacia un tratamiento m\u00e1s horizontal de la eficiencia: menos fragmentaci\u00f3n, m\u00e1s contexto, menor desperdicio de tokens. En ese sentido, la tecnolog\u00eda RAG, que fue una revoluci\u00f3n para conectar modelos con memoria documental, empieza a mostrar sus l\u00edmites operativos en entornos exigentes.<\/p>\n<p>\u00bfEstamos en el fin de RAG? No completamente. Pero muy probablemente estamos al final de su <strong>etapa dominante<\/strong>. Y quienes estemos trabajando con IA debemos prepararnos para la siguiente fase: modelos que lean m\u00e1s, procesen mejor y simplifiquen la arquitectura.<\/p>\n<blockquote><p>Si deseas explorar un caso pr\u00e1ctico, no dudes en mirar mi proyecto \u201c<a href=\"https:\/\/germanmallo.com\/en\/portfolio\/chatbot-personal-rag\/\" target=\"_blank\" rel=\"noopener\">My personal chatbot with RAG<\/a>\u201d donde lo implement\u00e9 usando LangChain, React, Pinecone y contenedores Docker. (<a title=\"Mi Chatbot personal con RAG - Germ\u00e1n Mallo\" href=\"https:\/\/germanmallo.com\/en\/portfolio\/chatbot-personal-rag\/?utm_source=chatgpt.com\">germanmallo.com<\/a>)<\/p><\/blockquote>","protected":false},"excerpt":{"rendered":"<p>&nbsp; Cuando la optimizaci\u00f3n de tokens y el procesamiento horizontal sacuden el paradigma La inteligencia artificial ha llegado a un punto de inflexi\u00f3n. Por un lado, los recursos computacionales son cada vez m\u00e1s eficientes; por otro, las estrategias para abaratar costes y aligerar contextos se multiplican. Gracias a herramientas como Deepseek OCR y arquitecturas \u201ctoken-friendly\u201d, [&hellip;]<\/p>\n","protected":false},"author":2,"featured_media":1394,"comment_status":"open","ping_status":"open","sticky":false,"template":"","format":"standard","meta":{"_acf_changed":false,"footnotes":""},"categories":[76],"tags":[126,250,127],"class_list":["post-1393","post","type-post","status-publish","format-standard","has-post-thumbnail","hentry","category-ia","tag-llm","tag-optimizacion-de-tokens","tag-rag"],"acf":[],"_links":{"self":[{"href":"https:\/\/germanmallo.com\/en\/wp-json\/wp\/v2\/posts\/1393","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/germanmallo.com\/en\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/germanmallo.com\/en\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/germanmallo.com\/en\/wp-json\/wp\/v2\/users\/2"}],"replies":[{"embeddable":true,"href":"https:\/\/germanmallo.com\/en\/wp-json\/wp\/v2\/comments?post=1393"}],"version-history":[{"count":1,"href":"https:\/\/germanmallo.com\/en\/wp-json\/wp\/v2\/posts\/1393\/revisions"}],"predecessor-version":[{"id":4524,"href":"https:\/\/germanmallo.com\/en\/wp-json\/wp\/v2\/posts\/1393\/revisions\/4524"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/germanmallo.com\/en\/wp-json\/wp\/v2\/media\/1394"}],"wp:attachment":[{"href":"https:\/\/germanmallo.com\/en\/wp-json\/wp\/v2\/media?parent=1393"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/germanmallo.com\/en\/wp-json\/wp\/v2\/categories?post=1393"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/germanmallo.com\/en\/wp-json\/wp\/v2\/tags?post=1393"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}