Saltar al contenido
Todos los artículos
Chatbot

Introducción a RAG: recuperación agéntica

Por qué la recuperación es indispensable, los dos flujos centrales que la impulsan, el panorama completo de enfoques y el marco para elegir la arquitectura adecuada.

Rodrigo Cano

Rodrigo Cano

Sentina

11 de agosto de 202610 min de lectura
Introducción a RAG: recuperación agéntica

Por qué la recuperación es indispensable

Los modelos de lenguaje solo conocen aquello con lo que fueron entrenados. No pueden acceder a los documentos de tu empresa, tus bases de datos ni a la información en tiempo real. La recuperación cierra esta brecha: encuentra la información exacta y la sitúa en el contexto para que el modelo razone sobre ella.

Este es el paradigma RAG: recuperar contexto relevante y luego generar una respuesta fundamentada en esa evidencia. La calidad de la recuperación es la palanca más determinante en el rendimiento de un sistema RAG. Incluso modelos pequeños superan a modelos de frontera cuando disponen del contexto correcto.

El problema

Tu modelo fue entrenado hace meses o años. No conoce tus políticas internas, los datos de tus clientes, las cifras de ventas de ayer ni el documento que subiste hace cinco minutos.

La solución

La recuperación encuentra la información adecuada en el momento oportuno y la inyecta en la ventana de contexto del modelo. El modelo genera una respuesta precisa y fundamentada a partir de esa evidencia.

Principio clave

La calidad de recuperación es la palanca #1. Un modelo pequeño con el contexto correcto supera sistemáticamente a un modelo de frontera que carece de él. Resuelve bien la recuperación y el resto funcionará.

Los dos flujos fundamentales de RAG vectorial

Los sistemas RAG se estructuran en torno a dos flujos fundamentales: la ingestión offline y la consulta en tiempo real. Comprender cada etapa de estos pipelines permite diseñar arquitecturas escalables y fiables.

Pipeline de ingestión (offline)

Prepara tus documentos para que puedan recuperarse posteriormente. Se ejecuta una vez o periódicamente, y define el techo de calidad de todo el sistema.

  1. 1Documento: se recibe el archivo fuente.
  2. 2Parsear y extraer: se extrae el texto y los metadatos relevantes.
  3. 3Fragmentación (chunking): se divide el contenido en fragmentos manejables.
  4. 4Generar embeddings: se convierte cada fragmento en un vector.
  5. 5Almacenar en base vectorial: los vectores quedan listos para búsqueda por similitud.

Pipeline de consulta (en tiempo real)

Encuentra la información correcta al momento de la consulta. Este pipeline puede iterar: el agente evalúa los resultados, refina la búsqueda y vuelve a consultar hasta reunir la evidencia necesaria.

  1. 1Pregunta del usuario.
  2. 2Embeddings de la consulta.
  3. 3Búsqueda híbrida.
  4. 4Re-ordenamiento (re-rank).
  5. 5Resultados verificados: si no son suficientes, el agente ajusta la consulta y repite el ciclo.

No todos los enfoques requieren ambos flujos

Estos dos flujos describen específicamente Vector RAG y la búsqueda híbrida. Text-to-SQL consulta una base de datos existente (sin pipeline de ingestión). Vectorless RAG usa herramientas de archivos (listar, grep, leer) sin paso de embeddings. Graph RAG comparte la forma de ingestión cuando se construye a partir de documentos, pero si consultas un grafo ya existente no hay ingestión RAG. No fuerces cada enfoque a este mismo molde.

¿Por qué hablamos de recuperación "agéntica"?

La recuperación moderna es inherentemente agéntica. No se trata de un pase único por una tubería rígida: el agente razona sobre qué buscar, cómo buscarlo y si los resultados obtenidos son suficientes.

Llamadas a herramientas

El pipeline de consulta es una llamada a herramienta. El agente invoca búsqueda vectorial, consultas SQL, lectura de archivos o búsqueda web y procesa los datos devueltos.

Bucles de iteración

El agente evalúa los resultados, decide si son insuficientes, transforma la consulta y vuelve a buscar. Esta naturaleza iterativa es lo que separa a la recuperación agéntica de un pipeline estático.

Toma de decisiones

El agente decide qué enfoque de recuperación utilizar, qué herramienta ejecutar, qué filtros de metadatos aplicar y en qué momento detenerse.

  1. 1El agente recibe la consulta del usuario y razona sobre ella.
  2. 2Elige la herramienta más adecuada: búsqueda vectorial, consulta SQL, herramientas de archivos, búsqueda web o APIs y MCPs.
  3. 3Ejecuta la herramienta elegida y evalúa los resultados obtenidos.
  4. 4Si la evidencia no es suficiente, vuelve a razonar y prueba otra herramienta o ajusta la consulta.
  5. 5Cuando la evidencia es suficiente, genera la respuesta final.

Marco A-RAG

El marco A-RAG formaliza tres principios de autonomía: estrategia autónoma (el agente selecciona su propio enfoque de búsqueda), ejecución iterativa (el agente itera hasta quedar satisfecho) y uso intercalado de herramientas (mezcla distintos tipos de recuperación en una misma consulta). La clave del éxito radica en diseñar interfaces de recuperación amigables para agentes.

El panorama de enfoques de recuperación

La recuperación es cualquier acción que extrae información y la coloca en el contexto del modelo. No existe un enfoque único ideal. Cualquier llamada a herramienta que devuelve datos es recuperación: consultar una API para un ticket, llamar a un servidor MCP, consultar el CRM o extraer métricas de la base de datos.

Vector RAG y búsqueda híbrida

Convierte documentos y consultas en vectores (embeddings) y recupera por similitud semántica. La búsqueda híbrida combina la recuperación densa (semántica) con la dispersa (BM25/palabras clave). Hoy es la recomendación por defecto, no una mejora opcional.

Text-to-SQL

El LLM genera consultas SQL sobre bases de datos estructuradas. Los datos residen en su formato relacional nativo, sin requerir pipeline de ingestión previo.

Graph RAG

Construye o navega grafos de conocimiento para datos con relaciones complejas. GraphRAG y sus variantes ligeras permiten sintetizar conexiones entre múltiples documentos y entidades.

Vectorless RAG

El agente utiliza herramientas para explorar colecciones de documentos sin embeddings (listar, grep, árbol de directorios, lectura y APIs de búsqueda). Costo de indexación cero.

Búsqueda web

Uso de motores de búsqueda como fuente de información. Frecuentemente utilizado como respaldo cuando la base interna no contiene la respuesta (patrón Corrective RAG).

Recuperación multimodal

Modelos de visión y lenguaje que recuperan documentos como imágenes, evitando por completo la extracción de texto con OCR. Preservan tablas, diagramas y diseño visual original.

APIs y MCP como mecanismos de recuperación

Cualquier llamada a herramienta que devuelva datos es recuperación, ya sea consultar la API de ClickUp por un ticket, llamar a un servidor MCP de Slack, o consultar el CRM por un cliente.

Recuperación contextual

Añade contexto a nivel de documento a cada fragmento antes de generar el embedding (recuperación contextual de Anthropic), o usa modelos de embeddings de contexto largo (late-chunking de Jina). Ya es práctica estándar en los frameworks principales.

Memoria como recuperación

En lugar de recuperar fragmentos crudos al momento de la consulta, el modelo procesa documentos durante la ingestión y mantiene una base de conocimiento persistente y sintetizada (estilo LLM Wiki).

BM25 sigue siendo indispensable

La búsqueda léxica tradicional (BM25) supera a los recuperadores puramente vectoriales en búsquedas técnicas específicas. Por eso la búsqueda híbrida es el punto de partida.

Cómo elegir el enfoque de recuperación adecuado

La decisión depende de cuatro ejes: la estructura de tus datos, el tipo de preguntas a responder, el presupuesto de cómputo y el nivel de precisión exigido.

EjeVector / HybridText-to-SQLGraph RAGVectorlessBúsqueda web
Estructura de datosTexto no estructuradoEstructurado / tabularEntidades interconectadasArchivos organizadosWeb pública
Tipo de consultaSemántica, hechosAnalítica, agregacionesMulti-paso, síntesisCódigo, archivosEventos actuales
Escala y costoEconómico al iniciarUsa base existenteMayor costo de índiceCero costo de índiceCosto por consulta
PrecisiónHíbrido supera al vectorialResultados exactosÓptimo para relacionesDepende del ordenCalidad variable

El modelo de portafolio de recuperación

Los sistemas en producción rara vez dependen de un único enfoque: combinan múltiples herramientas. El patrón dominante es un agente con un portafolio de recuperación que rutea dinámicamente cada pregunta a la herramienta adecuada.

Ejemplo: asistente empresarial Sentina

Un único asistente que orquesta múltiples herramientas de recuperación según la necesidad del usuario:

  • "¿Cuál es nuestra política de reembolsos?" → búsqueda vectorial sobre los documentos de políticas.
  • "¿Cuáles fueron las ventas de Q3 en EMEA?" → Text-to-SQL sobre la base de datos de ventas.
  • "¿Cómo se relacionan Smith Corp y Acme?" → recorrido del grafo de conocimiento del CRM.
  • "¿Cuáles son las tendencias actuales del mercado de IA?" → búsqueda web para datos en tiempo real.
  • "¿Cuál es el estado del ticket PROJ-142?" → llamada a la API de ClickUp o herramienta MCP.

Mentalidad arquitectónica

Piensa en términos de portafolios de recuperación, no de pipelines únicos. El agente es el orquestador: combina los resultados de múltiples fuentes, los re-ordena (re-rank) y los pasa al modelo de generación. Esta es la recuperación agéntica en su forma más completa.

Ventanas de contexto y Cache-Augmented Generation (CAG)

Con ventanas de contexto de hasta 1 millón de tokens, para colecciones documentales pequeñas puedes precargar la información completa mediante caché. Para grandes volúmenes, la recuperación sigue siendo imprescindible.

Tamaño del corpusEstrategia
Corpus pequeño (menos de 200K tokens)Cachear todo (CAG)
Corpus medianoRecuperar y cargar más según haga falta
Corpus grande (10,000+ documentos)Recuperación obligatoria

Cache-Augmented Generation (CAG)

Para bases de conocimiento acotadas, precargar todo el material en el KV-cache del modelo mediante prompt caching simplifica la arquitectura: sin chunking ni bases vectoriales. No escala a millones de documentos, pero es ideal para catálogos medianos.

Prompt caching

El facilitador de CAG. El prompt caching hace viable reutilizar contextos extensos pagando solo una fracción del costo habitual.

El mito de que "RAG ha muerto"

La decisión real es rutear según el tipo de consulta, no elegir entre RAG y contextos largos. El historial va a contexto largo; la precisión documental a RAG; la síntesis relacional a Graph RAG; y los datos externos a búsqueda en vivo.

Conceptos erróneos comunes

  • "La búsqueda vectorial es RAG": muchos confunden RAG únicamente con búsqueda vectorial. La búsqueda vectorial es solo uno de los métodos. Text-to-SQL, Graph RAG y herramientas de archivos son enfoques igualmente válidos.
  • "Siempre se necesitan embeddings": RAG sin vectores usa llamadas a herramientas del sistema de archivos, y Text-to-SQL usa consultas de base de datos. No todo sistema requiere modelos de embeddings.
  • "La recuperación ocurre en un solo paso": en producción, la recuperación itera en bucle. El agente busca, evalúa los datos, ajusta la consulta y vuelve a buscar hasta tener certeza.
  • "Un solo enfoque es suficiente": los sistemas reales combinan varios métodos en paralelo orquestados por el agente.
  • "Graph RAG reemplaza a Vector RAG": Graph RAG sobresale en relaciones complejas pero requiere mayor costo de mantenimiento. Complementa a la búsqueda vectorial en lugar de reemplazarla.
  • "Las ventanas de contexto gigantes eliminan a RAG": incluso ventanas de 1M de tokens no pueden abarcar todo el conocimiento corporativo. Las ventanas grandes cambian cuánto contexto cargas, no la necesidad de recuperarlo con precisión.

Ejes clave de la recuperación empresarial

Estos son los pilares de diseño que implementamos en Sentina para conectar datos empresariales con inteligencia artificial:

Vector RAG y búsqueda híbrida

Ingestión profunda (parseo documental, extracción de metadatos, chunking semántico y base vectorial) con consulta en tiempo real mediante búsqueda híbrida y re-ranking.

De RAG ingenuo a RAG agéntico

Evolución desde RAG simple de un solo paso hacia transformación de consultas, autoevaluación de evidencia (Self-RAG) y respaldo correctivo (CRAG).

Vectorless RAG

Navegación inteligente sobre repositorios y sistemas de archivos mediante llamadas a herramientas de búsqueda directa.

Text-to-SQL

Generación controlada de consultas sobre bases de datos transaccionales para consultar existencias, saldos y métricas en tiempo real.

Graph RAG

Extracción de entidades y navegación por grafos para sintetizar relaciones complejas entre documentos y clientes.

Evaluación de la recuperación

Medición continua de precisión, recall y fidelidad de respuestas para garantizar cero alucinaciones en producción.

RAGRecuperación de informaciónBases vectoriales

¿Quieres este tipo de resultado para tu operación?

Mapeemos en conjunto dónde tus sistemas están perdiendo tiempo y dinero, y qué se necesita para resolverlo.

Agendar diagnóstico

Seguir leyendo