Introducción a RAG: recuperación agéntica
Por qué la recuperación es indispensable, los dos flujos centrales que la impulsan, el panorama completo de enfoques y el marco para elegir la arquitectura adecuada.

Rodrigo Cano
Sentina

Por qué la recuperación es indispensable
Los modelos de lenguaje solo conocen aquello con lo que fueron entrenados. No pueden acceder a los documentos de tu empresa, tus bases de datos ni a la información en tiempo real. La recuperación cierra esta brecha: encuentra la información exacta y la sitúa en el contexto para que el modelo razone sobre ella.
Este es el paradigma RAG: recuperar contexto relevante y luego generar una respuesta fundamentada en esa evidencia. La calidad de la recuperación es la palanca más determinante en el rendimiento de un sistema RAG. Incluso modelos pequeños superan a modelos de frontera cuando disponen del contexto correcto.
El problema
Tu modelo fue entrenado hace meses o años. No conoce tus políticas internas, los datos de tus clientes, las cifras de ventas de ayer ni el documento que subiste hace cinco minutos.
La solución
La recuperación encuentra la información adecuada en el momento oportuno y la inyecta en la ventana de contexto del modelo. El modelo genera una respuesta precisa y fundamentada a partir de esa evidencia.
Principio clave
La calidad de recuperación es la palanca #1. Un modelo pequeño con el contexto correcto supera sistemáticamente a un modelo de frontera que carece de él. Resuelve bien la recuperación y el resto funcionará.
Los dos flujos fundamentales de RAG vectorial
Los sistemas RAG se estructuran en torno a dos flujos fundamentales: la ingestión offline y la consulta en tiempo real. Comprender cada etapa de estos pipelines permite diseñar arquitecturas escalables y fiables.
Pipeline de ingestión (offline)
Prepara tus documentos para que puedan recuperarse posteriormente. Se ejecuta una vez o periódicamente, y define el techo de calidad de todo el sistema.
- 1Documento: se recibe el archivo fuente.
- 2Parsear y extraer: se extrae el texto y los metadatos relevantes.
- 3Fragmentación (chunking): se divide el contenido en fragmentos manejables.
- 4Generar embeddings: se convierte cada fragmento en un vector.
- 5Almacenar en base vectorial: los vectores quedan listos para búsqueda por similitud.
Pipeline de consulta (en tiempo real)
Encuentra la información correcta al momento de la consulta. Este pipeline puede iterar: el agente evalúa los resultados, refina la búsqueda y vuelve a consultar hasta reunir la evidencia necesaria.
- 1Pregunta del usuario.
- 2Embeddings de la consulta.
- 3Búsqueda híbrida.
- 4Re-ordenamiento (re-rank).
- 5Resultados verificados: si no son suficientes, el agente ajusta la consulta y repite el ciclo.
No todos los enfoques requieren ambos flujos
Estos dos flujos describen específicamente Vector RAG y la búsqueda híbrida. Text-to-SQL consulta una base de datos existente (sin pipeline de ingestión). Vectorless RAG usa herramientas de archivos (listar, grep, leer) sin paso de embeddings. Graph RAG comparte la forma de ingestión cuando se construye a partir de documentos, pero si consultas un grafo ya existente no hay ingestión RAG. No fuerces cada enfoque a este mismo molde.
¿Por qué hablamos de recuperación "agéntica"?
La recuperación moderna es inherentemente agéntica. No se trata de un pase único por una tubería rígida: el agente razona sobre qué buscar, cómo buscarlo y si los resultados obtenidos son suficientes.
Llamadas a herramientas
El pipeline de consulta es una llamada a herramienta. El agente invoca búsqueda vectorial, consultas SQL, lectura de archivos o búsqueda web y procesa los datos devueltos.
Bucles de iteración
El agente evalúa los resultados, decide si son insuficientes, transforma la consulta y vuelve a buscar. Esta naturaleza iterativa es lo que separa a la recuperación agéntica de un pipeline estático.
Toma de decisiones
El agente decide qué enfoque de recuperación utilizar, qué herramienta ejecutar, qué filtros de metadatos aplicar y en qué momento detenerse.
- 1El agente recibe la consulta del usuario y razona sobre ella.
- 2Elige la herramienta más adecuada: búsqueda vectorial, consulta SQL, herramientas de archivos, búsqueda web o APIs y MCPs.
- 3Ejecuta la herramienta elegida y evalúa los resultados obtenidos.
- 4Si la evidencia no es suficiente, vuelve a razonar y prueba otra herramienta o ajusta la consulta.
- 5Cuando la evidencia es suficiente, genera la respuesta final.
Marco A-RAG
El marco A-RAG formaliza tres principios de autonomía: estrategia autónoma (el agente selecciona su propio enfoque de búsqueda), ejecución iterativa (el agente itera hasta quedar satisfecho) y uso intercalado de herramientas (mezcla distintos tipos de recuperación en una misma consulta). La clave del éxito radica en diseñar interfaces de recuperación amigables para agentes.
El panorama de enfoques de recuperación
La recuperación es cualquier acción que extrae información y la coloca en el contexto del modelo. No existe un enfoque único ideal. Cualquier llamada a herramienta que devuelve datos es recuperación: consultar una API para un ticket, llamar a un servidor MCP, consultar el CRM o extraer métricas de la base de datos.
Vector RAG y búsqueda híbrida
Convierte documentos y consultas en vectores (embeddings) y recupera por similitud semántica. La búsqueda híbrida combina la recuperación densa (semántica) con la dispersa (BM25/palabras clave). Hoy es la recomendación por defecto, no una mejora opcional.
Text-to-SQL
El LLM genera consultas SQL sobre bases de datos estructuradas. Los datos residen en su formato relacional nativo, sin requerir pipeline de ingestión previo.
Graph RAG
Construye o navega grafos de conocimiento para datos con relaciones complejas. GraphRAG y sus variantes ligeras permiten sintetizar conexiones entre múltiples documentos y entidades.
Vectorless RAG
El agente utiliza herramientas para explorar colecciones de documentos sin embeddings (listar, grep, árbol de directorios, lectura y APIs de búsqueda). Costo de indexación cero.
Búsqueda web
Uso de motores de búsqueda como fuente de información. Frecuentemente utilizado como respaldo cuando la base interna no contiene la respuesta (patrón Corrective RAG).
Recuperación multimodal
Modelos de visión y lenguaje que recuperan documentos como imágenes, evitando por completo la extracción de texto con OCR. Preservan tablas, diagramas y diseño visual original.
APIs y MCP como mecanismos de recuperación
Cualquier llamada a herramienta que devuelva datos es recuperación, ya sea consultar la API de ClickUp por un ticket, llamar a un servidor MCP de Slack, o consultar el CRM por un cliente.
Recuperación contextual
Añade contexto a nivel de documento a cada fragmento antes de generar el embedding (recuperación contextual de Anthropic), o usa modelos de embeddings de contexto largo (late-chunking de Jina). Ya es práctica estándar en los frameworks principales.
Memoria como recuperación
En lugar de recuperar fragmentos crudos al momento de la consulta, el modelo procesa documentos durante la ingestión y mantiene una base de conocimiento persistente y sintetizada (estilo LLM Wiki).
BM25 sigue siendo indispensable
La búsqueda léxica tradicional (BM25) supera a los recuperadores puramente vectoriales en búsquedas técnicas específicas. Por eso la búsqueda híbrida es el punto de partida.
Cómo elegir el enfoque de recuperación adecuado
La decisión depende de cuatro ejes: la estructura de tus datos, el tipo de preguntas a responder, el presupuesto de cómputo y el nivel de precisión exigido.
| Eje | Vector / Hybrid | Text-to-SQL | Graph RAG | Vectorless | Búsqueda web |
|---|---|---|---|---|---|
| Estructura de datos | Texto no estructurado | Estructurado / tabular | Entidades interconectadas | Archivos organizados | Web pública |
| Tipo de consulta | Semántica, hechos | Analítica, agregaciones | Multi-paso, síntesis | Código, archivos | Eventos actuales |
| Escala y costo | Económico al iniciar | Usa base existente | Mayor costo de índice | Cero costo de índice | Costo por consulta |
| Precisión | Híbrido supera al vectorial | Resultados exactos | Óptimo para relaciones | Depende del orden | Calidad variable |
El modelo de portafolio de recuperación
Los sistemas en producción rara vez dependen de un único enfoque: combinan múltiples herramientas. El patrón dominante es un agente con un portafolio de recuperación que rutea dinámicamente cada pregunta a la herramienta adecuada.
Ejemplo: asistente empresarial Sentina
Un único asistente que orquesta múltiples herramientas de recuperación según la necesidad del usuario:
"¿Cuál es nuestra política de reembolsos?" → búsqueda vectorial sobre los documentos de políticas. "¿Cuáles fueron las ventas de Q3 en EMEA?" → Text-to-SQL sobre la base de datos de ventas. "¿Cómo se relacionan Smith Corp y Acme?" → recorrido del grafo de conocimiento del CRM. "¿Cuáles son las tendencias actuales del mercado de IA?" → búsqueda web para datos en tiempo real. "¿Cuál es el estado del ticket PROJ-142?" → llamada a la API de ClickUp o herramienta MCP.
Mentalidad arquitectónica
Piensa en términos de portafolios de recuperación, no de pipelines únicos. El agente es el orquestador: combina los resultados de múltiples fuentes, los re-ordena (re-rank) y los pasa al modelo de generación. Esta es la recuperación agéntica en su forma más completa.
Ventanas de contexto y Cache-Augmented Generation (CAG)
Con ventanas de contexto de hasta 1 millón de tokens, para colecciones documentales pequeñas puedes precargar la información completa mediante caché. Para grandes volúmenes, la recuperación sigue siendo imprescindible.
| Tamaño del corpus | Estrategia |
|---|---|
| Corpus pequeño (menos de 200K tokens) | Cachear todo (CAG) |
| Corpus mediano | Recuperar y cargar más según haga falta |
| Corpus grande (10,000+ documentos) | Recuperación obligatoria |
Cache-Augmented Generation (CAG)
Para bases de conocimiento acotadas, precargar todo el material en el KV-cache del modelo mediante prompt caching simplifica la arquitectura: sin chunking ni bases vectoriales. No escala a millones de documentos, pero es ideal para catálogos medianos.
Prompt caching
El facilitador de CAG. El prompt caching hace viable reutilizar contextos extensos pagando solo una fracción del costo habitual.
El mito de que "RAG ha muerto"
La decisión real es rutear según el tipo de consulta, no elegir entre RAG y contextos largos. El historial va a contexto largo; la precisión documental a RAG; la síntesis relacional a Graph RAG; y los datos externos a búsqueda en vivo.
Conceptos erróneos comunes
"La búsqueda vectorial es RAG": muchos confunden RAG únicamente con búsqueda vectorial. La búsqueda vectorial es solo uno de los métodos. Text-to-SQL, Graph RAG y herramientas de archivos son enfoques igualmente válidos. "Siempre se necesitan embeddings": RAG sin vectores usa llamadas a herramientas del sistema de archivos, y Text-to-SQL usa consultas de base de datos. No todo sistema requiere modelos de embeddings. "La recuperación ocurre en un solo paso": en producción, la recuperación itera en bucle. El agente busca, evalúa los datos, ajusta la consulta y vuelve a buscar hasta tener certeza. "Un solo enfoque es suficiente": los sistemas reales combinan varios métodos en paralelo orquestados por el agente. "Graph RAG reemplaza a Vector RAG": Graph RAG sobresale en relaciones complejas pero requiere mayor costo de mantenimiento. Complementa a la búsqueda vectorial en lugar de reemplazarla. "Las ventanas de contexto gigantes eliminan a RAG": incluso ventanas de 1M de tokens no pueden abarcar todo el conocimiento corporativo. Las ventanas grandes cambian cuánto contexto cargas, no la necesidad de recuperarlo con precisión.
Ejes clave de la recuperación empresarial
Estos son los pilares de diseño que implementamos en Sentina para conectar datos empresariales con inteligencia artificial:
Vector RAG y búsqueda híbrida
Ingestión profunda (parseo documental, extracción de metadatos, chunking semántico y base vectorial) con consulta en tiempo real mediante búsqueda híbrida y re-ranking.
De RAG ingenuo a RAG agéntico
Evolución desde RAG simple de un solo paso hacia transformación de consultas, autoevaluación de evidencia (Self-RAG) y respaldo correctivo (CRAG).
Vectorless RAG
Navegación inteligente sobre repositorios y sistemas de archivos mediante llamadas a herramientas de búsqueda directa.
Text-to-SQL
Generación controlada de consultas sobre bases de datos transaccionales para consultar existencias, saldos y métricas en tiempo real.
Graph RAG
Extracción de entidades y navegación por grafos para sintetizar relaciones complejas entre documentos y clientes.
Evaluación de la recuperación
Medición continua de precisión, recall y fidelidad de respuestas para garantizar cero alucinaciones en producción.
¿Quieres este tipo de resultado para tu operación?
Mapeemos en conjunto dónde tus sistemas están perdiendo tiempo y dinero, y qué se necesita para resolverlo.
Agendar diagnósticoSeguir leyendo

Interfaces para agentes de IA: del chat a un segundo plano
Cómo interactúan los usuarios y los sistemas con los agentes. La interfaz no es una capa cosmética: moldea la arquitectura, la latencia, la confianza y el control operativo.

Protocolo de Contexto de Modelo (MCP)
El estándar universal que Sentina utiliza para conectar modelos de IA con herramientas, bases de datos y APIs empresariales. Qué es, cómo funciona, por qué todos los proveedores lo adoptaron y cómo implementarlo en tu negocio.

El panorama de modelos de IA
Nube, local y cómo elegir el modelo correcto. No se trata de "qué modelo es el mejor", sino de "qué modelo es mejor para esta tarea específica en este sistema específico". Un marco de decisión que no caduca como una tabla comparativa.
