Arquitectura de un sistema de IA: las 5 capas fundamentales
La arquitectura integral de un sistema de IA: cómo se articulan el frontend, el backend, la orquestación agéntica, los datos y los modelos fundacionales en un entorno de producción real.

Rodrigo Cano
Sentina

Los sistemas de IA también son software
Un sistema de IA no es una categoría mágica de software: es una aplicación estructurada que utiliza un modelo de lenguaje (LLM) como uno de sus componentes. Los principios de ingeniería de software de siempre (modularidad, seguridad, bases de datos, observabilidad) siguen aplicándose casi sin cambios. Lo que sí cambia es la capa de orquestación, que gestiona el contexto, las herramientas y el loop agéntico.
En este artículo analizamos la arquitectura de referencia en sus dos variantes: desarrollo local e infraestructura en la nube.
Principio clave
El modelo (LLM) es solo una pieza del rompecabezas. La mayor parte de la ingeniería reside en la captura del contexto en memoria, la integración segura de herramientas, la persistencia de datos y la orquestación en torno al modelo.
Las 5 capas fundamentales de la arquitectura
Pensar en capas permite aislar responsabilidades, identificar puntos de falla y sustituir componentes sin alterar el resto del sistema:
- 1Presentación / frontend: WhatsApp, interfaz web o panel de administración.
- 2Backend / API: recepción de solicitudes, autenticación y lógica de negocio.
- 3Orquestación agéntica: ensamblaje de contexto, loop agéntico y guardrails.
- 4Capa de datos y almacenamiento: base relacional, base vectorial (pgvector) y archivos.
- 5Proveedores de modelos: APIs de Claude, OpenAI, Gemini o modelos locales.
La capa de orquestación (capa 3) es la más compleja y estratégica: reúne la ingeniería de contexto, las herramientas y las defensas de seguridad. La modularidad por capas permite actualizar modelos o bases de datos sin reescribir la aplicación.
No todo sistema requiere las 5 capas completas
Un asistente simple requiere al menos un frontend, un backend seguro para proteger las credenciales y un modelo. Un agente de sincronización en segundo plano puede prescindir del frontend.
Capa 1: el frontend y presentación
El punto de contacto con el usuario: aplicación web en React + TypeScript con Vite, chat integrado o conectores a canales de mensajería como WhatsApp.
Streaming en tiempo real (SSE)
Server-Sent Events permite transmitir las respuestas token por token al cliente, eliminando la sensación de latencia.
Desarrollo web estándar y modular
La complejidad de la IA reside en el backend; el frontend se enfoca en ofrecer una experiencia fluida con estados transparentes.
Stack de frontend de referencia
React, TypeScript y Vite como base, con Tailwind CSS y shadcn/ui para la interfaz, compilados de forma optimizada y servidos al cliente con alta velocidad.
Capa 2: el backend de aplicación
El servidor de aplicación gestiona la autenticación, coordina la lógica de negocio, persiste el estado de las conversaciones y se comunica de forma segura con los modelos y las bases de datos.
Backend en Python (estándar de IA)
Python es la opción predilecta para IA. Nuestra arquitectura de referencia utiliza FastAPI sobre servidores asíncronos Uvicorn.
Backend en JavaScript / Node.js
Un backend en TypeScript (Next.js, Node.js, Express) permite compartir tipos y modelos en un único lenguaje entre frontend y backend.
El soporte asíncrono es obligatorio
Las llamadas a modelos toman entre 1 y 15 segundos. Tu backend debe procesar peticiones concurrentes de forma no bloqueante mediante una arquitectura asíncrona.
Capa 3: la capa de orquestación agéntica
Es el cerebro de la solución: gestiona la memoria conversacional, recupera el contexto documental, invoca las herramientas y ejecuta el bucle de razonamiento y validación.
Captura de contexto
Selección y ordenamiento estratégico del prompt de sistema, historial, fragmentos RAG y resultados de herramientas en la ventana de contexto.
El bucle agéntico
Ciclo de razonar, actuar y observar, que determina cuándo volver a consultar una herramienta y cuándo entregar la respuesta final al cliente.
Despacho de herramientas
Ejecución controlada de funciones y validación de esquemas JSON devueltos por el modelo.
Guardrails y gestión de memoria
Límites de costo por llamada, filtros de seguridad y políticas de retención y resumen de memoria a largo plazo.
En este nivel operan librerías y frameworks como LangGraph, o se construye lógica de orquestación a medida. En Sentina es donde más horas de ingeniería invertimos en cada proyecto.
Donde se concentra el valor de la arquitectura
El éxito de una implementación de IA empresarial depende de las decisiones en esta capa: guardrails, manejo de excepciones y nivel de autonomía del agente.
Capa 4: datos y almacenamiento
Las soluciones de IA requieren combinar bases relacionales para datos estructurados, bases vectoriales para búsqueda semántica y almacenamiento de documentos en la nube.
Base de datos transaccional
Cuentas, estados de pedidos, historial y configuraciones en PostgreSQL (vía Supabase o bases dedicadas en la nube), con soporte integrado para pgvector, autenticación, datos en tiempo real y almacenamiento de archivos.
Base de datos vectorial (pgvector / Pinecone)
Almacena representaciones vectoriales para búsqueda por similitud semántica, el motor central de RAG.
Base de datos de grafos (Neo4j)
Permite modelar y navegar relaciones complejas entre entidades, clientes y documentos corporativos: grafos de conocimiento, razonamiento multi-paso y ontologías de dominio.
Sincronización en tiempo real
Los paneles interactivos pueden mostrar en tiempo real el estado de procesamiento del agente.
Capa 5: proveedores de modelos
El backend se comunica mediante peticiones HTTPS seguras con proveedores de modelos en la nube o instancias locales de inferencia privada.
Proveedores en la nube (estándar de producción)
OpenAI, Anthropic y Google, además de gateways de ruteo como OpenRouter, conectados a tu backend mediante llamadas HTTP estándar.
Inferencia local / privada
LM Studio y Ollama sirviendo modelos open-weight como Qwen, Llama o Mistral, corriendo en tu propia infraestructura.
El uso de APIs compatibles permite alternar entre modelos en la nube (máxima capacidad) y modelos locales (privacidad estricta o desarrollo) simplemente modificando variables de entorno.
Gateways de ruteo como OpenRouter brindan redundancia automática entre diferentes proveedores de IA.
Desarrollo local vs. producción en la nube
La arquitectura lógica se traduce en componentes concretos según el entorno:
| Componente | Desarrollo local | Producción en la nube |
|---|---|---|
| Frontend | Servidor de desarrollo Vite (localhost:5173) | Cloudflare / Vercel (CDN y edge distribuido) |
| Backend | Servidor FastAPI asíncrono (localhost:8000) | Servidores en la nube (FastAPI + Uvicorn autoescalable) |
| Base de datos | PostgreSQL en Docker o Supabase local | PostgreSQL gestionado con pgvector y backups automáticos |
| Modelos | Modelos locales (Ollama/LM Studio) y APIs | APIs de modelos de frontera (Anthropic, OpenAI, Google) |
| Despliegue | Herramientas de desarrollo asistido | CI/CD automatizado con despliegue continuo |
| Aspecto | Entorno de desarrollo local | Producción empresarial en la nube |
|---|---|---|
| Despliegue | Ejecución directa en consola | CI/CD automatizado con validación |
| Escalabilidad | Proceso único en memoria | Contenedores y serverless con autoescalado |
| Seguridad | Variables .env locales | Gestor de secretos encriptados, HTTPS y OAuth |
| Observabilidad | Logs en consola | Trazabilidad y observabilidad distribuida (Langfuse / Datadog) |
| Costos | Cero costo de infraestructura | Costo por tokens, hosting y base de datos gestionada |
| Dominio | localhost:5173 / localhost:8000 | tudominio.com / api.tudominio.com |
En Sentina nos encargamos de todo el ciclo: diseño, prototipado, despliegue seguro, monitoreo y mantenimiento en la nube.
¿Quieres este tipo de resultado para tu operación?
Mapeemos en conjunto dónde tus sistemas están perdiendo tiempo y dinero, y qué se necesita para resolverlo.
Agendar diagnósticoSeguir leyendo

Interfaces para agentes de IA: del chat a un segundo plano
Cómo interactúan los usuarios y los sistemas con los agentes. La interfaz no es una capa cosmética: moldea la arquitectura, la latencia, la confianza y el control operativo.

¿Qué son los sistemas agénticos y por qué importan?
Una visión estratégica sobre los sistemas agénticos de IA: qué son, cómo funcionan y cómo en Sentina los diseñamos para transformar la operación de tu empresa.

¿Qué es un agente de IA?
De las capacidades de los LLMs a los sistemas autónomos. Entiende qué son los agentes, qué pueden hacer hoy y por qué la definición importa para tomar decisiones de negocio inteligentes.
