Saltar al contenido
Todos los artículos
Agente IA

Arquitectura de un sistema de IA: las 5 capas fundamentales

La arquitectura integral de un sistema de IA: cómo se articulan el frontend, el backend, la orquestación agéntica, los datos y los modelos fundacionales en un entorno de producción real.

Rodrigo Cano

Rodrigo Cano

Sentina

28 de julio de 20268 min de lectura
Arquitectura de un sistema de IA: las 5 capas fundamentales

Los sistemas de IA también son software

Un sistema de IA no es una categoría mágica de software: es una aplicación estructurada que utiliza un modelo de lenguaje (LLM) como uno de sus componentes. Los principios de ingeniería de software de siempre (modularidad, seguridad, bases de datos, observabilidad) siguen aplicándose casi sin cambios. Lo que sí cambia es la capa de orquestación, que gestiona el contexto, las herramientas y el loop agéntico.

En este artículo analizamos la arquitectura de referencia en sus dos variantes: desarrollo local e infraestructura en la nube.

Principio clave

El modelo (LLM) es solo una pieza del rompecabezas. La mayor parte de la ingeniería reside en la captura del contexto en memoria, la integración segura de herramientas, la persistencia de datos y la orquestación en torno al modelo.

Las 5 capas fundamentales de la arquitectura

Pensar en capas permite aislar responsabilidades, identificar puntos de falla y sustituir componentes sin alterar el resto del sistema:

  1. 1Presentación / frontend: WhatsApp, interfaz web o panel de administración.
  2. 2Backend / API: recepción de solicitudes, autenticación y lógica de negocio.
  3. 3Orquestación agéntica: ensamblaje de contexto, loop agéntico y guardrails.
  4. 4Capa de datos y almacenamiento: base relacional, base vectorial (pgvector) y archivos.
  5. 5Proveedores de modelos: APIs de Claude, OpenAI, Gemini o modelos locales.

La capa de orquestación (capa 3) es la más compleja y estratégica: reúne la ingeniería de contexto, las herramientas y las defensas de seguridad. La modularidad por capas permite actualizar modelos o bases de datos sin reescribir la aplicación.

No todo sistema requiere las 5 capas completas

Un asistente simple requiere al menos un frontend, un backend seguro para proteger las credenciales y un modelo. Un agente de sincronización en segundo plano puede prescindir del frontend.

Capa 1: el frontend y presentación

El punto de contacto con el usuario: aplicación web en React + TypeScript con Vite, chat integrado o conectores a canales de mensajería como WhatsApp.

Streaming en tiempo real (SSE)

Server-Sent Events permite transmitir las respuestas token por token al cliente, eliminando la sensación de latencia.

Desarrollo web estándar y modular

La complejidad de la IA reside en el backend; el frontend se enfoca en ofrecer una experiencia fluida con estados transparentes.

Stack de frontend de referencia

React, TypeScript y Vite como base, con Tailwind CSS y shadcn/ui para la interfaz, compilados de forma optimizada y servidos al cliente con alta velocidad.

Capa 2: el backend de aplicación

El servidor de aplicación gestiona la autenticación, coordina la lógica de negocio, persiste el estado de las conversaciones y se comunica de forma segura con los modelos y las bases de datos.

Backend en Python (estándar de IA)

Default

Python es la opción predilecta para IA. Nuestra arquitectura de referencia utiliza FastAPI sobre servidores asíncronos Uvicorn.

Los SDKs de Anthropic, OpenAI y Google son prioritarios en Python.
Ecosistema nativo para orquestación y procesamiento de datos.
Librerías maduras de ciencia de datos (NumPy, pandas).
FastAPI provee soporte asíncrono nativo y documentación automática OpenAPI.

Backend en JavaScript / Node.js

Alternativa

Un backend en TypeScript (Next.js, Node.js, Express) permite compartir tipos y modelos en un único lenguaje entre frontend y backend.

Los SDKs oficiales de JavaScript son altamente estables.
Facilidad de integración de streaming con Vercel AI SDK.
Mismo lenguaje y despliegue unificado entre frontend y backend.
El ecosistema de librerías de ML es más reducido que en Python.

El soporte asíncrono es obligatorio

Las llamadas a modelos toman entre 1 y 15 segundos. Tu backend debe procesar peticiones concurrentes de forma no bloqueante mediante una arquitectura asíncrona.

Capa 3: la capa de orquestación agéntica

Es el cerebro de la solución: gestiona la memoria conversacional, recupera el contexto documental, invoca las herramientas y ejecuta el bucle de razonamiento y validación.

Captura de contexto

Selección y ordenamiento estratégico del prompt de sistema, historial, fragmentos RAG y resultados de herramientas en la ventana de contexto.

El bucle agéntico

Ciclo de razonar, actuar y observar, que determina cuándo volver a consultar una herramienta y cuándo entregar la respuesta final al cliente.

Despacho de herramientas

Ejecución controlada de funciones y validación de esquemas JSON devueltos por el modelo.

Guardrails y gestión de memoria

Límites de costo por llamada, filtros de seguridad y políticas de retención y resumen de memoria a largo plazo.

En este nivel operan librerías y frameworks como LangGraph, o se construye lógica de orquestación a medida. En Sentina es donde más horas de ingeniería invertimos en cada proyecto.

Donde se concentra el valor de la arquitectura

El éxito de una implementación de IA empresarial depende de las decisiones en esta capa: guardrails, manejo de excepciones y nivel de autonomía del agente.

Capa 4: datos y almacenamiento

Las soluciones de IA requieren combinar bases relacionales para datos estructurados, bases vectoriales para búsqueda semántica y almacenamiento de documentos en la nube.

Base de datos transaccional

Relacional

Cuentas, estados de pedidos, historial y configuraciones en PostgreSQL (vía Supabase o bases dedicadas en la nube), con soporte integrado para pgvector, autenticación, datos en tiempo real y almacenamiento de archivos.

Base de datos vectorial (pgvector / Pinecone)

RAG

Almacena representaciones vectoriales para búsqueda por similitud semántica, el motor central de RAG.

Base de datos de grafos (Neo4j)

Relaciones

Permite modelar y navegar relaciones complejas entre entidades, clientes y documentos corporativos: grafos de conocimiento, razonamiento multi-paso y ontologías de dominio.

Sincronización en tiempo real

Los paneles interactivos pueden mostrar en tiempo real el estado de procesamiento del agente.

Capa 5: proveedores de modelos

El backend se comunica mediante peticiones HTTPS seguras con proveedores de modelos en la nube o instancias locales de inferencia privada.

Proveedores en la nube (estándar de producción)

OpenAI, Anthropic y Google, además de gateways de ruteo como OpenRouter, conectados a tu backend mediante llamadas HTTP estándar.

Inferencia local / privada

LM Studio y Ollama sirviendo modelos open-weight como Qwen, Llama o Mistral, corriendo en tu propia infraestructura.

El uso de APIs compatibles permite alternar entre modelos en la nube (máxima capacidad) y modelos locales (privacidad estricta o desarrollo) simplemente modificando variables de entorno.

Gateways de ruteo como OpenRouter brindan redundancia automática entre diferentes proveedores de IA.

Desarrollo local vs. producción en la nube

La arquitectura lógica se traduce en componentes concretos según el entorno:

ComponenteDesarrollo localProducción en la nube
FrontendServidor de desarrollo Vite (localhost:5173)Cloudflare / Vercel (CDN y edge distribuido)
BackendServidor FastAPI asíncrono (localhost:8000)Servidores en la nube (FastAPI + Uvicorn autoescalable)
Base de datosPostgreSQL en Docker o Supabase localPostgreSQL gestionado con pgvector y backups automáticos
ModelosModelos locales (Ollama/LM Studio) y APIsAPIs de modelos de frontera (Anthropic, OpenAI, Google)
DespliegueHerramientas de desarrollo asistidoCI/CD automatizado con despliegue continuo
AspectoEntorno de desarrollo localProducción empresarial en la nube
DespliegueEjecución directa en consolaCI/CD automatizado con validación
EscalabilidadProceso único en memoriaContenedores y serverless con autoescalado
SeguridadVariables .env localesGestor de secretos encriptados, HTTPS y OAuth
ObservabilidadLogs en consolaTrazabilidad y observabilidad distribuida (Langfuse / Datadog)
CostosCero costo de infraestructuraCosto por tokens, hosting y base de datos gestionada
Dominiolocalhost:5173 / localhost:8000tudominio.com / api.tudominio.com

En Sentina nos encargamos de todo el ciclo: diseño, prototipado, despliegue seguro, monitoreo y mantenimiento en la nube.

ArquitecturaBackendOrquestación

¿Quieres este tipo de resultado para tu operación?

Mapeemos en conjunto dónde tus sistemas están perdiendo tiempo y dinero, y qué se necesita para resolverlo.

Agendar diagnóstico

Seguir leyendo