Tokens y ventanas de contexto
La restricción fundamental detrás de cada decisión arquitectónica en IA. Qué son los tokens, cómo funcionan las ventanas de contexto, cómo gestionar su presupuesto y cómo el prompt caching reduce costos hasta un 90%.

Rodrigo Cano
Sentina

¿Qué son los tokens?
Los tokens son la unidad fundamental con la que operan los LLMs. No son palabras ni caracteres aislados, sino fragmentos de subpalabras que el tokenizador extrae del texto.
Los tokenizadores utilizan algoritmos como Byte Pair Encoding (BPE) para segmentar el texto. Palabras muy frecuentes corresponden a un único token; términos largos o infrecuentes se dividen en varias piezas.
Cómo se tokeniza el texto según su longitud e idioma
Una frase común como "El gato está sobre la mesa" se divide en unos 6 tokens, uno por palabra, porque son palabras frecuentes. Una palabra larga o técnica, en cambio, ocupa la misma cantidad de tokens para una sola palabra: un término como "constitucionalismo" se descompone en varias subpalabras (algo como consti-tucion-alismo).
El idioma también cuesta tokens de forma desigual: "Hello, how are you?" son unos 6 tokens en inglés, pero la misma pregunta en coreano ocupa cerca de 14 tokens, entre 2 y 3 veces más para decir exactamente lo mismo.
| Tipo de contenido | Regla de estimación | Ejemplo |
|---|---|---|
| Prosa en inglés | ~1 token por cada 4 caracteres | 1,000 palabras ~ 1,333 tokens |
| Código Python | ~10 tokens por línea | Archivo de 500 líneas ~ 5,000 tokens |
| Código JavaScript / TS | ~7 tokens por línea | Archivo de 500 líneas ~ 3,500 tokens |
| Estructura JSON | ~2x respecto a texto plano | 1KB JSON ~ 500 tokens |
| Idiomas no ingleses (CJK) | 2-3x el inglés para el mismo contenido | Mismo significado ~ 2,500-4,000 tokens |
| Una página de texto | ~250 palabras | ~300-350 tokens |
Cada modelo tokeniza distinto
El mismo email de 500 palabras produce una cantidad distinta de tokens en GPT-4o, Claude, Gemini y Llama. Cada familia de modelos tiene su propio tokenizador (tiktoken, SentencePiece, etc.) con vocabularios de tamaños distintos (de 65K a 262K tokens). No puedes comparar el precio por token entre modelos sin contar los tokens de tu contenido real con el tokenizador de cada uno. Un modelo "más barato por token" puede terminar dividiendo tu texto en más piezas.
¿Qué es una ventana de contexto?
La ventana de contexto es el presupuesto total de tokens para una interacción con el modelo. Todo lo que el modelo puede ver (la entrada) y todo lo que genera (la salida) debe caber dentro de esa ventana. Es como el tamaño del escritorio del modelo: todo lo que necesita leer y escribir tiene que caber ahí al mismo tiempo.
Es un límite estricto, no una guía flexible. Superarlo produce truncamiento, errores o pérdida silenciosa de datos. Entender qué significan estos números en la práctica condiciona casi cualquier decisión arquitectónica.
| Tamaño de contexto | Equivalente práctico |
|---|---|
| 8K tokens | ~24 páginas, un post de blog largo |
| 32K tokens | ~100 páginas, un libro corto |
| 128K tokens | ~400 páginas, una novela completa |
| 256-400K tokens | ~800-1,250 páginas, un libro de texto extenso |
| 1M tokens | ~3,000 páginas, una biblioteca personal completa |
| 10M tokens | ~30,000 páginas, una biblioteca pequeña |
Por qué importa esto
Cuando leas que "Claude Opus tiene una ventana de contexto de 1M tokens", conviene saber qué significa en la práctica: unas 3,000 páginas, el equivalente a una biblioteca completa de manuales técnicos, 125 veces más espacio que un modelo con ventana de 8K. Estos números determinan qué arquitecturas son viables.
Qué llena la ventana de contexto
La ventana de contexto es un presupuesto compartido. Cada componente del sistema compite por el mismo espacio: instrucciones del sistema, historial de conversación, documentos recuperados, resultados de herramientas y la salida del propio modelo. Es un juego de suma cero: más espacio para uno significa menos para el resto.
Presupuesto de contexto: chatbot simple (ventana de 128K)
System prompt: ~6K Historial de conversación: ~70K Output: ~32K Buffer: ~20K
Presupuesto de contexto: sistema RAG (ventana de 128K)
System prompt: ~10K Historial: ~19K Documentos recuperados: ~64K Output: ~19K Buffer: ~16K
Presupuesto de contexto: sistema agéntico (ventana de 128K)
System: ~13K Definiciones de herramientas: ~10K Historial: ~13K Resultados de herramientas: ~38K Razonamiento previo: ~26K Output: ~15K
El trade-off de suma cero
En el sistema RAG, los documentos recuperados consumen la mayor parte del presupuesto, dejando mucho menos espacio para el historial de conversación. En el sistema agéntico dominan las definiciones de herramientas, los resultados de herramientas y el razonamiento previo. Cada decisión sobre qué incluir en el contexto es también una decisión sobre qué queda afuera. Por eso existen los sistemas de recuperación: no cabe toda la base de conocimiento en la ventana, así que se selecciona solo lo más relevante en tiempo de ejecución.
Tokens de entrada (prompt) vs. tokens de salida (generación)
Los tokens de entrada y de salida no se tratan igual: difieren en costo, en los límites de capacidad y en cómo afectan la latencia. Esta asimetría tiene implicaciones importantes para el diseño del sistema.
Tokens de entrada (prompt)
Todo lo que envías al modelo (system prompt, historial, documentos recuperados, definiciones de herramientas). Se procesan en paralelo, así que son rápidos, y cuestan menos por token.
Tokens de salida (generación)
Todo lo que el modelo genera (respuestas, razonamiento, llamadas a herramientas). Se generan de forma secuencial, así que son más lentos, y cuestan entre 4 y 5 veces más que la entrada.
| Tipo | Precio | Detalle |
|---|---|---|
| Entrada | $3 | por millón de tokens |
| Salida | $15 | por millón de tokens (5x) |
| Entrada en caché | $0.30 | por millón de tokens (90% de descuento) |
| Ventana de contexto | Salida máxima | Proporción |
|---|---|---|
| 200K | 8K | 4% de la ventana |
| 128K | 4K | 3% de la ventana |
| 1M | 8K | 0.8% de la ventana |
| 1M | 64K | 6.4% de la ventana |
| 1M | 128K | 12.8% de la ventana |
| 400K | 128K | 32% de la ventana |
Estos son ejemplos. Los números cambian con cada modelo nuevo, pero el patrón se mantiene: la salida máxima suele ser una fracción pequeña de la ventana de contexto total.
Tokens de pensamiento: el costo oculto
Los modelos con razonamiento extendido usan "tokens de pensamiento" que se facturan como tokens de salida pero no aparecen en la respuesta visible. Un modelo puede usar 30K tokens de pensamiento para razonar un problema complejo antes de dar una respuesta de 500 tokens. Esos 30K tokens se facturan a la tarifa cara de salida. Para Claude Sonnet, eso son $0.45 solo en pensamiento. Esto cambia bastante la economía de las tareas con mucho razonamiento.
El fenómeno "Lost in the Middle"
Una ventana de contexto más grande no significa mejor desempeño de forma lineal. La investigación de Liu et al. (2024) muestra que los modelos prestan atención desproporcionada a la información al principio y al final del contexto, con una degradación notable para el contenido que queda en el medio. Es uno de los hallazgos prácticos más importantes para quien diseña arquitecturas de IA.
La atención del modelo es alta al inicio y al final del contexto, y cae con fuerza en el medio: la "zona perdida".
Las agujas pequeñas son más difíciles de encontrar
Un estudio de seguimiento de 2025 mostró que cuando el pasaje relevante es corto en relación con el contexto que lo rodea, el desempeño cae con fuerza en todos los modelos evaluados. Una sola oración clave enterrada entre 100K tokens de texto puede volverse prácticamente invisible para el modelo.
La calidad se degrada en la práctica después de ~32K
Incluso los modelos con ventanas de 128K o más muestran caídas de desempeño medibles en tareas reales después de ~32K tokens. El número de la ficha técnica y el número realmente utilizable no son lo mismo.
La latencia escala de forma no lineal
El cómputo de atención crece de forma cuadrática con el largo del contexto. Duplicar el contexto más que duplica el tiempo de procesamiento. Un estudio midió un aumento de latencia de 7x con 15,000 palabras de contexto.
¿Quieres este tipo de resultado para tu operación?
Mapeemos en conjunto dónde tus sistemas están perdiendo tiempo y dinero, y qué se necesita para resolverlo.
Agendar diagnósticoSeguir leyendo

Protocolo de Contexto de Modelo (MCP)
El estándar universal que Sentina utiliza para conectar modelos de IA con herramientas, bases de datos y APIs empresariales. Qué es, cómo funciona, por qué todos los proveedores lo adoptaron y cómo implementarlo en tu negocio.

El panorama de modelos de IA
Nube, local y cómo elegir el modelo correcto. No se trata de "qué modelo es el mejor", sino de "qué modelo es mejor para esta tarea específica en este sistema específico". Un marco de decisión que no caduca como una tabla comparativa.

Cómo funcionan los LLMs: modelos mentales y sus límites
Entiende el motor que impulsa cada sistema de IA para razonar sobre sus fortalezas, debilidades e implicaciones de diseño: predicción de tokens, entrenamiento, alucinaciones y razonamiento.
