Saltar al contenido
Todos los artículos
Fundamentos de IA

Tokens y ventanas de contexto

La restricción fundamental detrás de cada decisión arquitectónica en IA. Qué son los tokens, cómo funcionan las ventanas de contexto, cómo gestionar su presupuesto y cómo el prompt caching reduce costos hasta un 90%.

Rodrigo Cano

Rodrigo Cano

Sentina

14 de julio de 20266 min de lectura
Tokens y ventanas de contexto

¿Qué son los tokens?

Los tokens son la unidad fundamental con la que operan los LLMs. No son palabras ni caracteres aislados, sino fragmentos de subpalabras que el tokenizador extrae del texto.

Los tokenizadores utilizan algoritmos como Byte Pair Encoding (BPE) para segmentar el texto. Palabras muy frecuentes corresponden a un único token; términos largos o infrecuentes se dividen en varias piezas.

Cómo se tokeniza el texto según su longitud e idioma

Una frase común como "El gato está sobre la mesa" se divide en unos 6 tokens, uno por palabra, porque son palabras frecuentes. Una palabra larga o técnica, en cambio, ocupa la misma cantidad de tokens para una sola palabra: un término como "constitucionalismo" se descompone en varias subpalabras (algo como consti-tucion-alismo).

El idioma también cuesta tokens de forma desigual: "Hello, how are you?" son unos 6 tokens en inglés, pero la misma pregunta en coreano ocupa cerca de 14 tokens, entre 2 y 3 veces más para decir exactamente lo mismo.

Tipo de contenidoRegla de estimaciónEjemplo
Prosa en inglés~1 token por cada 4 caracteres1,000 palabras ~ 1,333 tokens
Código Python~10 tokens por líneaArchivo de 500 líneas ~ 5,000 tokens
Código JavaScript / TS~7 tokens por líneaArchivo de 500 líneas ~ 3,500 tokens
Estructura JSON~2x respecto a texto plano1KB JSON ~ 500 tokens
Idiomas no ingleses (CJK)2-3x el inglés para el mismo contenidoMismo significado ~ 2,500-4,000 tokens
Una página de texto~250 palabras~300-350 tokens

Cada modelo tokeniza distinto

El mismo email de 500 palabras produce una cantidad distinta de tokens en GPT-4o, Claude, Gemini y Llama. Cada familia de modelos tiene su propio tokenizador (tiktoken, SentencePiece, etc.) con vocabularios de tamaños distintos (de 65K a 262K tokens). No puedes comparar el precio por token entre modelos sin contar los tokens de tu contenido real con el tokenizador de cada uno. Un modelo "más barato por token" puede terminar dividiendo tu texto en más piezas.

¿Qué es una ventana de contexto?

La ventana de contexto es el presupuesto total de tokens para una interacción con el modelo. Todo lo que el modelo puede ver (la entrada) y todo lo que genera (la salida) debe caber dentro de esa ventana. Es como el tamaño del escritorio del modelo: todo lo que necesita leer y escribir tiene que caber ahí al mismo tiempo.

Es un límite estricto, no una guía flexible. Superarlo produce truncamiento, errores o pérdida silenciosa de datos. Entender qué significan estos números en la práctica condiciona casi cualquier decisión arquitectónica.

Tamaño de contextoEquivalente práctico
8K tokens~24 páginas, un post de blog largo
32K tokens~100 páginas, un libro corto
128K tokens~400 páginas, una novela completa
256-400K tokens~800-1,250 páginas, un libro de texto extenso
1M tokens~3,000 páginas, una biblioteca personal completa
10M tokens~30,000 páginas, una biblioteca pequeña

Por qué importa esto

Cuando leas que "Claude Opus tiene una ventana de contexto de 1M tokens", conviene saber qué significa en la práctica: unas 3,000 páginas, el equivalente a una biblioteca completa de manuales técnicos, 125 veces más espacio que un modelo con ventana de 8K. Estos números determinan qué arquitecturas son viables.

Qué llena la ventana de contexto

La ventana de contexto es un presupuesto compartido. Cada componente del sistema compite por el mismo espacio: instrucciones del sistema, historial de conversación, documentos recuperados, resultados de herramientas y la salida del propio modelo. Es un juego de suma cero: más espacio para uno significa menos para el resto.

Presupuesto de contexto: chatbot simple (ventana de 128K)

  • System prompt: ~6K
  • Historial de conversación: ~70K
  • Output: ~32K
  • Buffer: ~20K

Presupuesto de contexto: sistema RAG (ventana de 128K)

  • System prompt: ~10K
  • Historial: ~19K
  • Documentos recuperados: ~64K
  • Output: ~19K
  • Buffer: ~16K

Presupuesto de contexto: sistema agéntico (ventana de 128K)

  • System: ~13K
  • Definiciones de herramientas: ~10K
  • Historial: ~13K
  • Resultados de herramientas: ~38K
  • Razonamiento previo: ~26K
  • Output: ~15K

El trade-off de suma cero

En el sistema RAG, los documentos recuperados consumen la mayor parte del presupuesto, dejando mucho menos espacio para el historial de conversación. En el sistema agéntico dominan las definiciones de herramientas, los resultados de herramientas y el razonamiento previo. Cada decisión sobre qué incluir en el contexto es también una decisión sobre qué queda afuera. Por eso existen los sistemas de recuperación: no cabe toda la base de conocimiento en la ventana, así que se selecciona solo lo más relevante en tiempo de ejecución.

Tokens de entrada (prompt) vs. tokens de salida (generación)

Los tokens de entrada y de salida no se tratan igual: difieren en costo, en los límites de capacidad y en cómo afectan la latencia. Esta asimetría tiene implicaciones importantes para el diseño del sistema.

Tokens de entrada (prompt)

Todo lo que envías al modelo (system prompt, historial, documentos recuperados, definiciones de herramientas). Se procesan en paralelo, así que son rápidos, y cuestan menos por token.

Tokens de salida (generación)

Todo lo que el modelo genera (respuestas, razonamiento, llamadas a herramientas). Se generan de forma secuencial, así que son más lentos, y cuestan entre 4 y 5 veces más que la entrada.

TipoPrecioDetalle
Entrada$3por millón de tokens
Salida$15por millón de tokens (5x)
Entrada en caché$0.30por millón de tokens (90% de descuento)
Ventana de contextoSalida máximaProporción
200K8K4% de la ventana
128K4K3% de la ventana
1M8K0.8% de la ventana
1M64K6.4% de la ventana
1M128K12.8% de la ventana
400K128K32% de la ventana

Estos son ejemplos. Los números cambian con cada modelo nuevo, pero el patrón se mantiene: la salida máxima suele ser una fracción pequeña de la ventana de contexto total.

Tokens de pensamiento: el costo oculto

Los modelos con razonamiento extendido usan "tokens de pensamiento" que se facturan como tokens de salida pero no aparecen en la respuesta visible. Un modelo puede usar 30K tokens de pensamiento para razonar un problema complejo antes de dar una respuesta de 500 tokens. Esos 30K tokens se facturan a la tarifa cara de salida. Para Claude Sonnet, eso son $0.45 solo en pensamiento. Esto cambia bastante la economía de las tareas con mucho razonamiento.

El fenómeno "Lost in the Middle"

Una ventana de contexto más grande no significa mejor desempeño de forma lineal. La investigación de Liu et al. (2024) muestra que los modelos prestan atención desproporcionada a la información al principio y al final del contexto, con una degradación notable para el contenido que queda en el medio. Es uno de los hallazgos prácticos más importantes para quien diseña arquitecturas de IA.

La atención del modelo es alta al inicio y al final del contexto, y cae con fuerza en el medio: la "zona perdida".

Las agujas pequeñas son más difíciles de encontrar

Un estudio de seguimiento de 2025 mostró que cuando el pasaje relevante es corto en relación con el contexto que lo rodea, el desempeño cae con fuerza en todos los modelos evaluados. Una sola oración clave enterrada entre 100K tokens de texto puede volverse prácticamente invisible para el modelo.

La calidad se degrada en la práctica después de ~32K

Incluso los modelos con ventanas de 128K o más muestran caídas de desempeño medibles en tareas reales después de ~32K tokens. El número de la ficha técnica y el número realmente utilizable no son lo mismo.

La latencia escala de forma no lineal

El cómputo de atención crece de forma cuadrática con el largo del contexto. Duplicar el contexto más que duplica el tiempo de procesamiento. Un estudio midió un aumento de latencia de 7x con 15,000 palabras de contexto.

TokensContextoPrompt caching

¿Quieres este tipo de resultado para tu operación?

Mapeemos en conjunto dónde tus sistemas están perdiendo tiempo y dinero, y qué se necesita para resolverlo.

Agendar diagnóstico

Seguir leyendo