Saltar al contenido
Todos los artículos
Fundamentos de IA

Cómo funcionan los LLMs: modelos mentales y sus límites

Entiende el motor que impulsa cada sistema de IA para razonar sobre sus fortalezas, debilidades e implicaciones de diseño: predicción de tokens, entrenamiento, alucinaciones y razonamiento.

Rodrigo Cano

Rodrigo Cano

Sentina

7 de julio de 20269 min de lectura
Cómo funcionan los LLMs: modelos mentales y sus límites

La mecánica central: predicción del siguiente token

Un LLM hace una sola cosa: dado todo el texto hasta el momento, predice el token más probable que viene después. Un token es aproximadamente una palabra o parte de una palabra. El modelo genera su respuesta un token a la vez, y cada nuevo token está influido por todo lo que ha venido antes. Eso es todo. Esa única mecánica explica prácticamente cada fortaleza y debilidad que encontrarás al diseñar sistemas de IA.

El principio clave

El modelo no está buscando en una base de datos. No está "pensando" como lo hacen los humanos. Está prediciendo qué texto es más probable que venga después, basándose en patrones que aprendió durante el entrenamiento. Esta distinción es fundamental para todo lo que cubrimos en esta guía.

Un ejemplo concreto: ante la secuencia "La capital de Francia es", el modelo calcula una probabilidad para cada token posible de su vocabulario y elige entre los más probables.

Token candidatoProbabilidad
Paris92%
Lyon3%
una2%
de1%

En cada paso, el modelo produce una probabilidad a través de todo su vocabulario (frecuentemente 100,000+ tokens) y muestrea de esa distribución. El token seleccionado se convierte en parte de la entrada para la siguiente predicción.

Modelos mentales útiles

  • Andrej Karpathy: "compresión con pérdida de internet". El modelo ha comprimido enormes cantidades de conocimiento humano en patrones estadísticos. Como un JPEG, la imagen general se preserva, pero los detalles finos pueden estar mal o ser inventados. Esto explica tanto su amplia cobertura como sus datos específicos poco confiables.
  • Simon Willison: "un becario capaz pero excesivamente confiado". Puede manejar un rango enorme de tareas de manera competente. También producirá respuestas incorrectas con total confianza y sin dudar. No dejarías que un becario tome decisiones críticas sin supervisión, y no deberías dejar que un LLM lo haga tampoco.
  • Ted Chiang: "un JPEG borroso de la web". Cuando haces una pregunta, no estás obteniendo una búsqueda precisa. Estás obteniendo una reconstrucción de una representación comprimida. A veces la reconstrucción es perfecta. A veces llena detalles que no estaban ahí.

Piensa en la "psicología del LLM"

El consejo de Karpathy: entender las tendencias, sesgos y modos de falla de un LLM es mucho más útil para los arquitectos que entender su arquitectura interna. Piénsalo como manejar a un miembro del equipo: necesitas saber en qué es bueno, dónde cometerá errores y cómo prepararlo para el éxito.

Implicaciones de la predicción de tokens

El corte de conocimiento (knowledge cutoff)

El conocimiento del modelo está congelado en el punto donde terminó su entrenamiento. No puede saber eventos que ocurrieron después. Si necesitas información actual, debes proveerla mediante recuperación (RAG) o uso de herramientas.

Sin aprendizaje de las conversaciones

Los modelos son estáticos después del despliegue. No aprenden de tus interacciones. Si tu sistema necesita acumular conocimiento, debes diseñar la capa de memoria y almacenamiento tú mismo. En Sentina diseñamos esa capa de memoria según las necesidades de cada solución.

Patrones, no datos

El modelo aprendió asociaciones estadísticas entre conceptos, no una base de datos relacional de hechos. "Sabe" que París es la capital de Francia de la misma manera que "sabe" qué consejo médico plausible sigue a un síntoma. Ambos son patrones, pero solo uno es un hecho verificable.

El error #1

Los LLMs no recuperan información. Generan basándose en patrones. Confundir esto es una causa común de malas decisiones arquitectónicas. Un arquitecto que trata a un LLM como una base de datos de conocimiento construirá sistemas poco confiables. Un arquitecto que lo entiende como un motor de predicción diseñará capas apropiadas de verificación, recuperación y guardrails.

Cómo se crean los modelos

Los modelos que usamos de Anthropic, OpenAI y Google no comenzaron como asistentes listos para conversar. Comenzaron como predictores de texto en bruto y se refinaron mediante etapas sucesivas:

  1. 1Texto en bruto: trillones de tokens recopilados de internet, libros y otras fuentes.
  2. 2Modelo base: predice texto, pero todavía no sabe conversar ni seguir instrucciones.
  3. 3Ajuste de instrucciones (SFT): aprende a seguir órdenes y mantener conversaciones.
  4. 4Alineamiento (RLHF / DPO): se ajusta para ser útil, inofensivo y honesto.

El modelo base aprende lenguaje y conocimiento del texto en bruto. El ajuste de instrucciones le enseña a seguir órdenes y mantener conversaciones. El alineamiento lo hace seguro, cooperativo y predecible.

Fine-tuning (opcional)

Es posible seguir entrenando un modelo con datos propios de tu empresa para crear una versión especializada (voz de marca, terminología de industria, formatos específicos). En Sentina evaluamos si tu caso realmente lo requiere: en la mayoría de los casos, una buena arquitectura de prompts y recuperación (RAG) resuelve la necesidad más rápido y a menor costo.

Destilación

Los modelos más pequeños pueden entrenarse para imitar las salidas de modelos más grandes. Por eso un modelo compacto puede ser capaz de tareas complejas: aprendió de la "enseñanza" de un modelo mucho más grande, lo que permite ofrecer opciones más rápidas y baratas que aún funcionan bien.

Cómo el modelo elige sus palabras

El modelo calcula una probabilidad para cada token posible, pero ¿cómo decide cuál elegir? Los parámetros de muestreo controlan esta selección:

TemperaturaModoComportamiento
0.0DeterminísticoSiempre elige el token con mayor probabilidad. Ideal para clasificación, JSON estructurado y extracción de datos.
0.7BalanceadoMuestreo equilibrado. Respuestas naturales y fluidas. El valor estándar para asistentes y soporte.
1.2+CreativoExplora tokens menos probables. Ideal para brainstorming, generación de ideas y redacción creativa.

Temperatura 0 no es verdaderamente determinística

Incluso con temperatura 0, el mismo prompt puede producir salidas ligeramente diferentes entre ejecuciones debido al batching del servidor y diferencias de punto flotante. Ejecutar el mismo prompt 1,000 veces con temperatura 0 puede producir docenas de variaciones. Diseña para robustez ante variaciones menores, no para reproducibilidad exacta bit a bit. Los parámetros de seed ayudan, pero son "mayormente determinísticos" en el mejor caso.

Alucinaciones: el modo de fallo fundamental

Una "alucinación" ocurre cuando el modelo genera información que suena plausible pero es fácticamente incorrecta o completamente inventada. Esto no es un bug en el código del LLM: es una consecuencia directa de la predicción de tokens.

Patrones fuertes vs. débiles

Para hechos comunes ("capital de Francia → París"), los datos de entrenamiento tienen un patrón abrumadoramente consistente. Para hechos específicos ("fundado en el año → 1998"), el patrón estadístico es débil y el modelo completa con la fecha que suene más plausible.

Completar a toda costa

El objetivo del modelo es completar la secuencia, no decir "no lo sé" (a menos que haya sido alineado específicamente para ello). Si le pides una cita de un libro que no conoce, inventará una que coincida con el estilo del autor.

La alucinación es matemáticamente inevitable

Un paper de investigación de 2024 demostró formalmente que la alucinación es inevitable en LLMs usados como resolutores de problemas generales: no pueden aprender todas las funciones computables. Esto significa que la alucinación se puede reducir mediante alineamiento, recuperación y verificación, pero nunca eliminarla. Diseña tu arquitectura sabiendo esto.

Cómo el modelo procesa su entrada

El mecanismo de autoatención permite que cada token "atienda" a todos los demás tokens en el contexto. Sin embargo, la atención no es uniforme a lo largo de toda la ventana:

Implicación de diseño: el efecto "perdido en el medio"

Los modelos prestan mayor atención a la información situada al principio (efecto de primacía) y al final (efecto de recencia) de su contexto. La información en el medio sufre una degradación medible de atención. Coloca siempre las instrucciones críticas y la evidencia más relevante en los extremos de tu prompt.

Razonamiento: qué pueden y qué no pueden hacer

Los LLMs pueden producir razonamiento paso a paso, análisis y síntesis impresionantes. Pero la pregunta clave para los arquitectos no es si "piensan", sino si el comportamiento es lo suficientemente confiable para tu caso de uso.

Lo que funciona

Fortalezas
Análisis paso a paso de problemas bien estructurados.
Transformación y traducción de formatos (JSON, SQL, Markdown).
Síntesis de múltiples documentos con evidencia explícita.
Clasificación y extracción semántica precisa.

Dónde falla

Límites
Operaciones aritméticas complejas sin herramientas de cálculo.
Razonamiento espacial y conteo exacto de caracteres o palabras.
Planes de más de 10 pasos sin bucles de verificación intermedia.
Casos extremos novedosos no representados en el entrenamiento.

Modelos de razonamiento: cómputo en tiempo de inferencia

Modelos como o1 y o3 de OpenAI, o DeepSeek-R1, generan "tokens de pensamiento" ocultos antes de responder. Esto les permite explorar ramas de solución, autocorregirse y verificar hipótesis antes de entregar el resultado final.

Hallazgo clave

Un modelo de razonamiento más pequeño puede superar a un modelo estándar más grande. La precisión mejora logarítmicamente con los tokens de pensamiento: ganancias grandes al inicio, rendimientos decrecientes después. Cubrimos la selección de modelos en profundidad en nuestro artículo sobre el panorama de modelos.

Multimodal: más allá del texto

Los modelos modernos procesan imágenes, audio y video convirtiéndolos en representaciones vectoriales que se integran en el mismo espacio conceptual que el texto:

Visión

Las imágenes se dividen en parches (típicamente de 16x16 píxeles), y cada parche se convierte en un token. Una sola imagen de alta resolución puede consumir miles de tokens de la ventana de contexto. El modelo procesa los tokens de imagen y texto a través de la misma arquitectura.

Audio y video

El audio se divide en segmentos que se convierten en tokens. El video se procesa cuadro por cuadro, cada cuadro tokenizado como una imagen. Ambos siguen el mismo patrón de convertir a tokens y procesar de forma uniforme.

Conceptos erróneos comunes

  • "Los LLMs recuperan información de sus datos de entrenamiento": en realidad, generan basándose en patrones aprendidos. No hay búsqueda ni consulta a base de datos. La distinción importa porque explica por qué pueden estar equivocados con total confianza.
  • "Aprenden de nuestras conversaciones": los modelos son estáticos después del despliegue. Cada sesión empieza desde el mismo estado entrenado. La memoria, el aprendizaje y la acumulación de conocimiento deben diseñarse explícitamente en tu sistema.
  • "Las alucinaciones se arreglarán en la siguiente versión del modelo": está demostrado matemáticamente que son inevitables en LLMs de propósito general. Los modelos futuros alucinarán con menos frecuencia, pero la propiedad no puede eliminarse. Diseña la mitigación en tu arquitectura.
  • "Temperatura 0 significa salida determinística": factores del lado del servidor hacen que aún ocurran variaciones menores. Construye sistemas robustos a pequeñas diferencias de salida en lugar de esperar reproducibilidad exacta.
  • "Si funciona en una demo, funcionará en producción": los LLMs son amplios y superficiales. Una tarea que tiene éxito el 90% del tiempo fallará el 10%, sin advertencia. Extrapolar de demos a confiabilidad en producción es el error arquitectónico más común.
  • "Más contexto siempre es mejor": las ventanas de contexto más largas ayudan, pero la degradación de atención (el problema "perdido en el medio") significa que más no siempre es mejor. La calidad y el posicionamiento del contexto importan más que la cantidad.

Resumen de modelos mentales

Motores de predicción

Los LLMs predicen el siguiente token más probable. No recuperan, no buscan ni razonan desde primeros principios. Este único hecho moldea todo lo demás.

Entrenado en etapas

El preentrenamiento construye conocimiento; el ajuste de instrucciones añade seguimiento de órdenes; la optimización de preferencias añade alineamiento.

La alucinación es inherente

Es una consecuencia directa de la predicción estadística. Se mitiga mediante recuperación (RAG), prompts estructurados y validación, pero nunca se elimina por completo.

Razonamiento capaz pero frágil

Fuerte en problemas bien estructurados, frágil en casos extremos novedosos. Los modelos de razonamiento añaden cómputo en tiempo de inferencia, pero no eliminan la fragilidad.

La posición importa

La atención no es uniforme a lo largo del contexto. La información crítica debe colocarse al inicio o al final para evitar la degradación en el centro.

Estático después del despliegue

Los modelos no aprenden del uso. El conocimiento, la memoria y la adaptación deben diseñarse explícitamente en la arquitectura de tu sistema.

LLMsModelos de lenguajeIA generativa

¿Quieres este tipo de resultado para tu operación?

Mapeemos en conjunto dónde tus sistemas están perdiendo tiempo y dinero, y qué se necesita para resolverlo.

Agendar diagnóstico

Seguir leyendo