transformers · 3 minutos de lectura

De Transformers a Agentes: Por qué un LLM no piensa como un cerebro (y qué le falta para lograrlo)

Los modelos de lenguaje son motores de atención asombrosos, pero su naturaleza estática y feedforward los aleja de cómo funciona un cerebro biológico. Analizamos las limitaciones del Transformer y cómo la arquitectura de memoria en agentes autónomos busca cerrar esa brecha cognitiva.

De Transformers a Agentes: Por qué un LLM no piensa como un cerebro (y qué le falta para lograrlo)
Foto de Growtika en Unsplash

Los modelos de lenguaje actuales son capaces de escribir código complejo, resolver razonamientos lógicos y redactar ensayos en segundos. Sin embargo, detrás de esa aparente fluidez existe una paradoja fundamental: la forma en que un LLM procesa la información está muy lejos de cómo funciona una mente biológica.
Para entender la brecha entre el procesamiento del lenguaje actual y la verdadera cognición continua, conviene conectar tres ideas clave: la arquitectura fundacional de los Transformers, la naturaleza feedforward de los modelos frente a la biología, y el papel de la memoria en los agentes autónomos.

1. El motor de atención: Attention Is All You Need (Vaswani et al., 2017)

El paper de Vaswani y su equipo revolucionó la inteligencia artificial al prescindir de las arquitecturas recurrentes (RNNs) y proponer una idea radical: el mecanismo de autoatención (self-attention).
En lugar de procesar el texto palabra por palabra en una cadena rígida, el Transformer calcula de forma simultánea qué tan relevante es cada palabra respecto a todas las demás dentro de una ventana de contexto.

  • Analogía de red: Puedes visualizar el mecanismo de atención como un grafo de conocimiento dinámico (similar a los enlaces bidireccionales en herramientas como Obsidian). Cuando el modelo analiza una frase, no "recuerda" el pasado; traza conexiones ponderadas entre nodos de información en un espacio vectorial.
  • El límite: Aunque la atención crea representaciones ricas y contextualizadas, el modelo solo opera sobre lo que tiene presente en su ventana activa. Una vez que la ventana se cierra, no queda ningún rastro de estado interno.

2. La paradoja arquitectónica: Los modelos son Feedforward, los cerebros no (Daniel Lenton)

Como expone Daniel Lenton, existe una diferencia estructural insalvable entre una red neuronal artificial típica y el tejido neuronal biológico:

CaracterísticaModelos de Lenguaje (Transformers)Cerebro Biológico
Flujo de señalFeedforward puro: La información viaja en una sola dirección capa por capa.Recurrente y en bucle: Millones de circuitos de retroalimentación constante.
Estado internoEstático durante la inferencia (los pesos están congelados).Dinámico y plástico en tiempo real (plasticidad sináptica continua).
ProcesamientoComputa un token a la vez mediante una pasada hacia adelante (forward pass).Mantiene actividad basal, anticipación y procesamiento paralelo continuo.

Un Transformer no "piensa antes de hablar" ni reflexiona en silencio. Cada palabra que genera es el resultado matemático de un único paso hacia adelante. Si no está emitiendo texto, el modelo está completamente inactivo. Tu cerebro, en cambio, mantiene bucles recurrentes de retroalimentación donde el pensamiento ocurre continuamente, con o sin lenguaje explícito.

3. Cerrando la brecha: Agentes de larga duración y memoria (Yohei Nakajima)

Si los modelos son estáticos y feedforward, ¿cómo construimos sistemas capaces de razonar a largo plazo, aprender de sus errores y ejecutar proyectos complejos?
Aquí es donde entra la arquitectura de agentes autónomos, explorada a fondo por Yohei Nakajima: un modelo congelado actúa como una corteza cerebral (cortex), pero necesita un andamiaje (harness) a su alrededor que decida qué y cómo aprender.

  1. Memoria episódica y semántica: Bases de datos vectoriales y grafos de conocimiento que actúan como hipocampo artificial, permitiendo almacenar y recuperar experiencias previas.
  2. Bucles de ejecución (Loops): Mecanismos externos que reinyectan la salida del modelo como nueva entrada, emulando la recurrencia que la arquitectura base no posee.
  3. Planificación y autorreflexión: Pasos intermedios donde el agente evalúa su propio progreso antes de emitir una acción final.

Conclusión: El Transformer es el procesador, no la mente

El Transformer nos dio el motor de compresión y asociación semántica más potente de la historia. Sin embargo, como nos recuerdan Lenton y Nakajima, un procesador feedforward no constituye una mente por sí solo.
El futuro de la inteligencia artificial no pasa únicamente por entrenar modelos con más parámetros, sino por diseñar arquitecturas cognitivas que aporten recurrencia, memoria viva y persistencia sobre la base del Transformer.

📚 Fuentes y Lecturas Recomendadas

  1. Vaswani, A., Shazeer, N., Parmar, N., Uszkoreit, J., Jones, L., Gomez, A. N., Kaiser, Ł., & Polosukhin, I. (2017). Attention Is All You Need. Advances in Neural Information Processing Systems (NeurIPS 2017). arXiv: 1706.03762.
  2. Lenton, Daniel. Architecture at a glance: models are feedforward, brains are not. Análisis sobre la divergencia computacional entre redes neuronales artificiales y neurobiología.
  3. Nakajima, Yohei. What the Brain Knows About Long-Running Agents. Ensayos sobre la arquitectura de agentes, andamiajes cognitivos (harnesses) y sistemas de memoria a largo plazo.