Revisada el 2026-10-09

El Transformer es la arquitectura de red neuronal, presentada por investigadores de Google en 2017, sobre la que se construyen normalmente los grandes modelos de lenguaje.12

Su idea central es la atención: cada token mira a todos los demás del texto y decide cuáles le importan. Como no lee palabra a palabra, se puede entrenar en paralelo, y eso abrió la puerta a modelos cada vez más grandes.13

Origen

  • Lo presentó el artículo «Attention Is All You Need», de Ashish Vaswani y otros siete autores, publicado en arXiv el 12 de junio de 2017 y presentado en la conferencia NeurIPS de ese año.12
  • Su propuesta: prescindir de las redes recurrentes y de las convoluciones, y basarse solo en mecanismos de atención.1
  • Nació para la traducción automática. Superó en más de 2 puntos BLEU lo mejor publicado en inglés-alemán y alcanzó 41,8 en inglés-francés tras 3,5 días de entrenamiento con ocho GPU, una fracción del coste de los mejores modelos de entonces.1

Cómo funciona, sin matemáticas

  • Cada token se convierte en un vector de números (embedding) que representa su significado.4
  • Atención. Para afinar el significado de cada palabra, el modelo la compara con todas las demás, puntúa cuánto le importa cada una y mezcla esa información. En el ejemplo de Google, en «I arrived at the bank after crossing the river», la palabra river (río) le basta para saber que bank es la orilla y no el banco.3
  • Varias «cabezas» de atención trabajan a la vez, y cada una puede fijarse en un tipo de relación distinto.1
  • Como no lee en orden, a cada token se le añade información sobre su posición en el texto.1
  • Todo eso se repite en capas apiladas: seis en el codificador y seis en el decodificador del modelo original.1 Los modelos de tipo GPT usan solo la parte decodificadora; BERT, solo la codificadora.4
  • En un modelo de lenguaje, la salida final es la probabilidad de cada posible siguiente token, calculada a partir de los anteriores.5

Por qué permitió escalar

  • Las redes recurrentes procesan el texto posición a posición, y esa secuencia impide paralelizar dentro de cada ejemplo. El transformer conecta todas las posiciones con un número fijo de pasos secuenciales.1
  • Encaja con el hardware actual (GPU y TPU, pensadas para trabajo en paralelo). Google habló de entrenamientos hasta un orden de magnitud más rápidos.3
  • Esa facilidad para paralelizar fue un factor importante en su adopción en redes muy grandes.4
  • En 2020, un estudio vio que el rendimiento de los modelos de lenguaje mejora de forma predecible al crecer el modelo, los datos y el cómputo, a lo largo de más de siete órdenes de magnitud. Detalles como el ancho o la profundidad de la red importaban poco.6
  • El salto de tamaño: el transformer grande de 2017 tenía 213 millones de parámetros;1 GPT-3, en 2020, 175.000 millones, diez veces más que cualquier modelo de lenguaje no disperso anterior.7
  • El precio: el coste de la atención crece con el cuadrado de la longitud del texto, en cálculo y en memoria.4 Sus efectos prácticos están en ventana de contexto.
  • Hoy se usa también en visión, audio, aprendizaje por refuerzo y robótica.4

Cómo lo uso

Sin uso propio documentado todavía.

Véase también

Referencias

Footnotes

  1. Attention Is All You Need. Ashish Vaswani et al., arXiv, v1 de 2017-06-12 (v7 de 2023-08-02): resumen y apartados 1, 3.1, 3.2.2, 3.5, 4, 5.2 y tabla 3. Consultado el 2026-10-09. ↩ ↩2 ↩3 ↩4 ↩5 ↩6 ↩7 ↩8 ↩9 ↩10

  2. Large language model. Wikipedia, revisión 1379150649. Consultado el 2026-10-09. ↩ ↩2

  3. Transformer: A Novel Neural Network Architecture for Language Understanding. Jakob Uszkoreit, Google Research, 2017-08-31. Consultado el 2026-10-09. ↩ ↩2 ↩3

  4. Transformer (deep learning). Wikipedia, revisión 1379269363. Consultado el 2026-10-09. ↩ ↩2 ↩3 ↩4 ↩5

  5. Foundations of Large Language Models. Tong Xiao y Jingbo Zhu, arXiv, v4 de 2026-10-08, apartado 1.2.1. Consultado el 2026-10-09. ↩

  6. Scaling Laws for Neural Language Models. Jared Kaplan et al., arXiv, 2020-01-23. Consultado el 2026-10-09. ↩

  7. Language Models are Few-Shot Learners. Tom B. Brown et al., arXiv, 2020-05-28. Consultado el 2026-10-09. ↩