Nueve años después de su introducción, los transformadores se han consolidado como la base fundamental de los modelos de lenguaje grande (LLMs) más destacados en el mercado. Sin embargo, esta tecnología comienza a mostrar limitaciones estructurales que están generando un replanteamiento en la industria. Los recientes avances en LLMs, como el desarrollo de modelos de razonamiento y su capacidad para procesar grandes volúmenes de información, no son simplemente extensiones de la tecnología de transformadores, sino soluciones alternativas que abordan algunas de sus restricciones inherentes. Este panorama ha llevado a un creciente número de científicos e ingenieros a cuestionar cómo evolucionará esta tecnología en los próximos años.
La fortaleza de los transformadores radica en un mecanismo conocido como atención densa, que traduce el significado de un bloque de texto en una serie de números a través de un proceso de comparación exhaustiva entre cada palabra (o token) en el texto. Este enfoque permite capturar el significado con notable precisión. Sin embargo, a medida que aumenta la longitud del texto, el número de cálculos necesarios para procesarlo se incrementa exponencialmente. Un documento de 10,000 palabras podría requerir hasta 50 millones de multiplicaciones, lo que explica en gran medida el alto consumo energético de los LLMs. Se estima que una de las principales empresas del sector destinará alrededor de 50 mil millones de dólares en computación durante el año, y se prevé que el consumo total de electricidad por parte de los centros de datos se duplique para 2030.
Además, los transformadores enfrentan desafíos en lo que respecta a las tareas que los modelos más recientes están diseñados para realizar. Debido a su método de procesamiento palabra por palabra, tienen dificultades para gestionar grandes cantidades de información simultáneamente, lo que limita su capacidad para mantener un contexto amplio. Para que los LLMs puedan abordar tareas más complejas, necesitarán procesar volúmenes aún mayores de datos, lo que podría incluir bibliotecas completas de documentos o bases de código extensas.
En este contexto, una nueva ola de startups está surgiendo con la ambición de expandir los límites de esta tecnología emergente. Aunque algunas de estas iniciativas pueden no alcanzar el éxito, el potencial que tienen es considerable. La evolución de los modelos de lenguaje se presenta como un campo fértil para la innovación, donde estas nuevas empresas podrían desempeñar un papel crucial en la redefinición de la inteligencia artificial en los próximos años. Aunque los LLMs no desaparecerán, la manera en que se diseñan y construyen está en plena transformación.




