Un Nuevo Método Revela los Pensamientos Internos de los Modelos de IA
Recientes investigaciones en el ámbito de la computación han permitido la extracción del "pensamiento" oculto de los modelos de inteligencia artificial (IA) de última generación mientras resuelven problemas complejos. Este descubrimiento tiene implicaciones significativas para la seguridad de los datos y el desarrollo de tecnologías de IA.
Los hallazgos sugieren que algunos modelos desarrollados en China podrían haber sido entrenados a través de la "destilación" de información de razonamiento de modelos estadounidenses, revelando similitudes preocupantes en sus patrones de pensamiento. Aunque los investigadores han encontrado evidencias de estas coincidencias, no se han establecido pruebas concluyentes de causalidad. Además, se ha demostrado que el método puede ser utilizado para recuperar información sensible, como contraseñas y claves de API, aunque esta vulnerabilidad ha sido corregida en modelos recientes.
Alexander Panfilov, un científico de la computación de la Universidad de Tübingen, ha señalado que "todos los principales proveedores de modelos de vanguardia que probamos comparten esta vulnerabilidad", lo que podría llevar a fugas de información personal y a la posibilidad de ataques de destilación de razonamiento a gran escala.
El equipo de investigación, que incluye a expertos de la Universidad de Tübingen, el Instituto Max Planck, MATS Research y la empresa de seguridad Snyk, identificó el mismo problema en modelos de OpenAI, Anthropic y Google, que son accesibles a través de interfaces de programación de aplicaciones (API).
En un documento que detalla estas investigaciones, se muestra que el modelo Kimi K3 de Moonshot AI, que es de peso abierto y descargable, produce resultados sorprendentemente similares a los pasos de razonamiento oculto de modelos como Claude Opus 4.8 y GPT 5.6 Sol. Sin embargo, los investigadores enfatizan que su trabajo no puede establecer de manera causal que se haya llevado a cabo un proceso de destilación. También encontraron que otros modelos de peso abierto, como DeepSeek de China e Inkling de la empresa estadounidense Thinking Machines, no mostraron similitudes de razonamiento con Claude Opus.
La técnica de destilación es ampliamente utilizada para replicar eficientemente las capacidades de modelos existentes en nuevos, y es particularmente común en el desarrollo de modelos de peso abierto. Sin embargo, ha surgido controversia en torno a su uso, ya que se alega que empresas de IA chinas la emplean para imitar modelos estadounidenses de alto rendimiento. En recientes informes, OpenAI comunicó a legisladores estadounidenses que DeepSeek parecía haber copiado uno de sus modelos para desarrollar un modelo de razonamiento llamado R1, mientras que Anthropic alertó que Alibaba había destilado sistemáticamente sus modelos para crear los suyos, denominados Qwen.




