En un descubrimiento que podría redefinir la comprensión de la seguridad en la inteligencia artificial, un equipo de científicos informáticos ha encontrado una manera de extraer los procesos internos de los modelos de IA más avanzados. Este hallazgo no solo revela posibles vulnerabilidades en la protección de la información personal, sino que también plantea preguntas sobre la práctica de la destilación de modelos de IA.
Los investigadores, liderados por Alexander Panfilov de la Universidad de Tübingen, han demostrado que ciertos modelos chinos podrían haber sido entrenados utilizando información de razonamiento de modelos estadounidenses, aparentemente oculta. Este proceso, conocido como destilación, es una técnica ampliamente utilizada para copiar las capacidades de modelos existentes a nuevos sistemas.
La vulnerabilidad en los modelos de IA
El equipo de Panfilov identificó una vulnerabilidad en los modelos de frontera de OpenAI, Anthropic y Google, accesibles a través de una interfaz de programación de aplicaciones (API). Descubrieron que el modelo chino Kimi K3 de Moonshot AI produce salidas sorprendentemente similares a los rastros de razonamiento ocultos de Claude Opus 4.8 y GPT 5.6 Sol para ciertas consultas.
Aunque los investigadores señalan que su trabajo «no puede establecer causalmente la destilación», el método podría permitir la extracción de información personal, como contraseñas y claves API, de los procesos internos de un modelo. Afortunadamente, esta vulnerabilidad ha sido corregida.
El proceso de destilación y sus implicaciones
La destilación es una técnica establecida y ampliamente utilizada para copiar eficientemente las capacidades de modelos existentes a nuevos sistemas. Sin embargo, recientemente se ha convertido en un tema controvertido debido a las acusaciones de que las empresas chinas de IA la utilizan para copiar los mejores modelos estadounidenses.
En febrero, OpenAI informó a los legisladores estadounidenses que DeepSeek parecía haber copiado uno de sus modelos para construir un modelo de razonamiento llamado R1. En junio, Anthropic informó que Alibaba había sistemáticamente destilado sus modelos para construir los suyos propios, llamados Qwen.
Mini-modelos y sus capacidades
Los modelos avanzados de IA resuelven problemas complejos dividiéndolos en partes constitutivas que se analizan en una especie de razonamiento artificial o «cadena de pensamiento». Las empresas tienden a mantener en secreto el razonamiento de sus modelos propietarios para evitar que otros los utilicen para entrenar nuevos sistemas. Sin embargo, también envían una versión cifrada de ese razonamiento a la computadora del usuario para descargar parte del cálculo.
El ataque de los investigadores se basa en el hecho de que la mayoría de las empresas de IA también proporcionan modelos relacionados de diferentes tamaños. Los modelos más grandes son más capaces pero también más costosos de ejecutar y acceder. Los usuarios pueden elegir modelos más pequeños y más débiles para ciertas tareas para reducir costos.
Panfilov y sus colegas descubrieron que alimentar rastros de razonamiento cifrados a una versión más pequeña del mismo modelo puede revelar el razonamiento oculto. Los modelos más pequeños han recibido menos entrenamiento de alineación, lo que significa que, a diferencia de los más grandes, son menos propensos a negarse a revelar sus pensamientos internos.
Revelación de información secreta
El mismo método también reveló información secreta, incluida claves API y contraseñas, incrustadas en rastros de razonamiento capturados de la máquina de un usuario. Panfilov y sus coautores alertaron a OpenAI, Anthropic y Google sobre la vulnerabilidad el mes pasado. Cada empresa ha ajustado su API para mitigar el problema.
Aunque ya no es posible extraer información privada de esta manera, Panfilov señala que algunos rastros de razonamiento aún pueden ser descubiertos utilizando el mismo método. Corregir la destilación por completo requeriría una revisión fundamental de la forma en que funcionan las APIs de estas empresas.
El debate geopolítico sobre la destilación
La destilación se ha convertido en un tema de importancia geopolítica en los últimos meses, a medida que las empresas de EE. UU. y China compiten por la supremacía en IA con modelos cada vez más poderosos. Algunos argumentan que China gana una ventaja estratégica al destilar la tecnología de EE. UU. para construir modelos de peso abierto que son menos costosos de ejecutar.
Mark Zuckerberg, CEO de Meta, dijo en una publicación de blog esta semana que la destilación «es un principio importante de cómo funciona el ecosistema de código abierto» y advirtió que restringir la práctica pondría a EE. UU. en desventaja.
Kyle Miller, investigador del Center for Security and Emerging Technologies, un think tank de políticas tecnológicas, dice que no está claro cuánto ayuda la destilación a China. Esto se debe a que solo mejora las capacidades de los modelos existentes en un grado limitado y porque las empresas chinas parecen tener la experiencia necesaria para construir modelos de vanguardia completamente desde cero si es necesario.
Para probar si los modelos de peso abierto podrían haber sido destilados de los cerrados, los investigadores alimentaron 90 preguntas a cada uno de los modelos. Cuando dieron a algunos modelos de peso abierto las primeras palabras de los rastros de razonamiento capturados del grupo propietario, a veces vieron que esos modelos abiertos generaban respuestas notablemente similares. Esto fue particularmente pronunciado con Kimi K3, según los investigadores.
Yarin Gal, científico informático de la Universidad de Oxford, dice que la destilación no solo es ampliamente utilizada, sino que también ha ayudado a que la IA avance más rápidamente. «Si es la norma que todos bloqueen a todos [para hacer destilación], entonces eso también tendrá implicaciones en la tasa de progreso», dice.
Las empresas y los responsables políticos pueden introducir medidas destinadas a limitar la destilación, pero incluso así, los modelos de IA podrían continuar revelando su pensamiento interno de maneras sorprendentes.



