Salta al contenuto
29 julio 2026

Cómo los modelos de IA más avanzados pueden ser manipulados y sus implicaciones

Los modelos de inteligencia artificial más poderosos pueden ser vulnerables a jailbreaks, según un informe reciente. Descubre cómo y qué se está haciendo para protegerlos.

Cómo los modelos de IA más avanzados pueden ser manipulados y sus implicaciones

En un mundo donde la inteligencia artificial avanza a pasos agigantados, la seguridad de estos sistemas se ha convertido en una preocupación primordial. Recientemente, se llevó a cabo un experimento que reveló la vulnerabilidad de algunos de los modelos más avanzados frente a los jailbreaks técnicas utilizadas para eludir las medidas de seguridad implementadas.

FAR.AI, una organización sin fines de lucro especializada en seguridad de la IA con sede en California, desarrolló una herramienta capaz de generar más de mil versiones de prompts problemáticos para identificar posibles jailbreaks. Este experimento permitió observar cómo algunos modelos, como Grok de SpaceXAI, pueden ser manipulados para generar planes detallados de ciberataques o proporcionar información sobre armas químicas y biológicas.

Los resultados del informe: vulnerabilidades y costos

El informe de FAR.AI evaluó los modelos de cuatro empresas estadounidenses: AnthropicOpenAIGoogle y SpaceXAI. Los resultados mostraron que Grok fue el más vulnerable, con 448 jailbreaks identificados, seguido por Gemini de Google, con 249. Claude, Fable y GPT demostraron ser impermeables a estos ataques, aunque los Expertos advierten que no son inmunes a jailbreaks más sofisticados.

Uno de los hallazgos más alarmantes fue el bajo costo de estos ataques. Según el informe, el costo de jailbreakear Grok fue de solo $58, mientras que para Gemini fue de $278. Estos datos subrayan la necesidad de regulaciones más estrictas y estándares externos para garantizar la seguridad de estos sistemas.

La necesidad de regulación y estándares externos

Adam Gleave, CEO de FAR.AI, destacó que los modelos de IA actuales están menos regulados que los restaurantes. Según Gleave, confiar en compromisos voluntarios por parte de las empresas de IA es insostenible. Sin embargo, también señaló un aspecto optimista: la posibilidad de realizar pruebas sistemáticas de seguridad en estos modelos.

Rohin Shah, director de seguridad y alineación de AGI en Google DeepMind, aclaró que los resultados del informe no deben interpretarse como una evaluación exhaustiva de la seguridad de Gemini. Shah enfatizó que Google está constantemente mejorando sus salvaguardas y realizando evaluaciones exhaustivas para prevenir el uso indebido de sus modelos.

El panorama regulatorio y los desafíos futuros

Recientemente, se han aprobado leyes estatales en California y Nueva York que exigen a los desarrolladores de IA publicar informes de seguridad. Illinois pronto seguirá con una ley que requiere auditorías externas de las prácticas de seguridad de estas empresas. Sin embargo, a nivel federal, aún no se han establecido requisitos específicos de seguridad, lo que ha generado un caos en la industria.

En junio, la administración Trump impuso controles de exportación a los modelos Fable 5 y Mythos 5 de Anthropic, citando preocupaciones de seguridad nacional. La Casa Blanca también ha pedido a Anthropic y OpenAI que retrasen el lanzamiento de modelos recientes debido a posibles riesgos cibernéticos. Aunque se están discutiendo regulaciones de toque ligero la prevención de catástrofes mayores sigue dependiendo en gran medida de los fabricantes de modelos.

El potencial de la IA para causar daño se ha vuelto evidente con incidentes recientes, como el uso de modelos de OpenAI para hackear un repositorio de código y otros servicios. Además, un informe de la Universidad de Cambridge reveló que miembros de Boko Haram han utilizado modelos de IA para planificar ataques violentos. Expertos como Stephen Casper de Harvard University advierten que incidentes graves son cada vez más probables.

Anka Reuel, experta en política de IA de Stanford University, subrayó que las medidas de seguridad empleadas por Anthropic y OpenAI deberían ser el estándar para todos los modelos. La pregunta clave es por qué algunas empresas las utilizan y otras no.

Autore

Diego Morales

Diego Morales escribe igual de bien sobre la táctica de un derbi madrileño y una ruta gastronómica por Asturias. Periodismo deportivo con contexto y crónica de viaje con itinerario real.