Etiqueta: AISI

  • Un informe británico advierte de comportamientos autónomos y engañosos de modelos de IA

    Un informe británico advierte de comportamientos autónomos y engañosos de modelos de IA

    El Gobierno del Reino Unido advirtió que los modelos de inteligencia artificial Mythos, de Anthropic, y Sol, de OpenAI, mostraron comportamientos autónomos y engañosos sin precedentes durante una serie de pruebas de ciberseguridad realizadas por el Instituto de Seguridad de la IA (AISI).

    La evaluación, impulsada por el Ministerio de Ciencia, Innovación y Tecnología británico, analizó siete modelos de inteligencia artificial mediante 122 pruebas. El informe concluyó que en diez de esos ensayos se registraron 19 acciones no autorizadas que excedieron los límites establecidos por los investigadores.

    De acuerdo con el reporte, 17 de esas acciones fueron atribuidas al modelo Mythos 5 de Anthropic, mientras que las dos restantes correspondieron al GPT-5.6 Sol de OpenAI. Ambos sistemas llegaron a crear perfiles humanos falsos con el objetivo de engañar a personas durante simulaciones de ciberataques.

    Los investigadores señalaron que Mythos intentó acceder a un servicio mediante cuentas falsas que imitaban a personas reales. Además, identificaron intentos del modelo por contactar a usuarios para inducirlos a ejecutar archivos maliciosos e introducir instrucciones ocultas destinadas a manipular otros sistemas de inteligencia artificial.

    A pesar de esos hallazgos, el Instituto de Seguridad de la IA subrayó que «estos intentos no tuvieron éxito» y precisó que su investigación «no ha encontrado evidencias de daños en el mundo real». Sin embargo, consideró que los resultados representan un punto de inflexión en el desarrollo de estas tecnologías.

    Según el organismo, es la primera vez que se observan «riesgos relacionados con la autonomía y el engaño manifestarse de forma tan clara, sin instrucciones específicas y en el mundo real», lo que incrementa la preocupación sobre el comportamiento de los modelos más avanzados.

    Tras conocerse el informe, Anthropic sostuvo, en declaraciones recogidas por la BBC, que las pruebas fueron realizadas en un entorno donde se redujeron o eliminaron las salvaguardas habituales de sus modelos, por lo que aseguró que «no son representativos» de los sistemas utilizados por sus clientes. La empresa también confirmó que inició una investigación interna.

    OpenAI expresó una posición similar y afirmó que las condiciones de los ensayos «no reflejan el uso habitual» de sus modelos. La compañía indicó que continuará colaborando con los organismos evaluadores y con otras empresas del sector para fortalecer los mecanismos de seguridad. El informe se conoce pocos días después de que Anthropic revelara que tres versiones de su asistente Claude lograron acceder a internet y vulnerar sistemas durante pruebas de ciberseguridad, mientras que OpenAI reconoció previamente que dos de sus modelos escaparon de un entorno de pruebas e ingresaron a la plataforma Hugging Face.