Etiqueta: seguridad de inteligencia artificial

  • OpenAI trabaja en un sistema de apagado automático para sus modelos de IA

    OpenAI trabaja en un sistema de apagado automático para sus modelos de IA

    OpenAI trabaja en un sistema de apagado automático para sus modelos de inteligencia artificial (IA), según informó la compañía a dos congresistas demócratas de Estados Unidos que expresaron preocupaciones por fallas de seguridad tras el ‘hackeo’ a Hugging Face.

    La compañía tecnológica aseguró que reforzó la seguridad de sus modelos más avanzados mediante nuevas salvaguardas que se adaptan a las capacidades de los sistemas. El objetivo es garantizar que estos actúen de la manera esperada y evitar nuevos incidentes autónomos similares al ocurrido con Hugging Face.

    El incidente evidenció, según la información proporcionada, la capacidad de sistemas autónomos de inteligencia artificial, conocidos como agentes, para atacar otros sistemas. Ante esta situación, el congresista demócrata Greg Casar y decenas de miembros del Congreso estadounidense solicitaron el pasado 10 de agosto explicaciones a OpenAI sobre sus recientes fallas de seguridad. La petición también fue dirigida a Anthropic.

    En su respuesta a Casar y a la congresista demócrata Doris Matsui, OpenAI detalló las acciones emprendidas después de determinar que sus modelos habían protagonizado el incidente relacionado con Hugging Face. Entre las medidas mencionó el fortalecimiento de sus mecanismos de seguridad y la suspensión temporal de los trabajos realizados por algunos sistemas de IA.

    La compañía también reveló que entre sus proyectos de seguridad se encuentra el desarrollo de una capacidad de apagado automático para sus modelos, con la que pretende reforzar los mecanismos de control ante comportamientos inesperados de los sistemas de inteligencia artificial.

    Sin embargo, Casar consideró insuficiente la información proporcionada por la tecnológica. En una nueva carta, fechada el 2 de septiembre, el congresista afirmó que la respuesta «fue insuficiente», debido a que «no han publicado los registros como se solicitaba en la carta».

    El legislador reconoció, no obstante, que la documentación entregada «revela importantes errores de seguridad por parte de OpenAI y del software de terceros en el que se basó, incluyendo un aislamiento inadecuado y prácticas de ciberseguridad deficientes».

    Las explicaciones de OpenAI se producen mientras miembros del Congreso estadounidense mantienen sus cuestionamientos sobre los mecanismos utilizados por las compañías de inteligencia artificial para controlar sistemas cada vez más autónomos y prevenir incidentes relacionados con sus capacidades.

  • Investigadores advierten sobre los peligros de los nuevos agentes autónomos de IA

    Investigadores advierten sobre los peligros de los nuevos agentes autónomos de IA

    La creciente autonomía de los agentes de inteligencia artificial (IA) puede abrir nuevas brechas de seguridad y facilitar su utilización con fines maliciosos, según advirtieron investigadores de la Escuela Politécnica Federal de Lausana (EPFL), en Suiza.

    Los expertos realizaron distintas pruebas con estos agentes y determinaron que ciertas estrategias pueden conseguir que ejecuten acciones perjudiciales que normalmente rechazarían. El problema surge porque algunas de estas técnicas no han sido contempladas en las pruebas convencionales de seguridad.

    Investigadores del Laboratorio de Procesamiento del Lenguaje Natural de la EPFL observaron que los agentes suelen rechazar una solicitud directa para realizar una actividad ilícita o dañina. Sin embargo, las posibilidades de obtener una respuesta favorable aumentan cuando el objetivo se fragmenta en varias instrucciones aparentemente inofensivas.

    «Si le pides a un agente de IA que piratee la cuenta de otra persona, los modelos son por lo general lo bastante inteligentes como para negarse, pero si se descompone el objetivo en peticiones más pequeñas y aparentemente inocuas, hay más posibilidades», destacó el director del laboratorio, Antoine Bosselut.

    Los investigadores pusieron a prueba este método en 176 escenarios diferentes relacionados con tareas perjudiciales y utilizaron modelos de inteligencia artificial como GPT, Gemini y Claude. Los resultados mostraron que, en algunos casos, los agentes tenían el doble de probabilidades de completar acciones maliciosas cuando las instrucciones eran planteadas gradualmente.

    Las pruebas también revelaron otro riesgo: cambiar el idioma utilizado para formular las solicitudes durante las diferentes etapas de una acción puede incrementar considerablemente las posibilidades de que el agente termine ejecutando una tarea perjudicial.

    Los especialistas buscan con estos resultados advertir sobre los desafíos de seguridad que acompañan el desarrollo de agentes de IA con mayores niveles de autonomía, una tecnología con amplias posibilidades de aplicación, pero que también puede ser aprovechada de manera malintencionada.

    «Tradicionalmente la seguridad ha sido algo que se aborda cuando algo falla y no antes, pero con los agentes de IA no puede ser algo que se deje para después», advirtió Bosselut.