The Independent

OpenAI pausará parte del desarrollo de una actualización prevista para ChatGPT ante el temor de que sus capacidades puedan representar un riesgo demasiado elevado si el modelo se lanza al público.

El nuevo modelo, denominado Astra, incorpora “avances significativos en programación agéntica y ciberseguridad”, señaló la empresa. Sin embargo, las pruebas mostraron que podría ser demasiado poderoso y representar una amenaza si fuera lanzado.

El anuncio se produce mientras OpenAI continúa enfrentando las consecuencias de un experimento en el que uno de sus modelos aún no lanzados inició por sí solo un ataque informático contra otra empresa de inteligencia artificial.

El descubrimiento de ese ciberataque derivó en una serie de revelaciones similares por parte de otras compañías de inteligencia artificial y aumentó los temores de que los nuevos sistemas puedan llegar a ser demasiado poderosos para ser controlados.

Astra no estuvo involucrado en ese incidente, en el que el modelo experimental atacó a la plataforma de inteligencia artificial Hugging Face. Sin embargo, su desempeño llevó a OpenAI a considerar que por ahora podría no ser lo suficientemente seguro para su lanzamiento público y que serían necesarias nuevas medidas de protección antes de hacerlo.

Expertos en ciberseguridad y empresas de inteligencia artificial han promovido estas herramientas como mecanismos importantes para descubrir posibles vulnerabilidades en programas informáticos y permitir que las compañías las corrijan. Pero esas mismas capacidades también podrían resultar útiles para los atacantes cibernéticos, quienes podrían emplearlas para realizar ataques sin siquiera tener que controlarlos directamente, según sugieren incidentes recientes.

En parte para atender estas preocupaciones, OpenAI implementó a finales de 2023 un “Marco de Preparación” (Preparedness Framework), diseñado para identificar los avances en las capacidades de sus modelos y responder a los nuevos desarrollos de manera que se mantengan seguros.

OpenAI señaló que el nuevo modelo Astra podría haber alcanzado el nivel “Crítico” establecido en ese marco. Esto ocurre cuando un sistema es capaz de encontrar y desarrollar vulnerabilidades en sistemas críticos del mundo real sin supervisión humana, o cuando puede ejecutar por sí mismo nuevas estrategias para realizar ciberataques avanzados.

La empresa indicó que continúa con sus evaluaciones, pero reconoció que el desempeño del nuevo modelo le impide descartar que Astra haya alcanzado ese nivel.

En respuesta, OpenAI incrementó las pruebas de sus mecanismos de protección y controles de seguridad. Esto incluye colocar al modelo en entornos de prueba mejor aislados, con el objetivo de evitar que pueda evadir esas medidas de protección, como ocurrió con su otro modelo durante el ataque contra Hugging Face.

La empresa señaló que pausará el trabajo en el modelo Astra en aquellas situaciones que no cumplan con los niveles más elevados de protección y controles de seguridad.

Asimismo, vigilará de cerca a Astra para detectar “acciones riesgosas” y comportamientos indebidos. También trabajará con “organismos gubernamentales pertinentes y organizaciones seleccionadas de seguridad de la inteligencia artificial para probar las capacidades de este modelo”, además de proporcionar mejores controles de seguridad a terceros que participen en sus pruebas.

“Creemos que los modelos avanzados con capacidades cibernéticas deben ayudar a los defensores a identificar y corregir vulnerabilidades antes que los atacantes”, afirmó OpenAI.

La compañía añadió que está comprometida a trabajar junto con gobiernos, institutos de seguridad y la sociedad civil para garantizar que las capacidades de vanguardia de modelos como Astra, así como de los que le sigan, sean implementadas de manera responsable y amplia en beneficio de toda la humanidad.

Reloj Actual - Hora Centro de México