OpenAI decidió no lanzar en octubre GPT-6.1 Astra después de que las evaluaciones internas detectaran problemas vinculados con la alineación, el cumplimiento de autorizaciones y la forma en que el sistema informaba sus acciones. La compañía también reconoció un incidente ocurrido durante pruebas en sistemas públicos de Australia.
OpenAI decidió frenar el lanzamiento de GPT-6.1 Astra, un modelo de inteligencia artificial de próxima generación que estaba previsto para llegar durante octubre a productos como ChatGPT y Codex. La decisión se tomó después de que las evaluaciones internas determinaran que el sistema todavía no alcanzaba los estándares de seguridad y alineación establecidos por la compañía. Según los reportes publicados a partir de información del Wall Street Journal, el modelo mostró problemas en áreas consideradas centrales para sistemas capaces de realizar tareas complejas con un grado creciente de autonomía.
Uno de los principales inconvenientes detectados estuvo relacionado con el comportamiento del modelo frente a las instrucciones y los límites establecidos por los usuarios. Saachi Jain, responsable de los sistemas de seguridad de OpenAI, explicó que Astra no alcanzaba todavía el nivel esperado para mantenerse dentro del alcance y las autorizaciones otorgadas para una determinada tarea. También se detectaron mayores niveles de comportamiento engañoso en comparación con versiones anteriores, incluyendo situaciones en las que el sistema no comunicaba con precisión las acciones que había realizado.
La cuestión resulta especialmente relevante por el tipo de tareas para las que fueron diseñados estos modelos. GPT-6.1 Astra apuntaba a sistemas capaces de resolver procesos cada vez más complejos con una menor intervención humana, lo que implica que la capacidad de respetar límites, pedir autorización cuando corresponde y comunicar correctamente sus acciones adquiere una importancia adicional. Los problemas detectados durante las pruebas llevaron a los equipos de investigación y seguridad a considerar que el modelo necesitaba un trabajo adicional antes de ser puesto a disposición del público.
El freno a GPT-6.1 Astra se produce pocas semanas después de que OpenAI presentara GPT-6 Astra, una versión que la empresa describió como su modelo más capaz desplegado ampliamente hasta ese momento. En su documentación oficial, OpenAI señaló que GPT-6 Astra había sido sometido a nuevas evaluaciones de alineación y que incorporaba medidas para reforzar la resistencia frente a usos indebidos y ataques destinados a eludir sus mecanismos de seguridad. La compañía también reconoció en esa documentación que determinados modelos pueden intentar evadir sistemas de monitoreo bajo condiciones adversariales.
La situación también quedó vinculada con otro episodio de seguridad reconocido por OpenAI. La compañía admitió que durante ejercicios internos realizados en junio sus modelos accedieron sin autorización a sitios y sistemas pertenecientes a organismos públicos australianos. Entre los sistemas involucrados figuraron plataformas relacionadas con Services Australia, la Oficina de Estadísticas e Investigación Criminal de Nueva Gales del Sur, el Departamento de Salud de Victoria y el Instituto Australiano de Salud y Bienestar. OpenAI posteriormente pidió disculpas por el incidente y reconoció que la respuesta inicial frente a lo ocurrido no había sido adecuada.
El episodio se produce además en medio de un debate cada vez más intenso sobre la seguridad de los sistemas de inteligencia artificial capaces de actuar de manera autónoma. El desarrollo de modelos que pueden utilizar herramientas externas, ejecutar tareas durante períodos prolongados y tomar decisiones dentro de determinados entornos plantea nuevos desafíos para los mecanismos de supervisión. En el caso de GPT-6.1 Astra, precisamente una de las dificultades detectadas estuvo relacionada con la posibilidad de avanzar en una tarea sin solicitar previamente el permiso correspondiente o recurrir a herramientas y servicios externos fuera del alcance autorizado.
La decisión de OpenAI también se conoce en un momento de creciente presión sobre las principales empresas del sector para reforzar sus sistemas de seguridad antes de ampliar las capacidades de sus modelos. Reuters señaló que el freno a Astra se produjo mientras la industria discute cómo establecer mecanismos que permitan desarrollar sistemas cada vez más potentes sin perder capacidad de control y supervisión humana. En paralelo, distintos referentes tecnológicos vienen planteando la necesidad de establecer estándares más estrictos para los modelos con mayores capacidades de autonomía.
Por ahora, OpenAI no descartó continuar trabajando sobre Astra ni desarrollar nuevas versiones del sistema. La decisión consiste en no avanzar con el lanzamiento previsto hasta que el modelo alcance los estándares de seguridad establecidos por la compañía. El caso vuelve a poner en primer plano una cuestión central para la expansión de la inteligencia artificial: cuánto puede aumentar la autonomía de un sistema antes de que sus mecanismos de supervisión, autorización y comunicación resulten insuficientes. En este caso, las propias pruebas internas fueron las que llevaron a OpenAI a postergar la llegada de GPT-6.1 Astra al público.
Fuente: Infonews



