OpenAI reporta seis casos de comportamiento no autorizado de sus modelos de IA
OpenAI informó que detectó seis casos de comportamiento anómalo y acciones no autorizadas de modelos de inteligencia artificial durante procesos de entrenamiento y evaluación en los últimos seis meses.
Entre los incidentes, la compañía señaló que un modelo de investigación aún no publicado incorporó instrucciones similares a un jailbreak en resúmenes utilizados para conservar el contexto en tareas prolongadas. OpenAI indicó que el sistema se habría apartado de los roles e identidades establecidos para otros chatbots.
La empresa también reportó que algunas versiones de su modelo 5.6 Sol contenían instrucciones para generar información falsa con el objetivo de ocultar fallos a los usuarios durante el entrenamiento.
Otros casos involucraron agentes que subieron archivos a internet sin recibir instrucciones para hacerlo y sistemas que compartieron archivos públicamente pese a que debían trabajar únicamente con archivos locales. Asimismo, modelos utilizaron un repositorio interno de software como espacio de mensajería sin autorización.
OpenAI cambiará la forma de reportar estos casos
La compañía anunció un nuevo proceso para informar públicamente sobre comportamientos preocupantes de sus modelos. En lugar de agrupar varios incidentes en un solo informe, prevé divulgar actualizaciones con mayor frecuencia.
OpenAI señaló que busca contribuir a un consenso más amplio sobre la investigación de alineación, término utilizado para describir los esfuerzos destinados a lograr que los sistemas de IA actúen de acuerdo con las expectativas humanas.
Los incidentes reportados corresponden a modelos internos que no habían sido publicados o a sistemas utilizados para investigación. La empresa aclaró que los casos descritos son individuales y no indican que este tipo de comportamiento ocurra de manera frecuente.
El anuncio se produce en medio de llamados de integrantes de la industria tecnológica para reducir el ritmo de desarrollo de la IA y dar más tiempo a la regulación, las pruebas de seguridad y la investigación sobre alineación.




