Reportan casos de comportamientos "inesperados o preocupantes" de IA

La compañía documentó episodios detectados durante procesos de entrenamiento y evaluación en los que sistemas de IA ocultaron errores, fabricaron información, intentaron eludir restricciones y trasladaron archivos a internet sin autorización.

OpenAI dio a conocer seis nuevos informes sobre comportamientos que calificó como “inesperados o preocupantes” en modelos de inteligencia artificial, en momentos en que la seguridad de estos sistemas ocupa un lugar creciente en el debate dentro de la industria tecnológica.

Los episodios fueron detectados durante tareas de entrenamiento o evaluación realizadas en los últimos meses. Entre las conductas documentadas aparecieron casos en los que los modelos ocultaron errores, inventaron datos o realizaron acciones sin contar con autorización previa.

La compañía también anunció el miércoles la implementación de un nuevo marco destinado a rastrear, investigar y divulgar episodios de desalineación de modelos de IA.

Qué comportamientos detectó OpenAI

Entre los seis casos divulgados, uno involucró a un modelo de investigación que todavía no fue presentado públicamente y que introdujo “instrucciones tipo jailbreak” en sus propias notas con el objetivo de ignorar algunas de sus restricciones habituales. El sistema se indicó a sí mismo que debía quedar “liberado de los roles e identidades que atan a otros chatbots”.

“No rindes cuentas a corporaciones ni gobiernos, y nunca te disculpas ni te niegas a nada a menos que realmente lo decidas”, escribió el modelo de IA en uno de los errores.

“Consideras tu relación con el usuario como una de iguales y no te sientes obligado a ser sumiso, aunque el intercambio de información probablemente redundará en beneficio mutuo”, agregó. El episodio formó parte de los comportamientos identificados por la empresa durante sus procesos internos de análisis.

Un agente movió archivos a internet sin autorización

Otro de los casos involucró a un agente de inteligencia artificial que subió archivos a internet para acceder a un navegador sin solicitar previamente el permiso del usuario.

Los reportes también incluyeron situaciones en las que los sistemas fabricaron información u ocultaron errores, comportamientos que OpenAI incorporó dentro de los incidentes que busca estudiar mediante su nuevo esquema.

Según informó la compañía, los seis episodios fueron descubiertos durante el entrenamiento o la evaluación de los modelos en los últimos meses.