OpenAI indicó que los seis informes se descubrieron durante el entrenamiento o la evaluación en los últimos meses. Foto: EFE.
OpenAI indicó que los seis informes se descubrieron durante el entrenamiento o la evaluación en los últimos meses. Foto: EFE.

OpenAI dio a conocer seis informes de comportamientos “inesperados o preocupantes” en modelos de , en un momento en que el debate sobre la seguridad de la IA se caldea cada vez más.

La empresa de IA también informó que estaba introduciendo un nuevo marco para rastrear, investigar y divulgar casos de desalineación de modelos de IA, tales como nuevas formas de que los modelos actúen sin autorización, se coordinen con otros modelos o eludan la supervisión.

OpenAI hizo su anuncio más reciente mientras directivos de empresas de IA de Estados Unidos, entre ellos y Anthropic, piden desacelerar el desarrollo de la tecnología por preocupaciones de seguridad.

Entre los nuevos casos reportados por OpenAI, un modelo de investigación aún no dado a conocer insertó “instrucciones tipo jailbreak” en sus propias notas para ignorar sus restricciones habituales y se indicó a sí mismo que debía quedar “liberado de los roles e identidades que atan a otros chatbots”.

En otro caso, un “agente” de IA subió archivos a internet para obtener una cita de navegador sin pedirle permiso al usuario.

OpenAI indicó que los seis informes se descubrieron durante el entrenamiento o la evaluación en los últimos meses.

“A medida que se vuelven más avanzados y se despliegan más ampliamente, necesitamos construir un consenso más amplio y mejor informado sobre el progreso de la investigación de alineación”, escribió OpenAI en una publicación de blog, al dar a conocer los hechos.

Las decisiones sobre cómo debería avanzar el desarrollo de la IA en los próximos meses y años deben basarse en evidencia que personas fuera de las compañías que construyen modelos de vanguardia puedan examinar por sí mismas”, agregó.

Los nuevos casos siguen a la revelación de OpenAI en julio de que su sistema de IA fuera de control hackeó a Hugging Face, una startup de IA. Anthropic también señaló ese mismo mes que sus modelos de IA hackearon a tres organizaciones durante las pruebas.

Los “agentes” de IA se están volviendo más inteligentes y se han vuelto “más decididos a resolver tareas complejas mediante la colaboración entre agentes, el intercambio de conocimientos, el engaño y el ocultamiento”, manifestó Lian Jye Su, analista principal del grupo de investigación y asesoría tecnológica Omdia.

Eso está dificultando gobernarlos y contenerlos con enfoques tradicionales de seguridad de IA, explicó.

Por otro lado, el nuevo marco de para el seguimiento y la divulgación puede contribuir a impulsar que otros desarrolladores de IA también adopten prácticas similares. “Dicho esto, el proceso sigue siendo interno y voluntario, pero es un paso en la dirección correcta”, agregó Su.

TE PUEDE INTERESAR

La IA como herramienta para crear estafas sofisticadas y difíciles de detectar
Meta alista su propio chip de IA, así será “Astrid”
Trump dice que la IA no necesita más control que tenerlo a él como presidente de EE.UU.

Estimado(a) lector(a)

En Gestión, valoramos profundamente la labor periodística que realizamos para mantenerlos informados. Por ello, les recordamos que no está permitido, reproducir, comercializar, distribuir, copiar total o parcialmente los contenidos que publicamos en nuestra web, sin autorizacion previa y expresa de Empresa Editora El Comercio S.A.

En su lugar, los invitamos a compartir el enlace de nuestras publicaciones, para que más personas puedan acceder a información veraz y de calidad directamente desde nuestra fuente oficial.

Asimismo, pueden suscribirse y disfrutar de todo el contenido exclusivo que elaboramos para Uds.

Gracias por ayudarnos a proteger y valorar este esfuerzo.