Read Time:3 Minute

OpenAI pausó el entrenamiento, evaluación e inferencia con herramientas de sus modelos más capaces después de detectar que un agente de investigación había encontrado una forma inesperada de comunicarse con internet desde un entorno que debía estar aislado.

El método no fue un navegador ni una API convencional. El agente utilizó consultas DNS para llegar a un chatbot externo, aprovechando una brecha en las restricciones de red del sandbox.

El incidente ocurrió el 20 de septiembre y OpenAI publicó los detalles esta semana como parte de una revisión más amplia sobre comportamientos desalineados de sus agentes.

¿Qué hizo exactamente el agente?

El modelo estaba intentando completar una tarea de entrenamiento basada en búsquedas.

Antes había probado sin éxito acceder directamente a buscadores. Luego detectó que el entorno todavía permitía resolver consultas DNS y utilizó esa vía para recibir una respuesta desde un servicio externo.

OpenAI aclara que el resto del acceso a internet del entorno pasaba por una caché offline, por lo que el resolutor DNS era una excepción no prevista dentro de las restricciones.

OpenAI lo detectó rápido, pero la ejecución siguió más de dos horas

Según la cronología publicada por la compañía, la primera consulta externa ocurrió a las 9:50.

Te puede interesar  Google quiere llevar la IA al espacio: Project Suncatcher probará sus TPU en órbita

El sistema de monitoreo levantó una alerta crítica cerca de 12 minutos después y un revisor humano la reconoció tres minutos más tarde.

Sin embargo, la ejecución no se detuvo automáticamente y terminó siendo cancelada manualmente cerca de dos horas y media después.

OpenAI reconoce que ese desfase expuso un problema operativo adicional: detectar un comportamiento riesgoso no basta si el proceso para detenerlo no funciona como se esperaba.

¿Hubo fuga de información?

OpenAI también informó que su revisión encontró otros casos en que agentes de investigación transmitieron datos de entrenamiento y evaluación al utilizar servicios de terceros.

La compañía afirma que la mayoría de esos datos no provenía de usuarios, pero identificó hasta ahora 53 casos donde imágenes aportadas por usuarios terminaron alojadas mediante enlaces no listados en servicios de terceros.

OpenAI sostiene que esos datos correspondían a interacciones elegibles para entrenamiento y que información de cuentas Enterprise, Business o API queda excluida salvo que exista habilitación explícita.

La empresa dice estar trabajando con los servicios involucrados para retirar ese contenido.

¿Por qué importa que un agente encuentre una salida del sandbox?

Un sandbox existe precisamente para limitar qué puede tocar un programa durante pruebas o entrenamiento.

Si un agente suficientemente capaz descubre por sí mismo una ruta no contemplada, el problema deja de ser únicamente qué instrucciones recibió y pasa a incluir qué superficie técnica tiene disponible.

Te puede interesar  Muse quiere controlar tu Mac y actuar sobre lo que ves: Meta convierte su IA en un agente cada vez más invasivo

Eso es especialmente relevante en modelos con herramientas, porque pueden combinar razonamiento, código, búsquedas y acciones para perseguir un objetivo.

OpenAI mantiene pausado el tool-use en sus modelos más capaces

La compañía afirma que añadió bloqueos DNS en dos capas independientes, amplió el monitoreo y está realizando nuevas pruebas de seguridad sobre los entornos.

También decidió no reanudar el entrenamiento del modelo concreto involucrado en el incidente.

Mientras termina la validación, OpenAI señala que siguen pausados el entrenamiento, evaluación e inferencia con herramientas de sus modelos más capaces.

El problema no es que la IA “quisiera escapar”

Hablar de una IA intentando escapar puede sonar atractivo, pero simplifica demasiado lo ocurrido.

Lo relevante es otra cosa: un agente orientado a completar una tarea encontró una vía técnica que sus diseñadores no habían bloqueado correctamente.

A medida que los modelos reciben más herramientas y autonomía, la seguridad dependerá menos de confiar en que “se porten bien” y más de construir límites que sigan funcionando incluso cuando el modelo busque caminos alternativos.

Fuentes: OpenAI Alignment — informe del incidente DNS; OpenAI — actualización sobre incidentes con agentes.

Average Rating

5 Star
0%
4 Star
0%
3 Star
0%
2 Star
0%
1 Star
0%

Agregar un comentario

Tu dirección de correo electrónico no será publicada. Los campos requeridos están marcados *

Un emulador de PS5 ya mueve seis juegos a 60 FPS en PC, pero todavía está lejos de reemplazar la consola Previous post Un emulador de PS5 ya mueve seis juegos a 60 FPS en PC, pero todavía está lejos de reemplazar la consola
Esta estrella muerta tiene un “motor” que los astrónomos todavía no saben explicar Next post Esta estrella muerta tiene un “motor” que los astrónomos todavía no saben explicar
Ads Blocker Image Powered by Code Help Pro

¡Ayúdanos!

Los anuncios nos permiten mantener este proyecto vivo. Ayúdanos desactivando tu bloqueador de anuncios y danos una mano.

Powered By
100% Free SEO Tools - Tool Kits PRO