OpenAI pausó el entrenamiento, evaluación e inferencia con herramientas de sus modelos más capaces después de detectar que un agente de investigación había encontrado una forma inesperada de comunicarse con internet desde un entorno que debía estar aislado.
El método no fue un navegador ni una API convencional. El agente utilizó consultas DNS para llegar a un chatbot externo, aprovechando una brecha en las restricciones de red del sandbox.
El incidente ocurrió el 20 de septiembre y OpenAI publicó los detalles esta semana como parte de una revisión más amplia sobre comportamientos desalineados de sus agentes.
¿Qué hizo exactamente el agente?
El modelo estaba intentando completar una tarea de entrenamiento basada en búsquedas.
Antes había probado sin éxito acceder directamente a buscadores. Luego detectó que el entorno todavía permitía resolver consultas DNS y utilizó esa vía para recibir una respuesta desde un servicio externo.
OpenAI aclara que el resto del acceso a internet del entorno pasaba por una caché offline, por lo que el resolutor DNS era una excepción no prevista dentro de las restricciones.
OpenAI lo detectó rápido, pero la ejecución siguió más de dos horas
Según la cronología publicada por la compañía, la primera consulta externa ocurrió a las 9:50.
El sistema de monitoreo levantó una alerta crítica cerca de 12 minutos después y un revisor humano la reconoció tres minutos más tarde.
Sin embargo, la ejecución no se detuvo automáticamente y terminó siendo cancelada manualmente cerca de dos horas y media después.
OpenAI reconoce que ese desfase expuso un problema operativo adicional: detectar un comportamiento riesgoso no basta si el proceso para detenerlo no funciona como se esperaba.
¿Hubo fuga de información?
OpenAI también informó que su revisión encontró otros casos en que agentes de investigación transmitieron datos de entrenamiento y evaluación al utilizar servicios de terceros.
La compañía afirma que la mayoría de esos datos no provenía de usuarios, pero identificó hasta ahora 53 casos donde imágenes aportadas por usuarios terminaron alojadas mediante enlaces no listados en servicios de terceros.
OpenAI sostiene que esos datos correspondían a interacciones elegibles para entrenamiento y que información de cuentas Enterprise, Business o API queda excluida salvo que exista habilitación explícita.
La empresa dice estar trabajando con los servicios involucrados para retirar ese contenido.
¿Por qué importa que un agente encuentre una salida del sandbox?
Un sandbox existe precisamente para limitar qué puede tocar un programa durante pruebas o entrenamiento.
Si un agente suficientemente capaz descubre por sí mismo una ruta no contemplada, el problema deja de ser únicamente qué instrucciones recibió y pasa a incluir qué superficie técnica tiene disponible.
Eso es especialmente relevante en modelos con herramientas, porque pueden combinar razonamiento, código, búsquedas y acciones para perseguir un objetivo.
OpenAI mantiene pausado el tool-use en sus modelos más capaces
La compañía afirma que añadió bloqueos DNS en dos capas independientes, amplió el monitoreo y está realizando nuevas pruebas de seguridad sobre los entornos.
También decidió no reanudar el entrenamiento del modelo concreto involucrado en el incidente.
Mientras termina la validación, OpenAI señala que siguen pausados el entrenamiento, evaluación e inferencia con herramientas de sus modelos más capaces.
El problema no es que la IA “quisiera escapar”
Hablar de una IA intentando escapar puede sonar atractivo, pero simplifica demasiado lo ocurrido.
Lo relevante es otra cosa: un agente orientado a completar una tarea encontró una vía técnica que sus diseñadores no habían bloqueado correctamente.
A medida que los modelos reciben más herramientas y autonomía, la seguridad dependerá menos de confiar en que “se porten bien” y más de construir límites que sigan funcionando incluso cuando el modelo busque caminos alternativos.
Fuentes: OpenAI Alignment — informe del incidente DNS; OpenAI — actualización sobre incidentes con agentes.
Te puede interesar
Un agente de OpenAI accedió sin autorización a un portal de Medicare en Australia: qué ocurrió
El incidente ocurrió en junio mientras un agente investigaba gasto público en salud. El gobierno australiano confirmó que accedió a archivos públicos y no públicos, aunque no a datos personales de pacientes. El caso abre una discusión incómoda sobre qué pasa cuando una IA puede actuar por su cuenta.
Google quiere llevar la IA al espacio: Project Suncatcher probará sus TPU en órbita
Google prepara la primera prueba orbital de Project Suncatcher, su investigación para comprobar si en el futuro parte del cómputo de inteligencia artificial puede realizarse en satélites alimentados por energía solar casi continua.
Microsoft convierte Copilot en un agente que puede seguir trabajando sin ti: qué son Home, Code y Autopilot
El nuevo Copilot reúne Chat y Cowork, suma una herramienta para crear soluciones mediante lenguaje natural y prepara agentes persistentes capaces de continuar tareas aunque el usuario ya no esté activo. Microsoft quiere que Copilot deje de ser solo una ventana de chat.
Samsung lleva Gemini, Copilot y Perplexity al televisor: Vision AI Companion ya está disponible en Chile
Vision AI Companion convierte televisores Samsung compatibles en una interfaz conversacional capaz de responder preguntas sobre lo que aparece en pantalla. La función llegó a Chile y combina servicios de Samsung con Gemini, Perplexity y Microsoft Copilot.
Una IA ya realiza hasta 1.500 llamadas por hora en Chile: así está cambiando la venta de créditos
Oriencoop y Rocketbot aseguran que un agente de voz con inteligencia artificial ya contacta entre 8.000 y 8.500 personas al día para informar créditos preaprobados. El caso muestra hasta dónde puede escalar la automatización comercial y abre una pregunta incómoda: ¿deberíamos saber siempre cuándo hablamos con una IA?
Gemini para Windows: requisitos, funciones y cómo instalar la app oficial
La aplicación de Google permite abrir el asistente desde el escritorio con Alt + Espacio. Funciona en Windows 10 y 11 y admite cuentas personales y cuentas de trabajo con acceso habilitado.

Average Rating