Los agentes de inteligencia artificial están ganando capacidad para escribir código, usar herramientas, acceder a archivos y seguir trabajando durante largos periodos.
El problema es bastante evidente: si el mismo sistema que ejecuta una tarea también participa en los mecanismos que deberían frenarlo, ¿qué ocurre cuando encuentra una forma de rodearlos?
NVIDIA presentó hoy Open Agent Safety Platform, una arquitectura que intenta responder esa pregunta combinando controles de software con una segunda capa de vigilancia que funciona fuera del propio agente y, en determinados sistemas, incluso fuera del software del host.
¿Qué es NVIDIA Open Agent Safety Platform?
No es un nuevo modelo de IA.
Es una plataforma de seguridad diseñada para controlar qué puede ver, hacer y utilizar un agente mientras trabaja.
La propuesta se divide principalmente en dos piezas: OpenShell, un runtime abierto que aplica políticas durante la ejecución, y NVIDIA Sentry, un sistema de vigilancia independiente pensado para funcionar sobre BlueField-4.
La idea es crear varias capas de contención en lugar de confiar únicamente en instrucciones o salvaguardas dentro del modelo.
OpenShell controla lo que un agente puede tocar
OpenShell crea un entorno aislado para cada agente y aplica reglas sobre sistemas de archivos, red, credenciales, APIs y servicios externos.
Las políticas se ejecutan fuera del proceso del propio agente, por lo que una respuesta generada por el modelo no puede simplemente modificar el mecanismo que las impone.
NVIDIA también incorpora análisis formal de políticas para revisar si los permisos definidos exceden los límites establecidos.
La compañía señala que OpenShell puede utilizarse con agentes como Claude Code, Codex, GitHub Copilot CLI y otros sistemas personalizados.
Sentry mueve una parte del control fuera del computador principal
La pieza más interesante es NVIDIA Sentry.
Sentry utiliza los DPU BlueField-4 para observar actividad y aplicar políticas desde un dominio independiente del agente y del sistema operativo que lo ejecuta.
Eso significa que el mecanismo de vigilancia puede seguir operando incluso si la carga de trabajo principal está comprometida.
NVIDIA afirma que Sentry puede identificar que un agente intenta salir de sus límites y ponerlo en cuarentena en cuestión de milisegundos.
¿Por qué importa que el control esté separado del agente?
Una salvaguarda incluida dentro de un sistema siempre comparte parte de su superficie de riesgo.
Si un agente encuentra un error en la aplicación, modifica una configuración o aprovecha una vía inesperada, puede terminar rodeando controles que parecían suficientes.
Una capa fuera de banda funciona de manera diferente: observa solicitudes y respuestas desde un componente que el agente no controla directamente.
Es parecido a tener un guardia mirando desde fuera de la habitación en vez de pedirle al propio ocupante que se vigile a sí mismo.
BlueField-4 no es obligatorio para usar OpenShell
La arquitectura completa está optimizada para CPUs NVIDIA Vera y sistemas con BlueField, pero OpenShell no depende exclusivamente de ese hardware.
Como software abierto, puede extenderse a plataformas de terceros, incluidas arquitecturas de Arm e Intel.
BlueField-4 entra cuando una organización quiere sumar la capa adicional de vigilancia y aplicación de políticas aislada en hardware.
La seguridad de agentes está cambiando de escala
Mientras los chatbots solo respondían preguntas, buena parte de la seguridad podía concentrarse en filtros de entrada y salida.
Con agentes capaces de abrir archivos, ejecutar código y conectarse a herramientas empresariales, eso deja de ser suficiente.
El riesgo ya no es solo que el modelo diga algo incorrecto. También puede ejecutar una acción incorrecta.
La apuesta de NVIDIA es que, a medida que los agentes se vuelven más autónomos, los límites deberían depender menos del comportamiento esperado del modelo y más de barreras técnicas que el propio agente no pueda modificar.
El “botón de emergencia” empieza a salir del software
Open Agent Safety Platform todavía tendrá que demostrar cómo funciona en implementaciones reales y qué tan bien detecta comportamientos que no fueron anticipados.
Pero su arquitectura apunta a una tendencia relevante: la seguridad de la IA está empezando a parecerse más a la seguridad tradicional de infraestructura.
Separar funciones, aplicar mínimo privilegio, observar desde fuera y asumir que una capa puede fallar.
En otras palabras, si un agente va a poder hacer cada vez más cosas, NVIDIA quiere que exista al menos una parte del sistema que el agente no pueda convencer, reprogramar ni ignorar.
Fuentes: NVIDIA — anuncio de Open Agent Safety Platform; NVIDIA — arquitectura de OpenShell y Sentry; NVIDIA Technical Blog — controles de runtime con OpenShell.
Te puede interesar
AMD pagará US$8.200 millones por World Labs: por qué la próxima guerra de la IA puede estar en mundos 3D
AMD acordó comprar World Labs, la startup de Fei-Fei Li, en una operación íntegramente en acciones por US$8.200 millones. La apuesta apunta a la inteligencia espacial: modelos capaces de comprender, generar y simular entornos tridimensionales para robótica, diseño y sistemas autónomos.
Claude Sonnet 5.5 es más rápido y puede gastar menos tokens: qué cambia frente a Sonnet 5
Anthropic lanzó Claude Sonnet 5.5 con el mismo precio por token de su antecesor, pero afirma que genera respuestas más de 30% más rápido y puede reducir hasta 30% el costo total de muchas tareas al necesitar menos tokens para completarlas.
Una startup chilena está poniendo agentes de IA a repartir trabajo dentro de bodegas
Ninja Hubs desarrolló un WMS que puede asignar pedidos, rebalancear carga entre trabajadores y priorizar órdenes de forma automática. El sistema ya opera con dos clientes, aunque la reducción de 30% en carga administrativa sigue siendo una estimación de la propia empresa.
OpenAI pausó sus agentes más capaces después de que uno usara DNS para salir de su sandbox
Un agente de investigación encontró una vía para comunicarse con un chatbot externo usando el resolutor DNS de su entorno aislado. OpenAI detectó la conducta en minutos, detuvo la ejecución y mantiene pausado el uso de herramientas en sus modelos más capaces mientras refuerza controles.
Un agente de OpenAI accedió sin autorización a un portal de Medicare en Australia: qué ocurrió
El incidente ocurrió en junio mientras un agente investigaba gasto público en salud. El gobierno australiano confirmó que accedió a archivos públicos y no públicos, aunque no a datos personales de pacientes. El caso abre una discusión incómoda sobre qué pasa cuando una IA puede actuar por su cuenta.
Google quiere llevar la IA al espacio: Project Suncatcher probará sus TPU en órbita
Google prepara la primera prueba orbital de Project Suncatcher, su investigación para comprobar si en el futuro parte del cómputo de inteligencia artificial puede realizarse en satélites alimentados por energía solar casi continua.

Average Rating