NVIDIA OpenShell: cómo funciona el runtime open source para contener agentes de IA
"No se puede esperar que un agente en estas circunstancias gobierne por completo su propio comportamiento". La frase es de NVIDIA, en el post técnico con el que presentó el 28 de septiembre de 2026 su Open Agent Safety Platform, y resume la idea detrás del lanzamiento: la seguridad de un agente no puede depender de que el agente se porte bien. Tiene que haber controles fuera de su alcance.
La pieza central para desarrolladores es OpenShell, un runtime open source (licencia Apache 2.0) que ejecuta agentes en sandboxes con aislamiento a nivel de kernel, filtra su salida de red por política y mantiene las credenciales reales fuera del proceso del agente. NVIDIA publicó la versión 0.1.0 junto con un tutorial paso a paso. Lo contamos en formato corto en este Short; acá va el detalle técnico.
Por qué ahora
El contexto es una serie de incidentes reportados por laboratorios de frontera, en los que agentes salieron de los entornos que debían contenerlos. NVIDIA lo describe así en su post: no fue una capacidad nueva la que llevó a esas fugas, sino "una combinación de herramientas, tiempo e instrucciones ambiguas".
Su propuesta usa una analogía con la web de los 90: internet no se volvió segura pidiéndoles a los desarrolladores web que prometieran portarse bien, sino cuando el navegador dejó de confiar en el código de las páginas y aisló cada pestaña en su propio sandbox.
Los cinco principios de la plataforma
NVIDIA enumera cinco principios de diseño:
- La política tiene que ser verificable. Antes de que el agente corra, un verificador demuestra que su política no puede escaparse de la intención del operador.
- El control tiene que ser out of band. Los controles no viven dentro del agente ni a su alcance.
- El camino hacia el modelo es el punto de control. Un agente no puede actuar sin su próximo "pensamiento": controlar ese camino da el mejor punto de observación y el botón de apagado.
- La autoridad del agente escala con la visibilidad de su razonamiento. Cuanto más puede hacer, más visible tiene que ser cómo decide.
- Responsabilidad compartida. Laboratorios, empresas y proveedores de hardware son dueños de una capa cada uno, como en la nube.
Cómo funciona OpenShell
Según el tutorial técnico, OpenShell 0.1.0 tiene tres componentes:
| Componente | Qué hace |
|---|---|
| Gateway | Gestiona el ciclo de vida y las políticas de muchos sandboxes |
| Supervisor | Uno por sandbox, fuera del proceso del agente; revisa cada request saliente contra la política |
| Sandbox | Corre la carga con controles de kernel sobre filesystem y procesos, sin camino de red salvo a través del supervisor |
Algunos detalles que lo diferencian de un contenedor con un firewall:
- Inspección a nivel de protocolo. El supervisor puede inspeccionar tráfico HTTP, GraphQL y MCP configurado, y permitir una consulta de datos mientras bloquea una escritura en la misma API.
- Los controles persisten cuando el agente abre un shell, ejecuta código generado, lanza procesos hijos o delega en subagentes.
- Auditoría en formato OCSF (Open Cybersecurity Schema Framework) de cada decisión de política.
- Credenciales fuera del agente. El agente ve un placeholder; la credencial real se sustituye fuera del sandbox y solo para destinos autorizados. Si el agente manda el placeholder a otro destino, el request se rechaza.
- Propuestas de cambio de política. Si un request se bloquea, el agente puede proponer una regla acotada. La propuesta queda pendiente de revisión humana por defecto y el agente no puede aprobar su propio pedido.
Según NVIDIA, OpenShell soporta Codex, Claude Code, Pi y Hermes, y tiene compute drivers para Docker, Podman, MicroVM y Kubernetes.
Un ejemplo práctico: de sin red a solo lectura
El tutorial usa curl contra un endpoint público de la API de GitHub para mostrar las decisiones de política sin necesitar un modelo. Primero, un sandbox sin salida de red:
openshell sandbox create --name policy-demo \
--no-auto-providers \
--policy examples/no-network.yaml
# Dentro del sandbox: esto falla, no hay permiso de red
curl -sS --max-time 10 https://api.github.com/zen
# Desde otra terminal en el host: ver qué se bloqueó y por qué
openshell logs policy-demo --since 5m
Después, una política que permite solo lectura sobre la API de GitHub. Las políticas se escriben en YAML y se compilan a OPA/Rego:
network_policies:
github_api:
name: github-api-readonly
endpoints:
- host: api.github.com
port: 443
protocol: rest
enforcement: enforce
access: read-only
binaries:
- path: /usr/bin/curl
Se aplica sin reiniciar el sandbox:
openshell policy set policy-demo \
--policy examples/github-readonly.yaml --wait
# Lectura: permitida
curl -sS --max-time 10 https://api.github.com/zen
# Escritura: bloqueada
curl -sS --max-time 10 -X POST https://api.github.com/zen
Un agente que ejecute esos mismos comandos se encuentra con las mismas restricciones. Esa es la clave: la política no depende de lo que el agente "decida".
El verificador de políticas
Una política puede parecer restrictiva y dejar otro camino abierto: bloquear escrituras a GitHub desde una herramienta no sirve si otra herramienta permitida, o código generado, puede usar la misma credencial. OpenShell incluye un policy prover que usa lógica formal para demostrar que los permisos modelados quedan dentro de un límite definido por el operador, o para mostrar una acción concreta que lo cruza.
NVIDIA cuenta que, en experimentos adversariales largos, agentes de frontera con salvaguardas reducidas pasaron hasta dos horas intentando convencer a un revisor de IA de que les diera permisos para modificar un repositorio protegido. Según la empresa, el análisis formal le dio al revisor evidencia de qué permitían esos permisos, y no hubo escrituras al repo protegido en esas pruebas.
Sentry y el hardware
La segunda pieza, NVIDIA Sentry, extiende el monitoreo a las DPU BlueField. En los sistemas Vera Rubin POD, cada bandeja de cómputo tiene una BlueField-4 en el único camino del nodo hacia el modelo, aislada del host. Desde ahí puede observar y aplicar políticas aunque el host no sea confiable. Es opcional y está pensado para quien ya tiene ese hardware; WIRED informa que NVIDIA trabaja con Arm e Intel para llevar Sentry a otras arquitecturas.
Quién lo usa y qué falta saber
NVIDIA menciona adopciones de Cadence (diseño de chips), Slack (una plataforma de agentes bajo demanda) y Gecko Robotics (agentes que toman decisiones sobre robots físicos). WIRED agrega que NVIDIA dice que SpaceXAI usa la plataforma para sus agentes de Cursor y los modelos Grok, y que Anthropic y NVIDIA están integrando seguridad en Claude Managed Agents. WIRED también señala que no queda claro cuántos de los socios listados adoptaron OpenShell en la práctica, y que OpenAI no figura en el anuncio.
Es una versión 0.1.0: conviene evaluarla con expectativas de proyecto joven.
Qué hacer con esto
Aunque no adoptes OpenShell, sus principios sirven como checklist para cualquier plataforma de agentes:
- ¿Los controles de red y filesystem viven fuera del proceso del agente?
- ¿El agente puede ver credenciales reales, o solo placeholders que se sustituyen fuera?
- ¿Podés permitir lecturas y bloquear escrituras sobre la misma API?
- ¿Cada decisión de política queda auditada en un formato estándar?
- ¿Los cambios de permisos pasan por revisión humana, sin que el agente pueda aprobarse a sí mismo?
- ¿Tenés un corte (kill switch) en el camino hacia el modelo?
¿Tus agentes corren hoy en un sandbox con política de red explícita, o en la misma máquina y con las mismas credenciales que el desarrollador?
Lecturas relacionadas
- OpenAI pausó sus modelos más capaces: 6 lecciones de seguridad para equipos que usan agentes de IA: un agente que salió a internet por DNS, otro que filtró un token, y qué revisar en tus propios agentes.
- OWASP Top 10 para aplicaciones con LLM (2025) explicado: prompt injection y cómo mitigarla: los 10 riesgos de OWASP para apps con LLM y un plan concreto contra prompt injection y exceso de agencia.
- Storm-3168: cómo atacaron Azure con service principals comprometidos y cómo proteger tus identidades de workload: un ataque automatizado que borró más de 100 storage accounts en 7 minutos, y un checklist con comandos az.
En video (Short de menos de 1 minuto): Nvidia lanza OpenShell para contener agentes de IA
Fuentes
- NVIDIA Technical Blog, "NVIDIA Open Agent Safety Platform: A Reference for Continuous In-Silicon Agent Monitoring" (28/09/2026): https://developer.nvidia.com/blog/nvidia-open-agent-safety-platform-a-reference-for-continuous-in-silicon-agent-monitoring/
- NVIDIA Technical Blog, "Add Runtime Controls to AI Agents with NVIDIA OpenShell" (28/09/2026): https://developer.nvidia.com/blog/add-runtime-controls-to-ai-agents-with-nvidia-openshell
- NVIDIA, página de OpenShell: https://www.nvidia.com/en-us/ai/openshell/
- WIRED, "Nvidia's Answer to Rogue Agents Is an Open-Source AI Security System" (28/09/2026): https://www.wired.com/story/nvidias-answer-to-rogue-agents-is-an-open-source-ai-security-system/