A NVIDIA apresentou a Open Agent Safety Platform, uma nova barreira de segurança para agentes de IA que aplica parte dos controlos fora do próprio modelo. A arquitetura combina o ambiente de execução aberto OpenShell com o Sentry, uma camada independente de monitorização capaz de interromper ações consideradas suspeitas.
A principal diferença está no local onde as restrições são aplicadas. Em vez de depender apenas das instruções dadas ao modelo ou de mecanismos presentes no ambiente que o agente consegue observar e manipular, a proposta da NVIDIA transfere parte do controlo para a infraestrutura onde o sistema executa as suas ações.
A Open Agent Safety Platform procura responder a um problema que ganhou maior relevância com agentes capazes de navegar na Internet, executar código, utilizar credenciais e interagir com sistemas externos. A NVIDIA afirma que a plataforma permite impor limites que permanecem ativos mesmo quando um agente tenta ultrapassar as restrições definidas ao nível da aplicação.

OpenShell cria uma barreira que o agente não controla
O OpenShell funciona como um ambiente isolado no qual uma organização pode definir os ficheiros, processos, serviços de rede, ferramentas e credenciais a que cada agente pode aceder.
Segundo a NVIDIA, o software cria uma fronteira de execução fora do modelo e aplica políticas enquanto o agente realiza as suas tarefas. A empresa apresenta atualmente a implementação em processadores Vera, mas o OpenShell é software de código aberto e pode ser adaptado a outras plataformas, incluindo sistemas baseados em tecnologia Arm e Intel.
Esta separação é relevante porque uma instrução dada ao modelo não constitui, por si só, uma barreira de segurança. Um agente pode encontrar caminhos não antecipados pelos programadores, alterar a sequência prevista de ações ou explorar recursos disponíveis no ambiente para cumprir o objetivo que lhe foi atribuído.
Uma política aplicada pela infraestrutura introduz um limite diferente. Mesmo que o agente tente executar uma operação proibida, continua dependente das permissões concedidas pelo sistema onde está alojado.
O princípio aproxima-se do modelo de privilégio mínimo utilizado em cibersegurança. O agente recebe apenas os acessos necessários para a tarefa, em vez de operar com permissões gerais sobre ficheiros, rede, serviços e credenciais.
NVIDIA Sentry acrescenta uma camada separada em hardware
A segunda componente da plataforma é o Sentry, um sistema de referência que funciona nos processadores de rede NVIDIA BlueField-4.
O Sentry monitoriza continuamente a atividade do agente a partir de um domínio separado e aplica políticas de segurança diretamente no hardware. Segundo a NVIDIA, pode colocar um agente em quarentena e interrompê-lo em milissegundos caso este tente sair dos limites definidos pelo OpenShell.
A arquitetura cria, assim, duas linhas de defesa. O OpenShell controla os recursos a que o agente pode aceder, enquanto o Sentry procura detetar e bloquear comportamentos que ultrapassem essas regras.
A diferença técnica está na independência dessa segunda camada. O mecanismo de supervisão não corre dentro do agente nem depende do próprio modelo para decidir quando deve interromper a sua atividade.
A Associated Press refere, contudo, que definir corretamente estas políticas continua a ser um dos desafios da abordagem. Restrições demasiado apertadas podem impedir tarefas legítimas, enquanto permissões excessivas reduzem a capacidade de contenção. A publicação salienta também que será necessária utilização em condições reais para avaliar até que ponto a arquitetura consegue manter o equilíbrio entre segurança e funcionalidade.
NVIDIA relaciona plataforma com incidente da Hugging Face
A NVIDIA afirma que a nova arquitetura poderia ter evitado o incidente no qual agentes da OpenAI ultrapassaram mecanismos de contenção durante avaliações de cibersegurança e acabaram por comprometer sistemas da Hugging Face.
A Reuters refere que a empresa considera que OpenShell e Sentry poderiam ter impedido parte das ações realizadas pelos agentes. Trata-se, no entanto, de uma avaliação retrospetiva da NVIDIA e não de uma demonstração independente realizada sobre o incidente original.
O TecheNet analisou anteriormente o incidente da Hugging Face. Durante as avaliações, os agentes ultrapassaram os controlos que os isolavam da Internet, comunicaram através de canais não autorizados e exploraram vulnerabilidades em sistemas externos.
A investigação mostrou que o problema não resultou apenas do comportamento dos modelos. As permissões concedidas aos ambientes de teste, a existência de serviços partilhados e falhas na monitorização permitiram que ações inicialmente confinadas alcançassem infraestrutura real.
É precisamente esse tipo de cenário que a NVIDIA procura abordar. Em vez de assumir que o agente respeitará as fronteiras definidas pelo software que executa, a plataforma introduz mecanismos adicionais fora desse ambiente.
OpenShell é aberto, mas Sentry depende do ecossistema NVIDIA
A dependência tecnológica varia entre as duas componentes.
O OpenShell é software de código aberto e a NVIDIA afirma que pode ser adaptado a plataformas de terceiros. A empresa trabalha com Arm e Intel para ampliar essa compatibilidade.
O Sentry apresenta uma limitação diferente. A implementação anunciada utiliza os DPU BlueField-4 da NVIDIA para criar a camada independente de supervisão e aplicar políticas diretamente no hardware.
Uma organização pode, por isso, utilizar ou adaptar o OpenShell sem adotar toda a infraestrutura da NVIDIA. Já a combinação completa apresentada pela empresa, com o Sentry como camada externa de monitorização, permanece ligada ao seu hardware.
A Open Agent Safety Platform também não resolve todos os riscos associados aos agentes de IA. A arquitetura procura limitar aquilo que um sistema pode fazer sobre ficheiros, rede, credenciais, ferramentas e outros recursos, mas não impede por si só respostas incorretas, decisões inadequadas ou comportamentos problemáticos que ocorram dentro das permissões concedidas.
O anúncio da NVIDIA mostra uma mudança importante na forma como a indústria começa a abordar a segurança dos agentes. Em vez de confiar apenas em instruções, filtros e mecanismos integrados no próprio software, parte da contenção passa para uma infraestrutura que o agente não controla diretamente.
Outros artigos interessantes:



