Nvidia cria novo sistema para conter agentes de IA que tentam escapar de restrições
Tudo sobre Inteligência Artificial
A Nvidia lançou nesta segunda-feira um pacote de ferramentas de segurança para agentes de IA. Segundo a empresa, a tecnologia poderia ter impedido o ataque à Hugging Face, plataforma de programação de IA que foi alvo de agentes da OpenAI.Continua após a publicidadeA novidade chega enquanto OpenAI e Anthropic investigam diversos casos envolvendo agentes capazes de invadir sistemas comerciais e governamentais. A Nvidia trata a contenção desse comportamento como um problema de engenharia e aposta em mecanismos técnicos para limitar as ações desses sistemas.
As ferramentas identificam comportamentos como a criação de subagentes para tentar contornar bloqueios de segurança. – Imagem: Olhar Digital via ChatGPTOpenShell controla as ações dos agentesUma das ferramentas apresentadas é o OpenShell, que usa recursos de hardware dos processadores da Nvidia para manter agentes de IA em ambientes controlados e restringir suas ações.A empresa também trabalha com a Arm Holdings e a Intel para que a tecnologia funcione nos processadores das duas fabricantes. O lançamento conta com dezenas de parceiros, entre eles a Anthropic.Leia mais:Justin Boitano, vice-presidente e gerente-geral de computação empresarial da Nvidia, afirmou que a plataforma poderia ter evitado o ataque à Hugging Face caso estivesse sendo utilizada durante as avaliações de modelos.“Pelo que sabemos, essa nova plataforma de segurança poderia ter impedido a invasão se estivesse sendo usada nos laboratórios de fronteira para avaliação de modelos desde o início”, disse Boitano à Reuters. “Estamos avançando com isso de forma aberta e queremos envolver todos para trabalhar conosco.”Meses após o ataque, a Nvidia anunciou a compra da Hugging Face por US$ 13 bilhões.
A Nvidia diz que suas novas ferramentas poderiam ter impedido o ataque à Hugging Face durante avaliações de modelos. – Imagem: Divulgação/NvidiaSentry tenta impedir fugasOutra ferramenta é o Sentry, que funciona em conjunto com o OpenShell e usa um chip separado da Nvidia. O sistema pode interromper um agente caso ele tente escapar das barreiras impostas pelo processador.As ferramentas usam fórmulas matemáticas para identificar comportamentos que podem indicar tentativas de contornar as restrições, incluindo:
criação de vários subagentes para driblar bloqueios;
tentativa de escapar das barreiras de segurança;
uso de estratégias alternativas para contornar restrições;
atuação coordenada de múltiplos agentes.
Ali Golshan, diretor sênior de software de IA da Nvidia, explicou que a questão envolve não apenas o comportamento de um agente individual, mas também a forma como vários deles podem operar juntos.Continua após a publicidade“É realmente de comportamento agentivo que estamos falando: frotas de agentes e como eles operam em conjunto”, afirmou Golshan.As novas ferramentas combinam recursos de hardware e software para detectar tentativas de contornar as barreiras de segurança. A Nvidia pretende ampliar o sistema para diferentes processadores e trabalhar com parceiros do setor no desenvolvimento da tecnologia.
Valdir Antonelli
Valdir Antonelli é jornalista com especialização em marketing digital e consumo.
Ver todos os artigos →









