A startup Goodfire desenvolveu um sistema de monitoramento interno para agentes de inteligência artificial, com o objetivo de detectar e conter comportamentos nocivos durante a execução das tarefas, sem depender de modelos revisores separados, que costumam ter custo elevado.
O fato e os números
A tecnologia da Goodfire funciona por meio de sondas que observam os sinais internos de um modelo de IA enquanto ele está em funcionamento, em vez de analisar apenas o resultado final gerado. Em testes realizados com o modelo Kimi K3, o sistema conseguiu detectar 93% das tentativas de ataques hacker direcionadas ao modelo.
Segundo a empresa, o custo estimado da nova abordagem é de US$ 185 por milhão de interações processadas. Em comparação, sistemas tradicionais de revisão, que usam outros modelos de IA para verificar o comportamento do agente principal, chegam a cobrar US$ 5.420 pelo mesmo volume de interações.
Contexto e por que importa
Com o avanço de agentes de IA capazes de executar tarefas de forma mais autônoma, cresce também a preocupação com comportamentos indesejados ou ataques direcionados a esses sistemas, como tentativas de manipulação para que o agente realize ações fora do previsto. Esse tipo de risco é chamado de segurança agêntica pelo setor de tecnologia.
Até então, garantir esse tipo de segurança costumava exigir o uso de modelos de IA adicionais só para supervisionar o comportamento de outros modelos, o que elevava significativamente os custos operacionais, especialmente para empresas que processam grandes volumes de interações.
O que muda para as pessoas e para o mercado
Para empresas que utilizam agentes de IA em larga escala, a redução de custo apontada pela Goodfire pode tornar viável a adoção de camadas de segurança que antes eram caras demais para negócios menores ou para operações de alto volume.
Para o mercado de segurança em inteligência artificial, a abordagem de monitoramento interno representa uma alternativa técnica ao modelo tradicional de revisão externa, podendo influenciar como outras empresas do setor desenvolvem suas próprias ferramentas de proteção contra uso malicioso de agentes de IA.
O que observar daqui para frente
De acordo com a TechCrunch, será importante acompanhar se a taxa de detecção de 93% observada nos testes com o Kimi K3 se mantém estável em outros modelos de IA e em cenários de uso real, fora do ambiente controlado dos testes iniciais.


Deixe um comentário