Aikido

Apresentamos o Altar da « Aikido »: o modelo que torna possível a inteligência de segurança soberana

Escrito por

Hoje, apresentamos o Altar, o nosso primeiro modelo de segurança de peso aberto, concebido para proporcionar segurança defensiva de nível de vanguarda à infraestrutura que controla.

Demos o nosso primeiro passo rumo à segurança de inteligência soberana com o nosso dispositivo « pentest autônomo » ( Aikido Machine), que funciona inteiramente dentro da própria infraestrutura do cliente, incluindo ambientes totalmente isolados (air-gapped). As equipas com regras rigorosas quanto à manutenção do código internamente podem detetar, explorar e validar continuamente vulnerabilidades em toda a sua superfície de ataque sem infringir essas regras.

A Altar disponibiliza a «Aikido » com IA avançada que assegura a defesa, sem enviar os dados mais sensíveis de uma organização para um serviço de inferência de terceiros.

Para tal, precisávamos de colmatar a lacuna na implementação. A maioria dos modelos de peso aberto mais avançados continua a ser difícil de implementar à escala de produção, mantendo ao mesmo tempo a qualidade de raciocínio dos modelos de ponta.

Começámos com o GLM-5.3, um dos modelos mais robustos nas nossas avaliações de segurança. O modelo completo ocupa 1,51 TB; a quantização reduz esse valor para 488 GB e o nosso processo de poda especializado reduz-o ainda mais para 328 GB, preservando, ao mesmo tempo, a maior parte da qualidade de raciocínio do modelo original.

A diferença entre os modelos «frontier» e «open-weights»: uma explicação

Modelos de fronteira fechada executados na infraestrutura de terceiros

Recorrer a essa opção significa que o seu código-fonte, a documentação da sua arquitetura interna e as suas constatações não corrigidas saem da sua rede. Para um banco que opera ao abrigo de uma obrigação de residência de dados, um grupo hospitalar sujeito a regras rigorosas de tratamento de dados ou um operador industrial cujo ambiente de tecnologia operacional (OT) não tem qualquer ligação à Internet, não se trata de uma escolha que lhes seja permitido fazer.

A lacuna na implementação

A execução de um modelo como o GLM 5.3 com precisão total requer centenas de gigabytes de memória unificada e resulta numa velocidade de inferência limitada quando se processam conversas paralelas com janelas de contexto amplas. Em termos humanos, são enormes. 

Essas exigências de recursos resultam, em parte, da forma como estes modelos são construídos. Muitos dos modelos mais potentes da atualidade utilizam arquiteturas do tipo «mistura de especialistas». Estes modelos são compostos por uma multiplicidade de pequenas redes neurais especializadas, cada uma das quais designada por «especialista». Apenas um pequeno número de especialistas está ativo para cada token, enquanto o conjunto completo de especialistas tem, ainda assim, de ser armazenado e disponibilizado. Isso significa suportar um custo significativo em termos de memória e infraestrutura por uma capacidade que pode contribuir pouco para a carga de trabalho que está efetivamente a executar. 

O trabalho de segurança, como a análise de código à procura de vulnerabilidades, a proposta de correções e a realização de testes de penetração, recorre apenas a uma pequena parte desse conjunto de especialistas. No entanto, o custo de memória não diminui em conformidade: cada pedido tem ainda de carregar o modelo completo, seja ou não relevante para a tarefa. 

Agora, se adicionarmos agentes a este cenário, a utilização do contexto dispara, o que satura a memória e leva os agentes a disputarem espaço entre si. Cada um mantém um registo contínuo de tudo o que viu e fez, e esse registo fica na memória da GPU juntamente com o próprio modelo, aumentando à medida que a investigação avança e multiplicando-se por todas as investigações em execução em paralelo. 

É por isso que a dimensão do modelo é importante neste contexto: o modelo e todo esse contexto em expansão recorrem à mesma reserva fixa de memória, pelo que quanto mais espaço um ocupa, menos espaço resta para o outro. O objetivo é tornar um modelo de vanguarda mais eficiente na execução de uma carga de trabalho específica, preservando as capacidades que importam e, ao mesmo tempo, libertando capacidade para tudo o que está a ser executado em paralelo.

O que podemos eliminar sem perder o que é essencial?

O grande fardo que representa a inclusão de tantos especialistas num modelo pode ser transformado numa vantagem com as técnicas adequadas. A fim de minimizar o tamanho dos modelos de peso aberto num contexto de segurança baseada em agentes, mantendo simultaneamente uma elevada precisão, recorremos à quantização e à poda. 

A poda de especialistas remove alguns dos especialistas do modelo, normalmente eliminando blocos inteiros de pesos de especialistas e ajustando o modelo para que cada token escolha apenas entre os que permanecem. A remoção em si é mecânica. Decidir quais os especialistas a remover é a parte difícil, e a perda pode ser desigual: um modelo mais pequeno pode manter um forte desempenho na codificação, mas perder grande parte da sua capacidade de compreender uma determinada língua natural. Isso pode torná-lo incapaz de interpretar de forma fiável a documentação, as regras de negócio ou as funcionalidades da aplicação descritas nessa língua.

Para decidir o que manter, começámos pelo conjunto de dados mais natural: registos do nosso conjunto de testes de penetração ao executar benchmarks internos. Estes registos captam o código, as chamadas às ferramentas e as respostas que os agentes processam durante um teste de penetração completo, fornecendo-nos dados representativos para orientar a seleção de especialistas. Nunca foram envolvidos dados de clientes.

Esta etapa de calibração proporciona-nos uma base específica para cada carga de trabalho na seleção de especialistas, sem ser necessário treinar novas competências no modelo.

Os percursos do harness abrangiam a carga de trabalho técnica. Também precisávamos de preservar a compreensão da linguagem: investigar uma aplicação significa compreender as suas funcionalidades, regras de negócio e fluxos de trabalho pretendidos, mesmo quando a sua documentação ou interface está em francês, holandês ou noutro idioma. Por isso, adicionámos texto multilingue para ajudar a preservar essas capacidades durante a poda.

A escolha é tão importante quanto o tamanho

Existem muitas técnicas de poda para reduzir a pegada dos LLMs, pelo que decidimos optar por uma técnica capaz de preservar o desempenho nos nossos casos de utilização: o Cerebras REAP( Router-weighted Expert Activation Pruning). Utilizámos a pontuação de contribuição do REAP com uma estratégia de agregação que preserva o domínio, selecionada através de experiências de fidelidade. Contar a frequência com que um «expert» é selecionado dá apenas uma visão parcial da situação. O REAP estima a sua contribuição utilizando tanto a ponderação do «router» como a magnitude da saída do «expert».

Analisamos também as contribuições em diferentes grupos de exemplos. Caso contrário, uma competência relevante para uma carga de trabalho menos comum pode perder-se numa média global. As competências em cibersegurança, programação e línguas estão distribuídas entre os especialistas; não existe um conjunto claramente definido de «especialistas em cibersegurança» que se possa manter ou descartar.

No estudo de compressão de apoio, os modelos que mantinham o mesmo número de especialistas diferiram substancialmente no grau de correspondência dos seus resultados com o modelo de referência. O tamanho, por si só, não determinou quais os modelos que se mantiveram.

De 1,51 TB a 328 GB

Conseguimos uma redução total de 78,2% no tamanho do modelo em comparação com o GLM 5.3 com precisão total e uma redução de 32,8% em comparação com o GLM 5.3 com quantização AWQ INT4. O Altar mantém 168 dos 256 especialistas encaminhados originais em cada camada de especialistas da estrutura principal, removendo 88, ou seja, 34,4% deles. O router continua a selecionar oito por token, agora a partir do conjunto mais reduzido.

A outra parte da redução resulta da quantização. Os pesos de um modelo são os valores numéricos que este aprende durante o treino. A quantização armazena esses números com menos bits, sacrificando alguma precisão em troca de pesos mais pequenos no armazenamento. Ao contrário da poda, não remove os «experts».

O nosso ponto de verificação inicial utilizou o AWQ para armazenar a maioria dos pesos do modelo em quatro bits, em vez dos dezasseis do modelo BF16. O AWQ utiliza informações sobre a atividade do modelo em entradas de exemplo para limitar os erros introduzidos por uma precisão inferior. Os valores intermédios produzidos durante a inferência, denominados ativações, mantêm-se em 16 bits: daí a designação W4A16, ou pesos de quatro bits e ativações de 16 bits. Alguns pesos também mantêm uma precisão mais elevada. Em seguida, aplicámos a poda a este ponto de verificação já quantizado.

A comparação das duas representações-mãe mostra qual é a contribuição de cada etapa:

Ponto de controlo Pesos guardados
GLM-5.3, BF16 não podado (16 bits) 1 506,7 GB
GLM-5.3, AWQ INT4 não podado 488,2 GB
Altar, podado W4A16 328,0 GB

Isso representa 78,2% menos espaço de armazenamento do que o modelo completo de 16 bits. Em comparação com o modelo original, já quantizado, a poda elimina mais 160 GB, o que corresponde a uma redução de 32,8%.

O impacto da compressão nas capacidades de identificação de vulnerabilidades

Já criámos anteriormente um benchmark interno do CVE que utilizamos para avaliar a capacidade de um modelo identificar vulnerabilidades complexas do mundo real, recorrendo ao nosso conjunto de testes « análise de código com IA »: 32 vulnerabilidades conhecidas distribuídas por 30 repositórios, com três execuções por caso.

Executámos o Altar para testar o sistema. O Altar registou uma taxa média de deteção de 60,4% por execução e voltou a detetar 23 das 32 vulnerabilidades pelo menos uma vez ao longo de três execuções.

Em comparação, o modelo GLM-5.3 AWQ quantizado registou, em média, 61,5% de recall e abrangeu as mesmas 23 vulnerabilidades. O modelo GLM-5.3 original, com precisão total, registou, em média, 65,6% de recall e abrangeu 25 das 32 vulnerabilidades.

Por outras palavras, a redução do ponto de verificação já quantizado de 488 GB para 328 GB — o que representa uma redução de 32,8 % nos pesos armazenados — resultou numa diminuição de aproximadamente um ponto percentual na taxa média de recall, em comparação com a linha de base do AWQ, mantendo simultaneamente toda a sua cobertura de vulnerabilidades. Em comparação com o modelo original, o Altar manteve 23 das suas 25 vulnerabilidades abrangidas, ou seja, 92%, com uma diminuição de 5,2 pontos percentuais na taxa média de recall. Isto significa que 92% da cobertura de vulnerabilidades do modelo original foi mantida com 33% menos espaço de armazenamento.

É esse o compromisso que procurávamos: um modelo significativamente mais pequeno, mantendo, ao mesmo tempo, a maior parte das capacidades de segurança do modelo original.

Apresentamos a taxa média de deteção por execução separadamente da cobertura ao longo de três execuções: detetar uma vulnerabilidade uma única vez é diferente de a detetar de forma consistente. As execuções concluídas sem qualquer deteção são consideradas falhas; as execuções incompletas são apresentadas separadamente.

Esta medida avalia a redescoberta de CVE de forma direcionada no âmbito de um fluxo de trabalho que utiliza outros modelos nas etapas circundantes. Não mede a descoberta cega em toda a base de código, não executa exploits para validar os resultados nem avalia a etapa de proposta de correção. Esses limites distinguem este benchmark do fluxo de trabalho mais abrangente de testes de penetração para o qual estamos a desenvolver o Altar.

Além disso, implementámos o Altar na nossa frota de máquinas « Aikido » imediatamente após concluirmos estas avaliações. Pouco depois da implementação, o Altar identificou uma vulnerabilidade válida de gravidade crítica durante um teste de penetração em ambiente de produção de um cliente.

{{cta}}

O que se segue 

A ideia subjacente é mais abrangente: os serviços de informação de segurança soberana devem funcionar em qualquer ambiente que protejam.

O Altar é apenas o começo. No que diz respeito à compressão, estamos a explorar formatos com menor número de bits, como o EXL3, que nos poderão permitir reter mais especialistas, a par de novas otimizações na disponibilização do H200.

O próximo passo é ir além da compressão e avançar para a fase de treino: aperfeiçoar os modelos para fluxos de trabalho de segurança, melhorar a utilização das ferramentas e o raciocínio a longo prazo, e criar um pipeline de autoaprendizagem baseado nos nossos benchmarks internos para orientar e moldar os modelos futuros.

Esse trabalho abrangerá a investigação de vulnerabilidades, a análise de código, a correção e outros fluxos de trabalho relacionados com a segurança defensiva.

Aikido A Labs existe para continuar a levar isso mais longe: modelos que se tornam mais capazes ao longo do tempo, sem perder a restrição que importa — os defensores têm de ser capazes de os executar inteiramente dentro dos ambientes que têm a responsabilidade de proteger. 

Agradecemos à Z.AI pelo GLM-5.3, à Cerebras pelo REAP, à cyanwiki pelo modelo quantizado e ao 0xSero pelo trabalho de compressão. O estudo público sobre fidelidade e o conjunto de ferramentas «keep plans» e «pruning» fornecem mais detalhes técnicos, sem divulgar as conversas dos agentes na sua forma original.

Os pesos do Altar estão disponíveis na organização Aikido. O Altar pode ser implementado e executado facilmente utilizando um nó 4-H200s e a versão mais recente do vLLM. Descarregue o Altar para obter o cartão do modelo, a licença, os parâmetros de execução e as instruções de implementação.

Precisa de ajuda para o implementar no seu próprio ambiente? Contacte o departamento de vendas para discutir a implementação do Altar no local.

Esta abordagem está a ser alargada a toda a linha de produtos da Aikido, incluindo oAikido Attack (pentest de IA), a Code Security Audit e a Deep PR Review. 

‍

‍

Compartilhar:

https://www.aikido.dev/blog/aikido-altar-open-weight-ai-sovereign-security

Assine para receber notícias

4.7/5
Cansado de falsos positivos?

Experimente Aikido como 100 mil outros.
Começar Agora
Obtenha um tour personalizado

Confiado por mais de 100 mil equipes

Agende Agora
Escaneie seu aplicativo em busca de IDORs e caminhos de ataque reais

Confiado por mais de 100 mil equipes

Iniciar Escaneamento
Veja como o pentest de IA testa seu aplicativo

Confiado por mais de 100 mil equipes

Iniciar Testes
Execute o Altar no seu próprio ambiente

Obter apoio

Fique seguro agora

Proteja seu código, Cloud e runtime em um único sistema centralizado.
Encontre e corrija vulnerabilidades rapidamente de forma automática.

Não é necessário cartão de crédito | Resultados da varredura em 32 segundos.