Aikido

Como a Aikido encontra mais vulnerabilidades do que o Mythos a metade do custo

Escrito por

TL;DR: Testámos três produtos de segurança de código de IA contra uma aplicação de referência privada com 89 vulnerabilidades conhecidas. Eis os resultados:

  • Aikido Code Security Audit: 68 de 89 vulnerabilidades (76%) por $75
  • Claude Security com Mythos: 60 de 89 vulnerabilidades (67%) por $157
  • Codex Security: 58 de 89 vulnerabilidades (65%) por $125

O Claude Mythos é, sem dúvida, o modelo de cibersegurança mais forte construído pela Anthropic. Mas sabemos que a capacidade do modelo é apenas parte do que determina o desempenho de um produto de vulnerabilidade de IA.

Para testar isso, colocámos o Claude Security da Anthropic (que executa no Mythos) e o Code Security Audit do Aikido lado a lado no mesmo alvo exato, para avaliar qual das soluções oferece a melhor cobertura e a que custo. O Code Security Audit faz parte do pacote de análise de código com IA do Aikido. Também testámos o Codex Security. Executámos os três produtos contra a mesma aplicação de referência privada.

Os resultados? O Aikido encontrou mais 8 vulnerabilidades do que o Claude Security com Mythos, incluindo 1 problema crítico e 3 de alta severidade, custando menos de metade. O Aikido encontrou dez vulnerabilidades a mais do que o Codex Security. Estes resultados são mais um exemplo de que o desempenho e a eficiência dependem do sistema em redor do modelo, e que mesmo com o modelo mais capaz, o desempenho ainda pode ficar aquém.

A estrutura continua a fazer a diferença

Tal como já escrevemos anteriormente, a descoberta de vulnerabilidades é, fundamentalmente, um problema de pesquisa. Uma ferramenta tem de decidir onde procurar, que hipóteses investigar, com que profundidade deve analizá-las e quando é que uma descoberta tem provas suficientes para ser comunicada.

O Claude Security utiliza um processo sofisticado que envolve o mapeamento de repositórios, agentes de análise e verificação em várias fases. A Aikido tem o seu próprio processo sofisticado, mas difere na forma como aloca esse trabalho, utilizando modelos mais pequenos e de menor custo, escolhidos especificamente para as tarefas em que têm melhor desempenho. Estes modelos mais pequenos conseguem explorar uma gama mais ampla de hipóteses independentes, enquanto o raciocínio avançado mais dispendioso é reservado para as fases em que é mais provável fazer a diferença no resultado.

Essa alocação é o que permitiu que esta execução gastasse o seu orçamento na amplitude da investigação, em vez de aplicar o modelo mais dispendioso a tudo, o que resultou numa taxa de recuperação substancialmente superior.

Esta recuperação superior incluiu vários problemas com impacto no mundo real que o enxame de agentes da Aikido detetou, mas que o Mythos deixou escapar. Um deles foi uma falha crítica de autorização entre inquilinos (cross-tenant) que permitia aos utilizadores atualizar as definições da sua própria conta e alterar a atribuição da sua organização para se adicionarem a outra, obtendo acesso aos dados dessa organização. A Aikido também encontrou problemas mais subtis e fáceis de ignorar, incluindo uma discrepância no formato de carimbo de data/hora (timestamp) entre a aplicação e a base de dados, que permitia que chaves de API expiradas continuassem válidas.

‍

A inteligência avançada torna-se dispendiosa rapidamente

O Mythos começa nos 10 dólares por milhão de tokens de entrada e nos 50 dólares por milhão de tokens de saída. Isto acumula-se rapidamente quando uma revisão se expande para centenas de trajetórias de agentes num repositório de grande dimensões. 

A dificuldade reside no facto de as auditorias de código agênticas não terem uma quantidade fixa de trabalho. Dependendo de fatores como o tamanho do repositório e a complexidade da aplicação, o número de pistas a seguir e o raciocínio necessário tendem a variar de um repositório para outro. 

O Claude Security deixa esta variabilidade do seu lado. Os utilizadores avançam às cegas porque o Claude Security não fornece o custo da análise até que a execução esteja concluída. Assim, quando a poeira assenta, pode acabar com um custo muito superior ao esperado.

A Aikido faz uma escolha diferente. Nós assumimos essa incerteza. Antes de a análise começar, estimamos dinamicamente o seu custo com base no tamanho do repositório, no código passível de revisão e na complexidade, apresentando essa estimativa ao utilizador.

Enquanto utilizador, pode aumentar ou diminuir o nível de cobertura para se adaptar a essa estimativa antes de se comprometer com ela. A nossa execução no repositório de referência ter-lhe-ia custado 75 dólares à profundidade recomendada, enquanto o Claude Security teria custado uns fixos 157,06 dólares.

‍

‍

E se achar que o repositório merece uma cobertura ainda mais intensiva do que a estimada automaticamente por nós, tem a liberdade de a aumentar.  

‍

Na nossa execução com o Claude Security, não foi fornecida nenhuma estimativa de custo prévia e o total só ficou claro após a conclusão da análise. 

O repositório que utilizámos para a análise tem cerca de ~15.000 linhas de código. Não ter a opção de ver uma estimativa de custos antecipada ou de ajustar o nível de esforço da análise ao seu orçamento é gerível num repositório desta dimensão. No entanto, torna-se um problema muito maior à medida que os custos de pesquisa de vulnerabilidades aumentam com o tamanho do repositório, o tipo de aplicação e a complexidade do pipeline.

Se apontar um modelo dispendioso a um monorepo, ou se o executar em cada pull request, a ausência de uma estimativa pré-análise pode deixá-lo com custos substancialmente superiores aos esperados.

O que isto significa

Argumentamos há algum tempo que o design da estrutura determina os resultados de segurança muito mais do que o modelo subjacente. Este benchmark oferece-nos uma primeira visão de comparação direta, testando o Mythos 5 e o Codex Security contra o Code Security Audit nos mesmos repositórios, e a estrutura continuou a fazer a diferença.

‍
Naturalmente, um único benchmark não encerra a discussão, mas fornece provas de que a premissa de que "a estrutura é mais importante do que o modelo" já não se baseia apenas em afirmações.

Compartilhar:

https://www.aikido.dev/blog/aikido-finds-more-vulnerabilities-claude-security-mythos

Assine para receber notícias

4.7/5
Cansado de falsos positivos?

Experimente Aikido como 100 mil outros.
Começar Agora
Obtenha um tour personalizado

Confiado por mais de 100 mil equipes

Agende Agora
Escaneie seu aplicativo em busca de IDORs e caminhos de ataque reais

Confiado por mais de 100 mil equipes

Iniciar Escaneamento
Veja como o pentest de IA testa seu aplicativo

Confiado por mais de 100 mil equipes

Iniciar Testes

Torne-se seguro hoje,
de forma rápida e gratuita.

Proteja o seu código, a cloud e o runtime num sistema central.
Conecte um repositório para descobrir o que os agentes de raciocínio encontram na sua base de código.

Não é necessário cartão de crédito | Resultados do teste em 32 segundos.
Confiado por mais de 150 mil orgs