Avaliação Comparativa e Caracterização de Ferramentas SAST e LLMs no OWASP Benchmark

Henrique da Fonseca Diniz Freitas

A detecção precoce de vulnerabilidades é um desafio crítico na engenharia de software, tradicionalmente abordado por ferramentas de Teste Estático de Segurança de Aplicações (SAST). Contudo, o excesso de falsos positivos gerados por essas ferramentas afeta severamente a manutenção de sistemas. Recentemente, Grandes Modelos de Linguagem (LLMs) surgiram como alternativas promissoras, capazes de raciocínio semântico. Este trabalho apresenta uma análise comparativa sistemática entre ferramentas SAST (CodeQL e Semgrep) e LLMs (Gemini 2.5 Flash e GPT-5-mini) utilizando o OWASP Benchmark v1.2. Os resultados evidenciam uma dicotomia tecnológica: o CodeQL garantiu cobertura total (Recall de 1.0) em validações determinísticas, enquanto o Gemini demonstrou precisão superior (aprox. 90%) em fluxos de dados complexos. O estudo avança na caracterização das falhas, utilizando métricas de risco como Odds Ratio e Absolute Risk Difference para avaliar a exclusividade de detecção e a influência da severidade na probabilidade de acerto. Conclui-se que as abordagens são estritamente complementares, fornecendo diretrizes empíricas para a construção de pipelines híbridos que reduzam a fadiga de alertas na evolução de software.


2026/1 - POC2

Orientador: João Eduardo Montandon de Araújo Filho

Palavras-chave: Segurança de Software, Manutenção, SAST, LLM, Detecção de Vulnerabilidades, Fadiga de Alertas, GQM

PDF Disponível