SRE-Bench expõe limites de agentes de IA na engenharia reversa de binários reais
Pesquisadores construíram do zero, com mais de 5.000 horas de trabalho de especialistas em engenharia reversa, um benchmark livre de contaminação com 19 programas privados de escala real e 44 primitivas anti-análise proprietárias, gerando 262 binários e 1.572 tarefas avaliadas de forma determinística. O modelo mais forte testado resolveu completamente apenas 31,5% das instâncias, evidenciando que a forte capacidade de LLMs em análise de código-fonte não se transfere para análise binária.
Fonte ↗