SCRIPTIOC-BENCH: benchmark mostra que LLMs ainda erram bastante ao extrair IOCs de malware em script
Um novo benchmark, o SCRIPTIOC-BENCH, reúne 634 amostras reais e verificadas manualmente de malware em JavaScript, PowerShell e VBScript para medir a capacidade de LLMs de extrair estaticamente indicadores de comprometimento — URLs, domínios, IPs e artefatos de sistema de arquivos — sem executar o código. O modelo mais forte avaliado atingiu apenas 65,4 de F1, o que mostra que a extração automatizada de IOCs continua não confiável quando os indicadores estão ofuscados ou exigem decodificação, mesmo usando os modelos mais capazes disponíveis.
Fonte ↗