Benchmark DFIR-Metric expõe os limites dos LLMs na perícia digital
Um novo conjunto de avaliação com 500 casos reais de disco e memória do NIST, 700 questões e 150 desafios estilo CTF mede o quanto modelos de linguagem realmente ajudam na forense digital — e revela que, em tarefas periciais complexas, a acurácia dos modelos ainda beira zero.
Fonte ↗