Estudo propõe detectar áudio deepfake por coerência temporal usando embeddings CLAP, e expõe falha grave de generalização
Pesquisadores apresentaram um método de detecção de áudio sintético (deepfake) baseado em coerência temporal: em vez de treinar uma rede profunda de ponta a ponta, eles extraem embeddings de áudio com CLAP, medem a similaridade de cosseno entre segmentos consecutivos e treinam um classificador ensemble leve sobre as estatísticas dessa distribuição. O trabalho cobre fala, música instrumental e música com vocais, mas o achado mais relevante é negativo: 21 das 29 features estatísticas usadas invertem a direção discriminativa entre o treino e o uso em campo, e a entropia chega a discriminar em sentidos opostos para fala e para música.
Fonte ↗