• JoomlaWorks Simple Image Rotator
  • JoomlaWorks Simple Image Rotator
  • JoomlaWorks Simple Image Rotator
  • JoomlaWorks Simple Image Rotator
  • JoomlaWorks Simple Image Rotator
  • JoomlaWorks Simple Image Rotator
  • JoomlaWorks Simple Image Rotator
  • JoomlaWorks Simple Image Rotator
  • JoomlaWorks Simple Image Rotator
  • JoomlaWorks Simple Image Rotator
 
  Bookmark and Share
 
 
Tesis Doctoral
DOI
https://doi.org/10.11606/T.55.2020.tde-07012020-105601
Documento
Autor
Nombre completo
Henrique Oliveira Marques
Dirección Electrónica
Instituto/Escuela/Facultad
Área de Conocimiento
Fecha de Defensa
Publicación
São Carlos, 2019
Director
Tribunal
Manzato, Marcelo Garcia (Presidente)
Oliveira, Adriano Lorena Inácio de
Santos, Davi Pereira dos
Silva, Diego Furtado
Título en inglés
Evaluation and model selection for unsupervised outlier detection and one-class classification
Palabras clave en inglés
Internal evaluation
Model selection
Outlier detection
Semi-supervised learning
Unsupervised learning
Resumen en inglés
Outlier detection (or anomaly detection) plays an important role in the pattern discovery from data that can be considered exceptional in some sense. An important distinction is that between the supervised, semi-supervised and unsupervised techniques. In this work, we focus on semisupervised and unsupervised techniques. It has been shown that unsupervised outlier detection techniques can be adapted to be applicable also in the semi-supervised setting. Therefore, we conduct a comparative study between the semi-supervised techniques and unsupervised techniques adapted to the semi-supervised context. The main focus of this work, however, is on the unsupervised evaluation of outlier detection. Although there is a large and growing literature that tackles the outlier detection problem, the unsupervised evaluation of outlier detection results is still virtually untouched in the literature, especially in the context of unsupervised detection. The so-called internal evaluation, based solely on the data and the assessed solutions themselves, is required if one wants to statistically validate (in absolute terms) or just compare (in relative terms) the solutions provided by different algorithms or by different parameterizations of a given algorithm in the absence of labeled data. However, in contrast to cluster analysis, where indexes for internal evaluation and validation of clustering solutions have been conceived and shown to be very useful, in the outlier detection domain this problem has been notably overlooked. Here we discuss this problem and provide solutions for the internal evaluation of outlier detection results. In the scenario of semi-supervised detection, we propose an (relative) internal evaluation measure based on data perturbation and compared it with the main measures of the literature, providing the reader with clear recommendations of the best scenario for the use of each one. In the scenario of unsupervised detection, the pioneering measure for internal evaluation of binary outlier solutions, proposed by the author of this thesis in his masters work, is extended to the more general scenario of non-binary outlier solutions, which involves the evaluation of outlier detection scorings, which is the type of result produced by most widely used database-oriented algorithms in the literature. We extensively evaluate both measures in several experiments involving different collections of synthetic and real datasets collected from public repositories.
Título en portugués
Avaliação e seleção de modelos em detecção não supervisionada de outliers e classificação de classe única
Palabras clave en portugués
Aprendizado não supervisionado
Aprendizado semissupervisionado
Avaliação interna
Detecção de outliers
Seleção de modelos
Resumen en portugués
A área de detecção de outliers (ou detecção de anomalias) possui um papel fundamental na descoberta de padrões em dados que podem ser considerados excepcionais sob alguma perspectiva. Uma importante distinção se dá entre as técnicas supervisionadas, semissupervisionadas e não supervisionadas de detecção. O presente trabalho enfoca as técnicas de detecção semissupervisionadas e não supervisionadas. As técnicas não supervisionadas de detecção podem ser adaptadas para operarem também de forma semissupervisionada. Desta forma, foi realizado um estudo comparativo entre as técnicas de detecção semissupervisionada e as técnicas não supervisionadas adaptadas ao contexto semissupervisionado. O principal foco deste trabalho, no entanto, está na avaliação não supervisionada de detecção de outliers. Embora exista uma literatura grande e crescente que aborde o problema de detecção de outliers, a avaliação não supervisionada dos resultados em detecção de outliers ainda está praticamente intocada na literatura, especialmente no contexto de detecção não supervisionada. A chamada avaliação interna, que baseia-se unicamente nos dados e nas próprias soluções a serem avaliadas, é necessária se for preciso validar estatisticamente (em termos absolutos) ou apenas comparar (em termos relativos) as soluções fornecidas por diferentes algoritmos ou por diferentes parametrizações de um dado algoritmo na ausência de dados rotulados. No entanto, em contraste com agrupamento de dados, onde os índices para validação e avaliação interna de soluções de agrupamento foram concebidos e demonstraram ser bastantes úteis, no domínio de detecção de outliers, este problema tem sido notavelmente negligenciado. Nesta tese, este problema é discutido e soluções são fornecidas para a avaliação interna dos resultados em detecção de outliers. No cenário de detecção semissupervisionada, uma medida (relativa) de avaliação interna baseada na perturbação dos dados é proposta e comparada com as principais medidas da literatura, fornecendo ao leitor recomendações claras do melhor cenário para a utilização de cada uma delas. No cenário de detecção não supervisionada, a medida pioneira para avaliação interna de soluções binárias de detecção de outliers, proposta pelo autor desta tese em seu trabalho de mestrado, é estendida para o cenário mais geral de soluções não binárias de detecção de outliers, que envolve a avaliação de scorings de detecção de outliers, que é o tipo de resultado produzido pela ampla maioria dos algoritmos. Ambas medidas são extensivamente avaliadas em vários experimentos envolvendo diferentes coleções de bases de dados sintéticas e reais coletadas de repositórios públicos.
 
ADVERTENCIA - La consulta de este documento queda condicionada a la aceptación de las siguientes condiciones de uso:
Este documento es únicamente para usos privados enmarcados en actividades de investigación y docencia. No se autoriza su reproducción con finalidades de lucro. Esta reserva de derechos afecta tanto los datos del documento como a sus contenidos. En la utilización o cita de partes del documento es obligado indicar el nombre de la persona autora.
Fecha de Publicación
2020-01-10
 
ADVERTENCIA: Aprenda que son los trabajos derivados haciendo clic aquí.
Todos los derechos de la tesis/disertación pertenecen a los autores
CeTI-SC/STI
Biblioteca Digital de Tesis y Disertaciones de la USP. Copyright © 2001-2024. Todos los derechos reservados.