• JoomlaWorks Simple Image Rotator
  • JoomlaWorks Simple Image Rotator
  • JoomlaWorks Simple Image Rotator
  • JoomlaWorks Simple Image Rotator
  • JoomlaWorks Simple Image Rotator
  • JoomlaWorks Simple Image Rotator
  • JoomlaWorks Simple Image Rotator
  • JoomlaWorks Simple Image Rotator
  • JoomlaWorks Simple Image Rotator
  • JoomlaWorks Simple Image Rotator
 
  Bookmark and Share
 
 
Doctoral Thesis
DOI
https://doi.org/10.11606/T.55.2020.tde-07012020-105601
Document
Author
Full name
Henrique Oliveira Marques
E-mail
Institute/School/College
Knowledge Area
Date of Defense
Published
São Carlos, 2019
Supervisor
Committee
Manzato, Marcelo Garcia (President)
Oliveira, Adriano Lorena Inácio de
Santos, Davi Pereira dos
Silva, Diego Furtado
Title in English
Evaluation and model selection for unsupervised outlier detection and one-class classification
Keywords in English
Internal evaluation
Model selection
Outlier detection
Semi-supervised learning
Unsupervised learning
Abstract in English
Outlier detection (or anomaly detection) plays an important role in the pattern discovery from data that can be considered exceptional in some sense. An important distinction is that between the supervised, semi-supervised and unsupervised techniques. In this work, we focus on semisupervised and unsupervised techniques. It has been shown that unsupervised outlier detection techniques can be adapted to be applicable also in the semi-supervised setting. Therefore, we conduct a comparative study between the semi-supervised techniques and unsupervised techniques adapted to the semi-supervised context. The main focus of this work, however, is on the unsupervised evaluation of outlier detection. Although there is a large and growing literature that tackles the outlier detection problem, the unsupervised evaluation of outlier detection results is still virtually untouched in the literature, especially in the context of unsupervised detection. The so-called internal evaluation, based solely on the data and the assessed solutions themselves, is required if one wants to statistically validate (in absolute terms) or just compare (in relative terms) the solutions provided by different algorithms or by different parameterizations of a given algorithm in the absence of labeled data. However, in contrast to cluster analysis, where indexes for internal evaluation and validation of clustering solutions have been conceived and shown to be very useful, in the outlier detection domain this problem has been notably overlooked. Here we discuss this problem and provide solutions for the internal evaluation of outlier detection results. In the scenario of semi-supervised detection, we propose an (relative) internal evaluation measure based on data perturbation and compared it with the main measures of the literature, providing the reader with clear recommendations of the best scenario for the use of each one. In the scenario of unsupervised detection, the pioneering measure for internal evaluation of binary outlier solutions, proposed by the author of this thesis in his masters work, is extended to the more general scenario of non-binary outlier solutions, which involves the evaluation of outlier detection scorings, which is the type of result produced by most widely used database-oriented algorithms in the literature. We extensively evaluate both measures in several experiments involving different collections of synthetic and real datasets collected from public repositories.
Title in Portuguese
Avaliação e seleção de modelos em detecção não supervisionada de outliers e classificação de classe única
Keywords in Portuguese
Aprendizado não supervisionado
Aprendizado semissupervisionado
Avaliação interna
Detecção de outliers
Seleção de modelos
Abstract in Portuguese
A área de detecção de outliers (ou detecção de anomalias) possui um papel fundamental na descoberta de padrões em dados que podem ser considerados excepcionais sob alguma perspectiva. Uma importante distinção se dá entre as técnicas supervisionadas, semissupervisionadas e não supervisionadas de detecção. O presente trabalho enfoca as técnicas de detecção semissupervisionadas e não supervisionadas. As técnicas não supervisionadas de detecção podem ser adaptadas para operarem também de forma semissupervisionada. Desta forma, foi realizado um estudo comparativo entre as técnicas de detecção semissupervisionada e as técnicas não supervisionadas adaptadas ao contexto semissupervisionado. O principal foco deste trabalho, no entanto, está na avaliação não supervisionada de detecção de outliers. Embora exista uma literatura grande e crescente que aborde o problema de detecção de outliers, a avaliação não supervisionada dos resultados em detecção de outliers ainda está praticamente intocada na literatura, especialmente no contexto de detecção não supervisionada. A chamada avaliação interna, que baseia-se unicamente nos dados e nas próprias soluções a serem avaliadas, é necessária se for preciso validar estatisticamente (em termos absolutos) ou apenas comparar (em termos relativos) as soluções fornecidas por diferentes algoritmos ou por diferentes parametrizações de um dado algoritmo na ausência de dados rotulados. No entanto, em contraste com agrupamento de dados, onde os índices para validação e avaliação interna de soluções de agrupamento foram concebidos e demonstraram ser bastantes úteis, no domínio de detecção de outliers, este problema tem sido notavelmente negligenciado. Nesta tese, este problema é discutido e soluções são fornecidas para a avaliação interna dos resultados em detecção de outliers. No cenário de detecção semissupervisionada, uma medida (relativa) de avaliação interna baseada na perturbação dos dados é proposta e comparada com as principais medidas da literatura, fornecendo ao leitor recomendações claras do melhor cenário para a utilização de cada uma delas. No cenário de detecção não supervisionada, a medida pioneira para avaliação interna de soluções binárias de detecção de outliers, proposta pelo autor desta tese em seu trabalho de mestrado, é estendida para o cenário mais geral de soluções não binárias de detecção de outliers, que envolve a avaliação de scorings de detecção de outliers, que é o tipo de resultado produzido pela ampla maioria dos algoritmos. Ambas medidas são extensivamente avaliadas em vários experimentos envolvendo diferentes coleções de bases de dados sintéticas e reais coletadas de repositórios públicos.
 
WARNING - Viewing this document is conditioned on your acceptance of the following terms of use:
This document is only for private use for research and teaching activities. Reproduction for commercial use is forbidden. This rights cover the whole data about this document as well as its contents. Any uses or copies of this document in whole or in part must include the author's name.
Publishing Date
2020-01-10
 
WARNING: Learn what derived works are clicking here.
All rights of the thesis/dissertation are from the authors
CeTI-SC/STI
Digital Library of Theses and Dissertations of USP. Copyright © 2001-2024. All rights reserved.