Contributions to the mixed data clustering problem: from a conceptual codification and classification proposal to the usage of optimization methods

Fróes, Nádia Junqueira Martarelli

doi:10.11606/T.18.2021.tde-16112021-121737

Home

Facilities

Doctoral Thesis

DOI

https://doi.org/10.11606/T.18.2021.tde-16112021-121737

Document

Doctoral Thesis

Author

Fróes, Nádia Junqueira Martarelli (Catálogo USP)

Full name

Nádia Junqueira Martarelli Fróes

Institute/School/College

Escola de Engenharia de São Carlos

Knowledge Area

Process and Knowledge Management

Date of Defense

2021-07-16

Published

São Carlos, 2021

Supervisor

Nagano, Marcelo Seido (Catálogo USP)

Committee

Nagano, Marcelo Seido (President)
Andrade Filho, Mário de Castro
Prata, Bruno de Athayde
Ruiz, Evandro Eduardo Seron
Tavares Neto, Roberto Fernandes

Title in English

Contributions to the mixed data clustering problem: from a conceptual codification and classification proposal to the usage of optimization methods

Keywords in English

Feature Balancing
Feature Weighting
Mixed Data Clustering
Standard Representation
Systematic Literature Review

Abstract in English

Data mining techniques have gained prominence in recent years due to their wide range of applications. Among such techniques is data clustering, which identifies groups in unlabeled datasets. In view of the need to describe the characteristics of a phenomenon in more detail through numerical and categorical attributes, the development of the data clustering technique started to include the study of the mixed datasets in the process of clustering. Although promising, this new branch of study is still recent in the literature. Thus, this thesis aims to contribute to the advancement of the mixed data clustering problem, through four objectives, which are: to propose a standard representation for documents published in the knowledge-discovery field, to carry out a systematic review of the literature that provides a comprehensive view of this thematic and also a detailed comprehension of the selected documents; to perform the modeling of the meta-heuristic Biased Random-Key Genetic Algorithm (BRKGA) to propose a solution to the feature balancing problem in distance-based mixed data clustering algorithms; and to perform the modeling and hybridization of the following meta-heuristics: Evolutionary Clustering Search, Iterated Local Search, and BRKGA, to propose a solution to the feature weighting problem in a model-based mixed data clustering algorithm. As a result, one proposed for an initial idea for a standard representation, and a systematic review of the literature was obtained with a bibliometric and individual analysis of 160 documents resulted from the selection step of the designed methodological procedure. In addition, the proposed meta-heuristics obtained the best performances in most of the 476 simulated datasets, which contemplated several characteristics, such as data generated through the normal and lognormal distribution, balancing and unbalancing numerical and categorical attributes in relation to the amount of each type of feature in the dataset, different levels of overlapping of attributes, among others. Therefore, one concludes that this thesis reached its objectives, contributing to the advancement of the mixed data clustering technique.

Title in Portuguese

Contribuições para o problema de agrupamento de dados mistos: de uma proposta conceitual de codificação e classificação ao uso de métodos de otimização

Keywords in Portuguese

Agrupamento de Dados Mistos
Balanceamento de Atributos
Ponderação de Atributos
Representação Padrão
Revisão Sistemática da Literatura

Abstract in Portuguese

As técnicas de mineração de dados têm ganhado destaque nos últimos anos devido sua ampla gama de aplicações. Dentre tais técnicas, está o agrupamento de dados, o qual identifica grupos em conjuntos de dados não rotulados. Diante da necessidade de descrever as características do fenômeno estudado com mais detalhes por meio do uso de atributos numéricos e categóricos, o desenvolvimento da técnica de agrupamento de dados passou a contemplar o estudo do agrupamento de dados mistos. Embora promissor, este novo ramo de estudo ainda é recente na literatura. Dessa forma, esta tese visa contribuir com o avanço da técnica de agrupamento de dados mistos, por meio de quatro objetivos, que são: propor uma representação padrão para documentos publicados no campo de descoberta do conhecimento, realizar uma revisão sistemática da literatura que forneça uma visão abrangente desta temática e também detalhada dos documentos selecionados; realizar a modelagem da meta-heurística Biased Random-Key Genetic Algorithm (BRKGA) para propor uma solução para o problema do balanceamento de atributos em algoritmos de agrupamento de dados mistos baseados em distância; e realizar a modelagem e hibridização das meta-heurísticas: Evolutionary Clustering Search, Iterated Local Search e BRKGA, para propor uma solução para o problema de ponderação de atributos em um algoritmo de agrupamento de dados mistos baseado em modelo. Como resultados, obteve-se uma proposta de ideia inicial para a representação padrão e uma revisão sistemática da literatura com uma análise bibliométrica e individual de 160 documentos resultantes da seleção feita para o estudo. Além disso, as meta-heurísticas propostas obtiveram os melhores desempenhos na maioria dos 476 conjuntos de dados simulados, os quais contemplaram diversas características, como dados gerados por meio de distribuição normal e lognormal, balanceamento e desbalanceamento de atributos numéricos e categóricos com relação a quantidade de cada tipo de atributo no conjunto de dados, sobreposição de atributos em diferentes níveis, entre outras. Portanto, conclui-se que esta tese alcançou seus objetivos, contribuindo para o avanço da técnica de agrupamento de dados mistos.

WARNING - Viewing this document is conditioned on your acceptance of the following terms of use:
This document is only for private use for research and teaching activities. Reproduction for commercial use is forbidden. This rights cover the whole data about this document as well as its contents. Any uses or copies of this document in whole or in part must include the author's name.

NadiaJunqueiraMartarelliFroesDEFINITIVO.pdf (5.86 Mbytes)

Publishing Date

2021-11-29

Derived works

WARNING: Learn what derived works are clicking here.