• JoomlaWorks Simple Image Rotator
  • JoomlaWorks Simple Image Rotator
  • JoomlaWorks Simple Image Rotator
  • JoomlaWorks Simple Image Rotator
  • JoomlaWorks Simple Image Rotator
  • JoomlaWorks Simple Image Rotator
  • JoomlaWorks Simple Image Rotator
  • JoomlaWorks Simple Image Rotator
  • JoomlaWorks Simple Image Rotator
  • JoomlaWorks Simple Image Rotator
 
  Bookmark and Share
 
 
Tese de Doutorado
DOI
https://doi.org/10.11606/T.18.2021.tde-16112021-121737
Documento
Autor
Nome completo
Nádia Junqueira Martarelli Fróes
Unidade da USP
Área do Conhecimento
Data de Defesa
Imprenta
São Carlos, 2021
Orientador
Banca examinadora
Nagano, Marcelo Seido (Presidente)
Andrade Filho, Mário de Castro
Prata, Bruno de Athayde
Ruiz, Evandro Eduardo Seron
Tavares Neto, Roberto Fernandes
Título em inglês
Contributions to the mixed data clustering problem: from a conceptual codification and classification proposal to the usage of optimization methods
Palavras-chave em inglês
Feature Balancing
Feature Weighting
Mixed Data Clustering
Standard Representation
Systematic Literature Review
Resumo em inglês
Data mining techniques have gained prominence in recent years due to their wide range of applications. Among such techniques is data clustering, which identifies groups in unlabeled datasets. In view of the need to describe the characteristics of a phenomenon in more detail through numerical and categorical attributes, the development of the data clustering technique started to include the study of the mixed datasets in the process of clustering. Although promising, this new branch of study is still recent in the literature. Thus, this thesis aims to contribute to the advancement of the mixed data clustering problem, through four objectives, which are: to propose a standard representation for documents published in the knowledge-discovery field, to carry out a systematic review of the literature that provides a comprehensive view of this thematic and also a detailed comprehension of the selected documents; to perform the modeling of the meta-heuristic Biased Random-Key Genetic Algorithm (BRKGA) to propose a solution to the feature balancing problem in distance-based mixed data clustering algorithms; and to perform the modeling and hybridization of the following meta-heuristics: Evolutionary Clustering Search, Iterated Local Search, and BRKGA, to propose a solution to the feature weighting problem in a model-based mixed data clustering algorithm. As a result, one proposed for an initial idea for a standard representation, and a systematic review of the literature was obtained with a bibliometric and individual analysis of 160 documents resulted from the selection step of the designed methodological procedure. In addition, the proposed meta-heuristics obtained the best performances in most of the 476 simulated datasets, which contemplated several characteristics, such as data generated through the normal and lognormal distribution, balancing and unbalancing numerical and categorical attributes in relation to the amount of each type of feature in the dataset, different levels of overlapping of attributes, among others. Therefore, one concludes that this thesis reached its objectives, contributing to the advancement of the mixed data clustering technique.
Título em português
Contribuições para o problema de agrupamento de dados mistos: de uma proposta conceitual de codificação e classificação ao uso de métodos de otimização
Palavras-chave em português
Agrupamento de Dados Mistos
Balanceamento de Atributos
Ponderação de Atributos
Representação Padrão
Revisão Sistemática da Literatura
Resumo em português
As técnicas de mineração de dados têm ganhado destaque nos últimos anos devido sua ampla gama de aplicações. Dentre tais técnicas, está o agrupamento de dados, o qual identifica grupos em conjuntos de dados não rotulados. Diante da necessidade de descrever as características do fenômeno estudado com mais detalhes por meio do uso de atributos numéricos e categóricos, o desenvolvimento da técnica de agrupamento de dados passou a contemplar o estudo do agrupamento de dados mistos. Embora promissor, este novo ramo de estudo ainda é recente na literatura. Dessa forma, esta tese visa contribuir com o avanço da técnica de agrupamento de dados mistos, por meio de quatro objetivos, que são: propor uma representação padrão para documentos publicados no campo de descoberta do conhecimento, realizar uma revisão sistemática da literatura que forneça uma visão abrangente desta temática e também detalhada dos documentos selecionados; realizar a modelagem da meta-heurística Biased Random-Key Genetic Algorithm (BRKGA) para propor uma solução para o problema do balanceamento de atributos em algoritmos de agrupamento de dados mistos baseados em distância; e realizar a modelagem e hibridização das meta-heurísticas: Evolutionary Clustering Search, Iterated Local Search e BRKGA, para propor uma solução para o problema de ponderação de atributos em um algoritmo de agrupamento de dados mistos baseado em modelo. Como resultados, obteve-se uma proposta de ideia inicial para a representação padrão e uma revisão sistemática da literatura com uma análise bibliométrica e individual de 160 documentos resultantes da seleção feita para o estudo. Além disso, as meta-heurísticas propostas obtiveram os melhores desempenhos na maioria dos 476 conjuntos de dados simulados, os quais contemplaram diversas características, como dados gerados por meio de distribuição normal e lognormal, balanceamento e desbalanceamento de atributos numéricos e categóricos com relação a quantidade de cada tipo de atributo no conjunto de dados, sobreposição de atributos em diferentes níveis, entre outras. Portanto, conclui-se que esta tese alcançou seus objetivos, contribuindo para o avanço da técnica de agrupamento de dados mistos.
 
AVISO - A consulta a este documento fica condicionada na aceitação das seguintes condições de uso:
Este trabalho é somente para uso privado de atividades de pesquisa e ensino. Não é autorizada sua reprodução para quaisquer fins lucrativos. Esta reserva de direitos abrange a todos os dados do documento bem como seu conteúdo. Na utilização ou citação de partes do documento é obrigatório mencionar nome da pessoa autora do trabalho.
Data de Publicação
2021-11-29
 
AVISO: Saiba o que são os trabalhos decorrentes clicando aqui.
Todos os direitos da tese/dissertação são de seus autores
CeTI-SC/STI
Biblioteca Digital de Teses e Dissertações da USP. Copyright © 2001-2022. Todos os direitos reservados.