Agrupamento baseado em modelos de mistura de gaussianas com covariáveis

Relvas, Carlos Eduardo Martins

doi:10.11606/T.45.2020.tde-16012021-193220

Inicío

Serviços

Trabalhos decorrentes

Como citar

Formato MARC

Formato OAI DC

Tese de Doutorado

DOI

https://doi.org/10.11606/T.45.2020.tde-16012021-193220

Documento

Tese de Doutorado

Autor

Relvas, Carlos Eduardo Martins (Catálogo USP)

Nome completo

Carlos Eduardo Martins Relvas

E-mail

Unidade da USP

Instituto de Matemática e Estatística

Área do Conhecimento

Ciência da Computação

Data de Defesa

2020-12-04

Imprenta

São Paulo, 2020

Orientador

Fujita, André (Catálogo USP)

Banca examinadora

Fujita, André (Presidente)
Amorim, Renato Cordeiro de
Carvalho, Benilton de Sá
Patriota, Alexandre Galvão
Takahashi, Daniel Yasumasa

Título em português

Agrupamento baseado em modelos de mistura de gaussianas com covariáveis

Palavras-chave em português

Agrupamento
Algoritmo de mistura gaussiana
Algoritmo EM
BIC
Efeitos de covariáveis
Testes de hipóteses

Resumo em português

Frequentemente, o processo de agrupamento é a primeira etapa em diversos projetos de análises de dados. Ele permite identicar padrões que não foram notados antes, sendo muito útil para detectar novas hipóteses. No entanto, um desao na análise de dados empíricos é a presença de covariáveis, que podem mascarar a estrutura de agrupamento obtida. Por exemplo: se estamos interessados em agrupar um conjunto de indivíduos em um grupo de controle e pacientes com câncer. Neste caso, o algoritmo de agrupamento poderia agrupar as observações apenas em jovens e velhos. Isso pode acontecer pois a idade do diagnóstico é associada ao câncer. Com isso em mente, desenvolvemos o CEM-Co, um algoritmo baseado em modelos, que remove/minimiza os efeitos das covariáveis durante o processo de agrupamento. Aplicamos o CEM-Co a uma base de dados de expressão gênica, composta de 129 pacientes de câncer de pulmão do estágio I. Como resultado, foi possível identicar um subgrupo de pacientes com taxa de sobrevida estatisticamente menor, algo até então não encontrado.

Título em inglês

Model-based clustering algorithm with covariates

Palavras-chave em inglês

BIC
Clusterization
Covariates effect
EM algorithm
Hyphotesis tests
Mixture gaussian

Resumo em inglês

Usually, the clustering process is the first step in several data analyses. Clustering allows the identification of unseen patterns and is useful when raising new hypotheses. However, one challenge when analyzing empirical data is the presence of covariates, which may mask the obtained clustering structure. For example: suppose we are interested in clustering a set of individuals into controls and cancer patients. In this case, a clustering algorithm could group subjects into young and elderly. This may happen because, during diagnosis, the age is directly associated with cancer. Thus, we developed CEM-Co, a model-based clustering algorithm that removes/minimizes undesirable covariates' effects during the clustering process. We applied CEM-Co on a gene expression data set composed of 129 stage I non-small cell lung cancer patients. As a result, we identified a subgroup with a poorer prognosis where standard clustering algorithms failed.

AVISO - A consulta a este documento fica condicionada na aceitação das seguintes condições de uso:
Este trabalho é somente para uso privado de atividades de pesquisa e ensino. Não é autorizada sua reprodução para quaisquer fins lucrativos. Esta reserva de direitos abrange a todos os dados do documento bem como seu conteúdo. Na utilização ou citação de partes do documento é obrigatório mencionar nome da pessoa autora do trabalho.

Doutorado__CarlosRelvas.pdf (1.49 Mbytes)

Data de Publicação

2021-01-20

Trabalhos decorrentes

AVISO: Saiba o que são os trabalhos decorrentes clicando aqui.