• JoomlaWorks Simple Image Rotator
  • JoomlaWorks Simple Image Rotator
  • JoomlaWorks Simple Image Rotator
  • JoomlaWorks Simple Image Rotator
  • JoomlaWorks Simple Image Rotator
  • JoomlaWorks Simple Image Rotator
  • JoomlaWorks Simple Image Rotator
  • JoomlaWorks Simple Image Rotator
  • JoomlaWorks Simple Image Rotator
  • JoomlaWorks Simple Image Rotator
 
  Bookmark and Share
 
 
Disertación de Maestría
DOI
https://doi.org/10.11606/D.55.2022.tde-11012023-172819
Documento
Autor
Nombre completo
Paulo Ricardo Viviurka do Carmo
Dirección Electrónica
Instituto/Escuela/Facultad
Área de Conocimiento
Fecha de Defensa
Publicación
São Carlos, 2022
Director
Tribunal
Marcacini, Ricardo Marcondes (Presidente)
Amancio, Diego Raphael
Macedo, Alessandra Alaniz
Sinoara, Roberta Akemi
Título en inglés
Embedding Propagation over Heterogeneous Information Networks
Palabras clave en inglés
Embedding propagation
Heterogeneous information network
Network embedding
Resumen en inglés
In order to use text data in machine learning tasks, they must be cleaned and transformed to a structured representation. Recently, neural embeddings have been used to encode text data in low dimensionality latent spaces. For example, BERT pre-trained neural language models can position words, sentences, or documents with fixed dimension embedding vectors. Another way to model text data is to use heterogeneous information networks. That structure models multi-typed data respecting relations and characteristics. Heterogeneous information networks also have their challenges for use with off-the-shelf machine learning methods. Network embedding methods allow the extraction of embedding vectors for each node in an information network. However, these methods usually use only network topology, and sometimes, metadata for the relationships. Embedding propagation methods allow previously generated features with pre-trained methods to be propagated through all network nodes. Information networks that contain some nodes with textual information can use pre-trained neural language models features for propagation. This masters dissertation presents an embedding propagation method for heterogeneous information networks with some textual nodes. The proposed method combines pre-trained neural language models to the topology of heterogeneous information networks through a regularization function to generate embedding for non-textual nodes. Three papers on use case experiments to evaluate and validate the proposed method are presented, where one paper extends the experiments from another: (1) Embedding Propagation over Heterogeneous Event Networks presents the results of the proposed method for event analysis where it achieved the best performance by at least 3% MRR@k in all scenarios; (2) TRENCHANT: TRENd prediCtion on Heterogeneous informAtion NeTworks extends Commodities trend link prediction on heterogeneous information networks where the proposed method is evaluated against network embeddings in the task of predicting price trends for commodities, and it achieved the best performance in some scenarios, where its best results 8% better F1 when predicting weekly soybean price trends; and (3) NatUKE: Benchmark for Natural Product Knowledge Extraction from Academic Literature that evaluates the use of network embedding methods for unsupervised knowledge extraction and the proposed method achieved the best performance in most scenarios, more notably it achieved 43% more Hits@1 than baselines when extraction the isolation process type to obtain a molecule from a certain species. The presented papers show, in three different use cases and experiments, that the proposed method achieves the research goals of propagating the initial embedding from some textual nodes to the remaining nodes in a heterogeneous information network and allowing dynamic insertion of new nodes in the embedding propagation process.
Título en portugués
Propagação de Embeddings em Redes Heterogêneas de Informação
Palabras clave en portugués
Network embedding
Propagação de embeddings
Redes heterogêneas
Resumen en portugués
Dados textuais precisam ser limpos e transformados para representações estruturadas antes de serem utilizados em cenários de aprendizado de máquina. Recentemente, embeddings estão sendo utilizadas para representar dados textuais. Por exemplo, o modelo de linguagem neurais pré-treinado BERT podem posicionar palavras, sentenças ou textos em embeddings dentro de um espaço vetorial de dimensão fixa. Outra forma de modelar dados textuais é a utilização de redes heterogêneas de informação. Essa estrutura permite a modelagem de relações complexas por meio de nós e conexões de dados textuais de diferentes domínios com conexões explícitas. Por outro lado, redes de informação possuem seus próprios desafios quanto a utilização direta em métodos tradicionais de aprendizado de máquina. Métodos de network embedding podem ser utilizados para gerarem embeddings de nós com relação a topologia da rede, tipos de relações e até mesmo rótulos. Entretanto esses métodos normalmente exploram apenas a topologia, e em alguns casos, metadados dos relacionamentos em uma rede. Métodos de propagação de embeddings foram desenvolvidos com o objetivo de distribuir vetores de características gerados a partir de outros modelos. Para redes de informação que possuem alguns nós com dados textuais modelos de linguagem pré-treinados podem ser propagados respeitando a topologia e outros dados das redes para a geração de uma embedding final. Esta dissertação de mestrado apresenta um método de propagação de embeddings para redes heterogêneas de informação que representam dados textuais. O método proposto propaga as embeddings de nós textuais por toda a rede por meio de uma função de regularização. Três artigos de caso de uso que avaliam e validam o método também são apresentados: (1) Embedding Propagation over Heterogeneous Event Networks mostra o desempenho do método proposto para análise de eventos onde sua performance supera a literatura por mais de 3% MRR@k em todos os cenários; (2) TRENCHANT: TRENd prediCtion on Heterogeneous informAtion NeTworks que é uma extensão de Commodities trend link prediction on heterogeneous information networks onde o método proposto é avaliado em relação a métodos de network embedding da literatura na tarefa de predição de preços de commodities e atinge performance superior a literatura em alguns cenários, onde obteve 8% melhor F1 predizendo trends de preços semanais da soja; e (3) NatUKE: Benchmark for Natural Product Knowledge Extraction from Academic Literature que avalia a utilização de métodos de network embedding para a extração de conhecimento não-supervisionada e o método proposto obteve a melhor performance na maior parte dos cenários, sendo que em sua melhor performance obteve 43% mais Hits@1 que a literatura extraindo o tipo de isolamento necessário para obter certa molécula de uma espécia de planta. Esses artigos mostram por meio de experimentos e resultados que o método proposto, ao utilizar uma função de regularização para a propagação, atinge os objetivos de pesquisa de propagar uma embedding inicial de alguns nós com dados textuais para os nós restantes de uma rede heterogênea de informação e permitir a inserção dinâmica de novos nós ao processo de propagação de embeddings.
 
ADVERTENCIA - La consulta de este documento queda condicionada a la aceptación de las siguientes condiciones de uso:
Este documento es únicamente para usos privados enmarcados en actividades de investigación y docencia. No se autoriza su reproducción con finalidades de lucro. Esta reserva de derechos afecta tanto los datos del documento como a sus contenidos. En la utilización o cita de partes del documento es obligado indicar el nombre de la persona autora.
Fecha de Publicación
2023-01-11
 
ADVERTENCIA: Aprenda que son los trabajos derivados haciendo clic aquí.
Todos los derechos de la tesis/disertación pertenecen a los autores
CeTI-SC/STI
Biblioteca Digital de Tesis y Disertaciones de la USP. Copyright © 2001-2024. Todos los derechos reservados.