• JoomlaWorks Simple Image Rotator
  • JoomlaWorks Simple Image Rotator
  • JoomlaWorks Simple Image Rotator
  • JoomlaWorks Simple Image Rotator
  • JoomlaWorks Simple Image Rotator
  • JoomlaWorks Simple Image Rotator
  • JoomlaWorks Simple Image Rotator
  • JoomlaWorks Simple Image Rotator
  • JoomlaWorks Simple Image Rotator
  • JoomlaWorks Simple Image Rotator
 
  Bookmark and Share
 
 
Disertación de Maestría
DOI
https://doi.org/10.11606/D.8.2020.tde-06042021-192617
Documento
Autor
Nombre completo
Andressa Vieira e Silva
Dirección Electrónica
Instituto/Escuela/Facultad
Área de Conocimiento
Fecha de Defensa
Publicación
São Paulo, 2020
Director
Tribunal
Lopes, Marcos Fernando (Presidente)
Barretto, Marcos Ribeiro Pereira
Felippo, Ariani Di
Ferreira, Marcelo Barra
Título en portugués
Um modelo de classificação para o Reconhecimento de Entidades Nomeadas
Palabras clave en portugués
Reconhecimento de Entidades Nomeadas
Redes neurais
Representações word embeddings
Traços de representação linguística
Resumen en portugués
O Reconhecimento de Entidades Nomeadas (REN) é uma tarefa de Proces- samento de Linguagem Natural (PLN) que busca identificar as Entidades Nomeadas de um texto, tais como nomes de pessoas, cidades e organiza- ções, classificando-as em um conjunto pré-definido de categorias. Essa é considerada uma tarefa difícil, pois as Entidades Nomeadas constituem uma classe gramatical com muita variação lexical e de baixa frequência quando comparadas à massa total de dados textuais. Recentemente, as pesquisas com redes neurais profundas têm mostrado excelentes resultados em diversas aplicações de PLN, incluindo o REN. Nesta pesquisa, foram investigadas duas arquiteturas de redes neurais para o REN no Harem, um corpus de língua portuguesa: BERT (devlin et al., 2018) e uma rede neural bidirecional LSTM (BiLSTM). O objetivo principal foi explorar traços baseados na distribuição contextual das entidades, através de representações vetoriais word embeddings associadas a traços linguísticos. Foram usados traços de etiquetagem morfossintática, forma ortográfica da palavra e recursos lexicais. Esses traços foram concatenados às representações word embeddings para alimentar a BiLSTM. Os resultados mostraram uma melhora estatisticamente significativa no desempenho desse modelo em comparação à BiLSTM apenas com os word embeddings. O modelo BERT, por sua vez, obteve medidas próximas ao estado da arte no Harem.
Título en inglés
A classification model for Named Entity Recognition
Palabras clave en inglés
Linguistic feature representation
Named Entity Recognition
Neural networks
Word embeddings
Resumen en inglés
Named Entity Recognition (NER) is a Natural Language Processing (NLP) task that aims at identifying Named Entities in a text, such as person, city, and organization names, classifying them into a pre-defined set of categories. NER is considered a hard task as Named Entities are a grammatical class with lots of lexical variation and relatevely low frequency if compared to the total mass of textual data. Nevertheless, deep neural network researches have recently shown excelent results in several NLP applications, including NER. In this work, two neural network archictetures were investigated for Harem, a corpus of Portuguese: BERT (devlin et al., 2018) and a bidirectional neural network LSTM (BiLSTM). The main goal was to explore features based on the entities contextual distribution by means of word embeddings vectors associated with linguistic features. We used as features part-of-speech tagging, spelling formats, and lexical resources. Those features were concatened with word embeddings vectors and fed into the BiLSTM. Our results showed a significant performance improvement with this model if compared to a BiLSTM using only word embeddings. On the other hand, BERT model obtained scores close to the Harem state-of-the-art.
 
ADVERTENCIA - La consulta de este documento queda condicionada a la aceptación de las siguientes condiciones de uso:
Este documento es únicamente para usos privados enmarcados en actividades de investigación y docencia. No se autoriza su reproducción con finalidades de lucro. Esta reserva de derechos afecta tanto los datos del documento como a sus contenidos. En la utilización o cita de partes del documento es obligado indicar el nombre de la persona autora.
Fecha de Publicación
2021-04-06
 
ADVERTENCIA: Aprenda que son los trabajos derivados haciendo clic aquí.
Todos los derechos de la tesis/disertación pertenecen a los autores
CeTI-SC/STI
Biblioteca Digital de Tesis y Disertaciones de la USP. Copyright © 2001-2024. Todos los derechos reservados.