Abordagem para integração automática de dados estruturados e não estruturados em um contexto Big Data

Saes, Keylla Ramos

doi:10.11606/D.100.2019.tde-16012019-212403

Início

Servicios

Disertación de Maestría

DOI

https://doi.org/10.11606/D.100.2019.tde-16012019-212403

Documento

Disertación de Maestría

Autor

Saes, Keylla Ramos (Catálogo USP)

Nombre completo

Keylla Ramos Saes

Dirección Electrónica

Instituto/Escuela/Facultad

Escola de Artes, Ciências e Humanidades

Área de Conocimiento

Metodología y Técnicas de Informática

Fecha de Defensa

2018-11-22

Publicación

São Paulo, 2019

Director

Araújo, Luciano Vieira de (Catálogo USP)

Tribunal

Araújo, Luciano Vieira de (Presidente)
Biscaro, Helton Hideraldo
Josko, João Marcelo Borovina
Lauretto, Marcelo de Souza

Título en portugués

Abordagem para integração automática de dados estruturados e não estruturados em um contexto Big Data

Palabras clave en portugués

Banco de dados não relacionais
Banco de dados relacionais
Big Data
Dados estruturados
Dados não estruturados
Integração de dados
Integração de dados heterogêneos
NoSQL

Resumen en portugués

O aumento de dados disponíveis para uso tem despertado o interesse na geração de conhecimento pela integração de tais dados. No entanto, a tarefa de integração requer conhecimento dos dados e também dos modelos de dados utilizados para representá-los. Ou seja, a realização da tarefa de integração de dados requer a participação de especialistas em computação, o que limita a escalabilidade desse tipo de tarefa. No contexto de Big Data, essa limitação é reforçada pela presença de uma grande variedade de fontes e modelos heterogêneos de representação de dados, como dados relacionais com dados estruturados e modelos não relacionais com dados não estruturados, essa variedade de representações apresenta uma complexidade adicional para o processo de integração de dados. Para lidar com esse cenário é necessário o uso de ferramentas de integração que reduzam ou até mesmo eliminem a necessidade de intervenção humana. Como contribuição, este trabalho oferece a possibilidade de integração de diversos modelos de representação de dados e fontes de dados heterogêneos, por meio de uma abordagem que permite o do uso de técnicas variadas, como por exemplo, algoritmos de comparação por similaridade estrutural dos dados, algoritmos de inteligência artificial, que através da geração do metadados integrador, possibilita a integração de dados heterogêneos. Essa flexibilidade permite lidar com a variedade crescente de dados, é proporcionada pela modularização da arquitetura proposta, que possibilita que integração de dados em um contexto Big Data de maneira automática, sem a necessidade de intervenção humana

Título en inglés

Approach for automatic integration of structured and unstructured data in a Big Data context

Palabras clave en inglés

Big Data
Data integration
Heterogeneous data integration
Non-relational database
NoSQL
Relational database
Structured data
Unstructured data

Resumen en inglés

The increase of data available to use has piqued interest in the generation of knowledge for the integration of such data bases. However, the task of integration requires knowledge of the data and the data models used to represent them. Namely, the accomplishment of the task of data integration requires the participation of experts in computing, which limits the scalability of this type of task. In the context of Big Data, this limitation is reinforced by the presence of a wide variety of sources and heterogeneous data representation models, such as relational data with structured and non-relational models with unstructured data, this variety of features an additional complexity representations for the data integration process. Handling this scenario is required the use of integration tools that reduce or even eliminate the need for human intervention. As a contribution, this work offers the possibility of integrating diverse data representation models and heterogeneous data sources through the use of varied techniques such as comparison algorithms for structural similarity of the artificial intelligence algorithms, data, among others. This flexibility, allows dealing with the growing variety of data, is provided by the proposed modularized architecture, which enables data integration in a context Big Data automatically, without the need for human intervention

ADVERTENCIA - La consulta de este documento queda condicionada a la aceptación de las siguientes condiciones de uso:
Este documento es únicamente para usos privados enmarcados en actividades de investigación y docencia. No se autoriza su reproducción con finalidades de lucro. Esta reserva de derechos afecta tanto los datos del documento como a sus contenidos. En la utilización o cita de partes del documento es obligado indicar el nombre de la persona autora.

Dissertacao_Keylla_Saes_Versao_Final_Pos_Banca_2019_01_15.pdf (1.63 Mbytes)

Fecha de Publicación

2019-01-28

Trabajos derivados

ADVERTENCIA: Aprenda que son los trabajos derivados haciendo clic aquí.