Operações de consulta por similaridade em grandes bases de dados complexos

Barioni, Maria Camila Nardini

doi:10.11606/T.55.2006.tde-28092006-151225

Inicío

Serviços

Trabalhos decorrentes

Como citar

Formato MARC

Formato OAI DC

Tese de Doutorado

DOI

https://doi.org/10.11606/T.55.2006.tde-28092006-151225

Documento

Tese de Doutorado

Autor

Barioni, Maria Camila Nardini (Catálogo USP)

Nome completo

Maria Camila Nardini Barioni

Unidade da USP

Instituto de Ciências Matemáticas e de Computação

Área do Conhecimento

Ciências de Computação e Matemática Computacional

Data de Defesa

2006-09-04

Imprenta

São Carlos, 2006

Orientador

Traina Junior, Caetano (Catálogo USP)

Banca examinadora

Traina Junior, Caetano (Presidente)
Amo, Sandra Aparecida de
Ferreira, Joao Eduardo
Heuser, Carlos Alberto
Rezende, Solange Oliveira

Título em português

Operações de consulta por similaridade em grandes bases de dados complexos

Palavras-chave em português

Consultas por similaridade
detecção de agrupamentos de dados
Recuperação por conteúdo

Resumo em português

Os Sistemas de Gerenciamento de Bases de Dados (SGBD) foram desenvolvidos para armazenar e recuperar de maneira eficiente dados formados apenas por números ou cadeias de caracteres. Entretanto, nas últimas décadas houve um aumento expressivo, não só da quantidade, mas da complexidade dos dados manipulados em bases de dados, dentre eles os de natureza multimídia (como imagens, áudio e vídeo), informações geo-referenciadas, séries temporais, entre outros. Assim, surgiu a necessidade do desenvolvimento de novas técnicas que permitam a manipulação eficiente de tipos de dados complexos. Para atender às buscas necessárias às aplicações de base de dados modernas é preciso que os SGBD ofereçam suporte para buscas por similaridade ? consultas que realizam busca por objetos da base similares a um objeto de consulta, de acordo com uma certa medida de similaridade. Outro fator importante que veio contribuir para a necessidade de suportar a realização de consultas por similaridade em SGBD está relacionado à integração de técnicas de mineração de dados. É fundamental para essa integração o fornecimento de recursos pelos SGBD que permitam a realização de operações básicas para as diversas técnicas de mineração de dados existentes. Uma operação básica para várias dessas técnicas, tais como a técnica de detecção de agrupamentos de dados, é justamente o cálculo de medidas de similaridade entre pares de objetos de um conjunto de dados. Embora haja necessidade de fornecer suporte para a realização desse tipo de consultas em SGBD, o atual padrão da linguagem SQL não prevê a realização de consultas por similaridade. Esta tese pretende contribuir para o fornecimento desse suporte, incorporando ao SQL recursos capazes de permitir a realização de operações de consulta por similaridade sobre grandes bases de dados complexos de maneira totalmente integrada com os demais recursos da linguagem

Título em inglês

Similarity search operations in large complex databases

Palavras-chave em inglês

clustr detection
content-based retrieval
similarity search

Resumo em inglês

Database Management Systems (DBMS) were developed to store and efficiently retrieve only data composed by numbers and small strings. However, over the last decades, there was an expressive increase in the volume and complexity of the data being managed, such as multimedia data (images, audio tracks and video), geo-referenced information and time series. Thus, the need to develop new techniques that allow the efficient handling of complex data types also increased. In order to support these data and the corresponding applications, the DBMS needs to support similarity queries, i.e., queries that search for objects similar to a query object according to a similarity measure. The need to support similarity queries in DBMS is also related to the integration of data mining techniques, which requires the DBMS acting as the provider for resources that allow the execution of basic operations for several existing data mining techniques. A basic operation for several of these techniques, such as clustering detection, is again the computation of similarity measures among pairs of objects of a data set. Although there is a need to execute these kind of queries in DBMS, the SQL standard does not allow the specification of similarity queries. Hence, this thesis aims at contributing to support such queries, integrating to the SQL the resources capable to execute similarity query operations over large sets of complex data

AVISO - A consulta a este documento fica condicionada na aceitação das seguintes condições de uso:
Este trabalho é somente para uso privado de atividades de pesquisa e ensino. Não é autorizada sua reprodução para quaisquer fins lucrativos. Esta reserva de direitos abrange a todos os dados do documento bem como seu conteúdo. Na utilização ou citação de partes do documento é obrigatório mencionar nome da pessoa autora do trabalho.

tesecamila.pdf (2.20 Mbytes)

Data de Publicação

2006-09-28

Trabalhos decorrentes

AVISO: O material descrito abaixo refere-se a trabalhos decorrentes desta tese ou dissertação. O conteúdo desses trabalhos é de inteira responsabilidade do autor da tese ou dissertação.

BARIONI, M. C. N., et al. Seamlessly integrating similarity queries in SQL [doi:10.1002/spe.898]. Software: Practice and Experience [online], 2009, vol. 39, n. 4, p. 355-384.
RAZENTE, Humberto L., et al. A novel optimization approach to efficiently process aggregate similarity queries in metric access methods [doi:10.1145/1458082.1458110]. In Proceeding of the 17th ACM conference on Information and knowledge mining - CIKM '08 [online], 17, Napa Valley, 2008. New York : ACM Press, 2008. p. 193.