Amostragem e medidas de qualidade de shapelets

Cavalcante, Lucas Schmidt

doi:10.11606/D.55.2016.tde-07112016-162458

Accueil

Services

Mémoire de Maîtrise

DOI

https://doi.org/10.11606/D.55.2016.tde-07112016-162458

Document

Mémoire de Maîtrise

Auteur

Cavalcante, Lucas Schmidt (Catálogo USP)

Nom complet

Lucas Schmidt Cavalcante

Unité de l'USP

Instituto de Ciências Matemáticas e de Computação

Domain de Connaissance

Informatique et Mathématique Computationnelle

Date de Soutenance

2016-05-02

Editeur

São Carlos, 2016

Directeur

Batista, Gustavo Enrique de Almeida Prado Alves (Catálogo USP)

Jury

Batista, Gustavo Enrique de Almeida Prado Alves (Président)
Prati, Ronaldo Cristiano
Sousa, Elaine Parros Machado de

Titre en portugais

Amostragem e medidas de qualidade de shapelets

Mots-clés en portugais

Classificação de séries temporais; Transformada shapelet; Medidas de qualidade; Amostragem aleatória

Resumé en portugais

Uma série temporal é uma sequência ordenada pelo tempo de valores reais. Dado que inúmeros fenômenos do dia-a-dia podem ser representados por séries temporais, há grande interesse na mineração de dados temporais, em especial na tarefa de classificação. Recentemente foi introduzida uma nova primitiva de séries temporais chamada shapelet, que é uma subsequência que permite a classificação de séries temporais de acordo com padrões locais. Na transformada shapelet estas subsequências se tornam atributos em uma matriz de distância que mede a dissimilaridade entre os atributos e as séries temporais. Para obter a transformada é preciso escolher alguns shapelets dos inúmeros possíveis, seja pelo efeito de evitar overfitting ou pelo fato de que é computacionalmente caro obter todos. Sendo assim, foram elaboradas medidas de qualidade para os shapelets. Tradicionalmente tem se utilizado a medida de ganho de informação, porém recentemente foi proposto o uso da f-statistic, e nós propomos neste trabalho uma nova denominada in-class transitions. Em nossos experimentos demonstramos que a inclass transitions costuma obter a melhor acurácia, especialmente quando poucos atributos são utilizados. Além disso, propomos o uso de amostragem aleatória nos shapelets para reduzir o espaço de busca e acelerar o processo de obtenção da transformada. Contrastamos a abordagem de amostragem aleatória contra uma em que só são exploradas shapelets de determinados tamanhos. Nossos experimentos mostraram que a amostragem aleatória é mais rápida e requer a computação de um menor número de shapelets. De fato, obtemos os melhores resultados ao amostrarmos 5% dos shapelets, mas mesmo a uma amostragem de 0,05% não foi possível notar uma degradação significante da acurácia.

Titre en anglais

Shapelets sampling and quality measurements

Mots-clés en anglais

Classification of time series; Shapelet transform; Quality measurements; Random sampling

Resumé en anglais

A time series is a time ordered sequence of real values. Given that numerous daily phenomena that can be described by time series, there is a great interest on its data mining, specially on the task of classification. Recently it was introduced a new time series primitive called shapelets, that is a subsequence that allows the classification of time series by local patterns. On the shapelet transformation these subsequences turn into attributes in a distance matrix that measures the dissimilarity between these attributes and the time series. To obtain the shapelet transformation it is required to choose some shapelets among all of the possible ones, be it to avoid overfitting or because it is too computationally expensive to obtain everyone. Thus, some shapelet quality measurements were created. Traditionally the information gain has been used as the default measurement, however, recently it was proposed to use the f-statistic instead, and in this work we propose a new one called in-class transitions. On our experiments it is shown that usually the in-class transitions achieves the best accuracy, specially when few attributes are used. Moreover, we propose the use of random sampling of shapelets as a way to reduce the search space and to speed up the process of obtaining the shapelet transformation. We contrast this approach with one that explores only shapelets that have a specific length. Our experiments show that random sampling is faster and requires fewer shapelets to be computed. In fact, we got the best results when we sampled 5% of the shapelets, but even at a rate of 0.05% it was not possible to detect a significant degradation of the accuracy.

AVERTISSEMENT - Regarde ce document est soumise à votre acceptation des conditions d'utilisation suivantes:
Ce document est uniquement à des fins privées pour la recherche et l'enseignement. Reproduction à des fins commerciales est interdite. Cette droits couvrent l'ensemble des données sur ce document ainsi que son contenu. Toute utilisation ou de copie de ce document, en totalité ou en partie, doit inclure le nom de l'auteur.

LucasSchmidtCavalcante.pdf (994.93 Kbytes)

Date de Publication

2016-11-07

Œvres dérivées

AVERTISSEMENT: Apprenez ce que sont des œvres dérivées cliquant ici.