Operadores de fusão prévia para segmentação temporal de vídeo em cenas

Beserra, Antonio Alessandro Rocha

doi:10.11606/D.55.2022.tde-07022023-152229

Master Dissertation

DOI

10.11606/D.55.2022.tde-07022023-152229

Document

Master Dissertation

Author

Beserra, Antonio Alessandro Rocha ( )

Full name

Antonio Alessandro Rocha Beserra

E-mail

Institute/School/College

Instituto de Ciências Matemáticas e de Computação

Program or Specialty

Computer Science and Computational Mathematics

Date of Defense

2022-11-21

Published

São Carlos, 2022

Supervisor

Goularte, Rudinei ( )

Committee

Goularte, Rudinei (President)

Barrére, Eduardo

Manzato, Marcelo Garcia

Santos, Celso Alberto Saibel

Title in Portuguese

Operadores de fusão prévia para segmentação temporal de vídeo em cenas

Keywords in Portuguese

Fusão multimodal, Fusão prévia, Segmentação de vídeo

Abstract in Portuguese

Técnicas de fusão prévia têm sido propostas em tarefas de análise multimídia como uma maneira de melhorar a eficácia ao gerar representações de dados mais compactas, expressivas e capazes de preservar a semântica presente nos dados. Os trabalhos recentes no domínio de vídeo digital empregam multimodalidade fazendo jus à natureza multimodal de um vídeo. Esse espaço heterogêneo, somado à dificuldade de se obter uma etapa de fusão prévia desacoplada e separável do restante do processamento, limita possíveis melhorias que poderiam ser alcançadas nas etapas isoladamente. Além disso, técnicas foram projetadas para problemas específicos, não podendo ser generalizadas, o que também as tornam inseparáveis da tarefa de análise de vídeo em questão. Motivado por esse cenário, este trabalho de mestrado propõe a aplicação dos operadores de fusão prévia, Soma, Máximo e Concatenação, que atuem no médio nível semântico, desacoplando o operador de qualquer tarefa específica e, ao mesmo tempo, com um custo computacional mais simples. Os operadores foram aplicados em duas bases de dados publicamente disponíveis da tarefa de Segmentação Temporal de Vídeo em Cenas. Os resultados atingidos competem com os do estado da arte com a vantagem de simplicidade computacional.

Title in English

Early fusion operators for temporal video scene segmentation

Keywords in English

Early fusion, Multimodal fusion, Video segmentation

Abstract in English

Early fusion techniques have been proposed in multimedia analysis tasks as a way to improve efficiency by generating more compact, expressive data representations capable of preserving the semantics present in the data. Recent work in the digital video domain employs multimodality due to the multimodal nature of a video. This heterogeneous space, added to the difficulty of obtaining a early fusion step that is uncoupled and separable from the rest of the processing, limits possible improvements that could be achieved in the steps isolatedly. Furthermore, techniques were designed for specific problems and cannot be generalized, which also makes them inseparable from the video analysis task. Motivated by this scenario, this masters degree work proposes the application of the early fusion operators, Sum, Maximum and Concatenation, which act at the medium semantic level, decoupling the operator from any specific task and, at the same time, with a simpler computational cost. The operators were applied in two publicly available databases of the Temporal Video Scene Segmentation task. The achieved results competed with those of the state of the art with the advantage of computational simplicity.

WARNING - Viewing this document is conditioned on acceptance of the terms of use. This document is for private use in research and teaching activities only.

AntonioAlessandroRochaBeserra_ME_revisada.pdf

Publishing Date

2023-02-07

Derived works

WARNING: Learn what derived works are in the digital library guidance pages.