Ambiente para Minimização do Impacto de Falhas para Aplicações Paralelas

Zem, José Luis

doi:10.11606/T.76.2005.tde-18122005-231621

Inicío

Serviços

Trabalhos decorrentes

Como citar

Formato MARC

Formato OAI DC

Tese de Doutorado

DOI

https://doi.org/10.11606/T.76.2005.tde-18122005-231621

Documento

Tese de Doutorado

Autor

Zem, José Luis (Catálogo USP)

Nome completo

José Luis Zem

Unidade da USP

Instituto de Física de São Carlos

Área do Conhecimento

Física Aplicada

Data de Defesa

2005-09-26

Imprenta

São Carlos, 2005

Orientador

Travieso, Gonzalo (Catálogo USP)

Banca examinadora

Travieso, Gonzalo (Presidente)
Cucchieri, Attilio
Gonçalves, Ronaldo Augusto de Lara
Roda, Valentin Obac
Sipahi, Guilherme Matos

Título em português

"Ambiente para Minimização do Impacto de Falhas para Aplicações Paralelas"

Palavras-chave em português

Alta Disponibilidade
Cluster de Computadores
Tolerância a Falhas

Resumo em português

Os sistemas paralelos são importantes pois permitem concentrar recursos computacionais como processadores, memórias e dispositivos de E/S para solucionar problemas computacionais que necessitam de uma grande quantidade destes mesmos recursos e em um tempo de execução aceitável. Tradicionalmente, o tempo, a capacidade e o custo do processamento para se resolver estes problemas computacionais utilizando-se aplicações seqüênciais podem ser proibitivos e isto acaba criando um contexto propício para se utilizar aplicações paralelas. Em razão de ser composto por muitas partes, um sistema distribuído está sujeito a falhas em seu subsistema de comunicação, em seus processadores, em suas aplicações entre outros componentes. Desta maneira, as aplicações paralelas, ao utilizarem os sistemas distribuídos, têm suas partes executadas em paralelo pelos recursos distribuídos. Em razão de cada um destes recursos ser um possível ponto de falha, as aplicações paralelas acabam por tornarem-se mais susceptíveis à ocorrência de falhas e, conseqüentemente, à interrupção de suas execuções. Quando estas aplicações paralelas são interrompidas, todo o processamento realizado e o tempo gasto para tal são desperdiçados, pois as aplicações devem ser reinicializadas. Para minimizar estes desperdícios de tempo e processamento é apresentado neste trabalho um ambiente de monitoramento e execução que fornece mecanismos para se detectar falhas da classe fail stop em aplicações paralelas executas em ambientes distribuídos ou centralizados. O ambiente em questão é denominado de AMTF (Ambiente de Monitoramento Tolerante a Falhas). O ambiente AMTF utiliza as técnicas de checkpointing/restart para armazenar e recuperar os estados dos processos e de heartbeat para verificar a continuidade de execução destes mesmos processos. Juntamente com o ambiente AMTF é disponibilizada uma biblioteca a ser utilizada pelo desenvolvedor de aplicações paralelas, sendo que a mesma oferece a liberdade de se indicar no código-fonte da aplicação o ponto e o momento que se deseja que o contexto da aplicação seja armazenado para uma possível recuperação além de sua periodicidade para os registros automáticos.

AVISO - A consulta a este documento fica condicionada na aceitação das seguintes condições de uso:
Este trabalho é somente para uso privado de atividades de pesquisa e ensino. Não é autorizada sua reprodução para quaisquer fins lucrativos. Esta reserva de direitos abrange a todos os dados do documento bem como seu conteúdo. Na utilização ou citação de partes do documento é obrigatório mencionar nome da pessoa autora do trabalho.

tesejosezem.pdf (1.46 Mbytes)

Data de Publicação

2006-01-31

Trabalhos decorrentes

AVISO: Saiba o que são os trabalhos decorrentes clicando aqui.