• JoomlaWorks Simple Image Rotator
  • JoomlaWorks Simple Image Rotator
  • JoomlaWorks Simple Image Rotator
  • JoomlaWorks Simple Image Rotator
  • JoomlaWorks Simple Image Rotator
  • JoomlaWorks Simple Image Rotator
  • JoomlaWorks Simple Image Rotator
  • JoomlaWorks Simple Image Rotator
  • JoomlaWorks Simple Image Rotator
  • JoomlaWorks Simple Image Rotator
 
  Bookmark and Share
 
 
Dissertação de Mestrado
DOI
https://doi.org/10.11606/D.3.2022.tde-31032023-082212
Documento
Autor
Nome completo
Bruno Eidi Nishimoto
E-mail
Unidade da USP
Área do Conhecimento
Data de Defesa
Imprenta
São Paulo, 2022
Orientador
Banca examinadora
Costa, Anna Helena Reali (Presidente)
Carvalho, Aline Marins Paes
Mello, Rodrigo Fernandes de
Título em inglês
Deep reinforcement learning for multi-domain task-oriented dialogue systems.
Palavras-chave em inglês
Chatbots
Dialogue management
Dialogue system
Multiple domains
Reinforcement learning
Transfer learning
Resumo em inglês
Dialogue system (DS) is an old idea dating back to 1966, when the rst such system was created. DS can be classied in three categories: question & answering, task-oriented and socialbot. Task-oriented dialogue systems are a very relevant eld due to the diversity of possible applications it can achieve. For example, it can solve tasks like buying a movie ticket, booking a restaurant and providing customer service. They have received increasing attention in recent years, and one reason for this is the advancement in natural language processing. Although the literature presents several studies focusing on DS, there are still many issues to be accomplished. Most of them are related to dialogue management, the central component of DS. Reinforcement learning (RL) is one approach that has achieved great success recently. However, things become more complex when DS is extended to multi-domain settings, i.e. when DS needs to complete multiple tasks in dierent domains for the user. Some problems such as policy adaptation and transfer learning arise in this new scenario. The purpose of this research is to improve recent techniques using RL on the dialogue management. We present an ecient learning by balancing exploration and exploitation, and enhancing the usage of expert knowledge to guide the agent. We propose a method to handle noise and error in the input of the dialogue management and we also provide a basic comparison between RL and supervised learning in both toy and real datasets. Finally, we present a new proposal to deal with multi-domain settings: the use of the divide-and-conquer technique and transfer learning for dierent domains.
Título em português
Aprendizado por reforço profundo para sistemas de diálogo orientados a objetivo de múltiplos domínios.
Palavras-chave em português
Aprendizado computacional
Aprendizado por reforço
Chatbot
Resumo em português
O sistema de diálogo (DS) é uma ideia antiga que remonta a 1966, quando o primeiro sistema desse tipo foi criado. O DS pode ser classificado em três categorias: perguntas & respostas, orientado à objetivo e socialbot. Os sistemas de diálogo orientados à objetivo são um campo muito relevante devido à diversidade de aplicações possíveis que podem alcançar. Por exemplo, ele pode resolver tarefas como comprar um ingresso de cinema, reservar um restaurante e fornecer atendimento ao cliente. Eles têm recebido cada vez mais atenção no processamento de linguagem natural. Embora a literatura apresente diversos estudos com foco na SD, ainda há muitas questões a serem cumpridas. A maioria deles está relacionada à gestão do diálogo, componente central do DS. A aprendizagem por reforço (RL) é uma abordagem que alcançou grande sucesso recentemente. No entanto, as coisas se tornam mais complexas quando o DS é estendido para configurações de vários domínios, ou seja, quando o DS precisa concluir várias tarefas em diferentes domínios para o usuário. Alguns problemas como adaptação de políticas e transferência de aprendizado surgem nesse novo cenário. O objetivo desta pesquisa é aprimorar técnicas recentes de uso de RL na gestão do diálogo. Apresentamos um aprendizado eficiente equilibrando exploração e explotação, e potencializando o uso do conhecimento especializado para orientar o agente. Propomos um método para lidar com ruído e erro na entrada do gerenciamento de diálogo e também fornecemos uma comparação básica entre RL e aprendizado supervisionado em conjuntos de dados reais e de brinquedo. Porém, apresentamos uma nova proposta para lidar com configurações multidomínio: o uso da técnica de dividir e conquistar e transferir aprendizado para diferentes domínios.
 
AVISO - A consulta a este documento fica condicionada na aceitação das seguintes condições de uso:
Este trabalho é somente para uso privado de atividades de pesquisa e ensino. Não é autorizada sua reprodução para quaisquer fins lucrativos. Esta reserva de direitos abrange a todos os dados do documento bem como seu conteúdo. Na utilização ou citação de partes do documento é obrigatório mencionar nome da pessoa autora do trabalho.
Data de Publicação
2023-04-03
 
AVISO: Saiba o que são os trabalhos decorrentes clicando aqui.
Todos os direitos da tese/dissertação são de seus autores
CeTI-SC/STI
Biblioteca Digital de Teses e Dissertações da USP. Copyright © 2001-2024. Todos os direitos reservados.