Aprendizado por reforço em lote: um estudo de caso para o problema de tomada de decisão em processos de venda

Lacerda, Dênis Antonio

doi:10.11606/D.45.2013.tde-03072014-101251

Início

Servicios

Disertación de Maestría

DOI

https://doi.org/10.11606/D.45.2013.tde-03072014-101251

Documento

Disertación de Maestría

Autor

Lacerda, Dênis Antonio (Catálogo USP)

Nombre completo

Dênis Antonio Lacerda

Dirección Electrónica

Instituto/Escuela/Facultad

Instituto de Matemática e Estatística

Área de Conocimiento

Informática

Fecha de Defensa

2013-12-12

Publicación

São Paulo, 2014

Director

Barros, Leliane Nunes de (Catálogo USP)

Tribunal

Barros, Leliane Nunes de (Presidente)
Ferreira, João Eduardo
Reali Costa, Anna Helena

Título en portugués

Aprendizado por reforço em lote: um estudo de caso para o problema de tomada de decisão em processos de venda

Palabras clave en portugués

Aprendizado de processos de venda
Aprendizado por reforço em lote
Planejamento probabilístico
Processo de decisão markoviano

Resumen en portugués

Planejamento Probabilístico estuda os problemas de tomada de decisão sequencial de um agente, em que as ações possuem efeitos probabilísticos, modelados como um processo de decisão markoviano (Markov Decision Process - MDP). Dadas a função de transição de estados probabilística e os valores de recompensa das ações, é possível determinar uma política de ações (i.e., um mapeamento entre estado do ambiente e ações do agente) que maximiza a recompensa esperada acumulada (ou minimiza o custo esperado acumulado) pela execução de uma sequência de ações. Nos casos em que o modelo MDP não é completamente conhecido, a melhor política deve ser aprendida através da interação do agente com o ambiente real. Este processo é chamado de aprendizado por reforço. Porém, nas aplicações em que não é permitido realizar experiências no ambiente real, por exemplo, operações de venda, é possível realizar o aprendizado por reforço sobre uma amostra de experiências passadas, processo chamado de aprendizado por reforço em lote (Batch Reinforcement Learning). Neste trabalho, estudamos técnicas de aprendizado por reforço em lote usando um histórico de interações passadas, armazenadas em um banco de dados de processos, e propomos algumas formas de melhorar os algoritmos existentes. Como um estudo de caso, aplicamos esta técnica no aprendizado de políticas para o processo de venda de impressoras de grande formato, cujo objetivo é a construção de um sistema de recomendação de ações para vendedores iniciantes.

Título en inglés

Batch reinforcement learning: a case study for the problem of decision making in sales processes

Palabras clave en inglés

Batch reinforcement learning
Markov decision process
Probabilistic planning
Sales process learning

Resumen en inglés

Probabilistic planning studies the problems of sequential decision-making of an agent, in which actions have probabilistic effects, and can be modeled as a Markov decision process (MDP). Given the probabilities and reward values of each action, it is possible to determine an action policy (in other words, a mapping between the state of the environment and the agent's actions) that maximizes the expected reward accumulated by executing a sequence of actions. In cases where the MDP model is not completely known, the best policy needs to be learned through the interaction of the agent in the real environment. This process is called reinforcement learning. However, in applications where it is not allowed to perform experiments in the real environment, for example, sales process, it is possible to perform the reinforcement learning using a sample of past experiences. This process is called Batch Reinforcement Learning. In this work, we study techniques of batch reinforcement learning (BRL), in which learning is done using a history of past interactions, stored in a processes database. As a case study, we apply this technique for learning policies in the sales process for large format printers, whose goal is to build a action recommendation system for beginners sellers.

ADVERTENCIA - La consulta de este documento queda condicionada a la aceptación de las siguientes condiciones de uso:
Este documento es únicamente para usos privados enmarcados en actividades de investigación y docencia. No se autoriza su reproducción con finalidades de lucro. Esta reserva de derechos afecta tanto los datos del documento como a sus contenidos. En la utilización o cita de partes del documento es obligado indicar el nombre de la persona autora.

dissertacao.pdf (1.30 Mbytes)

Dissertacao_DenisAntonioLacerda_pdf.pdf (867.22 Kbytes)

Fecha de Publicación

2014-07-07

Trabajos derivados

ADVERTENCIA: Aprenda que son los trabajos derivados haciendo clic aquí.