Aprendizado por reforço em lote: um estudo de caso para o problema de tomada de decisão em processos de venda

Lacerda, Dênis Antonio

doi:10.11606/D.45.2013.tde-03072014-101251

Home

Facilities

Master's Dissertation

DOI

https://doi.org/10.11606/D.45.2013.tde-03072014-101251

Document

Master's Dissertation

Author

Lacerda, Dênis Antonio (Catálogo USP)

Full name

Dênis Antonio Lacerda

E-mail

Institute/School/College

Instituto de Matemática e Estatística

Knowledge Area

Computer Science

Date of Defense

2013-12-12

Published

São Paulo, 2014

Supervisor

Barros, Leliane Nunes de (Catálogo USP)

Committee

Barros, Leliane Nunes de (President)
Ferreira, João Eduardo
Reali Costa, Anna Helena

Title in Portuguese

Aprendizado por reforço em lote: um estudo de caso para o problema de tomada de decisão em processos de venda

Keywords in Portuguese

Aprendizado de processos de venda
Aprendizado por reforço em lote
Planejamento probabilístico
Processo de decisão markoviano

Abstract in Portuguese

Planejamento Probabilístico estuda os problemas de tomada de decisão sequencial de um agente, em que as ações possuem efeitos probabilísticos, modelados como um processo de decisão markoviano (Markov Decision Process - MDP). Dadas a função de transição de estados probabilística e os valores de recompensa das ações, é possível determinar uma política de ações (i.e., um mapeamento entre estado do ambiente e ações do agente) que maximiza a recompensa esperada acumulada (ou minimiza o custo esperado acumulado) pela execução de uma sequência de ações. Nos casos em que o modelo MDP não é completamente conhecido, a melhor política deve ser aprendida através da interação do agente com o ambiente real. Este processo é chamado de aprendizado por reforço. Porém, nas aplicações em que não é permitido realizar experiências no ambiente real, por exemplo, operações de venda, é possível realizar o aprendizado por reforço sobre uma amostra de experiências passadas, processo chamado de aprendizado por reforço em lote (Batch Reinforcement Learning). Neste trabalho, estudamos técnicas de aprendizado por reforço em lote usando um histórico de interações passadas, armazenadas em um banco de dados de processos, e propomos algumas formas de melhorar os algoritmos existentes. Como um estudo de caso, aplicamos esta técnica no aprendizado de políticas para o processo de venda de impressoras de grande formato, cujo objetivo é a construção de um sistema de recomendação de ações para vendedores iniciantes.

Title in English

Batch reinforcement learning: a case study for the problem of decision making in sales processes

Keywords in English

Batch reinforcement learning
Markov decision process
Probabilistic planning
Sales process learning

Abstract in English

Probabilistic planning studies the problems of sequential decision-making of an agent, in which actions have probabilistic effects, and can be modeled as a Markov decision process (MDP). Given the probabilities and reward values of each action, it is possible to determine an action policy (in other words, a mapping between the state of the environment and the agent's actions) that maximizes the expected reward accumulated by executing a sequence of actions. In cases where the MDP model is not completely known, the best policy needs to be learned through the interaction of the agent in the real environment. This process is called reinforcement learning. However, in applications where it is not allowed to perform experiments in the real environment, for example, sales process, it is possible to perform the reinforcement learning using a sample of past experiences. This process is called Batch Reinforcement Learning. In this work, we study techniques of batch reinforcement learning (BRL), in which learning is done using a history of past interactions, stored in a processes database. As a case study, we apply this technique for learning policies in the sales process for large format printers, whose goal is to build a action recommendation system for beginners sellers.

WARNING - Viewing this document is conditioned on your acceptance of the following terms of use:
This document is only for private use for research and teaching activities. Reproduction for commercial use is forbidden. This rights cover the whole data about this document as well as its contents. Any uses or copies of this document in whole or in part must include the author's name.

dissertacao.pdf (1.30 Mbytes)

Dissertacao_DenisAntonioLacerda_pdf.pdf (867.22 Kbytes)

Publishing Date

2014-07-07

Derived works

WARNING: Learn what derived works are clicking here.