Otimização da Distribuição de Leads via Aprendizado por Reforço: Uma Abordagem com Multi-Armed Bandits em um Ambiente de Vendas Simulado
Este trabalho apresenta o desenvolvimento de um ambiente de vendas simulado para a otimização da distribuição de leads por meio de técnicas de Multi-Armed Bandits (MAB). Partindo da observação de que CRMs comerciais normalmente aplicam regras fixas (Round-Robin, score-based, etc.), propõe-se modelar um ambiente que permita comparar heurísticas tradicionais com algoritmos adaptativos de MAB (epsilon-Greedy, epsilon-Decaying, UCB1, UCB-Tuned, Gradient Bandit e Thompson Sampling). A contribuição principal é (i) um ambiente de simulação parametrizável que reproduz variações realistas de demanda e heterogeneidade entre vendedores, incorporando uma penalidade de carga que degrada a conversão em função da ocupação do vendedor; (ii) a implementação e integração de nove estratégias de alocação, incluindo heurísticas fixas e políticas adaptativas, que atualizam suas decisões a partir do desempenho observado; e (iii) a avaliação experimental que mensura a taxa de conversão e a concentração de carga em diferentes cenários. Os resultados indicam que políticas adaptativas superam heurísticas estáticas, especialmente quando há heterogeneidade significativa entre vendedores e o sistema opera sem saturação. Em contrapartida, sob alta demanda ou quando os vendedores são homogêneos, estratégias de distribuição uniforme demonstram robustez.
2026/1 - POC2
Orientador: Pedro Olmo Stancioli Vaz De Melo
PDF Disponível