1 of 31

Aprendizado por Reforço

2 of 31

O que é Aprendizado por Reforço (AR)?

  • AR é ideal para cenários onde o ambiente é complexo e incerto, e as decisões têm consequências que se desdobram ao longo do tempo.�
  • Como lidar com a incerteza para resolver problemas?

3 of 31

O que é Aprendizado por Reforço (AR)?

A imagem de Vanderlei Cordeiro de Lima sendo agarrado por um ex-padre irlandês nos Jogos Olímpicos de Atenas, em 2004, ficou mundialmente conhecida.

Neste problema, como o atleta lidou com a incerteza?

4 of 31

O que é Aprendizado por Reforço (AR)?

  • Diferente do aprendizado supervisionado, o AR não requer exemplos rotulados. Ele aprende com a interação direta com o ambiente.

  • Aprendizado Supervisionado: Requer dados rotulados.

  • Aprendizado por Reforço: Explora e interage com o ambiente para aprender.

5 of 31

Exemplo de Aprendizado Supervisionado

  • Classificar frutas por cor: Um modelo aprende a identificar frutas como “maçã” ou “banana”.�
  • Dados de treino (rotulados):
    • 🍎 Vermelha → Maçã
    • 🍌 Amarela → Banana
    • 🍏Verde → Maçã�
  • Como aprende?
    • O modelo olha para muitos exemplos já com o nome da fruta (rótulo) e aprende padrões entre as cores e os tipos.
    • Se uma pessoa pergunta para a IA qual a fruta com a cor verde? Ele consegue responder “maçã”, com base nos dados rotulados.�
  • Resumo: O modelo precisa de exemplos com respostas corretas para aprender.

6 of 31

Exemplo de Aprendizado por Reforço

  • Treinar um robô a andar em uma sala: o robô deve aprender a andar sem bater nas paredes.�
  • Como aprende?
    • Ele tenta dar um passo.
    • Se não bater em nada, ganha recompensa.
    • Se bater na parede, recebe punição.
    • Com o tempo, ele descobre quais movimentos rendem mais recompensas.
  • Resumo: O agente explora sozinho e aprende a partir das consequências das suas ações.

7 of 31

Exemplos reais de Aplicação do AR

  • Navegação Robótica: Tomada de decisões em tempo real para explorar ambientes desconhecidos.

  • Negociação: Tomada de decisões em ambientes financeiros incertos.

  • Gestão de Recursos: Distribuir recursos de forma eficiente ao longo do tempo.

8 of 31

Como lidar com a incerteza para resolver

problemas?

  • Solução: Processos de Decisão de Markov

(Markov Decision processes - MDPs)

  • Dinâmica do Labirinto
    • Objetivo: Entender o conceito de estados, ações, recompensas e transições probabilísticas.

    • Material:
      • Tabuleiro de labirinto (ou desenho no quadro/lousa).
      • Fichas ou marcadores.
      • Cartões de ações e recompensas.
      • Dado para simular incerteza.

Fonte: Gemini

9 of 31

Como lidar com a incerteza para resolver

problemas?

  • Alunos, em grupos, precisam tomar decisões para chegar à saída do labirinto (estado final).�
    • Estados: Cada posição no labirinto.�
    • Ações: Ir para frente, para trás, esquerda, direita.�
    • Recompensas: +1 para avanço correto (sem bater na parede), -1 para erro (bater na parede).

10 of 31

Como lidar com a incerteza para resolver

problemas?

  • Exemplo de labirinto (desenhar no quadro/lousa):

Fim

Parede

Parede

Início

Parede

11 of 31

Como lidar com a incerteza para resolver

problemas?

  • Exemplo de cartões de recompensa (definir com os alunos e desenhar no quadro/lousa):

12 of 31

Como lidar com a incerteza para resolver

problemas?

  • Exemplo de cartões de ações aleatórias
    • Desenhar em vários pedaços de papel, embaralhar e virá-los de cabeça para baixo
    • Os cartões serão selecionados em função dos dados ao longo do jogo.

13 of 31

Como lidar com a incerteza para resolver

problemas?

  • Dinâmica do Labirinto�
    • Para executar o jogo, role o dado!�
    • Isso mostrará que no MDP nem sempre o resultado é garantido.

14 of 31

Como lidar com a incerteza para resolver

problemas?

  • Dinâmica do Labirinto�
    • Após várias rodadas do jogo, vamos observar:�
      • Como as decisões foram afetadas pela incerteza nas transições?
      • Como poderiam maximizar suas recompensas?
      • Como o processo se parece com decisões na vida real, onde nem sempre sabemos o resultado exato das nossas escolhas?

15 of 31

Como lidar com a incerteza para resolver

problemas?

  • A dinâmica do “Labirinto” exemplifica os componentes de Aprendizado por Reforço (AR). Vamos explorar como cada conceito do MDP é refletido na atividade!�
  • Agente
      • Na dinâmica, os alunos representam o agente do sistema
      • O agente interage com o ambiente (o labirinto), escolhe ações e busca maximizar a recompensa total.
        • Ex: Cada aluno decide suas ações no labirinto visando encontrar o caminho ideal.

16 of 31

Como lidar com a incerteza para resolver

problemas?

  • Ambiente
      • Na dinâmica, o labirinto é o ambiente onde o agente opera.
      • Define os estados possíveis (posições no labirinto) e as transições entre estados.
        • Ex: Os alunos movem-se pelas posições no labirinto de acordo com suas ações, enfrentando mudanças no ambiente.

17 of 31

Como lidar com a incerteza para resolver

problemas?

  • Estados
      • Cada posição no labirinto representa um estado.
      • O agente observa seu estado atual para decidir a próxima ação
        • Ex: Os alunos avaliam sua posição no labirinto (estado) antes de decidir o próximo passo.

18 of 31

Como lidar com a incerteza para resolver

problemas?

  • Ações
      • As ações são as opções de movimento que o agente pode escolher.
      • No AR, o agente escolhe ações para maximizar a recompensa ao longo do tempo.
        • Ex: Cartões de ação como "Ir para frente" ou "Virar à esquerda" guiam as decisões dos alunos no labirinto.

19 of 31

Como lidar com a incerteza para resolver

problemas?

  • Recompensas
      • As recompensas indicam a qualidade de uma ação tomada em um estado.
      • No AR, o objetivo é maximizar as recompensas acumuladas.
        • Ex: Alunos recebem recompensas positivas ao avançar no labirinto e negativas ao entrar em becos sem saída.

20 of 31

Como lidar com a incerteza para resolver

problemas?

  • Exploração x Aproveitamento
      • Dilema entre tentar novas ações (exploração) e repetir ações conhecidas (aproveitar).
      • No AR, o agente equilibra entre testar novas opções e seguir o caminho com melhores recompensas.
        • Ex: Alunos exploram novas direções ou repetem ações que já lhes deram boas recompensas.

21 of 31

Como lidar com a incerteza para resolver

problemas?

  • Transições Probabilísticas
      • Incertezas no resultado de uma ação.
      • Em AR, ações nem sempre levam ao resultado esperado devido a transições probabilísticas.
        • Ex: O dado determina o sucesso ou falha de uma ação no labirinto, simulando a incerteza do ambiente.

22 of 31

Como lidar com a incerteza para resolver

problemas?

  • Política
      • Estratégia que mapeia o estado para a melhor ação.
      • No AR, a política é o conjunto de regras que guiam as ações do agente em cada estado.
        • Ex: Após várias rodadas, os alunos começam a desenvolver uma política para o labirinto, identificando o melhor caminho a seguir.

23 of 31

Como lidar com a incerteza para resolver

problemas?

  • Função de Valor
      • Valor de longo prazo dos estados.
      • A função de valor avalia o quanto cada estado contribui para recompensas futuras.
        • Ex: Alunos percebem que certas posições no labirinto são mais vantajosas, conduzindo a melhores recompensas.

24 of 31

Conclusão e Reflexão

  • Revisão dos paralelos entre o AR e o labirinto.
  • Como esses conceitos podem ser aplicados em problemas reais?
    • Exemplo:
      • No labirinto, o agente aprende por tentativa e erro.
      • No Netflix, o sistema aprende com feedback implícito: cliques, tempo assistido e avaliações.
      • Ambos buscam políticas ótimas para maximizar recompensas!

25 of 31

Conclusão e Reflexão

  • Possíveis variações na dinâmica para incluir aspectos mais avançados do Aprendizado por Reforço:
    • Simular ambientes onde nem toda vitória tem o mesmo valor.
    • Permitir que o mesmo estado leve a resultados distintos.
    • Incluir elementos para forçar o agente a escolher entre explorar caminhos novos ou aproveitar rotas já conhecidas.
    • Limitar a visão do ambiente para simular cenários onde o agente não sabe tudo.
    • Permitir que vários agentes interajam no mesmo ambiente.
      • Avaliar competição e cooperação.
  • Benefício: Tornar a dinâmica mais próxima de desafios reais!

26 of 31

Atividade e Discussão

Atividade: Quais outros problemas do nosso estado poderiam ser estudados com o aprendizado por reforço?

Discussão:

  • Controle inteligente de semáforo
  • Distribuição dos ônibus de acordo com a ocupação
  • Alocação de agente para o combate à dengue
  • Distribuição otimizada de policiamento ostensivo

27 of 31

Referências

28 of 31

Referências

Faceli, K., Lorena, A. C., Gama, J., Almeida, T. A. D., & Carvalho, A. C. P. D. L. F. D. (2021). Inteligência artificial: uma abordagem de aprendizado de máquina.

RUSSELL, Stuart J.; NORVIG, Peter. Inteligência Artificial: uma abordagem moderna. 4. ed. São Paulo: Pearson, 2022.

Barto, A. G. (2021). Reinforcement learning: An introduction. by richard’s sutton. SIAM Rev, 6(2), 423.

28

29 of 31

Produção do Material

  • Universidade Federal da Bahia (UFBA)�
  • Universidade do Estado da Bahia (UNEB)�
  • SENAI/CIMATEC�
  • Universidade Estadual de Feira de Santana (UEFS)�
  • Universidade Estadual do Sudoeste da Bahia (UESB)�
  • Universidade Estadual de Santa Cruz (UESC)�
  • Instituto Federal Baiano (IFBaiano)

29

30 of 31

Apoio

31 of 31

Apoio

31