Playing Atari with Deep Reinforcement
Learning
Fransley Brustolim Ferreira
Matheus Victor Gubert
Otavio Flyssak Tumelero
Thiago Schizzi
Caetano Turra
Inteligência Artificial Aplicada à Sistemas de Informação
INTRODUÇÃO ARQUITETURA DA
REDE NEURAL PROFUNDA
• Pixels para Ações: Rede neural aprende a jogar Atari
diretamente dos pixels da tela.
• Q-Learning Aprimorado :Utiliza Q-learning com
repetição de experiência para treinamento estável e
eficiente.
• Resultados de Ponta: Supera métodos anteriores em
seis de sete jogos, com arquitetura e parâmetros
genéricos.
2
ARQUITETURA DA REDE NEURAL
PROFUNDA
• Camada de Entrada:
Produzida pela função de pré-
processamento
• Primeira Camada Oculta: Não
linearidade
• Segunda Camada Oculta
• Terceira Camada Oculta
3
DEEP Q-NETWORKS
• Do TD-Gammon ao DQN: Sucesso no backgammon
com Q-learning e rede neural, mas limitado a esse
jogo.
• Desafios: Divergência do Q-learning com
aproximadores não-lineares.
• Solução: DQN combina Q-learning, redes neurais
profundas e aprendizado por gradiente estocástico.
4
VANTAGENS DO DQN E
PLATAFORMA ATARI
• Escalabilidade: Baixo custo computacional por
iteração.
• Aprendizado ponta-a-ponta: Diretamente da entrada
visual.
• Atari 2600: Plataforma para testar algoritmos de RL.
• DQN: Supera abordagens anteriores com aprendizado
mais eficiente.
5
ALGORITMO DE APRENDIZADO
• Inicialização: Inicializar memória de repetição D e função de valor de ação Q com
pesos aleatórios
• Seleção de Ação: Seleciona usando politica ε-greedy
• Execução e Armazenamento: Executar ação, observar recompensa e próximo estado
• Atualização: Amostrar minibatch de transições de D e atualizar Q usando descida de
gradiente
6
Comparação de desempenho
• Comparação DQN vs. Humano: Avaliação do desempenho
de um agente DQN contra humanos em 7 jogos Atari.
• Desempenho da DQN: Supera humanos em 3 jogos (Beam
Rider, Enduro, Pong), competitivo em Q*bert.
• Gráfico de Aprendizado: Mostra a progressão e melhoria do
desempenho da DQN ao longo do treinamento.
7
Conclusão e Impacto
• Desempenho Superior: O modelo DQN superou métodos
anteriores em seis dos sete jogos testados, sem ajustes
específicos por jogo
• Aprendizado End-to-End:Demonstrou capacidade de aprender
diretamente de pixels brutos
• Desempenho Sobre-Humano: Alcançou resultados superiores
aos de jogadores humanos
• Porencial Futuro: Abre caminho para aplicações mais amplas
de aprendizado por reforço profundo em problemas complexos
de controle e tomada de decisão
8
Referencias Relacionadas
• [Link]
• [Link]
• [Link]
• [Link]
• [Link]