0% acharam este documento útil (0 voto)
3 visualizações9 páginas

Deep Q-Networks em Jogos Atari

Enviado por

otaviotumelero77
Direitos autorais
© All Rights Reserved
Levamos muito a sério os direitos de conteúdo. Se você suspeita que este conteúdo é seu, reivindique-o aqui.
Formatos disponíveis
Baixe no formato PPTX, PDF, TXT ou leia on-line no Scribd
0% acharam este documento útil (0 voto)
3 visualizações9 páginas

Deep Q-Networks em Jogos Atari

Enviado por

otaviotumelero77
Direitos autorais
© All Rights Reserved
Levamos muito a sério os direitos de conteúdo. Se você suspeita que este conteúdo é seu, reivindique-o aqui.
Formatos disponíveis
Baixe no formato PPTX, PDF, TXT ou leia on-line no Scribd

Playing Atari with Deep Reinforcement

Learning

Fransley Brustolim Ferreira


Matheus Victor Gubert
Otavio Flyssak Tumelero
Thiago Schizzi
Caetano Turra
Inteligência Artificial Aplicada à Sistemas de Informação
INTRODUÇÃO ARQUITETURA DA
REDE NEURAL PROFUNDA
• Pixels para Ações: Rede neural aprende a jogar Atari
diretamente dos pixels da tela.
• Q-Learning Aprimorado :Utiliza Q-learning com
repetição de experiência para treinamento estável e
eficiente.
• Resultados de Ponta: Supera métodos anteriores em
seis de sete jogos, com arquitetura e parâmetros
genéricos.
2
ARQUITETURA DA REDE NEURAL
PROFUNDA
• Camada de Entrada:
Produzida pela função de pré-
processamento
• Primeira Camada Oculta: Não
linearidade
• Segunda Camada Oculta
• Terceira Camada Oculta

3
DEEP Q-NETWORKS

• Do TD-Gammon ao DQN: Sucesso no backgammon


com Q-learning e rede neural, mas limitado a esse
jogo.
• Desafios: Divergência do Q-learning com
aproximadores não-lineares.
• Solução: DQN combina Q-learning, redes neurais
profundas e aprendizado por gradiente estocástico.

4
VANTAGENS DO DQN E
PLATAFORMA ATARI
• Escalabilidade: Baixo custo computacional por
iteração.
• Aprendizado ponta-a-ponta: Diretamente da entrada
visual.
• Atari 2600: Plataforma para testar algoritmos de RL.
• DQN: Supera abordagens anteriores com aprendizado
mais eficiente.

5
ALGORITMO DE APRENDIZADO
• Inicialização: Inicializar memória de repetição D e função de valor de ação Q com
pesos aleatórios
• Seleção de Ação: Seleciona usando politica ε-greedy
• Execução e Armazenamento: Executar ação, observar recompensa e próximo estado
• Atualização: Amostrar minibatch de transições de D e atualizar Q usando descida de
gradiente

6
Comparação de desempenho

• Comparação DQN vs. Humano: Avaliação do desempenho


de um agente DQN contra humanos em 7 jogos Atari.
• Desempenho da DQN: Supera humanos em 3 jogos (Beam
Rider, Enduro, Pong), competitivo em Q*bert.
• Gráfico de Aprendizado: Mostra a progressão e melhoria do
desempenho da DQN ao longo do treinamento.

7
Conclusão e Impacto

• Desempenho Superior: O modelo DQN superou métodos


anteriores em seis dos sete jogos testados, sem ajustes
específicos por jogo
• Aprendizado End-to-End:Demonstrou capacidade de aprender
diretamente de pixels brutos
• Desempenho Sobre-Humano: Alcançou resultados superiores
aos de jogadores humanos
• Porencial Futuro: Abre caminho para aplicações mais amplas
de aprendizado por reforço profundo em problemas complexos
de controle e tomada de decisão

8
Referencias Relacionadas

• [Link]
• [Link]
• [Link]
• [Link]
• [Link]

Você também pode gostar