Inteligência Artificial – Visão Geral

Pac-Man (Aprendizado por Reforço)

  • Algoritmo: Q-Learning tabular com política ε-greedy adaptativa.
  • Estado Compacto: posição, máscara de direções livres, proximidade das 2 ameaças mais próximas e se há pellet / power no tile.
  • Ações: {←, →, ↑, ↓} filtrando movimentos inválidos (paredes).
  • Recompensas Base: pellet +1.2, power +10, fantasma +8, vitória +50, morte −30, passo neutro −0.02.
  • Penalizações Dinâmicas: starvation (cresce quadrático), looping (detecção local), revisita excessiva escalonada.
  • Shaping Positivo: aproximação de pellets, maior distância mínima de fantasmas, bônus primeira visita e primeira coleta.
  • Exploração Direcionada: viés forte para células nunca visitadas / com pellets; decaimento periódico de contagens.
  • Planejamento Local: BFS limitada para encontrar rota ao próximo pellet fresco quando entorno está esgotado.
  • Escape de Confinamento: detecção de "caixa" (bounding box reduzida + baixa diversidade) gera rota forçada de saída.
  • Adaptação de ε: vitória acelera redução; morte precoce ou timeout aumentam / mantêm exploração controlada.

Fantasmas (Personalidades & Modos)

  • Modos: scatter (cantinhos), chase (perseguição), frightened (aleatório lento), eyes (retorno à casa).
  • Ciclo Temporal: alternância scatter↔chase baseada em tabela reduzida; frightened interrompe ciclo temporariamente.
  • Blinky: mira diretamente o Pac-Man (pressão constante).
  • Pinky: projeta 4+ células à frente da direção atual do Pac-Man.
  • Inky: vetoriza combinação de posição projetada do Pac-Man e Blinky (efeito de cerco).
  • Clyde: persegue se distante; recua ao canto se perto (<=8 células).
  • Frightened: movimento pseudo-aleatório + velocidade reduzida; captura gera olhos retornando.
  • Decisão em Interseções: evita reversões gratuitas e escolhe direção que minimiza distância ao alvo contextual.
  • Parâmetros Adaptativos: fatores (ex.: scatterFactor, predictionAhead, randomness) ajustam agressividade / previsibilidade.
  • Separação de Responsabilidades: Game controla transições especiais (frightened / olhos); ghostAI gerencia alvo e direção.

Racional & Estratégias

  • Equilíbrio: forte incentivo a novidade evita estagnação; penalidades calibram risco vs. progresso.
  • Complexidade Controlada: estado discretizado reduz explosão de Q-table mantendo sinais suficientes.
  • Pathfinding Híbrido: Q-Learning lida com longo prazo; BFS fornece micro-planejamento imediato em zonas exploradas.
  • Anti-Stuck: múltiplas camadas (ping-pong, baixa diversidade, starvation, corner escape).
  • Transparência: painel expõe heurísticas para análise acadêmica e ajustes futuros.

Trabalho acadêmico – Demonstração de integração de Q-Learning com heurísticas de exploração e IA clássica baseada em estados para inimigos.