Reinforcement learning
25 methods in the atlas attack this one problem. They are rivals: each wins something the others do not.
Phrasings that mean this problem
Reinforcement learningOn-policy reinforcement learningValue-based deep RLPolicy-based RLDeep reinforcement learningContinuous-control RLModel-free RLOn-policy RLOverestimation-free RLDeep RLPolicy-gradient deep RLPolicy-gradient RLPolicy-gradient variance reductionDistributed RLRL accelerationSparse-reward RL
machine-learning
- Q-learningEpsilon-greedy explorationcanonmachine-learning
- Actor-criticAdvantage estimationcanonmachine-learning
- Temporal difference learningEligibility tracesstandardmachine-learning
- SARSAstandalonestandardmachine-learning
- Deep Q-networkExperience replaycanonmachine-learning
- Double DQNDecoupled target selectionstandardmachine-learning
- Policy gradientREINFORCE baselinestandardmachine-learning
- Proximal policy optimizationClipped surrogate objectivecanonmachine-learning
- Trust region policy optimizationKL trust regionspecialistmachine-learning
- Soft actor-criticEntropy-regularized objectivestandardmachine-learning
reinforcement-learning
- Dueling DQNValue-advantage streamsstandardreinforcement-learning
- RainbowCombined DQN improvementsspecialistreinforcement-learning
- DDPGDeterministic actor-criticstandardreinforcement-learning
- TD3Twin critics and delayed updatesstandardreinforcement-learning
- Monte Carlo controlFirst-visit returnsstandardreinforcement-learning
- Expected SARSAstandalonestandardreinforcement-learning
- Double Q-learningDecoupled max estimatorstandardreinforcement-learning
- Prioritized experience replayTD-error samplingstandardreinforcement-learning
- A3CAsynchronous advantage actorsstandardreinforcement-learning
- A2CSynchronous advantage actorsstandardreinforcement-learning
- Generalized advantage estimationLambda-weighted advantagesstandardreinforcement-learning
- IMPALAV-trace off-policy correctionspecialistreinforcement-learning
- PPGPhasic policy-value trainingspecialistreinforcement-learning
- Hindsight experience replayGoal relabelingstandardreinforcement-learning
- Reward shapingPotential-based shapingstandardreinforcement-learning