reinforcement-learning
39 entries in Machine Learning & AI.
- Dyna-QModel-based planning updatesstandardreinforcement-learning
- Prioritized sweeping RLTD-error backup queuespecialistreinforcement-learning
- Monte Carlo controlFirst-visit returnsstandardreinforcement-learning
- Expected SARSAstandalonestandardreinforcement-learning
- Double Q-learningDecoupled max estimatorstandardreinforcement-learning
- Dueling DQNValue-advantage streamsstandardreinforcement-learning
- Prioritized experience replayTD-error samplingstandardreinforcement-learning
- RainbowCombined DQN improvementsspecialistreinforcement-learning
- Distributional RLC51 categorical returnsspecialistreinforcement-learning
- Quantile regression DQNstandalonespecialistreinforcement-learning
- A3CAsynchronous advantage actorsstandardreinforcement-learning
- A2CSynchronous advantage actorsstandardreinforcement-learning
- Generalized advantage estimationLambda-weighted advantagesstandardreinforcement-learning
- DDPGDeterministic actor-criticstandardreinforcement-learning
- TD3Twin critics and delayed updatesstandardreinforcement-learning
- IMPALAV-trace off-policy correctionspecialistreinforcement-learning
- PPGPhasic policy-value trainingspecialistreinforcement-learning
- MuZeroLearned-model tree searchspecialistreinforcement-learning
- AlphaZeroSelf-play policy-value MCTSstandardreinforcement-learning
- World modelsLatent-dynamics rolloutspecialistreinforcement-learning
- DreamerLatent imaginationspecialistreinforcement-learning
- Random network distillationPrediction-error bonusspecialistreinforcement-learning
- Count-based explorationPseudo-count bonusspecialistreinforcement-learning
- Intrinsic curiosity moduleForward-model errorspecialistreinforcement-learning
- Hindsight experience replayGoal relabelingstandardreinforcement-learning
- Conservative Q-learningOut-of-distribution penaltyspecialistreinforcement-learning
- Batch-constrained Q-learningstandalonespecialistreinforcement-learning
- Implicit Q-learningExpectile regressionspecialistreinforcement-learning
- Decision transformerReturn-conditioned sequencesspecialistreinforcement-learning
- Behavior cloningstandalonecanonreinforcement-learning
- DAggerDataset aggregationstandardreinforcement-learning
- GAILAdversarial imitationspecialistreinforcement-learning
- Inverse reinforcement learningMaximum entropyspecialistreinforcement-learning
- MADDPGCentralized critic decentralized actorsspecialistreinforcement-learning
- QMIXMonotonic value mixingspecialistreinforcement-learning
- Successor featuresstandalonespecialistreinforcement-learning
- Option-criticLearned temporal abstractionsspecialistreinforcement-learning
- Feudal networksManager-worker hierarchyspecialistreinforcement-learning
- Reward shapingPotential-based shapingstandardreinforcement-learning