Part 2 - Going Beyond Behaviour Cloning with Off-Policy Reinforcement Learning
Adam Jelley
University of Edinburgh
Improving on Behaviour Cloning
Review of Off-Policy RL
Review of Off-Policy RL - DDPG
Review of Off-Policy RL - TD3
Review of Off-Policy RL - SAC
Improving on Behaviour Cloning with Off-Policy RL
How can we handle the inevitable distribution shift when optimising return?
A Minimalistic Approach to Offline RL - Introduction
A Minimalistic Approach to Offline RL - Theory
A Minimalistic Approach to Offline RL - Experiments
A Minimalistic Approach to Offline RL - Experiments
Uncertainty Based Offline-RL with Diversified Q-Ensemble - Introduction
Use uncertainty not regularisation!
Uncertainty Based Offline-RL with Diversified Q-Ensemble - Uncertainty Penalisation with Q-Ensemble
Uncertainty Based Offline-RL with Diversified Q-Ensemble - Uncertainty Penalisation with Q-Ensemble
Uncertainty Based Offline-RL with Diversified Q-Ensemble - Uncertainty Penalisation with Q-Ensemble
Uncertainty Based Offline-RL with Diversified Q-Ensemble - Uncertainty Penalisation with Q-Ensemble
Uncertainty Based Offline-RL with Diversified Q-Ensemble - Ensemble Gradient Diversification
Uncertainty Based Offline-RL with Diversified Q-Ensemble - Ensemble Gradient Diversification
Uncertainty Based Offline-RL with Diversified Q-Ensemble - Ensemble Gradient Diversification
Uncertainty Based Offline-RL with Diversified Q-Ensemble - Ensemble Gradient Diversification
Uncertainty Based Offline-RL with Diversified Q-Ensemble - Experiments
Uncertainty Based Offline-RL with Diversified Q-Ensemble - Experiments
Uncertainty Based Offline-RL with Diversified Q-Ensemble - Experiments
Uncertainty Based Offline-RL with Diversified Q-Ensemble - Experiments
Uncertainty Based Offline-RL with Diversified Q-Ensemble - Experiments
Uncertainty Based Offline-RL with Diversified Q-Ensemble - Experiments
Uncertainty Based Offline-RL with Diversified Q-Ensemble - Conclusion
Critique and Further Research Directions