1
Federated Methods to speed up Reinforcement Learning
Sajad Khodadadian
Georgia Institute of Technology
2
Reinforcement Learning
3
Reinforcement Learning
My research: Theoretical Foundations of Reinforcement Learning
This talk: Federated Reinforcement Learning
4
Kendall et. al.: “Learning to Drive in a Day”, 2018
Reinforcement Learning
RL is data intensive!
factordaily.com
Multiple data collecting agents
5
Reinforcement Learning
shengpu-tang.me
Privacy matters!
6
Outline
7
Outline
8
Background on MDP Theory
Agent
Environment
9
Background on MDP Theory
Discount factor
Reward function
Initial state and action
policy
10
Background on MDP Theory
…
Markovian noise
11
Outline
12
Vanilla Distributed Reinforcement Learning
12
Agent 1
Central Agent
Agent j
Local Agents
13
Federated Reinforcement Learning
Agent 1
Local observations & policy
not shared with central agent
Agent j
…
14
Federated Reinforcement Learning
1Shen, et al. "Asynchronous advantage actor critic: Non-asymptotic analysis and linear speedup." arXiv preprint arXiv:2012.15511 (2020).
Conjecture
Yes! We are the first to show this.
Open problem: is there linear speedup in federated RL?
15
…
16
Convergence
Bias
Convergence Variance
17
Convergence
Bias
Convergence Variance
Higher order
…
18
Federated TD-learning
Agent 1
Agent j
19
Linear Speedup in Federated TD-Learning
…
…
20
Linear Speedup in Federated Learning
21
Stochastic Approximation
TD-learning, off-policy
TD-learning, on-policy:
Contraction
22
Stochastic Approximation
…
Extend to Federated!
23
Federated Stochastic Approximation (FedSAM)
Agent 1
Agent j
…
24
Federated Stochastic Approximation (FedSAM)
25
Outline
26
Proof Outline
27
Proof Outline
variance
28
Proof Outline
variance
Moreau envelop
Refined analysis
29
Multiple Agents, Synchronous, i.i.d. Noise
30
Multiple Agents, Synchronous, Markovian Noise
?
?
?
?
Our refined analysis:
Simple bound
31
Multiple Agents, Synchronous, Markovian Noise
Mixing time
32
Multiple Agents, Asynchronous, Markovian Noise
Consensus error due to local updates
33
Key Takeaways
34
Outline
35
My other works
Focus of this talk
Focus of my other work
36
My other works
Actor-Critic
Critic
Actor
suboptimal
37
My other works
Actor-Critic
Critic
Actor
38
My other works
Actor-Critic
Critic
Actor
Two-Time-Scale Actor-Critic
39
My other works
40
Outline
41
Multi Time-Scale Stochastic Approximation
Safe Reinforcement Learning
Markov games
Multi-agent Reinforcement Learning
42
Reinforcement Learning for Operations Research
43
Fairness in Reinforcement Learning
Fairness
44
Multi-Agent Systems
Reinforcement Learning
Fairness
Stochastic Processes
Control Theory
Information Theory
Optimization
Dynamic Programming