> ML_ALGORITHM // ADVANTAGE-ACTOR-CRITIC-A2C-A3C_v1.0
Advantage Actor-Critic (A2C & A3C)
Synchronous actor-critic framework that accelerates policy gradient learning by running parallel environment instances to stabilize gradient variance.
On-Policy Actor-Critic RLreinforcement-learningblack-boxlarge (>100k)
Back to All AlgorithmsComputational Complexity
Training Complexity:O(workers * steps * forward_backward)
Inference Complexity:O(policy_forward)
Hardware Profile
CPU Friendly:Yes
Requires GPU:Yes
Memory Footprint:moderate
Interpretability & Data
Interpretability Tier:black-box
Training Data Needs:large (>100k)
Interpretability Assessment
Advantage function A(s, a) = Q(s, a) - V(s) reduces gradient variance significantly.
Suitable Tasks & Supported Modalities
Suitable Tasks:
reinforcement learningparallel simulation
Supported Modalities:
tabularimage
Implementing Libraries
stable-baselines3
torchrl
ray-rllib
Foundational Literature
Asynchronous Methods for Deep Reinforcement Learning (A3C)Volodymyr Mnih, Adrià Puigdomènech Badia (2016) · International Conference on Machine Learning (ICML)
Common Pitfalls & Warnings
- A single slow environment worker stalls the entire synchronous step update in A2C
