> ML_ALGORITHM // SOFT-ACTOR-CRITIC-SAC_v1.0
Soft Actor-Critic (SAC)
Sample-efficient off-policy actor-critic algorithm that optimizes a stochastic policy with maximum entropy, providing superior exploration and robustness.
Maximum Entropy Continuous RLreinforcement-learningblack-boxlarge (>100k)
Back to All AlgorithmsComputational Complexity
Training Complexity:O(steps * batch_size * passes)
Inference Complexity:O(actor_forward)
Hardware Profile
CPU Friendly:No
Requires GPU:Yes
Memory Footprint:moderate
Interpretability & Data
Interpretability Tier:black-box
Training Data Needs:large (>100k)
Interpretability Assessment
Stochastic actor outputs mean and variance of action distribution; entropy term ensures exploration.
Suitable Tasks & Supported Modalities
Suitable Tasks:
reinforcement learningcontinuous robotics controlautonomous driving
Supported Modalities:
tabularimage
Implementing Libraries
stable-baselines3
torchrl
ray-rllib
Foundational Literature
Soft Actor-Critic: Off-Policy Maximum Entropy Deep Reinforcement Learning with a Stochastic ActorTuomas Haarnoja, Aurick Zhou (2018) · International Conference on Machine Learning (ICML)
Common Pitfalls & Warnings
- Failing to tune or automatically adjust the entropy coefficient alpha causes either erratic random actions or premature determinism
