Skip to main content

> ML_ALGORITHM // SOFT-ACTOR-CRITIC-SAC_v1.0

Soft Actor-Critic (SAC)

Sample-efficient off-policy actor-critic algorithm that optimizes a stochastic policy with maximum entropy, providing superior exploration and robustness.

Maximum Entropy Continuous RLreinforcement-learningblack-boxlarge (>100k)
Back to All Algorithms
Computational Complexity
Training Complexity:O(steps * batch_size * passes)
Inference Complexity:O(actor_forward)
Hardware Profile
CPU Friendly:No
Requires GPU:Yes
Memory Footprint:moderate
Interpretability & Data
Interpretability Tier:black-box
Training Data Needs:large (>100k)

Interpretability Assessment

Stochastic actor outputs mean and variance of action distribution; entropy term ensures exploration.

Suitable Tasks & Supported Modalities

Suitable Tasks:
reinforcement learningcontinuous robotics controlautonomous driving
Supported Modalities:
tabularimage

Implementing Libraries

stable-baselines3
torchrl
ray-rllib

Foundational Literature

Soft Actor-Critic: Off-Policy Maximum Entropy Deep Reinforcement Learning with a Stochastic ActorTuomas Haarnoja, Aurick Zhou (2018) · International Conference on Machine Learning (ICML)
Common Pitfalls & Warnings
  • Failing to tune or automatically adjust the entropy coefficient alpha causes either erratic random actions or premature determinism