Skip to main content

> ML_ALGORITHM // TWIN-DELAYED-DEEP-DETERMINISTIC-TD3_v1.0

Twin Delayed Deep Deterministic Policy Gradient (TD3)

Major stabilization of continuous actor-critic RL addressing function approximation error through clipped double Q-learning and delayed updates.

Actor-Critic Continuous RLreinforcement-learningblack-boxlarge (>100k)
Back to All Algorithms
Computational Complexity
Training Complexity:O(steps * batch_size * (actor + 2 * critic)_passes)
Inference Complexity:O(actor_forward)
Hardware Profile
CPU Friendly:No
Requires GPU:Yes
Memory Footprint:moderate
Interpretability & Data
Interpretability Tier:black-box
Training Data Needs:large (>100k)

Interpretability Assessment

Twin critics produce defensive value estimates mitigating overestimation bias.

Suitable Tasks & Supported Modalities

Suitable Tasks:
reinforcement learningcontinuous robotics control
Supported Modalities:
tabular

Implementing Libraries

stable-baselines3
torchrl
ray-rllib

Foundational Literature

Addressing Function Approximation Error in Actor-Critic Methods (TD3)Scott Fujimoto, Herke van Hoof (2018) · International Conference on Machine Learning (ICML)
Common Pitfalls & Warnings
  • Target policy smoothing noise must be clipped; excessive noise prevents fine-precision control