> ML_ALGORITHM // TWIN-DELAYED-DEEP-DETERMINISTIC-TD3_v1.0
Twin Delayed Deep Deterministic Policy Gradient (TD3)
Major stabilization of continuous actor-critic RL addressing function approximation error through clipped double Q-learning and delayed updates.
Actor-Critic Continuous RLreinforcement-learningblack-boxlarge (>100k)
Back to All AlgorithmsComputational Complexity
Training Complexity:O(steps * batch_size * (actor + 2 * critic)_passes)
Inference Complexity:O(actor_forward)
Hardware Profile
CPU Friendly:No
Requires GPU:Yes
Memory Footprint:moderate
Interpretability & Data
Interpretability Tier:black-box
Training Data Needs:large (>100k)
Interpretability Assessment
Twin critics produce defensive value estimates mitigating overestimation bias.
Suitable Tasks & Supported Modalities
Suitable Tasks:
reinforcement learningcontinuous robotics control
Supported Modalities:
tabular
Implementing Libraries
stable-baselines3
torchrl
ray-rllib
Foundational Literature
Addressing Function Approximation Error in Actor-Critic Methods (TD3)Scott Fujimoto, Herke van Hoof (2018) · International Conference on Machine Learning (ICML)
Common Pitfalls & Warnings
- Target policy smoothing noise must be clipped; excessive noise prevents fine-precision control
