> ML_ALGORITHM // REINFORCE-POLICY-GRADIENTS_v1.0
REINFORCE (Monte Carlo Policy Gradient)
The classic Monte Carlo policy gradient algorithm that updates parameter weights proportionally to observed full-episode cumulative returns.
Policy Gradient RLreinforcement-learningblack-boxmedium (1k-100k)
Back to All AlgorithmsComputational Complexity
Training Complexity:O(episodes * episode_length * policy_pass)
Inference Complexity:O(policy_pass)
Hardware Profile
CPU Friendly:Yes
Requires GPU:No
Memory Footprint:low
Interpretability & Data
Interpretability Tier:black-box
Training Data Needs:medium (1k-100k)
Interpretability Assessment
Directly optimizes the objective J(theta) = E[R] by increasing log-probabilities of actions yielding above-average returns.
Suitable Tasks & Supported Modalities
Suitable Tasks:
reinforcement learningdiscrete control
Supported Modalities:
tabular
Implementing Libraries
Foundational Literature
Simple Statistical Gradient-Following Algorithms for Connectionist Reinforcement Learning (REINFORCE)Ronald J. Williams (1992) · Machine Learning
Common Pitfalls & Warnings
- Excessive gradient variance without a learned baseline causes erratic learning trajectories and slow convergence
