> ML_ALGORITHMS_ATLAS_v1.0
Algorithms & Method Families
100 qualified algorithmic method families across 9 disciplines: Classical Supervised, Unsupervised, Time Series, Anomaly Detection, Deep Learning, Recommenders, Causal Inference, Reinforcement Learning, and Specialized Methods.
Deep Q-Network (DQN & Rainbow)
Neural network approximates complex high-dimensional state-to-action Q-values.
Deep Deterministic Policy Gradient (DDPG)
Actor outputs continuous real-valued action vectors directly evaluated by the critic.
Twin Delayed Deep Deterministic Policy Gradient (TD3)
Twin critics produce defensive value estimates mitigating overestimation bias.
Soft Actor-Critic (SAC)
Stochastic actor outputs mean and variance of action distribution; entropy term ensures exploration.
Proximal Policy Optimization (PPO)
Clipping objective prevents catastrophic policy destruction without requiring expensive second-order Hessian calculations.
Trust Region Policy Optimization (TRPO)
Theoretically guarantees non-decreasing policy performance under bounded KL divergence trust regions.
Advantage Actor-Critic (A2C & A3C)
Advantage function A(s, a) = Q(s, a) - V(s) reduces gradient variance significantly.
REINFORCE (Monte Carlo Policy Gradient)
Directly optimizes the objective J(theta) = E[R] by increasing log-probabilities of actions yielding above-average returns.
Monte Carlo Tree Search with Neural Guidance (AlphaZero / MCTS)
Search tree can be explicitly dumped and inspected to examine candidate branches, visit counts, and expected values.
Direct Preference Optimization (DPO)
Directly optimizes the language model policy without requiring training a separate unstable reward model.
Variational Autoencoder (VAE)
Continuous latent space enables smooth linear interpolation between complex data points.
Generative Adversarial Network (GAN)
Generator synthesizes crisp, photorealistic outputs through game-theoretic competition.
Wasserstein GAN with Gradient Penalty (WGAN-GP)
Critic loss correlates monotonically with image quality, providing a reliable convergence metric.
Denoising Diffusion Probabilistic Models (DDPM)
Intermediate diffusion trajectories demonstrate gradual emergence of coarse structural geometry followed by fine details.
Denoising Diffusion Implicit Models (DDIM)
Deterministic ODE sampling enables exact latent inversion (mapping real images back to noise).
Flow Matching for Continuous Normalizing Flows
Straight probability trajectories allow fast Euler ODE integration with minimal curved path deviations.
Latent Diffusion Models (LDM / Stable Diffusion)
Cross-attention maps reveal how natural language conditioning tokens guide spatial layout synthesis.
Normalizing Flows (RealNVP)
Computes mathematically exact log-likelihoods without variational lower bounds or approximations.
