ErrLookup › labmlai/annotated_deep_learning_paper_implementations

labmlai/annotated_deep_learning_paper_implementations

🧑‍🏫 60+ Implementations/tutorials of deep learning papers with side-by-side notes 📝; including transformers (original, xl, switch, feedback, vit, ...), optimizers (adam, adabelief, sophia, ...), gans(cyclegan, stylegan2, ...), 🎮 reinforcement learning (ppo, dqn), capsnet, distillation, ... 🧠 · Python · 222 source files

Analyzed at 33ab02281c on 2026-08-25. 10 documented errors.

Code / MessageTypeSeverityTags
Unknown variant
validation error python, pytorch, transformer, glu-variants, config, validation
Head size too large for Flash Attention
exception error pytorch, flash-attention, stable-diffusion, config
Please install `bitsandbytes` with `pip install…
exception error python, pytorch, bitsandbytes, quantization, dependency
Invalid learning rate
exception error python, pytorch, optimizer, hyperparameter, validation
Invalid beta parameter at index 0
exception error python, pytorch, optimizer, hyperparameter, validation
GenericAdaptiveOptimizer does not support sparse gradients…
exception error python, pytorch, optimizer, sparse-gradients, embedding
Head size too large for flash attention
exception error pytorch, gpt-neox, flash-attention, config
Invalid beta parameter at index 1
validation error python, pytorch, optimizer, hyperparameter, validation
Invalid weight_decay value
validation error python, pytorch, optimizer, hyperparameter, weight-decay, validation
Invalid epsilon value
exception error python, pytorch, optimizer, hyperparameter, validation