ErrLookup › labmlai/annotated_deep_learning_paper_implementations
labmlai/annotated_deep_learning_paper_implementations
🧑🏫 60+ Implementations/tutorials of deep learning papers with side-by-side notes 📝; including transformers (original, xl, switch, feedback, vit, ...), optimizers (adam, adabelief, sophia, ...), gans(cyclegan, stylegan2, ...), 🎮 reinforcement learning (ppo, dqn), capsnet, distillation, ... 🧠 · Python · 222 source files
Analyzed at 33ab02281c on 2026-08-25. 10 documented errors.
| Code / Message | Type | Severity | Tags |
|---|---|---|---|
| Unknown variant | validation | error | python, pytorch, transformer, glu-variants, config, validation |
| Head size too large for Flash Attention | exception | error | pytorch, flash-attention, stable-diffusion, config |
| Please install `bitsandbytes` with `pip install… | exception | error | python, pytorch, bitsandbytes, quantization, dependency |
| Invalid learning rate | exception | error | python, pytorch, optimizer, hyperparameter, validation |
| Invalid beta parameter at index 0 | exception | error | python, pytorch, optimizer, hyperparameter, validation |
| GenericAdaptiveOptimizer does not support sparse gradients… | exception | error | python, pytorch, optimizer, sparse-gradients, embedding |
| Head size too large for flash attention | exception | error | pytorch, gpt-neox, flash-attention, config |
| Invalid beta parameter at index 1 | validation | error | python, pytorch, optimizer, hyperparameter, validation |
| Invalid weight_decay value | validation | error | python, pytorch, optimizer, hyperparameter, weight-decay, validation |
| Invalid epsilon value | exception | error | python, pytorch, optimizer, hyperparameter, validation |