Tensor Programs V: Tuning Large Neural Networks via Zero-Shot Hyperparameter Transfer (ΞΌTransfer) @TheAIEpiphany
Tensor Programs V: Tuning Large Neural Networks via Zero-Shot Hyperparameter Transfer (ΞΌTransfer)  @TheAIEpiphany
Uploaded March 2022 | Updated September 2026, 1 week ago
πŸ‘¨β€πŸ‘©β€πŸ‘§β€πŸ‘¦ Join our Discord community πŸ‘¨β€πŸ‘©β€πŸ‘§β€πŸ‘¦
discord.gg/peBrCpheKE

In this video I cover "Tensor Programs V: Tuning Large Neural Networks via Zero-Shot Hyperparameter Transfer (ΞΌTransfer)" paper that makes optimal hyperparameters stable w.r.t. width scaling!

β–¬β–¬β–¬β–¬β–¬β–¬β–¬β–¬β–¬β–¬β–¬β–¬β–¬β–¬β–¬β–¬β–¬β–¬β–¬β–¬β–¬β–¬β–¬β–¬
βœ… Paper: arxiv.org/abs/2203.03466
βœ… Their previous paper: arxiv.org/abs/2011.14522
βœ… ΞΌTransfer tool: github.com/microsoft/mup
βœ… DeepNet paper: arxiv.org/abs/2203.00555
β–¬β–¬β–¬β–¬β–¬β–¬β–¬β–¬β–¬β–¬β–¬β–¬β–¬β–¬β–¬β–¬β–¬β–¬β–¬β–¬β–¬β–¬β–¬β–¬

⌚️ Timetable:
00:00 uTransfer introduced
04:30 Previous work (tensor programs IV)
10:00 NTK - neural tangent kernel recap
16:30 abc parametrization
19:25 How does learning happen in NTK?
33:50 Connections to Central Limit Theorem
39:30 Maximal Update Parametrization in Practice
45:50 DeepNet paper connection
48:20 Results (width is all you need?)

β–¬β–¬β–¬β–¬β–¬β–¬β–¬β–¬β–¬β–¬β–¬β–¬β–¬β–¬β–¬β–¬β–¬β–¬β–¬β–¬β–¬β–¬β–¬β–¬
THE AI EPIPHANY PATREONS WALL ❀️

Eli Mahler
Kevin Stone
Petar VeličkoviΔ‡

β–¬β–¬β–¬β–¬β–¬β–¬β–¬β–¬β–¬β–¬β–¬β–¬β–¬β–¬β–¬β–¬β–¬β–¬β–¬β–¬β–¬β–¬β–¬β–¬

πŸ’Ό LinkedIn - linkedin.com/in/aleksagordic
🐦 Twitter - twitter.com/gordic_aleksa
πŸ‘¨β€πŸ‘©β€πŸ‘§β€πŸ‘¦ Discord - discord.gg/peBrCpheKE

πŸ“Ί YouTube - youtube.com/c/TheAIEpiphany
πŸ“š Medium - gordicaleksa.medium.com
πŸ’» GitHub - github.com/gordicaleksa
πŸ“’ AI Newsletter - aiepiphany.substack.com

β–¬β–¬β–¬β–¬β–¬β–¬β–¬β–¬β–¬β–¬β–¬β–¬β–¬β–¬β–¬β–¬β–¬β–¬β–¬β–¬β–¬β–¬β–¬β–¬

#ΞΌTransfer #MaximalUpdateParametrization #scalingl
Tensor Programs V: Tuning Large Neural Networks via Zero-Shot Hyperparameter Transfer (ΞΌTransfer)Day 5: Meta NLLB - data filtering (Pt. 3)Make-A-Video: Text-To-Video Generation Without Text-Video Data | Paper ExplainedBest LLM? Qwen 2 LLM w/ author Junyang LinDay 25: Open NLLB - filtering HBS (Pt 3)Day 19: Open NLLB - OPUS, downloading HBS parallel corpora (Pt 2)Day 20: Open NLLB - downloading HBS parallel corpora (Croatian - wrap up) (Pt 1)Day 29: Open NLLB - testing & improving fasttext HBS LID (Pt 3)Text Style Brush - Transfer of text aesthetics from a single example | Paper ExplainedHow to Build a Deep Learning Machine - Everything You Need To KnowDay 28: Open NLLB - debugging fuzzy dedup, training fasttext LID (Pt 2)Day 27: Open NLLB - filtering stage hyperparams, HBS LID detector (Pt 3 cont.)
Aleksa Gordić - The AI Epiphany |

Tensor Programs V: Tuning Large Neural Networks via Zero-Shot Hyperparameter Transfer (ΞΌTransfer)

SHARE TO X SHARE TO REDDIT SHARE TO FACEBOOK WALLPAPER