GradNorm: Gradient Normalization for Adaptive Loss Balancing in Deep Multitask Networks
Zhao ChenVijay BadrinarayananChen-Yu LeeAndrew Rabinovich
Proposes GradNorm, an adaptive loss-balancing method that dynamically scales gradient magnitudes during training, eliminating expensive loss-weight grid searches while improving multitask performance and reducing overfitting across diverse architectures.
- Paper: Multitask Learning, RICH CARUANA (1997). Provides foundational principles and architectures for multi-task learning through shared representations, establishing the baseline framework that GradNorm dynamically optimizes.
- Paper: An Overview of Multi-Task Learning in Deep Neural Networks, Sebastian Ruder (2017). Surveys the mechanics and core challenges of hard and soft parameter sharing in deep multi-task networks, providing direct context for the multi-task optimization bottleneck GradNorm targets.
- Paper: A Survey on Multi-Task Learning, Yu Zhang et al. (2017). Offers a comprehensive taxonomy of multi-task learning algorithms and feature-sharing strategies, clarifying the broader problem space of joint task optimization.
- Paper: An overview of gradient descent optimization algorithms, Sebastian Ruder (2016). Reviews fundamental gradient descent optimization techniques and adaptive learning rate mechanics that underlie gradient-based balancing algorithms.
- Paper: Gradient Surgery for Multi-Task Learning, Tianhe Yu et al. (2020). Extends multi-task gradient manipulation beyond magnitude balancing by directly resolving conflicting gradient directions via vector projection.
- Paper: Modeling Task Relationships in Multi-task Learning with Multi-gate Mixture-of-Experts, Jiaqi Ma et al. (2018). Complements dynamic loss balancing with a flexible multi-gate mixture-of-experts architecture to mitigate task interference in multi-task networks.
- Paper: DSelect-k: Differentiable Selection in the Mixture of Experts with Applications to Multi-Task Learning, Hussein Hazimeh et al. (2021). Builds on multi-task optimization by introducing differentiable expert selection to stabilize gradient-based multi-task mixture-of-experts training.
