Multilingual Denoising Pre-training for Neural Machine Translation
Yinhan LiuJiatao GuNaman GoyalXian LiSergey EdunovMarjan GhazvininejadMike LewisLuke Zettlemoyer
Introduces mBART, a multilingual sequence-to-sequence denoising autoencoder pre-trained on large-scale monolingual corpora that yields substantial performance gains across low-resource, document-level, and unsupervised machine translation.
- Paper: BART: Denoising Sequence-to-Sequence Pre-training for Natural Language Generation, Translation, and Comprehension, Mike Lewis et al. (2020). Reading the foundational BART paper is essential because the source directly adapts its denoising sequence-to-sequence pre-training objective for multilingual machine translation.
- Paper: Cross-lingual Language Model Pretraining, Guillaume Lample et al. (2019). This cross-lingual pretraining framework provides necessary background on scaling language model objectives across multiple languages without relying heavily on parallel text.
- Paper: mT5: A Massively Multilingual Pre-trained Text-to-Text Transformer, Linting Xue et al. (2020). Exploring the massive multilingual span-corruption approach of mT5 helps clarify the design choices behind sequence-to-sequence pretraining across diverse language sets.
- Paper: Omnilingual MT: Machine Translation for 1,600 Languages, Omnilingual MT Team et al. (2026). This work extends multilingual machine translation techniques to over 1,600 languages, building directly on the foundation of sequence-to-sequence multilingual transfer.
- Paper: Language Models are Few-Shot Learners, T. B. Brown et al. (2020). Following with GPT-3 demonstrates how massive autoregressive scaling achieves powerful few-shot translation capabilities beyond specialized encoder-decoder pre-training.
