keyword
multi-task visual grounding
Multi-task visual grounding is a multimodal artificial intelligence paradigm that unifies multiple forms of language-guided visual localization within a single computational framework. Given an input image and a natural language query, the system simultaneously predicts different spatial representations of the referenced target, primarily integrating bounding-box localization for referring expression comprehension with pixel-level mask generation for referring expression segmentation. By sharing representations across these complementary objectives and extending across multiple semantic granularities—including instance, semantic, and part levels—multi-task visual grounding allows models to improve cross-modal alignment, resolve visual ambiguities, and maintain spatial and semantic consistency across diverse vision-language localization outputs.
1 item

