keyword
joint embeddings
Joint embeddings are machine learning representations where data from multiple distinct modalities or domains, such as text, images, and audio, are mapped into a single, shared mathematical vector space. In this unified space, semantically related or paired inputs from different sources are positioned close to one another, allowing geometric distance metrics to measure relationships across diverse types of data. By aligning disparate data types within a common coordinate system, joint embeddings enable models to perform cross-modal tasks such as searching for images using audio or text queries, transferring knowledge between modalities, and facilitating zero-shot recognition and multimodal analysis.
1 item

