Cross-modality correlation loss is a training objective in multimodal machine learning that measures and optimizes the statistical correlation or semantic alignment between representations extracted from different data modalities, such as audio, vision, text, or sensory signals. By penalizing discrepancies or maximizing similarity metrics between paired embeddings in a shared latent space, this loss function encourages encoders to discover and preserve shared, consistent information across heterogeneous inputs. It is widely utilized in self-supervised learning, contrastive learning, and cross-modal retrieval to align disparate data types into a unified feature space while distinguishing modality-invariant characteristics from modality-specific noise.