Cross-Modal Retrieval

Cross-Modal Retrieval (CMR) is a task of retrieving items across different modalities, such as image, text, video, and audio. The core challenge of CMR is the heterogeneity gap, which arises because data from different modalities have distinct representations, making direct comparison difficult. To address this, most CMR methods focus on learning a shared latent embedding space. In this space, concepts from different modalities are projected, allowing their similarity to be measured using a distance metric.

Scene-centric vs. Object-centric Image-Text Cross-modal Retrieval: A Reproducibility Study

Papers

Recently Added Most Hyped Most Active Needs Verification Most Verified

Showing 201–250 of 522 papers

Title	Date	Tasks	Status
Leveraging Chemistry Foundation Models to Facilitate Structure Focused Retrieval Augmented Generation in Multi-Agent Workflows for Catalyst and Materials Design	Aug 21, 2024	Cross-Modal RetrievalInformation Retrieval	—Unverified
Cross-Modal Discrete Representation Learning	Jun 10, 2021	Cross-Modal RetrievalQuantization	—Unverified
BagFormer: Better Cross-Modal Retrieval via bag-wise interaction	Dec 29, 2022	Cross-Modal RetrievalRetrieval	—Unverified
Cross-modal Deep Metric Learning with Multi-task Regularization	Mar 21, 2017	Cross-Modal RetrievalMetric Learning	—Unverified
FaD-VLP: Fashion Vision-and-Language Pre-training towards Unified Retrieval and Captioning	Oct 26, 2022	Cross-Modal RetrievalDecoder	—Unverified
Cross-Modal Coordination Across a Diverse Set of Input Modalities	Jan 29, 2024	Cross-Modal RetrievalImage Retrieval	—Unverified
Extending Cross-Modal Retrieval with Interactive Learning to Improve Image Retrieval Performance in Forensics	Aug 28, 2023	Cross-Modal RetrievalImage Retrieval	—Unverified
Cross-modal Common Representation Learning by Hybrid Transfer Network	Jun 1, 2017	Cross-Modal RetrievalRepresentation Learning	—Unverified
All in One Framework for Multimodal Re-identification in the Wild	May 8, 2024	AllCross-Modal Retrieval	—Unverified
Fine-Grained Action Retrieval Through Multiple Parts-of-Speech Embeddings	Aug 9, 2019	Cross-Modal RetrievalPOS	—Unverified
Learning Visual-Semantic Embeddings for Reporting Abnormal Findings on Chest X-rays	Oct 6, 2020	ClusteringCross-Modal Retrieval	—Unverified
Fine-grained Prototypical Voting with Heterogeneous Mixup for Semi-supervised 2D-3D Cross-modal Retrieval	Jan 1, 2024	Cross-Modal RetrievalRetrieval	—Unverified
Exploring Optimal Transport-Based Multi-Grained Alignments for Text-Molecule Retrieval	Nov 4, 2024	Contrastive LearningCross-Modal Retrieval	—Unverified
Cross-Modal Center Loss for 3D Cross-Modal Retrieval	Jun 19, 2021	Cross-Modal RetrievalRetrieval	—Unverified
Cross-modal Center Loss	Aug 8, 2020	Cross-Modal RetrievalRetrieval	—Unverified
FLEX-CLIP: Feature-Level GEneration Network Enhanced CLIP for X-shot Cross-modal Retrieval	Nov 26, 2024	Cross-Modal RetrievalRetrieval	—Unverified
Exploiting Transformation Invariance and Equivariance for Self-supervised Sound Localisation	Jun 26, 2022	Cross-Modal RetrievalRepresentation Learning	—Unverified
FOLIAGE: Towards Physical Intelligence World Models Via Unbounded Surface Evolution	May 29, 2025	counterfactualCross-Modal Retrieval	—Unverified
Explainable and Interpretable Multimodal Large Language Models: A Comprehensive Survey	Dec 3, 2024	Cross-Modal RetrievalNatural Language Understanding	—Unverified
Everything is a Video: Unifying Modalities through Next-Frame Prediction	Nov 15, 2024	Caption GenerationCross-Modal Retrieval	—Unverified
Fusion-supervised Deep Cross-modal Hashing	Apr 25, 2019	Cross-Modal RetrievalDeep Hashing	—Unverified
Cross-Modal and Multimodal Data Analysis Based on Functional Mapping of Spectral Descriptors and Manifold Regularization	May 12, 2021	ClassificationCross-Modal Retrieval	—Unverified
Cross-Modal 3D Representation with Multi-View Images and Point Clouds	Jan 1, 2025	Autonomous DrivingCross-Modal Retrieval	—Unverified
A Unified Optimal Transport Framework for Cross-Modal Retrieval with Noisy Labels	Mar 20, 2024	Cross-Modal RetrievalRetrieval	—Unverified
Semi-Supervised Cross-Modal Retrieval with Label Prediction	Dec 4, 2018	Cross-Modal RetrievalPrediction	—Unverified
Generative Cross-Modal Retrieval: Memorizing Images in Multimodal Language Models for Retrieval and Beyond	Feb 16, 2024	Cross-Modal RetrievalRetrieval	—Unverified
Learning with Noisy Correspondence	Apr 13, 2024	Cross-Modal RetrievalCross-modal retrieval with noisy correspondence	—Unverified
Global–Local Information Soft-Alignment for Cross-Modal Remote-Sensing Image–Text Retrieval	May 14, 2024	Cross-Modal RetrievalCross-Modal Retrieval on RSITMD	—Unverified
Lightweight Contrastive Distilled Hashing for Online Cross-modal Retrieval	Feb 27, 2025	Cross-Modal RetrievalKnowledge Distillation	—Unverified
Bridging Information Asymmetry in Text-video Retrieval: A Data-centric Approach	Aug 14, 2024	Cross-Modal RetrievalLanguage Modeling	—Unverified
Maximal Matching Matters: Preventing Representation Collapse for Robust Cross-Modal Retrieval	Jun 26, 2025	Cross-Modal RetrievalImage-text Retrieval	—Unverified
Enhancing medical vision-language contrastive learning via inter-matching relation modelling	Jan 19, 2024	Contrastive LearningCross-Modal Retrieval	—Unverified
Cross-Modal Retrieval Meets Inference:Improving Zero-Shot Classification with Cross-Modal Retrieval	Aug 29, 2023	Cross-Modal Retrievalimage-classification	—Unverified
HashGAN:Attention-aware Deep Adversarial Hashing for Cross Modal Retrieval	Nov 26, 2017	Cross-Modal RetrievalRetrieval	—Unverified
Cross-Media Scientific Research Achievements Retrieval Based on Deep Language Model	Mar 29, 2022	Cross-Modal RetrievalLanguage Modeling	—Unverified
HiVLP: Hierarchical Vision-Language Pre-Training for Fast Image-Text Retrieval	May 24, 2022	Cross-Modal RetrievalImage-text Retrieval	—Unverified
Emphasizing Complementary Samples for Non-literal Cross-modal Retrieval	Jun 25, 2022	Cross-Modal RetrievalRetrieval	—Unverified
Cross-modal Retrieval with Improved Graph Convolution	Mar 7, 2023	Cross-Modal RetrievalRepresentation Learning	—Unverified
EmotionRankCLAP: Bridging Natural Language Speaking Styles and Ordinal Speech Emotion via Rank-N-Contrast	May 29, 2025	Contrastive Learningcross-modal alignment	—Unverified
Attribute-Guided Network for Cross-Modal Zero-Shot Hashing	Feb 6, 2018	AttributeCross-Modal Retrieval	—Unverified
Cross-lingual Cross-modal Pretraining for Multimodal Retrieval	Jun 1, 2021	Cross-Modal RetrievalMachine Translation	—Unverified
Attention-aware Deep Adversarial Hashing for Cross-Modal Retrieval	Sep 1, 2018	Cross-Modal RetrievalRetrieval	—Unverified
EI-CLIP: Entity-Aware Interventional Contrastive Learning for E-Commerce Cross-Modal Retrieval	Jan 1, 2022	Causal InferenceContrastive Learning	—Unverified
CoVLR: Coordinating Cross-Modal Consistency and Intra-Modal Structure for Vision-Language Retrieval	Apr 15, 2023	cross-modal alignmentCross-Modal Retrieval	—Unverified
Improved Text-Image Matching by Mitigating Visual Semantic Hubs	May 22, 2019	Cross-Modal RetrievalRetrieval	—Unverified
Learning Similarity Preserving Binary Codes for Recommender Systems	Apr 18, 2022	BinarizationCross-Modal Retrieval	—Unverified
Improving Factuality of 3D Brain MRI Report Generation with Paired Image-domain Retrieval and Text-domain Augmentation	Nov 23, 2024	Cross-Modal RetrievalImage to text	—Unverified
Cross-modal Subspace Learning for Fine-grained Sketch-based Image Retrieval	May 28, 2017	Cross-Modal RetrievalImage Retrieval	—Unverified
Efficient Discrete Supervised Hashing for Large-scale Cross-modal Retrieval	May 3, 2019	Cross-Modal RetrievalQuantization	—Unverified
Coupled CycleGAN: Unsupervised Hashing Network for Cross-Modal Retrieval	Mar 6, 2019	Cross-Modal RetrievalRetrieval	—Unverified

Show:10 25 50

← PrevPage 5 of 11Next →

All datasets COCO 2014 Flickr30k Recipe1M+RSICD RSITMD ChEBI-20 MSCOCO-1k SoundingEarth CUHK-PEDES Flickr-8k MSCOCO MS-COCO-2014

Benchmark Results

#	Model	Metric	Claimed	Verified	Status
1	MaMMUT (ours)	Image-to-text R@1	70.7	—	Unverified
2	VAST	Text-to-image R@1	68	—	Unverified
3	X2-VLM (large)	Text-to-image R@1	67.7	—	Unverified
4	BEiT-3	Text-to-image R@1	67.2	—	Unverified
5	XFM (base)	Text-to-image R@1	67	—	Unverified
6	X2-VLM (base)	Text-to-image R@1	66.2	—	Unverified
7	PTP-BLIP (14M)	Text-to-image R@1	64.9	—	Unverified
8	OmniVL (14M)	Text-to-image R@1	64.8	—	Unverified
9	VSE-Gradient	Text-to-image R@1	63.6	—	Unverified
10	X-VLM (base)	Text-to-image R@1	63.4	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	X2-VLM (large)	Image-to-text R@1	98.8	—	Unverified
2	X2-VLM (base)	Image-to-text R@1	98.5	—	Unverified
3	BEiT-3	Image-to-text R@1	98	—	Unverified
4	OmniVL (14M)	Image-to-text R@1	97.3	—	Unverified
5	Aurora (ours, r=128)	Image-to-text R@1	97.2	—	Unverified
6	ERNIE-ViL 2.0	Image-to-text R@1	97.2	—	Unverified
7	X-VLM (base)	Image-to-text R@1	97.1	—	Unverified
8	VSE-Gradient	Image-to-text R@1	97	—	Unverified
9	ALIGN	Image-to-text R@1	95.3	—	Unverified
10	VAST	Text-to-image R@1	91	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	VLPCook (R1M+)	Image-to-text R@1	74.9	—	Unverified
2	VLPCook	Image-to-text R@1	73.6	—	Unverified
3	T-Food (CLIP)	Image-to-text R@1	72.3	—	Unverified
4	T-Food	Image-to-text R@1	68.2	—	Unverified
5	X-MRS	Image-to-text R@1	64	—	Unverified
6	H-T	Image-to-text R@1	60	—	Unverified
7	SCAN	Image-to-text R@1	54	—	Unverified
8	ACME	Image-to-text R@1	51.8	—	Unverified
9	VLPCook	Image-to-text R@1	45.2	—	Unverified
10	AdaMine	Image-to-text R@1	39.8	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	HarMA (w/ GeoRSCLIP)	Mean Recall	38.95	—	Unverified
2	GeoRSCLIP-FT	Mean Recall	38.87	—	Unverified
3	GLISA	Mean Recall	37.69	—	Unverified
4	RemoteCLIP	Mean Recall	36.35	—	Unverified
5	PE-RSITR (MRS-Adapter)	Mean Recall	31.12	—	Unverified
6	PIR	Mean Recall	24.46	—	Unverified
7	DOVE	Mean Recall	22.72	—	Unverified
8	SWAN	Mean Recall	20.61	—	Unverified
9	GaLR	Mean Recall	18.96	—	Unverified
10	AMFMN	Mean Recall	15.53	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	HarMA (w/ GeoRSCLIP)	Image-to-text R@1	32.74	—	Unverified
2	GeoRSCLIP-FT	Image-to-text R@1	32.3	—	Unverified
3	GLISA	Image-to-text R@1	32.08	—	Unverified
4	RemoteCLIP	Image-to-text R@1	28.76	—	Unverified
5	PE-RSITR (MRS-Adapter)	Image-to-text R@1	23.67	—	Unverified
6	PIR	Image-to-text R@1	18.14	—	Unverified
7	DOVE	Image-to-text R@1	16.81	—	Unverified
8	GaLR	Image-to-text R@1	14.82	—	Unverified
9	SWAN	Image-to-text R@1	13.35	—	Unverified
10	AMFMN	Image-to-text R@1	10.63	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	CLASS (ORMA)	Hits@1	67.4	—	Unverified
2	ORMA	Hits@1	66.5	—	Unverified
3	Song et al.	Hits@1	56.5	—	Unverified
4	CLASS (AMAN)	Hits@1	51.1	—	Unverified
5	DSOKR	Hits@1	51	—	Unverified
6	AMAN	Hits@1	49.4	—	Unverified
7	All-Ensemble	Hits@1	34.4	—	Unverified
8	MLP1	Hits@1	22.4	—	Unverified
9	GCN2	Hits@1	22.3	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	NAPReg	Image-to-text R@1	81.9	—	Unverified
2	Dual-path CNN	Image-to-text R@1	41.2	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	ResNet-18	Median Rank	565	—	Unverified
2	GeoCLAP	Median Rank	159	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	Dual Path	Text-to-image Medr	2	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	NAPReg	Image-to-text R@1	56.2	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	3SHNet	Image-to-text R@1	85.8	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	NAPReg	Text-to-image R@1	43	—	Unverified