SOTAVerified

Video-Text Retrieval

Video-Text retrieval requires understanding of both video and language together. Therefore it's different to video retrieval task.

Papers

Showing 101–111 of 111 papers

TitleStatusHype
Videoprompter: an ensemble of foundational models for zero-shot video understanding—0
CLIP2TV: Align, Match and Distill for Video-Text Retrieval—0
Alternating Gradient Descent and Mixture-of-Experts for Integrated Multimodal Perception—0
CiCo: Domain-Aware Sign Language Retrieval via Cross-Lingual Contrastive Learning—0
ViLEM: Visual-Language Error Modeling for Image-Text Retrieval—0
ViSeRet: A simple yet effective approach to moment retrieval via fine-grained video segmentation—0
Boosting Video-Text Retrieval with Explicit High-Level Semantics—0
VLAB: Enhancing Video Language Pre-training by Feature Adapting and Blending—0
Memory Enhanced Embedding Learning for Cross-Modal Video-Text Retrieval—0
Mask to reconstruct: Cooperative Semantics Completion for Video-text Retrieval—0
Masked Contrastive Pre-Training for Efficient Video-Text Retrieval—0
Show:102550
← PrevPage 3 of 3Next →

No leaderboard results yet.