SOTAVerified

Video-Text Retrieval

Video-Text retrieval requires understanding of both video and language together. Therefore it's different to video retrieval task.

Papers

Showing 51–100 of 111 papers

TitleStatusHype
Reversed in Time: A Novel Temporal-Emphasized Benchmark for Cross-Modal Video-Text RetrievalCode0
CAREL: Instruction-guided reinforcement learning with cross-modal auxiliary objectivesCode0
Diving Deep into the Motion Representation of Video-Text ModelsCode0
Expertized Caption Auto-Enhancement for Video-Text RetrievalCode0
Learning Joint Embedding with Multimodal Cues for Cross-Modal Video-Text RetrievalCode0
Rudder: A Cross Lingual Video and Text Retrieval DatasetCode0
TaCA: Upgrading Your Visual Foundation Model with Task-agnostic Compatible AdapterCode0
Video-Text Retrieval by Supervised Sparse Multi-Grained LearningCode0
Multi-Scale Temporal Difference Transformer for Video-Text Retrieval—0
NAVERO: Unlocking Fine-Grained Semantics for Video-Language Compositionality—0
OmniVL:One Foundation Model for Image-Language and Video-Language Tasks—0
LV-MAE: Learning Long Video Representations through Masked-Embedding Autoencoders—0
Leveraging Generative Language Models for Weakly Supervised Sentence Component Analysis in Video-Language Joint Learning—0
Learning with Noisy Correspondence—0
Learning Context-Adapted Video-Text Retrieval by Attending to User Comments—0
Rethinking Noisy Video-Text Retrieval via Relation-aware Alignment—0
RETTA: Retrieval-Enhanced Test-Time Adaptation for Zero-Shot Video Captioning—0
Retrieving and Highlighting Action with Spatiotemporal Reference—0
Learning Audio-guided Video Representation with Gated Attention for Video-Text Retrieval—0
LaT: Latent Translation with Cycle-Consistency for Video-Text Retrieval—0
HiVLP: Hierarchical Interactive Video-Language Pre-Training—0
Beyond Coarse-Grained Matching in Video-Text Retrieval—0
HiT: Hierarchical Transformer with Momentum Contrast for Video-Text Retrieval—0
Stacked Convolutional Deep Encoding Network for Video-Text Retrieval—0
HENASY: Learning to Assemble Scene-Entities for Egocentric Video-Language Model—0
Synopses of Movie Narratives: a Video-Language Dataset for Story Understanding—0
Synopses of Movie Narratives: a Video-Language Dataset for Story Understanding—0
An Empirical Study of Excitation and Aggregation Design Adaptions in CLIP4Clip for Video-Text Retrieval—0
Tagging before Alignment: Integrating Multi-Modal Tags for Video-Text Retrieval—0
HaVTR: Improving Video-Text Retrieval Through Augmentation Using Large Foundation Models—0
Harvest Video Foundation Models via Efficient Post-Pretraining—0
Generalizing Multimodal Pre-training into Multilingual via Language Acquisition—0
Text-Adaptive Multiple Visual Prototype Matching for Video-Text Retrieval—0
CaReBench: A Fine-Grained Benchmark for Video Captioning and Retrieval—0
TokenFlow: Rethinking Fine-grained Cross-modal Alignment in Vision-Language Retrieval—0
Towards Understanding Camera Motions in Any Video—0
Uncertainty-Aware Alignment Network for Cross-Domain Video-Text Retrieval—0
Uncertainty-Aware Alignment Network for Cross-Domain Video-Text Retrieval—0
Uncertainty-aware sign language video retrieval with probability distribution modeling—0
Exploiting Visual Semantic Reasoning for Video-Text Retrieval—0
EA-VTR: Event-Aware Video-Text Retrieval—0
Unified Loss of Pair Similarity Optimization for Vision-Language Retrieval—0
Unifying Latent and Lexicon Representations for Effective Video-Text Retrieval—0
Dual Alignment Unsupervised Domain Adaptation for Video-Text Retrieval—0
Deep Semantic Multimodal Hashing Network for Scalable Image-Text and Video-Text Retrievals—0
V^2Dial: Unification of Video and Visual Dialog via Multimodal Experts—0
V^2Dial: Unification of Video and Visual Dialog via Multimodal Experts—0
Video Editing for Video Retrieval—0
Deep Learning for Video-Text Retrieval: a Review—0
CrossCLR: Cross-modal Contrastive Learning For Multi-modal Video Representations—0
Show:102550
← PrevPage 2 of 3Next →

No leaderboard results yet.