SOTAVerified

Video Retrieval

The objective of video retrieval is as follows: given a text query and a pool of candidate videos, select the video which corresponds to the text query. Typically, the videos are returned as a ranked list of candidates and scored via document retrieval metrics.

Papers

Showing 201–250 of 486 papers

TitleStatusHype
Clarification of Video Retrieval Query Results by the Automated Insertion of Supporting Shots—0
Classroom Video Assessment and Retrieval via Multiple Instance Learning—0
CLIP2TV: Align, Match and Distill for Video-Text Retrieval—0
CLOP: Video-and-Language Pre-Training with Knowledge Regularizations—0
CMAWRNet: Multiple Adverse Weather Removal via a Unified Quaternion Neural Architecture—0
CNN Retrieval based Unsupervised Metric Learning for Near-Duplicated Video Retrieval—0
Coarse to Fine: Video Retrieval before Moment Localization—0
CoAVT: A Cognition-Inspired Unified Audio-Visual-Text Pre-Training Model for Multimodal Processing—0
Colo-SCRL: Self-Supervised Contrastive Representation Learning for Colonoscopic Video Retrieval—0
Contrastive Video-Language Learning with Fine-grained Frame Sampling—0
Controllable Augmentations for Video Representation Learning—0
COTS: Collaborative Two-Stream Vision-Language Pre-Training Model for Cross-Modal Retrieval—0
CREATE: A Benchmark for Chinese Short Video Retrieval and Title Generation—0
CREATE: A Benchmark for Chinese Short Video Retrieval and Title Generation—0
CUPID: Adaptive Curation of Pre-training Data for Video-and-Language Representation Learning—0
Deep Heterogeneous Hashing for Face Video Retrieval—0
Deep Learning Based Semantic Video Indexing and Retrieval—0
De-Hashing: Server-Side Context-Aware Feature Reconstruction for Mobile Visual Search—0
Detours for Navigating Instructional Videos—0
Discrete Wavelet Transform and Gradient Difference based approach for text localization in videos—0
Distilling Vision-Language Models on Millions of Videos—0
Domain Adaptation in Multi-View Embedding for Cross-Modal Video Retrieval—0
Dual-Stream Knowledge-Preserving Hashing for Unsupervised Video Retrieval—0
EA-VTR: Event-Aware Video-Text Retrieval—0
Efficient Action Detection in Untrimmed Videos via Multi-Task Learning—0
Efficient video indexing for monitoring disease activity and progression in the upper gastrointestinal tract—0
Ego-Surfing: Person Localization in First-Person Videos Using Ego-Motion Signatures—0
Empowering Agentic Video Analytics Systems with Video Language Models—0
Encode the Unseen: Predictive Video Hashing for Scalable Mid-Stream Retrieval—0
End-to-end Concept Word Detection for Video Captioning, Retrieval, and Question Answering—0
End-to-end Generative Pretraining for Multimodal Video Captioning—0
Enhanced Multimodal Representation Learning with Cross-modal KD—0
Enhancing Interactive Image Retrieval With Query Rewriting Using Large Language Models and Vision Language Models—0
Event-aware Video Corpus Moment Retrieval—0
Event Extraction in Video Transcripts—0
E-ViLM: Efficient Video-Language Model via Masked Video Modeling with Semantic Vector-Quantized Tokenizer—0
ExpertAF: Expert Actionable Feedback from Video—0
Exploiting Visual Semantic Reasoning for Video-Text Retrieval—0
Exploring Relations in Untrimmed Videos for Self-Supervised Learning—0
Face Video Retrieval With Image Query via Hashing Across Euclidean Space and Riemannian Manifold—0
Fighting FIRe with FIRE: Assessing the Validity of Text-to-Video Retrieval Benchmarks—0
Find and Focus: Retrieve and Localize Video Events with Natural Language Queries—0
Fine-Grained Action Retrieval Through Multiple Parts-of-Speech Embeddings—0
Fine-Grained Instance-Level Sketch-Based Video Retrieval—0
Fine-grained Text-Video Retrieval with Frozen Image Encoders—0
CaReBench: A Fine-Grained Benchmark for Video Captioning and Retrieval—0
FMM-X3D: FPGA-based modeling and mapping of X3D for Human Action Recognition—0
fpgaHART: A toolflow for throughput-oriented acceleration of 3D CNNs for HAR onto FPGAs—0
Free-Form Multi-Modal Multimedia Retrieval (4MR)—0
Generalizable Multi-linear Attention Network—0
Show:102550
← PrevPage 5 of 10Next →

Benchmark Results

#ModelMetricClaimedVerifiedStatus
1OmniVectext-to-video R@1089.4—Unverified
2CLIP4Cliptext-to-video R@1081.6—Unverified
3OmniVec (pretrained)text-to-video R@1078.6—Unverified
4HunYuan_tvr (huge)text-to-video R@162.9—Unverified
5CLIP-ViPtext-to-video R@157.7—Unverified
6PIDRotext-to-video R@155.9—Unverified
7DMAE (ViT-B/16)text-to-video R@155.5—Unverified
8HunYuan_tvrtext-to-video R@155—Unverified
9MuLTItext-to-video R@154.7—Unverified
10EERCFtext-to-video R@154.1—Unverified
#ModelMetricClaimedVerifiedStatus
1Aurora (ours, r=64)text-to-video R@577.4—Unverified
2InternVideo2-6Btext-to-video R@174.2—Unverified
3vid-TLDR (UMT-L)text-to-video R@172.3—Unverified
4VASTtext-to-video R@172—Unverified
5COSAtext-to-video R@170.5—Unverified
6UMT-L (ViT-L/16)text-to-video R@170.4—Unverified
7GRAMtext-to-video R@167.3—Unverified
8VALORtext-to-video R@161.5—Unverified
9TESTA (ViT-B/16)text-to-video R@161.2—Unverified
10VindLUtext-to-video R@161.2—Unverified
#ModelMetricClaimedVerifiedStatus
1GRAMtext-to-video R@164—Unverified
2VASTtext-to-video R@163.9—Unverified
3InternVideo2-6Btext-to-video R@162.8—Unverified
4VALORtext-to-video R@159.9—Unverified
5UMT-L (ViT-L/16)text-to-video R@158.8—Unverified
6vid-TLDR (UMT-L)text-to-video R@158.1—Unverified
7COSAtext-to-video R@157.9—Unverified
8InternVideo2-6Btext-to-video R@155.9—Unverified
9InternVideotext-to-video R@155.2—Unverified
10VLABtext-to-video R@155.1—Unverified
#ModelMetricClaimedVerifiedStatus
1EMCL-Net (Ours)++ LSMDC Rohrbach et al. (2015)text-to-video R@1053.7—Unverified
2InternVideo2-6Btext-to-video R@146.4—Unverified
3vid-TLDR (UMT-L)text-to-video R@143.1—Unverified
4UMT-L (ViT-L/16)text-to-video R@143—Unverified
5HunYuan_tvr (huge)text-to-video R@140.4—Unverified
6COSAtext-to-video R@139.4—Unverified
7mPLUG-2text-to-video R@134.4—Unverified
8VALORtext-to-video R@134.2—Unverified
9InternVideotext-to-video R@134—Unverified
10InternVideo2-6Btext-to-video R@133.8—Unverified