SOTAVerified

Video Retrieval

The objective of video retrieval is as follows: given a text query and a pool of candidate videos, select the video which corresponds to the text query. Typically, the videos are returned as a ranked list of candidates and scored via document retrieval metrics.

Papers

Showing 226–250 of 486 papers

TitleStatusHype
Efficient video indexing for monitoring disease activity and progression in the upper gastrointestinal tract—0
Ego-Surfing: Person Localization in First-Person Videos Using Ego-Motion Signatures—0
Empowering Agentic Video Analytics Systems with Video Language Models—0
Encode the Unseen: Predictive Video Hashing for Scalable Mid-Stream Retrieval—0
End-to-end Concept Word Detection for Video Captioning, Retrieval, and Question Answering—0
End-to-end Generative Pretraining for Multimodal Video Captioning—0
Enhanced Multimodal Representation Learning with Cross-modal KD—0
Enhancing Interactive Image Retrieval With Query Rewriting Using Large Language Models and Vision Language Models—0
Event-aware Video Corpus Moment Retrieval—0
Event Extraction in Video Transcripts—0
E-ViLM: Efficient Video-Language Model via Masked Video Modeling with Semantic Vector-Quantized Tokenizer—0
ExpertAF: Expert Actionable Feedback from Video—0
Exploiting Visual Semantic Reasoning for Video-Text Retrieval—0
Exploring Relations in Untrimmed Videos for Self-Supervised Learning—0
Face Video Retrieval With Image Query via Hashing Across Euclidean Space and Riemannian Manifold—0
Fighting FIRe with FIRE: Assessing the Validity of Text-to-Video Retrieval Benchmarks—0
Find and Focus: Retrieve and Localize Video Events with Natural Language Queries—0
Fine-Grained Action Retrieval Through Multiple Parts-of-Speech Embeddings—0
Fine-Grained Instance-Level Sketch-Based Video Retrieval—0
Fine-grained Text-Video Retrieval with Frozen Image Encoders—0
CaReBench: A Fine-Grained Benchmark for Video Captioning and Retrieval—0
FMM-X3D: FPGA-based modeling and mapping of X3D for Human Action Recognition—0
fpgaHART: A toolflow for throughput-oriented acceleration of 3D CNNs for HAR onto FPGAs—0
Free-Form Multi-Modal Multimedia Retrieval (4MR)—0
Generalizable Multi-linear Attention Network—0
Show:102550
← PrevPage 10 of 20Next →

Benchmark Results

#ModelMetricClaimedVerifiedStatus
1OmniVectext-to-video R@1089.4—Unverified
2CLIP4Cliptext-to-video R@1081.6—Unverified
3OmniVec (pretrained)text-to-video R@1078.6—Unverified
4HunYuan_tvr (huge)text-to-video R@162.9—Unverified
5CLIP-ViPtext-to-video R@157.7—Unverified
6PIDRotext-to-video R@155.9—Unverified
7DMAE (ViT-B/16)text-to-video R@155.5—Unverified
8HunYuan_tvrtext-to-video R@155—Unverified
9MuLTItext-to-video R@154.7—Unverified
10EERCFtext-to-video R@154.1—Unverified
#ModelMetricClaimedVerifiedStatus
1Aurora (ours, r=64)text-to-video R@577.4—Unverified
2InternVideo2-6Btext-to-video R@174.2—Unverified
3vid-TLDR (UMT-L)text-to-video R@172.3—Unverified
4VASTtext-to-video R@172—Unverified
5COSAtext-to-video R@170.5—Unverified
6UMT-L (ViT-L/16)text-to-video R@170.4—Unverified
7GRAMtext-to-video R@167.3—Unverified
8VALORtext-to-video R@161.5—Unverified
9TESTA (ViT-B/16)text-to-video R@161.2—Unverified
10VindLUtext-to-video R@161.2—Unverified
#ModelMetricClaimedVerifiedStatus
1GRAMtext-to-video R@164—Unverified
2VASTtext-to-video R@163.9—Unverified
3InternVideo2-6Btext-to-video R@162.8—Unverified
4VALORtext-to-video R@159.9—Unverified
5UMT-L (ViT-L/16)text-to-video R@158.8—Unverified
6vid-TLDR (UMT-L)text-to-video R@158.1—Unverified
7COSAtext-to-video R@157.9—Unverified
8InternVideo2-6Btext-to-video R@155.9—Unverified
9InternVideotext-to-video R@155.2—Unverified
10VLABtext-to-video R@155.1—Unverified
#ModelMetricClaimedVerifiedStatus
1EMCL-Net (Ours)++ LSMDC Rohrbach et al. (2015)text-to-video R@1053.7—Unverified
2InternVideo2-6Btext-to-video R@146.4—Unverified
3vid-TLDR (UMT-L)text-to-video R@143.1—Unverified
4UMT-L (ViT-L/16)text-to-video R@143—Unverified
5HunYuan_tvr (huge)text-to-video R@140.4—Unverified
6COSAtext-to-video R@139.4—Unverified
7mPLUG-2text-to-video R@134.4—Unverified
8VALORtext-to-video R@134.2—Unverified
9InternVideotext-to-video R@134—Unverified
10InternVideo2-6Btext-to-video R@133.8—Unverified