SOTAVerified

Zero-Shot Learning

Zero-shot learning (ZSL) is a model's ability to detect classes never seen during training. The condition is that the classes are not known during supervised learning.

Earlier work in zero-shot learning use attributes in a two-step approach to infer unknown classes. In the computer vision context, more recent advances learn mappings from image feature space to semantic space. Other approaches learn non-linear multimodal embeddings. In the modern NLP context, language models can be evaluated on downstream tasks without fine tuning.

Benchmark datasets for zero-shot learning include aPY, AwA, and CUB, among others.

( Image credit: Prototypical Networks for Few shot Learning in PyTorch )

Further readings:

Papers

Showing 101–150 of 1864 papers

TitleStatusHype
CARL-GT: Evaluating Causal Reasoning Capabilities of Large Language ModelsCode1
SenCLIP: Enhancing zero-shot land-use mapping for Sentinel-2 with ground-level promptingCode1
KNN-MMD: Cross Domain Wireless Sensing via Local Distribution AlignmentCode1
Expanding Event Modality Applications through a Robust CLIP-Based EncoderCode1
CLIP meets DINO for Tuning Zero-Shot Classifier using Unlabeled Image CollectionsCode1
TableTime: Reformulating Time Series Classification as Zero-Shot Table Understanding via Large Language ModelsCode1
CLIPer: Hierarchically Improving Spatial Representation of CLIP for Open-Vocabulary Semantic SegmentationCode1
Leveraging MLLM Embeddings and Attribute Smoothing for Compositional Zero-Shot LearningCode1
TDSM: Triplet Diffusion for Skeleton-Text Matching in Zero-Shot Action RecognitionCode1
RaVL: Discovering and Mitigating Spurious Correlations in Fine-Tuned Vision-Language ModelsCode1
Abstracted Shapes as Tokens -- A Generalizable and Interpretable Model for Time-series ClassificationCode1
Interpreting and Analysing CLIP's Zero-Shot Image Classification via Mutual KnowledgeCode1
AgriCLIP: Adapting CLIP for Agriculture and Livestock via Domain-Specialized Cross-Model AlignmentCode1
For Overall Nighttime Visibility: Integrate Irregular Glow Removal With Glow-Aware EnhancementCode1
Enhancing Agricultural Environment Perception via Active Vision and Zero-Shot LearningCode1
CrossFi: A Cross Domain Wi-Fi Sensing Framework Based on Siamese NetworkCode1
DC3DO: Diffusion Classifier for 3D ObjectsCode1
OmniCLIP: Adapting CLIP for Video Recognition with Spatial-Temporal Omni-Scale Feature LearningCode1
Leveraging Foundation Models for Zero-Shot IoT SensingCode1
Adversarial Robustification via Text-to-Image Diffusion ModelsCode1
ClinicRealm: Re-evaluating Large Language Models with Conventional Machine Learning for Non-Generative Clinical Prediction TasksCode1
InvAgent: A Large Language Model based Multi-Agent System for Inventory Management in Supply ChainsCode1
STD-PLM: Understanding Both Spatial and Temporal Properties of Spatial-Temporal Data with PLMCode1
BioTrove: A Large Curated Image Dataset Enabling AI for BiodiversityCode1
Part-aware Unified Representation of Language and Skeleton for Zero-shot Action RecognitionCode1
BIOSCAN-5M: A Multimodal Dataset for Insect BiodiversityCode1
Fairer Preferences Elicit Improved Human-Aligned Large Language Model JudgmentsCode1
Exploring the Spectrum of Visio-Linguistic Compositionality and RecognitionCode1
CPLIP: Zero-Shot Learning for Histopathology with Comprehensive Vision-Language AlignmentCode1
CountCLIP -- [Re] Teaching CLIP to Count to TenCode1
CLIBD: Bridging Vision and Genomics for Biodiversity Monitoring at ScaleCode1
Implicit In-context LearningCode1
Differentiable Model Scaling using Differentiable TopkCode1
MedConceptsQA: Open Source Medical Concepts QA BenchmarkCode1
Pseudo-Prompt Generating in Pre-trained Vision-Language Models for Multi-Label Medical Image ClassificationCode1
CLIPArTT: Adaptation of CLIP to New Domains at Test TimeCode1
Modeling Caption Diversity in Contrastive Vision-Language PretrainingCode1
AAPL: Adding Attributes to Prompt Learning for Vision-Language ModelsCode1
OpenDlign: Open-World Point Cloud Understanding with Depth-Aligned ImagesCode1
The Devil is in the Few Shots: Iterative Visual Knowledge Completion for Few-shot LearningCode1
Knowledge-enhanced Visual-Language Pretraining for Computational PathologyCode1
Progressive Semantic-Guided Vision Transformer for Zero-Shot LearningCode1
Audio-Visual Generalized Zero-Shot Learning using Pre-Trained Large Multi-Modal ModelsCode1
Label Propagation for Zero-shot Classification with Vision-Language ModelsCode1
X-MIC: Cross-Modal Instance Conditioning for Egocentric Action GeneralizationCode1
VLM-CPL: Consensus Pseudo Labels from Vision-Language Models for Human Annotation-Free Pathological Image ClassificationCode1
Just Shift It: Test-Time Prototype Shifting for Zero-Shot Generalization with Vision-Language ModelsCode1
CLIP-VIS: Adapting CLIP for Open-Vocabulary Video Instance SegmentationCode1
Eye-gaze Guided Multi-modal Alignment for Medical Representation LearningCode1
Meta-Prompting for Automating Zero-shot Visual Recognition with LLMsCode1
Show:102550
← PrevPage 3 of 38Next →

Benchmark Results

#ModelMetricClaimedVerifiedStatus
1ZeroDiffaverage top-1 classification accuracy87.5—Unverified
2DUETaverage top-1 classification accuracy72.3—Unverified
3Composeraverage top-1 classification accuracy69.4—Unverified
4HDC-ZSC-MLPaverage top-1 classification accuracy65.6—Unverified
5ZSL_TF-VAEGANaverage top-1 classification accuracy64.9—Unverified
6ZLaPAccuracy64.3—Unverified
7ZLaP*Accuracy64.2—Unverified
8HDC-ZSCaverage top-1 classification accuracy63.8—Unverified
9SPOTaverage top-1 classification accuracy62.9—Unverified
10f-VAEGAN-D2average top-1 classification accuracy61—Unverified
#ModelMetricClaimedVerifiedStatus
1dmis-lab/biobert-v1.1Accuracy26.15—Unverified
2meta-llama/Meta-Llama-3-8B-InstructAccuracy25.84—Unverified
3epfl-llm/meditron-7bAccuracy25.75—Unverified
4dmis-lab/meerkat-7b-v1.0Accuracy25.68—Unverified
5meta-llama/Meta-Llama-3-8B-InstructAccuracy25.65—Unverified
6HuggingFaceH4/zephyr-7b-betaAccuracy25.54—Unverified
7dmis-lab/biobert-v1.1Accuracy25.46—Unverified
8epfl-llm/meditron-70bAccuracy25.36—Unverified
9epfl-llm/meditron-70bAccuracy25.26—Unverified
10HuggingFaceH4/zephyr-7b-betaAccuracy25.06—Unverified
#ModelMetricClaimedVerifiedStatus
1ZeroDiffaverage top-1 classification accuracy77.3—Unverified
2SPOT (VAEGAN)average top-1 classification accuracy66.04—Unverified
3ZSL_TF-VAEGANaverage top-1 classification accuracy66—Unverified
4f-VAEGANaverage top-1 classification accuracy64.7—Unverified
5DUET (Ours)average top-1 classification accuracy64.4—Unverified
6LisGANaverage top-1 classification accuracy61.7—Unverified
7TCNaverage top-1 classification accuracy61.5—Unverified
8f-CLSWGANaverage top-1 classification accuracy60.8—Unverified
9Cycle-WGANaverage top-1 classification accuracy59.9—Unverified
#ModelMetricClaimedVerifiedStatus
1ZeroDiffaverage top-1 classification accuracy86.4—Unverified
2ZSL-KGaverage top-1 classification accuracy78.08—Unverified
3ZSL_TF-VAEGANaverage top-1 classification accuracy72.2—Unverified
4DUET (Ours)average top-1 classification accuracy69.9—Unverified
#ModelMetricClaimedVerifiedStatus
1ZLaPAccuracy84—Unverified
2ZLaP*Accuracy83.1—Unverified
#ModelMetricClaimedVerifiedStatus
1ZLaP*Accuracy93.6—Unverified
2ZLaPAccuracy93.4—Unverified
#ModelMetricClaimedVerifiedStatus
1ZLaP*Accuracy74.2—Unverified
2ZLaPAccuracy74—Unverified
#ModelMetricClaimedVerifiedStatus
1ViT-B/16Average mAP60.17—Unverified
2ResNet-50Average mAP56.19—Unverified
#ModelMetricClaimedVerifiedStatus
1ZLaPAccuracy51.2—Unverified
2ZLaP*Accuracy51—Unverified
#ModelMetricClaimedVerifiedStatus
1ZLaPAccuracy29.1—Unverified
2ZLaP*Accuracy29—Unverified
#ModelMetricClaimedVerifiedStatus
1ZLaPAccuracy75.9—Unverified
2ZLaP*Accuracy75.5—Unverified
#ModelMetricClaimedVerifiedStatus
1ZLaP*Accuracy87.9—Unverified
2ZLaPAccuracy87.8—Unverified
#ModelMetricClaimedVerifiedStatus
1ZLaPTop 1 Accuracy72.1—Unverified
2ZLaP*Top 1 Accuracy72.1—Unverified
#ModelMetricClaimedVerifiedStatus
1HiTeAAccuracy21.7—Unverified
2HiTeAAccuracy0.46—Unverified
#ModelMetricClaimedVerifiedStatus
1HiTeAAccuracy37.4—Unverified
2HiTeAAccuracy0.56—Unverified
#ModelMetricClaimedVerifiedStatus
1SPOTaverage top-1 classification accuracy71.9—Unverified
2ZSL_TF-VAEGANaverage top-1 classification accuracy70.8—Unverified
#ModelMetricClaimedVerifiedStatus
1ZLaPAccuracy90—Unverified
2ZLaP*Accuracy89—Unverified
#ModelMetricClaimedVerifiedStatus
1ZLaP*Accuracy71.8—Unverified
2ZLaPAccuracy71.2—Unverified
#ModelMetricClaimedVerifiedStatus
1ZLaP*Accuracy71.4—Unverified
2ZLaPAccuracy71—Unverified
#ModelMetricClaimedVerifiedStatus
1ZLaP*Accuracy76.3—Unverified
2ZLaPAccuracy76.3—Unverified
#ModelMetricClaimedVerifiedStatus
1CLIP(ViT-B/16)Average mAP85.77—Unverified
2CLIP(ResNet-50)Average mAP84.3—Unverified
#ModelMetricClaimedVerifiedStatus
1ZSL-KGTop-160.54—Unverified
#ModelMetricClaimedVerifiedStatus
1zsl_ADAAverage Per-Class Accuracy70.9—Unverified
#ModelMetricClaimedVerifiedStatus
1ZLaP*Accuracy63.2—Unverified
#ModelMetricClaimedVerifiedStatus
1MSDAPearson correlation coefficient (PCC)0.52—Unverified
#ModelMetricClaimedVerifiedStatus
1SeViLAAccuracy72.3—Unverified
#ModelMetricClaimedVerifiedStatus
1M^2-EncoderAccuracy80.7—Unverified
#ModelMetricClaimedVerifiedStatus
1FrozenBiLMAccuracy51.5—Unverified
#ModelMetricClaimedVerifiedStatus
1CZSLA-acc36—Unverified
#ModelMetricClaimedVerifiedStatus
1ZS3Netk=10 mIOU26.3—Unverified
#ModelMetricClaimedVerifiedStatus
1ZSL-KGAccuracy88.98—Unverified
#ModelMetricClaimedVerifiedStatus
1VideoChat2Accuracy40.6—Unverified