SOTAVerified

Zero-Shot Learning

Zero-shot learning (ZSL) is a model's ability to detect classes never seen during training. The condition is that the classes are not known during supervised learning.

Earlier work in zero-shot learning use attributes in a two-step approach to infer unknown classes. In the computer vision context, more recent advances learn mappings from image feature space to semantic space. Other approaches learn non-linear multimodal embeddings. In the modern NLP context, language models can be evaluated on downstream tasks without fine tuning.

Benchmark datasets for zero-shot learning include aPY, AwA, and CUB, among others.

( Image credit: Prototypical Networks for Few shot Learning in PyTorch )

Further readings:

Papers

Showing 1–50 of 1864 papers

TitleStatusHype
GLAD: Generalizable Tuning for Vision-Language Models—0
DEARLi: Decoupled Enhancement of Recognition and Localization for Semi-supervised Panoptic SegmentationCode0
Zero-Shot Learning for Obsolescence Risk Forecasting—0
EVA: Mixture-of-Experts Semantic Variant Alignment for Compositional Zero-Shot Learning—0
SEZ-HARN: Self-Explainable Zero-shot Human Activity Recognition NetworkCode0
A Multi-Scale Spatial Attention-Based Zero-Shot Learning Framework for Low-Light Image Enhancement—0
AnyTraverse: An off-road traversability framework with VLM and human operator in the loop—0
Generalizable Agent Modeling for Agent Collaboration-Competition Adaptation with Multi-Retrieval and Dynamic GenerationCode0
OTFusion: Bridging Vision-only and Vision-Language Models via Optimal Transport for Transductive Zero-Shot Learning—0
Comparison of ConvNeXt and Vision-Language Models for Breast Density Assessment in Screening Mammography—0
An Interdisciplinary Review of Commonsense Reasoning and Intent Detection—0
Harmonizing and Merging Source Models for CLIP-based Domain Generalization—0
Low-Rank Augmented Implicit Neural Representation for Unsupervised High-Dimensional Quantitative MRI Reconstruction—0
Efficient Medical Vision-Language Alignment Through Adapting Masked Vision ModelsCode1
Hyperbolic Dual Feature Augmentation for Open-Environment—0
CXR-LT 2024: A MICCAI challenge on long-tailed, multi-label, and zero-shot disease classification from chest X-ray—0
MegaHan97K: A Large-Scale Dataset for Mega-Category Chinese Character Recognition with over 97K CategoriesCode2
Large Language Models for EEG: A Comprehensive Survey and Taxonomy—0
A Brain Graph Foundation Model: Pre-Training and Prompt-Tuning for Any Atlas and DisorderCode1
GeoVision Labeler: Zero-Shot Geospatial Classification with Vision and Language ModelsCode2
Multi-Timescale Motion-Decoupled Spiking Transformer for Audio-Visual Zero-Shot Learning—0
Distill CLIP (DCLIP): Enhancing Image-Text Retrieval via Cross-Modal Transformer Distillation—0
AmorLIP: Efficient Language-Image Pretraining via AmortizationCode0
Scaling Up Biomedical Vision-Language Models: Fine-Tuning, Instruction Tuning, and Multi-Modal LearningCode4
Monocular Marker-free Patient-to-Image Intraoperative Registration for Cochlear Implant Surgery—0
Zero-Shot Anomaly Detection in Battery Thermal Images Using Visual Question Answering with Prior Knowledge—0
Beginning with You: Perceptual-Initialization Improves Vision-Language Representation and Alignment—0
From Local Details to Global Context: Advancing Vision-Language Models with Attention-Based SelectionCode1
Uniformity First: Uniformity-aware Test-time Adaptation of Vision-language Models against Image CorruptionCode0
StarFT: Robust Fine-tuning of Zero-shot Models via Spuriosity AlignmentCode0
GenZSL: Generative Zero-Shot Learning Via Inductive Variational AutoencoderCode0
CrypticBio: A Large Multimodal Dataset for Visually Confusing BiodiversityCode0
Feasibility with Language Models for Open-World Compositional Zero-Shot Learning—0
SurgPose: Generalisable Surgical Instrument Pose Estimation using Zero-Shot Learning and Stereo Vision—0
Patho-R1: A Multimodal Reinforcement Learning-Based Pathology Expert ReasonerCode2
ZEUS: Zero-shot Embeddings for Unsupervised Separation of Tabular DataCode0
MSCI: Addressing CLIP's Inherent Limitations for Compositional Zero-Shot LearningCode1
Advanced Crash Causation Analysis for Freeway Safety: A Large Language Model Approach to Identifying Key Contributing Factors—0
Human-like Cognitive Generalization for Large Models via Brain-in-the-loop Supervision—0
Beyond CLIP Generalization: Against Forward&Backward Forgetting Adapter for Continual Learning of Vision-Language Models—0
TACOS: Temporally-aligned Audio CaptiOnS for Language-Audio Pretraining—0
Implementing Long Text Style Transfer with LLMs through Dual-Layered Sentence and Paragraph Structure Extraction and Mapping—0
Image Classification Using a Diffusion Model as a Pre-Training Model—0
MM-Skin: Enhancing Dermatology Vision-Language Model with an Image-Text Dataset Derived from TextbooksCode1
scDrugMap: Benchmarking Large Foundation Models for Drug Response PredictionCode1
The Pitfalls of Growing Group Complexity: LLMs and Social Choice-Based Aggregation for Group Recommendations—0
FG-CLIP: Fine-Grained Visual and Textual AlignmentCode4
Exploring Zero-Shot App Review Classification with ChatGPT: Challenges and Potential—0
Interpretable Zero-shot Learning with Infinite Class Concepts—0
CXR-AD: Component X-ray Image Dataset for Industrial Anomaly Detection—0
Show:102550
← PrevPage 1 of 38Next →

Benchmark Results

#ModelMetricClaimedVerifiedStatus
1ZeroDiffaverage top-1 classification accuracy87.5—Unverified
2DUETaverage top-1 classification accuracy72.3—Unverified
3Composeraverage top-1 classification accuracy69.4—Unverified
4HDC-ZSC-MLPaverage top-1 classification accuracy65.6—Unverified
5ZSL_TF-VAEGANaverage top-1 classification accuracy64.9—Unverified
6ZLaPAccuracy64.3—Unverified
7ZLaP*Accuracy64.2—Unverified
8HDC-ZSCaverage top-1 classification accuracy63.8—Unverified
9SPOTaverage top-1 classification accuracy62.9—Unverified
10f-VAEGAN-D2average top-1 classification accuracy61—Unverified
#ModelMetricClaimedVerifiedStatus
1dmis-lab/biobert-v1.1Accuracy26.15—Unverified
2meta-llama/Meta-Llama-3-8B-InstructAccuracy25.84—Unverified
3epfl-llm/meditron-7bAccuracy25.75—Unverified
4dmis-lab/meerkat-7b-v1.0Accuracy25.68—Unverified
5meta-llama/Meta-Llama-3-8B-InstructAccuracy25.65—Unverified
6HuggingFaceH4/zephyr-7b-betaAccuracy25.54—Unverified
7dmis-lab/biobert-v1.1Accuracy25.46—Unverified
8epfl-llm/meditron-70bAccuracy25.36—Unverified
9epfl-llm/meditron-70bAccuracy25.26—Unverified
10HuggingFaceH4/zephyr-7b-betaAccuracy25.06—Unverified
#ModelMetricClaimedVerifiedStatus
1ZeroDiffaverage top-1 classification accuracy77.3—Unverified
2SPOT (VAEGAN)average top-1 classification accuracy66.04—Unverified
3ZSL_TF-VAEGANaverage top-1 classification accuracy66—Unverified
4f-VAEGANaverage top-1 classification accuracy64.7—Unverified
5DUET (Ours)average top-1 classification accuracy64.4—Unverified
6LisGANaverage top-1 classification accuracy61.7—Unverified
7TCNaverage top-1 classification accuracy61.5—Unverified
8f-CLSWGANaverage top-1 classification accuracy60.8—Unverified
9Cycle-WGANaverage top-1 classification accuracy59.9—Unverified
#ModelMetricClaimedVerifiedStatus
1ZeroDiffaverage top-1 classification accuracy86.4—Unverified
2ZSL-KGaverage top-1 classification accuracy78.08—Unverified
3ZSL_TF-VAEGANaverage top-1 classification accuracy72.2—Unverified
4DUET (Ours)average top-1 classification accuracy69.9—Unverified
#ModelMetricClaimedVerifiedStatus
1ZLaPAccuracy84—Unverified
2ZLaP*Accuracy83.1—Unverified
#ModelMetricClaimedVerifiedStatus
1ZLaP*Accuracy93.6—Unverified
2ZLaPAccuracy93.4—Unverified
#ModelMetricClaimedVerifiedStatus
1ZLaP*Accuracy74.2—Unverified
2ZLaPAccuracy74—Unverified
#ModelMetricClaimedVerifiedStatus
1ViT-B/16Average mAP60.17—Unverified
2ResNet-50Average mAP56.19—Unverified
#ModelMetricClaimedVerifiedStatus
1ZLaPAccuracy51.2—Unverified
2ZLaP*Accuracy51—Unverified
#ModelMetricClaimedVerifiedStatus
1ZLaPAccuracy29.1—Unverified
2ZLaP*Accuracy29—Unverified
#ModelMetricClaimedVerifiedStatus
1ZLaPAccuracy75.9—Unverified
2ZLaP*Accuracy75.5—Unverified
#ModelMetricClaimedVerifiedStatus
1ZLaP*Accuracy87.9—Unverified
2ZLaPAccuracy87.8—Unverified
#ModelMetricClaimedVerifiedStatus
1ZLaPTop 1 Accuracy72.1—Unverified
2ZLaP*Top 1 Accuracy72.1—Unverified
#ModelMetricClaimedVerifiedStatus
1HiTeAAccuracy21.7—Unverified
2HiTeAAccuracy0.46—Unverified
#ModelMetricClaimedVerifiedStatus
1HiTeAAccuracy37.4—Unverified
2HiTeAAccuracy0.56—Unverified
#ModelMetricClaimedVerifiedStatus
1SPOTaverage top-1 classification accuracy71.9—Unverified
2ZSL_TF-VAEGANaverage top-1 classification accuracy70.8—Unverified
#ModelMetricClaimedVerifiedStatus
1ZLaPAccuracy90—Unverified
2ZLaP*Accuracy89—Unverified
#ModelMetricClaimedVerifiedStatus
1ZLaP*Accuracy71.8—Unverified
2ZLaPAccuracy71.2—Unverified
#ModelMetricClaimedVerifiedStatus
1ZLaP*Accuracy71.4—Unverified
2ZLaPAccuracy71—Unverified
#ModelMetricClaimedVerifiedStatus
1ZLaP*Accuracy76.3—Unverified
2ZLaPAccuracy76.3—Unverified
#ModelMetricClaimedVerifiedStatus
1CLIP(ViT-B/16)Average mAP85.77—Unverified
2CLIP(ResNet-50)Average mAP84.3—Unverified
#ModelMetricClaimedVerifiedStatus
1ZSL-KGTop-160.54—Unverified
#ModelMetricClaimedVerifiedStatus
1zsl_ADAAverage Per-Class Accuracy70.9—Unverified
#ModelMetricClaimedVerifiedStatus
1ZLaP*Accuracy63.2—Unverified
#ModelMetricClaimedVerifiedStatus
1MSDAPearson correlation coefficient (PCC)0.52—Unverified
#ModelMetricClaimedVerifiedStatus
1SeViLAAccuracy72.3—Unverified
#ModelMetricClaimedVerifiedStatus
1M^2-EncoderAccuracy80.7—Unverified
#ModelMetricClaimedVerifiedStatus
1FrozenBiLMAccuracy51.5—Unverified
#ModelMetricClaimedVerifiedStatus
1CZSLA-acc36—Unverified
#ModelMetricClaimedVerifiedStatus
1ZS3Netk=10 mIOU26.3—Unverified
#ModelMetricClaimedVerifiedStatus
1ZSL-KGAccuracy88.98—Unverified
#ModelMetricClaimedVerifiedStatus
1VideoChat2Accuracy40.6—Unverified