SOTAVerified

Text Spotting

Scene Text Spotting is the combination of Scene Text Detection and Scene Text Recognition in an end-to-end manner. It is the ability to read natural text in the wild.

Papers

Showing 26–50 of 112 papers

TitleStatusHype
A Bilingual, OpenWorld Video Text Dataset and End-to-end Video Text Spotter with TransformerCode1
TPSNet: Reverse Thinking of Thin Plate Splines for Arbitrary Shape Scene Text RepresentationCode1
Dictionary-Guided Scene Text RecognitionCode1
ABCNet v2: Adaptive Bezier-Curve Network for Real-time End-to-end Text SpottingCode1
PAN++: Towards Efficient and Accurate End-to-End Spotting of Arbitrarily-Shaped TextCode1
Scene Text Retrieval via Joint Text Detection and Similarity LearningCode1
Towards Robust Visual Information Extraction in Real World: New Dataset and Novel SolutionCode1
AE TextSpotter: Learning Visual and Linguistic Representation for Ambiguous Text SpottingCode1
Mask TextSpotter v3: Segmentation Proposal Network for Robust Scene Text SpottingCode1
ABCNet: Real-time Scene Text Spotting with Adaptive Bezier-Curve NetworkCode1
ICDAR 2019 Competition on Large-scale Street View Text with Partial Labeling -- RRC-LSVTCode1
Text-Aware Image Restoration with Diffusion Models—0
OmniParser V2: Structured-Points-of-Thought for Unified Visual Text Parsing and Its Generality to Multimodal Large Language Models—0
CLIP is Almost All You Need: Towards Parameter-Efficient Scene Text Retrieval without OCR—0
Hear the Scene: Audio-Enhanced Text Spotting—0
InstructOCR: Instruction Boosting Scene Text SpottingCode0
Arbitrary Reading Order Scene Text Spotter with Local Semantics Guidance—0
HIP: Hierarchical Point Modeling and Pre-training for Visual Information Extraction—0
FastTextSpotter: A High-Efficiency Transformer for Multilingual Scene Text SpottingCode0
WeCromCL: Weakly Supervised Cross-Modality Contrastive Learning for Transcription-only Supervised Text SpottingCode0
CLII: Visual-Text Inpainting via Cross-Modal Predictive Interaction—0
Block-level Text Spotting with LLMs—0
LOGO: Video Text Spotting with Language Collaboration and Glyph Perception Model—0
Mixed Text Recognition with Efficient Parameter Fine-Tuning and Transformer—0
Ensemble Learning for Vietnamese Scene Text Spotting in Urban Environments—0
Show:102550
← PrevPage 2 of 5Next →

Benchmark Results

#ModelMetricClaimedVerifiedStatus
1UNITSF-measure (%) - Strong Lexicon89—Unverified
2DeepSolo (ViTAEv2-S, TextOCR)F-measure (%) - Strong Lexicon88.1—Unverified
3DeepSolo(ResNet-50, TextOCR)F-measure (%) - Strong Lexicon88—Unverified
4DeepSolo(ResNet-50)F-measure (%) - Strong Lexicon86.8—Unverified
5SRTSF-measure (%) - Strong Lexicon85.6—Unverified
6TESTRF-measure (%) - Strong Lexicon85.2—Unverified
7A3SF-measure (%) - Strong Lexicon84.8—Unverified
8GLASSF-measure (%) - Strong Lexicon84.7—Unverified
9SwinTextSpotterF-measure (%) - Strong Lexicon83.9—Unverified
10FOTSF-measure (%) - Strong Lexicon83.6—Unverified
#ModelMetricClaimedVerifiedStatus
1DeepSolo (ViTAEv2-S, TextOCR)F-measure (%) - No Lexicon83.6—Unverified
2DeepSolo (ResNet-50, TextOCR)F-measure (%) - No Lexicon82.5—Unverified
3DeepSolo (ResNet-50)F-measure (%) - No Lexicon79.7—Unverified
4A3SF-measure (%) - No Lexicon79.4—Unverified
5UNITSF-measure (%) - No Lexicon78.7—Unverified
6GLASSF-measure (%) - No Lexicon76.6—Unverified
7DEERF-measure (%) - No Lexicon74.8—Unverified
8SwinTextSpotterF-measure (%) - No Lexicon74.3—Unverified
9TESTRF-measure (%) - No Lexicon73.3—Unverified
10MANGOF-measure (%) - No Lexicon72.9—Unverified
#ModelMetricClaimedVerifiedStatus
1A3SF-measure (%) - No Lexicon64.4—Unverified
2DeepSolo (ResNet-50)F-measure (%) - No Lexicon64.2—Unverified
3SPTSF-measure (%) - No Lexicon63.6—Unverified
4ABINet++F-measure (%) - No Lexicon60.2—Unverified
5TPSNetF-measure (%) - No Lexicon59.7—Unverified
6MANGOF-measure (%) - No Lexicon58.9—Unverified
7ABCNet v2F-measure (%) - No Lexicon57.5—Unverified
8TextPerceptronF-measure (%) - No Lexicon57—Unverified
9TESTRF-measure (%) - No Lexicon56—Unverified
10SwinTextSpotterF-measure (%) - No Lexicon51.8—Unverified
#ModelMetricClaimedVerifiedStatus
1DeepSolo (ViTAEv2-S, TextOCR)F-measure (%) - No Lexicon68.8—Unverified
2DeepSolo (ResNet-50, TextOCR)F-measure (%) - No Lexicon64.6—Unverified
3SwinTextSpotterF-measure (%) - No Lexicon55.4—Unverified
4DeepSolo (ResNet-50)F-measure (%) - No Lexicon48.5—Unverified
5MaskTextSpotter v2F-measure (%) - No Lexicon39—Unverified
6SPTSF-measure (%) - No Lexicon38.3—Unverified
7ABCNet v2F-measure (%) - No Lexicon34.5—Unverified
8TESTRF-measure (%) - No Lexicon34.2—Unverified
9ABCNetF-measure (%) - No Lexicon22.2—Unverified