SOTAVerified

Scene Text Detection

Scene Text Detection is a computer vision task that involves automatically identifying and localizing text within natural images or videos. The goal of scene text detection is to develop algorithms that can robustly detect and and label text with bounding boxes in uncontrolled and complex environments, such as street signs, billboards, or license plates.

Source: ContourNet: Taking a Further Step toward Accurate Arbitrary-shaped Scene Text Detection

Papers

Showing 1–50 of 213 papers

TitleStatusHype
The Devil is in Fine-tuning and Long-tailed Problems:A New Benchmark for Scene Text DetectionCode1
Explicit Relational Reasoning Network for Scene Text Detection—0
KhmerST: A Low-Resource Khmer Scene Text Detection and Recognition Benchmark—0
Spotlight Text Detector: Spotlight on Candidate Regions Like a Camera—0
Region Prompt Tuning: Fine-grained Scene Text Detection Utilizing Region Text Prompt—0
Revisiting Tampered Scene Text Detection in the Era of Generative AICode2
Towards Unified Multi-granularity Text Detection with Interactive Attention—0
Dataset and Benchmark for Urdu Natural Scenes Text Detection, Recognition and Visual Question AnsweringCode0
The First Swahili Language Scene Text Detection and Recognition DatasetCode0
FPDIoU Loss: A Loss Function for Efficient Bounding Box Regression of Rotated Object Detection—0
Text Grouping Adapter: Adapting Pre-trained Text Detector for Layout Analysis—0
MorphText: Deep Morphology Regularized Arbitrary-shape Scene Text Detection—0
Text in the Dark: Extremely Low-Light Text Image EnhancementCode0
MENTOR: Multilingual tExt detectioN TOward leaRning by analogy—0
ODM: A Text-Image Further Alignment Pre-training Approach for Scene Text Detection and SpottingCode1
CPN: Complementary Proposal Network for Unconstrained Text Detection—0
EK-Net:Real-time Scene Text Detection with Expand Kernel Distance—0
Text Region Multiple Information Perception Network for Scene Text Detection—0
BPDO:Boundary Points Dynamic Optimization for Arbitrary Shape Scene Text Detection—0
Kernel Adaptive Convolution for Scene Text Detection via Distance Map Prediction—0
Research on Multilingual Natural Scene Text Detection AlgorithmCode0
Bridging Synthetic and Real Worlds for Pre-training Scene Text DetectorsCode1
Enhancing Scene Text Detectors with Realistic Text Image Synthesis Using Diffusion ModelsCode1
DocXChain: A Powerful Open-Source Toolchain for Document Parsing and Beyond—0
Harnessing the Power of Multi-Lingual Datasets for Pre-training: Towards Enhancing Text Spotting PerformanceCode0
STEP -- Towards Structured Scene-Text SpottingCode0
MixNet: Toward Accurate Detection of Challenging Scene Text in the WildCode1
Turning a CLIP Model into a Scene Text SpotterCode2
SRFormer: Text Detection Transformer with Incorporated Segmentation and RegressionCode2
Towards Robust Real-Time Scene Text Detection: From Semantic to Instance Representation Learning—0
Separate Scene Text Detector for Unseen Scripts is Not All You Need—0
Adaptive Segmentation Network for Scene Text Detection—0
CT-Net: Arbitrary-Shaped Text Detection via Contour Transformer—0
LRANet: Towards Accurate and Efficient Scene Text Detection with Low-Rank Approximation NetworkCode1
ViTEraser: Harnessing the Power of Vision Transformers for Scene Text Removal with SegMIM PretrainingCode1
TextFormer: A Query-based End-to-End Text Spotter with Mixed Supervision—0
DeepSolo++: Let Transformer Decoder with Explicit Points Solo for Multilingual Text SpottingCode2
Deformable Kernel Expansion Model for Efficient Arbitrary-shaped Scene Text Detection—0
Turning a CLIP Model into a Scene Text DetectorCode2
Recurrent Generic Contour-based Instance Segmentation with Progressive LearningCode1
CBNet: A Plug-and-Play Network for Segmentation-Based Scene Text DetectionCode1
Domain Adaptive Scene Text Detection via Subcategorization—0
Aggregated Text Transformer for Scene Text Detection—0
DeepSolo: Let Transformer Decoder with Explicit Points Solo for Text SpottingCode2
Text Growing on Leaf—0
Arbitrary Shape Text Detection via Segmentation with Probability MapsCode1
DPTNet: A Dual-Path Transformer Architecture for Scene Text Detection—0
Shift Variance in Scene Text Detection—0
DPText-DETR: Towards Better Scene Text Detection with Dynamic Points in TransformerCode2
Explore Faster Localization Learning For Scene Text Detection—0
Show:102550
← PrevPage 1 of 5Next →

Benchmark Results

#ModelMetricClaimedVerifiedStatus
1TextFuseNet (ResNeXt-101)F-Measure92.23—Unverified
2CharNet H-88 (multi-scale)F-Measure91.55—Unverified
3CharNet H-88 (single-scale)F-Measure90.97—Unverified
4CharNet H-50 (multi-scale)F-Measure90.16—Unverified
5SBDF-Measure90.1—Unverified
6CharNet H-57 (multi-scale)F-Measure90.06—Unverified
7FOTS MSF-Measure89.84—Unverified
8CharNet H-50 (single-scale)F-Measure89.7—Unverified
9CharNet H-57 (single-scale)F-Measure89.66—Unverified
10PMTDF-Measure89.33—Unverified
#ModelMetricClaimedVerifiedStatus
1MixNetF-Measure90.5—Unverified
2SRFormer (ResNet-50)F-Measure90—Unverified
3DPText-DETR (ResNet-50)F-Measure89—Unverified
4TextFuseNet (ResNeXt-101)F-Measure87.5—Unverified
5FAST-B-800F-Measure87.5—Unverified
6I3CL + SSL(ResNet-50)F-Measure86.9—Unverified
7CharNet H-88 (multi-scale)F-Measure86.5—Unverified
8FAST-B-640F-Measure86.4—Unverified
9DBNet++ (ResNet-50) (800)F-Measure86—Unverified
10FAST-B-512F-Measure85.8—Unverified
#ModelMetricClaimedVerifiedStatus
1MixNetF-Measure89.4—Unverified
2FAST-B-736F-Measure87.3—Unverified
3DBNet++ (ResNet-50) (736)F-Measure87.2—Unverified
4FAST-S-736F-Measure86.4—Unverified
5DBNet++ (ResNet-18) (736)F-Measure85.1—Unverified
6FAST-T-736F-Measure84.9—Unverified
7DB-ResNet-50 (736)F-Measure84.9—Unverified
8FAST-T-512F-Measure84.5—Unverified
9PANF-Measure84.1—Unverified
10CRAFTF-Measure82.9—Unverified
#ModelMetricClaimedVerifiedStatus
1MixNetF-Measure89.8—Unverified
2SRFormer (ResNet-50)F-Measure89.6—Unverified
3DPText-DETR (ResNet50)F-Measure88.8—Unverified
4TextFuseNet (ResNeXt-101)F-Measure87.4—Unverified
5I3CL + SSLF-Measure86.5—Unverified
6PANF-Measure85—Unverified
7FAST-B-640F-Measure84.2—Unverified
8PAN-640F-Measure83.7—Unverified
9CRAFTF-Measure83.5—Unverified
10DB-ResNet50 (1024)F-Measure83.4—Unverified
#ModelMetricClaimedVerifiedStatus
1CRAFTPrecision97.4—Unverified
2TextFuseNet (ResNeXt-101)F-Measure94.61—Unverified
3SPCNETF-Measure92.1—Unverified
4Mask TextSpotterF-Measure91.7—Unverified
5WordSup (VGG16-synth-icdar)F-Measure90.34—Unverified
6STN-OCRF-Measure90.3—Unverified
7PixelLink+VGG16 2s MSF-Measure88.1—Unverified
8TextBoxes++_MSF-Measure88—Unverified
9Corner Localization (multi-scale)F-Measure88—Unverified
10Corner-based Region ProposalsF-Measure87.6—Unverified
#ModelMetricClaimedVerifiedStatus
1PMTD*Precision84.42—Unverified
2Corner Localization (single-scale)Precision83.8—Unverified
3SBDPrecision82.75—Unverified
4FOTS MSPrecision81.86—Unverified
5CharNet H-88Precision81.27—Unverified
6FOTSPrecision80.95—Unverified
7SPCNETPrecision80.6—Unverified
8CRAFTPrecision80.6—Unverified
9PANPrecision80—Unverified
10GNNetsPrecision79.63—Unverified
#ModelMetricClaimedVerifiedStatus
1Corner-based Region ProposalsF-Measure59.1—Unverified
2TextBoxes++_MSF-Measure58.72—Unverified
3EAST + VGG16F-Measure39.45—Unverified
4SSTDF-Measure37—Unverified
5WordSup (VGG16-synth-coco)F-Measure36.8—Unverified
6Yao et al.F-Measure33.31—Unverified
#ModelMetricClaimedVerifiedStatus
1MixNetH-Mean79.7—Unverified
2SRFormer (ResNet-50)H-Mean79.3—Unverified
3TextFuseNet (ResNeXt-101)H-Mean78.6—Unverified
4DPText-DETR (ResNet-50)H-Mean78.1—Unverified
#ModelMetricClaimedVerifiedStatus
1BDNF-Measure93.36—Unverified