SOTAVerified

Optical Character Recognition (OCR)

Optical Character Recognition or Optical Character Reader (OCR) is the electronic or mechanical conversion of images of typed, handwritten or printed text into machine-encoded text, whether from a scanned document, a photo of a document, a scene-photo (for example the text on signs and billboards in a landscape photo, license plates in cars...) or from subtitle text superimposed on an image (for example: from a television broadcast)

Papers

Showing 951–1000 of 1209 papers

TitleStatusHype
Optical Character Recognition and Transcription of Berber Signs from Images in a Low-Resource Language Amazigh—0
Optical Character Recognition (OCR) for Telugu: Database, Algorithm and Application—0
Optical character recognition quality affects perceived usefulness of historical newspaper clippings—0
Optical Character Recognition using Convolutional Neural Networks for Ashokan Brahmi Inscriptions—0
Optical Character Recognition, Using K-Nearest Neighbors—0
Optical Character Recognition, Word Segmentation, Sentence Segmentation, and Information Extraction for Historical and Literature Texts in Classical Chinese—0
Optical Text Recognition in Nepali and Bengali: A Transformer-based Approach—0
Optimal Boxes: Boosting End-to-End Scene Text Recognition by Adjusting Annotated Bounding Boxes via Reinforcement Learning—0
Optimizing the Neural Network Training for OCR Error Correction of Historical Hebrew Texts—0
OSPC: Detecting Harmful Memes with Large Language Model as a Catalyst—0
Out-of-Candidate Rectification for Weakly Supervised Semantic Segmentation—0
Out-of-Distribution Recovery with Object-Centric Keypoint Inverse Policy for Visuomotor Imitation Learning—0
Out-of-Vocabulary Challenge Report—0
Overlay Text Extraction From TV News Broadcast—0
Overview of the 2017 ALTA Shared Task: Correcting OCR Errors—0
PACMAN: a framework for pulse oximeter digit detection and reading in a low-resource setting—0
PaddleOCR 3.0 Technical Report—0
Page Stream Segmentation with Convolutional Neural Nets Combining Textual and Visual Features—0
PAM: Understanding Product Images in Cross Product Category Attribute Extraction—0
papago: A Machine Translation Service with Word Sense Disambiguation and Currency Conversion—0
Pay Voice: Point of Sale Recognition for Visually Impaired People—0
PDFdigest: an Adaptable Layout-Aware PDF-to-XML Textual Content Extractor for Scientific Articles—0
PdfTable: A Unified Toolkit for Deep Learning-Based Table Extraction—0
PDF-to-Text Reanalysis for Linguistic Data Mining—0
People and Places of Historical Europe: Bootstrapping Annotation Pipeline and a New Corpus of Named Entities in Late Medieval Texts—0
Persian Handwritten Digit, Character and Word Recognition Using Deep Learning—0
Pipeline Enabling Zero-shot Classification for Bangla Handwritten Grapheme—0
Plagiarism Detection in the Bengali Language: A Text Similarity-Based Approach—0
Plague Dot Text: Text mining and annotation of outbreak reports of the Third Plague Pandemic (1894-1952)—0
Platypus: A Generalized Specialist Model for Reading Text in Various Forms—0
PLayerTV: Advanced Player Tracking and Identification for Automatic Soccer Highlight Clips—0
Polar-Doc: One-Stage Document Dewarping with Multi-Scope Constraints under Polar Representation—0
PP-DocBee: Improving Multimodal Document Understanding Through a Bag of Tricks—0
PP-OCRv3: More Attempts for the Improvement of Ultra Lightweight OCR System—0
Preserving Semantic Information from Old Dictionaries: Linking Senses of the `Altfranz\"osisches W\"orterbuch' to WordNet—0
PreSTU: Pre-Training for Scene-Text Understanding—0
Producing Corpora of Medieval and Premodern Occitan—0
Profiling of OCR'ed Historical Texts Revisited—0
Proposal for Automatic License and Number Plate Recognition System for Vehicle Identification—0
Proposal Report for the 2nd SciCAP Competition 2024—0
Providing and Analyzing NLP Terms for our Community—0
Pseudo-Bidirectional Decoding for Local Sequence Transduction—0
Pynini: A Python library for weighted finite-state grammar compilation—0
Qalam : A Multimodal LLM for Arabic Optical Character and Handwriting Recognition—0
QID: Efficient Query-Informed ViTs in Data-Scarce Regimes for OCR-free Visual Document Understanding—0
Quantitative Analysis of Image Classification Techniques for Memory-Constrained Devices—0
RDU: A Region-based Approach to Form-style Document Understanding—0
Reading Ancient Coin Legends: Object Recognition vs. OCR—0
Reading in the Dark with Foveated Event Vision—0
RealitySummary: Exploring On-Demand Mixed Reality Text Summarization and Question Answering using Large Language Models—0
Show:102550
← PrevPage 20 of 25Next →

Benchmark Results

#ModelMetricClaimedVerifiedStatus
1DTrOCRAccuracy (%)89.6—Unverified
2DTrOCR 105MAccuracy (%)89.6—Unverified
3MaskOCR-LAccuracy (%)82.6—Unverified
4TransOCRAccuracy (%)72.8—Unverified
5SRNAccuracy (%)65—Unverified
6MORANAccuracy (%)64.3—Unverified
7SEEDAccuracy (%)61.2—Unverified
#ModelMetricClaimedVerifiedStatus
1GPT-4oAverage Accuracy76.22—Unverified
2Gemini-1.5 ProAverage Accuracy76.13—Unverified
3Claude-3 SonnetAverage Accuracy67.71—Unverified
4RapidOCRAverage Accuracy56.98—Unverified
5EasyOCRAverage Accuracy49.3—Unverified
#ModelMetricClaimedVerifiedStatus
1STREETSequence error27.54—Unverified
2SEESequence error22—Unverified
3AttentionOCR_Inception-resnet-v2_LocationSequence error15.8—Unverified
#ModelMetricClaimedVerifiedStatus
1I2L-NOPOOLBLEU89.09—Unverified
2I2L-STRIPSBLEU89—Unverified
#ModelMetricClaimedVerifiedStatus
1TesseractCharacter Error Rate (CER)0.08—Unverified
2EasyOCRCharacter Error Rate (CER)0.07—Unverified
#ModelMetricClaimedVerifiedStatus
1I2L-STRIPSBLEU88.86—Unverified