SOTAVerified

Image Paragraph Captioning

Image paragraph captioning involves generating a detailed, multi-sentence description of the content of an image.

Papers

Showing 1–10 of 17 papers

TitleStatusHype
VLIS: Unimodal Language Models Guide Multimodal Language GenerationCode1
Context-Aware Visual Policy Network for Fine-Grained Image CaptioningCode0
Training for Diversity in Image Paragraph CaptioningCode0
Matching Visual Features to Hierarchical Semantic Topics for Image Paragraph CaptioningCode0
A Hierarchical Approach for Generating Descriptive Image ParagraphsCode0
Enhancing image captioning with depth information using a Transformer-based framework—0
Hierarchical Scene Graph Encoder-Decoder for Image Paragraph Captioning—0
Improving Diversity and Reducing Redundancy in Paragraph Captions—0
Interactive Key-Value Memory-augmented Attention for Image Paragraph Captioning—0
Look Deeper See Richer: Depth-aware Image Paragraph Captioning—0
Show:102550
← PrevPage 1 of 2Next →

Benchmark Results

#ModelMetricClaimedVerifiedStatus
1HSGED(SLL)BLEU-411.26—Unverified
2SCST training, w/ rep. penaltyBLEU-410.58—Unverified
3IMAPBLEU-410.29—Unverified
4CAE-LSTMBLEU-49.67—Unverified
5Diverse and Coherent Paragraph Generation from ImagesBLEU-49.43—Unverified
6RTT-GAN (Semi + Fully)BLEU-49.21—Unverified
7Regions-Hierarchical (ours)BLEU-48.69—Unverified
8Dual-CNNBLEU-48.6—Unverified
9Depth-aware Attention Model (DAM)BLEU-46.7—Unverified
10IMG+LNGBLEU-44.67—Unverified