SOTAVerified

Long-Context Understanding

Papers

Showing 61–70 of 81 papers

TitleStatusHype
Retrieval Or Holistic Understanding? Dolce: Differentiate Our Long Context Evaluation Tasks—0
Revisiting Parallel Context Windows: A Frustratingly Simple Alternative and Chain-of-Thought Deterioration—0
A Real-World WebAgent with Planning, Long Context Understanding, and Program Synthesis—0
What matters when building vision-language models?—0
Anomaly Detection of Tabular Data Using LLMs—0
How Effective Is Self-Consistency for Long-Context Problems?—0
Guided Code Generation with LLMs: A Multi-Agent Framework for Complex Code Tasks—0
Large Language Models as Efficient Reward Function Searchers for Custom-Environment Multi-Objective Reinforcement Learning—0
XL^2Bench: A Benchmark for Extremely Long Context Understanding with Long-range Dependencies—0
Fine-Tuning Medical Language Models for Enhanced Long-Contextual Understanding and Domain Expertise—0
Show:102550
← PrevPage 7 of 9Next →

Benchmark Results

#ModelMetricClaimedVerifiedStatus
1GPT-4o1 Image, 4*4 Stitching, Exact Accuracy83—Unverified
2GPT-4V1 Image, 4*4 Stitching, Exact Accuracy54.72—Unverified
3Gemini Pro 1.51 Image, 4*4 Stitching, Exact Accuracy39.85—Unverified
4Gemini Pro 1.01 Image, 4*4 Stitching, Exact Accuracy24.78—Unverified
5LLaVA-Llama-31 Image, 4*4 Stitching, Exact Accuracy17.5—Unverified
6Claude 3 Opus1 Image, 4*4 Stitching, Exact Accuracy12.3—Unverified
7IDEFICS2-8B1 Image, 4*4 Stitching, Exact Accuracy7.8—Unverified
8InstructBLIP-Flan-T5-XXL1 Image, 4*4 Stitching, Exact Accuracy6.2—Unverified
9CogVLM2-Llama-31 Image, 4*4 Stitching, Exact Accuracy0.9—Unverified
10mPLUG-Owl-v21 Image, 4*4 Stitching, Exact Accuracy0.3—Unverified
#ModelMetricClaimedVerifiedStatus
1GPT-4-Turbo-11061k74—Unverified
2GPT-4-Turbo-01251k73.5—Unverified
3Claude-21k65—Unverified
4GPT-3.5-Turbo-11061k61.5—Unverified
5InternLM2-7b1k58.6—Unverified
6Vicuna-13b-v1.5-16k1k53.4—Unverified
7ChatGLM3-6b-32k1k39.8—Unverified
8Vicuna-7b-v1.5-16k1k37—Unverified
9LongChat-7b-v1.5-32k1k32.4—Unverified
10ChatGLM2-6b-32k1k31.2—Unverified
#ModelMetricClaimedVerifiedStatus
1GPT-4-Turbo-11062k18.5—Unverified
2GPT-4-Turbo-01252k15.5—Unverified
3Vicuna-13b-v1.5-16k2k5.4—Unverified
4Vicuna-7b-v1.5-16k2k5.3—Unverified
5LongChat-7b-v1.5-32k2k5.3—Unverified
6InternLM2-7b2k5.1—Unverified
7Claude-22k5—Unverified
8GPT-3.5-Turbo-11062k4—Unverified
9ChatGLM3-6b-32k2k2.3—Unverified
10ChatGLM2-6b-32k2k0.9—Unverified
#ModelMetricClaimedVerifiedStatus
1GALI(Llama3-8b-ins-4k-to-16k)Average Score59.21—Unverified
2GALI(Llama3-8b-ins-4k-to-32k)Average Score59.1—Unverified
3GALI(Llama3-8b-ins-8k-to-32k)Average Score42.79—Unverified
4GALI(Llama3-8b-ins-8k-to-16k)Average Score42.32—Unverified
#ModelMetricClaimedVerifiedStatus
1GALI(Llama3-8b-ins-4k-to-16k)Average Score46.22—Unverified
2GALI(Llama3-8b-ins-8k-to-32k)Average Score45.38—Unverified
3GALI(Llama3-8b-ins-8k-to-16k)Average Score45.17—Unverified