SOTAVerified

Fact Checking

Papers

Showing 1–25 of 669 papers

TitleStatusHype
PiMRef: Detecting and Explaining Ever-evolving Spear Phishing Emails with Knowledge Base Invariants—0
DS@GT at CheckThat! 2025: Evaluating Context and Tokenization Strategies for Numerical Fact VerificationCode0
Recon, Answer, Verify: Agents in Search of Truth—0
Decide less, communicate more: On the construct validity of end-to-end fact-checking in medicineCode0
The Next Phase of Scientific Fact-Checking: Advanced Evidence Retrieval from Complex Structured Academic Papers—0
Veracity: An Open-Source AI Fact-Checking System—0
Verifying the Verifiers: Unveiling Pitfalls and Potentials in Fact VerifiersCode1
SPOT: Bridging Natural Language and Geospatial Search for Investigative Journalists—0
RealFactBench: A Benchmark for Evaluating Large Language Models in Real-World Fact-CheckingCode0
In Crowd Veritas: Leveraging Human Intelligence To Fight Misinformation—0
ClimateViz: A Benchmark for Statistical Reasoning and Fact Verification on Scientific ChartsCode0
Combating Misinformation in the Arab World: Challenges & Opportunities—0
SUCEA: Reasoning-Intensive Retrieval for Adversarial Fact-checking through Claim Decomposition and EditingCode0
Search Arena: Analyzing Search-Augmented LLMsCode2
Facts are Harder Than Opinions -- A Multilingual, Comparative Analysis of LLM-Based Fact-Checking Reliability—0
Improving Reliability and Explainability of Medical Question Answering through Atomic Fact Checking in Retrieval-Augmented LLMs—0
Verify-in-the-Graph: Entity Disambiguation Enhancement for Complex Claim Verification with Interactive Graph Representation—0
Community Moderation and the New Epistemology of Fact Checking on Social Media—0
From Generation to Detection: A Multimodal Multi-Task Dataset for Benchmarking Health Misinformation—0
Debate-to-Detect: Reformulating Misinformation Detection as a Real-World Debate with Large Language Models—0
Social Good or Scientific Curiosity? Uncovering the Research Framing Behind NLP Artefacts—0
Teaching with Lies: Curriculum DPO on Synthetic Negatives for Hallucination Detection—0
Resolving Conflicting Evidence in Automated Fact-Checking: A Study on Retrieval-Augmented LLMsCode0
EMULATE: A Multi-Agent Framework for Determining the Veracity of Atomic Claims by Emulating Human ActionsCode0
CUB: Benchmarking Context Utilisation Techniques for Language Models—0
Show:102550
← PrevPage 1 of 27Next →

Benchmark Results

#ModelMetricClaimedVerifiedStatus
1monoT5-3BnDCG@100.78—Unverified
2SGPT-BE-5.8BnDCG@100.75—Unverified
3BM25+CEnDCG@100.69—Unverified
4SGPT-CE-6.1BnDCG@100.68—Unverified
5ColBERTnDCG@100.67—Unverified
#ModelMetricClaimedVerifiedStatus
1SGPT-BE-5.8BnDCG@100.31—Unverified
2monoT5-3BnDCG@100.28—Unverified
3BM25+CEnDCG@100.25—Unverified
4SGPT-CE-6.1BnDCG@100.16—Unverified
#ModelMetricClaimedVerifiedStatus
1monoT5-3BnDCG@100.85—Unverified
2BM25+CEnDCG@100.82—Unverified
3SGPT-BE-5.8BnDCG@100.78—Unverified
4SGPT-CE-6.1BnDCG@100.73—Unverified
#ModelMetricClaimedVerifiedStatus
1HerOQuestion Only score0.48—Unverified
2CTU AICQuestion Only score0.46—Unverified
3InFactQuestion Only score0.45—Unverified
#ModelMetricClaimedVerifiedStatus
1Abc0..5sec2—Unverified
#ModelMetricClaimedVerifiedStatus
1MA-CINPrecision0.26—Unverified
#ModelMetricClaimedVerifiedStatus
1FDHNAccuracy (Test)0.7—Unverified