General Knowledge

This task aims to evaluate the ability of a model to answer general-knowledge questions.

Papers

Recently Added Most Hyped Most Active Needs Verification Most Verified

Showing 51–75 of 399 papers

Title	Date	Tasks	Status	Hype
CityBench: Evaluating the Capabilities of Large Language Models for Urban Tasks	Jun 20, 2024	General KnowledgeHuman Dynamics	CodeCode Available	1
RAD: A Comprehensive Dataset for Benchmarking the Robustness of Image Anomaly Detection	Jun 11, 2024	Anomaly DetectionBenchmarking	CodeCode Available	1
DomainRAG: A Chinese Benchmark for Evaluating Domain-specific Retrieval-Augmented Generation	Jun 9, 2024	Common Sense ReasoningDenoising	CodeCode Available	1
HYDRA: Model Factorization Framework for Black-Box LLM Personalization	Jun 5, 2024	General Knowledge	CodeCode Available	1
Slow and Steady Wins the Race: Maintaining Plasticity with Hare and Tortoise Networks	Jun 1, 2024	General KnowledgeHippocampus	CodeCode Available	1
CRoFT: Robust Fine-Tuning with Concurrent Optimization for OOD Generalization and Open-Set OOD Detection	May 26, 2024	General Knowledge	CodeCode Available	1
Health Index Estimation Through Integration of General Knowledge with Unsupervised Learning	May 8, 2024	General Knowledge	CodeCode Available	1
BEAR: A Unified Framework for Evaluating Relational Knowledge in Causal and Masked Language Models	Apr 5, 2024	Factual probeGeneral Knowledge	CodeCode Available	1
Benchmarking Large Language Models for Persian: A Preliminary Study Focusing on ChatGPT	Apr 3, 2024	BenchmarkingGeneral Knowledge	CodeCode Available	1
Prompt Learning via Meta-Regularization	Apr 1, 2024	Domain GeneralizationGeneral Knowledge	CodeCode Available	1
See Through Their Minds: Learning Transferable Neural Representation from Cross-Subject fMRI	Mar 11, 2024	Brain DecodingGeneral Knowledge	CodeCode Available	1
MedSafetyBench: Evaluating and Improving the Medical Safety of Large Language Models	Mar 6, 2024	EthicsGeneral Knowledge	CodeCode Available	1
Can LLM Generate Culturally Relevant Commonsense QA Data? Case Study in Indonesian and Sundanese	Feb 27, 2024	General KnowledgeQuestion Answering	CodeCode Available	1
OMGEval: An Open Multilingual Generative Evaluation Benchmark for Large Language Models	Feb 21, 2024	General KnowledgeLogical Reasoning	CodeCode Available	1
Pre-training and Diagnosing Knowledge Base Completion Models	Jan 27, 2024	General KnowledgeKnowledge Base Completion	CodeCode Available	1
The Unreasonable Effectiveness of Easy Training Data for Hard Tasks	Jan 12, 2024	General KnowledgeIn-Context Learning	CodeCode Available	1
Generic Knowledge Boosted Pre-training For Remote Sensing Images	Jan 9, 2024	Change DetectionDeep Learning	CodeCode Available	1
GeoGalactica: A Scientific Large Language Model in Geoscience	Dec 31, 2023	Document ClassificationGeneral Knowledge	CodeCode Available	1
Time Travelling Pixels: Bitemporal Features Integration with Foundation Model for Remote Sensing Image Change Detection	Dec 23, 2023	Change DetectionGeneral Knowledge	CodeCode Available	1
VIEScore: Towards Explainable Metrics for Conditional Image Synthesis Evaluation	Dec 22, 2023	Conditional Image GenerationGeneral Knowledge	CodeCode Available	1
Prediction and Control in Continual Reinforcement Learning	Dec 18, 2023	Continual LearningGeneral Knowledge	CodeCode Available	1
A New Learning Paradigm for Foundation Model-based Remote Sensing Change Detection	Dec 2, 2023	Building change detection for remote sensing imagesChange Detection	CodeCode Available	1
MultiGPrompt for Multi-Task Pre-Training and Prompting on Graphs	Nov 28, 2023	General KnowledgeGraph Representation Learning	CodeCode Available	1
CurriculumLoc: Enhancing Cross-Domain Geolocalization through Multi-Stage Refinement	Nov 20, 2023	General KnowledgeKeypoint Detection	CodeCode Available	1
Structured Chemistry Reasoning with Large Language Models	Nov 16, 2023	General Knowledge	CodeCode Available	1

Show:10 25 50

← PrevPage 3 of 16Next →

Benchmark Results

#	Model	Metric	Claimed	Verified	Status
1	Chinchilla-70B (few-shot, k=5)	Accuracy	94.3	—	Unverified
2	Gopher-280B (few-shot, k=5)	Accuracy	93.9	—	Unverified
3	Chinchilla-70B (few-shot, k=5)	Accuracy	85.7	—	Unverified
4	Gopher-280B (few-shot, k=5)	Accuracy	84.8	—	Unverified
5	Gopher-280B (few-shot, k=5)	Accuracy	84.2	—	Unverified
6	Gopher-280B (few-shot, k=5)	Accuracy	84.1	—	Unverified
7	Gopher-280B (few-shot, k=5)	Accuracy	83.9	—	Unverified
8	Gopher-280B (few-shot, k=5)	Accuracy	83.3	—	Unverified
9	Gopher-280B (few-shot, k=5)	Accuracy	81.8	—	Unverified
10	Gopher-280B (few-shot, k=5)	Accuracy	81	—	Unverified