| EgoNormia: Benchmarking Physical Social Norm Understanding | Feb 27, 2025 | Answer GenerationBenchmarking | CodeCode Available | 1 | 5 |
| MIRAGE-Bench: Automatic Multilingual Benchmark Arena for Retrieval-Augmented Generation Systems | Oct 17, 2024 | Answer GenerationLanguage Modeling | CodeCode Available | 1 | 5 |
| Enhancing Multi-modal and Multi-hop Question Answering via Structured Knowledge and Unified Retrieval-Generation | Dec 16, 2022 | Answer GenerationDecoder | CodeCode Available | 1 | 5 |
| MRAMG-Bench: A Comprehensive Benchmark for Advancing Multimodal Retrieval-Augmented Multimodal Generation | Feb 6, 2025 | Answer Generationmultimodal generation | CodeCode Available | 1 | 5 |
| Can ChatGPT Assess Human Personalities? A General Evaluation Framework | Mar 1, 2023 | Answer GenerationFairness | CodeCode Available | 1 | 5 |
| Knowing More About Questions Can Help: Improving Calibration in Question Answering | Jun 2, 2021 | Answer GenerationData Augmentation | CodeCode Available | 1 | 5 |
| Change Detection Meets Visual Question Answering | Dec 12, 2021 | Answer GenerationChange Detection | CodeCode Available | 1 | 5 |
| CICERO: A Dataset for Contextualized Commonsense Inference in Dialogues | Mar 25, 2022 | Answer GenerationAnswer Selection | CodeCode Available | 1 | 5 |
| Answer Mining from a Pool of Images: Towards Retrieval-Based Visual Question Answering | Jun 29, 2023 | Answer GenerationQuestion Answering | CodeCode Available | 1 | 5 |
| MetaLadder: Ascending Mathematical Solution Quality via Analogical-Problem Reasoning Transfer | Mar 19, 2025 | Answer GenerationMathematical Reasoning | CodeCode Available | 1 | 5 |