SOTAVerified

Dialogue Evaluation

Papers

Showing 11–20 of 97 papers

TitleStatusHype
Soda-Eval: Open-Domain Dialogue Evaluation in the age of LLMsCode0
ECoh: Turn-level Coherence Evaluation for Multilingual DialoguesCode0
On the Benchmarking of LLMs for Open-Domain Dialogue Evaluation—0
Leveraging LLMs for Dialogue Quality Measurement—0
LLM as a Scorer: The Impact of Output Order on Dialogue Evaluation—0
SLIDE: A Framework Integrating Small and Large Language Models for Open-Domain Dialogues EvaluationCode0
PairEval: Open-domain Dialogue Evaluation with Pairwise ComparisonCode0
Emphasising Structured Information: Integrating Abstract Meaning Representation into LLMs for Enhanced Open-Domain Dialogue EvaluationCode0
CodingTeachLLM: Empowering LLM's Coding Ability via AST Prior Knowledge—0
A Comprehensive Analysis of the Effectiveness of Large Language Models as Automatic Dialogue EvaluatorsCode0
Show:102550
← PrevPage 2 of 10Next →

Benchmark Results

#ModelMetricClaimedVerifiedStatus
1MDD-EvalSpearman Correlation0.51—Unverified
2Lin-Reg (all)Spearman Correlation0.49—Unverified
3USRSpearman Correlation0.42—Unverified
4USR - DR (x = c)Spearman Correlation0.32—Unverified
5USR - MLMSpearman Correlation0.31—Unverified
6USR - DR (x = f)Spearman Correlation0.14—Unverified
#ModelMetricClaimedVerifiedStatus
1Lin-Reg (all)Spearman Correlation0.54—Unverified
2USR - DR (x = c)Spearman Correlation0.48—Unverified
3USRSpearman Correlation0.47—Unverified
4USR - MLMSpearman Correlation0.08—Unverified
5USR - DR (x = f)Spearman Correlation-0.05—Unverified