SOTAVerified

Natural Language Inference

Natural language inference (NLI) is the task of determining whether a "hypothesis" is true (entailment), false (contradiction), or undetermined (neutral) given a "premise".

Example:

| Premise | Label | Hypothesis | | --- | ---| --- | | A man inspects the uniform of a figure in some East Asian country. | contradiction | The man is sleeping. | | An older and younger man smiling. | neutral | Two men are smiling and laughing at the cats playing on the floor. | | A soccer game with multiple males playing. | entailment | Some men are playing a sport. |

Approaches used for NLI include earlier symbolic and statistical approaches to more recent deep learning approaches. Benchmark datasets used for NLI include SNLI, MultiNLI, SciTail, among others. You can get hands-on practice on the SNLI task by following this d2l.ai chapter.

Further readings:

Papers

Showing 851–900 of 1961 papers

TitleStatusHype
deepCybErNet at EmoInt-2017: Deep Emotion Intensities in Tweets—0
Automatic Evaluation of Summary Using Textual Entailment—0
Decomposing and Comparing Meaning Relations: Paraphrasing, Textual Entailment, Contradiction, and Specificity—0
An\'alise de Medidas de Similaridade Sem\^antica na Tarefa de Reconhecimento de Implica \~ao Textual (Analysis of Semantic Similarity Measures in the Recognition of Textual Entailment Task)[In Portuguese]—0
Automatic Building and Using Parallel Resources for SMT from Comparable Corpora—0
Dead parrots make bad pets: Exploring modifier effects in noun phrases—0
PECO: Examining Single Sentence Label Leakage in Natural Language Inference Datasets through Progressive Evaluation of Cluster Outliers—0
A Fact Checking and Verification System for FEVEROUS Using a Zero-Shot Learning Approach—0
Acquiring Predicate Paraphrases from News Tweets—0
Data-aware Low-Rank Compression for Large NLP Models—0
Data Augmentation with Adversarial Training for Cross-Lingual NLI—0
Auto-GDA: Automatic Domain Adaptation for Efficient Grounding Verification in Retrieval Augmented Generation—0
Curriculum Discovery through an Encompassing Curriculum Learning Framework—0
A Unified Kernel Approach for Learning Typed Sentence Rewritings—0
Adversarial Training for Large Neural Language Models—0
CSReader at SemEval-2018 Task 11: Multiple Choice Question Answering as Textual Entailment—0
Augmenting NLP data to counter Annotation Artifacts for NLI Tasks—0
CS-NLP team at SemEval-2020 Task 4: Evaluation of State-of-the-art NLP Deep Learning Architectures on Commonsense Reasoning Task—0
A Multilingual Perspective Towards the Evaluation of Attribution Methods—0
Crowdsourcing Inference-Rule Evaluation—0
IITP at MEDIQA 2019: Systems Report for Natural Language Inference, Question Entailment and Question Answering—0
Crowdsourcing Complex Language Resources: Playing to Annotate Dependency Syntax—0
IITP-AI-NLP-ML@ CL-SciSumm 2020, CL-LaySumm 2020, LongSumm 2020—0
I do not disagree: leveraging monolingual alignment to detect disagreement in dialogue—0
Crowd-Calibrator: Can Annotator Disagreement Inform Calibration in Subjective Tasks?—0
A Type-Theoretical system for the FraCaS test suite: Grammatical Framework meets Coq—0
Adversarial Text Normalization—0
A corpus of precise natural textual entailment problems—0
A Bayesian Approach to Unsupervised Semantic Role Induction—0
Defining and Evaluating Decision and Composite Risk in Language Models Applied to Natural Language Inference—0
Cross-Policy Compliance Detection via Question Answering—0
Identifying science concepts and student misconceptions in an interactive essay writing tutor—0
A Two Level Model for Context Sensitive Inference Rules—0
Identifying hypernyms in distributional semantic spaces—0
Identifying Factual Inconsistencies in Summaries: Grounding LLM Inference via Task Taxonomy—0
Identifying Constant and Unique Relations by using Time-Series Text—0
A Multi-level Supervised Contrastive Learning Framework for Low-Resource Natural Language Inference—0
Identification of Entailment and Contradiction Relations between Natural Language Sentences: A Neurosymbolic Approach—0
ICT: A Translation based Method for Cross-lingual Textual Entailment—0
IBM MNLP IE at CASE 2021 Task 2: NLI Reranking for Zero-Shot Text Classification—0
Cross-Lingual Transfer with MAML on Trees—0
Identifying Semantic Edit Intentions from Revisions in Wikipedia—0
Identifying Untyped Relation Mentions in a Corpus given an Ontology—0
Hypothesis-only Biases in Large Language Model-Elicited Natural Language Inference—0
Cross-lingual Transfer or Machine Translation? On Data Augmentation for Monolingual Semantic Textual Similarity—0
IFlyLegal: A Chinese Legal System for Consultation, Law Searching, and Document Analysis—0
Cross-lingual Transfer of Semantic Role Labeling Models—0
Attentive Tree-structured Network for Monotonicity Reasoning—0
A Multi-Domain Framework for Textual Similarity. A Case Study on Question-to-Question and Question-Answering Similarity Tasks—0
HypoNLI: Exploring the Artificial Patterns of Hypothesis-only Bias in Natural Language Inference—0
Show:102550
← PrevPage 18 of 40Next →

Benchmark Results

#ModelMetricClaimedVerifiedStatus
1UnitedSynT5 (3B)% Test Accuracy94.7—Unverified
2UnitedSynT5 (335M)% Test Accuracy93.5—Unverified
3EFL (Entailment as Few-shot Learner) + RoBERTa-large% Test Accuracy93.1—Unverified
4Neural Tree Indexers for Text Understanding% Test Accuracy93.1—Unverified
5RoBERTa-large + self-explaining layer% Test Accuracy92.3—Unverified
6RoBERTa-large+Self-Explaining% Test Accuracy92.3—Unverified
7CA-MTL% Test Accuracy92.1—Unverified
8SemBERT% Test Accuracy91.9—Unverified
9MT-DNN-SMARTLARGEv0% Test Accuracy91.7—Unverified
10MT-DNN-SMART_100%ofTrainingDataDev Accuracy91.6—Unverified
#ModelMetricClaimedVerifiedStatus
1Vega v2 6B (KD-based prompt transfer)Accuracy96—Unverified
2PaLM 540B (fine-tuned)Accuracy95.7—Unverified
3Turing NLR v5 XXL 5.4B (fine-tuned)Accuracy94.1—Unverified
4ST-MoE-32B 269B (fine-tuned)Accuracy93.5—Unverified
5DeBERTa-1.5BAccuracy93.2—Unverified
6MUPPET Roberta LargeAccuracy92.8—Unverified
7DeBERTaV3largeAccuracy92.7—Unverified
8T5-XXL 11B (fine-tuned)Accuracy92.5—Unverified
9T5-XXL 11BAccuracy92.5—Unverified
10UL2 20B (fine-tuned)Accuracy92.1—Unverified
#ModelMetricClaimedVerifiedStatus
1UnitedSynT5 (3B)Matched92.6—Unverified
2Turing NLR v5 XXL 5.4B (fine-tuned)Matched92.6—Unverified
3T5-XXL 11B (fine-tuned)Matched92—Unverified
4T5Matched92—Unverified
5T5-11BMismatched91.7—Unverified
6T5-3BMatched91.4—Unverified
7ALBERTMatched91.3—Unverified
8Adv-RoBERTa ensembleMatched91.1—Unverified
9DeBERTa (large)Matched91.1—Unverified
10SMARTRoBERTaDev Matched91.1—Unverified