Language Modelling

A language model is a model of natural language. Language models are useful for a variety of tasks, including speech recognition, machine translation, natural language generation (generating more human-like text), optical character recognition, route optimization, handwriting recognition, grammar induction, and information retrieval.

Large language models (LLMs), currently their most advanced form, are predominantly based on transformers trained on larger datasets (frequently using words scraped from the public internet). They have superseded recurrent neural network-based models, which had previously superseded the purely statistical models, such as word n-gram language model.

Source: Wikipedia

Papers

Recently Added Most Hyped Most Active Needs Verification Most Verified

Showing 13801–13850 of 17610 papers

Title	Date	Tasks	Status
Towards Continual Entity Learning in Language Models for Conversational Agents	Jul 30, 2021	Language ModelingLanguage Modelling	—Unverified
Goal-Oriented Script Construction	Jul 28, 2021	ArticlesLanguage Modeling	CodeCode Available
Combining Probabilistic Logic and Deep Learning for Self-Supervised Learning	Jul 27, 2021	Active LearningDeep Learning	—Unverified
Cross-lingual Transferring of Pre-trained Contextualized Language Models	Jul 27, 2021	Language ModelingLanguage Modelling	—Unverified
Fine-Grained Emotion Prediction by Modeling Emotion Definitions	Jul 26, 2021	Language ModelingLanguage Modelling	CodeCode Available
Exploiting Language Model for Efficient Linguistic Steganalysis	Jul 26, 2021	Language ModelingLanguage Modelling	—Unverified
A Differentiable Language Model Adversarial Attack on Text Classifiers	Jul 23, 2021	Adversarial AttackLanguage Modeling	—Unverified
Back-Translated Task Adaptive Pretraining: Improving Accuracy and Robustness on Text Classification	Jul 22, 2021	Language ModelingLanguage Modelling	—Unverified
DeepTitle -- Leveraging BERT to generate Search Engine Optimized Headlines	Jul 22, 2021	Abstractive Text SummarizationArticles	—Unverified
FNetAR: Mixing Tokens with Autoregressive Fourier Transforms	Jul 22, 2021	Language ModellingTime Series	CodeCode Available
Neuradicon: operational representation learning of neuroimaging reports	Jul 21, 2021	FormLanguage Modelling	—Unverified
The Effectiveness of Intermediate-Task Training for Code-Switched Natural Language Understanding	Jul 21, 2021	Language ModellingNatural Language Inference	—Unverified
Learning ULMFiT and Self-Distillation with Calibration for Medical Dialogue System	Jul 20, 2021	Decision MakingKnowledge Distillation	—Unverified
Seed Words Based Data Selection for Language Model Adaptation	Jul 20, 2021	Language ModelingLanguage Modelling	—Unverified
Bridging the Gap between Language Model and Reading Comprehension: Unsupervised MRC via Self-Supervision	Jul 19, 2021	Language ModelingLanguage Modelling	—Unverified
A Vector-Based Approach to Few-Shot Veracity Classification for Automated Fact-Checking	Jul 17, 2021	ClassificationFact Checking	—Unverified
Using Language Models on Low-end Hardware	Jul 17, 2021	ClassificationLanguage Modeling	—Unverified
Intersectional Bias in Causal Language Models	Jul 16, 2021	Language ModelingLanguage Modelling	—Unverified
Are Multilingual Models the Best Choice for Moderately Under-resourced Languages? A Comprehensive Assessment for Catalan	Jul 16, 2021	Language ModelingLanguage Modelling	—Unverified
AutoBERT-Zero: Evolving BERT Backbone from Scratch	Jul 15, 2021	Inductive BiasLanguage Modelling	—Unverified
Self-Supervised Contrastive Learning with Adversarial Perturbations for Defending Word Substitution-based Attacks	Jul 15, 2021	Adversarial AttackContrastive Learning	CodeCode Available
Large-Scale News Classification using BERT Language Model: Spark NLP Approach	Jul 14, 2021	Language ModelingLanguage Modelling	—Unverified
From Machine Translation to Code-Switching: Generating High-Quality Code-Switched Text	Jul 14, 2021	Data AugmentationLanguage Modeling	CodeCode Available
From Show to Tell: A Survey on Deep Learning-based Image Captioning	Jul 14, 2021	Image CaptioningLanguage Modelling	—Unverified
A Note on Learning Rare Events in Molecular Dynamics using LSTM and Transformer	Jul 14, 2021	Language Modelling	CodeCode Available
HTLM: Hyper-Text Pre-Training and Prompting of Language Models	Jul 14, 2021	Data-to-Text GenerationDenoising	—Unverified
DeepMutants: Training neural bug detectors with contextual mutations	Jul 14, 2021	Language ModelingLanguage Modelling	—Unverified
ZR-2021VG: Zero-Resource Speech Challenge, Visually-Grounded Language Modelling track, 2021 edition	Jul 14, 2021	Language Modelling	CodeCode Available
MOOCRep: A Unified Pre-trained Embedding of MOOC Entities	Jul 12, 2021	Language ModellingRepresentation Learning	CodeCode Available
Combiner: Full Attention Transformer with Sparse Computation Cost	Jul 12, 2021	Image GenerationLanguage Modelling	CodeCode Available
Inspiration through Observation: Demonstrating the Influence of Automatically Generated Text on Creative Writing	Jul 8, 2021	Language ModellingSentence	CodeCode Available
Controlled Caption Generation for Images Through Adversarial Attacks	Jul 7, 2021	Caption GenerationImage Captioning	—Unverified
Differentiable Random Access Memory using Lattices	Jul 7, 2021	Language Modelling	CodeCode Available
KOALA: A Kalman Optimization Algorithm with Loss Adaptivity	Jul 7, 2021	Language ModelingLanguage Modelling	—Unverified
Not Quite 'Ask a Librarian': AI on the Nature, Value, and Future of LIS	Jul 7, 2021	Language ModelingLanguage Modelling	—Unverified
LanguageRefer: Spatial-Language Model for 3D Visual Grounding	Jul 7, 2021	3D visual groundingLanguage Modeling	—Unverified
DeepRapper: Neural Rap Generation with Rhyme and Rhythm Modeling	Jul 5, 2021	Language ModelingLanguage Modelling	CodeCode Available
Getting to Production with Few-shot Natural Language Generation Models	Jul 1, 2021	Language ModelingLanguage Modelling	—Unverified
Cross-Lingual Transfer Learning for Statistical Type Inference	Jul 1, 2021	Code SummarizationCross-Lingual Transfer	—Unverified
Word-Free Spoken Language Understanding for Mandarin-Chinese	Jul 1, 2021	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Projection of Turn Completion in Incremental Spoken Dialogue Systems	Jul 1, 2021	Language ModelingLanguage Modelling	—Unverified
A Simple and Efficient Probabilistic Language model for Code-Mixed Text	Jun 29, 2021	Information RetrievalLanguage Identification	—Unverified
A Knowledge-Grounded Dialog System Based on Pre-Trained Language Models	Jun 28, 2021	Language ModelingLanguage Modelling	—Unverified
What's in a Measurement? Using GPT-3 on SemEval 2021 Task 8 -- MeasEval	Jun 28, 2021	Few-Shot LearningLanguage Modelling	—Unverified
Visual Conceptual Blending with Large-scale Language and Vision Models	Jun 27, 2021	Image GenerationLanguage Modeling	—Unverified
Toward Less Hidden Cost of Code Completion with Acceptance and Ranking Models	Jun 26, 2021	Code CompletionLanguage Modelling	—Unverified
Language Models are Good Translators	Jun 25, 2021	DecoderLanguage Modeling	—Unverified
Multimodal Few-Shot Learning with Frozen Language Models	Jun 25, 2021	Few-Shot LearningLanguage Modeling	—Unverified
Learning to Sample Replacements for ELECTRA Pre-Training	Jun 25, 2021	Language ModelingLanguage Modelling	—Unverified
QASR: QCRI Aljazeera Speech Resource -- A Large Scale Annotated Arabic Speech Corpus	Jun 24, 2021	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified

Show:10 25 50

← PrevPage 277 of 353Next →

All datasets WikiText-103 Penn Treebank (Word Level)enwik8 The Pile WikiText-2 LAMBADA One Billion Word Text8 Penn Treebank (Character Level)Hutter Prize OpenWebText SALMon

Benchmark Results

#	Model	Metric	Claimed	Verified	Status
1	Decay RNN	Validation perplexity	76.67	—	Unverified
2	GRU	Validation perplexity	53.78	—	Unverified
3	LSTM	Validation perplexity	52.73	—	Unverified
4	LSTM	Test perplexity	48.7	—	Unverified
5	Temporal CNN	Test perplexity	45.2	—	Unverified
6	TCN	Test perplexity	45.19	—	Unverified
7	GCNN-8	Test perplexity	44.9	—	Unverified
8	Neural cache model (size = 100)	Test perplexity	44.8	—	Unverified
9	Neural cache model (size = 2,000)	Test perplexity	40.8	—	Unverified
10	GPT-2 Small	Test perplexity	37.5	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	TCN	Test perplexity	108.47	—	Unverified
2	Seq-U-Net	Test perplexity	107.95	—	Unverified
3	GRU (Bai et al., 2018)	Test perplexity	92.48	—	Unverified
4	R-Transformer	Test perplexity	84.38	—	Unverified
5	Zaremba et al. (2014) - LSTM (medium)	Test perplexity	82.7	—	Unverified
6	Gal & Ghahramani (2016) - Variational LSTM (medium)	Test perplexity	79.7	—	Unverified
7	LSTM (Bai et al., 2018)	Test perplexity	78.93	—	Unverified
8	Zaremba et al. (2014) - LSTM (large)	Test perplexity	78.4	—	Unverified
9	Gal & Ghahramani (2016) - Variational LSTM (large)	Test perplexity	75.2	—	Unverified
10	Inan et al. (2016) - Variational RHN	Test perplexity	66	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	LSTM (7 layers)	Bit per Character (BPC)	1.67	—	Unverified
2	Hypernetworks	Bit per Character (BPC)	1.34	—	Unverified
3	SHA-LSTM (4 layers, h=1024, no attention head)	Bit per Character (BPC)	1.33	—	Unverified
4	LN HM-LSTM	Bit per Character (BPC)	1.32	—	Unverified
5	ByteNet	Bit per Character (BPC)	1.31	—	Unverified
6	Recurrent Highway Networks	Bit per Character (BPC)	1.27	—	Unverified
7	Large FS-LSTM-4	Bit per Character (BPC)	1.25	—	Unverified
8	Large mLSTM	Bit per Character (BPC)	1.24	—	Unverified
9	AWD-LSTM (3 layers)	Bit per Character (BPC)	1.23	—	Unverified
10	Cluster-Former (#C=512)	Bit per Character (BPC)	1.22	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	Smaller Transformer 126M (pre-trained)	Test perplexity	33	—	Unverified
2	OPT 125M	Test perplexity	32.26	—	Unverified
3	Larger Transformer 771M (pre-trained)	Test perplexity	28.1	—	Unverified
4	OPT 1.3B	Test perplexity	19.55	—	Unverified
5	GPT-Neo 125M	Test perplexity	17.83	—	Unverified
6	OPT 2.7B	Test perplexity	17.81	—	Unverified
7	Smaller Transformer 126M (fine-tuned)	Test perplexity	12	—	Unverified
8	GPT-Neo 1.3B	Test perplexity	11.46	—	Unverified
9	Transformer 125M	Test perplexity	10.7	—	Unverified
10	GPT-Neo 2.7B	Test perplexity	10.44	—	Unverified