Language Modelling

A language model is a model of natural language. Language models are useful for a variety of tasks, including speech recognition, machine translation, natural language generation (generating more human-like text), optical character recognition, route optimization, handwriting recognition, grammar induction, and information retrieval.

Large language models (LLMs), currently their most advanced form, are predominantly based on transformers trained on larger datasets (frequently using words scraped from the public internet). They have superseded recurrent neural network-based models, which had previously superseded the purely statistical models, such as word n-gram language model.

Source: Wikipedia

Papers

Recently Added Most Hyped Most Active Needs Verification Most Verified

Showing 3951–4000 of 17610 papers

Title	Date	Tasks	Status	Hype
Stabilizing Transformers for Reinforcement Learning	Oct 13, 2019	General Reinforcement LearningLanguage Modeling	CodeCode Available	1
Structured Pruning of Large Language Models	Oct 10, 2019	Language ModelingLanguage Modelling	CodeCode Available	1
ZeRO: Memory Optimizations Toward Training Trillion Parameter Models	Oct 4, 2019	Cross-Lingual Document ClassificationImage Generation	CodeCode Available	1
DistilBERT, a distilled version of BERT: smaller, faster, cheaper and lighter	Oct 2, 2019	Hate Speech DetectionKnowledge Distillation	CodeCode Available	1
Reducing Transformer Depth on Demand with Structured Dropout	Sep 25, 2019	Language ModelingLanguage Modelling	CodeCode Available	1
UNITER: UNiversal Image-TExt Representation Learning	Sep 25, 2019	Image-text matchingImage-text Retrieval	CodeCode Available	1
A Critical Analysis of Biased Parsers in Unsupervised Parsing	Sep 20, 2019	Language ModelingLanguage Modelling	CodeCode Available	1
Espresso: A Fast End-to-end Neural Speech Recognition Toolkit	Sep 18, 2019	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	CodeCode Available	1
Ouroboros: On Accelerating Training of Transformer-Based Language Models	Sep 14, 2019	Language ModelingLanguage Modelling	CodeCode Available	1
CTRL: A Conditional Transformer Language Model for Controllable Generation	Sep 11, 2019	Language ModelingLanguage Modelling	CodeCode Available	1
MultiFiT: Efficient Multi-lingual Language Model Fine-tuning	Sep 10, 2019	Cross-Lingual Document ClassificationDocument Classification	CodeCode Available	1
Improved Hierarchical Patient Classification with Language Model Pretraining over Clinical Notes	Sep 6, 2019	General ClassificationLanguage Modeling	CodeCode Available	1
The Woman Worked as a Babysitter: On Biases in Language Generation	Sep 3, 2019	Language ModelingLanguage Modelling	CodeCode Available	1
Deep Equilibrium Models	Sep 3, 2019	Language ModelingLanguage Modelling	CodeCode Available	1
Global Entity Disambiguation with BERT	Sep 1, 2019	Entity DisambiguationLanguage Modelling	CodeCode Available	1
VL-BERT: Pre-training of Generic Visual-Linguistic Representations	Aug 22, 2019	Image-text matchingLanguage Modelling	CodeCode Available	1
LXMERT: Learning Cross-Modality Encoder Representations from Transformers	Aug 20, 2019	Language ModelingLanguage Modelling	CodeCode Available	1
VisualBERT: A Simple and Performant Baseline for Vision and Language	Aug 9, 2019	Language ModelingLanguage Modelling	CodeCode Available	1
On the Variance of the Adaptive Learning Rate and Beyond	Aug 8, 2019	image-classificationImage Classification	CodeCode Available	1
RoBERTa: A Robustly Optimized BERT Pretraining Approach	Jul 26, 2019	Common Sense ReasoningDocument Image Classification	CodeCode Available	1
ELI5: Long Form Question Answering	Jul 22, 2019	FormLanguage Modeling	CodeCode Available	1
Lexical Simplification with Pretrained Encoders	Jul 14, 2019	Language ModellingLexical Simplification	CodeCode Available	1
Hello, It's GPT-2 -- How Can I Help You? Towards the Use of Pretrained Language Models for Task-Oriented Dialogue Systems	Jul 12, 2019	Decision MakingLanguage Modeling	CodeCode Available	1
Evaluating Language Model Finetuning Techniques for Low-resource Languages	Jun 30, 2019	Language ModelingLanguage Modelling	CodeCode Available	1
Language Modelling Makes Sense: Propagating Representations through WordNet for Full-Coverage Word Sense Disambiguation	Jun 24, 2019	Language ModellingLEMMA	CodeCode Available	1
A Tensorized Transformer for Language Modeling	Jun 24, 2019	DecoderLanguage Modeling	CodeCode Available	1
XLNet: Generalized Autoregressive Pretraining for Language Understanding	Jun 19, 2019	Audio Question AnsweringChinese Reading Comprehension	CodeCode Available	1
How multilingual is Multilingual BERT?	Jun 4, 2019	Language ModelingLanguage Modelling	CodeCode Available	1
Does It Make Sense? And Why? A Pilot Study for Sense Making and Explanation	Jun 2, 2019	Common Sense ReasoningLanguage Modeling	CodeCode Available	1
Learning to Generate Grounded Visual Captions without Localization Supervision	Jun 1, 2019	Image CaptioningLanguage Modelling	CodeCode Available	1
Adapting Text Embeddings for Causal Inference	May 29, 2019	Causal IdentificationCausal Inference	CodeCode Available	1
CIF: Continuous Integrate-and-Fire for End-to-End Speech Recognition	May 27, 2019	DecoderLanguage Modelling	CodeCode Available	1
Discrete Flows: Invertible Generative Models of Discrete Data	May 24, 2019	Language ModelingLanguage Modelling	CodeCode Available	1
Adaptive Attention Span in Transformers	May 19, 2019	8kLanguage Modeling	CodeCode Available	1
A Surprisingly Robust Trick for Winograd Schema Challenge	May 15, 2019	Common Sense ReasoningCoreference Resolution	CodeCode Available	1
What do you learn from context? Probing for sentence structure in contextualized word representations	May 15, 2019	Language ModellingSentence	CodeCode Available	1
How to Fine-Tune BERT for Text Classification?	May 14, 2019	General ClassificationLanguage Modeling	CodeCode Available	1
RWTH ASR Systems for LibriSpeech: Hybrid vs Attention -- w/o Data Augmentation	May 8, 2019	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	CodeCode Available	1
The Curious Case of Neural Text Degeneration	Apr 22, 2019	DiversityLanguage Modeling	CodeCode Available	1
Mask-Predict: Parallel Decoding of Conditional Masked Language Models	Apr 19, 2019	Language ModelingLanguage Modelling	CodeCode Available	1
SpecAugment: A Simple Data Augmentation Method for Automatic Speech Recognition	Apr 18, 2019	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	CodeCode Available	1
fairseq: A Fast, Extensible Toolkit for Sequence Modeling	Apr 1, 2019	Language ModelingLanguage Modelling	CodeCode Available	1
SciBERT: A Pretrained Language Model for Scientific Text	Mar 26, 2019	Citation Intent ClassificationDependency Parsing	CodeCode Available	1
A Fully Differentiable Beam Search Decoder	Feb 16, 2019	DecoderLanguage Modeling	CodeCode Available	1
Language Models are Unsupervised Multitask Learners	Feb 14, 2019	Common Sense ReasoningCoreference Resolution	CodeCode Available	1
Pay Less Attention with Lightweight and Dynamic Convolutions	Jan 29, 2019	Abstractive Text SummarizationLanguage Modeling	CodeCode Available	1
BioBERT: a pre-trained biomedical language representation model for biomedical text mining	Jan 25, 2019	Drug–drug Interaction ExtractionFew-Shot Learning	CodeCode Available	1
Transformer-XL: Attentive Language Models Beyond a Fixed-Length Context	Jan 9, 2019	ArticlesLanguage Modeling	CodeCode Available	1
Writer-Aware CNN for Parsimonious HMM-Based Offline Handwritten Chinese Text Recognition	Dec 24, 2018	Handwritten Chinese Text RecognitionLanguage Modeling	CodeCode Available	1
What Is One Grain of Sand in the Desert? Analyzing Individual Neurons in Deep NLP Models	Dec 21, 2018	Language ModelingLanguage Modelling	CodeCode Available	1

Show:10 25 50

← PrevPage 80 of 353Next →

All datasets WikiText-103 Penn Treebank (Word Level)enwik8 The Pile WikiText-2 LAMBADA One Billion Word Text8 Penn Treebank (Character Level)Hutter Prize OpenWebText SALMon

Benchmark Results

#	Model	Metric	Claimed	Verified	Status
1	Decay RNN	Validation perplexity	76.67	—	Unverified
2	GRU	Validation perplexity	53.78	—	Unverified
3	LSTM	Validation perplexity	52.73	—	Unverified
4	LSTM	Test perplexity	48.7	—	Unverified
5	Temporal CNN	Test perplexity	45.2	—	Unverified
6	TCN	Test perplexity	45.19	—	Unverified
7	GCNN-8	Test perplexity	44.9	—	Unverified
8	Neural cache model (size = 100)	Test perplexity	44.8	—	Unverified
9	Neural cache model (size = 2,000)	Test perplexity	40.8	—	Unverified
10	GPT-2 Small	Test perplexity	37.5	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	TCN	Test perplexity	108.47	—	Unverified
2	Seq-U-Net	Test perplexity	107.95	—	Unverified
3	GRU (Bai et al., 2018)	Test perplexity	92.48	—	Unverified
4	R-Transformer	Test perplexity	84.38	—	Unverified
5	Zaremba et al. (2014) - LSTM (medium)	Test perplexity	82.7	—	Unverified
6	Gal & Ghahramani (2016) - Variational LSTM (medium)	Test perplexity	79.7	—	Unverified
7	LSTM (Bai et al., 2018)	Test perplexity	78.93	—	Unverified
8	Zaremba et al. (2014) - LSTM (large)	Test perplexity	78.4	—	Unverified
9	Gal & Ghahramani (2016) - Variational LSTM (large)	Test perplexity	75.2	—	Unverified
10	Inan et al. (2016) - Variational RHN	Test perplexity	66	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	LSTM (7 layers)	Bit per Character (BPC)	1.67	—	Unverified
2	Hypernetworks	Bit per Character (BPC)	1.34	—	Unverified
3	SHA-LSTM (4 layers, h=1024, no attention head)	Bit per Character (BPC)	1.33	—	Unverified
4	LN HM-LSTM	Bit per Character (BPC)	1.32	—	Unverified
5	ByteNet	Bit per Character (BPC)	1.31	—	Unverified
6	Recurrent Highway Networks	Bit per Character (BPC)	1.27	—	Unverified
7	Large FS-LSTM-4	Bit per Character (BPC)	1.25	—	Unverified
8	Large mLSTM	Bit per Character (BPC)	1.24	—	Unverified
9	AWD-LSTM (3 layers)	Bit per Character (BPC)	1.23	—	Unverified
10	Cluster-Former (#C=512)	Bit per Character (BPC)	1.22	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	Smaller Transformer 126M (pre-trained)	Test perplexity	33	—	Unverified
2	OPT 125M	Test perplexity	32.26	—	Unverified
3	Larger Transformer 771M (pre-trained)	Test perplexity	28.1	—	Unverified
4	OPT 1.3B	Test perplexity	19.55	—	Unverified
5	GPT-Neo 125M	Test perplexity	17.83	—	Unverified
6	OPT 2.7B	Test perplexity	17.81	—	Unverified
7	Smaller Transformer 126M (fine-tuned)	Test perplexity	12	—	Unverified
8	GPT-Neo 1.3B	Test perplexity	11.46	—	Unverified
9	Transformer 125M	Test perplexity	10.7	—	Unverified
10	GPT-Neo 2.7B	Test perplexity	10.44	—	Unverified