Language Modelling

A language model is a model of natural language. Language models are useful for a variety of tasks, including speech recognition, machine translation, natural language generation (generating more human-like text), optical character recognition, route optimization, handwriting recognition, grammar induction, and information retrieval.

Large language models (LLMs), currently their most advanced form, are predominantly based on transformers trained on larger datasets (frequently using words scraped from the public internet). They have superseded recurrent neural network-based models, which had previously superseded the purely statistical models, such as word n-gram language model.

Source: Wikipedia

Papers

Recently Added Most Hyped Most Active Needs Verification Most Verified

Showing 16851–16900 of 17610 papers

Title	Date	Tasks	Status
Cropper: Vision-Language Model for Image Cropping through In-Context Learning	Aug 14, 2024	Image CroppingIn-Context Learning	—Unverified
Cross-Architecture Transfer Learning for Linear-Cost Inference Transformers	Apr 3, 2024	Language ModelingLanguage Modelling	—Unverified
Cross-composition Feature Disentanglement for Compositional Zero-shot Learning	Aug 19, 2024	AttributeCompositional Zero-Shot Learning	—Unverified
Cross-Domain Language Modeling: An Empirical Investigation	Dec 1, 2021	Language ModelingLanguage Modelling	—Unverified
Cross-Domain Semantic Segmentation with Large Language Model-Assisted Descriptor Generation	Jan 27, 2025	Language ModelingLanguage Modelling	—Unverified
Cross-Examiner: Evaluating Consistency of Large Language Model-Generated Explanations	Mar 11, 2025	Language ModelingLanguage Modelling	—Unverified
Crossing New Frontiers: Knowledge-Augmented Large Language Model Prompting for Zero-Shot Text-Based De Novo Molecule Design	Aug 18, 2024	Language ModelingLanguage Modelling	—Unverified
Cross-Lingual Ability of Multilingual Masked Language Models: A Study of Language Structure	Mar 16, 2022	Language ModelingLanguage Modelling	—Unverified
Cross-Lingual Transfer Learning for Statistical Type Inference	Jul 1, 2021	Code SummarizationCross-Lingual Transfer	—Unverified
Cross-lingual Transfer of Abstractive Summarizer to Less-resource Language	Dec 8, 2020	Abstractive Text SummarizationArticles	—Unverified
Cross-lingual Character-Level Neural Morphological Tagging	Sep 1, 2017	Language ModelingLanguage Modelling	—Unverified
Cross-lingual Universal Dependency Parsing Only from One Monolingual Treebank	Dec 24, 2020	Cross-Lingual TransferDependency Parsing	—Unverified
Cross-Lingual Dependency Parsing by POS-Guided Word Reordering	Nov 1, 2020	Dependency ParsingLanguage Modeling	—Unverified
Cross-Lingual Language Modeling with Syntactic Reordering for Low-Resource Speech Recognition	Jul 1, 2012	Language ModelingLanguage Modelling	—Unverified
Cross-Lingual Language Model Meta-Pretraining	Sep 23, 2021	Cross-Lingual TransferLanguage Modeling	—Unverified
Cross-lingual Model Transfer Using Feature Representation Projection	Jun 1, 2014	Language Modellingmodel	—Unverified
Cross-Lingual NER for Financial Transaction Data in Low-Resource Languages	Jul 16, 2023	Cross-Lingual NERKnowledge Distillation	—Unverified
Cross-lingual projection for class-based language models	Aug 1, 2016	Language ModelingLanguage Modelling	—Unverified
Cross-lingual Pronoun Prediction for English, French and German with Maximum Entropy Classification	Aug 1, 2016	General ClassificationLanguage Modeling	—Unverified
Cross-lingual Pronoun Prediction with Linguistically Informed Features	Aug 1, 2016	Coreference ResolutionLanguage Modeling	—Unverified
Cross-Lingual Pronoun Prediction with Deep Recurrent Neural Networks	Aug 1, 2016	Language ModelingLanguage Modelling	—Unverified
Cross-Lingual QA as a Stepping Stone for Monolingual Open QA in Icelandic	Jul 5, 2022	Language ModelingLanguage Modelling	—Unverified
Cross-Lingual Speaker Identification from Weak Local Evidence	Jan 16, 2022	Language ModelingLanguage Modelling	—Unverified
Cross-Lingual Speaker Verification with Domain-Balanced Hard Prototype Mining and Language-Dependent Score Normalization	Jul 15, 2020	Language ModellingSpeaker Verification	—Unverified
Crosslingual Structural Priming and the Pre-Training Dynamics of Bilingual Language Models	Oct 11, 2023	Language ModelingLanguage Modelling	—Unverified
Cross-lingual Subjectivity Detection for Resource Lean Languages	Jun 1, 2019	Language ModelingLanguage Modelling	—Unverified
Cross-Lingual Supervision improves Large Language Models Pre-training	May 19, 2023	In-Context LearningLanguage Modeling	—Unverified
Cross-Lingual Text Classification with Multilingual Distillation and Zero-Shot-Aware Training	Feb 28, 2022	Language ModelingLanguage Modelling	—Unverified
Cross-lingual Transfer for Automatic Question Generation by Learning Interrogative Structures in Target Languages	Oct 4, 2024	ChatbotCross-Lingual Transfer	—Unverified
Cross-Lingual Transfer for Distantly Supervised and Low-resources Indonesian NER	Jul 25, 2019	Cross-Lingual TransferLanguage Modeling	—Unverified
Cross-Lingual Transfer Learning for Phrase Break Prediction with Multilingual Language Model	Jun 5, 2023	Cross-Lingual TransferLanguage Modeling	—Unverified
Cross-Lingual Transfer Learning for POS Tagging without Cross-Lingual Resources	Sep 1, 2017	Cross-Lingual TransferLanguage Modeling	—Unverified
Cross-lingual Transfer Learning for Pre-trained Contextualized Language Models	Jan 1, 2021	Cross-Lingual TransferLanguage Modeling	—Unverified
Cross-lingual Transfer Learning with Data Selection for Large-Scale Spoken Language Understanding	Nov 1, 2019	Cross-Lingual TransferLanguage Modeling	—Unverified
Cross-lingual Transfer of Semantic Role Labeling Models	Aug 1, 2013	Cross-Lingual TransferLanguage Modelling	—Unverified
Cross-lingual Transferring of Pre-trained Contextualized Language Models	Jul 27, 2021	Language ModelingLanguage Modelling	—Unverified
Cross-Lingual Transformers for Neural Automatic Post-Editing	Nov 1, 2020	Automatic Post-EditingLanguage Modeling	—Unverified
Cross-Lingual UMLS Named Entity Linking using UMLS Dictionary Fine-Tuning	Nov 16, 2021	DescriptiveEntity Linking	—Unverified
Cross-Lingual Unsupervised Sentiment Classification with Multi-View Transfer Learning	Jul 1, 2020	ClassificationCross-Lingual Sentiment Classification	—Unverified
Cross-Lingual Word Embeddings for Low-Resource Language Modeling	Apr 1, 2017	Cross-Lingual Word EmbeddingsLanguage Modeling	—Unverified
Cross-Media Scientific Research Achievements Retrieval Based on Deep Language Model	Mar 29, 2022	Cross-Modal RetrievalLanguage Modeling	—Unverified
Cross-modal Alignment with Optimal Transport for CTC-based ASR	Sep 24, 2023	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Cross-modality debiasing: using language to mitigate sub-population shifts in imaging	Feb 2, 2024	Language ModelingLanguage Modelling	—Unverified
Cross-Modal Similarity-Based Curriculum Learning for Image Captioning	Dec 14, 2022	Image CaptioningLanguage Modeling	—Unverified
CrossQuant: A Post-Training Quantization Method with Smaller Quantization Kernel for Precise Large Language Model Compression	Oct 10, 2024	Language ModelingLanguage Modelling	—Unverified
Cross-utterance Reranking Models with BERT and Graph Convolutional Networks for Conversational Speech Recognition	Jun 13, 2021	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Cross-sentence Pre-trained Model for Interactive QA matching	May 1, 2020	Language ModelingLanguage Modelling	—Unverified
Cross-target Stance Detection by Exploiting Target Analytical Perspectives	Jan 3, 2024	Language ModelingLanguage Modelling	—Unverified
CrossTune: Black-Box Few-Shot Classification with Label Enhancement	Mar 19, 2024	Few-Shot Text ClassificationIn-Context Learning	—Unverified
Cross-utterance ASR Rescoring with Graph-based Label Propagation	Mar 27, 2023	FairnessLanguage Modeling	—Unverified

Show:10 25 50

← PrevPage 338 of 353Next →

All datasets WikiText-103 Penn Treebank (Word Level)enwik8 The Pile WikiText-2 LAMBADA One Billion Word Text8 Penn Treebank (Character Level)Hutter Prize OpenWebText SALMon

Benchmark Results

#	Model	Metric	Claimed	Verified	Status
1	Decay RNN	Validation perplexity	76.67	—	Unverified
2	GRU	Validation perplexity	53.78	—	Unverified
3	LSTM	Validation perplexity	52.73	—	Unverified
4	LSTM	Test perplexity	48.7	—	Unverified
5	Temporal CNN	Test perplexity	45.2	—	Unverified
6	TCN	Test perplexity	45.19	—	Unverified
7	GCNN-8	Test perplexity	44.9	—	Unverified
8	Neural cache model (size = 100)	Test perplexity	44.8	—	Unverified
9	Neural cache model (size = 2,000)	Test perplexity	40.8	—	Unverified
10	GPT-2 Small	Test perplexity	37.5	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	TCN	Test perplexity	108.47	—	Unverified
2	Seq-U-Net	Test perplexity	107.95	—	Unverified
3	GRU (Bai et al., 2018)	Test perplexity	92.48	—	Unverified
4	R-Transformer	Test perplexity	84.38	—	Unverified
5	Zaremba et al. (2014) - LSTM (medium)	Test perplexity	82.7	—	Unverified
6	Gal & Ghahramani (2016) - Variational LSTM (medium)	Test perplexity	79.7	—	Unverified
7	LSTM (Bai et al., 2018)	Test perplexity	78.93	—	Unverified
8	Zaremba et al. (2014) - LSTM (large)	Test perplexity	78.4	—	Unverified
9	Gal & Ghahramani (2016) - Variational LSTM (large)	Test perplexity	75.2	—	Unverified
10	Inan et al. (2016) - Variational RHN	Test perplexity	66	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	LSTM (7 layers)	Bit per Character (BPC)	1.67	—	Unverified
2	Hypernetworks	Bit per Character (BPC)	1.34	—	Unverified
3	SHA-LSTM (4 layers, h=1024, no attention head)	Bit per Character (BPC)	1.33	—	Unverified
4	LN HM-LSTM	Bit per Character (BPC)	1.32	—	Unverified
5	ByteNet	Bit per Character (BPC)	1.31	—	Unverified
6	Recurrent Highway Networks	Bit per Character (BPC)	1.27	—	Unverified
7	Large FS-LSTM-4	Bit per Character (BPC)	1.25	—	Unverified
8	Large mLSTM	Bit per Character (BPC)	1.24	—	Unverified
9	AWD-LSTM (3 layers)	Bit per Character (BPC)	1.23	—	Unverified
10	Cluster-Former (#C=512)	Bit per Character (BPC)	1.22	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	Smaller Transformer 126M (pre-trained)	Test perplexity	33	—	Unverified
2	OPT 125M	Test perplexity	32.26	—	Unverified
3	Larger Transformer 771M (pre-trained)	Test perplexity	28.1	—	Unverified
4	OPT 1.3B	Test perplexity	19.55	—	Unverified
5	GPT-Neo 125M	Test perplexity	17.83	—	Unverified
6	OPT 2.7B	Test perplexity	17.81	—	Unverified
7	Smaller Transformer 126M (fine-tuned)	Test perplexity	12	—	Unverified
8	GPT-Neo 1.3B	Test perplexity	11.46	—	Unverified
9	Transformer 125M	Test perplexity	10.7	—	Unverified
10	GPT-Neo 2.7B	Test perplexity	10.44	—	Unverified