Language Modelling

A language model is a model of natural language. Language models are useful for a variety of tasks, including speech recognition, machine translation, natural language generation (generating more human-like text), optical character recognition, route optimization, handwriting recognition, grammar induction, and information retrieval.

Large language models (LLMs), currently their most advanced form, are predominantly based on transformers trained on larger datasets (frequently using words scraped from the public internet). They have superseded recurrent neural network-based models, which had previously superseded the purely statistical models, such as word n-gram language model.

Source: Wikipedia

Papers

Recently Added Most Hyped Most Active Needs Verification Most Verified

Showing 16801–16850 of 17610 papers

Title	Date	Tasks	Status
Correlated Bigram LSA for Unsupervised Language Model Adaptation	Dec 1, 2008	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
Correlation Dimension of Natural Language in a Statistical Manifold	May 10, 2024	Language ModelingLanguage Modelling	—Unverified
Corruption Is Not All Bad: Incorporating Discourse Structure into Pre-training via Corruption for Essay Scoring	Oct 13, 2020	AllAutomated Essay Scoring	—Unverified
Cortical microcircuits as gated-recurrent neural networks	Nov 7, 2017	image-classificationImage Classification	—Unverified
CoSiNES: Contrastive Siamese Network for Entity Standardization	Jun 5, 2023	Language ModelingLanguage Modelling	—Unverified
COSMIC: Data Efficient Instruction-tuning For Speech In-Context Learning	Nov 3, 2023	Automatic Speech RecognitionAutomatic Speech Recognition (ASR)	—Unverified
COSMO: COntrastive Streamlined MultimOdal Model with Interleaved Pre-Training	Jan 1, 2024	Language ModellingReading Comprehension	—Unverified
Cost-Effective Proxy Reward Model Construction with On-Policy and Active Learning	Jul 2, 2024	Active LearningLanguage Modelling	—Unverified
Could a Large Language Model be Conscious?	Mar 4, 2023	Language ModelingLanguage Modelling	—Unverified
Count-based State Merging for Probabilistic Regular Tree Grammars	Jan 1, 2015	Language Modelling	—Unverified
Counterfactual Memorization in Neural Language Models	Dec 24, 2021	counterfactualLanguage Modeling	—Unverified
MCD: A Model-Agnostic Counterfactual Search Method For Multi-modal Design Modifications	May 18, 2023	counterfactualLanguage Modelling	—Unverified
Countering Language Drift via Grounding	Sep 27, 2018	Language ModelingLanguage Modelling	—Unverified
Countering Language Drift via Visual Grounding	Sep 10, 2019	Language ModelingLanguage Modelling	—Unverified
Counting in Language with RNNs	Oct 29, 2018	Language ModelingLanguage Modelling	—Unverified
Counting the Bugs in ChatGPT's Wugs: A Multilingual Investigation into the Morphological Capabilities of a Large Language Model	Oct 23, 2023	Language ModelingLanguage Modelling	—Unverified
CountLLM: Towards Generalizable Repetitive Action Counting via Large Language Model	Mar 22, 2025	Language ModelingLanguage Modelling	—Unverified
Coupled intrinsic and extrinsic human language resource-based query expansion	Apr 23, 2020	Information RetrievalLanguage Modeling	—Unverified
Coupling Symbolic Reasoning with Language Modeling for Efficient Longitudinal Understanding of Unstructured Electronic Medical Records	Aug 7, 2023	Language ModelingLanguage Modelling	—Unverified
CourseGPT-zh: an Educational Large Language Model Based on Knowledge Distillation Incorporating Prompt Optimization	May 8, 2024	DiversityKnowledge Distillation	—Unverified
COVID-19 sentiment analysis via deep learning during the rise of novel cases	Apr 5, 2021	Language ModelingLanguage Modelling	—Unverified
COVID-19 therapy target discovery with context-aware literature mining	Jul 30, 2020	Domain AdaptationLanguage Modeling	—Unverified
CoVis: A Collaborative Framework for Fine-grained Graphic Visual Understanding	Nov 27, 2024	Language ModelingLanguage Modelling	—Unverified
Co-Writing with Opinionated Language Models Affects Users' Views	Feb 1, 2023	Language ModelingLanguage Modelling	—Unverified
CPath-Omni: A Unified Multimodal Foundation Model for Patch and Whole Slide Image Analysis in Computational Pathology	Dec 16, 2024	Language ModelingLanguage Modelling	—Unverified
CP-LLM: Context and Pixel Aware Large Language Model for Video Quality Assessment	May 21, 2025	Language ModelingLanguage Modelling	—Unverified
CPP-UT-Bench: Can LLMs Write Complex Unit Tests in C++?	Dec 3, 2024	In-Context LearningLanguage Modeling	—Unverified
CPSDBench: A Large Language Model Evaluation Benchmark and Baseline for Chinese Public Security Domain	Feb 11, 2024	Language Model EvaluationLanguage Modeling	—Unverified
CPS-LLM: Large Language Model based Safe Usage Plan Generator for Human-in-the-Loop Human-in-the-Plant Cyber-Physical System	May 19, 2024	ChatbotLanguage Modeling	—Unverified
CPTQuant -- A Novel Mixed Precision Post-Training Quantization Techniques for Large Language Models	Dec 3, 2024	Language ModelingLanguage Modelling	—Unverified
CrashSage: A Large Language Model-Centered Framework for Contextual and Interpretable Traffic Crash Analysis	May 8, 2025	Data AugmentationData Integration	—Unverified
Crawling the Internal Knowledge-Base of Language Models	Jan 30, 2023	Language ModelingLanguage Modelling	—Unverified
Creating a Large Language Model of a Philosopher	Feb 2, 2023	Language ModelingLanguage Modelling	—Unverified
Creating and using large monolingual parallel corpora for sentential paraphrase generation	May 1, 2014	Language ModellingMachine Translation	—Unverified
Creating Arabic LLM Prompts at Scale	Aug 12, 2024	Headline GenerationInstruction Following	—Unverified
Creating dialect sub-corpora by clustering: a case in Japanese for an adaptive method	May 1, 2018	ClusteringLanguage Modeling	—Unverified
Creating Domain-Specific Translation Memories for Machine Translation Fine-tuning: The TRENCARD Bilingual Cardiology Corpus	Sep 4, 2024	Language ModelingLanguage Modelling	—Unverified
Creating Large Language Model Resistant Exams: Guidelines and Strategies	Apr 18, 2023	Language ModelingLanguage Modelling	—Unverified
Creating Lithuanian and Latvian Speech Corpora from Inaccurately Annotated Web Data	May 1, 2018	Automatic Speech Recognition (ASR)Language Modeling	—Unverified
Creativity in LLM-based Multi-Agent Systems: A Survey	May 27, 2025	Image GenerationLanguage Modeling	—Unverified
Credit Risk Meets Large Language Models: Building a Risk Indicator from Loan Descriptions in P2P Lending	Jan 29, 2024	FairnessLanguage Modeling	—Unverified
CREFT: Sequential Multi-Agent LLM for Character Relation Extraction	May 30, 2025	Knowledge DistillationLanguage Modeling	—Unverified
Mitigating Biases for Instruction-following Language Models via Bias Neurons Elimination	Nov 16, 2023	Instruction FollowingLanguage Modelling	—Unverified
Critical Batch Size Revisited: A Simple Empirical Approach to Large-Batch Language Model Training	May 29, 2025	Language ModelingLanguage Modelling	—Unverified
Critical Data Size of Language Models from a Grokking Perspective	Jan 19, 2024	Language ModelingLanguage Modelling	—Unverified
Critical Phase Transition in Large Language Models	Jun 8, 2024	Language ModellingLarge Language Model	—Unverified
Critic-CoT: Boosting the reasoning abilities of large language model via Chain-of-thoughts Critic	Aug 29, 2024	GSM8KLanguage Modeling	—Unverified
Croatian Dependency Treebank: Recent Development and Initial Experiments	May 1, 2012	Dependency ParsingLanguage Modelling	—Unverified
CROME: Cross-Modal Adapters for Efficient Multimodal LLM	Aug 13, 2024	Instruction FollowingLanguage Modeling	—Unverified
Croppable Knowledge Graph Embedding	Jul 3, 2024	Graph EmbeddingKnowledge Graph Embedding	—Unverified

Show:10 25 50

← PrevPage 337 of 353Next →

All datasets WikiText-103 Penn Treebank (Word Level)enwik8 The Pile WikiText-2 LAMBADA One Billion Word Text8 Penn Treebank (Character Level)Hutter Prize OpenWebText SALMon

Benchmark Results

#	Model	Metric	Claimed	Verified	Status
1	Decay RNN	Validation perplexity	76.67	—	Unverified
2	GRU	Validation perplexity	53.78	—	Unverified
3	LSTM	Validation perplexity	52.73	—	Unverified
4	LSTM	Test perplexity	48.7	—	Unverified
5	Temporal CNN	Test perplexity	45.2	—	Unverified
6	TCN	Test perplexity	45.19	—	Unverified
7	GCNN-8	Test perplexity	44.9	—	Unverified
8	Neural cache model (size = 100)	Test perplexity	44.8	—	Unverified
9	Neural cache model (size = 2,000)	Test perplexity	40.8	—	Unverified
10	GPT-2 Small	Test perplexity	37.5	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	TCN	Test perplexity	108.47	—	Unverified
2	Seq-U-Net	Test perplexity	107.95	—	Unverified
3	GRU (Bai et al., 2018)	Test perplexity	92.48	—	Unverified
4	R-Transformer	Test perplexity	84.38	—	Unverified
5	Zaremba et al. (2014) - LSTM (medium)	Test perplexity	82.7	—	Unverified
6	Gal & Ghahramani (2016) - Variational LSTM (medium)	Test perplexity	79.7	—	Unverified
7	LSTM (Bai et al., 2018)	Test perplexity	78.93	—	Unverified
8	Zaremba et al. (2014) - LSTM (large)	Test perplexity	78.4	—	Unverified
9	Gal & Ghahramani (2016) - Variational LSTM (large)	Test perplexity	75.2	—	Unverified
10	Inan et al. (2016) - Variational RHN	Test perplexity	66	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	LSTM (7 layers)	Bit per Character (BPC)	1.67	—	Unverified
2	Hypernetworks	Bit per Character (BPC)	1.34	—	Unverified
3	SHA-LSTM (4 layers, h=1024, no attention head)	Bit per Character (BPC)	1.33	—	Unverified
4	LN HM-LSTM	Bit per Character (BPC)	1.32	—	Unverified
5	ByteNet	Bit per Character (BPC)	1.31	—	Unverified
6	Recurrent Highway Networks	Bit per Character (BPC)	1.27	—	Unverified
7	Large FS-LSTM-4	Bit per Character (BPC)	1.25	—	Unverified
8	Large mLSTM	Bit per Character (BPC)	1.24	—	Unverified
9	AWD-LSTM (3 layers)	Bit per Character (BPC)	1.23	—	Unverified
10	Cluster-Former (#C=512)	Bit per Character (BPC)	1.22	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	Smaller Transformer 126M (pre-trained)	Test perplexity	33	—	Unverified
2	OPT 125M	Test perplexity	32.26	—	Unverified
3	Larger Transformer 771M (pre-trained)	Test perplexity	28.1	—	Unverified
4	OPT 1.3B	Test perplexity	19.55	—	Unverified
5	GPT-Neo 125M	Test perplexity	17.83	—	Unverified
6	OPT 2.7B	Test perplexity	17.81	—	Unverified
7	Smaller Transformer 126M (fine-tuned)	Test perplexity	12	—	Unverified
8	GPT-Neo 1.3B	Test perplexity	11.46	—	Unverified
9	Transformer 125M	Test perplexity	10.7	—	Unverified
10	GPT-Neo 2.7B	Test perplexity	10.44	—	Unverified