Language Modelling

A language model is a model of natural language. Language models are useful for a variety of tasks, including speech recognition, machine translation, natural language generation (generating more human-like text), optical character recognition, route optimization, handwriting recognition, grammar induction, and information retrieval.

Large language models (LLMs), currently their most advanced form, are predominantly based on transformers trained on larger datasets (frequently using words scraped from the public internet). They have superseded recurrent neural network-based models, which had previously superseded the purely statistical models, such as word n-gram language model.

Source: Wikipedia

Papers

Recently Added Most Hyped Most Active Needs Verification Most Verified

Showing 3151–3200 of 17610 papers

Title	Date	Tasks	Status	Hype	Score
C-STS: Conditional Semantic Textual Similarity	May 24, 2023	Information RetrievalLanguage Model Evaluation	CodeCode Available	1	5
CTAL: Pre-training Cross-modal Transformer for Audio-and-Language Representations	Sep 1, 2021	Emotion ClassificationLanguage Modeling	CodeCode Available	1	5
Gloss Attention for Gloss-free Sign Language Translation	Jul 14, 2023	Gloss-free Sign Language TranslationLanguage Modeling	CodeCode Available	1	5
Codified audio language modeling learns useful representations for music information retrieval	Jul 12, 2021	Emotion RecognitionGenre classification	CodeCode Available	1	5
CTRL: A Conditional Transformer Language Model for Controllable Generation	Sep 11, 2019	Language ModelingLanguage Modelling	CodeCode Available	1	5
LEAM: A Prompt-only Large Language Model-enabled Antenna Modeling Method	Apr 25, 2025	Language ModelingLanguage Modelling	CodeCode Available	1	5
Chess as a Testbed for Language Model State Tracking	Feb 26, 2021	Game of ChessLanguage Modeling	CodeCode Available	1	5
LAVCap: LLM-based Audio-Visual Captioning using Optimal Transport	Jan 16, 2025	AudioCapsAudio captioning	CodeCode Available	1	5
LAVENDER: Unifying Video-Language Understanding as Masked Language Modeling	Jun 14, 2022	DecoderLanguage Modeling	CodeCode Available	1	5
CrowdCLIP: Unsupervised Crowd Counting via Vision-Language Model	Apr 9, 2023	Cross-Part Crowd CountingCrowd Counting	CodeCode Available	1	5
Cross-View Language Modeling: Towards Unified Cross-Lingual Cross-Modal Pre-training	Jun 1, 2022	Contrastive LearningCross-Lingual Transfer	CodeCode Available	1	5
CofiPara: A Coarse-to-fine Paradigm for Multimodal Sarcasm Target Identification with Large Multimodal Models	May 1, 2024	Language ModelingLanguage Modelling	CodeCode Available	1	5
CrowdVLM-R1: Expanding R1 Ability to Vision Language Model for Crowd Counting using Fuzzy Group Relative Policy Reward	Mar 31, 2025	Crowd CountingLanguage Modeling	CodeCode Available	1	5
Bilinear MLPs enable weight-based mechanistic interpretability	Oct 10, 2024	image-classificationImage Classification	CodeCode Available	1	5
LauraTSE: Target Speaker Extraction using Auto-Regressive Decoder-Only Language Models	Apr 10, 2025	DecoderLanguage Modeling	CodeCode Available	1	5
BiLD: Bi-directional Logits Difference Loss for Large Language Model Distillation	Jun 19, 2024	Knowledge DistillationLanguage Modeling	CodeCode Available	1	5
Cross-Platform Video Person ReID: A New Benchmark Dataset and Adaptation Approach	Aug 14, 2024	Language ModelingLanguage Modelling	CodeCode Available	1	5
Cross-Thought for Sentence Encoder Pre-training	Oct 7, 2020	Information RetrievalLanguage Modeling	CodeCode Available	1	5
Latin BERT: A Contextual Language Model for Classical Philology	Sep 21, 2020	Language ModelingLanguage Modelling	CodeCode Available	1	5
Cross-lingual Visual Pre-training for Multimodal Machine Translation	Jan 25, 2021	Language ModellingMachine Translation	CodeCode Available	1	5
AE TextSpotter: Learning Visual and Linguistic Representation for Ambiguous Text Spotting	Aug 3, 2020	Language ModellingSentence	CodeCode Available	1	5
LasUIE: Unifying Information Extraction with Latent Adaptive Structure-aware Generative Language Model	Apr 13, 2023	Language ModelingLanguage Modelling	CodeCode Available	1	5
Latxa: An Open Language Model and Evaluation Suite for Basque	Mar 29, 2024	Language ModelingLanguage Modelling	CodeCode Available	1	5
Cognitive Visual-Language Mapper: Advancing Multimodal Comprehension with Enhanced Visual Knowledge Alignment	Feb 21, 2024	Language ModellingQuestion Answering	CodeCode Available	1	5
Cross-model Control: Improving Multiple Large Language Models in One-time Training	Oct 23, 2024	Instruction FollowingLanguage Modeling	CodeCode Available	1	5
AESOP: Paraphrase Generation with Adaptive Syntactic Control	Nov 1, 2021	Data AugmentationLanguage Modeling	CodeCode Available	1	5
DAM: Dynamic Attention Mask for Long-Context Large Language Model Inference Acceleration	Jun 6, 2025	Computational EfficiencyLanguage Modeling	CodeCode Available	1	5
Large-vocabulary forensic pathological analyses via prototypical cross-modal contrastive learning	Jul 20, 2024	Contrastive LearningDiagnostic	CodeCode Available	1	5
LaunchpadGPT: Language Model as Music Visualization Designer on Launchpad	Jul 7, 2023	Language ModelingLanguage Modelling	CodeCode Available	1	5
Lawformer: A Pre-trained Language Model for Chinese Legal Long Documents	May 9, 2021	Language ModelingLanguage Modelling	CodeCode Available	1	5
Learning Compact Metrics for MT	Oct 12, 2021	Cross-Lingual TransferLanguage Modeling	CodeCode Available	1	5
ColaCare: Enhancing Electronic Health Record Modeling through Large Language Model-Driven Multi-Agent Collaboration	Oct 3, 2024	Decision MakingLanguage Modeling	CodeCode Available	1	5
Learning to Speak from Text: Zero-Shot Multilingual Text-to-Speech with Unsupervised Text Pretraining	Jan 30, 2023	Language ModelingLanguage Modelling	CodeCode Available	1	5
GPTCast: a weather language model for precipitation nowcasting	Jul 2, 2024	Language ModelingLanguage Modelling	CodeCode Available	1	5
Large language model validity via enhanced conformal prediction methods	Jun 14, 2024	Conformal PredictionLanguage Modeling	CodeCode Available	1	5
Large Language Model Unlearning via Embedding-Corrupted Prompts	Jun 12, 2024	Language ModelingLanguage Modelling	CodeCode Available	1	5
UniTAB: Unifying Text and Box Outputs for Grounded Vision-Language Modeling	Nov 23, 2021	Image CaptioningImage Description	CodeCode Available	1	5
Co-Learning: Code Learning for Multi-Agent Reinforcement Collaborative Framework with Conversational Natural Language Interfaces	Sep 2, 2024	Language ModelingLanguage Modelling	CodeCode Available	1	5
Cross-domain Retrieval in the Legal and Patent Domains: a Reproducibility Study	Dec 21, 2020	Information RetrievalLanguage Modelling	CodeCode Available	1	5
GPTailor: Large Language Model Pruning Through Layer Cutting and Stitching	Jun 25, 2025	Language ModelingLanguage Modelling	CodeCode Available	1	5
Large Language Model Unlearning	Oct 14, 2023	Language ModelingLanguage Modelling	CodeCode Available	1	5
Cross-Care: Assessing the Healthcare Implications of Pre-training Data on Language Model Bias	May 9, 2024	Data VisualizationLanguage Modeling	CodeCode Available	1	5
CDLM: Cross-Document Language Modeling	Jan 2, 2021	Citation RecommendationCoreference Resolution	CodeCode Available	1	5
Cross-Align: Modeling Deep Cross-lingual Interactions for Word Alignment	Oct 9, 2022	Language ModelingLanguage Modelling	CodeCode Available	1	5
Topics, Authors, and Institutions in Large Language Model Research: Trends from 17K arXiv Papers	Jul 20, 2023	Language ModelingLanguage Modelling	CodeCode Available	1	5
Large-Scale Contextualised Language Modelling for Norwegian	Apr 13, 2021	Language Modelling	CodeCode Available	1	5
Critic-Guided Decoding for Controlled Text Generation	Dec 21, 2022	Language ModelingLanguage Modelling	CodeCode Available	1	5
Collaborative Retrieval for Large Language Model-based Conversational Recommender Systems	Feb 19, 2025	Collaborative FilteringConversational Recommendation	CodeCode Available	1	5
Large Language Models for Scientific Synthesis, Inference and Explanation	Oct 12, 2023	Code GenerationLanguage Modeling	CodeCode Available	1	5
CriticEval: Evaluating Large Language Model as Critic	Feb 21, 2024	Language ModelingLanguage Modelling	CodeCode Available	1	5

Show:10 25 50

← PrevPage 64 of 353Next →

All datasets WikiText-103 Penn Treebank (Word Level)enwik8 The Pile WikiText-2 LAMBADA One Billion Word Text8 Penn Treebank (Character Level)Hutter Prize OpenWebText SALMon

Benchmark Results

#	Model	Metric	Claimed	Verified	Status
1	Decay RNN	Validation perplexity	76.67	—	Unverified
2	GRU	Validation perplexity	53.78	—	Unverified
3	LSTM	Validation perplexity	52.73	—	Unverified
4	LSTM	Test perplexity	48.7	—	Unverified
5	Temporal CNN	Test perplexity	45.2	—	Unverified
6	TCN	Test perplexity	45.19	—	Unverified
7	GCNN-8	Test perplexity	44.9	—	Unverified
8	Neural cache model (size = 100)	Test perplexity	44.8	—	Unverified
9	Neural cache model (size = 2,000)	Test perplexity	40.8	—	Unverified
10	GPT-2 Small	Test perplexity	37.5	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	TCN	Test perplexity	108.47	—	Unverified
2	Seq-U-Net	Test perplexity	107.95	—	Unverified
3	GRU (Bai et al., 2018)	Test perplexity	92.48	—	Unverified
4	R-Transformer	Test perplexity	84.38	—	Unverified
5	Zaremba et al. (2014) - LSTM (medium)	Test perplexity	82.7	—	Unverified
6	Gal & Ghahramani (2016) - Variational LSTM (medium)	Test perplexity	79.7	—	Unverified
7	LSTM (Bai et al., 2018)	Test perplexity	78.93	—	Unverified
8	Zaremba et al. (2014) - LSTM (large)	Test perplexity	78.4	—	Unverified
9	Gal & Ghahramani (2016) - Variational LSTM (large)	Test perplexity	75.2	—	Unverified
10	Inan et al. (2016) - Variational RHN	Test perplexity	66	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	LSTM (7 layers)	Bit per Character (BPC)	1.67	—	Unverified
2	Hypernetworks	Bit per Character (BPC)	1.34	—	Unverified
3	SHA-LSTM (4 layers, h=1024, no attention head)	Bit per Character (BPC)	1.33	—	Unverified
4	LN HM-LSTM	Bit per Character (BPC)	1.32	—	Unverified
5	ByteNet	Bit per Character (BPC)	1.31	—	Unverified
6	Recurrent Highway Networks	Bit per Character (BPC)	1.27	—	Unverified
7	Large FS-LSTM-4	Bit per Character (BPC)	1.25	—	Unverified
8	Large mLSTM	Bit per Character (BPC)	1.24	—	Unverified
9	AWD-LSTM (3 layers)	Bit per Character (BPC)	1.23	—	Unverified
10	Cluster-Former (#C=512)	Bit per Character (BPC)	1.22	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	Smaller Transformer 126M (pre-trained)	Test perplexity	33	—	Unverified
2	OPT 125M	Test perplexity	32.26	—	Unverified
3	Larger Transformer 771M (pre-trained)	Test perplexity	28.1	—	Unverified
4	OPT 1.3B	Test perplexity	19.55	—	Unverified
5	GPT-Neo 125M	Test perplexity	17.83	—	Unverified
6	OPT 2.7B	Test perplexity	17.81	—	Unverified
7	Smaller Transformer 126M (fine-tuned)	Test perplexity	12	—	Unverified
8	GPT-Neo 1.3B	Test perplexity	11.46	—	Unverified
9	Transformer 125M	Test perplexity	10.7	—	Unverified
10	GPT-Neo 2.7B	Test perplexity	10.44	—	Unverified