Code Generation

Code Generation is an important field to predict explicit code or program structure from multimodal data sources such as incomplete code, programs in another programming language, natural language descriptions or execution examples. Code Generation tools can assist the development of automatic programming tools to improve programming productivity.

Source: Deep Learning for Source Code Modeling and Generation

Image source: Measuring Coding Challenge Competence With APPS

Papers

Recently Added Most Hyped Most Active Needs Verification Most Verified

Showing 451–500 of 1697 papers

Title	Date	Tasks	Status	Hype
Fault-Aware Neural Code Rankers	Jun 4, 2022	Code GenerationHumanEval	CodeCode Available	1
CoTexT: Multi-task Learning with Code-Text Transformer	May 18, 2021	Code GenerationCode Summarization	CodeCode Available	1
SlideCoder: Layout-aware RAG-enhanced Hierarchical Slide Generation from Design	Jun 9, 2025	Code GenerationRAG	CodeCode Available	1
EffiLearner: Enhancing Efficiency of Generated Code via Self-Optimization	May 24, 2024	Code GenerationHumanEval	CodeCode Available	1
Exploring Parameter-Efficient Fine-Tuning Techniques for Code Generation with Large Language Models	Aug 21, 2023	Code GenerationIn-Context Learning	CodeCode Available	1
Exploring Dynamic Selection of Branch Expansion Orders for Code Generation	Jun 1, 2021	Code Generation	CodeCode Available	1
VulScribeR: Exploring RAG-based Vulnerability Augmentation with LLMs	Aug 7, 2024	Code GenerationData Augmentation	CodeCode Available	1
Exploiting LLM Quantization	May 28, 2024	Code GenerationQuantization	CodeCode Available	1
Extend Model Merging from Fine-Tuned to Pre-Trained Large Language Models via Weight Disentanglement	Aug 6, 2024	Code GenerationDisentanglement	CodeCode Available	1
A parallel corpus of Python functions and documentation strings for automated code documentation and code generation	Jul 7, 2017	Code GenerationData Augmentation	CodeCode Available	1
Execution-based Code Generation using Deep Reinforcement Learning	Jan 31, 2023	Code CompletionCode Generation	CodeCode Available	1
BioCoder: A Benchmark for Bioinformatics Code Generation with Large Language Models	Aug 31, 2023	Code Generation	CodeCode Available	1
COAST: Enhancing the Code Debugging Ability of LLMs through Communicative Agent Based Data Synthesis	Aug 9, 2024	Code GenerationCode Repair	CodeCode Available	1
BigO(Bench) -- Can LLMs Generate Code with Controlled Time and Space Complexity?	Mar 19, 2025	Code Generation	CodeCode Available	1
Compliance-to-Code: Enhancing Financial Compliance Checking via Code Generation	May 26, 2025	Code Generation	CodeCode Available	1
AutoSafeCoder: A Multi-Agent Framework for Securing LLM Code Generation through Static Analysis and Fuzz Testing	Sep 16, 2024	Code GenerationProgram Synthesis	CodeCode Available	1
Entropy-Regularized Token-Level Policy Optimization for Language Agent Reinforcement	Feb 9, 2024	Code GenerationDecision Making	CodeCode Available	1
EPiC: Cost-effective Search-based Prompt Engineering of LLMs for Code Generation	Aug 20, 2024	Code GenerationPrompt Engineering	CodeCode Available	1
Execution-Based Evaluation for Open-Domain Code Generation	Dec 20, 2022	Code GenerationMemorization	CodeCode Available	1
EffiCoder: Enhancing Code Generation in Large Language Models through Efficiency-Aware Fine-tuning	Oct 14, 2024	Code Generation	CodeCode Available	1
EffiBench-X: A Multi-Language Benchmark for Measuring Efficiency of LLM-Generated Code	May 19, 2025	Code Generation	CodeCode Available	1
Embedding API Dependency Graph for Neural Code Generation	Mar 29, 2021	Code GenerationDecoder	CodeCode Available	1
Dynamics of Instruction Tuning: Each Ability of Large Language Models Has Its Own Growth Pace	Oct 30, 2023	Code GenerationLogical Reasoning	CodeCode Available	1
ANPL: Towards Natural Programming with Interactive Decomposition	May 29, 2023	ARCCode Generation	CodeCode Available	1
A Dynamic LLM-Powered Agent Network for Task-Oriented Agent Collaboration	Oct 3, 2023	Arithmetic ReasoningCode Generation	CodeCode Available	1
Teach me how to Label: Labeling Functions from Natural Language with Text-to-text Transformers	Jan 18, 2021	Code GenerationSemantic Parsing	CodeCode Available	1
B4: Towards Optimal Assessment of Plausible Code Solutions with Plausible Tests	Sep 13, 2024	Code Generation	CodeCode Available	1
Text2App: A Framework for Creating Android Apps from Text Descriptions	Apr 16, 2021	Code GenerationLanguage Modeling	CodeCode Available	1
Effective LLM-Driven Code Generation with Pythoness	Jan 3, 2025	Code Generation	CodeCode Available	1
Energy-Based Models for Code Generation under Compilability Constraints	Jun 9, 2021	Code CompletionCode Generation	CodeCode Available	1
ThingML+ Augmenting Model-Driven Software Engineering for the Internet of Things with Machine Learning	Sep 22, 2020	BIG-bench Machine LearningCode Generation	CodeCode Available	1
DolphCoder: Echo-Locating Code Large Language Models with Diverse and Multi-Objective Instruction Tuning	Feb 14, 2024	Code GenerationHumanEval	CodeCode Available	1
DocuMint: Docstring Generation for Python using Small Language Models	May 16, 2024	BenchmarkingCode Generation	CodeCode Available	1
ContraCLM: Contrastive Learning For Causal Language Model	Oct 3, 2022	Code GenerationCode Search	CodeCode Available	1
Beyond Correctness: Benchmarking Multi-dimensional Code Generation for Large Language Models	Jul 16, 2024	BenchmarkingCode Generation	CodeCode Available	1
Controlling Conditional Language Models without Catastrophic Forgetting	Dec 1, 2021	Abstractive Text SummarizationCode Generation	CodeCode Available	1
CYCLE: Learning to Self-Refine the Code Generation	Mar 27, 2024	Code GenerationHumanEval	CodeCode Available	1
Beyond Autoregression: Fast LLMs via Self-Distillation Through Time	Oct 28, 2024	Automated Theorem ProvingCode Generation	CodeCode Available	1
BEEAR: Embedding-based Adversarial Removal of Safety Backdoors in Instruction-tuned Language Models	Jun 24, 2024	Code Generation	CodeCode Available	1
TuRTLe: A Unified Evaluation of LLMs for RTL Generation	Mar 31, 2025	Code Generation	CodeCode Available	1
Unified Pre-training for Program Understanding and Generation	Mar 10, 2021	Clone DetectionCode Generation	CodeCode Available	1
Copiloting the Copilots: Fusing Large Language Models with Completion Engines for Automated Program Repair	Sep 1, 2023	Code GenerationProgram Repair	CodeCode Available	1
Benchmarking and Explaining Large Language Model-based Code Generation: A Causality-Centric Approach	Oct 10, 2023	BenchmarkingCode Generation	CodeCode Available	1
Beyond Accuracy: Evaluating Self-Consistency of Code Large Language Models with IdentityChain	Oct 21, 2023	Code GenerationCode Summarization	CodeCode Available	1
Between Lines of Code: Unraveling the Distinct Patterns of Machine and Human Programmers	Jan 12, 2024	Code GenerationDiversity	CodeCode Available	1
Diffusion-based Aesthetic QR Code Generation via Scanning-Robust Perceptual Guidance	Mar 23, 2024	Code Generation	CodeCode Available	1
Benchmarking Data Science Agents	Feb 27, 2024	BenchmarkingCode Generation	CodeCode Available	1
VeriThoughts: Enabling Automated Verilog Code Generation using Reasoning and Formal Verification	May 16, 2025	Code Generation	CodeCode Available	1
LiCoEval: Evaluating LLMs on License Compliance in Code Generation	Aug 5, 2024	Code Generation	CodeCode Available	1
Enhancing Cross-Tokenizer Knowledge Distillation with Contextual Dynamical Mapping	Feb 16, 2025	Code GenerationInstruction Following	CodeCode Available	1

Show:10 25 50

← PrevPage 10 of 34Next →

All datasets MBPP APPS CoNaLa Django WikiSQL RES-Q CodeContests HumanEval PECC WebApp1K-React CoNaLa-Ext WebApp1k-Duo-React

Benchmark Results

#	Model	Metric	Claimed	Verified	Status
1	EG-CFG (DeepSeek-V3-0324)	Accuracy	96.6	—	Unverified
2	QualityFlow (Sonnet-3.5)	Accuracy	94.2	—	Unverified
3	o1-mini + MapCoder (Hamming.ai)	Accuracy	93.2	—	Unverified
4	MGDebugger (DeepSeek-V3-0324)	Accuracy	92.4	—	Unverified
5	GPT-4 + AgentCoder	Accuracy	91.8	—	Unverified
6	CodeSim (GPT4o)	Accuracy	90.7	—	Unverified
7	Jiutian-大模型	Accuracy	90	—	Unverified
8	GPT-3.5 Turbo (ChatGPT) + AgentCoder	Accuracy	89.9	—	Unverified
9	MapCoder (GPT-4o)	Accuracy	89.7	—	Unverified
10	GPT-4 (ChatGPT Plus)	Accuracy	87.5	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	LPW (GPT-4o)	Introductory Pass@1	87.2	—	Unverified
2	MoTCoder-32B-V1.5	Introductory Pass@1	68.44	—	Unverified
3	MoTCoder-7B-V1.5	Introductory Pass@1	54.26	—	Unverified
4	code-davinci-002 175B (CodeT)	Introductory Pass@1	47.3	—	Unverified
5	deepseek-ai/deepseek-coder-6.7b-instruct	Introductory Pass@1	33.8	—	Unverified
6	code-davinci-002 175B	Introductory Pass@1	31.92	—	Unverified
7	CodeChain+WizardCoder-15b	Introductory Pass@1	29.3	—	Unverified
8	WizardCoder-15b	Introductory Pass@1	26.29	—	Unverified
9	CodeSim (GPT4)	Introductory Pass@1	26.04	—	Unverified
10	AlphaCode 1B Filtered from 50000	Competition Pass@any	22	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	PanGu-Coder-FT-I	BLEU	44.32	—	Unverified
2	RoBERTaMarian	BLEU	35.74	—	Unverified
3	MarianCG	BLEU	34.43	—	Unverified
4	TranX + BERT w/mined	BLEU	34.2	—	Unverified
5	BERT + TAE	BLEU	33.41	—	Unverified
6	BERTMarian	BLEU	32.46	—	Unverified
7	External Knowledge With API + Reranking	BLEU	32.26	—	Unverified
8	External Knowledge With API	BLEU	30.69	—	Unverified
9	BART W/ Mined	BLEU	30.55	—	Unverified
10	ELECTRAMarian	BLEU	30.18	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	MarianCG	Accuracy	81.83	—	Unverified
2	BERT + TAE	Accuracy	81.03	—	Unverified
3	TranX + BERT w/mined	Accuracy	81.03	—	Unverified
4	Reranker	Accuracy	80.2	—	Unverified
5	LUKEMarian	Accuracy	78.5	—	Unverified
6	RoBERTaMarian	Accuracy	77.95	—	Unverified
7	BERTMarian	Accuracy	76.68	—	Unverified
8	Tranx	Accuracy	73.7	—	Unverified
9	ELECTRAMarian	Accuracy	65.32	—	Unverified
10	lpn (Ling et al., 2016)	Accuracy	62.3	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	NL2SQL-RULE	Execution Accuracy	89.2	—	Unverified
2	TypeSQL+TC (Yu et al., 2018)+	Execution Accuracy	82.6	—	Unverified
3	Tranx	Execution Accuracy	78.6	—	Unverified
4	STAMP+RL (Sun et al., 2018)+	Execution Accuracy	74.6	—	Unverified
5	STAMP (Sun et al., 2018)+	Execution Accuracy	74.4	—	Unverified
6	TypeSQL (Yu et al., 2018)	Execution Accuracy	73.5	—	Unverified
7	PT-MAML (Huang et al., 2018)	Execution Accuracy	68	—	Unverified
8	Bidirectional Attention for SQL Generation	Execution Accuracy	62.5	—	Unverified
9	Seq2SQL (Zhong et al., 2017)	Execution Accuracy	59.4	—	Unverified
10	Seq2Seq (Zhong et al., 2017)	Execution Accuracy	35.9	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	QurrentOS-coder + Claude 3.5 Sonnet	pass@1	58	—	Unverified
2	QurrentOS-coder + GPT-4o	pass@1	46	—	Unverified
3	QurrentOS-coder + GPT-4 Turbo	pass@1	37	—	Unverified
4	QurrentOS-coder + Claude 3 Opus	pass@1	36	—	Unverified
5	QurrentOS-coder + Gemini 1.5 Pro	pass@1	30	—	Unverified
6	QurrentOS-coder + GPT-4	pass@1	30	—	Unverified
7	QurrentOS-coder + DeepSeek-Coder-V2	pass@1	29	—	Unverified
8	QurrentOS-coder + Llama 3 70b	pass@1	20	—	Unverified
9	QurrentOS-coder + Qwen-72B-Instruct	pass@1	18	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	EG-CFG (DeepSeek-V3-0324)	Test Set pass@1	58.18	—	Unverified
2	LPW (GPT-4o)	Test Set pass@1	34.7	—	Unverified
3	MapCoder (GPT-4)	Test Set pass@1	28.5	—	Unverified
4	CodeSim (GPT4)	Test Set pass@1	28.4	—	Unverified
5	MoTCoder-15B	Test Set pass@1	26.34	—	Unverified
6	MoTCoder-7B-v1.5	Test Set pass@1	20.77	—	Unverified
7	CodeChain + WizardCoder-15B	Test Set pass@1	2.35	—	Unverified
8	WizardCoder-15B	Test Set pass@1	1.11	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	DeepSeek-R1 (MGDebugger)	Pass@1	100	—	Unverified
2	LLaMA 3	Pass@1	99.4	—	Unverified
3	QualityFlow (Sonnet-3.5)	Pass@1	98.8	—	Unverified
4	Phi-2	Pass@1	98.2	—	Unverified
5	EG-CFG (DeepSeek-V3-0324)	Pass@1	96.95	—	Unverified
6	Mistral 7B	Pass@1	93.9	—	Unverified
7	Claude Sonnet 3.5	Pass@1	90.85	—	Unverified
8	L2MAC (GPT-4)	Pass@1	90.2	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	Claude 3 Haiku	Pass@3	27.67	—	Unverified
2	GPT-3.5 Turbo	Pass@3	23.75	—	Unverified
3	codechat-bison	Pass@3	11.39	—	Unverified
4	chat-bison	Pass@3	8.48	—	Unverified
5	Mixtral-8x7B-Instruct	Pass@3	8.35	—	Unverified
6	Phi-3-mini-128k-instruct	Pass@3	7.18	—	Unverified
7	WizardLM-2-7B	Pass@3	3.72	—	Unverified
8	Llama-3-8B-Instruct	Pass@3	3.1	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	o1-preview	pass@1	0.95	—	Unverified
2	o1-mini	pass@1	0.94	—	Unverified
3	gpt-4o-2024-08-06	pass@1	0.89	—	Unverified
4	claude-3.5-sonnet	pass@1	0.88	—	Unverified
5	deepseek-v2.5	pass@1	0.83	—	Unverified
6	mistral-large-2	pass@1	0.78	—	Unverified
7	deepseek-coder-v2-instruct	pass@1	0.7	—	Unverified
8	llama-v3p1-405b-instruct	pass@1	0.3	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	BART W/ Mined	BLEU	35.32	—	Unverified
2	BART Base	BLEU	34.35	—	Unverified
3	External Knowledge With API + Reranking	BLEU	20.54	—	Unverified
4	External Knowledge With API	BLEU	20.37	—	Unverified
5	Reranker	BLEU	19.85	—	Unverified
6	TranX	BLEU	18.85	—	Unverified

#	Model	Metric	Claimed	Verified	Status
1	claude-3-5-sonnet	pass@1	0.68	—	Unverified
2	o1-mini	pass@1	0.67	—	Unverified