SOTAVerified

Code Generation

Code Generation is an important field to predict explicit code or program structure from multimodal data sources such as incomplete code, programs in another programming language, natural language descriptions or execution examples. Code Generation tools can assist the development of automatic programming tools to improve programming productivity.

Source: Deep Learning for Source Code Modeling and Generation

Image source: Measuring Coding Challenge Competence With APPS

Papers

Showing 1–50 of 1697 papers

TitleStatusHype
Qwen3 Technical ReportCode14
R&D-Agent-Quant: A Multi-Agent Framework for Data-Centric Factors and Model Joint OptimizationCode13
DeepSeek-Coder: When the Large Language Model Meets Programming -- The Rise of Code IntelligenceCode11
AutoDev: Automated AI-Driven DevelopmentCode11
Qwen2.5-Coder Technical ReportCode11
Data Formulator 2: Iterative Creation of Data Visualizations, with AI Transforming Data Along the WayCode11
Kodezi Chronos: A Debugging-First Language Model for Repository-Scale, Memory-Driven Code UnderstandingCode9
Llama 2: Open Foundation and Fine-Tuned Chat ModelsCode8
LLaMA: Open and Efficient Foundation Language ModelsCode7
S*: Test Time Scaling for Code GenerationCode7
EvoAgentX: An Automated Framework for Evolving Agentic WorkflowsCode7
EAGLE: Speculative Sampling Requires Rethinking Feature UncertaintyCode7
AFlow: Automating Agentic Workflow GenerationCode7
StarCoder 2 and The Stack v2: The Next GenerationCode7
SEW: Self-Evolving Agentic Workflows for Automated Code GenerationCode7
Paper2Code: Automating Code Generation from Scientific Papers in Machine LearningCode7
Chinese-Vicuna: A Chinese Instruction-following Llama-based ModelCode7
ECCO: Can We Improve Model-Generated Code Efficiency Without Sacrificing Functional Correctness?Code7
Code Generation with AlphaCodium: From Prompt Engineering to Flow EngineeringCode7
Mistral 7BCode6
Code Llama: Open Foundation Models for CodeCode6
GPT-4 Technical ReportCode6
CodeGen: An Open Large Language Model for Code with Multi-Turn Program SynthesisCode6
Astraios: Parameter-Efficient Instruction Tuning Code Large Language ModelsCode5
StarVector: Generating Scalable Vector Graphics Code from Images and TextCode5
SantaCoder: don't reach for the stars!Code5
Granite Code Models: A Family of Open Foundation Models for Code IntelligenceCode5
OpenCodeInterpreter: Integrating Code Generation with Execution and RefinementCode5
StarCoder: may the source be with you!Code5
Search-o1: Agentic Search-Enhanced Large Reasoning ModelsCode5
CodeGeeX: A Pre-Trained Model for Code Generation with Multilingual Benchmarking on HumanEval-XCode5
WizardCoder: Empowering Code Large Language Models with Evol-InstructCode5
Magicoder: Empowering Code Generation with OSS-InstructCode4
AutoCoder: Enhancing Code Large Language Model with AIEV-InstructCode4
Mixtral of ExpertsCode4
Debug like a Human: A Large Language Model Debugger via Verifying Runtime Execution Step-by-stepCode4
CodeI/O: Condensing Reasoning Patterns via Code Input-Output PredictionCode4
Knowledge Fusion of Large Language ModelsCode4
SWE-bench: Can Language Models Resolve Real-World GitHub Issues?Code4
How is ChatGPT's behavior changing over time?Code4
Seed-Coder: Let the Code Model Curate Data for ItselfCode4
Agent-as-a-Judge: Evaluate Agents with AgentsCode4
RepoAgent: An LLM-Powered Open-Source Framework for Repository-level Code Documentation GenerationCode4
DiffuCoder: Understanding and Improving Masked Diffusion Models for Code GenerationCode4
VideoFusion: Decomposed Diffusion Models for High-Quality Video GenerationCode4
BigCodeBench: Benchmarking Code Generation with Diverse Function Calls and Complex InstructionsCode4
Co-Evolving LLM Coder and Unit Tester via Reinforcement LearningCode4
Competition-Level Code Generation with AlphaCodeCode4
Improving Parallel Program Performance with LLM Optimizers via Agent-System InterfacesCode4
Programming Is Hard -- Or at Least It Used to Be: Educational Opportunities And Challenges of AI Code GenerationCode4
Show:102550
← PrevPage 1 of 34Next →

Benchmark Results

#ModelMetricClaimedVerifiedStatus
1EG-CFG (DeepSeek-V3-0324)Accuracy96.6—Unverified
2QualityFlow (Sonnet-3.5)Accuracy94.2—Unverified
3o1-mini + MapCoder (Hamming.ai)Accuracy93.2—Unverified
4MGDebugger (DeepSeek-V3-0324)Accuracy92.4—Unverified
5GPT-4 + AgentCoderAccuracy91.8—Unverified
6CodeSim (GPT4o)Accuracy90.7—Unverified
7Jiutian-大模型Accuracy90—Unverified
8GPT-3.5 Turbo (ChatGPT) + AgentCoderAccuracy89.9—Unverified
9MapCoder (GPT-4o)Accuracy89.7—Unverified
10GPT-4 (ChatGPT Plus)Accuracy87.5—Unverified
#ModelMetricClaimedVerifiedStatus
1LPW (GPT-4o)Introductory Pass@187.2—Unverified
2MoTCoder-32B-V1.5Introductory Pass@168.44—Unverified
3MoTCoder-7B-V1.5Introductory Pass@154.26—Unverified
4code-davinci-002 175B (CodeT)Introductory Pass@147.3—Unverified
5deepseek-ai/deepseek-coder-6.7b-instructIntroductory Pass@133.8—Unverified
6code-davinci-002 175BIntroductory Pass@131.92—Unverified
7CodeChain+WizardCoder-15bIntroductory Pass@129.3—Unverified
8WizardCoder-15bIntroductory Pass@126.29—Unverified
9CodeSim (GPT4)Introductory Pass@126.04—Unverified
10AlphaCode 1B Filtered from 50000Competition Pass@any22—Unverified
#ModelMetricClaimedVerifiedStatus
1PanGu-Coder-FT-IBLEU44.32—Unverified
2RoBERTaMarianBLEU35.74—Unverified
3MarianCGBLEU34.43—Unverified
4TranX + BERT w/minedBLEU34.2—Unverified
5BERT + TAEBLEU33.41—Unverified
6BERTMarianBLEU32.46—Unverified
7External Knowledge With API + RerankingBLEU32.26—Unverified
8External Knowledge With APIBLEU30.69—Unverified
9BART W/ MinedBLEU30.55—Unverified
10ELECTRAMarianBLEU30.18—Unverified
#ModelMetricClaimedVerifiedStatus
1MarianCGAccuracy81.83—Unverified
2BERT + TAEAccuracy81.03—Unverified
3TranX + BERT w/minedAccuracy81.03—Unverified
4RerankerAccuracy80.2—Unverified
5LUKEMarianAccuracy78.5—Unverified
6RoBERTaMarianAccuracy77.95—Unverified
7BERTMarianAccuracy76.68—Unverified
8TranxAccuracy73.7—Unverified
9ELECTRAMarianAccuracy65.32—Unverified
10lpn (Ling et al., 2016)Accuracy62.3—Unverified
#ModelMetricClaimedVerifiedStatus
1NL2SQL-RULEExecution Accuracy89.2—Unverified
2TypeSQL+TC (Yu et al., 2018)+Execution Accuracy82.6—Unverified
3TranxExecution Accuracy78.6—Unverified
4STAMP+RL (Sun et al., 2018)+Execution Accuracy74.6—Unverified
5STAMP (Sun et al., 2018)+Execution Accuracy74.4—Unverified
6TypeSQL (Yu et al., 2018)Execution Accuracy73.5—Unverified
7PT-MAML (Huang et al., 2018)Execution Accuracy68—Unverified
8Bidirectional Attention for SQL GenerationExecution Accuracy62.5—Unverified
9Seq2SQL (Zhong et al., 2017)Execution Accuracy59.4—Unverified
10Seq2Seq (Zhong et al., 2017)Execution Accuracy35.9—Unverified
#ModelMetricClaimedVerifiedStatus
1QurrentOS-coder + Claude 3.5 Sonnetpass@158—Unverified
2QurrentOS-coder + GPT-4opass@146—Unverified
3QurrentOS-coder + GPT-4 Turbopass@137—Unverified
4QurrentOS-coder + Claude 3 Opuspass@136—Unverified
5QurrentOS-coder + Gemini 1.5 Propass@130—Unverified
6QurrentOS-coder + GPT-4pass@130—Unverified
7QurrentOS-coder + DeepSeek-Coder-V2pass@129—Unverified
8QurrentOS-coder + Llama 3 70bpass@120—Unverified
9QurrentOS-coder + Qwen-72B-Instructpass@118—Unverified
#ModelMetricClaimedVerifiedStatus
1EG-CFG (DeepSeek-V3-0324)Test Set pass@158.18—Unverified
2LPW (GPT-4o)Test Set pass@134.7—Unverified
3MapCoder (GPT-4)Test Set pass@128.5—Unverified
4CodeSim (GPT4)Test Set pass@128.4—Unverified
5MoTCoder-15BTest Set pass@126.34—Unverified
6MoTCoder-7B-v1.5Test Set pass@120.77—Unverified
7CodeChain + WizardCoder-15BTest Set pass@12.35—Unverified
8WizardCoder-15BTest Set pass@11.11—Unverified
#ModelMetricClaimedVerifiedStatus
1DeepSeek-R1 (MGDebugger)Pass@1100—Unverified
2LLaMA 3Pass@199.4—Unverified
3QualityFlow (Sonnet-3.5)Pass@198.8—Unverified
4Phi-2Pass@198.2—Unverified
5EG-CFG (DeepSeek-V3-0324)Pass@196.95—Unverified
6Mistral 7BPass@193.9—Unverified
7Claude Sonnet 3.5Pass@190.85—Unverified
8L2MAC (GPT-4)Pass@190.2—Unverified
#ModelMetricClaimedVerifiedStatus
1Claude 3 HaikuPass@327.67—Unverified
2GPT-3.5 TurboPass@323.75—Unverified
3codechat-bisonPass@311.39—Unverified
4chat-bisonPass@38.48—Unverified
5Mixtral-8x7B-InstructPass@38.35—Unverified
6Phi-3-mini-128k-instructPass@37.18—Unverified
7WizardLM-2-7BPass@33.72—Unverified
8Llama-3-8B-InstructPass@33.1—Unverified
#ModelMetricClaimedVerifiedStatus
1o1-previewpass@10.95—Unverified
2o1-minipass@10.94—Unverified
3gpt-4o-2024-08-06pass@10.89—Unverified
4claude-3.5-sonnetpass@10.88—Unverified
5deepseek-v2.5pass@10.83—Unverified
6mistral-large-2pass@10.78—Unverified
7deepseek-coder-v2-instructpass@10.7—Unverified
8llama-v3p1-405b-instructpass@10.3—Unverified
#ModelMetricClaimedVerifiedStatus
1BART W/ MinedBLEU35.32—Unverified
2BART BaseBLEU34.35—Unverified
3External Knowledge With API + RerankingBLEU20.54—Unverified
4External Knowledge With APIBLEU20.37—Unverified
5RerankerBLEU19.85—Unverified
6TranXBLEU18.85—Unverified
#ModelMetricClaimedVerifiedStatus
1claude-3-5-sonnetpass@10.68—Unverified
2o1-minipass@10.67—Unverified