SOTAVerified

Code Generation

Code Generation is an important field to predict explicit code or program structure from multimodal data sources such as incomplete code, programs in another programming language, natural language descriptions or execution examples. Code Generation tools can assist the development of automatic programming tools to improve programming productivity.

Source: Deep Learning for Source Code Modeling and Generation

Image source: Measuring Coding Challenge Competence With APPS

Papers

Showing 751–800 of 1697 papers

TitleStatusHype
CORE: Benchmarking LLMs Code Reasoning Capabilities through Static Analysis Tasks—0
CoQuIR: A Comprehensive Benchmark for Code Quality-Aware Information Retrieval—0
Benchmarking Causal Study to Interpret Large Language Models for Source Code—0
An Extensive Evaluation of PDDL Capabilities in off-the-shelf LLMs—0
A Disguised Wolf Is More Harmful Than a Toothless Tiger: Adaptive Malicious Code Injection Backdoor Attack Leveraging User Behavior as Triggers—0
Understanding Software Engineering Agents Through the Lens of Traceability: An Empirical Study—0
Copyright in Generative Deep Learning—0
Copilot-in-the-Loop: Fixing Code Smells in Copilot-Generated Python Code using Copilot—0
Copilot for Xcode: Exploring AI-Assisted Programming by Prompting Cloud-based Large Language Models—0
Benchmarking AI Models in Software Engineering: A Review, Search Tool, and Enhancement Protocol—0
An Exploratory Study of ML Sketches and Visual Code Assistants—0
Copilot Evaluation Harness: Evaluating LLM-Guided Software Programming—0
Conversational Planning for Personal Plans—0
ConvCodeWorld: Benchmarking Conversational Code Generation in Reproducible Feedback Environments—0
BeamLoRA: Beam-Constraint Low-Rank Adaptation—0
A New Approach for Image Authentication Framework for Media Forensics Purpose—0
A Deep Dive Into Large Language Model Code Generation Mistakes: What and Why?—0
Contrastive Policy Gradient: Aligning LLMs on sequence-level scores in a supervised-friendly fashion—0
Batched Low-Rank Adaptation of Foundation Models—0
Basis Selection: Low-Rank Decomposition of Pretrained Large Language Models for Target Applications—0
A new approach for encoding code and assisting code understanding—0
Context-Augmented Code Generation Using Programming Knowledge Graphs—0
Backpropagation with Callbacks: Foundations for Efficient and Expressive Differentiable Programming—0
Constrained Training of Neural Networks via Theorem Proving—0
An evaluation of LLM code generation capabilities through graded exercises—0
Adding guardrails to advanced chatbots—0
Repeton: Structured Bug Repair with ReAct-Guided Patch-and-Test Cycles—0
Enhancing AI-based Generation of Software Exploits with Contextual Information—0
Consolidating TinyML Lifecycle with Large Language Models: Reality, Illusion, or Opportunity?—0
CoCoST: Automatic Complex Code Generation with Online Searching and Correctness Testing—0
Conformal Prediction Sets for Deep Generative Models via Reduction to Conformal Regression—0
Configuration Validation with Large Language Models—0
Computing Education in the Era of Generative AI—0
Compute Optimal Scaling of Skills: Knowledge vs Reasoning—0
Compressing Structured Tensor Algebra—0
Compositional Hardness of Code in Large Language Models -- A Probabilistic Perspective—0
AutoVCoder: A Systematic Framework for Automated Verilog Code Generation using LLMs—0
Compositional API Recommendation for Library-Oriented Code Generation—0
AutoTest: Evolutionary Code Solution Selection with Test Cases—0
Composing inference algorithms as program transformations—0
ComplexityNet: Increasing LLM Inference Efficiency by Learning Task Complexity—0
AutoPrep: Natural Language Question-Aware Data Preparation with a Multi-Agent Framework—0
An Empirical Study on Self-correcting Large Language Models for Data Science Code Generation—0
An Empirical Study of NetOps Capability of Pre-Trained Large Language Models—0
Compilable Neural Code Generation with Compiler Feedback—0
CompCodeVet: A Compiler-guided Validation and Enhancement Approach for Code Dataset—0
Comparative Analysis of Large Language Models for Context-Aware Code Completion using SAFIM Framework—0
AUTOPARLLM: GNN-Guided Automatic Code Parallelization using Large Language Models—0
Combining LLM Code Generation with Formal Specifications and Reactive Program Synthesis—0
An Automated Reinforcement Learning Reward Design Framework with Large Language Model for Cooperative Platoon Coordination—0
Show:102550
← PrevPage 16 of 34Next →

Benchmark Results

#ModelMetricClaimedVerifiedStatus
1EG-CFG (DeepSeek-V3-0324)Accuracy96.6—Unverified
2QualityFlow (Sonnet-3.5)Accuracy94.2—Unverified
3o1-mini + MapCoder (Hamming.ai)Accuracy93.2—Unverified
4MGDebugger (DeepSeek-V3-0324)Accuracy92.4—Unverified
5GPT-4 + AgentCoderAccuracy91.8—Unverified
6CodeSim (GPT4o)Accuracy90.7—Unverified
7Jiutian-大模型Accuracy90—Unverified
8GPT-3.5 Turbo (ChatGPT) + AgentCoderAccuracy89.9—Unverified
9MapCoder (GPT-4o)Accuracy89.7—Unverified
10GPT-4 (ChatGPT Plus)Accuracy87.5—Unverified
#ModelMetricClaimedVerifiedStatus
1LPW (GPT-4o)Introductory Pass@187.2—Unverified
2MoTCoder-32B-V1.5Introductory Pass@168.44—Unverified
3MoTCoder-7B-V1.5Introductory Pass@154.26—Unverified
4code-davinci-002 175B (CodeT)Introductory Pass@147.3—Unverified
5deepseek-ai/deepseek-coder-6.7b-instructIntroductory Pass@133.8—Unverified
6code-davinci-002 175BIntroductory Pass@131.92—Unverified
7CodeChain+WizardCoder-15bIntroductory Pass@129.3—Unverified
8WizardCoder-15bIntroductory Pass@126.29—Unverified
9CodeSim (GPT4)Introductory Pass@126.04—Unverified
10AlphaCode 1B Filtered from 50000Competition Pass@any22—Unverified
#ModelMetricClaimedVerifiedStatus
1PanGu-Coder-FT-IBLEU44.32—Unverified
2RoBERTaMarianBLEU35.74—Unverified
3MarianCGBLEU34.43—Unverified
4TranX + BERT w/minedBLEU34.2—Unverified
5BERT + TAEBLEU33.41—Unverified
6BERTMarianBLEU32.46—Unverified
7External Knowledge With API + RerankingBLEU32.26—Unverified
8External Knowledge With APIBLEU30.69—Unverified
9BART W/ MinedBLEU30.55—Unverified
10ELECTRAMarianBLEU30.18—Unverified
#ModelMetricClaimedVerifiedStatus
1MarianCGAccuracy81.83—Unverified
2BERT + TAEAccuracy81.03—Unverified
3TranX + BERT w/minedAccuracy81.03—Unverified
4RerankerAccuracy80.2—Unverified
5LUKEMarianAccuracy78.5—Unverified
6RoBERTaMarianAccuracy77.95—Unverified
7BERTMarianAccuracy76.68—Unverified
8TranxAccuracy73.7—Unverified
9ELECTRAMarianAccuracy65.32—Unverified
10lpn (Ling et al., 2016)Accuracy62.3—Unverified
#ModelMetricClaimedVerifiedStatus
1NL2SQL-RULEExecution Accuracy89.2—Unverified
2TypeSQL+TC (Yu et al., 2018)+Execution Accuracy82.6—Unverified
3TranxExecution Accuracy78.6—Unverified
4STAMP+RL (Sun et al., 2018)+Execution Accuracy74.6—Unverified
5STAMP (Sun et al., 2018)+Execution Accuracy74.4—Unverified
6TypeSQL (Yu et al., 2018)Execution Accuracy73.5—Unverified
7PT-MAML (Huang et al., 2018)Execution Accuracy68—Unverified
8Bidirectional Attention for SQL GenerationExecution Accuracy62.5—Unverified
9Seq2SQL (Zhong et al., 2017)Execution Accuracy59.4—Unverified
10Seq2Seq (Zhong et al., 2017)Execution Accuracy35.9—Unverified
#ModelMetricClaimedVerifiedStatus
1QurrentOS-coder + Claude 3.5 Sonnetpass@158—Unverified
2QurrentOS-coder + GPT-4opass@146—Unverified
3QurrentOS-coder + GPT-4 Turbopass@137—Unverified
4QurrentOS-coder + Claude 3 Opuspass@136—Unverified
5QurrentOS-coder + Gemini 1.5 Propass@130—Unverified
6QurrentOS-coder + GPT-4pass@130—Unverified
7QurrentOS-coder + DeepSeek-Coder-V2pass@129—Unverified
8QurrentOS-coder + Llama 3 70bpass@120—Unverified
9QurrentOS-coder + Qwen-72B-Instructpass@118—Unverified
#ModelMetricClaimedVerifiedStatus
1EG-CFG (DeepSeek-V3-0324)Test Set pass@158.18—Unverified
2LPW (GPT-4o)Test Set pass@134.7—Unverified
3MapCoder (GPT-4)Test Set pass@128.5—Unverified
4CodeSim (GPT4)Test Set pass@128.4—Unverified
5MoTCoder-15BTest Set pass@126.34—Unverified
6MoTCoder-7B-v1.5Test Set pass@120.77—Unverified
7CodeChain + WizardCoder-15BTest Set pass@12.35—Unverified
8WizardCoder-15BTest Set pass@11.11—Unverified
#ModelMetricClaimedVerifiedStatus
1DeepSeek-R1 (MGDebugger)Pass@1100—Unverified
2LLaMA 3Pass@199.4—Unverified
3QualityFlow (Sonnet-3.5)Pass@198.8—Unverified
4Phi-2Pass@198.2—Unverified
5EG-CFG (DeepSeek-V3-0324)Pass@196.95—Unverified
6Mistral 7BPass@193.9—Unverified
7Claude Sonnet 3.5Pass@190.85—Unverified
8L2MAC (GPT-4)Pass@190.2—Unverified
#ModelMetricClaimedVerifiedStatus
1Claude 3 HaikuPass@327.67—Unverified
2GPT-3.5 TurboPass@323.75—Unverified
3codechat-bisonPass@311.39—Unverified
4chat-bisonPass@38.48—Unverified
5Mixtral-8x7B-InstructPass@38.35—Unverified
6Phi-3-mini-128k-instructPass@37.18—Unverified
7WizardLM-2-7BPass@33.72—Unverified
8Llama-3-8B-InstructPass@33.1—Unverified
#ModelMetricClaimedVerifiedStatus
1o1-previewpass@10.95—Unverified
2o1-minipass@10.94—Unverified
3gpt-4o-2024-08-06pass@10.89—Unverified
4claude-3.5-sonnetpass@10.88—Unverified
5deepseek-v2.5pass@10.83—Unverified
6mistral-large-2pass@10.78—Unverified
7deepseek-coder-v2-instructpass@10.7—Unverified
8llama-v3p1-405b-instructpass@10.3—Unverified
#ModelMetricClaimedVerifiedStatus
1BART W/ MinedBLEU35.32—Unverified
2BART BaseBLEU34.35—Unverified
3External Knowledge With API + RerankingBLEU20.54—Unverified
4External Knowledge With APIBLEU20.37—Unverified
5RerankerBLEU19.85—Unverified
6TranXBLEU18.85—Unverified
#ModelMetricClaimedVerifiedStatus
1claude-3-5-sonnetpass@10.68—Unverified
2o1-minipass@10.67—Unverified