SOTAVerified

Code Generation

Code Generation is an important field to predict explicit code or program structure from multimodal data sources such as incomplete code, programs in another programming language, natural language descriptions or execution examples. Code Generation tools can assist the development of automatic programming tools to improve programming productivity.

Source: Deep Learning for Source Code Modeling and Generation

Image source: Measuring Coding Challenge Competence With APPS

Papers

Showing 801–850 of 1697 papers

TitleStatusHype
Conversational Planning for Personal Plans—0
Detection of LLM-Paraphrased Code and Identification of the Responsible LLM Using Coding Style Features—0
Assistance or Disruption? Exploring and Evaluating the Design and Trade-offs of Proactive AI Programming Support—0
CodeSwift: Accelerating LLM Inference for Efficient Code Generation—0
RewardDS: Privacy-Preserving Fine-Tuning for Large Language Models via Reward Driven Data Synthesis—0
An Analyst-Inspector Framework for Evaluating Reproducibility of LLMs in Data ScienceCode0
Beyond Trusting Trust: Multi-Model Validation for Robust Code Generation—0
Comparative Analysis of Large Language Models for Context-Aware Code Completion using SAFIM Framework—0
Mechanistic Understanding of Language Models in Syntactic Code Completion—0
Pragmatic Reasoning improves LLM Code Generation—0
GATE: Graph-based Adaptive Tool Evolution Across Diverse TasksCode0
DeepRTL: Bridging Verilog Understanding and Generation with a Unified Representation Model—0
Hidden Darkness in LLM-Generated Designs: Exploring Dark Patterns in Ecommerce Web Components Generated by LLMs—0
Exploring Code Language Models for Automated HLS-based Hardware Generation: Benchmark, Infrastructure and Analysis—0
BeamLoRA: Beam-Constraint Low-Rank Adaptation—0
Explore-Construct-Filter: An Automated Framework for Rich and Reliable API Knowledge Graph Construction—0
Interactive Agents to Overcome Ambiguity in Software EngineeringCode0
The Role of GitHub Copilot on Software Development: A Perspective on Productivity, Security, Best Practices and Future Directions—0
Sens-Merging: Sensitivity-Guided Parameter Balancing for Merging Large Language Models—0
UniGenCoder: Merging Seq2Seq and Seq2Tree Paradigms for Unified Code GenerationCode0
EquiBench: Benchmarking Large Language Models' Understanding of Program Semantics via Equivalence Checking—0
Boost, Disentangle, and Customize: A Robust System2-to-System1 Pipeline for Code Generation—0
GSCE: A Prompt Framework with Enhanced Reasoning for Reliable LLM-driven Drone Control—0
Performance Evaluation of Large Language Models in Statistical ProgrammingCode0
LLM4EFFI: Leveraging Large Language Models to Enhance Code Efficiency and Correctness—0
GiFT: Gibbs Fine-Tuning for Code GenerationCode0
ToolCoder: A Systematic Code-Empowered Tool Learning Framework for Large Language ModelsCode0
UnitCoder: Scalable Iterative Code Synthesis with Unit Test Guidance—0
An Interpretable Automated Mechanism Design Framework with Large Language Models—0
Automated Visualization Code Synthesis via Multi-Path Reasoning and Feedback-Driven Optimization—0
Performance Review on LLM for solving leetcode problems—0
SURGE: On the Potential of Large Language Models as General-Purpose Surrogate Code ExecutorsCode0
Diversified Sampling Improves Scaling LLM inference—0
1bit-Merging: Dynamic Quantized Merging for Large Language Models—0
CoCoEvo: Co-Evolution of Programs and Test Cases to Enhance Code GenerationCode0
RefineCoder: Iterative Improving of Large Language Models via Adaptive Critique Refinement for Code Generation—0
3D-Grounded Vision-Language Framework for Robotic Task Planning: Automated Prompt Synthesis and Supervised Reasoning—0
CRANE: Reasoning with constrained LLM generation—0
Enhancing LLM Character-Level Manipulation via Divide and Conquer—0
From PowerPoint UI Sketches to Web-Based Applications: Pattern-Driven Code Generation for GIS Dashboard Development Using Knowledge-Augmented LLMs, Context-Aware Visual Prompting, and the React Framework—0
Rethinking Fine-Tuning when Scaling Test-Time Compute: Limiting Confidence Improves Mathematical ReasoningCode0
Bridging LLM-Generated Code and Requirements: Reverse Generation technique and SBC Metric for Developer InsightsCode0
Verifying LLM-Generated Code in the Context of Software Verification with Ada/SPARK—0
What I cannot execute, I do not understand: Training and Evaluating LLMs on Program Execution Traces—0
Cardiverse: Harnessing LLMs for Novel Card Game Prototyping—0
SnipGen: A Mining Repository Framework for Evaluating LLMs for Code—0
Can LLMs Replace Human Evaluators? An Empirical Study of LLM-as-a-Judge in Software Engineering—0
LessLeak-Bench: A First Investigation of Data Leakage in LLMs Across 83 Software Engineering Benchmarks—0
Mitigating Sensitive Information Leakage in LLMs4Code through Machine Unlearning—0
Benchmarking Prompt Engineering Techniques for Secure Code Generation with GPT Models—0
Show:102550
← PrevPage 17 of 34Next →

Benchmark Results

#ModelMetricClaimedVerifiedStatus
1EG-CFG (DeepSeek-V3-0324)Accuracy96.6—Unverified
2QualityFlow (Sonnet-3.5)Accuracy94.2—Unverified
3o1-mini + MapCoder (Hamming.ai)Accuracy93.2—Unverified
4MGDebugger (DeepSeek-V3-0324)Accuracy92.4—Unverified
5GPT-4 + AgentCoderAccuracy91.8—Unverified
6CodeSim (GPT4o)Accuracy90.7—Unverified
7Jiutian-大模型Accuracy90—Unverified
8GPT-3.5 Turbo (ChatGPT) + AgentCoderAccuracy89.9—Unverified
9MapCoder (GPT-4o)Accuracy89.7—Unverified
10GPT-4 (ChatGPT Plus)Accuracy87.5—Unverified
#ModelMetricClaimedVerifiedStatus
1LPW (GPT-4o)Introductory Pass@187.2—Unverified
2MoTCoder-32B-V1.5Introductory Pass@168.44—Unverified
3MoTCoder-7B-V1.5Introductory Pass@154.26—Unverified
4code-davinci-002 175B (CodeT)Introductory Pass@147.3—Unverified
5deepseek-ai/deepseek-coder-6.7b-instructIntroductory Pass@133.8—Unverified
6code-davinci-002 175BIntroductory Pass@131.92—Unverified
7CodeChain+WizardCoder-15bIntroductory Pass@129.3—Unverified
8WizardCoder-15bIntroductory Pass@126.29—Unverified
9CodeSim (GPT4)Introductory Pass@126.04—Unverified
10AlphaCode 1B Filtered from 50000Competition Pass@any22—Unverified
#ModelMetricClaimedVerifiedStatus
1PanGu-Coder-FT-IBLEU44.32—Unverified
2RoBERTaMarianBLEU35.74—Unverified
3MarianCGBLEU34.43—Unverified
4TranX + BERT w/minedBLEU34.2—Unverified
5BERT + TAEBLEU33.41—Unverified
6BERTMarianBLEU32.46—Unverified
7External Knowledge With API + RerankingBLEU32.26—Unverified
8External Knowledge With APIBLEU30.69—Unverified
9BART W/ MinedBLEU30.55—Unverified
10ELECTRAMarianBLEU30.18—Unverified
#ModelMetricClaimedVerifiedStatus
1MarianCGAccuracy81.83—Unverified
2BERT + TAEAccuracy81.03—Unverified
3TranX + BERT w/minedAccuracy81.03—Unverified
4RerankerAccuracy80.2—Unverified
5LUKEMarianAccuracy78.5—Unverified
6RoBERTaMarianAccuracy77.95—Unverified
7BERTMarianAccuracy76.68—Unverified
8TranxAccuracy73.7—Unverified
9ELECTRAMarianAccuracy65.32—Unverified
10lpn (Ling et al., 2016)Accuracy62.3—Unverified
#ModelMetricClaimedVerifiedStatus
1NL2SQL-RULEExecution Accuracy89.2—Unverified
2TypeSQL+TC (Yu et al., 2018)+Execution Accuracy82.6—Unverified
3TranxExecution Accuracy78.6—Unverified
4STAMP+RL (Sun et al., 2018)+Execution Accuracy74.6—Unverified
5STAMP (Sun et al., 2018)+Execution Accuracy74.4—Unverified
6TypeSQL (Yu et al., 2018)Execution Accuracy73.5—Unverified
7PT-MAML (Huang et al., 2018)Execution Accuracy68—Unverified
8Bidirectional Attention for SQL GenerationExecution Accuracy62.5—Unverified
9Seq2SQL (Zhong et al., 2017)Execution Accuracy59.4—Unverified
10Seq2Seq (Zhong et al., 2017)Execution Accuracy35.9—Unverified
#ModelMetricClaimedVerifiedStatus
1QurrentOS-coder + Claude 3.5 Sonnetpass@158—Unverified
2QurrentOS-coder + GPT-4opass@146—Unverified
3QurrentOS-coder + GPT-4 Turbopass@137—Unverified
4QurrentOS-coder + Claude 3 Opuspass@136—Unverified
5QurrentOS-coder + Gemini 1.5 Propass@130—Unverified
6QurrentOS-coder + GPT-4pass@130—Unverified
7QurrentOS-coder + DeepSeek-Coder-V2pass@129—Unverified
8QurrentOS-coder + Llama 3 70bpass@120—Unverified
9QurrentOS-coder + Qwen-72B-Instructpass@118—Unverified
#ModelMetricClaimedVerifiedStatus
1EG-CFG (DeepSeek-V3-0324)Test Set pass@158.18—Unverified
2LPW (GPT-4o)Test Set pass@134.7—Unverified
3MapCoder (GPT-4)Test Set pass@128.5—Unverified
4CodeSim (GPT4)Test Set pass@128.4—Unverified
5MoTCoder-15BTest Set pass@126.34—Unverified
6MoTCoder-7B-v1.5Test Set pass@120.77—Unverified
7CodeChain + WizardCoder-15BTest Set pass@12.35—Unverified
8WizardCoder-15BTest Set pass@11.11—Unverified
#ModelMetricClaimedVerifiedStatus
1DeepSeek-R1 (MGDebugger)Pass@1100—Unverified
2LLaMA 3Pass@199.4—Unverified
3QualityFlow (Sonnet-3.5)Pass@198.8—Unverified
4Phi-2Pass@198.2—Unverified
5EG-CFG (DeepSeek-V3-0324)Pass@196.95—Unverified
6Mistral 7BPass@193.9—Unverified
7Claude Sonnet 3.5Pass@190.85—Unverified
8L2MAC (GPT-4)Pass@190.2—Unverified
#ModelMetricClaimedVerifiedStatus
1Claude 3 HaikuPass@327.67—Unverified
2GPT-3.5 TurboPass@323.75—Unverified
3codechat-bisonPass@311.39—Unverified
4chat-bisonPass@38.48—Unverified
5Mixtral-8x7B-InstructPass@38.35—Unverified
6Phi-3-mini-128k-instructPass@37.18—Unverified
7WizardLM-2-7BPass@33.72—Unverified
8Llama-3-8B-InstructPass@33.1—Unverified
#ModelMetricClaimedVerifiedStatus
1o1-previewpass@10.95—Unverified
2o1-minipass@10.94—Unverified
3gpt-4o-2024-08-06pass@10.89—Unverified
4claude-3.5-sonnetpass@10.88—Unverified
5deepseek-v2.5pass@10.83—Unverified
6mistral-large-2pass@10.78—Unverified
7deepseek-coder-v2-instructpass@10.7—Unverified
8llama-v3p1-405b-instructpass@10.3—Unverified
#ModelMetricClaimedVerifiedStatus
1BART W/ MinedBLEU35.32—Unverified
2BART BaseBLEU34.35—Unverified
3External Knowledge With API + RerankingBLEU20.54—Unverified
4External Knowledge With APIBLEU20.37—Unverified
5RerankerBLEU19.85—Unverified
6TranXBLEU18.85—Unverified
#ModelMetricClaimedVerifiedStatus
1claude-3-5-sonnetpass@10.68—Unverified
2o1-minipass@10.67—Unverified