SOTAVerified

Code Generation

Code Generation is an important field to predict explicit code or program structure from multimodal data sources such as incomplete code, programs in another programming language, natural language descriptions or execution examples. Code Generation tools can assist the development of automatic programming tools to improve programming productivity.

Source: Deep Learning for Source Code Modeling and Generation

Image source: Measuring Coding Challenge Competence With APPS

Papers

Showing 551–600 of 1697 papers

TitleStatusHype
Exploring the Capabilities of the Frontier Large Language Models for Nuclear Energy Research—0
Repeton: Structured Bug Repair with ReAct-Guided Patch-and-Test Cycles—0
Worst-Case Symbolic Constraints Analysis and Generalisation with Large Language Models—0
ProtocolLLM: RTL Benchmark for SystemVerilog Generation of Communication Protocols—0
LLMs Caught in the Crossfire: Malware Requests and Jailbreak ChallengesCode0
Chain-of-Code Collapse: Reasoning Failures in LLMs via Adversarial Prompting in Code GenerationCode0
VeriLoC: Line-of-Code Level Prediction of Hardware Design Quality from Verilog Code—0
Can LLMs Generate Reliable Test Case Generators? A Study on Competition-Level Programming Problems—0
CP-Bench: Evaluating Large Language Models for Constraint Modelling—0
SafeGenBench: A Benchmark Framework for Security Vulnerability Detection in LLM-Generated Code—0
Can Theoretical Physics Research Benefit from Language Agents?—0
hdl2v: A Code Translation Dataset for Enhanced LLM Verilog Generation—0
ScaleRTL: Scaling LLMs with Reasoning Data and Test-Time Compute for Accurate RTL Code Generation—0
ICPC-Eval: Probing the Frontiers of LLM Reasoning with Competitive Programming Contests—0
Deployability-Centric Infrastructure-as-Code Generation: An LLM-based Iterative FrameworkCode0
Demonstrations of Integrity Attacks in Multi-Agent Systems—0
Matter-of-Fact: A Benchmark for Verifying the Feasibility of Literature-Supported Claims in Materials ScienceCode0
From Virtual Agents to Robot Teams: A Multi-Robot Framework Evaluation in High-Stakes Healthcare Context—0
CETBench: A Novel Dataset constructed via Transformations over Programs for Benchmarking LLMs for Code-Equivalence Checking—0
Generating Automotive Code: Large Language Models for Software Development and Verification in Safety-Critical Systems—0
VisCoder: Fine-Tuning LLMs for Executable Python Visualization Code Generation—0
Rethinking the effects of data contamination in Code Intelligence—0
Adaptive Graph Pruning for Multi-Agent CommunicationCode0
DiaBlo: Diagonal Blocks Are Sufficient For FinetuningCode0
How do Pre-Trained Models Support Software Engineering? An Empirical Study in Hugging Face—0
ResearchCodeBench: Benchmarking LLMs on Implementing Novel Machine Learning Research Code—0
SALAD: Systematic Assessment of Machine Unlearing on LLM-Aided Hardware Design—0
Flow2Code: Evaluating Large Language Models for Flowchart-based Code Generation CapabilityCode0
Legal Compliance Evaluation of Smart Contracts Generated By Large Language Models—0
CoQuIR: A Comprehensive Benchmark for Code Quality-Aware Information Retrieval—0
SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation—0
HardTests: Synthesizing High-Quality Test Cases for LLM Coding—0
RMoA: Optimizing Mixture-of-Agents through Diversity Maximization and Residual CompensationCode0
Cascading Adversarial Bias from Injection to Distillation in Language Models—0
A Reward-driven Automated Webshell Malicious-code Generator for Red-teaming—0
Eye of Judgement: Dissecting the Evaluation of Russian-speaking LLMs with POLLUX—0
Writing-Zero: Bridge the Gap Between Non-verifiable Tasks and Verifiable Rewards—0
OSS-UAgent: An Agent-based Usability Evaluation Framework for Open Source SoftwareCode0
Self-Correcting Code Generation Using Small Language ModelsCode0
Infinite-Instruct: Synthesizing Scaling Code instruction Data with Bidirectional Synthesis and Static VerificationCode0
Using Reasoning Models to Generate Search Heuristics that Solve Open Instances of Combinatorial Design ProblemsCode0
LLM Performance for Code Generation on Noisy TasksCode0
SwingArena: Competitive Programming Arena for Long-context GitHub Issue Solving—0
Enhancing LLM-Based Code Generation with Complexity Metrics: A Feedback-Driven Approach—0
HiLDe: Intentional Code Generation via Human-in-the-Loop Decoding—0
DeepRTL2: A Versatile Model for RTL-Related Tasks—0
Rendering-Aware Reinforcement Learning for Vector Graphics Generation—0
An LLM-as-Judge Metric for Bridging the Gap with Human Evaluation in SE Tasks—0
RepoMaster: Autonomous Exploration and Understanding of GitHub Repositories for Complex Task SolvingCode0
An Empirical Study on Strong-Weak Model Collaboration for Repo-level Code GenerationCode0
Show:102550
← PrevPage 12 of 34Next →

Benchmark Results

#ModelMetricClaimedVerifiedStatus
1EG-CFG (DeepSeek-V3-0324)Accuracy96.6—Unverified
2QualityFlow (Sonnet-3.5)Accuracy94.2—Unverified
3o1-mini + MapCoder (Hamming.ai)Accuracy93.2—Unverified
4MGDebugger (DeepSeek-V3-0324)Accuracy92.4—Unverified
5GPT-4 + AgentCoderAccuracy91.8—Unverified
6CodeSim (GPT4o)Accuracy90.7—Unverified
7Jiutian-大模型Accuracy90—Unverified
8GPT-3.5 Turbo (ChatGPT) + AgentCoderAccuracy89.9—Unverified
9MapCoder (GPT-4o)Accuracy89.7—Unverified
10GPT-4 (ChatGPT Plus)Accuracy87.5—Unverified
#ModelMetricClaimedVerifiedStatus
1LPW (GPT-4o)Introductory Pass@187.2—Unverified
2MoTCoder-32B-V1.5Introductory Pass@168.44—Unverified
3MoTCoder-7B-V1.5Introductory Pass@154.26—Unverified
4code-davinci-002 175B (CodeT)Introductory Pass@147.3—Unverified
5deepseek-ai/deepseek-coder-6.7b-instructIntroductory Pass@133.8—Unverified
6code-davinci-002 175BIntroductory Pass@131.92—Unverified
7CodeChain+WizardCoder-15bIntroductory Pass@129.3—Unverified
8WizardCoder-15bIntroductory Pass@126.29—Unverified
9CodeSim (GPT4)Introductory Pass@126.04—Unverified
10AlphaCode 1B Filtered from 50000Competition Pass@any22—Unverified
#ModelMetricClaimedVerifiedStatus
1PanGu-Coder-FT-IBLEU44.32—Unverified
2RoBERTaMarianBLEU35.74—Unverified
3MarianCGBLEU34.43—Unverified
4TranX + BERT w/minedBLEU34.2—Unverified
5BERT + TAEBLEU33.41—Unverified
6BERTMarianBLEU32.46—Unverified
7External Knowledge With API + RerankingBLEU32.26—Unverified
8External Knowledge With APIBLEU30.69—Unverified
9BART W/ MinedBLEU30.55—Unverified
10ELECTRAMarianBLEU30.18—Unverified
#ModelMetricClaimedVerifiedStatus
1MarianCGAccuracy81.83—Unverified
2BERT + TAEAccuracy81.03—Unverified
3TranX + BERT w/minedAccuracy81.03—Unverified
4RerankerAccuracy80.2—Unverified
5LUKEMarianAccuracy78.5—Unverified
6RoBERTaMarianAccuracy77.95—Unverified
7BERTMarianAccuracy76.68—Unverified
8TranxAccuracy73.7—Unverified
9ELECTRAMarianAccuracy65.32—Unverified
10lpn (Ling et al., 2016)Accuracy62.3—Unverified
#ModelMetricClaimedVerifiedStatus
1NL2SQL-RULEExecution Accuracy89.2—Unverified
2TypeSQL+TC (Yu et al., 2018)+Execution Accuracy82.6—Unverified
3TranxExecution Accuracy78.6—Unverified
4STAMP+RL (Sun et al., 2018)+Execution Accuracy74.6—Unverified
5STAMP (Sun et al., 2018)+Execution Accuracy74.4—Unverified
6TypeSQL (Yu et al., 2018)Execution Accuracy73.5—Unverified
7PT-MAML (Huang et al., 2018)Execution Accuracy68—Unverified
8Bidirectional Attention for SQL GenerationExecution Accuracy62.5—Unverified
9Seq2SQL (Zhong et al., 2017)Execution Accuracy59.4—Unverified
10Seq2Seq (Zhong et al., 2017)Execution Accuracy35.9—Unverified
#ModelMetricClaimedVerifiedStatus
1QurrentOS-coder + Claude 3.5 Sonnetpass@158—Unverified
2QurrentOS-coder + GPT-4opass@146—Unverified
3QurrentOS-coder + GPT-4 Turbopass@137—Unverified
4QurrentOS-coder + Claude 3 Opuspass@136—Unverified
5QurrentOS-coder + Gemini 1.5 Propass@130—Unverified
6QurrentOS-coder + GPT-4pass@130—Unverified
7QurrentOS-coder + DeepSeek-Coder-V2pass@129—Unverified
8QurrentOS-coder + Llama 3 70bpass@120—Unverified
9QurrentOS-coder + Qwen-72B-Instructpass@118—Unverified
#ModelMetricClaimedVerifiedStatus
1EG-CFG (DeepSeek-V3-0324)Test Set pass@158.18—Unverified
2LPW (GPT-4o)Test Set pass@134.7—Unverified
3MapCoder (GPT-4)Test Set pass@128.5—Unverified
4CodeSim (GPT4)Test Set pass@128.4—Unverified
5MoTCoder-15BTest Set pass@126.34—Unverified
6MoTCoder-7B-v1.5Test Set pass@120.77—Unverified
7CodeChain + WizardCoder-15BTest Set pass@12.35—Unverified
8WizardCoder-15BTest Set pass@11.11—Unverified
#ModelMetricClaimedVerifiedStatus
1DeepSeek-R1 (MGDebugger)Pass@1100—Unverified
2LLaMA 3Pass@199.4—Unverified
3QualityFlow (Sonnet-3.5)Pass@198.8—Unverified
4Phi-2Pass@198.2—Unverified
5EG-CFG (DeepSeek-V3-0324)Pass@196.95—Unverified
6Mistral 7BPass@193.9—Unverified
7Claude Sonnet 3.5Pass@190.85—Unverified
8L2MAC (GPT-4)Pass@190.2—Unverified
#ModelMetricClaimedVerifiedStatus
1Claude 3 HaikuPass@327.67—Unverified
2GPT-3.5 TurboPass@323.75—Unverified
3codechat-bisonPass@311.39—Unverified
4chat-bisonPass@38.48—Unverified
5Mixtral-8x7B-InstructPass@38.35—Unverified
6Phi-3-mini-128k-instructPass@37.18—Unverified
7WizardLM-2-7BPass@33.72—Unverified
8Llama-3-8B-InstructPass@33.1—Unverified
#ModelMetricClaimedVerifiedStatus
1o1-previewpass@10.95—Unverified
2o1-minipass@10.94—Unverified
3gpt-4o-2024-08-06pass@10.89—Unverified
4claude-3.5-sonnetpass@10.88—Unverified
5deepseek-v2.5pass@10.83—Unverified
6mistral-large-2pass@10.78—Unverified
7deepseek-coder-v2-instructpass@10.7—Unverified
8llama-v3p1-405b-instructpass@10.3—Unverified
#ModelMetricClaimedVerifiedStatus
1BART W/ MinedBLEU35.32—Unverified
2BART BaseBLEU34.35—Unverified
3External Knowledge With API + RerankingBLEU20.54—Unverified
4External Knowledge With APIBLEU20.37—Unverified
5RerankerBLEU19.85—Unverified
6TranXBLEU18.85—Unverified
#ModelMetricClaimedVerifiedStatus
1claude-3-5-sonnetpass@10.68—Unverified
2o1-minipass@10.67—Unverified