SOTAVerified

Code Generation

Code Generation is an important field to predict explicit code or program structure from multimodal data sources such as incomplete code, programs in another programming language, natural language descriptions or execution examples. Code Generation tools can assist the development of automatic programming tools to improve programming productivity.

Source: Deep Learning for Source Code Modeling and Generation

Image source: Measuring Coding Challenge Competence With APPS

Papers

Showing 651–700 of 1697 papers

TitleStatusHype
LLM Code Customization with Visual Results: A Benchmark on TikZ—0
YABLoCo: Yet Another Benchmark for Long Context Code Generation—0
A Proposal for Evaluating the Operational Risk for ChatBots based on Large Language Models—0
Scratch Copilot: Supporting Youth Creative Coding with AI—0
STORY2GAME: Generating (Almost) Everything in an Interactive Fiction Game—0
MARCO: Multi-Agent Code Optimization with Real-Time Knowledge Integration for High-Performance Computing—0
Capability-Driven Skill Generation with LLMs: A RAG-Based Approach for Reusing Existing Libraries and Interfaces—0
AKD : Adversarial Knowledge Distillation For Large Language Models Alignment on Coding tasks—0
QiMeng-Xpiler: Transcompiling Tensor Programs for Deep Learning Systems with a Neural-Symbolic Approach—0
CHORUS: Zero-shot Hierarchical Retrieval and Orchestration for Generating Linear Programming Code—0
Ensuring Reproducibility in Generative AI Systems for General Use Cases: A Framework for Regression Testing and Open DatasetsCode0
A Rusty Link in the AI Supply Chain: Detecting Evil Configurations in Model Repositories—0
PipeSpec: Breaking Stage Dependencies in Hierarchical LLM Decoding—0
Program Semantic Inequivalence Game with Large Language ModelsCode0
CodeFlowBench: A Multi-turn, Iterative Benchmark for Complex Code GenerationCode0
Assessing LLM code generation quality through path planning tasks—0
Hallucination by Code Generation LLMs: Taxonomy, Benchmarks, Mitigation, and Challenges—0
Computational Reasoning of Large Language ModelsCode0
The Hidden Risks of LLM-Generated Web Application Code: A Security-Centric Evaluation of Code Generation Capabilities in Large Language Models—0
CoCo-Bench: A Comprehensive Code Benchmark For Multi-task Large Language Model Evaluation—0
Skill Discovery for Software Scripting Automation via Offline Simulations with LLMs—0
ARCS: Agentic Retrieval-Augmented Code Synthesis with Iterative Refinement—0
SecRepoBench: Benchmarking LLMs for Secure Code Generation in Real-World Repositories—0
An Automated Reinforcement Learning Reward Design Framework with Large Language Model for Cooperative Platoon Coordination—0
CodeBC: A More Secure Large Language Model for Smart Contract Code Generation in BlockchainCode0
Towards Machine-Generated Code for the Resolution of User IntentionsCode0
High-Fidelity And Complex Test Data Generation For Real-World SQL Code Generation Services—0
Evaluating Grounded Reasoning by Code-Assisted Large Language Models for Mathematics—0
On Developers' Self-Declaration of AI-Generated Code: An Analysis of PracticesCode0
ClarifyCoder: Clarification-Aware Fine-Tuning for Programmatic Problem Solving—0
EduBot -- Can LLMs Solve Personalized Learning and Programming Assignments?—0
VeriCoder: Enhancing LLM-Based RTL Code Generation through Functional Correctness Validation—0
A Large-scale Class-level Benchmark Dataset for Code Generation with LLMs—0
Insights from Verification: Training a Verilog Generation LLM with Reinforcement Learning with Testbench Feedback—0
Evaluating Judges as Evaluators: The JETTS Benchmark of LLM-as-Judges as Test-Time Scaling EvaluatorsCode0
Evaluating Code Generation of LLMs in Advanced Computer Science Problems—0
Empowering AI to Generate Better AI Code: Guided Generation of Deep Learning Projects with LLMs—0
Towards Optimal Circuit Generation: Multi-Agent Collaboration Meets Collective IntelligenceCode0
LeetCodeDataset: A Temporal Dataset for Robust Evaluation and Efficient Training of Code LLMsCode0
ReasoningV: Efficient Verilog Code Generation with Adaptive Hybrid Reasoning ModelCode0
Improving RL Exploration for LLM Reasoning through Retrospective Replay—0
CodeVisionary: An Agent-based Framework for Evaluating Large Language Models in Code Generation—0
Towards End-to-End Network Intent Management with Large Language Models—0
Do Prompt Patterns Affect Code Quality? A First Empirical Assessment of ChatGPT-Generated Code—0
Syntactic and Semantic Control of Large Language Models via Sequential Monte Carlo—0
Code Copycat Conundrum: Demystifying Repetition in LLM-based Code Generation—0
RoboTwin: Dual-Arm Robot Benchmark with Generative Digital TwinsCode0
Themisto: Jupyter-Based Runtime Benchmark—0
Rethinking the Generation of High-Quality CoT Data from the Perspective of LLM-Adaptive Question Difficulty Grading—0
The Future of MLLM Prompting is Adaptive: A Comprehensive Experimental Evaluation of Prompt Engineering Methods for Robust Multimodal Performance—0
Show:102550
← PrevPage 14 of 34Next →

Benchmark Results

#ModelMetricClaimedVerifiedStatus
1EG-CFG (DeepSeek-V3-0324)Accuracy96.6—Unverified
2QualityFlow (Sonnet-3.5)Accuracy94.2—Unverified
3o1-mini + MapCoder (Hamming.ai)Accuracy93.2—Unverified
4MGDebugger (DeepSeek-V3-0324)Accuracy92.4—Unverified
5GPT-4 + AgentCoderAccuracy91.8—Unverified
6CodeSim (GPT4o)Accuracy90.7—Unverified
7Jiutian-大模型Accuracy90—Unverified
8GPT-3.5 Turbo (ChatGPT) + AgentCoderAccuracy89.9—Unverified
9MapCoder (GPT-4o)Accuracy89.7—Unverified
10GPT-4 (ChatGPT Plus)Accuracy87.5—Unverified
#ModelMetricClaimedVerifiedStatus
1LPW (GPT-4o)Introductory Pass@187.2—Unverified
2MoTCoder-32B-V1.5Introductory Pass@168.44—Unverified
3MoTCoder-7B-V1.5Introductory Pass@154.26—Unverified
4code-davinci-002 175B (CodeT)Introductory Pass@147.3—Unverified
5deepseek-ai/deepseek-coder-6.7b-instructIntroductory Pass@133.8—Unverified
6code-davinci-002 175BIntroductory Pass@131.92—Unverified
7CodeChain+WizardCoder-15bIntroductory Pass@129.3—Unverified
8WizardCoder-15bIntroductory Pass@126.29—Unverified
9CodeSim (GPT4)Introductory Pass@126.04—Unverified
10AlphaCode 1B Filtered from 50000Competition Pass@any22—Unverified
#ModelMetricClaimedVerifiedStatus
1PanGu-Coder-FT-IBLEU44.32—Unverified
2RoBERTaMarianBLEU35.74—Unverified
3MarianCGBLEU34.43—Unverified
4TranX + BERT w/minedBLEU34.2—Unverified
5BERT + TAEBLEU33.41—Unverified
6BERTMarianBLEU32.46—Unverified
7External Knowledge With API + RerankingBLEU32.26—Unverified
8External Knowledge With APIBLEU30.69—Unverified
9BART W/ MinedBLEU30.55—Unverified
10ELECTRAMarianBLEU30.18—Unverified
#ModelMetricClaimedVerifiedStatus
1MarianCGAccuracy81.83—Unverified
2BERT + TAEAccuracy81.03—Unverified
3TranX + BERT w/minedAccuracy81.03—Unverified
4RerankerAccuracy80.2—Unverified
5LUKEMarianAccuracy78.5—Unverified
6RoBERTaMarianAccuracy77.95—Unverified
7BERTMarianAccuracy76.68—Unverified
8TranxAccuracy73.7—Unverified
9ELECTRAMarianAccuracy65.32—Unverified
10lpn (Ling et al., 2016)Accuracy62.3—Unverified
#ModelMetricClaimedVerifiedStatus
1NL2SQL-RULEExecution Accuracy89.2—Unverified
2TypeSQL+TC (Yu et al., 2018)+Execution Accuracy82.6—Unverified
3TranxExecution Accuracy78.6—Unverified
4STAMP+RL (Sun et al., 2018)+Execution Accuracy74.6—Unverified
5STAMP (Sun et al., 2018)+Execution Accuracy74.4—Unverified
6TypeSQL (Yu et al., 2018)Execution Accuracy73.5—Unverified
7PT-MAML (Huang et al., 2018)Execution Accuracy68—Unverified
8Bidirectional Attention for SQL GenerationExecution Accuracy62.5—Unverified
9Seq2SQL (Zhong et al., 2017)Execution Accuracy59.4—Unverified
10Seq2Seq (Zhong et al., 2017)Execution Accuracy35.9—Unverified
#ModelMetricClaimedVerifiedStatus
1QurrentOS-coder + Claude 3.5 Sonnetpass@158—Unverified
2QurrentOS-coder + GPT-4opass@146—Unverified
3QurrentOS-coder + GPT-4 Turbopass@137—Unverified
4QurrentOS-coder + Claude 3 Opuspass@136—Unverified
5QurrentOS-coder + Gemini 1.5 Propass@130—Unverified
6QurrentOS-coder + GPT-4pass@130—Unverified
7QurrentOS-coder + DeepSeek-Coder-V2pass@129—Unverified
8QurrentOS-coder + Llama 3 70bpass@120—Unverified
9QurrentOS-coder + Qwen-72B-Instructpass@118—Unverified
#ModelMetricClaimedVerifiedStatus
1EG-CFG (DeepSeek-V3-0324)Test Set pass@158.18—Unverified
2LPW (GPT-4o)Test Set pass@134.7—Unverified
3MapCoder (GPT-4)Test Set pass@128.5—Unverified
4CodeSim (GPT4)Test Set pass@128.4—Unverified
5MoTCoder-15BTest Set pass@126.34—Unverified
6MoTCoder-7B-v1.5Test Set pass@120.77—Unverified
7CodeChain + WizardCoder-15BTest Set pass@12.35—Unverified
8WizardCoder-15BTest Set pass@11.11—Unverified
#ModelMetricClaimedVerifiedStatus
1DeepSeek-R1 (MGDebugger)Pass@1100—Unverified
2LLaMA 3Pass@199.4—Unverified
3QualityFlow (Sonnet-3.5)Pass@198.8—Unverified
4Phi-2Pass@198.2—Unverified
5EG-CFG (DeepSeek-V3-0324)Pass@196.95—Unverified
6Mistral 7BPass@193.9—Unverified
7Claude Sonnet 3.5Pass@190.85—Unverified
8L2MAC (GPT-4)Pass@190.2—Unverified
#ModelMetricClaimedVerifiedStatus
1Claude 3 HaikuPass@327.67—Unverified
2GPT-3.5 TurboPass@323.75—Unverified
3codechat-bisonPass@311.39—Unverified
4chat-bisonPass@38.48—Unverified
5Mixtral-8x7B-InstructPass@38.35—Unverified
6Phi-3-mini-128k-instructPass@37.18—Unverified
7WizardLM-2-7BPass@33.72—Unverified
8Llama-3-8B-InstructPass@33.1—Unverified
#ModelMetricClaimedVerifiedStatus
1o1-previewpass@10.95—Unverified
2o1-minipass@10.94—Unverified
3gpt-4o-2024-08-06pass@10.89—Unverified
4claude-3.5-sonnetpass@10.88—Unverified
5deepseek-v2.5pass@10.83—Unverified
6mistral-large-2pass@10.78—Unverified
7deepseek-coder-v2-instructpass@10.7—Unverified
8llama-v3p1-405b-instructpass@10.3—Unverified
#ModelMetricClaimedVerifiedStatus
1BART W/ MinedBLEU35.32—Unverified
2BART BaseBLEU34.35—Unverified
3External Knowledge With API + RerankingBLEU20.54—Unverified
4External Knowledge With APIBLEU20.37—Unverified
5RerankerBLEU19.85—Unverified
6TranXBLEU18.85—Unverified
#ModelMetricClaimedVerifiedStatus
1claude-3-5-sonnetpass@10.68—Unverified
2o1-minipass@10.67—Unverified