SOTAVerified

Code Generation

Code Generation is an important field to predict explicit code or program structure from multimodal data sources such as incomplete code, programs in another programming language, natural language descriptions or execution examples. Code Generation tools can assist the development of automatic programming tools to improve programming productivity.

Source: Deep Learning for Source Code Modeling and Generation

Image source: Measuring Coding Challenge Competence With APPS

Papers

Showing 601–650 of 1697 papers

TitleStatusHype
CODE-DITING: A Reasoning-Based Metric for Functional Alignment in Code Evaluation—0
Large Language Models for IT Automation Tasks: Are We There Yet?—0
Large Language Models in Code Co-generation for Safe Autonomous Vehicles—0
Style2Code: A Style-Controllable Code Generation Framework with Dual-Modal Contrastive Representation LearningCode0
ActiveDPO: Active Direct Preference Optimization for Sample-Efficient Alignment—0
Architectures of Error: A Philosophical Inquiry into AI and Human Code Generation—0
From Output to Evaluation: Does Raw Instruction-Tuned Code LLMs Output Suffice for Fill-in-the-Middle Code Generation?—0
PromptWise: Online Learning for Cost-Aware Prompt Assignment in Generative Models—0
Autocomp: LLM-Driven Code Optimization for Tensor Accelerators—0
Does Representation Intervention Really Identify Desired Concepts and Elicit Alignment?—0
HD-PiSSA: High-Rank Distributed Orthogonal Adaptation—0
Evaluating the Energy-Efficiency of the Code Generated by LLMs—0
PPT: A Process-based Preference Learning Framework for Self Improving Table Question Answering Models—0
HyGenar: An LLM-Driven Hybrid Genetic Algorithm for Few-Shot Grammar GenerationCode0
Code Graph Model (CGM): A Graph-Integrated Large Language Model for Repository-Level Software Engineering Tasks—0
Towards a Science of Causal Interpretability in Deep Learning for Software Engineering—0
MAPS: A Multilingual Benchmark for Global Agent Performance and Security—0
SIMCOPILOT: Evaluating Large Language Models for Copilot-Style Code Generation—0
Knowledge Graph Based Repository-Level Code Generation—0
Self-Evolving Curriculum for LLM Reasoning—0
Cheaper, Better, Faster, Stronger: Robust Text-to-SQL without Chain-of-Thought or Fine-Tuning—0
From Reasoning to Code: GRPO Optimization for Underrepresented Languages—0
Text Generation Beyond Discrete Token Sampling—0
RN-F: A Novel Approach for Mitigating Contaminated Data in Large Language ModelsCode0
Selective Code Generation for Functional Guarantees—0
AutoGEEval: A Multimodal and Automated Framework for Geospatial Code Generation on GEE with Large Language Models—0
Understanding Complexity in VideoQA via Visual Program Generation—0
Krikri: Advancing Open Large Language Models for Greek—0
On-Policy Optimization with Group Equivalent Preference for Multi-Programming Language Understanding—0
EVALOOP: Assessing LLM Robustness in Programming from a Self-consistency Perspective—0
OMAC: A Broad Optimization Framework for LLM-Based Multi-Agent CollaborationCode0
SOCIA: An End-to-End Agentic Framework for Automated Cyber-Physical-Social Simulator Generation—0
Reasoning with OmniThought: A Large CoT Dataset with Verbosity and Cognitive Difficulty Annotations—0
CRPE: Expanding The Reasoning Capability of Large Language Model for Code Generation—0
ComplexFormer: Disruptively Advancing Transformer Inference Ability via Head-Specific Complex Vector AttentionCode0
Reinforcing the Diffusion Chain of Lateral Thought with Diffusion Language Models—0
Code-Driven Planning in Grid Worlds with Large Language Models—0
MONAQ: Multi-Objective Neural Architecture Querying for Time-Series Analysis on Resource-Constrained DevicesCode0
Can You Really Trust Code Copilots? Evaluating Large Language Models from a Code Security PerspectiveCode0
Are Sparse Autoencoders Useful for Java Function Bug Detection?Code0
Generalizing Large Language Model Usability Across Resource-Constrained—0
Evaluating LLM Metrics Through Real-World Capabilities—0
Tests as Prompt: A Test-Driven-Development Benchmark for LLM Code Generation—0
CAD-Coder:Text-Guided CAD Files Code Generation—0
Agent-as-a-Service based on Agent Network—0
One Trigger Token Is Enough: A Defense Strategy for Balancing Safety and Usability in Large Language Models—0
Enhancing Code Generation via Bidirectional Comment-Level Mutual GroundingCode0
Code Retrieval for MILP Instance Generation—0
RTL++: Graph-enhanced LLM for RTL Code Generation—0
CodeMixBench: Evaluating Large Language Models on Code Generation with Code-Mixed Prompts—0
Show:102550
← PrevPage 13 of 34Next →

Benchmark Results

#ModelMetricClaimedVerifiedStatus
1EG-CFG (DeepSeek-V3-0324)Accuracy96.6—Unverified
2QualityFlow (Sonnet-3.5)Accuracy94.2—Unverified
3o1-mini + MapCoder (Hamming.ai)Accuracy93.2—Unverified
4MGDebugger (DeepSeek-V3-0324)Accuracy92.4—Unverified
5GPT-4 + AgentCoderAccuracy91.8—Unverified
6CodeSim (GPT4o)Accuracy90.7—Unverified
7Jiutian-大模型Accuracy90—Unverified
8GPT-3.5 Turbo (ChatGPT) + AgentCoderAccuracy89.9—Unverified
9MapCoder (GPT-4o)Accuracy89.7—Unverified
10GPT-4 (ChatGPT Plus)Accuracy87.5—Unverified
#ModelMetricClaimedVerifiedStatus
1LPW (GPT-4o)Introductory Pass@187.2—Unverified
2MoTCoder-32B-V1.5Introductory Pass@168.44—Unverified
3MoTCoder-7B-V1.5Introductory Pass@154.26—Unverified
4code-davinci-002 175B (CodeT)Introductory Pass@147.3—Unverified
5deepseek-ai/deepseek-coder-6.7b-instructIntroductory Pass@133.8—Unverified
6code-davinci-002 175BIntroductory Pass@131.92—Unverified
7CodeChain+WizardCoder-15bIntroductory Pass@129.3—Unverified
8WizardCoder-15bIntroductory Pass@126.29—Unverified
9CodeSim (GPT4)Introductory Pass@126.04—Unverified
10AlphaCode 1B Filtered from 50000Competition Pass@any22—Unverified
#ModelMetricClaimedVerifiedStatus
1PanGu-Coder-FT-IBLEU44.32—Unverified
2RoBERTaMarianBLEU35.74—Unverified
3MarianCGBLEU34.43—Unverified
4TranX + BERT w/minedBLEU34.2—Unverified
5BERT + TAEBLEU33.41—Unverified
6BERTMarianBLEU32.46—Unverified
7External Knowledge With API + RerankingBLEU32.26—Unverified
8External Knowledge With APIBLEU30.69—Unverified
9BART W/ MinedBLEU30.55—Unverified
10ELECTRAMarianBLEU30.18—Unverified
#ModelMetricClaimedVerifiedStatus
1MarianCGAccuracy81.83—Unverified
2BERT + TAEAccuracy81.03—Unverified
3TranX + BERT w/minedAccuracy81.03—Unverified
4RerankerAccuracy80.2—Unverified
5LUKEMarianAccuracy78.5—Unverified
6RoBERTaMarianAccuracy77.95—Unverified
7BERTMarianAccuracy76.68—Unverified
8TranxAccuracy73.7—Unverified
9ELECTRAMarianAccuracy65.32—Unverified
10lpn (Ling et al., 2016)Accuracy62.3—Unverified
#ModelMetricClaimedVerifiedStatus
1NL2SQL-RULEExecution Accuracy89.2—Unverified
2TypeSQL+TC (Yu et al., 2018)+Execution Accuracy82.6—Unverified
3TranxExecution Accuracy78.6—Unverified
4STAMP+RL (Sun et al., 2018)+Execution Accuracy74.6—Unverified
5STAMP (Sun et al., 2018)+Execution Accuracy74.4—Unverified
6TypeSQL (Yu et al., 2018)Execution Accuracy73.5—Unverified
7PT-MAML (Huang et al., 2018)Execution Accuracy68—Unverified
8Bidirectional Attention for SQL GenerationExecution Accuracy62.5—Unverified
9Seq2SQL (Zhong et al., 2017)Execution Accuracy59.4—Unverified
10Seq2Seq (Zhong et al., 2017)Execution Accuracy35.9—Unverified
#ModelMetricClaimedVerifiedStatus
1QurrentOS-coder + Claude 3.5 Sonnetpass@158—Unverified
2QurrentOS-coder + GPT-4opass@146—Unverified
3QurrentOS-coder + GPT-4 Turbopass@137—Unverified
4QurrentOS-coder + Claude 3 Opuspass@136—Unverified
5QurrentOS-coder + Gemini 1.5 Propass@130—Unverified
6QurrentOS-coder + GPT-4pass@130—Unverified
7QurrentOS-coder + DeepSeek-Coder-V2pass@129—Unverified
8QurrentOS-coder + Llama 3 70bpass@120—Unverified
9QurrentOS-coder + Qwen-72B-Instructpass@118—Unverified
#ModelMetricClaimedVerifiedStatus
1EG-CFG (DeepSeek-V3-0324)Test Set pass@158.18—Unverified
2LPW (GPT-4o)Test Set pass@134.7—Unverified
3MapCoder (GPT-4)Test Set pass@128.5—Unverified
4CodeSim (GPT4)Test Set pass@128.4—Unverified
5MoTCoder-15BTest Set pass@126.34—Unverified
6MoTCoder-7B-v1.5Test Set pass@120.77—Unverified
7CodeChain + WizardCoder-15BTest Set pass@12.35—Unverified
8WizardCoder-15BTest Set pass@11.11—Unverified
#ModelMetricClaimedVerifiedStatus
1DeepSeek-R1 (MGDebugger)Pass@1100—Unverified
2LLaMA 3Pass@199.4—Unverified
3QualityFlow (Sonnet-3.5)Pass@198.8—Unverified
4Phi-2Pass@198.2—Unverified
5EG-CFG (DeepSeek-V3-0324)Pass@196.95—Unverified
6Mistral 7BPass@193.9—Unverified
7Claude Sonnet 3.5Pass@190.85—Unverified
8L2MAC (GPT-4)Pass@190.2—Unverified
#ModelMetricClaimedVerifiedStatus
1Claude 3 HaikuPass@327.67—Unverified
2GPT-3.5 TurboPass@323.75—Unverified
3codechat-bisonPass@311.39—Unverified
4chat-bisonPass@38.48—Unverified
5Mixtral-8x7B-InstructPass@38.35—Unverified
6Phi-3-mini-128k-instructPass@37.18—Unverified
7WizardLM-2-7BPass@33.72—Unverified
8Llama-3-8B-InstructPass@33.1—Unverified
#ModelMetricClaimedVerifiedStatus
1o1-previewpass@10.95—Unverified
2o1-minipass@10.94—Unverified
3gpt-4o-2024-08-06pass@10.89—Unverified
4claude-3.5-sonnetpass@10.88—Unverified
5deepseek-v2.5pass@10.83—Unverified
6mistral-large-2pass@10.78—Unverified
7deepseek-coder-v2-instructpass@10.7—Unverified
8llama-v3p1-405b-instructpass@10.3—Unverified
#ModelMetricClaimedVerifiedStatus
1BART W/ MinedBLEU35.32—Unverified
2BART BaseBLEU34.35—Unverified
3External Knowledge With API + RerankingBLEU20.54—Unverified
4External Knowledge With APIBLEU20.37—Unverified
5RerankerBLEU19.85—Unverified
6TranXBLEU18.85—Unverified
#ModelMetricClaimedVerifiedStatus
1claude-3-5-sonnetpass@10.68—Unverified
2o1-minipass@10.67—Unverified