SOTAVerified

Code Completion

Papers

Showing 1–25 of 212 papers

TitleStatusHype
Beyond Autocomplete: Designing CopilotLens Towards Transparent and Explainable AI Coding Agents—0
Plan for Speed -- Dilated Scheduling for Masked Diffusion Language Models—0
Seed-Coder: Let the Code Model Curate Data for ItselfCode4
HiLDe: Intentional Code Generation via Human-in-the-Loop Decoding—0
SWE-Dev: Evaluating and Training Autonomous Feature-Driven Software DevelopmentCode2
Alignment-Augmented Speculative Decoding with Alignment Sampling and Conditional Verification—0
Structure-Aware Corpus Construction and User-Perception-Aligned Metrics for Large-Language-Model Code Completion—0
Can You Really Trust Code Copilots? Evaluating Large Language Models from a Code Security PerspectiveCode0
CodeMixBench: Evaluating Large Language Models on Code Generation with Code-Mixed Prompts—0
Procedural Memory Is Not All You Need: Bridging Cognitive Gaps in LLM-Based Agents—0
AKD : Adversarial Knowledge Distillation For Large Language Models Alignment on Coding tasks—0
NoEsis: Differentially Private Knowledge Transfer in Modular LLM Adaptation—0
EduBot -- Can LLMs Solve Personalized Learning and Programming Assignments?—0
RTLRepoCoder: Repository-Level RTL Code Completion through the Combination of Fine-Tuning and Retrieval Augmentation—0
CCCI: Code Completion with Contextual Information for Complex Data Transfer Tasks Using Large Language Models—0
ObscuraCoder: Powering Efficient Code LM Pre-Training Via Obfuscation GroundingCode0
LogQuant: Log-Distributed 2-Bit Quantization of KV Cache with Superior Accuracy PreservationCode1
On Explaining (Large) Language Models For Code Using Global Code-Based Explanations—0
CASTLE: Benchmarking Dataset for Static Code Analyzers and LLMs towards CWE DetectionCode1
Enhancing High-Quality Code Generation in Large Language Models with Comparative Prefix-TuningCode0
FEA-Bench: A Benchmark for Evaluating Repository-Level Code Generation for Feature Implementation—0
GenAI for Simulation Model in Model-Based Systems Engineering—0
SolBench: A Dataset and Benchmark for Evaluating Functional Correctness in Solidity Code Completion and Repair—0
Alchemist: Towards the Design of Efficient Online Continual Learning System—0
Automated Code Generation and Validation for Software Components of Microcontrollers—0
Show:102550
← PrevPage 1 of 9Next →

Benchmark Results

#ModelMetricClaimedVerifiedStatus
1deepseek-coder-33b-baseAverage69.01—Unverified
2deepseek-coder-6.7b-baseAverage63.4—Unverified
3starcoderbaseAverage55.54—Unverified
4gpt-4-1106-previewAverage53.28—Unverified
5CodeLlama-13b-hfAverage52.78—Unverified
6deepseek-coder-1.3b-baseAverage52.63—Unverified
7CodeLlama-34b-hfAverage49.66—Unverified
8CodeLlama-7b-hfAverage45—Unverified
9gpt-3.5-turbo-0301Average40.86—Unverified
10incoder-6BAverage33.79—Unverified
#ModelMetricClaimedVerifiedStatus
1CodeGPT-adaptedAccuracy (token-level)77.13—Unverified
2CodeT5+ 770MEM (line-level)37.9—Unverified
3CodeT5+ 220MEM (line-level)35.17—Unverified
#ModelMetricClaimedVerifiedStatus
1CodeGPT-adaptedAccuracy (token-level)75.11—Unverified
2CodeT5+ 770MEM (line-level)44.86—Unverified
3CodeT5+ 220MEM (line-level)43.42—Unverified
#ModelMetricClaimedVerifiedStatus
1SantaCoder-MGDCompilation Rate73.03—Unverified
2SantaCoderCompilation Rate59.97—Unverified
3SantaCoderCompilation Rate59.79—Unverified
#ModelMetricClaimedVerifiedStatus
1RamboCompilation Rate76.47—Unverified
2RepoCoderCompilation Rate74.02—Unverified
#ModelMetricClaimedVerifiedStatus
1RamboCompilation Rate61.7—Unverified
2RepoCoderCompilation Rate58.09—Unverified