Published January 29, 2026 | Version 1.0.0
Other Open

Replication Package for "Position: Current Coding Benchmarks Measure Task Performance, not Coding Capabilities"

Authors/Creators

Description

This replication package accompanies the paper "Position: Current Coding Benchmarks Measure Task Performance, not Coding Capabilities" and contains:

Evaluation Results for 24 models across 3-4 benchmarks:

  • Method Generation — Multi-turn code generation with real-world test feedback from the Django framework
  • Code Completion — Single-turn completion tasks
  • Program Repair — Bug fixing with test-driven feedback
  • LiveCodeBench — Competitive programming evaluation

Models Evaluated:

  • 10 open-weight models (Qwen2.5-Coder, DeepSWE, Skywork-SWE, R2EGym, SWE-agent-LM, OpenHands)
  • 6 LoRA fine-tuned configurations (32B and 7B variants)
  • 8 proprietary API models (GPT-4.1, GPT-5, Claude Haiku/Sonnet/Opus 4.5, Gemini 2.5/3)

Fine-tuned Checkpoints:

  • LoRA adapter weights for Qwen2.5-Coder-32B-Instruct and Qwen2.5-Coder-7B-Instruct. Fine-tuned on method generation, completion, and program repair tasks

Analysis Tools:

  • Python utilities for loading and analyzing results
  • Jupyter notebook for interactive exploration

Files

benchmarks_artifacts.zip

Files (9.5 GB)

Name Size
md5:67bf76388bdbcd4d20feb1391bc41844
874.4 MB Preview Download
md5:5aea8cca896c61c89ed7c75f651c0ac4
8.7 GB Preview Download

Additional details

Software

Repository URL
https://github.com/anonymous-submission-1234134124/benchmark_set
Programming language
Python
Development Status
Active