Open access
Jul 2026
Empirical benchmarking of large language models for data science coding: a multidimensional evaluation
The LLM4DS-Benchmark is introduced and a multidimensional empirical evaluation of seven large language models is conducted, highlighting the need for multidimensional, task-aware benchmarking and suggesting that model selection for data science coding should be guided by task characteristics and practical constraints rather than aggregate success rate alone.
Santhosh Anitha Boominathan, Sai Sanjna Chintakunta, Everton Guimarães et al.
· Empirical Software Engineeri... · 0 citations