[Submitted on 26 Jul 2026]

View PDF HTML (experimental)

Abstract:AI 编程代理已迅速成为软件工程中无处不在的工具。其串行性能(包括准确性和速度)已得到广泛研究。然而,最近的初步结果表明,其并行编程能力落后于串行编程能力。本文对三种编程代理——Cursor 的 Composer 2.0、GPT 5.4 和 Claude Sonnet 4.6——在三种算法类别(排序、图遍历和搜索)以及 C++、Python 和 Julia 三种语言下的并行代码生成进行了跨语言评估。对于每对算法和语言,我们提示编程代理从串行基线生成并行实现,跟踪实现功能正确性和性能提升所需的提示工作量,并针对自定义串行基线和第三方库实现测量加速比。我们发现,编程代理只需适度的提示工作即可生成正确的并行实现,但能否实现有意义的加速比在很大程度上取决于算法和语言。Sonnet 4.6 实现了最强的整体性能提升,而 GPT 5.4 尽管正确性一致,但未产生可测量的加速比。C++ 在图算法上最容易并行化,而 Python 和 Julia 在搜索算法上实现了最大的加速比:没有单一语言在所有类别中都占主导地位。Python 和 Julia 在某些图算法上实现了加速比,但在其他算法上出现了倒退。这些发现强调了将运行时性能效率作为 LLM 性能主要指标(除准确性外)的重要性,尤其是在并行实现方面。

Submission history

From: Shiqi Cheng [view email]
[v1] Sun, 26 Jul 2026 19:31:17 UTC (21 KB)