[Submitted on 26 Jul 2026]

View PDF HTML (experimental)

Abstract:AI 程式碼代理已迅速成為軟體工程中無所不在的工具。其序列效能,無論在準確度或速度方面,均已受到廣泛探討。然而,近期初步結果顯示,其平行程式設計能力落後於序列程式設計能力。本文針對三種程式碼代理——Cursor 的 Composer 2.0、GPT 5.4 與 Claude Sonnet 4.6——在三類演算法(排序、圖遍歷與搜尋)以及三種語言(C++、Python 與 Julia)中,進行平行程式碼生成的跨語言評估。對於每一組演算法與語言的組合,我們提示程式碼代理從序列基準產生平行實作,追蹤達到功能正確性與效能提升所需的提示努力,並針對自訂序列基準及第三方函式庫實作測量加速比。我們發現,程式碼代理能以適度的提示努力產生正確的平行實作,但能否達成有意義的加速比高度取決於演算法與語言。Sonnet 4.6 整體上帶來最強的效能提升,而 GPT 5.4 儘管在正確性上表現一致,卻未產生可測量的加速比。C++ 在圖演算法上最能穩定地進行平行化,而 Python 與 Julia 在搜尋演算法上達成最大的加速比:沒有單一語言在所有類別中皆居優勢。Python 與 Julia 在部分圖演算法上達成加速比,但在其他演算法上則出現效能退化。這些發現凸顯了將執行時期效能效率納入 LLM 效能指標的重要性,除了準確度之外,尤其是在平行實作方面。

Submission history

From: Shiqi Cheng [view email]
[v1] Sun, 26 Jul 2026 19:31:17 UTC (21 KB)