[2026年7月28日提交]

查看PDF HTML(实验性)

摘要:当代基于LLM的编码代理将代码作为黑盒输出生成:每行背后的推理是隐藏的,通过基准驱动修复的代码演化是短暂的,事后审计是不可能的。我们提出一个代码生成概念,通过三种互补机制解决这些缺点:(i)一种关系型片段历史模式,记录每个修复事件的基准参考、轮次数、失败文本和LLM解释,支持完整的来源查询;(ii)一个基于浏览器的可视化工具,将此历史呈现为热力映射、悬停注释的源代码;(iii)一种竞争性分数位置键索引方案,带有树节点分隔符,为每个代码片段分配稳定的、按字典序排序的标识符,支持细粒度跟踪而不会干扰周围行。我们在30个算法编程任务上评估TraceCoder,涵盖字符串处理、数学计算和数据结构操作,跨越两种提供商配置。其中,10个在具有微妙边界情况行为的任务上用尽了6次迭代预算。平均Chg%达到30%,十分之三的代码片段带有可追踪的修复事件行,而在20个任务子集上仅使用Gemini 2.0 Flash作为唯一提供商时这一比例为21%。三个详细的案例研究展示了系统如何解释哪些特定的基准失败塑造了最终程序的每一行。所提出的机制使自动代码生成的内部“叙述”可审计和可重放,这一特性对于生产部署中的信任和责任至关重要。

提交历史

来自:Marius Silaghi [查看电子邮件]
[v1] 2026年7月28日 星期二 22:03:52 UTC (137 KB)