you gyoung-yoon

最近 Kimi K3 发布,并在代码竞技场前端项目中超越 Claude Fable 夺得第一,引发广泛关注。

除了这份关注之外,我也阅读了 2026 年 7 月 16 日发布的最新文章「Kimi K3: Open Frontier Intelligence」。

该博客文章前半部分提到了模型规模和改进后的模型结构。事实上,2.8T(万亿)参数的部分让我感觉像是在另一个世界,而 Kimi Delta Attention(KDA)或 Attention Residuals(AttnRes)等结构改进,对于已经远离机器学习、特别是大规模 LLM 开发的我来说,感受并不深刻。

虽然我怀着「很厉害、很酷」的想法,但也借助之前的机器学习记忆以及 ChatGPT 的帮助,试图更深入地理解。

其实,这篇文章中最让我觉得「厉害」的是为了测试 Kimi K3 的编码能力而进行的案例。这些案例不仅表明它能更好地完成单一代码任务,还展示了 K3 这类前沿 AI 模型实际上已经在用于自身开发和优化过程。

更详细地说,以下是四项实验:

GPU 内核优化实验

据称,他们使用 Kimi K3 对前面提到的 AttnRes 和 KDA 相关运算,以及 MLA kernel 在 NVIDIA H200 和其他通用 GPU(GPGPU)上进行了优化。最终,AttnRes 的训练速度提升了 2.48 倍,DSA 训练内核执行时间减少了 55.1%,在 H200 上实现了 MLA 训练的高利用率;在陌生的第三方 GPGPU 环境中,K3 通过分析实现了相比之前约 3.79 倍的速度提升。

有趣的是,实际上早期版本的 Kimi K3 就已处理了后期 Kimi K3 模型的大部分优化工作。

GPU 编程系统开发

该实验测试 Kimi K3 是否能从零开始构建 GPU 编程系统。据称,Kimi K3 开发了一个小型的类 Triton 编译器。K3 构建了一个从 DSL 前端 → IR 优化通道 → PTX 代码生成 → 运行时的端到端一致编译器,其性能与 Triton 及 torch.compile 相当或更优,在部分任务中甚至超越了长期高度优化的 Triton。

芯片设计

这是一个以早期芯片设计 PoC(概念验证)为目的的实验。他们让 K3 以缩小后的架构设计一个针对 nano 模型优化的推理加速器。最终,完成了接近可通过 EDA(半导体芯片计算机辅助设计与验证软件工具)制造的 ASIC 设计结果。

研究用代码编写

他们进行了自主实现、验证和分析复杂计算研究全流程的实验。在此过程中,审阅并交叉验证了 20 多篇论文,实现了完整的数值计算流水线,并评估了 300 多个状态方程。据称,这相当于熟练研究人员通常需要 1–2 周完成的工作,K3 在约 2 小时内就完成了。


阅读这篇博客,我印象最深刻的是前面提到的:Kimi K3 这类前沿 AI 模型已经在用于优化其后续模型。同时,它也可以作为研究工具,用于实现、验证和分析复杂计算研究的完整工作流。

已开发的模型帮助构建更好的模型,加速研究,而由此产生的下一代模型又能进一步提升优化和研究的效率。现在看来,这种研发的正向循环实际上已经在运行。

虽然本博客中只是 PoC,但如果芯片设计——对模型改进至关重要的环节——也能纳入这一正向循环,那么前沿模型的发展速度预计将比现在更快。

另一方面,我认为率先稳定构建这种正向循环的企业或研究机构,与未能做到这一点的机构之间的差距可能会越来越大,因此集中精力开发前沿模型显得非常重要。

这原本是一位已远离机器学习的开发者的文章,但通过这篇文章,我觉得应该更多关注前沿 AI 模型,于是也写下了这篇感想。关于 Kimi K3 的详细说明,建议阅读「Kimi K3: Open Frontier Intelligence」或 Yang Zhilin 创始人的访谈。