最近 Kimi K3 公開後,在 Code Arena 前端項目中超越 Claude Fable 拿下第一名,引起許多關注。
在這股熱潮下,我也閱讀了 2026 年 7 月 16 日發表的最新文章「Kimi K3: Open Frontier Intelligence」。
該部落格文章前半段提到模型規模與結構改進。2.8T(兆)參數的部分讓人感覺像另一個世界,而 Kimi Delta Attention (KDA) 或 Attention Residuals (AttnRes) 等結構性改進,對已遠離機器學習、尤其是大型 LLM 開發的我來說,感受並不深刻。
我一邊覺得厲害且精彩,一邊回想過去做機器學習的經驗,這次還借助 ChatGPT 來試著更深入理解。
其實這篇文章中最令我驚艷的部分,是用來測試 Kimi K3 編碼能力的案例。這些案例不只是單純在單項編碼工作上表現更好,而是展現了 K3 這類前緣 AI 模型已實際被用來開發與優化自身。
再更詳細地說明,以下是 4 項實驗:
GPU 核心最佳化實驗
據說已使用 Kimi K3 對前述 AttnRes、KDA 相關運算,以及 MLA kernel 在 NVIDIA H200 與其他通用 GPU(GPGPU)上進行最佳化。結果顯示,AttnRes 的訓練速度提升 2.48 倍、DSA 訓練核心執行時間減少 55.1%、在 H200 上達成 MLA 訓練高使用率,並在陌生的第三方 GPGPU 環境中,透過分析讓 K3 相較以往提升約 3.79 倍的速度。
有趣的是,初期版本的 Kimi K3 實際上已處理了後期 Kimi K3 模型的大部分最佳化工作。
GPU 程式設計系統開發
這項實驗測試 Kimi K3 是否能從零開始建置 GPU 程式設計系統。據說 K3 已開發出類似小型 Triton 的編譯器。K3 建立了從 DSL 前端 → IR 最佳化階段 → PTX 程式碼產生 → 執行環境的一致性端到端編譯器,其效能與 Triton 及 torch.compile 相當或更佳,在部分工作上甚至超越長期高度最佳化的 Triton。
晶片設計
這是將初期晶片設計概念 PoC 的實驗。讓 K3 以縮小後的 nano 模型架構,設計出針對最佳化推論的加速器。最終完成接近可用 EDA(半導體晶片電腦設計與驗證軟體工具)製造的 ASIC 設計結果。
研究用程式碼撰寫
進行了自主實作、驗證並分析複雜計算研究完整工作流程的實驗。在過程中審閱超過 20 篇論文並相互交叉驗證,實作完整數值計算管線,並評估超過 300 個狀態方程式。相當於熟練研究者通常需花 1–2 週的工作,約在 2 小時內完成。
閱讀這篇部落格時,我印象最深刻的是:如前所述,Kimi K3 這類前緣 AI 模型已實際被用來優化後續模型。同時,它也可作為實作、驗證並分析複雜計算研究完整工作流程的研究工具。
已開發出的模型能協助打造更好的模型、加速研究,而接下來產生的模型又能進一步提升最佳化與研究的速度。現在看來,這種研究開發的正向循環已經實際運作。
雖然這次部落格僅以 PoC 形式展示,但晶片設計對模型改進至關重要,若能納入此正向循環,預期前緣模型的發展速度將比現在更快。
另一方面,我也想到率先穩定建立此正向循環的企業或研究機構,與未能做到者之間的差距可能會越來越大,因此我認為專注開發前緣模型將變得非常重要。
這原本是一篇已遠離機器學習的開發者所撰寫的文章,但透過這篇文章,我覺得自己應該對前緣 AI 模型投入更多關注,因此也寫下這篇心得。關於 Kimi K3 的詳細說明,推薦閱讀「Kimi K3: Open Frontier Intelligence」或參考 Yang Zhilin 創辦人的訪談。
0 Comments
Log in to join the conversation.No comments yet. Be the first to share your thoughts.