Mozilla

V1.0 · 定期更新 · 2026 年 7 月

來自我們 CTO Raffi Krikorian 的信

在紐西蘭最北端,一位毛利廣播員正在為「te reo」這種市場規模過小的語言訓練語音模型,而其授權條款讓資料仍由當地社群持有。全球最大的會計師事務所之一 PwC,已在財務語言上微調開放模型,如今在自家硬體上為數百位客戶執行,且無每權杖計費機制。洛桑的研究人員與紅十字會共同打造符合人道主義指南的開放醫療模型,並準備在瑞士及坦尚尼亞進行臨床試驗。在東非,農民利用可在手機上離線運作的模型,診斷木薯病害,而這些田野從未連上雲端。在瑞士,一個公眾聯盟在公共超級電腦上訓練國家模型,並完整釋出權重、資料與訓練程式碼。他們無需任何人許可,也無法透過租用方式取得這些成果——他們真正擁有它,這正是核心理念。

我們曾經歷過類似情境。Mozilla 的存在,正是因為一家公司企圖壟斷網路的入口,而開放社群挺身而出,確保這件事永遠不會發生。二十五年後,有人正在重演相同的劇本。我們第一次押注開放,開放獲勝了。讓我們一起再做一次。

我們的信念很簡單:前進之路在於競爭與互通性。我們相信一個擁有許多模型的世界,擁有標準化的接合方式,並能隨時自由離開任何供應商。開放在這方面已有實績,它擴大了整體規模,也讓更多人擁有其中一份。

請將以下內容視為一張地圖:開源 AI 正在勝出的領域——有些數據甚至讓我們感到驚訝——以及暴露的弱點。隱藏弱點的案例只是一種廣告。」

開放權重已縮小能力差距,而智慧的價格已大幅崩跌。

0%

與頂尖閉源模型的能力差距——在程式設計上已達平手,但在推理上仍稍遜

GPT-4 等級推論成本在 36 個月內的跌幅:從每 100 萬權杖 20 美元降至 0.40 美元

01開源 AI 的現況

已達平手。競賽已進入下一層。

開放權重不再是妥協方案。它們正是工作進行之處:目前多數生產權杖已透過開放權重模型路由,而 OpenRouter 上流量最高的五個模型全為開放模型。閉源模型仍在尖端領域領先,特別是推理與多模態,但尖端並非大多數工作負載所需。商品化輸入已無定價權。價值正向上移動,轉向代理式(agentic)整合層。

能力差距:8.04% → 0.5% → 3.3%

Chatbot Arena 過去 24 個月開放與閉源模型的差距。2024 年 8 月差距縮小至 0.5%,2025 年 2 月 DeepSeek-R1 短暫追平美國頂尖模型。2026 年 3 月差距再度擴大至 3.3%,因閉源推理模型再度領先。但 3.3% 只是整體平均值:開放模型在程式設計、指令遵循與一般知識上已達或接近平手,差距主要集中在推理、長文本檢索與代理式任務上。問題已不再是開放模型是否夠好,而是它是否符合你的工作負載需求。請將滑鼠移至各點查看。

資料來源:Chatbot Arena,2024 年 1 月 – 2026 年 3 月。

推論成本在 36 個月內下降 50 倍

GPT-4 等級模型每百萬權杖價格——跌幅速度快於網際網路時代的頻寬或個人電腦運算價格曲線。對數刻度。

資料來源:Stanford HAI AI Index 2025(GPT-3.5 等級模型 18 個月內下降 280 倍);Epoch AI(每年衰退 9–900 倍);2025 年 11 月 MIT 研究(尖端領域每年 5–10 倍,經硬體調整)。

開放權重贏得權杖流量

OpenRouter 上透過開放權重模型路由的權杖比例,從微不足道的基數成長至 2025 年底的三分之一,再到 2026 年中旬的過半。

資料來源:OpenRouter 100T 權杖研究(2024 年 11 月–2025 年 11 月)與即時排行榜;中間點為內插值。以請求次數計算,美國閉源供應商仍居領先——開放模型的領先主要來自權杖量,集中在程式設計與代理式工作負載。

OpenRouter 即時排行榜——過去一個月路由權杖量

流量最高的五個模型全為開放權重。美國閉源模型中,Anthropic 的 Claude 系列緊隨其後。

開放權重閉源

2026 年中旬,排名前九的模型中,中國建置模型每週約路由 18T 權杖,而美國建置模型約 5.5T——比例超過 3:1(FT 分析)。開發者若依成本選擇路由,便會導向開放權重。

開放模型易於部署。
開放模型難以投入生產。

資料來自 Mozilla / SlashData 2026 年開發者調查。開放模型在採用率上領先:79% 新增 AI 功能的開發者使用開放模型,而閉源模型為 71%,兩者多為互補關係,有一半開發者同時使用兩者。但在生產環境中,團隊卻常遇到瓶頸:僅 51% 的開放模型團隊能進入生產階段,而閉源模型則為 63%。差距來自營運工具與信任,而非模型能力本身。

開放模型在採用率上領先,且多與閉源模型共存

正在為應用程式新增 AI 功能的開發者中,使用各類模型的比例,以及兩者的重疊情況。

兩者如何結合

29%僅使用開放模型

50%兩者皆用

21%僅使用閉源模型

資料來源:Mozilla / SlashData 2026 年開發者調查。對多數團隊而言,開放與閉源模型並非替代品:50% 同時使用兩者,29% 僅使用開放模型,21% 僅使用閉源模型。

開放模型採用率高峰的地區,以及閉源模型仍具優勢的地區

各地區開放模型的採用率。大中華區與東亞以 89% 領先;南美洲與西歐是僅有的兩個閉源模型採用率超過開放模型的地區。

同一次調查,按開發者地區分類。在南美洲與西歐,且僅限於此兩地,閉源模型的採用率高於開放模型。

依公司規模區分的生產率

若差距來自資源,規模應能縮小差距,但事實並非如此。閉源模型隨規模成長從 54% 上升至 73%。開放模型則幾乎停滯:53% → 57%。

閉源模型開放模型

企業可透過付費方式解決閉源模型的部署問題。開放模型的部署則需等待尚未完成的工具。資料來源:Mozilla / SlashData 2026 年開發者調查。

團隊流失的原因:開放模型面臨的挑戰

Δ = 流失者 − 仍在使用者,單位為百分點。最大的差距(效能、整合、維護)來自營運層面,而非能力。請將滑鼠移至各長條查看。

仍在使用開放模型已流失

Mozilla 調查,n=1,410。「你在使用開放或開源 AI 模型時遇到的主要挑戰是什麼?」

相同的挑戰,遍及各地:各地區阻礙開放模型的因素

目前與已流失的開放模型開發者中,依地區列出提及各項挑戰的比例。顏色越暖代表越多開發者受阻。每一地區最上方的幾行皆為營運問題:基礎設施成本、安全與合規、維護、部署複雜度。南亞在安全與支援上受阻最嚴重;僅北美與大中華區有超過 15% 的受訪者表示沒有重大挑戰。

資料來源:Mozilla / SlashData 2026 年開發者調查 (MZCS1)。n=1,410 目前或已流失的開放模型開發者;大洋洲欄位 (n=39) 與東歐及獨立國家聯合體 (n=98) 低於可靠門檻。


02開源 AI 堆疊

開放堆疊在能力上得分高,
在營運上得分低。

堆疊的九個層級與 48 個元件,依 10 項標準(1–5 分)評分。點擊任一層級即可展開其元件:每個元件皆有各自的標準分數、成熟度等級、開放與閉源的平手判斷,並列出部分最受矚目的開源專案。

將滑鼠移至任一儲存格查看細節。

強勁可行但分散早期階段

強勁(≥4.0) 3.5–3.9 3.0–3.4 2.5–2.9 薄弱(<2.5) 營運差距 = 標準化 + 企業就緒度

各儲存格為各成熟度標準(1–5 分)的分數,由左至右依強至弱排列;各層級列為其元件的平均值。最冷的兩欄——標準化與企業就緒度——在每一層級與元件中反覆出現:這反覆出現的冷色邊緣即為營運差距。資料來源:Mozilla 堆疊地圖,2026 年 6 月(48 個元件,1,361 個專案)。


03誰在押注

開源是一種商業模式。

開放權重 AI 已是一個規模達數千億美元的商業市場,由獲得資金挹注的公司打造,並由全球企業投入生產使用。Databricks 已突破 54 億美元的年營收;Mistral 在十二個月內成長 20 倍,達到約 4 億美元 ARR;DeepSeek 達到約 2.2 億美元 ARR,近期以超過 500 億美元的估值募資 74 億美元。五種營收模式已在規模化階段得到驗證:託管推論、企業平台、本地部署授權、微調服務,以及整合工具。

風險投資支持的開源生態系:已揭露的總資金(單位:百萬美元)

長條會隨捲動而成長。顏色依公司所在地區區分。

北美中國歐洲及其他地區

精選公司;Zhipu AI 與 MiniMax 已於 2026 年在香港 IPO,總額未揭露。企業策略投資者(Nvidia、Salesforce、AMD、Google、IBM、ASML、Tencent、CATL、Schwarz Group)同時支持模型、推論與工具層級的生態系。

開放生態系的財務成熟度

承載開放堆疊的公司的資金、估值與營收表現。生態系已從補助金走向風險投資規模,再進入公開市場。

五種營收模式已在規模化階段得到驗證:託管推論、企業平台、本地部署授權、微調服務,以及整合工具。「—」表示未公開揭露。

按量計費模式在規模化時失效

閉源尖端模型以權杖計費——而在生產規模下,計量表本身成為問題。

五分之一的使用量,卻僅有 4% 的營收

在 OpenRouter(2025 年 5–9 月),閉源模型占約 80% 的使用量與 96% 的營收。價格是主因:以約 90% 的平手能力,閉源模型每次呼叫成本約高出 6 倍。

約 248 億美元

的未實現年度節省——Linux Foundation 的 Nagle–Yue 研究估計,開放與閉源模型在價格上的不對稱,能力相近的每次呼叫成本差距約 6 倍

開發者若依成本選擇路由,便會導向開放權重。


04為何在各地發生

開放不是供應商選擇。
而是主權選擇。

目前已有超過 70 項國家 AI 策略正在執行。策略性問題已從「是否需要國家 AI 政策」轉為「一個國家能掌握堆疊的哪一層」。

請點擊下方的標記或國家。

開放的論點在於選擇權

2026 年 6 月,選擇權不再是抽象概念,也不再只是採購問題。在 Claude Fable 5 上市三天後,單一政府的出口管制命令迫使 Anthropic 切斷全球所有外國國民的存取權限。其他資本未被諮詢,也無法被諮詢。選擇性合規已不可能,因此模型在當週五下午 5 時 21 分對所有人關閉。任何建構於該模型上的使用者,都繼承了一場毫無預警且無法參與的停機。供應商可以關閉模型,但沒有人能關閉已複製並在你持有的機器上運作的模型——無論這台機器是新創公司的伺服器還是國家超級電腦。對企業而言,磁碟上的權重是一種避險;對國家而言,這是政策與許可之間的差異。

開放的策略性論點在於離開的能力,而雲端時代已證明缺乏這種能力所付出的代價:

90,000–120,000 美元將 1 PB 資料從 AWS S3 移出的成本

80%目前正將工作負載遷回本地的企業比例

320 萬美元 → 低於 100 萬美元37signals 離開雲端後的雲端帳單

2.5 倍GEICO 的雲端成本超出預算的幅度

閉源模型 API 重現了相同的陷阱:在專有端點上建構,就會繼承供應商的價格變動,且無法乾淨地退出。開放權重代表離開的權利。

開放權重的最大來源是中國。刻意設計的結果。

截至 2026 年 3 月的 Hugging Face 累計下載量:

2026 年 2 月,Qwen 的下載量超過接下來的八個組織總和。在 OpenRouter 上,中國開放權重模型從 2024 年底的不到 2% 權杖流量,成長至 2026 年 4 月的每週超過 45%,而在十個最常用的模型中約占 61%。DeepSeek 報告擁有超過 26,000 個企業帳戶;2025 年有 58% 的新 AI 新創公司將其納入堆疊,儘管至少有八個司法管轄區限制其託管服務。解決方案在於架構:企業禁止託管應用程式,卻仍採用權重,並自行託管或透過西方端點使用。

這是刻意的政策。國務院的「AI Plus」倡議(2025 年 8 月)與國家五年計畫(2026 年 3 月)將開源推廣列為核心指令,而釋出公開權重同時也是對半導體出口管制的宏觀避險,將全球推論轉移至終端使用者的本地硬體。在全球南方,吸引力來自多元化以擺脫美國科技壟斷;其他地區則純粹是財務考量。甚至 Microsoft 也在探索為其最繁重的 Copilot 工作負載,在 Azure 上託管受保護的 DeepSeek V4。

標記大小 ≈ 已承諾的公共/策略性資本規模 · 等距圓柱投影

資料來源:Open Source AI jurisdictions dataset,2026 年 7 月。標記大小依已承諾的公共與策略性資本規模調整。


05整合層是新前沿

代理式整合層是另一種使用者代理。

瀏覽器是開放網路的使用者代理:使用者端的程式碼,代表使用者與伺服器協商。這個角色正被重新創造於更高一層。在模型之上,現在坐落著代理式整合層——協調迴路、工具、記憶體、沙箱與權限模型。這是生產難度集中的地方,也是開放與閉源、擁有者與承租者之間的競賽重新開始之處。

使用者 · 其他代理 · 世界人類 · 系統 · 資料 · 金錢

治理在多個整合層之上的一個平面

狀態化政策工作階段已執行的內容

註冊與血緣哪個代理做了什麼

預算與撤銷成本上限 · 終止開關

Meta-harness · Omnigent · OPA · Agent governance toolkit

介面與使用者及金錢互動

介面AG-UI · A2UI

付款與計量x402 · AP2 · UCP

動作安全地執行任務

沙箱與執行E2B · Daytona · Modal

權限與身分寫入介面——尚未解決的差距

評估與可觀測性Langfuse · Phoenix

觸及連接與記憶

工具與上下文MCP

代理間通訊A2A

記憶Mem0 · Letta · Zep

控制驅動迴路

協調迴路LangGraph · CrewAI · AutoGen · LlamaIndex——將模型轉變為代理的推理與行動迴路

模型——權重開放或閉源 · 可替換 · 正走向商品化,價格趨近零

這一層已成為一個產品類別:LangChain 單獨就有超過 126,000 個 GitHub 星標與 60% 的開發者市占率;MCP 在第一年達到 9,700 萬次每月 SDK 下載與超過 10,000 個活躍伺服器,在 16 個月內成長 4,750%——並於 2025 年 12 月捐贈給 Linux Foundation 的 Agentic AI Foundation。採用速度已超越治理:僅約 21% 的公司報告擁有成熟的代理治理機制。

模型正在吞噬整合層,這正是開放的機會

Terminal-Bench 2.0(2026 年 5 月)讓整合層看起來像是任何人都能取得的免費午餐:第三方框架在 Anthropic 自家權重上達到 79.8%,而 Claude Code 在相同模型上僅有 58.0%,差距達 21.8 分,整合層勝過權重本身。八週後,Terminal-Bench 2.1 卻反轉了這個結果。尖端實驗室讀到這個結果後,將整合層拉回自家:所有同時出現的模型中,實驗室自家的整合層現在勝出,而 21.8 分的差距已壓縮至頂尖層級的約 3 分:模型正在向上吞噬堆疊,權重與框架被打包成單一產品。

2026 年 5 月 · Terminal-Bench 2.0

2026 年 7 月 · Terminal-Bench 2.1 · 官方排行榜,已驗證頂尖層級

這種整合正在形成護城河,而實驗室有充分動機深化它。與單一實驗室權重緊密調整的整合層,會成為一種契合而非中立層級。它在其他模型上表現會下降,因此調整越緊密,底層權重的可替換性就越低。鎖定效應以最佳化為副作用出現。開放模型沒有第一方整合層可以回應,這也是為什麼官方排行榜的已驗證頂尖層級中完全沒有開放模型。

但缺席並不代表無能:將所有模型放在同一個中立框架上,差距就會消失

在公平的整合層上,能力差距僅有幾分;價格差距卻有 5 倍。最強的開放模型 GLM 5.2 僅略遜於 Claude Opus 4.7,與 Opus 4.8 相差約 4 分,成本卻僅為其五分之一。整合為實驗室帶來開放部署所缺乏的第二項優勢:資料飛輪——透過實驗室整合層的真實使用量,直接回饋至下一個模型。這個優勢是真實的,且具有雙面刃:使用量排氣會訓練擁有整合層的一方,而唯一的問題是這一方是閉源端點,還是你自己的堆疊。實驗室已證明整合層值得擁有。同樣的動作對開放也是可行的——與開放權重共同設計的整合層——而現在正是保持這一層為獨立層級的窗口,在閉源堆疊完成將模型與框架焊接成單一租用產品之前。

寫入介面:整合層中心尚未解決的漏洞

讀取

可逆且低後果。擷取文件、查詢資料庫、列出行事曆。這些大多可預設允許;一次不良讀取的成本很低,且可安全重試。

寫入

具有成本或不可逆的副作用。傳送訊息、支出預算、修改記錄、執行交易。這是確認、核准門檻、成本上限與撤銷必須集中的地方。

尚未解決的權限問題是寫入問題。整合層生態系目前涵蓋約十幾個框架、十個整合層與三個對等協議,但仍無可攜式模型定義代理在無人監督下可執行哪些寫入、哪些需要人工核准,以及哪些被禁止——涵蓋 MCP 主機、A2A 對等端、直接工具呼叫與框架邊界。協議已強化前門,但僅止於此:MCP 的 2025-11-25 規格將授權移至 OAuth 2.1,A2A v1.0 標準化簽署的 Agent Card,但兩者都停在驗證階段。知道代理是誰,並無法說明它能做什麼。

人類後盾也正在失效。CoSAI 的 MCP 威脅模型將「同意疲勞」(使用者核准大部分提示的模式)列為頂級威脅。同意疲勞本身就是寫入端失敗,因為重要的提示正是授權動作的那些。

產業回應正繞過框架僵局,將控制權提升至 meta-harness 層級。取代在個別代理內部使用脆弱的基於提示的過濾器,新興的跨整合層架構(如 Databricks 開源的 Omnigent)執行狀態化、情境化政策,追蹤工作階段已執行的內容,並據此限制下一次寫入:例如在代理提取未經驗證的套件後,要求人工核准程式碼推送,或在達到設定支出後,執行成本上限以暫停工作階段。這些控制從高於任何單一整合層的位置管理寫入介面,這也是最可能形成持久權限模型的地方。這是該層級中影響力最大的單一差距。

閉源不等於安全

閉源 API 感覺安全,是因為有過濾、監控與撤銷功能。這三者都是服務層的功能。將權重保密並無法提供其中任何一項。相同的控制存在於整合層,並適用於自行託管的開放模型。2025 年,Anthropic、Microsoft、ServiceNow 與 Salesforce 等閉源系統皆發生 CVSS 9.3–9.4 等級的授權失敗。NTIA 研究美國政府是否應限制開放權重,並建議改為監控。安全疑慮最好透過投資整合層來解決,而不需要租用閉源模型。

閉源仍具領先的領域

閉源系統仍在四個領域領先。第一是整合式整合層。開放模型未出現在官方 Terminal-Bench 2.1 排行榜的已驗證頂尖層級,即使在中立框架上,最佳開放模型仍落後 Opus 4.8 約 4 分。在整合層之後,是資料飛輪,因為透過實驗室自有框架路由的使用量會直接回饋至其下一個模型。第二是 100 萬權杖的長上下文保真度,Gemini 3 在多針檢索上達到 89%,而 DeepSeek V4-Pro 僅有 41%。第三是即開即用的合規性,預設提供 SOC 2、HIPAA 與零資料保留。第四是問責性,即客戶可以追究責任的對方。

合規性與問責性是合約問題。整合式整合層是工具問題。長上下文保真度是模型問題,而彌補這項差距的工作只有開放實驗室能做。


06機會

五個押注。無需擊敗尖端模型。

它們需要擁有尖端模型之上的層級——整合層、記憶體、權限模型——而這些層級仍處於開放狀態。


07觀察清單

保持層級開放的訊號。

能力與採用

3.3% 的差距(在程式設計上平手,在推理與代理式上落後),以及開放模型在 OpenRouter 的權杖市占率,特別是代理式程式設計。

若以下情況則反轉:權杖市占率停滯,而推理差距擴大。

整合層

Terminal-Bench 中實驗室自有框架與獨立框架之間的差距;AAIF 下的 MCP/A2A 治理;尚未存在的可攜式權限規格。

若以下情況則反轉:實驗室整合層領先擴大,或閉源平台先設定權限標準。

市場結構

開放實驗室的經濟表現(ARR、募資、Zhipu/MiniMax IPO)對抗按量計費的斷點(約 2027–28 年),以及主權產能作為平衡力量。

若以下情況則反轉:主權資金中斷,或開放實驗室經濟無法規模化。

信任與安全

持續追蹤,尚未解決:誤用能力,以及安全調整從開放權重中移除的容易程度;高摩擦區域,尤其是合成 CSAM 與 NCII;NTIA 的「監控而非限制」政策是否持續。

若以下情況則反轉:發生重大誤用事件,或從監控轉向限制。

有一個你可以對本文其餘部分進行的測試。看看誰坐在決定 AI 的房間裡,以及他們擁有什麼樣的地位。當那些讓 AI 保持開放、可攜且廣泛部署的人,以平等地位被安排入座的那一天,從租用轉向擁有的轉變就已經發生了。窗口現在是開著的。它正在緩慢關閉,緩慢到讓我們可以假裝它沒有關閉,而租約比看起來更短。與我們一起建構。

這是 V1 版。我們很樂意聽取您的意見。


引用來源