
V1.0 · 定期更新 · 2026 年 7 月
来自首席技术官 Raffi Krikorian 的信 “
在新西兰的远北地区,一位毛利广播员正在为 te reo 语言训练语音模型——这是一种规模太小、无法形成市场的语言——其许可协议确保数据始终掌握在当地人手中。全球最大的会计师事务所之一普华永道(PwC)在金融语言上微调了一个开放模型,如今在自有硬件上为数百家客户运行该模型,没有按 token 计费的计量器。洛桑的研究人员与红十字会共同构建了一个开放的医疗模型,并根据其人道主义准则进行了调优,目前正准备在本地和坦桑尼亚开展临床试验。在东非,农民使用运行在手机上的模型离线诊断木薯病害,服务于云从未覆盖的田野。在瑞士,一个公共财团在公共超级计算机上训练了一个国家模型,并完整发布了所有内容:权重、数据、训练代码。他们无需任何许可,也无法通过租用实现这一点。他们拥有它——这正是全部理念所在。
我们曾经经历过类似时刻。Mozilla 的诞生源于一家公司试图独占通往网络的大门,而一个开放社区奋起确保这种局面永不再现。二十五年后,有人正在重演同一出戏。我们第一次押注开放,开放赢了。让我们一起再做一次。
我们的信念很简单:前进之路在于竞争与互操作性。我们相信一个存在众多模型的世界,标准化的接入方式,以及随时离开任何供应商的自由。开放在此已有记录。它扩大了蛋糕,也让更多人拥有其中一份。
请将下文视为一幅地图:开放 AI 正在获胜的地方——其中一些数字甚至让我们都感到意外——以及暴露之处。一个隐藏弱点的案例只是一则广告。”
开放权重已缩小能力差距,而智能的价格已大幅崩盘。
0%
与顶级闭源模型的能力差距——在编码上持平,在推理上落后
0×
GPT-4 级别推理成本在 36 个月内下降:每 1M tokens 从 20 美元降至 0.40 美元
01开源 AI 的当前状态
已达到持平。竞争已进入更高层级。
开放权重不再是一种妥协。它们已成为实际工作的发生地:如今生产 token 的多数已通过它们路由,OpenRouter 上使用量最高的五款模型均为开放模型。闭源模型仍在前沿领域领先,尤其在推理和多模态方面,但前沿并非大多数工作负载所需。商品化输入不具备定价权。价值正向上游迁移,流向代理型编排层。
能力差距:8.04% → 0.5% → 3.3%
Chatbot Arena 上开放 vs 闭源模型在过去 24 个月的差距。到 2024 年 8 月,差距已缩小至 0.5%,2025 年 2 月 DeepSeek-R1 曾短暂与美国顶级模型持平。到 2026 年 3 月,差距重新扩大至 3.3%,因为闭源推理模型再次领先。但 3.3% 是对参差不齐的前沿的平均值:开放模型在编码、指令遵循和通用知识上已达到或接近持平,差距主要集中在推理、长上下文检索和代理任务上。问题已不再是开放模型是否足够好,而是它是否适合你的工作负载。悬停在数据点上查看详情。
来源:Chatbot Arena,2024 年 1 月 – 2026 年 3 月。
推理成本在 36 个月内下降 50 倍
GPT-4 等效模型每 1M tokens 的价格——下降速度快于互联网时代带宽或 PC 计算的价格曲线。对数刻度。
来源:Stanford HAI AI Index 2025(GPT-3.5 级别在 18 个月内下降 280 倍);Epoch AI(每年衰减 9–900 倍);2025 年 11 月 MIT 研究(前沿领域每年 5–10 倍,硬件调整后)。
开放权重赢得 token 份额
通过 OpenRouter 路由的开放权重模型 token 份额从可忽略的基数增长到 2025 年底的三分之一,再到 2026 年中期的多数。
来源:OpenRouter 100T token 研究(2024 年 11 月–2025 年 11 月)和实时排行榜;中间点已插值。按请求数计算,闭源美国提供商仍占主导——开放模型的领先是 token 量领先,主要集中在编码和代理工作负载。
OpenRouter 实时排行榜——过去一个月,token 路由量
使用量最高的五款模型均为开放权重。Anthropic 的闭源 Claude 模型是排名靠前的美国自研模型。
开放权重闭源
到 2026 年中期,排名前九的模型每周路由约 18T token 的中国自研模型,对比美国自研模型约 5.5T——比例超过 3:1(FT 分析)。开发者按成本路由时,会选择开放权重。
开放模型易于发布。
开放模型部署困难。
数据来自 Mozilla / SlashData 2026 开发者调查。开放模型在采用率上领先:79% 添加 AI 功能的开发者使用开放模型,而闭源模型为 71%,两者 largely 互补,半数开发者同时使用两者。但生产部署是团队停滞的地方:仅 51% 的开放模型团队达到生产阶段,而闭源为 63%。差距在于运营工具和信任,而非模型能力。
开放模型在采用率上领先,且大多与闭源模型共存
正在为其应用添加 AI 功能的开发者中,当前使用每种模型类型的比例,以及两者的重叠情况。
组合方式
29% 仅使用开源
50% 两者皆用
21% 仅使用闭源
来源:Mozilla / SlashData 2026 开发者调查。开放与闭源对大多数团队而言并非替代关系:50% 两者皆用,29% 仅用开放,21% 仅用闭源。
开放采用率高峰地区,以及闭源仍占优的地区
按地区划分的开放模型采用率。大中华区和东亚以 89% 领先;南美和西欧是仅有的两个闭源采用率超过开放的地区。
同一调查,按开发者地区划分。在南美和西欧,且仅在这两个地区,闭源模型采用率领先于开放模型。
按公司规模划分的生产率
如果差距源于资源,规模会缩小差距,但事实并非如此。闭源随规模从 54% 升至 73%。开放模型几乎不变:53% → 57%。
闭源模型开放模型
企业可以通过购买闭源部署绕过障碍。开放部署则依赖尚未完善的工具。来源:Mozilla / SlashData 2026 开发者调查。
团队流失原因:使用开放模型面临的挑战
Δ = 流失者 − 仍在使用者,单位为百分点。最大的差距(性能、集成、维护)是运营问题,而非能力问题。悬停在柱状图上查看详情。
仍在使用开放模型已流失
Mozilla 调查,n=1,410。“在使用开放或开源 AI 模型时,您面临的主要挑战是什么?”
相同的挑战,无处不在:按地区划分阻碍开放模型的因素
当前和已流失的开放模型开发者中,提及每项挑战的比例,按地区划分。颜色越暖表示被阻碍的开发者越多。最上方的几行在每个地区都是运营问题:基础设施成本、安全合规、维护、部署复杂性。南亚在安全和支持上受阻最严重;仅北美和大中华区有超过 15% 的开发者报告没有重大挑战。
来源:Mozilla / SlashData 2026 开发者调查 (MZCS1)。n=1,410 当前或已流失的开放模型开发者;大洋洲列 (n=39) 和东欧及独联体 (n=98) 低于可靠阈值。
02开源 AI 技术栈
开放栈在能力上得分高,
在运营上得分低。
技术栈的九层和 48 个组件按 10 项标准(1–5 分)评分。点击一层可展开其组件:每个组件都有自己的标准得分、成熟度等级、开放 vs 闭源持平评判,并列出一些最受欢迎的开源项目。
悬停在任意单元格上查看详情。
强劲可行但碎片化早期阶段
强劲 (≥4.0) 3.5–3.9 3.0–3.4 2.5–2.9 薄弱 (<2.5) 运营差距 = 标准化 + 企业就绪度
单元格为每个成熟度标准(1–5 分)的得分,按最强到最弱从左到右排列;层行是其组件的平均值。最冷的两列——标准化和企业就绪度——在每一层和每个组件中反复出现:这个反复出现的冷色边缘即为运营差距。来源:Mozilla 技术栈地图,2026 年 6 月(48 个组件,1,361 个项目)。
03谁在押注它
开源是一种商业模式。
开放权重 AI 是一个规模达数千亿美元的商业市场,由获得资金支持的公司构建,并由全球企业投入生产运行。Databricks 的年化 recurring revenue 超过 54 亿美元;Mistral 在十二个月内规模扩大 20 倍,ARR 约 4 亿美元;DeepSeek 达到约 2.2 亿美元 ARR,最近以超过 500 亿美元的估值融资 74 亿美元。五种收入模式已在规模上得到验证:托管推理、企业平台、本地许可、微调服务和编排工具。
风险投资支持的开源生态系统:已披露融资总额(百万美元)
滚动页面时柱状图会增长。颜色按公司所在地区划分。
北美中国欧洲及其他地区
部分公司;智谱 AI 和 MiniMax 已上市(2026 年香港 IPO),融资总额未披露。企业战略投资者(Nvidia、Salesforce、AMD、Google、IBM、ASML、Tencent、CATL、Schwarz Group)在模型、推理和工具层支持同一生态系统。
开放生态系统的财务成熟度
承载开放栈的公司的融资、估值和收入情况。该生态系统已从资助转向风险投资规模,再到公开市场。
五种收入模式已在规模上得到验证:托管推理、企业平台、本地许可、微调服务和编排工具。“—” = 未公开披露。
按量计费模式在规模上失效
闭源前沿模型按 token 销售——而在生产规模上,计量器成为问题。
五分之一的使用量,4% 的收入
在 OpenRouter(2025 年 5–9 月),闭源模型占约 80% 的使用量和约 96% 的收入。价格驱动这一结果:在大约 90% 持平的情况下,闭源模型每次调用成本约高 6 倍。
约 248 亿美元
的未实现年度节省——Linux Foundation 的 Nagle–Yue 研究估算的开放 vs 闭源价格不对称,在同等能力下每次调用成本约高 6 倍
开发者按成本路由时,会选择开放权重。
04为什么它正在全球发生
开放不是供应商选择。
而是主权选择。
目前已有超过 70 项国家 AI 战略正在实施。战略问题已从“是否需要国家 AI 政策”转向“一个国家能够拥有技术栈的哪一层”。
点击下方标记或国家名称。
开放的优势在于可选性
2026 年 6 月,可选性不再是抽象概念,也不再只是采购问题。Claude Fable 5 上市三天后,单一政府的出口命令迫使 Anthropic 切断对全球所有外国国民的访问。没有其他资本被咨询,也不可能被咨询。选择性合规是不可能的,因此模型在周五下午 5:21 突然对所有人失效。任何基于该模型构建的人都继承了一个他们事先毫不知情、也无法参与的关闭。供应商可以关闭模型。没有人能关闭已经运行在你所持有的机器上的副本——无论这台机器是初创公司的服务器还是国家超级计算机。对一家公司而言,磁盘上的权重是一种对冲。对一个国家而言,它是政策与许可之间的区别。
开放的战略意义在于能够离开,而云时代已证明缺乏这种能力的代价:
9–12 万美元将 1PB 数据从 AWS S3 迁出的成本
80%目前正在回迁工作负载的企业比例
320 万美元 → 不到 100 万美元37signals 离开云后的账单变化
2.5 倍GEICO 云成本超出预算的倍数
闭源模型 API 重现了同样的陷阱:在专有端点上构建,你将继承供应商的价格变动,且没有干净的退出路径。开放权重即退出权。
开放权重的最大来源是中国。这是设计使然。
Hugging Face 累计下载量,2026 年 3 月:
2026 年 2 月,Qwen 的下载量超过接下来八家机构的总和。在 OpenRouter 上,中国开放权重模型的 token 份额从 2024 年底的不足 2% 上升到 2026 年 4 月的每周流量 45% 以上,在十个最常用模型中约占 61%。DeepSeek 报告拥有 26,000 多家企业账户;2025 年 58% 的新 AI 初创公司将其纳入技术栈,尽管至少有八个司法管辖区限制了其托管服务。解决方案是架构性的:企业禁止托管应用,转而采用权重,通过自托管或西方端点运行。
这是有意为之的政策。国务院的“AI+”倡议(2025 年 8 月)和国家五年规划(2026 年 3 月)将开源扩散确立为核心指令,发布公共权重同时也作为应对半导体出口管制的宏观对冲,将全球推理卸载到终端用户的本地硬件上。在全球南方,吸引力在于摆脱美国技术垄断的多元化;而在其他地方,则纯粹是财务驱动。甚至微软也在为其最繁重的 Copilot 工作负载探索一个安全的、Azure 托管的 DeepSeek V4。
标记大小 ≈ 已承诺的公共/战略资本规模 · 等距圆柱投影
来源:开源 AI 司法管辖区数据集,2026 年 7 月。标记大小与已承诺的公共和战略资本成正比。
05编排层是新的前沿
代理型编排层是另一种用户代理。
浏览器是开放网络的用户代理:代码运行在用户端,代表用户与服务器协商。这一角色正在更高一层被重新创造。在模型之上,现在存在代理型编排层——编排循环、工具、记忆、沙箱和权限模型。生产难度集中于此,开放 vs 闭源、拥有 vs 租用的竞争也在此重新开始。
用户 · 其他代理 · 世界人类 · 系统 · 数据 · 金钱
治理跨越多个编排层的单一平面
有状态策略会话已执行的操作
注册与血统哪个代理执行了什么
预算与撤销成本上限 · 终止开关
元编排层 · Omnigent · OPA · 代理治理工具包
界面与用户及金钱交互
接口AG-UI · A2UI
支付与计量x402 · AP2 · UCP
动作安全地执行操作
沙箱与执行E2B · Daytona · Modal
权限与身份写入界面——尚未解决的差距
评估与可观测性Langfuse · Phoenix
触达连接与记忆
工具与上下文MCP
代理间通信A2A
记忆Mem0 · Letta · Zep
控制驱动循环
编排循环LangGraph · CrewAI · AutoGen · LlamaIndex——将模型转变为代理的推理-行动循环
模型——权重开放或闭源 · 可交换 · 正向零成本商品化
这一层已经成为一个产品类别:LangChain 拥有 126,000+ GitHub stars 和 60% 的开发者份额;MCP 在首年内达到 9700 万月度 SDK 下载和 10,000+ 活跃服务器,在 16 个月内增长 4,750%,并于 2025 年 12 月捐赠给 Linux Foundation 的 Agentic AI Foundation。采用速度快于治理:仅约 21% 的公司报告拥有成熟的代理治理。
模型正在吞噬编排层,这为开放创造了机会
Terminal-Bench 2.0(2026 年 5 月)让编排层看起来像是任何人都能捕获的免费午餐:第三方脚手架使用 Anthropic 自有权重达到 79.8%,而 Claude Code 在同一模型上仅为 58.0%,21.8 分的差距使编排层领先于权重。八周后,Terminal-Bench 2.1 出现了逆转。前沿实验室看到这一结果后,将编排层收归自有:在同时出现的每个模型上,实验室自有编排层均获胜,21.8 分的差距在顶尖水平已压缩至约 3 分:模型正在向上侵蚀技术栈,权重和脚手架作为单一产品一起交付。
2026 年 5 月 · Terminal-Bench 2.0
2026 年 7 月 · Terminal-Bench 2.1 · 官方榜单,已验证顶级梯队
这种集成正在形成护城河,实验室有充分动机深化它。紧密针对某一实验室权重的编排层会成为一种适配而非中立层。它在其他模型上性能下降,因此调优越紧密,底层权重的可交换性就越低。锁定作为优化的副作用悄然到来。开放模型没有第一方编排层来应对,因此在官方榜单的已验证顶级梯队中完全没有出现。
但缺席并不等于无能:将所有模型置于同一中立脚手架上,差距就会消失
在公平的编排层上,能力差距只有几分;而价格差距达到 5 倍。最强的开放模型 GLM 5.2 仅略逊于 Claude Opus 4.7,落后 Opus 4.8 约四分,但成本仅为其五分之一。集成让实验室获得开放部署所缺乏的第二优势:数据飞轮,实验室编排层上的真实使用数据直接反馈到下一个模型中。这一优势是真实存在的,且具有双向作用:使用数据训练了编排层的所有者,唯一的问题是这个所有者是闭源端点还是你自己的技术栈。实验室已证明编排层值得拥有。同样的举措对开放也适用——一个与开放权重共同设计的编排层——保持这一层开放的窗口现在就在,在闭源栈完成将模型和脚手架焊接成单一租用产品之前。
写入界面:编排层中心的未解之题
读取
可逆且低后果。获取文档、查询数据库、列出日历。这些操作大多可以默认允许;一次不良读取成本很低,且可以安全重复。
写入
有代价或不可逆的副作用。发送消息、花费预算、修改记录、执行交易。这正是需要集中确认、批准阈值、成本上限和撤销机制的地方。
未解决的权限问题是一个写入问题。编排层生态系统目前涵盖约十二个框架、十个编排层和三个对等协议,但尚无一个可移植的模型来定义代理在无人值守情况下可以执行哪些写入、哪些需要人工批准、哪些被禁止,涵盖 MCP 主机、A2A 对等节点、直接工具调用和框架边界。协议已强化前门,但仅止步于此:MCP 的 2025-11-25 规范将授权移至 OAuth 2.1,A2A v1.0 标准化了签名的 Agent Card,但两者都止步于身份验证。知道代理是谁,并不能说明它可以做什么。
人工后备机制也在失效。CoSAI 的 MCP 威胁模型将同意疲劳(用户批准绝大多数提示的模式)列为顶级威胁。同意疲劳本身就是写入侧的失败,因为真正重要的提示是授权执行操作的那些。
行业响应正在绕过框架僵局,将控制权提升至元编排层。不是在单个代理内部使用脆弱的基于提示的过滤器,而是新兴的跨编排层架构(如 Databricks 开源的 Omnigent)实施有状态、上下文感知的策略,跟踪会话已执行的操作,并据此控制下一次写入:例如在代理拉取未经验证的包后,要求人工批准代码推送,或在达到设定支出后强制执行成本上限以暂停会话。这些控制从高于任何单个编排层的层面管理写入界面,这也是持久权限模型最有可能形成的地方。这是该层中杠杆效应最大的差距。
闭源不等于安全
闭源 API 感觉安全是因为有过滤、监控和撤销。这三者都是服务层的功能。保持权重秘密并不能提供其中任何一项。相同的控制存在于编排层,并适用于自托管的开放模型。2025 年,CVSS 9.3–9.4 级别的授权失败影响了 Anthropic、Microsoft、ServiceNow 和 Salesforce,这些都是闭源系统。NTIA 研究了美国政府是否应限制开放权重,并建议对其进行监控而非限制。安全问题最好通过投资编排层来解决。不需要租用闭源模型。
闭源仍领先的领域
闭源系统仍在四个方面领先。首先是集成编排层。没有开放模型出现在 Terminal-Bench 2.1 官方榜单的已验证顶级梯队中,即使在中立脚手架上,最佳开放模型也落后于 Opus 4.8 约四分。其次是 1M token 的长上下文保真度,Gemini 3 在多针检索上达到 89%,而 DeepSeek V4-Pro 为 41%。第三是开箱即用的合规性,默认提供 SOC 2、HIPAA 和零数据保留。第四是问责制,即客户可以追究责任的交易对手。
合规性和问责制是合同问题。集成编排层是工具问题。长上下文保真度是模型问题,缩小差距的工作只有开放实验室能够完成。
06机遇
五项押注。无需超越前沿。
它们要求在这些层仍处于开放状态时,拥有其上的各层——编排层、记忆、权限模型。
07观察清单
保持这一层开放的信号。
能力与采用
3.3% 的差距(编码持平,推理和代理任务落后),以及开放模型在 OpenRouter 的 token 份额,尤其是在代理编码领域。
逆转条件:token 份额停滞,同时推理差距扩大。
编排层
实验室自有与独立脚手架之间的 Terminal-Bench 差距;AAIF 下的 MCP/A2A 治理;尚不存在的可移植权限规范。
逆转条件:实验室编排层领先扩大,或闭源平台率先制定权限标准。
市场结构
开放实验室的经济学(ARR、融资、智谱/MiniMax IPO)与按量计费定价的临界点(约 2027–28 年),以及主权产能作为制衡。
逆转条件:主权资助中断,或开放实验室经济学未能规模化。
信任与安全
正在跟踪,尚未解决:滥用能力和安全调优从开放权重中剥离的容易程度;高摩擦区域,尤其是合成 CSAM 和 NCII;NTIA 的“监控而非限制”政策是否持续。
逆转条件:重大滥用事件,或从监控转向限制。
对于本文的其余部分,你可以进行一项测试。看看在 AI 决策的会议室里,谁坐在那里,以及他们拥有何种地位。当那些致力于保持 AI 开放、可移植并广泛部署在平等地位上的人被请入席位的那一天,从租用转向拥有的转变就已发生。窗口现在是开放的。它正在缓慢关闭,缓慢到我们可以假装它没有关闭,而租期比看起来更短。与我们一起构建。
0 Comments
Log in to join the conversation.No comments yet. Be the first to share your thoughts.