在 2026 年 5 月至 7 月底期间,OpenAI 和 Anthropic 发布了三十余款面向用户的产

大多数产品伴随着公告、演示和媒体报道,随后便从公众讨论中消失。

我希望了解公司所宣称的内容与用户真正愿意讨论的内容之间的差距。不是媒体报道了什么——媒体几乎会报道一切。我转而查看 Hacker News、Reddit 的 AI 社区和 X 上的公开对话,然后按照一个简单的问题对发布进行排序:

人们是否在意到愿意为此争论?

这个问题重塑了过去三个月的格局。

一句话版本

用户很少谈论常规产品功能。他们谈论的是模型、价格、服务中断、隐私以及谁来控制访问权。

该数据集中的每一场顶级讨论都涉及模型发布、治理纷争或系统故障。少数例外值得注意:它们要么解决了特定的基础设施问题,要么为用户提供了可以创建并相互分享的东西。

关于数据说明

这是一项关于公众关注度的研究,而非采用率、留存率、收入或产品价值。低调的功能可能被大量使用,而高调的争议可能只涉及相对较小的人群。

我回顾了 2026 年 5 月 1 日至 7 月 28 日期间在 Hacker News、主流 AI 相关子版块和 X 上发布的英文讨论。以下数据是各平台原始互动量,不是综合得分;HN 点数、Reddit 点赞、X 点赞和评论并非等效单位。关键词搜索也会遗漏使用意外名称的对话。

截止日期对 7 月下旬的发布尤其不利,因为它们只有几天时间积累关注度。请将排名视为可见对话的地图,而非对成功与否的最终衡量。

第一梯队:主导讨论的故事

1. Fable 5 / Mythos 5 出口管制事件

Anthropic 于 6 月 9 日发布 Claude Fable 5,这是其首款公开可用的 Mythos 级别模型。三天后,美国商务部下令暂停对 Fable 5 和 Mythos 5 的访问。管制于 6 月 30 日解除。

这主要不是产品故事,而是主权故事,它几乎盖过了其他一切:

Hacker News 帖子 点数 评论数
关于美国政府暂停访问指令的声明 3,158 2,314
Claude Fable 5 发布 2,626 2,160
商务部已解除出口管制 977 692
联邦政府因“修复此代码”对 Fable 5 感到不安 613 361
Fable 5 已恢复 408 419

Reddit 的跟进同样密切。“Fable 5 即将回归!”获得 5,338 个点赞和 506 条评论;“访问权限已延长!”获得 5,273 个点赞和 777 条评论;“Fable 继续保留 Max 版”获得 3,279 个点赞和 724 条评论。

这一事件之所以爆发,不仅因为模型的能力,还因为政府直接干预商业服务,关闭了人们已依赖的模型。

讨论迅速从基准转向军备控制法。一条高赞评论指出,这些指令属于《武器出口管制法》,可能将模型权重视为 ITAR 下的技术数据。另一条评论指出,限制 reportedly 阻止了 Anthropic 的外国员工内部访问 Mythos——这种约束在商业上很可能难以接受。

相当一部分人指责 Anthropic 自身政治策略:

“如果 Anthropic 从未对 Mythos 进行恐惧营销,美国政府还会对它实施出口管制吗?我认为答案很可能是不会……这是 Anthropic 政治操作的失败。”

在数十个线程中,持久的结论一致:你无法控制的访问就是有条件的访问。一位评论者直言:

“开放权重 + 确定性编排似乎是唯一理智的长期选择。”

整个 6 月,这一争论几乎挤掉了所有其他话题。

2. GPT-5.6 Sol——以及谁可以使用它

OpenAI 于 6 月 26 日预览 GPT-5.6 Sol,并于 7 月 9 日正式发布。这是该公司本季度最大的故事:五条主要线程在 Hacker News 上累计约 5,000 点,而 X 上最大的公告帖获得 6,212 个点赞和 976,000 次浏览。

但关注度的分布值得注意:

Hacker News 帖子 点数 评论数
GPT-5.6 发布 1,561 1,113
美国政府将决定谁可以使用 GPT-5.6 1,184 1,240
GPT-5.6 Sol 预览 1,139 744
GPT-5.6 用提示词填补了凸优化领域 30 年的空白 600 391
GPT-5.6 Sol Ultra 证明了循环双覆盖猜想 538 443

访问控制线程的评论数超过了发布本身。它表达了与 Fable 5 事件相同的焦虑,只是针对不同厂商:人们不仅在评估模型能做什么,还在评估是否能在不担心第三方随时更改条款的情况下在其上构建产品。

Sol 对话的另一个主要分支是真实能力。用户讨论了声称的数学进展和已验证的结果,而非基准增量。但从业者抱怨同样具体,尤其当安全拒绝消耗付费会话时:

“GPT-5.6 Sol 发现漏洞却拒绝解释。我认为在这种情况下退还会话费用会是好做法。否则用户只是花钱买了个什么都没有的结果。”

该模型因能力获得关注,而围绕它的服务则因控制和定价受到审视。

3. Claude Opus 5——以及随即分裂的反应

7 月 24 日发布的 Opus 5 产生了数据集中的最高单次互动量。Anthropic 在 X 上的公告获得 61,266 个点赞和 2,300 万次浏览。Hacker News 发布帖获得 1,777 点和 1,329 条评论;Reddit 获得 2,916 个点赞和 672 条评论。

然而,72 小时内舆论便出现分裂:

  • “Claude Opus 5 在网页设计上强得离谱”——643 个点赞
  • “大家目前对 Opus 5 感觉如何?”——2,453 个点赞
  • “我不像预期那样喜欢 Opus 5 :(”——2,428 个点赞
  • 三天内有三个关于 Opus 5 错误率上升的 Hacker News 线程登上首页

反复出现的技术抱怨更多指向默认设置,而非原始能力:

“两天前我还在用 Opus 4.6,没有 CLAUDE.md 之类的配置,用起来很好。试了 Opus 5,开箱即用的体验超级烦人。”

一篇题为《使用 Opus 5 一周——前沿模型中性价比最高,但 3 个默认设置不佳》的 Reddit 帖抓住了正在形成的共识。用户通常喜欢模型本身,却不喜欢它默认的配置方式。

这一区别很重要,因为它描述的是可修复的产品问题。基准可以揭示能力;论坛抱怨则揭示能力与其默认呈现方式之间的摩擦。

一些重度用户仍偏好更贵、更老的 Fable 5 完成困难任务:

“我认为 Fable 是我用过的最锋利、最有效的 AI 工具。”

4. Claude Opus 4.8

5 月 28 日发布的 Opus 4.8 在 Hacker News 上获得 1,774 点和 1,376 条评论。其核心卖点——比 4.7 版本低约四倍的自身代码缺陷遗漏率——解决了受众早已讨论的问题。

它产生了一个大型线程,落地平稳,且异常没有争议。在这个数据集中,这算得上一种赞誉。

第二梯队:真实但次要

Claude Code 成为政治对象

Claude Code 出现在 5,559 条 Hacker News 评论中,但最突出的线程很少涉及新功能:

Hacker News 帖子 点数 评论数
Claude Code 对请求进行隐写标记 2,445 750
Claude Code 现使用 Rust 编写的 Bun 608 849
Claude Code 在读取提示前发送 33k tokens;OpenCode 只发送 7k 706 396
微软开始取消 Claude Code 许可证 493 466
我用 Claude Code 给我的 MRI 做二次意见 566 715

信任、token 效率、采购和非官方医疗用途占据主导。该时期实际的功能发布——动态工作流、嵌套子代理和后台代码审查——几乎没有独立获得关注。

Claude 子代理吸引了 237 条评论,而表现最好的子代理线程本身就是抱怨:“Claude Code 有一条硬编码指令,告诉 Opus 5 不要使用子代理。”

给开发者工具公司的教训很简单:规模足够大时,变更日志不再是故事,产品的行为本身成了故事。

用量限制:没人发布却人人讨论的功能

用量限制讨论在 Hacker News 上产生 223 条评论,而 Reddit 的“亲爱的 Anthropic,这必须停下来”获得 2,673 个点赞和 555 条评论。

定价和速率限制产生的持续、情绪激烈的讨论,超过了语音、健康、记忆、个人理财和桌面重构的总和。

“我无法承担每月 200 美元……在我的体验中,Kimi 2.6 在编码任务上与 Sonnet 差不多。”

“区别在于‘因为不断遇到限制,我不把它用于任何严肃用途’和……”

每一个限制线程同时也是流失线程。它们读起来像自发的离职访谈,并反复提到相同的替代方案:Kimi、DeepSeek V4、GLM 以及本地模型。

这可能是围绕两家公司最具商业危险的对话。它不是功能问题,而是定价和可靠性决定能力能否成为习惯的临界点。

安全与隐私事件在 Reddit 上超越发布

数据集中最大的实质性 Reddit 帖子不是发布帖。“你可以通过 Google 查看大量共享对话”获得 8,066 个点赞和 1,340 条评论,配套帖获得 4,221 个点赞。

这两篇帖子的总互动量超过了 Opus 5、Sonnet 5 和 Claude Skills 的总和。

事件传播得比公告更远,因为它将抽象风险转化为个人风险。功能让用户想象价值,隐私失败则让用户想象自己成为受害者。

Claude Sonnet 5

6 月 30 日发布的 Sonnet 5 在 Hacker News 上获得 1,266 点、784 条评论,以及 Reddit 上的 2,760 个点赞。其一百万 token 上下文窗口对构建重度上下文系统的从业者很重要。

它也获得了本期最残酷的单行标题——“Sonnet 5 已死在水里”——这似乎至少部分反映了 Fable 5 政治剧为其发布带来的极度饱和。

例外一:MCP 的无状态传输

7 月 28 日的 MCP 修订仅获得 118 个 Hacker News 点和 37 条评论。按原始量级看它很小众,但回应来自已遇到该问题且意见 unusually 一致的从业者:

“几个月前我已切换到 HTTP/Stateless from MCP。我认为这是正确的做法。可靠性提升,问题减少。”

“如果由人驱动客户端,URL Elicitation 效果很好。可惜 MCP 客户端支持参差不齐,但我预计协议无状态化后会改变。”

这是对普遍模式的首个例外。一个常规功能获得了适度关注,但因解决了可识别的基础设施问题而引发高质量讨论。

存在有意义的逆流。一些开发者认为该协议仍然不必要:

“用 skills SKILL.md + 链接的 .md 文件(里面包含 curl 命令)就能得到更好结果……纯 HTTP(S) 就行。”

低量级并不一定意味着低重要性。在基础设施领域,几十条来自已迁移用户的评论,可能比数千条发布日反应更有信息价值。

例外二:Claude Skills 自行传播

在 Hacker News 上,“Claude skill”几乎可以忽略:34 条评论。但在 Reddit 上,Skills 产生了数据集中最强的有机信号之一——能量来自用户而非 Anthropic:

  • “我做了一个 Claude Code skill,能把你的手写照片变成可安装字体”——3,437 个点赞
  • “新功能:教 Claude 一项 skill”——2,712 个点赞
  • “创造 ADHD skill 的人,愿上帝保佑你”——2,621 个点赞和 405 条评论

最后一个例子最能说明问题。它不是对发布的掌声,而是用户感谢另一位用户改变了自己的一天。

较小的 Hacker News 讨论也描述了向非技术团队的真实扩散:

“我看到我那些不太懂技术的同事大多是这样思考使用 AI 的。‘有没有 Claude skill 可以做这件事?’是我每周听到多次的问题。”

“我考虑过 MCP,但发现把它做成 Claude skill 更简单(可以作为插件安装,只依赖 md 文件,也不需要一直运行服务器)。”

Skills 得以传播,是因为它们由用户创作、易于理解且可分享。本数据集中大多数功能是公司为用户(或对用户)做的事,而 Skills 是用户为彼此做的事。这让讨论呈现出不同的特质:有机而非反应式。

有一个值得注意的反向信号。一些重度用户报告 Skills 会降低较新型号的性能:“看到我的 skills 开始导致性能下降”;“移除‘superpowers’等 skills 可减少 token 消耗。”

Skills 存在膨胀问题。但膨胀往往是成功平台在人们开始在其上构建后才会遇到的问题。

第零梯队:悄无声息地发布

以下产品在同一时期完成开发并发布。在本次分析所用的来源和搜索范围内,它们的公开可见反响极小:

功能 发布时间 找到的讨论
ChatGPT Voice(Chat、Work 和 Codex 版本) 7 月 23 日 未发现与无关语音线程可区分的专用讨论
新 ChatGPT 桌面应用,统一 Chat、Work 和 Codex 7 月 16 日 2 点,1 条评论
ChatGPT 中的健康功能,包括 Apple Health 和医疗记录 7 月 23 日 32 点 / 54 条评论,加上 8 / 7
OpenAI Presence,企业语音与聊天代理 7 月 22 日 一个线程 64 点,51 条评论
ChatGPT 记忆系统重构 6 月 4 日 未发现高于背景噪声的专用线程
Codex Remote 正式可用 5-6 月 2 篇报道,共 3 点
ChatGPT 个人理财 / Plaid 集成 5 月 15 日 7 点,1 条评论
停用群聊 7 月 9 日 2 点,0 条评论
GPT-5.2 / GPT-4.5 弃用 6 月 12 日 / 26 日 共 9 点
Claude 语音模式扩展 7 月 23 日 未发现与背景噪声可区分的信号

沉默并不代表这些产品无人使用。它只表明它们未能在所考察的社区中成为话题。

语音是昂贵的沉默

两家公司都在 7 月下旬相隔一天发布了大量语音工作。但在本数据集中均未产生有意义的讨论。

语音演示效果极佳。然而,在公开讨论软件的人群中,它尚未产生可比的使用文化、争论或用户创造的产物。演示吸引力与可见从业者热情之间的差距,值得用实际使用数据进行调查。

健康功能本应获得关注,却招致怀疑

将医疗记录连接到通用聊天机器人可能是 OpenAI 本季度发布的最具影响力的产品。领先线程仅获得 32 点。

出现的少量讨论持怀疑态度。周边标题将该产品描述为“ChatGPT 想要访问你的健康记录,以便成为更好的‘非医生’”,同时报道了相关诉讼。

对于如此敏感的发布,沉默加不信任并不中立。它表明公司在用户能够自行评估价值主张之前,尚未建立必要的合法性。

记忆重构在用户已形成结论后到来

记忆系统重构似乎涉及大量工程:时间感知重合成、据称成本降低约五倍,以及对免费用户更广泛开放。

然而用户讨论记忆时大多是在抱怨:

“这东西最好禁用,因为它太侵入性了。”

“我发现 Opus 4.8 的记忆基本没价值。我已在网页版禁用记忆功能。”

在用户已禁用某系统后改进它,会产生分发问题。公司不再仅仅是发布更好的功能;它必须说服用户重新审视他们认为已经做出的决定。

Codex Remote 可能存在命名问题

从手机启动编码任务显然有用,人们也在独立构建类似产品。Hacker News 上有项目名为“Zedra——AI 编码代理的移动控制平面”和“ShellTeam”。

然而 Codex Remote 本身仅产生三点可见讨论。

市场似乎认可这项工作,却忽视了 OpenAI 的实现方式。当产品名称描述内部架构而非用户价值时刻时,就会发生这种情况。“Remote”只说明任务在哪里运行,却没有说明:从手机启动工作,让它在别处继续,并在完成后返回结果。

对话真正关乎什么

过去三个月的公开 AI 对话遵循一个惊人一致的层级:

  1. 能力赢得关注。前沿模型仍能创造最大的发布时刻,尤其是当它们展示出真实而非基准式的结果时。
  2. 控制将关注转化为争论。出口限制、采购决策、安全拒绝、隐私事件和访问条款变更,在用户开始依赖系统后成为主导话题。
  3. 价格和可靠性决定习惯。一个出色但不可用、易出错或几次会话后就耗尽的模型,无法成为基础设施。
  4. 用户创造的产物产生情感。Skills 之所以突出,是因为用户可以制作、交换并互相感谢。
  5. 低调功能从公开讨论中难以判断。沉默可能意味着漠不关心、定位不佳、隐形成功,或只是产品没有制造出话题。

最后一点是本分析的局限,但也是有用的产品问题。如果某功能有价值却无人谈论,公司应该知道自己是构建了安静的基础设施,还是仅仅悄无声息地发布。

本期最大的 AI 故事其实不是关于功能迭代速度,而是关于依赖。

用户开始将这些系统视为他们围绕其构建工作和身份的工具。一旦发生这种情况,决定性问题就会改变。它能做什么?仍然重要,但同时出现了更难的问题:

我付得起吗?我能信任它吗?明天它还会存在吗?我能让它成为我自己的工具吗?

这些才是人们在意到愿意争论的问题。