2026 年 5 月到 7 月底,OpenAI 和 Anthropic 推出了三十多項面向使用者的產品與功能:全新語音模式、健康紀錄整合、個人理財、桌面重新設計、記憶系統重寫、企業代理產品,以及各自的兩個前沿模型家族。
大多數功能一推出就伴隨公告、展示、媒體報導,隨後便從公開討論中消失。
我想了解公司公布的功能與使用者真正願意討論的內容之間的落差。不是媒體報導了什麼——媒體幾乎涵蓋所有內容。我轉而觀察 Hacker News、Reddit 的 AI 社群,以及 X 上的公開對話,依據一個刻意簡化的問題進行排序:
人們是否在意到願意為之爭論?
這個問題重新組織了過去三個月的樣貌。
一句話版本
使用者很少談論傳統產品功能。他們討論的是模型、價格、中斷、隱私,以及誰掌握存取權。
資料集中每一則頂級討論都涉及模型發布、治理爭議,或是某些東西發生故障。少數例外值得注意:它們要麼解決了特定的基礎架構問題,要麼讓使用者能自行創作並互相分享。
關於數字的說明
這是一項關於公眾注意力的研究,而非採用率、留存率、營收或產品價值。低調的功能可能被大量使用,而熱門的爭議可能只涉及相對少數族群。
我檢視了 2026 年 5 月 1 日至 7 月 28 日之間,在 Hacker News、知名 AI 相關 subreddit,以及 X 上發表的英文討論。以下數字是各平台原始的互動次數,並非綜合分數;HN 點數、Reddit 按讚、X 按讚與留言並非等值單位。關鍵字搜尋也會遺漏使用非預期名稱的對話。
截止日期對 7 月底推出的功能特別不利,因為它們只有幾天時間累積關注。請將排名視為可見對話的地圖,而非成功與否的絕對指標。
第一層:主導討論的故事
1. Fable 5 / Mythos 5 出口管制事件
Anthropic 於 6 月 9 日推出 Claude Fable 5,這是它首款公開可取得的 Mythos 等級模型。三天後,美國商務部發出指令,強制 Anthropic 暫停 Fable 5 與 Mythos 5 的存取。管制於 6 月 30 日解除。
這主要不是產品故事,而是主權故事,而且幾乎壓倒其他所有事件:
| Hacker News 討論串 | 點數 | 留言 |
|---|---|---|
| Statement on US government directive to suspend access | 3,158 | 2,314 |
| Claude Fable 5 launch | 2,626 | 2,160 |
| Commerce has lifted export controls | 977 | 692 |
| Feds freaked over Fable 5 after “fix this code” | 613 | 361 |
| Fable 5 is Back | 408 | 419 |
Reddit 的關注度同樣高。「Fable 5 is coming back!」獲得 5,338 個按讚與 506 則留言;「Access has been extended!」獲得 5,273 個按讚與 777 則留言;「Fable staying on Max」獲得 3,279 個按讚與 724 則留言。
讓這段事件爆發的原因不只是模型的能力,而是政府介入商業服務,關閉人們已經依賴的模型。
討論立刻從基準測試延伸到軍備管制法。一則廣受按讚的留言指出,這些指令適用於《武器出口管制法》,可能將模型權重視為 ITAR 下的技術資料。另一則觀察指出,限制據稱也讓 Anthropic 自己的外國員工無法存取內部的 Mythos——這對商業運作來說難以忍受。
相當一部分人將責任歸咎於 Anthropic 自身的政治策略:
「如果 Anthropic 沒有對 Mythos 散布恐慌,美國政府會對它實施出口管制嗎?我認為答案非常可能是『不會』。……這是 Anthropic 政治操作的失敗。」
在數十個討論串中,持久的結論相同:你無法控制的存取就是有條件的存取。一位留言者直白地說:
「開放權重加上確定性編排,似乎是唯一合理的長期選擇。」
整個六月,這個論點幾乎排擠了其他一切。
2. GPT-5.6 Sol——以及誰能使用它
OpenAI 於 6 月 26 日預覽 GPT-5.6 Sol,並於 7 月 9 日正式發布。這是該公司本季最大的故事,遠超其他:五個主要討論串在 Hacker News 累計約 5,000 點,X 上最大的公告貼文則獲得 6,212 個按讚與 97.6 萬次觀看。
但注意力的分布更值得留意:
| Hacker News 討論串 | 點數 | 留言 |
|---|---|---|
| GPT-5.6 launch | 1,561 | 1,113 |
| U.S. government will decide who gets to use GPT-5.6 | 1,184 | 1,240 |
| Previewing GPT-5.6 Sol | 1,139 | 744 |
| GPT-5.6 used a prompt to close a 30-year gap in convex optimization | 600 | 391 |
| GPT-5.6 Sol Ultra produces proof of the Cycle Double Cover Conjecture | 538 | 443 |
存取控制的討論串留言數多於發布本身。它表達了與 Fable 5 事件相同的焦慮,只不過對象換成另一家廠商:人們不僅在評估模型能做什麼,也在思考自己是否能在不被第三方改變條款的情況下持續使用它。
Sol 討論的另一個主要分支是實質能力。使用者討論聲稱的數學進展與已驗證的結果,而非基準測試的差異。但從業者的抱怨同樣具體,特別是當安全拒絕消耗付費使用時段時:
「GPT-5.6 Sol 發現漏洞卻拒絕解釋。我認為在這種情況下退還使用費用會是好的做法,否則客戶只是花錢卻一無所獲。」
該模型靠能力獲得關注,周邊服務則因控制與定價而受到檢視。
3. Claude Opus 5——以及立即的分裂
7 月 24 日發布的 Opus 5,創造了資料集中單一最高的互動數字。Anthropic 在 X 上的公告獲得 61,266 個按讚與 2,300 萬次觀看。Hacker News 的發布討論串獲得 1,777 點與 1,329 則留言;Reddit 則獲得 2,916 個按讚與 672 則留言。
然而,72 小時內氛圍就分裂了:
- 「Claude Opus 5 在網頁設計上好得離譜」——643 個按讚
- 「大家目前對 Opus 5 的感覺如何?」——2,453 個按讚
- 「我沒像預期那麼喜歡 Opus 5 :(」——2,428 個按讚
- 三個關於 Opus 5 錯誤率上升的 Hacker News 討論串在四天內登上首頁
反覆出現的技術抱怨主要關於預設值,而非原始能力:
「兩天前我還在使用 Opus 4.6,沒有 CLAUDE.md 之類的設定,用起來很棒。試了 Opus 5,預設體驗超級惱人。」
一則標題為「使用 Opus 5 一週——前沿模型中性價比最高,但有 3 個預設設定不太好」的 Reddit 貼文,捕捉到了逐漸形成的共識。使用者常喜歡模型本身,卻不喜歡它出廠時的設定。
這種區別很重要,因為它描述的是一個可修正的產品問題。基準測試能揭示能力;論壇抱怨則揭示能力與預設呈現方式之間的摩擦。
部分重度使用者仍偏好較舊、較昂貴的 Fable 5 來處理困難工作:
「我相信 Fable 是我用過最銳利、最有效的 AI 工具。」
4. Claude Opus 4.8
5 月 28 日發布的 Opus 4.8,獲得 1,774 點 Hacker News 點數與 1,376 則留言。它的核心賣點——比 4.7 版低約四倍的機率忽略自身程式碼中的缺陷——解決了其受眾早已在討論的問題。
它產生了一個大型討論串,順利落地,而且異乎尋常地沒有爭議。在這個資料集中,這是一種讚美。
第二層:真實,但次要
Claude Code 成為政治對象
Claude Code 出現在 5,559 則 Hacker News 留言中,但最受關注的討論串很少與新功能有關:
| Hacker News 討論串 | 點數 | 留言 |
|---|---|---|
| Claude Code is steganographically marking requests | 2,445 | 750 |
| Claude Code uses Bun written in Rust now | 608 | 849 |
| Claude Code sends 33k tokens before reading the prompt; OpenCode sends 7k | 706 | 396 |
| Microsoft starts canceling Claude Code licenses | 493 | 466 |
| I used Claude Code to get a second opinion on my MRI | 566 | 715 |
信任、token 效率、採購,以及非正規醫學用途主導了討論。本季實際的功能發布——動態工作流程、巢狀子代理、背景程式碼審查——幾乎沒有獨立引起注意。
Claude 子代理吸引了 237 則留言,而表現最好的子代理討論串本身就是一則抱怨:「Claude Code 有硬編碼指令告訴 Opus 5 不要使用子代理。」
給開發工具公司的教訓很簡單:規模夠大時,更新日誌就不再是故事。產品的行為本身才成為故事。
使用限制:沒人推出卻人人討論的功能
使用限制的討論在 Hacker News 產生 223 則留言,而 Reddit 的「Dear Anthropic, This Has to STOP.」獲得 2,673 個按讚與 555 則留言。
定價與速率限制產生的持續、情緒強烈的討論,超過語音、健康、記憶、個人理財與桌面重新設計的總和。
「我負擔不起每月 200 美元 […] 用在編碼任務上,Kimi 2.6 在我看來和 Sonnet 差不多。」
「這就是『我不會用它做任何正經事,因為我總是碰到限制』與……之間的差別。」
每一則限制討論串同時也是流失討論串。它們讀起來像未經請求的離職訪談,反覆提及相同的替代方案:Kimi、DeepSeek V4、GLM,以及本地模型。
這可能是圍繞兩家公司最具商業危險性的對話。它不是功能問題,而是定價與可靠性決定能力能否成為習慣的臨界點。
安全與隱私事件在 Reddit 上的表現優於發布
資料集中最大的實質性 Reddit 貼文不是發布。「You can view a lot of shared conversations via Google」獲得 8,066 個按讚與 1,340 則留言,另一篇關於同一疑似外洩的貼文則獲得 4,221 個按讚。
這兩篇貼文加起來,互動數高於 Opus 5、Sonnet 5 與 Claude Skills 的總和。
事件傳播得比公告更遠,因為它把抽象風險轉化為個人風險。功能要求使用者想像價值。隱私失敗則要求使用者想像自己是受害者。
Claude Sonnet 5
6 月 30 日發布的 Sonnet 5,獲得 1,266 點 Hacker News 點數、784 則留言,以及 2,760 個 Reddit 按讚。它的一百萬 token 上下文視窗對建構需要大量上下文的系統的從業者很重要。
它也獲得了本季最殘酷的一行標題——「Sonnet 5 Is Dead in the Water」——這似乎至少部分反映了 Fable 5 政治風波在它發布時造成的極端飽和。
例外一:MCP 的無狀態傳輸
7 月 28 日的 MCP 修訂只吸引了 118 點 Hacker News 點數與 37 則留言。從原始數量來看它很小眾,但回應來自已經遇到這個問題的從業者,而且意見 unusually 一致:
「我幾個月前就從 MCP 切換到 HTTP/Stateless 了。我認為這是正確的做法。可靠性提升,問題減少。」
「如果由人駕馭客戶端,URL Elicitation 效果很好。可惜 MCP 的客戶端支援很零散,但我預期隨著協定改為無狀態,情況會改變。」
這是通用模式的第一個例外。一個傳統功能產生的關注度不高,但討論品質很高,因為它解決了可辨識的基礎架構問題。
也有一股有意義的反向意見。部分開發者認為這個協定仍然不必要:
「用 skills SKILL.md 加上內含 curl 指令的連結 .md 檔案,就能得到更好的結果……就是普通的 HTTP(S)。」
流量低不一定代表重要性低。在基礎架構領域,來自已經完成遷移的少數留言,可能比數千則發布當天的反應更有參考價值。
例外二:Claude Skills 自行傳播
在 Hacker News 上,「Claude skill」幾乎可以忽略:34 則留言。但在 Reddit 上,Skills 產生了資料集中最強的有機訊號之一——而且能量來自使用者,而非 Anthropic:
- 「我做了一個 Claude Code skill,能把你的手寫照片轉成可安裝的字型」——3,437 個按讚
- 「新功能:教 Claude 一項技能」——2,712 個按讚
- 「創造 ADHD skill 的人,願上帝保佑你」——2,621 個按讚與 405 則留言
最後這個例子就是關鍵。它不是對發布的掌聲,而是使用者感謝另一位使用者改變了他的一天。
Hacker News 較小的討論也描述了向非技術團隊的真實擴散:
「這就是我看到我那些技術程度較低的同事使用 AI 的方式。『有 Claude skill 可以做這件事嗎?』是我每週都會聽到好幾次的問題。」
「我考慮過 MCP,但發現把它做成 Claude skill 簡單多了(因為可以當成外掛安裝,只依賴 md 檔案,而且不需要一直跑伺服器)。」
Skills 之所以傳播,是因為它們由使用者創作、易懂,而且可以分享。這個資料集中的大多數功能都是公司為(或對)使用者做的事。Skills 則是使用者為彼此做的事。這讓討論呈現不同的特質:有機而非被動反應。
有一個值得注意的反向訊號。部分進階使用者回報 Skills 會降低較新模型的效能:「看到我的 skills 開始造成效能下降」;「移除像『superpowers』這樣的 skills 會減少 token 消耗。」
Skills 有膨脹問題。但膨脹往往是成功平台在人們開始在其上建構後才會遇到的問題。
第零層:發布後幾乎無聲
以下產品在同一時期完成開發與發布。在本分析所使用的來源與搜尋範圍內,它們可見的公眾反應極低:
| 功能 | 發布時間 | 找到的討論 |
|---|---|---|
| ChatGPT Voice in Chat, Work, and Codex | 7 月 23 日 | 沒有可與其他語音討論串區分的專屬討論 |
| New ChatGPT desktop app, unifying Chat, Work, and Codex | 7 月 16 日 | 2 點,1 則留言 |
| Health in ChatGPT, including Apple Health and medical records | 7 月 23 日 | 32 點 / 54 則留言,加上 8 / 7 |
| OpenAI Presence, enterprise voice-and-chat agents | 7 月 22 日 | 單一討論串 64 點,51 則留言 |
| Rebuilt ChatGPT memory | 6 月 4 日 | 沒有高於背景雜訊的專屬討論串 |
| Codex Remote general availability | 5 月 / 6 月 | 2 則報導,共 3 點 |
| ChatGPT personal finance / Plaid | 5 月 15 日 | 7 點,1 則留言 |
| Retiring group chats | 7 月 9 日 | 2 點,0 則留言 |
| GPT-5.2 / GPT-4.5 deprecation | 6 月 12 日 / 26 日 | 共 9 點 |
| Claude voice-mode expansion | 7 月 23 日 | 沒有可與背景雜訊區分的訊號 |
沉默並不代表這些產品無人使用。它只顯示它們未能成為所檢視社群中的故事。
語音是昂貴的沉默
兩家公司都在 7 月底相隔一天推出了大量語音功能。兩者在這個資料集中都沒有產生有意義的討論。
語音示範很漂亮。但在公開討論軟體的人當中,它尚未產生可比的使用文化、爭論或使用者創作的成果。這種示範吸引力與可見從業者熱情之間的落差,值得用實際使用資料進一步調查。
健康功能值得關注卻獲得懷疑
將醫療紀錄連接到通用聊天機器人,可能是 OpenAI 本季最有影響力的產品。主要討論串只獲得 32 點。
出現的少量討論帶有懷疑。相關標題將該產品描述為「ChatGPT 想要存取你的健康紀錄,以便成為更好的非醫生」,並附帶訴訟報導。
對於如此敏感的發布,沉默加上不信任並非中性。這表示該公司尚未建立讓使用者能依據自身條件評估價值主張的正當性。
記憶重寫在使用者已形成判斷後才推出
記憶重新設計似乎涉及大量工程:具時間感知的重新合成、據稱成本降低約五倍,以及更廣泛提供給免費用戶。
然而使用者討論記憶時大多是抱怨:
「這東西最好關掉,因為它太侵入性了。」
「我發現 Opus 4.8 的記憶大多沒有價值。我在網頁介面中停用了記憶功能。」
在使用者已經停用某系統後再改善它,會產生分發問題。公司不再只是推出更好的功能;它必須說服使用者重新檢視他們自認已經做出的決定。
Codex Remote 可能有命名問題
從手機啟動編碼任務顯然有用,而且人們已經在獨立開發類似產品。Hacker News 上有標題為「Zedra—Mobile control plane for AI coding agents」與「ShellTeam」的專案。
然而 Codex Remote 本身只產生三點可見討論。
市場似乎認可這項工作,卻忽略了 OpenAI 的實作。這可能發生在產品名稱描述內部架構而非使用者價值時刻的情況。「Remote」說明任務在哪裡執行。它沒有說明:從手機開始工作,讓它在其他地方繼續,並在完成後取回結果。
對話真正關於什麼
過去三個月的公開 AI 對話遵循一個出奇一致的層級:
- 能力獲得關注。前沿模型仍能創造最大的發布時刻,特別是當它們展示出感覺真實而非基準測試形狀的結果時。
- 控制將注意力轉化為爭論。出口限制、採購決定、安全拒絕、隱私事件,以及改變存取條款,一旦使用者開始依賴系統,就會主導討論。
- 價格與可靠性決定習慣。一個出色的模型如果無法取得、容易出錯,或幾次使用後就耗盡,就無法成為基礎建設。
- 使用者創作的產物產生情感連結。Skills 之所以突出,是因為使用者能製作它們、交換它們,並為它們互相感謝。
- 低調功能真的很難從公開討論判斷。沉默可能意味著冷漠、定位不佳、無形成功,或只是產品沒有產生故事。
最後一點是本分析的極限,但同時也是一個有用的產品問題。如果某項功能有價值卻沒有人談論,公司應該知道自己是建構了安靜的基礎建設,還是只是發布到一片空白。
本期最大的 AI 故事其實不是關於功能速度。它們是關於依賴。
使用者開始將這些系統視為他們圍繞工作與身分建構的工具。一旦發生這種情況,決定性的問題就會改變。它能做什麼?仍然重要,但同時出現更困難的問題:
我負擔得起嗎?我能信任它嗎?它明天還會存在嗎?而我能讓它成為我的嗎?
這些才是人們在意到願意爭論的問題。
0 Comments
Log in to join the conversation.No comments yet. Be the first to share your thoughts.