Cover image for I wanted to run my own AI. My laptop says not yet

Márcio Florindo

聽起來很完美:完全屬於我的助理,在自己的機器上運行,不需要任何連線,我輸入的任何東西都不會離開房間。沒有公司計算我的 token。沒有訂閱。也不會因為別人伺服器的故障而毀掉我的下午(我說的就是你,Anthropic,還有你那持續不斷的故障)。我非常想要這樣的東西,所以花了幾個月去追求它,而我現在想誠實地告訴你,它把我帶到哪裡。

24GB 聽起來很多,直到你載入模型

我的 Mac 有 24GB 記憶體。當我買它的時候,這個數字感覺很慷慨,但當你載入一個真正的語言模型時,這個數字很快就縮水了。系統會保留自己的份額,因為電腦需要繼續運作,而真正留給模型的只剩下標示數量的三分之二左右。真正值得信賴的模型剛好卡在這個上限,或是稍微超過。所以你必須選擇:一個能舒適運行但不是很聰明的模型,或者一個更聰明但會讓機器喘不過氣的模型。

顯而易見的解決方案是增加更多記憶體,但你有看過最近的記憶體價格嗎?時機糟得不能再糟了。記憶體價格上漲的方式仍然讓一段時間沒買過的人感到驚訝。自 2025 年初以來,DRAM 價格大約上漲了一倍,而關注這個領域的分析師認為,到 2026 年可能還會再上漲 70% 左右。儲存空間在某些方面更糟。SSD 切割自的原始 NAND 晶圓,其交易價格大約是去年年中時的八倍,而我不久前只需 250 美元就能買到的 4TB 硬碟,現在卻要 700 美元以上——而且因為市場目前非常波動,當這篇部落格文章上線時,這些數字可能完全不同,因為現在是 2026 年,誰知道 RAM 和 SSD 的價格會變成多少。

造成這種瘋狂的原因,也是現在科技界一半故事背後的原因——AI。大型資料中心的建置預計今年將吞噬全球約 70% 的高端記憶體,而雲端巨頭已經簽署了提前數年鎖定產能的合約。他們實際上是在購買還沒生產出來的晶片。美光甚至關閉了面向消費者的 Crucial 品牌,將所有資源都投入 AI 市場。

請想一想。同樣讓私人的小型本地模型如此吸引人的熱潮,也正是讓我們大多數人買不起能妥善運行它的硬體的熱潮。如果不是因為我的錢包,我會覺得這更有趣。

我一開始怪罪軟體

在接受這些現實之前,我確信我只是選錯了工具。所以我開始尋找各種框架。如果說 LLM 是大腦,那麼框架就是給它雙手——讓它真正有用的工具:Pi、OpenCode、Hermes。每個都承諾能讓本地 AI 發揮作用。

我最後選擇了 Pi,不是因為它的功能,而是因為模型在那裡運行得最好,回答更快,而且我和我提出的任何問題之間的摩擦更少。但在購買的過程中,我學到包裝器不一定是瓶頸。我可以整天更換它們,但都會撞到同一堵牆,因為牆就是模型和支撐它的記憶體。沒有任何介面能修復一個沒有足夠空間思考的模型。

所以我現在處於一個不相信我能運行的本地模型的地步,不敢在任何可能因為出錯而付出很大代價的事情上依賴它們。快速重新措辭、一個隨手提出的問題,沒問題。但當一個任務需要真正的判斷時,我幾乎還沒決定,就又回到雲端了。我想要停止依賴付費助理,不是因為它們貴得離譜。我想要的是獨立於雲端公司、它們的喜好和它們的故障。目前 token 受到大量補貼,所以這些更強大的模型可能很快就會讓我負擔不起。

我的本地 AI 實際上擅長什麼

不過,也不是完全沒有好消息。有一項工作本地模型經常做,而且做得很好,那就是幫我分析職缺廣告。

我的求職活動是作為背景批次運作。一個腳本會抓取職缺清單,剔除明顯的垃圾,然後把剩下的交給筆電上的模型,讓它根據我寫的簡介閱讀每一個職缺,並告訴我看起來有多合適。免費且離線。我的履歷永遠不會離開機器,而且無論雲端是否有 AI 故障,它都能運作。這是我追尋的那種獨立,只是範圍比我原本希望的小得多。

它之所以能運作,是因為新模型的建構方式。我使用的 Gemma 模型採用混合專家(mixture-of-experts)設計,簡單來說,就是它只會喚醒給定問題所需的自身部分,而不是一次啟動全部。它足夠輕巧,能在我的硬體上真正進行推理,而不需要花很長時間,每則廣告大約需要三十秒。對於在我工作時在背景運行的東西來說,三十秒不算什麼。

所以,還不行

我還沒有放棄本地 AI。我對我想要的東西和 24GB 加上殘酷的記憶體市場今天能給我的東西之間的差距感到沮喪。但混合專家技巧已經把那條線往前推了一次,希望它能再往前推。模型持續變得更聰明(每 GB 的效能),而非只是變得更大,價格最終會緩解,而幾年後的某個版本的我,可能會在本地運行所有這些東西,而不會再三思考。目前,我只有一個工作流程在自己的硬體上運作,而其他一切仍然需要連回雲端。那個工作流程是完全屬於我的。這是一個開始。