这个理念听起来很诱人:一个完全属于我的助手,在我自己的机器上运行,无需连接,输入的任何内容都不会离开房间。没有公司统计我的 token。没有订阅。没有因他人服务器宕机而毁掉我的下午(我在说你,Anthropic,还有你那频繁的宕机)。我曾经非常渴望这个,于是花了几个月去追逐它,现在我想坦诚地告诉你结果如何。
24GB 听起来够用,直到你加载模型
我的 Mac 有 24GB 内存。购买时我觉得这很慷慨,但当你加载一个真正的语言模型时,这个数字很快就会缩水。系统会保留一部分内存,因为电脑需要继续运行,留给模型的内存实际上只剩贴标数字的三分之二左右。真正值得信赖的模型正好卡在这个上限或略微超出。所以你必须做出选择:一个能轻松运行但不够聪明的模型,或者一个更聪明但让机器喘不过气的模型。
显而易见的解决方案是增加内存,但你最近有没有关注过内存价格?时机糟糕透了。内存价格上涨的方式仍然让那些有一段时间没买过的人感到惊讶。自 2025 年初以来,DRAM 价格大约翻了一番,关注这个领域的分析师认为,到 2026 年底价格可能再上涨约 70%。存储的情况更糟。制造 SSD 的原始 NAND 晶圆交易价格大约是去年年中时的八倍,一块 4TB 硬盘不久前我只需支付约 250 美元,现在却要 700 美元以上——而且由于目前市场波动如此剧烈,当这篇博客发布时,这些数字可能完全不同,因为现在是 2026 年,谁知道 RAM 和 SSD 的价格会是多少。
造成这种疯狂局面的原因,也是当今科技领域一半故事背后的原因——AI。大型数据中心的建设预计今年将消耗全球约 70% 的高端内存,云巨头们已经签署了提前数年锁定产量的合同。他们实际上是在购买尚未制造的芯片。美光甚至关闭了面向消费者的 Crucial 品牌,将一切转向 AI 市场。
稍微思考一下。正是这场让私人本地模型如此诱人的热潮,也把我们大多数人挡在了能正常运行它的硬件之外。如果不是因为我的钱包,我会觉得这更有趣。
我一开始责怪软件
在接受这一切之前,我确信只是选错了工具。所以我开始寻找框架。如果说 LLM 是大脑,那么框架就是给它装上手——让它真正有用的工具:Pi、OpenCode、Hermes。每一个都承诺能让本地 AI 真正起作用。
我最终选择了 Pi,不是因为它的功能,而是因为模型在那里运行得最好,响应更快,我和请求之间的摩擦更少。但这次寻找让我明白,包装器不一定是瓶颈。我可以整天切换它们,但都会遇到同样的障碍,因为障碍在于模型和支撑它的内存。没有哪个界面能修复一个没有足够空间思考的模型。
所以现在我的处境是:我不够信任自己能运行的本地模型,无法依赖它们处理任何出错可能造成重大损失的任务。快速改写、随手一问,没问题。但当任务需要真正判断时,我几乎还没决定,就又回到了云端。我想停止依赖付费助手,不是因为它们贵得离谱。我想要的是独立于云公司,独立于它们的任性和宕机。token 目前 heavily subsidized,以至于这些更强大的模型迟早会让我因为价格而却步。
我的本地 AI 真正擅长什么
不过,也不是完全没有好消息。有一个工作本地模型经常做,而且做得很好,那就是帮我分析招聘广告。
我的求职过程以后台批处理方式运行。一个脚本拉取职位列表,剔除明显无用的,然后把剩下的交给笔记本上的模型,由它根据我写的简要说明判断匹配度。免费且离线。我的简历从未离开过这台机器,无论云端 AI 是否宕机,它都能工作。这是我所追逐的那种独立性,只是范围比我希望的小得多。
这之所以可行,是因为新型模型的构建方式。我使用的 Gemma 模型采用混合专家(mixture-of-experts)设计,简单来说就是它只会唤醒给定问题所需的自身部分,而不是一次性激活整个模型。它足够轻量,能在我的硬件上真正进行推理而不会卡顿太久,每条广告大约需要 30 秒。对于在后台运行的任务来说,30 秒不算什么。
所以,还不行
我还没有放弃本地 AI。我对「我想要的」和「24GB 加上残酷的内存市场今天能给我的」之间的差距感到沮丧。但混合专家技巧已经把那条线往前推了一次,希望它还能再推。模型的智能正在以每 GB 提升,而不是单纯变大,价格最终也会回落。几年后的某个版本的我,可能会毫不犹豫地把这一切都本地运行。目前,我只有一个工作流完全运行在自己的硬件上,其他一切仍在「打电话回家」。那个工作流完全属于我。这是一个开始。
0 Comments
Log in to join the conversation.No comments yet. Be the first to share your thoughts.