Cover image for I wanted to run my own AI. My laptop says not yet

Márcio Florindo

その売り文句は自分で語る。完全に自分のもの、自身のマシン上で動作し、接続不要で、入力した内容が部屋の外に出ることはない。トークンを数える企業もない。サブスクリプションもない。他人のサーバーの障害が午後を台無しにすることもない(Anthropicさん、あなたの繰り返す障害のことですよ)。私はそれを強く望み、数ヶ月間追いかけた。そして正直に結果をお伝えしたい。

24GBは十分に聞こえるが、モデルを読み込むと話は別

私のMacには24GBのメモリがある。購入したときは十分だと思ったが、実際の言語モデルを読み込むとその数字はあっという間に減る。システムはコンピュータの動作を維持するため一定量を確保し、モデルに残るのは定価の3分の2程度だ。実際に信頼できるモデルはちょうどその上限か、少し上にある。だから選ばなければならない。余裕で動くがあまり賢くないモデルか、賢いがマシンが苦しむモデルか。

明らかな解決策はメモリを増やすことだが、最近のメモリ価格をご存知だろうか?タイミングは最悪だ。メモリはしばらく購入していなかった人々を驚かせるほど高価になった。DRAMの価格は2025年初頭から約2倍になり、アナリストたちは2026年を通じてさらに70%程度上昇する可能性があると見ている。ストレージはさらに悪い。SSDの原料となるNANDウェハは、昨年の半ばに比べて約8倍の価格で取引されており、以前なら250ドル程度だった4TBドライブが今では700ドルを超える値段を要求している。そして市場が非常に不安定なため、この記事が公開されたときには数字が全く違う可能性がある。なぜなら2026年であり、RAMやSSDがどれだけ値上がりするかは誰にもわからないからだ。

この異常事態の原因は、現在のテック業界の半分のニュースの背景にあるものと同じだ——AIだ。大型データセンターの建設は、今年世界の高性能メモリの約70%を消費する見込みで、クラウド大手は数年先の生産を契約で押さえている。彼らは文字通り、まだ製造されていないチップを購入している。Micronは消費者向けのCrucialブランドを停止して、すべてをAI市場に向けるほどだった。

少し考えてみてほしい。プライベートなローカルモデルを魅力的にするブームが、ほとんどの人にとって適切にモデルを動かすハードウェアの価格を押し上げているのだ。もし自分の財布の問題でなければ、もっと面白かっただろう。

最初はソフトウェアのせいにした

その事実を受け入れる前に、私は単に間違ったツールを選んだのだと思っていた。そこでハーネスを探しに行った。LLMが脳なら、ハーネスはそれに手を与えるものだ——実際に役立つツール:Pi、OpenCode、Hermes。それぞれがローカルAIを成功させるものだと約束していた。

私はPiを選んだ。機能のためではなく、単にモデルが最も良く動作したからだ。回答が速く、私と質問の間の摩擦が少なかった。しかし買い物を通じて学んだのは、ラッパーが必ずしもボトルネックではないということだ。どんなに取り替えても同じ壁にぶつかる。壁はモデルとそれを支えるメモリだった。インターフェースは、考える余地のないモデルを修正できない。

だから私は、間違えると大きな損失につながるような場面で、実行できるローカルモデルを十分に信頼できない状態にある。素早い言い換えや使い捨ての質問なら問題ない。しかしタスクに本当の判断が必要になると、私は決める前にクラウドに戻ってしまう。私は有料アシスタントへの依存をやめたかった。法外に高価だからではなく、クラウド企業とその気まぐれや障害から独立したかったからだ。トークンは現在大幅に補助金が出ているため、これらのより強力なモデルは、いずれ私にとって手が届かなくなるだろう。

私のローカルAIが実際に役立つこと

すべてが悪いニュースというわけではない。ローカルモデルが頻繁に、そしてうまくこなす仕事の一つに、求人広告の分析がある。

私の求職活動はバックグラウンドのバッチ処理として行われている。スクリプトが求人情報を取得し、明らかに不要なものを除外し、残りをノートPC上のモデルに渡す。モデルは私が書いた要件と各求人を比較し、どの程度適合するかを教えてくれる。無料でオフライン。私の履歴書がマシンの外に出ることはなく、クラウドでAIの障害が起きていても動作する。私は追い求めていた独立性の少しを実現できた。ただし、期待していたよりもはるかに小さな範囲で。

これが機能するのは、新しいモデルの構築方法のおかげだ。私が使用しているGemmaはmixture-of-experts設計で、平易に言うと、質問が必要とする部分だけを起動し、全体を一度に起動するわけではない。私のハードウェアで実際に推論でき、遅延もなく、1つの広告あたり約30秒かかる。一日中動作させながら他の作業をするには、30秒は問題にならない。

だから、まだ

私はローカルAIを見限っていない。望んでいたものと、24GBと厳しいメモリ市場が今日与えてくれるものの間の距離に苛立っている。しかしmixture-of-expertsの工夫はすでにそのラインを一度動かしたし、また動くことを期待している。モデルは単に大きくなるだけでなく、ギガバイトあたりの賢さも増し続け、価格はいずれ落ち着くだろう。そして数年後の私は、これらすべてをローカルで、何も考えずに実行しているかもしれない。今のところ、私のハードウェアで動作しているワークフローは1つだけで、他のすべてはまだクラウドに依存している。その1つは完全に私のものだ。それは始まりだ。