Who the F*** Am I?

嗨,我是 Daniel Flores。一名軟體開發者,我相信有七年專業經驗。

這是一段狂野的旅程——至少過去三年是如此。我可能是最早在預覽階段就實際嘗試 GitHub Copilot 的人之一,大概是在 2021 或 2022 年左右。我當時完全被它驚艷到,但它確實非常、非常粗糙。

不過,沒有人認識我。我從未打算成為公眾人物,或是那種「知道 AI 應該走向何方」的人。那不是我,這也沒關係。我一直在旁觀這個新典範的演進——以及退化。


What I Think About LLMs and "AI"

我已經看了好幾年關於這個主題的影片。演化模擬器、學習演算法,以及一個被訓練來玩躲貓貓的模型——當我發現那段影片來自 OpenAI 本身時,我完全驚呆了。

我不是建構模型或 LLM 的專家。我沒有博士學位。我只是這些年來一直做自己的事,觀察哪些工具被採用、哪些工具很爛。而且我必須說:這個產業根本不知道到底發生了什麼事。我也不知道。沒有人知道,而這正是我最討厭的地方。

LLM 非常有用。它們可以幫你省下大量工作時間。但這只是故事的一半。


So What's the Issue?

幾乎所有人——大多是有酬的 AI 代言人——都在告訴你:「如果你不使用這些工具,你就落後了!!」

他們試圖把整個產業推入一種害怕錯過(FOMO)的狀態。

讓我分享我對這種完全無關緊要的恐懼的個人經驗。

如果你已經有足夠的經驗——如果你已經知道 LLM 是什麼,並且能提示它去做或重構某些東西——你並沒有錯過什麼。就是這樣。

我來解釋我的意思。我之前在使用舊版 GitHub Copilot 時遇到的完全相同的問題——我甚至不知道它執行的是哪個模型,可能是一個客製化的 GPT——在今天最新的前沿模型中,仍然成立

它們都會產生幻覺。它們看似理解自己在做什麼,直到它們不理解為止。而且如果沒有人類在迴路中捕捉錯誤,錯誤就會在整個代理鏈中累積。

對於已經嘗試過每種代理迴路、每個 CLI、每種本地和 API 託管模型的資深開發者來說,這是舊聞。它們都共享相同的根本行為。它們不完全是「錯誤」——LLM 只是在向你展示最可能的下一個 token——但你懂我的意思。


But You Should Still Be Scared

我感到害怕——但不是害怕錯過 LLM 或科技。我已經知道這些系統的極限,或者至少我相信我知道。我一直在學習如何用它們建構更有效率的工具。我現在正在使用小米(Xiaomi)的 MiMo v2.5 模型。對於一般的氛圍程式設計師來說,這個模型絕對是垃圾。但對於資深開發者來說,它非常棒而且極其便宜。

我害怕的是產業的未來:工作機會、我們出售知識的方式。

我目前採取新的立場。我的履歷申請明確指出,我的 LLM 輔助方法會 100% 審查所有產生的程式碼。但這不夠吸引人。這不是標準作法。我確信這就是為什麼沒有人打電話給我。這部分是我的錯——我可能可以用更好的措辭來推銷我的技能——但這不是真正的重點。

大家給你的標準建議是:「學會使用這些技能、工具,掌握新事物。」直到下一個東西被釋出。喔,但他們不會在你花自己的時間和金錢測試它時幫你付帳單。他們當然不會。

我並不害怕學習新東西或嘗試下一個模型,因為大多數模型只是在自主性或解決描述不清的問題方面稍微好一點。

我害怕的是產業想要快速走向下一個模型、下一個、下一個——而且不管建立新模型有多昂貴。他們就是不會慢下來。

新模型每天都在被釋出。但沒有一個標準伴隨它們。氛圍程式設計已經進入公司,我真的希望沒有哪家瘋狂的組織會讓未經審查的氛圍程式設計軟體碰觸心律調節器或嵌入式控制系統。


The Real Problem: Drift

我知道——而且很多人也知道——這些 token 賭博機是不完美的。但它們有用。然而,它們有缺陷。

我已經嘗試過很多實驗性的工作流程和方法。規格驅動開發——我試過了。它有效,某種程度上。但當模型決定漂移時,它就會漂移。

不管規格寫得多好。模型想漂移時就會漂移。而且如果你不審查原始碼本身——即使在最關鍵的步驟、在最終輸出時——它仍然可能決定漂移。這種漂移不只是意味著寫一個小 bug 或錯誤的邏輯。它也可能意味著模型決定呼叫子代理,對為什麼某個函式應該存在進行極其全面且浪費的研究。這只是一個例子。

當模型漂移時,影響可能從微不足道到致命

人類也會漂移。我們很懶。而且老實說,大多數時候,LLM 在純技術層面上比我更擅長編碼。但我有自我——我在乎工作。LLM 不會。它是一台賭博機。它無法自己做決定。

我們可以做決定。


What I Truly Believe

我不是說所有程式碼都必須 100% 審查。但我堅信:

  1. 所有單元測試、整合測試和端對端測試都應該 100% 由人類審查。即使測試很難理解,也要讓代理重構它們,直到你的大腦真的能吸收它們。如果你無法理解測試,你就無法信任測試。

  2. 任何系統中最關鍵的部分都必須 100% 審查——每一行。我不想失去對人類的希望,如果某塊氛圍程式設計的爛程式碼碰觸到關鍵系統並導致人員傷亡。(截至目前,我還沒有調查是否已經發生,但我相信這已經很有可能發生了)。


Conclusion: You're Not Falling Behind

讓我清楚地說:你並沒有落後。

我承認,產業正在快速轉變。但沒有人——我的意思是沒有人——知道他們到底在做什麼。不是我,不是建構模型的公司,也絕對不是那些賣你課程的人。他們也不知道。他們也一無所知。這一切都太新了。

沒有人真正在以 99% 的準確率、效能和效率使用 LLM。這個星球上沒有一個人。如果有人告訴你不是這樣,要嘛是為了賣東西在撒謊,要嘛是在自欺欺人。

每隔幾個月,就會有人賣給你最新的課程、最新的工作流程、最新的「讓你產出提高 10 倍的一招」。而當它變成「過時」時,你會認為是因為有更好的東西出現了。但那不是發生的事。它之所以過時,是因為它從一開始就沒有效

模型改變了。API 改變了。炒作轉移了。而你手上拿著的是一門關於已經不存在的工具的課程。

所以我的建議是:停止追逐。學習基礎知識。了解這些工具實際上能做什麼,以及它們實際上不能做什麼。建立你自己的判斷。這種技能——知道什麼時候該信任輸出、什麼時候該丟棄——永遠不會過時。

炒作循環會持續旋轉。讓它繼續吧。你並沒有落後。

你可以幫自己一個忙,開始使用 Pi Coding Agent,它是一個很好的開源工具。或者任何你喜歡的其他開源代理工具,opencode 也是一個不錯的選擇。就這麼做,開始用它實驗,不需要下載技能,不需要任何那些東西……只要試著調查原始 LLM 能做什麼,然後從那裡擴展。

注意:順便一提,你可能已經注意到,是的,我使用了一個模型來修正這篇文章,MiMo v2.5。我不知道它是否真的修正好了,但我相信它做得不錯,它保留了我大部分的個人風格。它甚至在我的原始草稿中到處添加了它最喜歡的破折號。沒關係,我今天就讓它過關吧。