Cover image for The Reliability Roadmap: A 90-Day Plan for New SRE Teams

Samson Tanimawo

貴公司新成立 SRE 團隊?這是我曾兩度使用的 90 天計畫。它之所以有效,是因為平衡了「立即展現價值」與「長期建置」兩者之間的關係。

第 1-14 天:觀察

克制想改變現狀的衝動。先觀察現有系統、閱讀既有的事後檢討報告、跟著值班,與工程師聊聊他們遇到的痛點。

產出:一份依「每週工程師耗時」排序的前 5 大可靠性問題清單。

第 15-30 天:快速勝利

從清單中挑選前 2 項問題並加以解決。讓這些改善成果能被看見——在全工程師大會上公佈。

好的快速勝利:刪除不穩定的告警、自動化重複性的操作手冊、修復大家抱怨的破損儀表板。

壞的快速勝利:重寫部署流程。太龐大,單獨就要花 90 天。

產出:可見的可靠性改善 + 工程團隊的信任。

第 31-60 天:基礎建置

現在運用你已建立的信任,導入這些基礎工作:

  • 為前 3 個關鍵服務定義 SLO
  • 建立錯誤預算儀表板
  • 設立每週可靠性檢討會議(10 分鐘,而非一小時)
  • 撰寫事件回應操作手冊模板

產出:工程團隊可凝聚的、可衡量的可靠性目標。

第 61-90 天:程序化變革

開始將可靠性工作轉化為持續性的程序:

  • 附帶行動項目追蹤的事後檢討流程
  • 每月 toil 調查(本月工程師做了哪些本可自動化的事?)
  • 與領導層的季度可靠性檢討
  • 明確的交接流程:可靠性工作何時應轉由產品工程團隊負責?

產出:即使你休假,流程仍能持續運作。

陷阱

「沒問題,我們一週就能全部做完。」你做不到。凡是試過的團隊,不是精疲力盡就是招致反感。90 天是最短時間,更長很正常。

真正目標

到了第 91 天,工程團隊應該能用一句話描述你團隊的價值。如果他們做不到,就表示你 90 天做錯事了。


作者:Dr. Samson Tanimawo
BSc · MSc · MBA · PhD
Nova AI Ops 創辦人兼執行長。https://novaaiops.com