台北萬豪的下午三點,窗外光線斜斜打進來,場內還在消化剛才的下午茶。

這是一場三家廠商聯合辦的技術 Seminar,主題是「AI 驅動的次世代數位體驗平台」。Datadog、Google Cloud、MongoDB,加上壓軸的 17LIVE 實戰分享——聽起來像是各說各話的產品介紹場,但坐完整場下來,卻有種意外的完整感。

三家公司講的其實是同一件事,只是從不同角落切入:你的 AI 應用要跑得穩、跑得久,光靠語言模型是不夠的。 可觀測性、資料架構、智慧應用,缺一塊都是跛腳。


第一棒 Datadog:你看不見的,就修不了

Datadog 的工程師開場沒有廢話,直接借用 Google SRE 的可靠性金字塔——最底層是 Monitoring,往上一路到 Product——然後丟出今天的核心命題:

可靠性是建立在可觀測性的基礎之上的。

聽起來像廢話,但往下展開就不是了。

他們描述了一個非常真實的客戶場景——某家跑在 GCP 上的 ToC AI 服務公司,GKE 跑核心服務、Serverless 處理 API、Vertex AI 負責 LLM、資料庫掛著 MongoDB Atlas。架構圖畫出來一看,標準現代雲原生,漂亮。

然後他們放出另一張圖。

那是一張蜘蛛網——Dev Team、Backend Team、Frontend Team、Ops Team 各自標在網的不同角落,中間是密密麻麻交叉的服務連線。每次使用者發出一個請求,那條路徑要穿過多少節點才能回來?出事的時候,到底是哪個線斷了?

你的監控看到的,只是這張網的一個小角落。

這就是問題所在。DBA 看到的是 MongoDB 出現慢查詢;SRE 看到的是某個 Pod 的 CPU 飆高;前端收到的是使用者說「頁面一直轉圈」。三組人看到三件不同的事,卻在描述同一個問題——只是沒有人知道。

排查就變成了人工拼圖。

Datadog 的解法分四塊:

Integrations 解決的是資料孤島問題。一千多種整合,GCP 就有 49 種原生服務,開箱即用的儀表板不需要工程師另外搭建。重點不只是「能看」,而是讓 Dev、Ops、DBA 站在同一個螢幕前說話,而不是各自拿著不同的工具互相翻譯。

Database Monitoring 直接深入 MongoDB 內部。Slow Queries、Top Operations、Explain Plan 全部自動呈現,甚至能找出那些「建立了但從來沒被用過的 Index」——這種事以前要靠 DBA 憑經驗感覺,現在系統直接列給你。更有趣的是,看不懂某個 Explain Plan 在做什麼的時候,可以直接請 AI 解讀,並建議要加哪些索引。

APM & RUM 是前後端那道割裂的縫隙終於被縫起來的地方。Demo 裡,從使用者點擊結帳按鈕的那一刻,一條追蹤線從前端穿過 API Gateway、後端服務群,一路追到第三方支付商的 API 拋出了 HTTP 403——全程在同一個畫面,原本可能在 war room 開三小時的問題,幾分鐘就找到了。

Bits AI SRE 則是今天最新的東西。一個 Payment API rate limited 的 Incident,Bits 自動收到警報、開始跑假設驗證(是 payment service 掛了?還是新版本部署出問題了?),七分鐘後給出結論:第三方支付商對 production egress IP 做了每分鐘一千次的 rate limiting,觸發了 403。還可以直接問它「我現在應該做什麼」,它會告訴你改哪個 file、把指令直接貼給你。

目標只有一個:讓剛進來的新人,也能獨立處理 Incident,不用每次都去拉那幾個資深工程師出來救火。