La 可觀測性已從一個冷門技術話題發展成為一個策略支柱。 對於任何依賴軟體的組織(實際上幾乎所有組織都是如此)而言,僅僅「監控伺服器」或查看孤立的儀表板已經遠遠不夠了。企業需要即時了解系統內部的運作狀況,將這些數據與業務連結起來,並在出現問題時迅速做出反應。更重要的是,他們必須在一個日益軟體驅動的環境中完成這一切。 智能體人工智慧、開放標準與分散式架構.
在這種情況下,趨勢顯然是朝著…的方向發展。 更開放的可觀測性,與業務成果更緊密地聯繫在一起,並且自主性更強。OpenTelemetry 正逐漸成為遙測領域的通用語言,人工智慧正從實驗階段走向應用階段,並融入可觀測性平台的核心,而 IT 維運團隊正在轉型為智慧系統的協調者,這些系統能夠自主檢測、分析甚至糾正問題。讓我們來深入探討這項變革的發生機制,以及它對技術、業務、安全和資料治理的影響。
從經典監測到可觀測性時代
從…演變 從傳統監測到現代可觀測性 這可以追溯到很久以前。當像 Lew Cirne 開發的 New Relic 這樣的開創性 APM 工具出現時,最大的新聞莫過於能夠詳細查看單體應用在公司自有資料中心中的程式碼運作情況。這可謂是一場革命:團隊第一次能夠以極高的粒度觀察生產應用的效能。
隨著的到來 雲端運算、微服務、容器、無伺服器運算以及 DevOps 和 SRE 實踐格局已徹底改變。從單體系統到分散式系統的轉變意味著,僅憑時間點的可見度已遠遠不夠。服務不再是單一應用程序,而是一群短暫的微服務,它們在 Kubernetes 等平台上進行編排,每天部署數十次,並運行在包含多個雲端供應商的混合基礎設施上。
在這種環境下,傳統的監控方式,也就是專注於預先定義的指標和靜態警報,就顯得力不從心了。 可觀測性引入了一種不同的方法:收集和關聯指標、日誌、追蹤和事件。 從系統的外部輸出推斷其內部狀態。這不僅是知道發生了什麼故障,而是要理解故障發生的原因以及它對使用者和業務的影響。
作者喜歡 尤里·什庫羅 這個差異可以概括為:監測衡量的是預先決定的重要指標,而可觀測性則允許你在沒有預先準備好所有指標的情況下,提出關於系統的新問題。換句話說, 可觀測性將遙測數據轉化為可操作的背景信息 用於開發、營運和業務。
這項轉變也受到一些非常具體因素的驅動: 快速創新的殘酷壓力越來越挑剔的客戶,稍有瑕疵就會放棄使用應用程式;種類繁多的技術和管理服務幾乎無窮無盡;以及不斷增長的… 整個軟體生命週期的自動化所有這些自動化功能也都是軟體,它們可能會故障,因此需要具備自身的可觀測性。
複雜性、風險和過多的工具:為什麼可觀測性至關重要

現代建築帶來了四大難題,使得… 可觀測性實際上是強制性的。 如果你想保持控制權:
首先, 複雜性急劇上升容器的生命週期可能只有幾分鐘甚至幾秒鐘,微服務一天內可以多次更新版本,元件數量更是倍增。曾經的單體應用變成了相互關聯的服務群集。維運團隊發現自己要處理數百上千個不斷變化的實體,其中許多並非他們自己開發的。
除此之外 風險明顯增加每天多次部署意味著不斷引入變更,也意味著可能需要回滾。敏捷實踐和持續交付增加了更多工具、管線和自動化流程,這些也需要考慮。快速檢測問題、識別根本原因並在幾分鐘內回滾或修復問題的能力,不再是可取的,而是必備的。
同時, 技能差距技術堆疊如此龐大,一個人根本無法精通資料庫、網路、API、安全、容器、編排平台和 CI/CD 工具。我們需要一些機制來幫助理解所有元件如何協同工作、彼此依賴,以及出現問題時應該從哪裡入手。如果沒有這種全域視角,在不同工具之間切換所浪費的時間將非常巨大。
而且,更糟的是,還會出現其他問題 工具氾濫或工具過剩技術堆疊的每一層通常都有各自的監控方案:資料庫監控、基礎設施監控、前端監控、日誌監控、追蹤監控…關聯這些方案之間的資料需要頻繁切換上下文、手動搜索,並且會延長故障解決時間。這與應用程式宕機、用戶投訴時的需求截然相反。
這一切的答案在於… 統一可觀測性平台 它收集所有相關的遙測數據,將其與產生這些數據的實體關聯起來,並允許任何團隊(開發、維運、安全性、業務)從單一位置探索和利用這些數據。這不僅包括績效指標,還包括業務事件和訊號,揭示每次事件的經濟影響。
OpenTelemetry 作為一種通用的可觀測性語言
最明顯的趨勢之一是整合 OpenTelemetry (OTel) 是一種開放的遙測標準它是一個開源框架,定義了 API、SDK 和元件,以統一的方式收集指標、日誌和追蹤信息,而無需依賴特定的可觀測性工具製造商。
預計未來幾年 企業要求與 OpenTelemetry 相容 對供應商而言,原因很簡單:透過使用「通用語言」來描述遙測數據,組織可以切換可觀測性平台,而無需重寫或重新配置所有程式碼。這降低了供應商鎖定風險,並提供了根據需要擴展技術堆疊的靈活性。
與完全專有的解決方案(其中每次新的整合都取決於製造商的路線圖)不同,OTel 它使整合方案能夠經得起技術變革的考驗。隨著新的雲端服務、框架或運行時的出現,它們只需要以標準格式發出遙測數據,就可以將其發送到任何相容的後端。
此外,使用 OpenTelemetry 是關鍵。 正確地為人工智慧提供訊息無論是傳統機器學習、異常檢測還是生成式人工智慧,人工智慧模型在資料乾淨、結構化且一致的情況下都能發揮最佳效能。 OTel 正好提供了一個統一的框架,用於產生和標記演算法隨後將要處理的遙測資料。
近期研究表明 已經使用 OpenTelemetry 的組織即使僅部分實施,他們也認為這對收入成長、營業利潤率提升和品牌聲譽等指標產生了正面影響。這並非魔法:擁有一個一致且可移植的可觀測性基礎,就能更容易地在問題影響客戶之前發現它們,並優化關鍵服務的效能。
現代可觀測性實踐的三大支柱
除了採用像OTel這樣的標準之外,健全的可觀測性實踐還依賴 三個相互加強的基本組成部分:開放式儀器、連接實體(或資料)和可程式性。
La 開放式儀器 這涉及到從專有代理和開源代理程式收集遙測資料。應用程式、服務、主機、容器、無伺服器函數、行動應用程式、託管雲端服務——所有服務都必須能夠以標準化的格式發出指標、事件、日誌和追蹤資訊。傳統供應商的代理商以及來自 OpenTelemetry 和其他開源專案的導出器和函式庫都發揮著重要作用。
第二個區塊是… 關聯實體和元數據僅僅收集指標和日誌是不夠的;你需要了解是誰產生了這些數據,以及它們之間是如何關聯的。這需要識別服務、資料庫、佇列、函數、Pod、叢集、雲端帳戶,並關聯它們的遙測資料和相依性。有了這些訊息,平台就可以自動產生架構圖、呼叫流程和事件時間線,而無需團隊手動配置所有內容。
基於此,可以應用 情報和高級分析透過識別資料集中的模式、異常和關聯性,可觀測性平台可以幫助確定警報優先順序、減少雜訊、偵測複雜事件並加速根本原因分析。這是實現日益主動的可觀測性的自然路徑,正如我們稍後將看到的,也是實現智能體自主性的必經之路。
最後是 可程式性每個企業都有其特定的需求:不同的關鍵績效指標 (KPI)、不同的關鍵流程和獨特的成本模型。現代化的可觀測性平台必須能夠基於所有遙測資料建立自訂應用程式和視圖:例如,將技術資料與業務指標結合的儀表板、對故障或效能下降進行經濟影響分析,或根據公司工作流程調查複雜事件的內部應用程式。
這種基於可觀測性資料進行「編程」的能力,為以下應用場景打開了大門: 量化錯誤所造成的實際成本 在支付過程中,將其與技術原因聯繫起來(例如,結帳微服務中的回歸),從而根據純粹的經濟影響標準優先考慮糾正措施。
以業務為導向的可觀測性:從控制台到結果
預計的主要變革之一是從一種轉變 可觀測性著重於技術操作 轉變為另一種明顯以業務為導向的方式。同樣的數據——日誌、追蹤資訊、指標、事件——不僅用於維護基礎設施,還用於… 回答有關收入、成本和使用者體驗的關鍵問題.
例如,在工業領域,物聯網感測器的可觀測性使得… 預見機械故障 並優化維護計畫。如果偵測到異常振動模式或超出範圍的溫度,可以在生產線停機前安排幹預措施,從而防止計劃外停機及其造成的經濟損失。
在金融領域,即時分析 交易日誌 它有助於識別可能與詐欺相關的可疑交易。當系統偵測到異常事件序列、不尋常的地理位置或金額與常規模式不符時,它可以在攻擊得逞之前觸發自動阻止機製或人工審核。
在行銷和銷售中,相關性 帶有行銷活動指標的應用程式跟踪 它能幫助您回答一些非常直接的問題:網站延遲是否會影響點擊率或轉換率?哪個版本的功能最能改善導航和使用者停留時間?如果在行銷活動期間效果下降,可觀測性有助於確定損失了多少潛在銷售機會,以及問題究竟發生在銷售漏斗的哪個階段。
所有這些都涉及將技術遙測數據轉化為 為企業領導者提供可操作的知識關鍵不在於向銷售總監展示CPU圖表,而是向他們展示有多少交易因服務降級而失敗,以及預估成本是多少。為了實現這一點,可觀測性必須將技術資料、使用者事件和業務指標整合到同一個模型中。
像Nettaro這樣專門從事可觀測性諮詢的公司,開始幫助企業和機構實現以下目標: 要實現從純粹的營運願景到策略願景的飛躍設計將業務KPI與即時遙測訊號連結的模型。
從AIOps到代理可觀測性
通過 人工智慧在可觀測性平台的應用 這已經成為現實。大多數IT維運團隊已經將AIOps元件(用於分析大量營運資料以偵測異常、分組事件或預測問題的演算法)整合到他們的工作流程中。
在許多情況下,它也正在被整合。 生成式人工智能 使用自然語言與遙測資料互動:提出類似「為什麼 20 分鐘前歐洲的錯誤數量增加了 500 個?」這樣的對話式問題,並根據日誌、指標和追蹤結果獲得解釋,而無需構建複雜的查詢。
然而,如今大多數決策都基於人工智慧。 它們會繼續接受人們的審查。演算法有助於過濾噪音並識別潛在原因,但維運團隊仍需保持控制權,驗證建議並手動執行許多補救措施。人們對自動化決策的完全信任仍然有限。
這就是 智能體可觀測性在這種方法中,人工智慧代理扮演著更自主的角色:它們不僅能夠偵測模式並解釋正在發生的事情,而且還能夠 他們管理完整的工作流程從發現故障到實施適當的解決方案。
在這個模型中,代理可以偵測關鍵服務延遲的異常增加,將其與特定部署關聯起來,檢查類似事件的歷史記錄,並自行決定是否需要採取行動。 啟動回滾、擴充容量或套用替代配置所有這些都會被詳細記錄下來,以便進行審計和可能的後續人工審核。
目前,只有少數公司使用這種方法。 主動代理可觀測性它具備自動修復和高階問題預測功能。但預測顯示,在IT團隊追求更高生產力以及減少重複性維護任務耗時的需求推動下,其應用將顯著成長。
人工監督的限制和自主性的必要性
如果我們檢視一些極端案例,例如…,就能更理解對自僱代理人的需求。 大型語言模型可觀測性(LLM)手動監控這類系統幾乎是不可能的:資料量龐大,架構結合了多個分散式元件,而且需要持續進行即時監控。
大量的記錄和指標使其成為 手動識別問題非常緩慢任何未能及時發現行為變化、錯誤增加或回應品質下降的情況,都可能對生產環境造成嚴重後果,包括使用者體驗、聲譽和合規性方面。
此外,人工觀察會消耗大量人力資源; 容易出錯且擴展性差 隨著模型、實例或與業務應用程式的整合數量的增加,在少數使用者試點中可能行之有效的方法,在系統推廣到整個組織時可能會成為瓶頸。
因此,在諸如涉及LLM或高度分散式架構等複雜環境中,需要 自主可觀測性解決方案我們所說的系統能夠持續分析遙測數據,檢測偏差,提出或執行糾正措施,並從每次幹預中學習,從而隨著時間的推移提高其有效性。
視覺動作代理程式和介面自動化
人工智慧的進步並不限於「經典」可觀測性領域。像英偉達這樣的公司所進行的研究,以及諸如以下項目: 氮 它正在推動結合視覺和行動能力的模型:智能體觀察螢幕,推斷環境狀態,並決定下一步該做什麼,而無需與它們所控制的系統進行特定的整合。
從技術上講,這涉及訓練一個模型。 大量的遊戲或互動視訊語料庫 這樣他們就能學會將所見與專家會採取的行動連結起來。他們研究時間序列、運動離散化、長期目標,並在延遲或穩定性等多種限制下進行最佳化。
雖然最明顯的例子是遊戲,但這種視覺行動方法在商業領域具有巨大的潛力:它能夠創造… 在圖形介面上運行的代理 無需特定 API 即可進行常規操作、導航複雜應用程式、運行重複流程、驗證流程或執行端對端測試。
這代表了傳統RPA向一種自然演進的過程。 更聰明、更具情境性的自動化典型的應用案例包括模擬真實用戶行為的自動化軟體測試、逐次點擊模擬員工操作的引導式支援、用於品質保證的合成資料生成,或在企業系統中複製人類活動的「數位孿生」。
為了讓這一切可行, 網路安全、治理和可觀測性的穩健框架與關鍵介面和系統互動的代理必須遵守存取策略,避免危險操作,記錄每一步操作以供審計,並在明確定義的邊界內運作。可觀測性在此既扮演著「黑箱」的角色,也扮演著「工具箱」的角色:它記錄代理人的行為,並提供資料來校準和改進其行為。
人工智慧代理時代的安全、治理與零信任
智能體人工智慧和自主系統的擴展帶來了以下方面: 必須謹慎管理的新風險其中最受關注的問題之一是所謂的「影子人工智慧」:在組織官方管道之外啟動的代理、模型或集成,缺乏足夠的安全或監管合規控制。
此外,還存在以下危險: 雙重間諜或惡意代理人這種情況可能是人為設計的(外部攻擊、提示符號篡改、指令注入),也可能是由於配置錯誤導致原本良好的系統執行了非預期操作。為了最大限度地降低這些風險,應用以下原則至關重要: 零信任,尤其是在人工智慧領域.
在此背景下,零信任意味著 預設情況下,任何人工智慧代理或元件都不被認為是「可靠的」。所有操作都必須明確授權,權限必須限制在最低必要範圍內(最小權限原則),所有互動都必須記錄以供後續審計。因此,可觀測性成為人工智慧治理的關鍵要素。
良好的可觀測性能夠即時監控代理的行為,檢測異常行為,驗證存取策略,並在發生事件時提供完整的證據。諸如允許操作清單、關鍵循環的人工審核、敏感資料脫敏以及對運算位置(本地、公有雲、主權雲)的控制等工具,都是健全檢查清單中不可或缺的要素。 有效的AI治理.
在這種情況下,找到……至關重要。 創新與控制之間的平衡各組織希望充分利用智慧人工智慧的潛力來提高生產力和競爭力,但又不希望犧牲自動化決策的安全性、合規性或透明度。
數據、基礎設施和人工智慧是企業的基礎層。
從宏觀角度來看,人工智慧正在從一種輔助工具演變為自身。 經濟競爭力所依據的結構層一切都圍繞著這項轉型:數據策略、雲端架構、硬體設計、勞動力模式,甚至是國家數位基礎設施政策。
一方面, 數據整合是主要的競爭優勢。隨著計算和建模日益商品化,擁有高品質、管理良好的自有資料才是關鍵所在。透過捕捉豐富且具有上下文關聯的遙測數據,可觀測性已成為最有價值的數據來源之一。 電力人工智慧系統 並改進流程。
另一方面, 人工智慧基礎設施正逐漸被視為一項戰略性國家資產。主權雲的興起是為了滿足控制敏感資料儲存和處理地點、模型訓練方式以及運行監管框架的需求。各國正投資建置針對人工智慧工作負載優化、節能高效且符合合規要求的資料中心。
這一切都與…相吻合 加速資料中心現代化由於人工智慧工作負載和代理系統對能源和冷卻的需求不斷增長,能源效率不再只是一個營運問題,而是成為了創新的限制因素和環境合規要求。
同時,公司也被迫… 對其員工進行再培訓目標不是讓每個人都成為程式設計師,而是培養能夠協調和利用這些自主系統的專業人員:人工智慧驅動的業務專家、能夠將營運需求轉化為可觀察性和安全策略的工程師,以及了解決策的技術和經濟影響的混合人才。
綜上所述,這種演變導致了這樣一種局面: 更開放和自主的可觀測性 它成為連接技術、商業和監管的紐帶:OpenTelemetry 等標準保證了數據的可移植性和質量,人工智慧和代理可觀測性降低了運營複雜性並加快了事件響應,而治理和零信任實踐確保所有這一切都在可控、安全且可審計的條件下進行。
能夠將標準化遙測、統一平台、專注於業務成果以及具有良好可觀測性的 AI 代理結合起來的組織,將最有能力在數位系統日益重要、複雜和自主的環境中競爭,但當以適當的可見性進行管理時,這些系統也更有能力創造切實價值。