破界-迭代-內(nèi)生 阿里云網(wǎng)絡(luò)穩(wěn)定性進(jìn)化之道_第1頁
破界-迭代-內(nèi)生 阿里云網(wǎng)絡(luò)穩(wěn)定性進(jìn)化之道_第2頁
破界-迭代-內(nèi)生 阿里云網(wǎng)絡(luò)穩(wěn)定性進(jìn)化之道_第3頁
破界-迭代-內(nèi)生 阿里云網(wǎng)絡(luò)穩(wěn)定性進(jìn)化之道_第4頁
破界-迭代-內(nèi)生 阿里云網(wǎng)絡(luò)穩(wěn)定性進(jìn)化之道_第5頁
已閱讀5頁,還剩6頁未讀, 繼續(xù)免費(fèi)閱讀

付費(fèi)下載

下載本文檔

版權(quán)說明:本文檔由用戶提供并上傳,收益歸屬內(nèi)容提供方,若內(nèi)容存在侵權(quán),請進(jìn)行舉報(bào)或認(rèn)領(lǐng)

文檔簡介

阿里云網(wǎng)絡(luò)穩(wěn)定性進(jìn)化之道蓋鏡源阿里云智能集團(tuán)高級產(chǎn)品解決方案架構(gòu)師破界-迭代-內(nèi)生BreakingBoundaries-Iteration-Endogenous

Growth本演講的主旨匯報(bào)

阿里云網(wǎng)絡(luò)穩(wěn)定性工程實(shí)踐,啟迪

云時(shí)代網(wǎng)絡(luò)穩(wěn)定性新范式建設(shè)。破界:傳統(tǒng)網(wǎng)絡(luò)穩(wěn)定性模型的局限公共云的特殊性打破傳統(tǒng)邊界傳統(tǒng)穩(wěn)定性-容災(zāi)思想設(shè)計(jì)并行路徑:多鏈路/多板卡/多設(shè)備/多廠商/多機(jī)房等故障檢測感知:光路檢測、健康檢查、BFD探測等故障快速恢復(fù):路徑切換、主備倒換、設(shè)備替換等公共云的特殊性海量租戶:需要軟件Overlay做大租戶規(guī)模,系統(tǒng)龐大、變更頻繁資源共享:鄰居租戶共享同一套物理資源,租戶間突發(fā)任務(wù)干擾云網(wǎng)絡(luò)穩(wěn)定性新挑戰(zhàn)微突發(fā)流量導(dǎo)致的性能抖動,多租戶環(huán)境下的QoS保障軟件處理網(wǎng)絡(luò)轉(zhuǎn)發(fā),租戶網(wǎng)絡(luò)的確定性性能龐大軟件系統(tǒng),駕馭與變更管理迭代:云網(wǎng)絡(luò)穩(wěn)定性建設(shè)新范式被動響應(yīng)到內(nèi)生主動防御的思路、體系、技術(shù)“不要出問題”

→“控制問題影響”并獲得“免疫力”“故障后容災(zāi)”

→“風(fēng)險(xiǎn)提前暴露”并修復(fù)3.

"人治"

"自治"核心思路轉(zhuǎn)變?nèi)珬W匝?、自主可控主動式故障域隔離打破控制面局限確定性的變更管理Fail-Ops的工程實(shí)踐使用主動防御技術(shù)3個(gè)階段:面向失敗的架構(gòu)設(shè)計(jì)、可觀測與應(yīng)急恢復(fù)3個(gè)維度:平臺建設(shè)(標(biāo)準(zhǔn))、

運(yùn)營流程(約束)、最佳實(shí)踐(執(zhí)行)構(gòu)建新的體系自身可演進(jìn)、可驗(yàn)證、可迭代精準(zhǔn)定位01

破除任何"黑盒"依賴內(nèi)生1:全棧自研的穩(wěn)定性紅利自主可控的核心技術(shù)02

創(chuàng)新更契合的穩(wěn)定性技術(shù)ZooRouteNetExpress

ZooNet03

“問題-修復(fù)-沉淀”快速閉環(huán)“一次故障,獲得免疫"隔離:一個(gè)獨(dú)立功能組件只在一個(gè)可用區(qū)內(nèi)完成服務(wù),避免其他可用區(qū)故障影響可靠:相同功能的組件在多個(gè)可用區(qū)部署副本,當(dāng)一個(gè)可用區(qū)故障后其他可用區(qū)組件副本接管服務(wù)基于可用區(qū)的單元化部署服務(wù)用戶多、資源規(guī)模大的組件,按某種維度(比如實(shí)例id)拆分成多個(gè)獨(dú)立子實(shí)例每個(gè)子實(shí)例僅服務(wù)一部分用戶,彼此之間無共享、無干擾,縮小故障范圍、縮短故障平均修復(fù)時(shí)間實(shí)例水平拆分將服務(wù)隨機(jī)映射到多個(gè)子實(shí)例,確保不同租戶故障域組合差異化單子實(shí)例故障時(shí),受影響租戶隨機(jī)且稀疏分布“規(guī)模免疫”:系統(tǒng)越大,個(gè)體租戶受故障影響的概率越低隨機(jī)化打散Shuffle

Sharding在保留彈性與共享的前提下,通過主動式故障域隔離,控制爆炸半徑,實(shí)現(xiàn)“既共享又安全”的目標(biāo)控制故障爆炸半徑內(nèi)生2:主動式故障域隔離與爆炸半徑控制縮小故障影響范圍內(nèi)生3:打破控制面局限使用資源預(yù)留、數(shù)據(jù)面收斂、恒定負(fù)載和靜態(tài)穩(wěn)定性優(yōu)化的關(guān)鍵策略優(yōu)先數(shù)據(jù)面收斂故障:500ms~3s生效關(guān)鍵資源預(yù)留:

控制面關(guān)鍵服務(wù)部署時(shí)必須有足夠的資源預(yù)留,不依賴彈性保持控制面負(fù)載恒定:通過隊(duì)列限速、緩存、調(diào)度等機(jī)制靜態(tài)穩(wěn)定:控制平面組件失聯(lián)時(shí),轉(zhuǎn)發(fā)組件保持最后狀態(tài)繼續(xù)工作控制面的局限性控制平面過載時(shí),無法及時(shí)響應(yīng)請求資源不足時(shí),無法實(shí)現(xiàn)彈性擴(kuò)容依賴外部服務(wù),外部服務(wù)可能會故障邏輯復(fù)雜、調(diào)用延遲、一致性校驗(yàn)等導(dǎo)致響應(yīng)時(shí)間長內(nèi)生4:確定性的變更管理對生產(chǎn)系統(tǒng)變更入口進(jìn)行管理,確保系統(tǒng)密閉性人工操作,效率很低Double

check

的機(jī)制,通常能做到99%的正確率白屏化基礎(chǔ)上,“變更編排→智能監(jiān)控→異常自動剎車”效率再次提升、有錯即停運(yùn)維控制臺上創(chuàng)建、執(zhí)行、分析,標(biāo)準(zhǔn)化效率、正確率更高權(quán)限管控,系統(tǒng)密閉性形成腳本調(diào)API,效率有提升Double

check

的機(jī)制,能做到99%的正確率內(nèi)生5:Fail-Ops工程實(shí)踐以破壞性為核心的測試,面向失敗的演進(jìn)線上演練大規(guī)模復(fù)雜系統(tǒng),單元測試/集成測試是不夠的在可控條件下,主動制造不可控的破壞、主動注入故障錘煉系統(tǒng)、面向失敗進(jìn)行學(xué)習(xí)和改進(jìn),固化到系統(tǒng)中事前評估與事后復(fù)盤事前:影響域分析與風(fēng)險(xiǎn)預(yù)判事后:聚焦"系統(tǒng)為何未能自動恢復(fù)"

把經(jīng)驗(yàn)"編碼"進(jìn)系統(tǒng)將故障教訓(xùn)轉(zhuǎn)化為可執(zhí)行、可復(fù)用、自動化的系統(tǒng)能力從"人治"向"自治"躍遷把之前發(fā)生的故障構(gòu)造成下一次演練的輸入重復(fù)故障注入結(jié)語曾經(jīng),我們用“容災(zāi)倒換”的思路守護(hù)著傳統(tǒng)網(wǎng)絡(luò)的平穩(wěn)運(yùn)行!現(xiàn)在,我們用“主動防御、經(jīng)驗(yàn)編碼、Fail-Ops”等先進(jìn)

溫馨提示

  • 1. 本站所有資源如無特殊說明,都需要本地電腦安裝OFFICE2007和PDF閱讀器。圖紙軟件為CAD,CAXA,PROE,UG,SolidWorks等.壓縮文件請下載最新的WinRAR軟件解壓。
  • 2. 本站的文檔不包含任何第三方提供的附件圖紙等,如果需要附件,請聯(lián)系上傳者。文件的所有權(quán)益歸上傳用戶所有。
  • 3. 本站RAR壓縮包中若帶圖紙,網(wǎng)頁內(nèi)容里面會有圖紙預(yù)覽,若沒有圖紙預(yù)覽就沒有圖紙。
  • 4. 未經(jīng)權(quán)益所有人同意不得將文件中的內(nèi)容挪作商業(yè)或盈利用途。
  • 5. 人人文庫網(wǎng)僅提供信息存儲空間,僅對用戶上傳內(nèi)容的表現(xiàn)方式做保護(hù)處理,對用戶上傳分享的文檔內(nèi)容本身不做任何修改或編輯,并不能對任何下載內(nèi)容負(fù)責(zé)。
  • 6. 下載文件中如有侵權(quán)或不適當(dāng)內(nèi)容,請與我們聯(lián)系,我們立即糾正。
  • 7. 本站不保證下載資源的準(zhǔn)確性、安全性和完整性, 同時(shí)也不承擔(dān)用戶因使用這些下載資源對自己和他人造成任何形式的傷害或損失。

最新文檔

評論

0/150

提交評論