Skip to main content

> REHBER // TEMELLER

Site Reliability Engineering (SRE) İlkeleri & Hata Bütçesi Yönetimi

SLI'lar, SLO'lar, Hata Bütçeleri ve suçlamasız postmortem kültürü ile güvenilir dağıtık sistemler geliştirme.

Yönetici Özeti

Site Reliability Engineering (SRE), yazılım mühendisliği prensiplerini altyapı ve operasyonlara uygular. Bu rehber Hizmet Seviyesi Hedeflerini (SLO), Hizmet Seviyesi Göstergelerini (SLI), Hata Bütçelerini ve özellik sürüm hızı ile sistem kararlılığı arasındaki operasyonel dengeyi ele alır.

1. SRE Matematiksel Temeli: SLI, SLO & Hata Bütçesi

Modern SRE yaklaşımında %100 kesintisizlik neredeyse hiçbir zaman hedef değildir—ekonomik olarak imkansızdır ve inovasyon hızını boğar:

  • SLI (Hizmet Seviyesi Göstergesi): Servis performansının ölçülebilir bir metriğidir (örn. başarılı HTTP 200 yanıtları / toplam istekler).
  • SLO (Hizmet Seviyesi Hedefi): Mühendislik ve ürün ekiplerinin üzerinde anlaştığı güvenilirlik hedefidir (örn. 30 günlük kayan pencerede isteklerin %99.9'unun < 200ms olması).
  • Error Budget (Hata Bütçesi): İzin verilen güvenilmezlik payıdır (%100 - SLO). %99.9 SLO için bütçe isteklerin %0.1'i veya ayda yaklaşık 43 dakikalık kesintidir. Hata Bütçesi tükendiğinde, kritik olmayan özellik dağıtımları dondurulur ve tüm mühendislik kapasitesi güvenilirlik güçlendirmesine odaklanır.

Sıkça Sorulan Sorular

Mühendislik organizasyonu tükenen bir Hata Bütçesine nasıl yanıt vermelidir?

Yeni özellik dağıtımlarını durdurun, mühendislik sprintlerini teknik borç gidermeye yönlendirin ve güvenilirlik metrikleri hedef SLO seviyesine dönene kadar devre kesici mimarileri devreye alın.

Yapay Zeka Özeti

Site Reliability Engineering (SRE), yazılım mühendisliği prensiplerini altyapı ve operasyonlara uygular. Bu rehber Hizmet Seviyesi Hedeflerini (SLO), Hizmet Seviyesi Göstergelerini (SLI), Hata Bütçelerini ve özellik sürüm hızı ile sistem kararlılığı arasındaki operasyonel dengeyi ele alır.