Site Reliability Engineering (SRE), yazılım mühendisliği prensiplerini altyapı ve operasyonlara uygular. Bu rehber Hizmet Seviyesi Hedeflerini (SLO), Hizmet Seviyesi Göstergelerini (SLI), Hata Bütçelerini ve özellik sürüm hızı ile sistem kararlılığı arasındaki operasyonel dengeyi ele alır.
1. SRE Matematiksel Temeli: SLI, SLO & Hata Bütçesi
Modern SRE yaklaşımında %100 kesintisizlik neredeyse hiçbir zaman hedef değildir—ekonomik olarak imkansızdır ve inovasyon hızını boğar:
- SLI (Hizmet Seviyesi Göstergesi): Servis performansının ölçülebilir bir metriğidir (örn. başarılı HTTP 200 yanıtları / toplam istekler).
- SLO (Hizmet Seviyesi Hedefi): Mühendislik ve ürün ekiplerinin üzerinde anlaştığı güvenilirlik hedefidir (örn. 30 günlük kayan pencerede isteklerin %99.9'unun < 200ms olması).
- Error Budget (Hata Bütçesi): İzin verilen güvenilmezlik payıdır (%100 - SLO). %99.9 SLO için bütçe isteklerin %0.1'i veya ayda yaklaşık 43 dakikalık kesintidir. Hata Bütçesi tükendiğinde, kritik olmayan özellik dağıtımları dondurulur ve tüm mühendislik kapasitesi güvenilirlik güçlendirmesine odaklanır.
