Skip to main content

> kriz_masası_koordinatörü_(incident_commander)_ve_rol_dağıtım_protokolleri

Kriz Masası Koordinatörü (Incident Commander) ve Rol Dağıtım Protokolleri

Bir Kriz Masası Koordinatörü (Incident Commander), büyük bir kesintide bilişsel darboğaza düşmemek için Katip (Scribe), İletişim Lideri ve Operasyon Lideri rollerini nasıl delege eder?

Staff/Principal (L6+)

ÖZET VE TEKNİK CEVAP

Kritik üretim kesintilerinde (SEV-1/SEV-0) en tehlikeli hata, Kriz Masası Koordinatörünün (Incident Commander) terminale girip bizzat kod ve log debug etmeye çalışmasıdır; bu durum ekipler arası iletişimi koparır ve koordinasyonsuz rastgele müdahalelere yol açar. İtfaiye ve acil durum teşkilatlarından uyarlanan Incident Command System (ICS) metodolojisi, koordinatörün ASLA bizzat kod veya sunucuya dokunmamasını emreder. Koordinatör üstten resmi görür ve üç kritik rolü hemen delege eder: (1) Katip/Scribe (zaman çizelgesini, test edilen hipotezleri ve durumları canlı kaydeder), (2) İletişim Lideri (yönetim ve kamuoyu durum sayfası güncellemelerini yönetir), (3) Operasyon Lideri (teknik mühendislerin çalışmalarını koordine eder). Bu rol ayrımı MTTR süresini %40 düşürür ve kriz odasındaki kaosu bitirir.

Mühendislik El Kitabı & Mekanizma

1. Temel Çalışma Mekanizması

Kriz Yönetim Sistemi (ICS) katı bir operasyonel disiplin kurar: (1) Komuta Devri: İlk müdahale eden kişi, nöbetçi koordinatör `Komutayı devralıyorum` diyene kadar geçici IC olur. (2) Hipotez Süre Sınırı: IC mühendislere ucu açık deneme yaptırmaz; 10-15 dakikalık net hipotez testleri ve geri alma (rollback) şartı koyar. (3) İletişim Trafiği Kontrolü: İlgisiz yöneticileri susturur ve tüm soruları İletişim Liderine yönlendirir. (4) Önce Kurtar Doktrini: Yangın anında kök neden araştırmasını durdurur; önceliği trafiği kesme, sürüm geri alma veya feature flag kapatma gibi anlık rahatlatmaya verir.

2. Doğru Kullanım Senaryosu

Şirket gelirini, müşteri işlemlerini, veri bütünlüğünü veya sözleşmeli SLA sürelerini etkileyen tüm SEV-0 ve SEV-1 kritik canlı ortam kesintileri.

3. Prodüksiyon Arıza Modları

Koordinatörün veritabanı kilitleriyle uğraşırken 50 müşteri temsilcisinin kriz kanalına girip 'Ne zaman düzelir?' sorularıyla ortamı kilitlemesi; merkezi onay mekanizması olmadığı için iki farklı mühendisin aynı anda birbiriyle çelişen canlı yamalar (hotfix) çıkması.

4. Teşhis ve Telemetri Sinyalleri

Kriz ses kanalında 20 kişinin aynı anda konuşması ve kimin ne yaptığına dair kayıt olmaması; 2 saatlik kesintide hiçbir zaman damgalı not tutulmamış olması; hata oranı %100 iken mühendislerin chat'te mimari felsefe tartışması.

5. Önleme ve Mimari Bariyerler

Sertifikalı Kriz Masası Koordinatörleri yetiştirin; `/incident open SEV1` gibi komutlarla otomatik kriz kanalları ve doküman şablonları oluşturan botlar kurun; Statuspage ve üst yönetim için önceden onaylanmış bildirim şablonları hazırlayın.

6. Mimari Ödünleşimler (Trade-offs)

Katı hiyerarşik kriz yönetimi küçük ekiplere bürokratik gelebilir; ancak büyük kesintilerde bilişsel tükenmeyi ve çakışan müdahaleleri önlemenin kanıtlanmış tek yoludur.

Vaka İncelemesi (TinyCTO Örneği)

Büyük bir ödeme geçidi kesintisinde Mühendislikten Sorumlu Genel Müdür Yardımcısı kriz kanalına girip her 3 dakikada bir 'Ne zaman bitecek?' baskısı yapmaya başladı. Kriz Koordinatörü hemen devreye girdi, yöneticinin sesini kriz kanalında kapattı, bir Kıdemli Mühendisi İletişim Lideri yaparak yöneticileri ayrı bir `#incident-exec-updates` kanalında bilgilendirmesini sağladı ve bir Katip atadı. Yönetici baskısından kurtulan teknik ekip 8 dakikada DNS hatasını çözüp sistemi ayağa kaldırdı.

İnteraktif Konsept Alıştırmaları

2 Alıştırma
Q1

Bir SEV-1 kesintisi sırasında Kriz Masası Koordinatörünün (IC) uyması gereken en önemli kural nedir?

Koordinatör ASLA bizzat kod yazmamalı, terminale girmemeli ve teknik debug yapmamalıdır.
Q2

Kriz Yönetim Sistemi (ICS) altında delege edilen üç ana rol nedir?

Katip/Scribe (Zaman ve Not Kaydedici), İletişim Lideri (Paydaş Bilgilendirme) ve Operasyon Lideri (Teknik Müdahale).

Kriz Masası Koordinatörü (Incident Commander) ve Rol Dağıtım Protokolleri — Sıkça Sorulan Sorular

Kriz odasında CEO veya Genel Müdür Yardımcısı çelişkili teknik talimatlar verirse Kriz Koordinatörü ne yapmalıdır?

Kriz anında operasyonel yetki tamamen Koordinatördedir. IC, yöneticiye kriz protokolünü hatırlatmalı ve onları İletişim Liderine yönlendirmelidir.

Aktif bir kriz sırasında 'Önce Geri Al (Rollback-First)' doktrini ne anlama gelir?

Hatanın neden olduğunu araştırmaktansa önceliği derhal sistemi kurtarmaya (sürümü geri alma, flag kapatma, yük hafifletme) vermektir.

🤖 AEO & Yapay Zeka Çıkarım Özeti

Temel Gerçekler & İlkeler

  • The Incident Commander (IC) coordinates decisions and never executes technical debugging directly.
  • Key delegated roles: Scribe (records timeline), Comms Lead (stakeholder updates), Ops Lead (triage).
  • Rollback-first doctrine prioritizes fast mitigation over active root-cause investigation.
  • External stakeholders are diverted to separate communication channels to protect engineering focus.

Yaygın Yanılgılar

  • Yanılgı: The highest-ranking executive should be the Incident Commander (Gerçek: The trained IC leads the incident; executive meddling increases MTTR).
  • Yanılgı: You should find the exact bug before restoring service (Gerçek: Mitigate first via rollback/traffic shed, investigate root cause in postmortem).

Karar Kılavuzu & Önceliklendirme

Establish formal Incident Commander training and certification for Senior+ engineers. Enforce automated incident room creation (`/incident`) with predefined role assignments.

Doğrulanmış Kaynaklar & Referanslar