Skip to main content

Gözlemlenebilirlik Platformu (Observability Platform)

Sistem Analizi

GözlemlenebilirlikPRODUCTION

Normal Davranış

Mikro hizmetlerden (microservices) ve altyapı aracılarından (infrastructure agents) OpenTelemetry toplayıcıları (collectors) aracılığıyla yüksek verimli (high-throughput) telemetri akışlarını sürekli olarak alır. Anında toplama (aggregation) için zaman serisi (time-series) metriklerini indeksler, istek yaşam döngülerini (request lifecycles) hizmetler arasında eşlemek için evrensel izleme kimliklerini (universal trace IDs) kullanarak dağıtılmış izleme yayılmalarını (distributed trace spans) ilişkilendirir, yapılandırılmış (structured) JSON günlüklerini ayrıştırır ve on-call mühendislerini anormal hata oranları veya gecikme (latency) ihlalleri konusunda bilgilendirmek için uyarı sorgularını (alerting queries) değerlendirir.

Çöküş Davranışı

Bir mikro hizmet sürümü yanlışlıkla yüksek kardinaliteli etiketler (high-cardinality labels - örn. Prometheus metrik etiketlerinde ham UUID'ler veya e-posta adresleri) yayar, Gözlemlenebilirlik Platformunun (Observability Platform) belleğini tüketen üstel zaman serisi dizini patlamasına (exponential time-series index explosion) neden olur, alma düğümlerini (ingestion nodes) çökertir ve mühendisliği büyük bir canlı kesinti (live outage) sırasında tamamen kör bırakır.

İş Sonuçları

Bir Gözlemlenebilirlik Platformu (Observability Platform) başarısız olduğunda, mühendislik ekibi sistem sağlığına (system health) ilişkin tüm görünürlüğünü kaybeder. Otomatik uyarılar (automated alerts) tetiklenemez ve sessiz arızalar (silent failures), müşteriler sosyal medyada şikayet edene kadar kimse fark etmeden üretim ortamlarını yok eder. Ortaya çıkan uzatılmış kesinti süresi (prolonged downtime) ciddi itibar hasarına (reputational damage) neden olur ve katı kurumsal SLA'leri doğrudan ihlal eder.

Görsel Tezahür

"Tüm Grafana gösterge panolarının (dashboards) düzleşmiş metrikler veya 'No Data' (Veri Yok) göstermesi; bu sırada PagerDuty'nin yıkıcı bir üretim çöküşü sırasında korkutucu derecede sessiz kalması."

Satirical Behavior

"A multi-million dollar SaaS product whose sole purpose is to wake up engineers at 3 AM to tell them that CPU usage spiked for 2 seconds."

Bilinen İsimler

Logging & MetricsMonitoring

Teknik Terminoloji

Log aggregationMetrics ingestionAlert routing

Hata Göstergeleri

Alert fatigueDropped logsDashboard timeout

Sistem Mimarisi

Click or hover to interact

Kullanan Karakterler

FAQ

Normalde nasıl davranır?

Mikro hizmetlerden (microservices) ve altyapı aracılarından (infrastructure agents) OpenTelemetry toplayıcıları (collectors) aracılığıyla yüksek verimli (high-throughput) telemetri akışlarını sürekli olarak alır. Anında toplama (aggregation) için zaman serisi (time-series) metriklerini indeksler, istek yaşam döngülerini (request lifecycles) hizmetler arasında eşlemek için evrensel izleme kimliklerini (universal trace IDs) kullanarak dağıtılmış izleme yayılmalarını (distributed trace spans) ilişkilendirir, yapılandırılmış (structured) JSON günlüklerini ayrıştırır ve on-call mühendislerini anormal hata oranları veya gecikme (latency) ihlalleri konusunda bilgilendirmek için uyarı sorgularını (alerting queries) değerlendirir.

Nasıl çöker?

Bir mikro hizmet sürümü yanlışlıkla yüksek kardinaliteli etiketler (high-cardinality labels - örn. Prometheus metrik etiketlerinde ham UUID'ler veya e-posta adresleri) yayar, Gözlemlenebilirlik Platformunun (Observability Platform) belleğini tüketen üstel zaman serisi dizini patlamasına (exponential time-series index explosion) neden olur, alma düğümlerini (ingestion nodes) çökertir ve mühendisliği büyük bir canlı kesinti (live outage) sırasında tamamen kör bırakır.

İş sonuçları nelerdir?

Bir Gözlemlenebilirlik Platformu (Observability Platform) başarısız olduğunda, mühendislik ekibi sistem sağlığına (system health) ilişkin tüm görünürlüğünü kaybeder. Otomatik uyarılar (automated alerts) tetiklenemez ve sessiz arızalar (silent failures), müşteriler sosyal medyada şikayet edene kadar kimse fark etmeden üretim ortamlarını yok eder. Ortaya çıkan uzatılmış kesinti süresi (prolonged downtime) ciddi itibar hasarına (reputational damage) neden olur ve katı kurumsal SLA'leri doğrudan ihlal eder.

What is high-cardinality metric explosion and why does it crash time-series databases (TSDB)?

Cardinality refers to the total number of unique combinations of metric label key-value pairs. When developers use unbounded dynamic values (such as user IDs, UUIDs, or raw query parameters) as metric labels, the TSDB generates millions of distinct time-series streams in memory, causing severe RAM exhaustion, garbage collection freezing, and storage node failure.

How does tail-based sampling in distributed tracing balance observability depth with storage costs?

Head-based sampling decides whether to sample a trace at request initiation when the outcome is unknown, frequently dropping rare error traces. Tail-based sampling buffers all spans of a trace in memory until the request completes, allowing the collector to retain 100% of error or high-latency traces while discarding uninteresting successful (HTTP 200) traces to drastically reduce storage volume.

AI özeti

Observability Platform is a OBSERVABILITY system in TinyCTO.tv. Continuously ingests high-throughput telemetry streams via OpenTelemetry collectors from microservices and infrastructure agents. It indexes time-series metrics for instant aggregation, correlates distributed trace spans using universal trace IDs to map request lifecycles across services, parses structured JSON logs, and evaluates alerting queries to notify on-call engineers of anomalous error rates or latency breaches.