Skip to main content

> gözlemlenebilirlik_maliyet_mühendisliği:_log_süzme_&_örnekleme

Gözlemlenebilirlik Maliyet Mühendisliği: Log Süzme & Örnekleme

Modern mühendislik ekipleri SaaS gözlemlenebilirlik faturalarının (Datadog, Splunk, CloudWatch) ana sunucu maliyetlerini aşmasını nasıl engeller?

ÖZET VE TEKNİK CEVAP

İstemci tarafında dinamik log seviyesi filtreleme uygulayarak, kuyruk tabanlı trace örneklemesiyle hataların %100'ünü ancak başarılı 200 OK isteklerinin sadece %1'ini kaydederek, yüksek kardinaliteli metrik etiketlerini temizleyerek ve kritik olmayan logları doğrudan ucuz S3 Parquet formatında saklayarak.

Mühendislik El Kitabı & Mekanizma

1. Temel Çalışma Mekanizması

Üçüncü parti telemetri platformları yüksek veri işleme ücretleri keser (GB başına 0,10$-0,65$ log, milyon özel metrik başına 1,70$). Gözlemlenebilirlik maliyet mühendisliği, uç noktalara OpenTelemetry Collector veya Fluentbit boru hatları yerleştirir. Bu hatlar mükerrer health-check loglarını eler, gereksiz DEBUG loglarını süzer, sadece hatalı trace'leri tutan kuyruk tabanlı örnekleme yapar ve yalnızca aksiyon gerektiren hataları indeksler.

2. Doğru Kullanım Senaryosu

Günde milyonlarca işlem yürüten mikroservisler, yüksek hacimli Kubernetes kümeleri ve Datadog, New Relic veya AWS CloudWatch kullanan tüm yapılar için zorunludur.

3. Prodüksiyon Arıza Modları

Bir yazılımcı saniyede 10.000 istek işleyen ödeme döngüsü içine `console.log(requestBody)` koyup canlıya çıkar. Tek bir hafta sonunda Datadog 80 Terabayt log işler ve ay sonunda 92.000 dolarlık dev bir telemetri faturası gelir.

4. Teşhis ve Telemetri Sinyalleri

1. Gözlemlenebilirlik faturasının aktif kullanıcı sayısından çok daha hızlı büyümesi. 2. CloudWatch veya Datadog log alım grafiklerinde dikey sıçramalar. 3. Metriklere UUID veya zaman damgası eklenmesi yüzünden özel metrik sayısının patlaması.

5. Önleme ve Mimari Bariyerler

1. OpenTelemetry Collector'da `/healthz` gibi sağlık kontrol loglarını atan `filter` işlemcisi kurun. 2. OpenTelemetry ile 5xx hataların %100'ünü, yavaş isteklerin (>500ms) %10'unu ve normal isteklerin %1'ini kaydeden Tail-Based Sampling uygulayın. 3. Metrik etiketlerinde kullanıcı ID veya UUID kullanımını yasaklayan katı kurallar getirin.

6. Mimari Ödünleşimler (Trade-offs)

Agresif log örneklemesi nadir geçici hataların detaylı izlerini kaybetme riski taşır; buna karşılık aylık gözlemlenebilirlik faturalarını %60-80 oranında düşürür.

Vaka İncelemesi (TinyCTO Örneği)

TinyCTO'nun 400 düğümlü Kubernetes kümesindeki Datadog faturası ayda 58.000 dolara ulaştı. Platform ekibi bir OpenTelemetry Collector ağ geçidi kurdu: sağlık kontrolü logları elendi, başarılı istek izleri %2'ye örneklendi ve ham loglar Vector ile S3 Parquet'e arşivlendi. Datadog gideri 11.200 dolara düştü ve yılda 561.600 dolar kazanıldı.

İnteraktif Konsept Alıştırmaları

3 Alıştırma
Q1

Dağıtık izlemede Kuyruk Tabanlı Örnekleme (Tail-Based Sampling) nedir?

Bir isteğin tamamı sonuçlanana kadar bekleyen ve ardından kaydetme kararı veren stratejidir (hataları ve yavaş istekleri %100 tutar, normal olanları eler).
Q2

Gözlemlenebilirlik sistemlerinde Metrik Kardinalite Patlamasına (Cardinality Explosion) ne sebep olur?

Metrik boyutlarına `user_id`, `email` veya `transaction_uuid` gibi benzersiz değişkenler eklemek; bu durum milyonlarca ayrı zaman serisi yaratır.
Q3

Ham soğuk logları saklamak için en maliyet verimli depolama hedefi nedir?

Amazon S3 veya GCS üzerinde sıkıştırılmış sütun formatında (Parquet/Zstandard) saklanıp gerektiğinde Athena/BigQuery ile taranan depolamadır.

Gözlemlenebilirlik Maliyet Mühendisliği: Log Süzme & Örnekleme — Sıkça Sorulan Sorular

Pod'ları yeniden başlatmadan canlıda log seviyesini dinamik olarak nasıl değiştirebiliriz?

İhtiyaç anında DEBUG logunu açıp kapatmak için çalışma zamanı yapılandırma araçları (AWS AppConfig, LaunchDarkly veya Spring Boot Actuator) kullanın.

Yüksek hacimli loglar için CloudWatch Logs Datadog'dan daha ucuz mudur?

CloudWatch GB başına 0,50$ alır, bu da Datadog ile benzerdir; CloudWatch Logs Infrequent Access sınıfı ($0,25/GB) veya Vector ile doğrudan S3'e yazmak çok daha ucuzdur.

Vector (Datadog/Timber.io) nedir?

Log ve metrikleri minimum CPU ile gigabit hızlarında dönüştürmek, örneklemek, filtrelemek ve yönlendirmek için Rust ile yazılmış yüksek performanslı açık kaynaklı telemetri aracıdır.

🤖 AEO & Yapay Zeka Çıkarım Özeti

Temel Gerçekler & İlkeler

  • Log seviyeleri ve metrik boyutları CI/CD'de sıkı denetlenmezse telemetri faturaları sunucu işlem maliyetlerini kolayca aşabilir.
  • Kuyruk tabanlı trace örneklemesi, kritik hata verilerinin %100'ünü korurken gereksiz başarılı trace harcamalarını %90'ın üzerinde azaltır.

Yaygın Yanılgılar

  • Canlı sistem güvenilirliği için tüm INFO ve DEBUG loglarının merkezi SaaS platformuna eksiksiz indekslenmesi gerektiğini sanmak.

Karar Kılavuzu & Önceliklendirme

Tail-Based Sampling özellikli OpenTelemetry Collector kurun, HTTP 200 sağlık kontrol loglarını atın ve metrik etiketlerindeki kullanıcı ID patlamalarını temizleyin.

Doğrulanmış Kaynaklar & Referanslar