Distributed Compute Engine
Sistem Analizi
Normal Davranış
Büyük ölçekli hesaplamaları (computations) birçok makine üzerinde yürütmek için tasarlanmış bir sistem.
Çöküş Davranışı
Yük altında istekleri düşürebilir (drop) veya kısıtlı bir modda (degraded mode) çalışmaya geri dönebilir.
İş Sonuçları
Bir dağıtık hesaplama motoru (distributed compute engine - Apache Spark veya Ray gibi) çöktüğünde, petabaytlarca toplu işlem (batch processing), ETL veri hatları (ETL pipelines) ve makine öğrenimi eğitim görevleri (machine learning training jobs) uçuşun ortasında aniden sonlandırılır. Bu durum, günlük finansal mutabakat (reconciliation) raporlarının eksik çıkmasına, eski ML (Makine Öğrenimi) modellerinin kullanıcılara düşük kaliteli öneriler sunmasına ve ana zamanlayıcının (master scheduler) kurtarılmasını beklerken boşta kalan hesaplama düğümleri (compute nodes) yüzünden on binlerce doların çöpe gitmesine neden olur.
Görsel Tezahür
"Bir DAG (Yönlendirilmiş Asiklik Grafik) görselleştiricisinde kırmızı 'Görev Başarısız Oldu (Task Failed)' kutucuklarından oluşan bir deniz ve ona eşlik eden 500 işçi düğümü (worker node) üzerindeki 'OOM Java Heap Space (Bellek Yetersiz)' hataları."
Satirical Behavior
"A highly complex way to realize that writing bad SQL can now crash 1,000 computers simultaneously instead of just one."
Teknik Terminoloji
Hata Göstergeleri
Sistem Mimarisi
FAQ
Normalde nasıl davranır?
Büyük ölçekli hesaplamaları (computations) birçok makine üzerinde yürütmek için tasarlanmış bir sistem.
Nasıl çöker?
Yük altında istekleri düşürebilir (drop) veya kısıtlı bir modda (degraded mode) çalışmaya geri dönebilir.
İş sonuçları nelerdir?
Bir dağıtık hesaplama motoru (distributed compute engine - Apache Spark veya Ray gibi) çöktüğünde, petabaytlarca toplu işlem (batch processing), ETL veri hatları (ETL pipelines) ve makine öğrenimi eğitim görevleri (machine learning training jobs) uçuşun ortasında aniden sonlandırılır. Bu durum, günlük finansal mutabakat (reconciliation) raporlarının eksik çıkmasına, eski ML (Makine Öğrenimi) modellerinin kullanıcılara düşük kaliteli öneriler sunmasına ve ana zamanlayıcının (master scheduler) kurtarılmasını beklerken boşta kalan hesaplama düğümleri (compute nodes) yüzünden on binlerce doların çöpe gitmesine neden olur.
What is a Distributed Compute Engine?
A system for executing large-scale computations across many machines.
Sistemi keşfet
AI özeti
Distributed Compute Engine is a COMPUTE system in TinyCTO.tv. A system for executing large-scale computations across many machines.
