Skip to main content

Distributed Compute Engine

Sistem Analizi

İşlem (Compute)

Normal Davranış

Büyük ölçekli hesaplamaları (computations) birçok makine üzerinde yürütmek için tasarlanmış bir sistem.

Çöküş Davranışı

Yük altında istekleri düşürebilir (drop) veya kısıtlı bir modda (degraded mode) çalışmaya geri dönebilir.

İş Sonuçları

Bir dağıtık hesaplama motoru (distributed compute engine - Apache Spark veya Ray gibi) çöktüğünde, petabaytlarca toplu işlem (batch processing), ETL veri hatları (ETL pipelines) ve makine öğrenimi eğitim görevleri (machine learning training jobs) uçuşun ortasında aniden sonlandırılır. Bu durum, günlük finansal mutabakat (reconciliation) raporlarının eksik çıkmasına, eski ML (Makine Öğrenimi) modellerinin kullanıcılara düşük kaliteli öneriler sunmasına ve ana zamanlayıcının (master scheduler) kurtarılmasını beklerken boşta kalan hesaplama düğümleri (compute nodes) yüzünden on binlerce doların çöpe gitmesine neden olur.

Görsel Tezahür

"Bir DAG (Yönlendirilmiş Asiklik Grafik) görselleştiricisinde kırmızı 'Görev Başarısız Oldu (Task Failed)' kutucuklarından oluşan bir deniz ve ona eşlik eden 500 işçi düğümü (worker node) üzerindeki 'OOM Java Heap Space (Bellek Yetersiz)' hataları."

Satirical Behavior

"A highly complex way to realize that writing bad SQL can now crash 1,000 computers simultaneously instead of just one."

Teknik Terminoloji

ScalabilityFault toleranceLatency

Hata Göstergeleri

Crash loopTimeoutDeadlock

Sistem Mimarisi

Click or hover to interact

FAQ

Normalde nasıl davranır?

Büyük ölçekli hesaplamaları (computations) birçok makine üzerinde yürütmek için tasarlanmış bir sistem.

Nasıl çöker?

Yük altında istekleri düşürebilir (drop) veya kısıtlı bir modda (degraded mode) çalışmaya geri dönebilir.

İş sonuçları nelerdir?

Bir dağıtık hesaplama motoru (distributed compute engine - Apache Spark veya Ray gibi) çöktüğünde, petabaytlarca toplu işlem (batch processing), ETL veri hatları (ETL pipelines) ve makine öğrenimi eğitim görevleri (machine learning training jobs) uçuşun ortasında aniden sonlandırılır. Bu durum, günlük finansal mutabakat (reconciliation) raporlarının eksik çıkmasına, eski ML (Makine Öğrenimi) modellerinin kullanıcılara düşük kaliteli öneriler sunmasına ve ana zamanlayıcının (master scheduler) kurtarılmasını beklerken boşta kalan hesaplama düğümleri (compute nodes) yüzünden on binlerce doların çöpe gitmesine neden olur.

What is a Distributed Compute Engine?

A system for executing large-scale computations across many machines.

AI özeti

Distributed Compute Engine is a COMPUTE system in TinyCTO.tv. A system for executing large-scale computations across many machines.