Skip to main content

> tpl_aim_020

Tahminleme Modeli Değerlendirme ve Kabul Planı

Nicel performans eşiklerini (PR-AUC, Brier skoru), dilim tabanlı alt popülasyon stres testlerini, demografik adalet denetimlerini (Farklı Etki), kalibrasyon eğrilerini ve model risk onay kapılarını belirleyen kapsamlı model değerlendirme ve canlı kabul protokolü.

TEMPLATE // INSPECT: TPL-AIM-020MODIFIED: 2026-09-19
KATEGORİVeri, Yapay Zekâ ve Makine Öğrenimi
SÜRÜMv1.0.0
RİSK SEVİYESİMEDIUM
ARTEFAKT SINIFIDOC
FORMATLARDOCX, PDF, MD, MERMAID, SVG
YAPAY ZEKÂ VE YÖNETİCİ ÖZETİ (AI SUMMARY)

Dilim tabanlı doğruluk değerlendirmeleri, olasılık kalibrasyon testleri, demografik adalet eşitliği ve model risk onayları yürüten canlı model bekçisi protokolü.

Önemli Teknik Doküman Şablonu ve Hukuki Uyarı

TinyCTO.tv Teknik Doküman Şablon Bildirimi: Bu şablon genel eğitim ve operasyon amaçlı bir başlangıç materyalidir. Hukuki, vergisel, muhasebesel, yatırım, satın alma, mevzuat, güvenlik veya sertifikasyon danışmanlığı değildir. Gereklilikler ülkeye, kuruma, sözleşmeye ve riske göre değişir. Kullanmadan önce yetkin uzmanlarla gözden geçirip uyarlayın.

Çözülen Üretim Problemi

Yüksek genel doğruluğa sahip modeller kritik azınlık dilimlerinde sessizce başarısız olur veya kötü kalibre edilmiş olasılıklar üretir; bu da mevzuat cezalarına, itibar kaybına veya ağır finansal zararlara yol açar.

Ne Zaman Kullanılmalı?

  • Yeni makine öğrenimi modellerini hazırlık ortamından canlı üretim trafiğine geçirmeden önce kapılardan geçirirken
  • Korunan kullanıcı niteliklerinde (yaş, cinsiyet, köken) algoritmik yanlılığı ve demografik eşitliği denetlerken
  • Tahmin edilen olasılıkların finansal kararları belirlediği risk skorlama sistemlerinde olasılık kalibrasyonunu doğrularken

Ne Zaman Kullanılmamalı?

  • İnsan kaynakları performans değerlendirmelerinde veya yazılımcı akran incelemelerinde (TPL-PEO-004 kullanın)
  • Web kullanıcı arayüzü bileşenlerinin basit regresyon testlerinde (TPL-QAV-001 kullanın)

5 Şablon Bölümü ve Yapısal İskelet

1. 1. Nicel Performans Değerlendirmesi ve İş Eşikleristandard, enterprise

Precision-Recall AUC, ROC-AUC, F1-beta, Matthew Korelasyon Katsayısı (MCC) ve özel finansal beklenen değer maliyet fonksiyonları.

Yönerge:Dengesiz sınıflandırma modellerini asla yalnızca doğruluk (accuracy) ile değerlendirmeyin; PR-AUC ve maliyet ağırlıklı eğrileri zorunlu kılın.
2. 2. Alt Popülasyon Dilim Testleri ve Stres Senaryolarıstandard, enterprise

Kritik kullanıcı kohortlarına göre dilimlenmiş performans değerlendirmesi (düşük aktiviteli kullanıcılar, mobil vs masaüstü, yüksek değerli hesaplar).

Yönerge:Her alt dilim için kabul edilebilir asgari taban belirleyin; genel AUC 0.90 olsa bile kritik bir dilim 0.70'in altına düşerse model reddedilir.
3. 3. Olasılık Kalibrasyonu ve Belirsizlik Ölçümüstandard, enterprise

Güvenilirlik diyagramları, beklenen kalibrasyon hatası (ECE), Brier skoru ve kalibrasyon yöntemleri (Platt ölçekleme, İzotonik regresyon).

Yönerge:Model çıktıları otomatik kararları (kredi onayı) belirliyorsa, 0.80 tahmininin gerçekte %80 gerçekleşme oranına karşılık gelmesi için olasılıkları kalibre edin.
4. 4. Algoritmik Adalet, Yanlılık ve Demografik Eşitlik Denetimleristandard, enterprise

Korunan sınıflarda Fairlearn denetimi: Farklı Etki (%80 kuralı), Fırsat Eşitliği ve Tahmin Eşitliği.

Yönerge:Demografik eşitlik metriklerini belgeleyin ve kalan eşitsizlikleri resmi iş gerekliliği incelemesiyle gerekçelendirin.
5. 5. Canlıya Geçiş Kapıları ve Çok Paydaşlı Onay Sürecistandard, enterprise

Kanarya trafiği öncesinde Model Risk Sorumlusu, Veri Bilimi Lideri, Ürün Müdürü ve Güvenlik Mimarı onayını şart koşan imza matrisi.

Yönerge:Herhangi bir adalet, kalibrasyon veya gecikme kapısı BAŞARISIZ olduğunda CI/CD dağıtımını otomatik olarak engelleyin.

Doldurma ve Uygulama Yönergeleri

1. Boş şablonu inceleyin. 2. Örnek senaryoyu kurum ölçeğine uyarlayın. 3. Kontrol listesiyle doğrulayın.

Bağımsız İnceleme ve Onay Kontrol Listesi

  • Tüm zorunlu bölümler dolduruldu
  • Gizli anahtar veya parola içermiyor
  • Yönetici sponsor onayı alındı
İŞLENMİŞ SENARYO ÖRNEĞİ

Tahminleme Modeli Değerlendirme ve Kabul Planı - Örnek Vaka Analizi

Örnek Organizasyon: Sovereign Ticari Kredi Tahsis Modeli Kabul Kapısı

Sovereign Ticari Kredi Tahsis Modeli Kabul Kapısı için eksiksiz operasyonel uygulamayı gösteren gerçek dünya vaka analizi.

Öne Çıkan Bulgular ve Çıktılar:
  • 450.000 geçmiş başvuru üzerinde 18 otomatik doğrulama kontrolüyle model canlıya geçişi kontrol altına alındı
  • Risk olasılıklarında uygulanan İzotonik regresyon ile beklenen kalibrasyon hatası (ECE) %14,2'den %2,1'e düşürüldü
  • Cinsiyet grupları arasındaki farklı etki giderilerek Eşit Kredi Fırsatı Yasası (ECOA) ile %100 uyum sağlandı

Sıkça Sorulan Sorular

Dengesiz sınıflandırma görevlerinde (sahtecilik, hastalık) yüksek doğruluk veya AUC-ROC neden yanıltıcıdır?

İşlemlerin yalnızca %0,1'inin sahte olduğu bir veri setinde, her işleme "meşru" diyen aptal bir model hiçbir sahteciliği yakalayamadığı halde %99,9 doğruluk elde eder. AUC-ROC da yüksek doğru negatif sayısı nedeniyle yapay olarak yüksek çıkabilir. Precision-Recall AUC (PR-AUC) ise kesinliği yalnızca pozitif örnekler üzerinden ölçerek gerçek başarıyı gösterir.

Olasılık kalibrasyonu nedir ve iş riski modelleri için neden önemlidir?

Ağaç tabanlı veya derin öğrenme algoritmaları genellikle gerçek olasılık yerine sıralamayı yansıtan kalibre edilmemiş 0-1 arası skorlar üretir. Kalibrasyon, 0.80 olasılık atanan olayların gerçekte tam olarak %80'inin gerçekleşmesini sağlar. Kalibrasyon olmadan beklenen finansal değer hesaplamaları ve eşik kararları ciddi biçimde sapar.

Dilim tabanlı değerlendirme algoritmik yanlılığa ve demografik zararlara karşı nasıl koruma sağlar?

Genel metrikler, küçük azınlık kohortlarındaki felaket performans düşüşlerini gizler. Dilim tabanlı testler, doğrulama verisini demografik, coğrafi ve davranışsal niteliklere göre ayırarak hata oranlarını her grup için ayrı ayrı ölçer; böylece doğruluğun tüm kitleye adil dağıldığından emin olunur.

Teknik Doküman Şablon Paketi

Giriş Gerekli
Ücretsiz ve güvenli indirmeler için tek seferlik giriş veya kayıt gereklidir.
Eksiksiz Teknik Doküman Paketi (.zip)
12 Dosya

Tüm boş şablonları, işlenmiş senaryoları ve doğrulama manifestolarını tek bir arşivde indirin.

Münferit Belgeler (.zip)
TPL-AIM-020-Predictive-Model-Evaluation-and-Acceptance-Plan-Blank-EN.docxDOCX
all11.5 KB
TPL-AIM-020-Predictive-Model-Evaluation-and-Acceptance-Plan-Example-EN.docxDOCX
all11.5 KB
TPL-AIM-020-Tahminleme-Modeli-Degerlendirme-ve-Kabul-Plani-Bos-TR.docxDOCX
all11.6 KB
TPL-AIM-020-Tahminleme-Modeli-Degerlendirme-ve-Kabul-Plani-Ornek-TR.docxDOCX
all11.7 KB
TPL-AIM-020-Predictive-Model-Evaluation-and-Acceptance-Plan-Blank-EN.mdMD
all2.4 KB
TPL-AIM-020-Predictive-Model-Evaluation-and-Acceptance-Plan-Example-EN.mdMD
all2.5 KB
TPL-AIM-020-Tahminleme-Modeli-Degerlendirme-ve-Kabul-Plani-Bos-TR.mdMD
all2.5 KB
TPL-AIM-020-Tahminleme-Modeli-Degerlendirme-ve-Kabul-Plani-Ornek-TR.mdMD
all2.6 KB
TPL-AIM-020-Predictive-Model-Evaluation-and-Acceptance-Plan-Blank-EN.pdfPDF
all101.2 KB
TPL-AIM-020-Predictive-Model-Evaluation-and-Acceptance-Plan-Example-EN.pdfPDF
all102.9 KB
TPL-AIM-020-Tahminleme-Modeli-Degerlendirme-ve-Kabul-Plani-Bos-TR.pdfPDF
all102.5 KB
TPL-AIM-020-Tahminleme-Modeli-Degerlendirme-ve-Kabul-Plani-Ornek-TR.pdfPDF
all102.8 KB
Doğrulanmış SHA-256 · Makrosuz Güvenli Arşiv
Her indirme dinamik MANIFEST.json içerir

Yetkili Standartlar ve Kaynaklar