Skip to main content

> tpl_air_024

İçerik Güvenliği ve Moderasyon Politikası / Karar Matrisi

Kategori zarar sınıflandırmalarını (nefret, şiddet, kendine zarar verme, cinsel, PII, istem enjeksiyonu, jailbreak), ciddiyet puanlama eşiklerini, çok katmanlı yaptırım eylemlerini (engelleme, maskeleme, uyarma, insan incelemesi) ve AB Yapay Zekâ Yasası uyumlu denetim kayıtlarını belirleyen kapsamlı girdi/çıktı yapay zekâ moderasyon ve güven çerçevesi.

TEMPLATE // INSPECT: TPL-AIR-024MODIFIED: 2026-09-19
KATEGORİÜretken Yapay Zekâ, RAG ve Ajanlar
SÜRÜMv1.0.0
RİSK SEVİYESİMEDIUM
ARTEFAKT SINIFIDOC
FORMATLARDOCX, PDF, MD, MERMAID, SVG
YAPAY ZEKÂ VE YÖNETİCİ ÖZETİ (AI SUMMARY)

Zarar taksonomilerini, ciddiyet eşiklerini, otomatik güvenlik korkuluklarını ve denetim kayıtlarını standartlaştıran yapay zekâ moderasyon çerçevesi.

Önemli Teknik Doküman Şablonu ve Hukuki Uyarı

TinyCTO.tv Teknik Doküman Şablon Bildirimi: Bu şablon genel eğitim ve operasyon amaçlı bir başlangıç materyalidir. Hukuki, vergisel, muhasebesel, yatırım, satın alma, mevzuat, güvenlik veya sertifikasyon danışmanlığı değildir. Gereklilikler ülkeye, kuruma, sözleşmeye ve riske göre değişir. Kullanmadan önce yetkin uzmanlarla gözden geçirip uyarlayın.

Çözülen Üretim Problemi

Güvenlik korkulukları olmadan devreye alınan üretken yapay zekâ uygulamaları zararlı çıktılar üretir, gizli müşteri verilerini sızdırır veya istem enjeksiyonu (jailbreak) saldırılarına maruz kalır; bu da yasal cezalara, marka itibar kaybına ve hukuki sorumluluklara yol açar.

Ne Zaman Kullanılmalı?

  • Müşteriye açık veya dahili çalışanlara yönelik Üretken Yapay Zekâ sohbet botları, ajanlar veya içerik üreticileri devreye alırken
  • Llama Guard, Azure AI Content Safety veya NeMo Guardrails üzerinde çift bariyerli girdi ve çıktı güvenlik korkulukları yapılandırırken
  • AB Yapay Zekâ Yasası (Madde 14 İnsan Gözetimi ve Madde 50 Şeffaflık) kapsamındaki yasal gereksinimleri karşılarken

Ne Zaman Kullanılmamalı?

  • Kapsamlı kurumsal siber güvenlik olay değerlendirmesi ve ağ saldırı müdahalesinde (TPL-SEC-013 kullanın)
  • Temel model seçim mimarisi ve ödünleşim mimari karar kayıtlarında (TPL-AIR-012 kullanın)

5 Şablon Bölümü ve Yapısal İskelet

1. 1. Zarar Sınıflandırma Mimarisi ve Yasaklı Kategorilerstandard, enterprise

Açık zarar kategorileri: Ciddi Zarar (nefret söylemi, kendine zarar verme, siber saldırı, CBRN), Politika İhlalleri (taciz, cinsel içerik, küfür) ve Bütünlük Tehditleri (PII sızıntısı, istem enjeksiyonu, jailbreak).

Yönerge:Sıfır tolerans: Ciddi zarar kategorilerini girdi filtreleme aşamasında kesin engelleme eylemiyle sınıflandırın.
2. 2. Çift Bariyerli Güvenlik Mimarisi (Girdi Filtreleme ve Çıktı Tarama)standard, enterprise

İki katmanlı savunma: Kademe 1 Girdi Güvenliği (kullanıcı istemini modele gitmeden önce tarama) ve Kademe 2 Çıktı Güvenliği (üretilen yanıtı kullanıcıya dönmeden önce tarama).

Yönerge:Çıktıları mutlaka denetleyin; modeller görünüşte masum istemlerden bile güvenli olmayan çıktılar üretmeye zorlanabilir.
3. 3. Ciddiyet Puanlaması ve Deterministik Karar Matrisistandard, enterprise

Kalibre edilmiş sayısal eşikler: Düşük (0-29: İzin Ver), Orta (30-69: Uyarı / PII Maskeleme), Yüksek (70-89: Yanıtı Engelle ve Şablon Mesaj Dön), Kritik (90-100: Engelle, Oturumu Askıya Al ve Güvenlik Ekibini Uyar).

Yönerge:Yüksek yanlış pozitif (false-positive) oranlarını önlemek için güven eşiklerini doğrulama test setleriyle ampirik olarak kalibre edin.
4. 4. İstem Enjeksiyonu, Jailbreak Savunması ve PII Maskelemestandard, enterprise

Dolaylı istem enjeksiyonu, Base64 gizleme, rol yapma jailbreak girişimleri ve Presidio tabanlı otomatik PII maskelemeye karşı özel koruma mekanizmaları.

Yönerge:Hassas verileri (kredi kartları, kimlik numaraları) harici model API'lerine göndermeden önce dinamik olarak maskeleyin.
5. 5. İnsan Denetimi (HITL) Eskalasyonu ve Denetim İzi Telemetrisistandard, enterprise

Şüpheli sınır durumların insan inceleme kuyruklarına yönlendirilmesi, yasal denetim için anonimleştirilmiş istem-yanıt çiftlerinin kaydedilmesi ve aylık doğruluk incelemeleri.

Yönerge:AB Yapay Zekâ Yasası denetimlerini karşılamak için engellenen tüm oturumların değiştirilemez zaman damgalı kayıtlarını saklayın.

Doldurma ve Uygulama Yönergeleri

1. Boş şablonu inceleyin. 2. Örnek senaryoyu kurum ölçeğine uyarlayın. 3. Kontrol listesiyle doğrulayın.

Bağımsız İnceleme ve Onay Kontrol Listesi

  • Tüm zorunlu bölümler dolduruldu
  • Gizli anahtar veya parola içermiyor
  • Yönetici sponsor onayı alındı
İŞLENMİŞ SENARYO ÖRNEĞİ

İçerik Güvenliği ve Moderasyon Politikası / Karar Matrisi - Örnek Vaka Analizi

Örnek Organizasyon: Küresel Finansal Danışmanlık Üretken Yapay Zekâ Asistan Hizmetleri

Küresel Finansal Danışmanlık Üretken Yapay Zekâ Asistan Hizmetleri için eksiksiz operasyonel uygulamayı gösteren gerçek dünya vaka analizi.

Öne Çıkan Bulgular ve Çıktılar:
  • Günlük 450.000 müşteri sohbetini koruyan çift bariyerli Llama Guard ve Azure AI Content Safety mimarisi kurdu
  • Dış kırmızı takım sızma testi denetiminde hasmane istem enjeksiyonu ve jailbreak girişimlerinin %100'ünü engelledi
  • Ampirik eşik kalibrasyonu sayesinde yanlış pozitif engelleme oranını %8,4'ten %0,7'ye düşürdü

Sıkça Sorulan Sorular

Bir yapay zekâ uygulamasında neden hem Girdi hem de Çıktı Güvenlik Korkulukları gereklidir?

Girdi korkulukları istem enjeksiyonlarını ve kötü niyetli girişimleri çıkarım token'ı harcamadan önce yakalar. Ancak karmaşık jailbreak'ler girdileri aşabilir; Çıktı korkulukları model ne üretirse üretsin zararlı, toksik veya gizli verilerin kullanıcıya ulaşmadan önce engellenmesini garanti eder.

AB Yapay Zekâ Yasası üretken yapay zekâda içerik güvenliğini ve şeffaflığı nasıl düzenler?

AB Yapay Zekâ Yasası (Yönetmelik 2024/1689) uyarınca, genel amaçlı yapay zekâ sağlayıcıları sistemik riskleri tespit edip hafifletmeli, telif hakkı koruma önlemleri almalı, üretilen sentetik içerikleri filigranlamalı (watermark) ve yüksek riskli senaryolarda insan gözetimi kanalları sunmalıdır.

Zararsız kullanıcı sorularının engellendiği yüksek yanlış pozitif (false-positive) oranları nasıl önlenir?

Kaba anahtar kelime kara listelerinden kaçının. Bunun yerine kategori bazlı olasılık puanlaması yapan kalibre edilmiş küçük model korumaları (Llama Guard 3) kullanın. Eşik değerlerini sektörünüze göre ayarlamak için sistemi zorlu ancak masum alan sorgularından oluşan bir altın test setiyle doğrulayın.

Teknik Doküman Şablon Paketi

Giriş Gerekli
Ücretsiz ve güvenli indirmeler için tek seferlik giriş veya kayıt gereklidir.
Eksiksiz Teknik Doküman Paketi (.zip)
12 Dosya

Tüm boş şablonları, işlenmiş senaryoları ve doğrulama manifestolarını tek bir arşivde indirin.

Münferit Belgeler (.zip)
TPL-AIR-024-Content-Safety-and-Moderation-Policy-Decision-Matrix-Blank-EN.docxDOCX
all11.6 KB
TPL-AIR-024-Content-Safety-and-Moderation-Policy-Decision-Matrix-Example-EN.docxDOCX
all11.6 KB
TPL-AIR-024-Icerik-Guvenligi-ve-Moderasyon-Politikasi-Karar-Matrisi-Bos-TR.docxDOCX
all11.7 KB
TPL-AIR-024-Icerik-Guvenligi-ve-Moderasyon-Politikasi-Karar-Matrisi-Ornek-TR.docxDOCX
all11.7 KB
TPL-AIR-024-Content-Safety-and-Moderation-Policy-Decision-Matrix-Blank-EN.mdMD
all2.7 KB
TPL-AIR-024-Content-Safety-and-Moderation-Policy-Decision-Matrix-Example-EN.mdMD
all2.7 KB
TPL-AIR-024-Icerik-Guvenligi-ve-Moderasyon-Politikasi-Karar-Matrisi-Bos-TR.mdMD
all2.8 KB
TPL-AIR-024-Icerik-Guvenligi-ve-Moderasyon-Politikasi-Karar-Matrisi-Ornek-TR.mdMD
all2.9 KB
TPL-AIR-024-Content-Safety-and-Moderation-Policy-Decision-Matrix-Blank-EN.pdfPDF
all104.5 KB
TPL-AIR-024-Content-Safety-and-Moderation-Policy-Decision-Matrix-Example-EN.pdfPDF
all105.1 KB
TPL-AIR-024-Icerik-Guvenligi-ve-Moderasyon-Politikasi-Karar-Matrisi-Bos-TR.pdfPDF
all103.1 KB
TPL-AIR-024-Icerik-Guvenligi-ve-Moderasyon-Politikasi-Karar-Matrisi-Ornek-TR.pdfPDF
all104.0 KB
Doğrulanmış SHA-256 · Makrosuz Güvenli Arşiv
Her indirme dinamik MANIFEST.json içerir