> tpl_air_024
İçerik Güvenliği ve Moderasyon Politikası / Karar Matrisi
Kategori zarar sınıflandırmalarını (nefret, şiddet, kendine zarar verme, cinsel, PII, istem enjeksiyonu, jailbreak), ciddiyet puanlama eşiklerini, çok katmanlı yaptırım eylemlerini (engelleme, maskeleme, uyarma, insan incelemesi) ve AB Yapay Zekâ Yasası uyumlu denetim kayıtlarını belirleyen kapsamlı girdi/çıktı yapay zekâ moderasyon ve güven çerçevesi.
Zarar taksonomilerini, ciddiyet eşiklerini, otomatik güvenlik korkuluklarını ve denetim kayıtlarını standartlaştıran yapay zekâ moderasyon çerçevesi.
Önemli Teknik Doküman Şablonu ve Hukuki Uyarı
TinyCTO.tv Teknik Doküman Şablon Bildirimi: Bu şablon genel eğitim ve operasyon amaçlı bir başlangıç materyalidir. Hukuki, vergisel, muhasebesel, yatırım, satın alma, mevzuat, güvenlik veya sertifikasyon danışmanlığı değildir. Gereklilikler ülkeye, kuruma, sözleşmeye ve riske göre değişir. Kullanmadan önce yetkin uzmanlarla gözden geçirip uyarlayın.
Çözülen Üretim Problemi
Güvenlik korkulukları olmadan devreye alınan üretken yapay zekâ uygulamaları zararlı çıktılar üretir, gizli müşteri verilerini sızdırır veya istem enjeksiyonu (jailbreak) saldırılarına maruz kalır; bu da yasal cezalara, marka itibar kaybına ve hukuki sorumluluklara yol açar.
Ne Zaman Kullanılmalı?
- •Müşteriye açık veya dahili çalışanlara yönelik Üretken Yapay Zekâ sohbet botları, ajanlar veya içerik üreticileri devreye alırken
- •Llama Guard, Azure AI Content Safety veya NeMo Guardrails üzerinde çift bariyerli girdi ve çıktı güvenlik korkulukları yapılandırırken
- •AB Yapay Zekâ Yasası (Madde 14 İnsan Gözetimi ve Madde 50 Şeffaflık) kapsamındaki yasal gereksinimleri karşılarken
Ne Zaman Kullanılmamalı?
- •Kapsamlı kurumsal siber güvenlik olay değerlendirmesi ve ağ saldırı müdahalesinde (TPL-SEC-013 kullanın)
- •Temel model seçim mimarisi ve ödünleşim mimari karar kayıtlarında (TPL-AIR-012 kullanın)
5 Şablon Bölümü ve Yapısal İskelet
Açık zarar kategorileri: Ciddi Zarar (nefret söylemi, kendine zarar verme, siber saldırı, CBRN), Politika İhlalleri (taciz, cinsel içerik, küfür) ve Bütünlük Tehditleri (PII sızıntısı, istem enjeksiyonu, jailbreak).
İki katmanlı savunma: Kademe 1 Girdi Güvenliği (kullanıcı istemini modele gitmeden önce tarama) ve Kademe 2 Çıktı Güvenliği (üretilen yanıtı kullanıcıya dönmeden önce tarama).
Kalibre edilmiş sayısal eşikler: Düşük (0-29: İzin Ver), Orta (30-69: Uyarı / PII Maskeleme), Yüksek (70-89: Yanıtı Engelle ve Şablon Mesaj Dön), Kritik (90-100: Engelle, Oturumu Askıya Al ve Güvenlik Ekibini Uyar).
Dolaylı istem enjeksiyonu, Base64 gizleme, rol yapma jailbreak girişimleri ve Presidio tabanlı otomatik PII maskelemeye karşı özel koruma mekanizmaları.
Şüpheli sınır durumların insan inceleme kuyruklarına yönlendirilmesi, yasal denetim için anonimleştirilmiş istem-yanıt çiftlerinin kaydedilmesi ve aylık doğruluk incelemeleri.
Doldurma ve Uygulama Yönergeleri
Bağımsız İnceleme ve Onay Kontrol Listesi
- Tüm zorunlu bölümler dolduruldu
- Gizli anahtar veya parola içermiyor
- Yönetici sponsor onayı alındı
İçerik Güvenliği ve Moderasyon Politikası / Karar Matrisi - Örnek Vaka Analizi
Örnek Organizasyon: Küresel Finansal Danışmanlık Üretken Yapay Zekâ Asistan Hizmetleri
Küresel Finansal Danışmanlık Üretken Yapay Zekâ Asistan Hizmetleri için eksiksiz operasyonel uygulamayı gösteren gerçek dünya vaka analizi.
- •Günlük 450.000 müşteri sohbetini koruyan çift bariyerli Llama Guard ve Azure AI Content Safety mimarisi kurdu
- •Dış kırmızı takım sızma testi denetiminde hasmane istem enjeksiyonu ve jailbreak girişimlerinin %100'ünü engelledi
- •Ampirik eşik kalibrasyonu sayesinde yanlış pozitif engelleme oranını %8,4'ten %0,7'ye düşürdü
Sıkça Sorulan Sorular
Bir yapay zekâ uygulamasında neden hem Girdi hem de Çıktı Güvenlik Korkulukları gereklidir?
Girdi korkulukları istem enjeksiyonlarını ve kötü niyetli girişimleri çıkarım token'ı harcamadan önce yakalar. Ancak karmaşık jailbreak'ler girdileri aşabilir; Çıktı korkulukları model ne üretirse üretsin zararlı, toksik veya gizli verilerin kullanıcıya ulaşmadan önce engellenmesini garanti eder.
AB Yapay Zekâ Yasası üretken yapay zekâda içerik güvenliğini ve şeffaflığı nasıl düzenler?
AB Yapay Zekâ Yasası (Yönetmelik 2024/1689) uyarınca, genel amaçlı yapay zekâ sağlayıcıları sistemik riskleri tespit edip hafifletmeli, telif hakkı koruma önlemleri almalı, üretilen sentetik içerikleri filigranlamalı (watermark) ve yüksek riskli senaryolarda insan gözetimi kanalları sunmalıdır.
Zararsız kullanıcı sorularının engellendiği yüksek yanlış pozitif (false-positive) oranları nasıl önlenir?
Kaba anahtar kelime kara listelerinden kaçının. Bunun yerine kategori bazlı olasılık puanlaması yapan kalibre edilmiş küçük model korumaları (Llama Guard 3) kullanın. Eşik değerlerini sektörünüze göre ayarlamak için sistemi zorlu ancak masum alan sorgularından oluşan bir altın test setiyle doğrulayın.
Teknik Doküman Şablon Paketi
Giriş GerekliTüm boş şablonları, işlenmiş senaryoları ve doğrulama manifestolarını tek bir arşivde indirin.
Yetkili Standartlar ve Kaynaklar
- Regulation (EU) 2024/1689 laying down harmonised rules on artificial intelligence (EU AI Act)European Parliament and Council • OFFICIAL REQUIREMENT
- NIST Artificial Intelligence Risk Management Framework (AI RMF 1.0)NIST • OFFICIAL REQUIREMENT
- Meta Llama Guard 3: Safe and Responsible AI Deployment Model CardMeta AI • OFFICIAL REQUIREMENT
