Skip to main content

> ML_LITERATURE // BAI-2022-CONSTITUTIONAL-AI-HARMLESSNESS-FROM-AI-FEEDBACK_v1.0

Constitutional AI: Harmlessness from AI Feedback (RLAIF)

Yuntao Bai, Saurav Kadavath, Sandhini Agarwal, Kavita Saund, Amanda Askell, Jackson Kernion, Andy Jones, Anna Chen, Anna Goldie, Azalia Mirhoseini, Cameron McKinnon, Carol Chen, Catherine Olsson, Christopher Olah, Danny Hernandez, Dawn Drain, Deep Ganguli, Dustin Li, Eli Tran-Johnson, Ethan Perez, Jamie Kerr, Jared Mueller, Jeffrey Ladish, Joshua Landau, Kamal Ndousse, Kamile Lukosuite, Liane Lovitt, Michael Sellitto, Nelson Elhage, Nicholas Schiefer, Noemi Mercado, Nova DasSarma, Robert Lasenby, Robin Larson, Sam Ringer, Scott Johnston, Shauna Kravec, Sheer El Showk, Stanislav Fort, Tamera Lanham, Timothy Telleen-Lawton, Tom Conerly, Tom Henighan, Tristan Hume, Samuel R. Bowman, Zac Hatfield-Dodds, Ben Mann, Dario Amodei, Nicholas Joseph, Sam McCandlish, Tom Brown, Christopher Durr, Jack Clark · arXiv preprint (2022)

safety-fairness2022industry-standardartifactsAvailable

Temel Katkı (Principal Contribution)

Yazılı bir anayasa ve Yapay Zeka Geri Bildiriminden Pekiştirmeli Öğrenme (RLAIF) kullanarak zararlar konusunda insan geri bildirimi olmadan zararsız modeller eğitti.

Operasyonel ve Mühendislik Uygunluğu

task-llm-alignment-rlhf, task-ai-safety için dağıtım seçimlerini ve mimari belirlemeyi doğrudan yönlendirir.

Temel Varsayımlar (Assumptions)

  • Değerlendirme alanları genelinde standart ampirik düzenlilik ve istatistiksel kararlılık geçerlidir

Kısıtlar ve Sınırlamalar (Limitations)

  • Performans özellikleri alan dağılımına ve hesaplama tahsisi parametrelerine bağlıdır

Bağlantılı Algoritmalar, Mimariler ve Kütüphaneler

İlgili Algoritmalar:
İlgili Mimariler:
Uygulayıcı Kütüphaneler: