Skip to main content

> ML_LITERATURE // BROHAN-2023-RT-2-VISION-LANGUAGE-ACTION-MODELS-ROBOTIC-CONTROL_v1.0

RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control

Anthony Brohan, Noah Brown, Justice Carbajal, Yevgen Chebotar, Xi Chen, Krzysztof Choromanski, Tianli Ding, Danny Driess, Avinava Dubey, Chelsea Finn, Pete Florence, Chuyuan Fu, Montse Gonzalez Arenas, Keerthana Gopalakrishnan, Kehang Han, Karol Hausman, Alex Herzog, Jasmine Hsu, Brian Ichter, Alex Irpan, Nikhil Joshi, Ryan Julian, Dmitry Kalashnikov, Yuheng Kuang, Isabel Leal, Jacky Liang, Xinlei Lu, Kanishka Rao, Michael Ryoo, Quan Vuong, Vincent Vanhoucke, Fei Xia, Ted Xiao, Peng Xu, Sichun Xu, Tianhe Yu, Brianna Zitkovich · Conference on Robot Learning (CoRL) (2023)

seminal-architecture2023foundationalthirdPartyReproduced

Temel Katkı (Principal Contribution)

Görsel-dil modellerini doğrudan robot eylem belirteçleri üzerinde birlikte ince ayarlayarak internet ölçeğindeki anlamsal akıl yürütmeyi fiziksel robot kontrolüne aktardı.

Operasyonel ve Mühendislik Uygunluğu

task-robotics, task-multimodal için yetkili teorik ve sistem temeli olarak hizmet eder.

Temel Varsayımlar (Assumptions)

  • Hedef değerlendirme ortamlarında Markovian durum dinamikleri ve durağan ödül fonksiyonları geçerlidir

Kısıtlar ve Sınırlamalar (Limitations)

  • Örneklem verimliliği, keşif kararlılığı ve simülasyondan gerçeğe transfer boşlukları özel ayarlama gerektirir

Bağlantılı Algoritmalar, Mimariler ve Kütüphaneler

İlgili Algoritmalar:
İlgili Mimariler:
Uygulayıcı Kütüphaneler: