> ML_LITERATURE // BROHAN-2023-RT-2-VISION-LANGUAGE-ACTION-MODELS-ROBOTIC-CONTROL_v1.0
RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
Anthony Brohan, Noah Brown, Justice Carbajal, Yevgen Chebotar, Xi Chen, Krzysztof Choromanski, Tianli Ding, Danny Driess, Avinava Dubey, Chelsea Finn, Pete Florence, Chuyuan Fu, Montse Gonzalez Arenas, Keerthana Gopalakrishnan, Kehang Han, Karol Hausman, Alex Herzog, Jasmine Hsu, Brian Ichter, Alex Irpan, Nikhil Joshi, Ryan Julian, Dmitry Kalashnikov, Yuheng Kuang, Isabel Leal, Jacky Liang, Xinlei Lu, Kanishka Rao, Michael Ryoo, Quan Vuong, Vincent Vanhoucke, Fei Xia, Ted Xiao, Peng Xu, Sichun Xu, Tianhe Yu, Brianna Zitkovich · Conference on Robot Learning (CoRL) (2023)
Temel Katkı (Principal Contribution)
Görsel-dil modellerini doğrudan robot eylem belirteçleri üzerinde birlikte ince ayarlayarak internet ölçeğindeki anlamsal akıl yürütmeyi fiziksel robot kontrolüne aktardı.
Operasyonel ve Mühendislik Uygunluğu
task-robotics, task-multimodal için yetkili teorik ve sistem temeli olarak hizmet eder.
Temel Varsayımlar (Assumptions)
- Hedef değerlendirme ortamlarında Markovian durum dinamikleri ve durağan ödül fonksiyonları geçerlidir
Kısıtlar ve Sınırlamalar (Limitations)
- Örneklem verimliliği, keşif kararlılığı ve simülasyondan gerçeğe transfer boşlukları özel ayarlama gerektirir
