Vision-Action Data Factory
Генерация данных для обучения роботов
Генерация данных для обучения роботов
Для решения задачи Участники самостоятельно загружают робототехнические и эгоцентрические данные из следующих открытых источников:
b96f7216e3cff58007884656a81584c857c185aefc006b5dc812220645a2e6dd0b68a0a03bd0ac6cd54542e0eebf8084edb10e2c67ef5b94bd41fcc4fae604b751b25337d6fd8c4c53e595910c28f68fДанные содержат робототехнические эпизоды и эгоцентрические видеозаписи, которые могут использоваться для построения vision-language датасета. Итоговый датасет для дообучения VLM должен быть представлен в формате ShareGPT JSONL. Требования к его структуре и пример записи приведены в документации participant.zip.
Участникам также предоставляются следующие материалы:
baseline.zip — базовый пайплайн автоматической разметки изображений с использованием YOLOv8, SAM2 и VLM;participant.zip — код для дообучения SmolVLM2 на созданном ShareGPT JSONL, последующего обучения action-эксперта SmolVLA и локальной проверки решения;submission.zip — пример структуры итогового решения, загружаемого на платформу.baseline.zip
Базовый пайплайн автоматической разметки изображений с использованием YOLOv8, SAM2 и VLM
participant.zip
Код для дообучения SmolVLM2 на созданном ShareGPT JSONL, последующего обучения action-эксперта SmolVLA и локальной проверки решения
submission.zip
Пример структуры итогового решения, загружаемого на платформу