Российские ученые научили большие языковые модели (LLM) оценивать устройство трехмерных сцен и эффективно ориентироваться в них, сообщает ТАСС со ссылкой на Институт искусственного интеллекта AIRI.
Суть метода в обучении больших моделей учитывать пространственные и семантические связи между элементами пространства — от местоположения до размеров и способов использования. Эта функция полезна при анализе насыщенных объектами пространств (кухни, мастерской, офиса и т. д.) и расширяет применение LLM в робототехнике: роботы смогут не только определять предметы, но и понимать их связь друг с другом и с задачами пользователя, отметил ведущий научный сотрудник института Дмитрий Юдин.
Ученые обучили модели Vicuna-v1.5 и LLAMA3 на нескольких наборах реконструкций реальных помещений, на их комбинациях и подробных текстовых запросах к ним. В результате отечественная разработка на 10 % превзошла системы трехмерного зрения без LLM и более чем на 7 % улучшила точность распознавания объектов по текстовому описанию в сравнении с Chat-Scene.
Фактически метод российских ученых сопоставим с GPT4Scene, но обрабатывает запросы в 2–4 раза быстрее. Сейчас сотрудники AIRI работают над его внедрением в действующие робототехнические платформы.