Задачи трёхмерного компьютерного зрения на семинаре
На нашем семинаре мы уже довольно давно работаем с так называемыми облаками точек. Они представляют собой трёхмерные изображения, которые формируются lidar-сканерами. Физически это неупорядоченные наборы точек с координатами (x, y, z). Облако точек, полученное при сканировании комнаты, выглядит примерно так (картинка из статьи C. Sok, M. Adams "Visually Aided Feature Extraction from 3D Range Data"):

Мы рассматриваем самые разные задачи, от простых - удаление шума - до более сложных: распознавание ("что перед нами") и сегментации ("из каких частей оно состоит"). Все они естественным образом используют параллельные вычисления, поскольку современные сканеры порождают облака из сотен тысяч и даже миллионов точек.
Недавно у нас появились задачи, связанные со зрением роботов:
- поиск точки подвеса предмета - необходимо определить точку на предмете, за которую предмет может быть подвешен на штыре;
- построение траектории робота с использованием только данных лидара.
Начали использовать методы машинного обучения, например, исследуем нейросети PointNet и PointNet++. Это весьма интересное направление, т.к. долгое время вообще было непонятно, как учиться на сырых облаках точек. Ведь это абсолютно неупорядоченная структура данных, в ней нет никаких связей. Поэтому считалось необходимым сначала преобразовать облако в более высокоуровневое представление (воксельное изображение, например), а потом уже обучать модель глубокого обучения. И только с появлением PointNet началась история машинного обучения непосредственно на облаках точек.
Если появилось желание глубже погрузиться в тему - читайте дальше
Трёхмерные изображения
Существует много способов представления трёхмерного объекта в цифровом виде:
- облако точек - представление самого низкого уровня, неупорядоченный набор точек трёхмерного пространства;
- полигональная модель - точки соединены рёбрами, т.е. есть информация о соседстве точек;
- воксельное изображение - состоит из трёхмерных кубических элементов (по аналогии с плоскими пикселами)