Ключевые слова: геолокация изображений, сверточные нейросети, resNet, анализ городских сцен, глубокая регрессия, визуализация внимания, smooth Grad‑CAM, mapillary
УДК 004.93
DOI: 10.26102/2310-6018/2026.58.7.016
Актуальность исследования обусловлена ростом объемов уличных снимков и необходимостью их автоматической географической привязки без использования GPS-метаданных. В связи с этим статья направлена на оценку возможности определения координат фотографий в пределах одного города с помощью глубоких нейросетей. Ведущим методом исследования является применение сверточных нейросетей ResNet18 и ResNet50 для регрессии широты и долготы по кадрам размером 512×512 пикселей. Для сбора данных использована открытая платформа Mapillary, а для равномерного покрытия территории Уфы разработана программа с разбиением города на сетку из 10 000 ячеек. Всего собрано 88 798 изображений с точной привязкой к координатам. В статье представлены количественные результаты обучения моделей. Модель на базе ResNet50 достигает медианной ошибки локализации около 3,1 км после 13 эпох, при этом 92,6 % предсказаний попадают в радиус 10 км от истинного положения. Методом Smooth Grad‑CAM визуализированы области, на которые модель опирается при определении координат; показано, что модель фокусируется на фасадах зданий, перекрестках и дорожной разметке. Материалы статьи представляют практическую ценность для систем автоматической геопривязки больших массивов уличных фотографий. Работа также предлагает воспроизводимый пайплайн для городской геолокации и анализирует поведенческое внимание нейросетей в данной задаче.
1. Weyand T., Kostrikov I., Philbin J. PlaNet – Photo Geolocation with Convolutional Neural Networks. In: Proceedings of the Computer Vision – ECCV 2016: 14th European Conference, 11–14 October 2016, Amsterdam, Netherlands. Cham: Springer; 2016. P. 37–55. https://doi.org/10.1007/978-3-319-46484-8_3
2. Hays J., Efros A.A. IM2GPS: estimating geographic information from a single image. In: Proceedings of the 2008 IEEE Conference on Computer Vision and Pattern Recognition, 23–28 June 2008, Anchorage, AK, USA. IEEE; 2008. P. 1–8. https://doi.org/10.1109/CVPR.2008.4587784
3. Workman S., Jacobs N. On the location dependence of convolutional neural network features. In: Proceedings of the 2015 IEEE Conference on Computer Vision and Pattern Recognition Workshops (CVPRW), 7–12 June 2015, Boston, MA, USA. IEEE; 2015. P. 70–78. https://doi.org/10.1109/CVPRW.2015.7301385
4. Melekhov I., Kannala J., Rahtu E. Siamese network features for image matching. In: Proceedings of the 2016 23rd International Conference on Pattern Recognition (ICPR), 4–8 December 2016, Cancún, Mexico. IEEE; 2016. P. 378–383. https://doi.org/10.1109/ICPR.2016.7899663
5. Hou Y., Quintana M., Khomiakov M., et al. Global Streetscapes – a comprehensive dataset of 10 million street-level images across 688 cities for urban science and analytics. ISPRS Journal of Photogrammetry and Remote Sensing. 2024;215:216–238. https://doi.org/10.1016/j.isprsjprs.2024.06.023
6. Chattopadhyay A., Sarkar A., Howlader P., et al. Grad-CAM++: Generalized Gradient-Based Visual Explanations for Deep Convolutional Networks. In: Proceedings of the 2018 IEEE Winter Conference on Applications of Computer Vision (WACV), 12–15 March 2018, Lake Tahoe, NV, USA. IEEE; 2018. P. 839–847. https://doi.org/10.1109/WACV.2018.00097
7. He K., Zhang X., Ren S., et al. Deep Residual Learning for Image Recognition. In: Proceedings of the 2016 IEEE Conference on Computer Vision and Pattern Recognition (CVPR), 27–30 June 2016, Las Vegas, NV, USA. IEEE; 2016. P. 770–778. https://doi.org/10.1109/CVPR.2016.90
8. Wu Z., Shen C., Van Den Hengel A. Wider or Deeper: Revisiting the ResNet Model for Visual Recognition. Pattern Recognition. 2019;90:119–133. https://doi.org/10.1016/j.patcog.2019.01.006
9. Selvaraju R.R., Cogswell M., Das A., et al. Grad-CAM: Visual Explanations from Deep Networks via Gradient-Based Localization. International Journal of Computer Vision. 2020;128(2):336–359. https://doi.org/10.1007/s11263-019-01228-7
10. Shimizu T., Nagata F., Arima K., et al. Enhancing defective region visualization in industrial products using Grad-CAM and random masking data augmentation. Artificial Life and Robotics. 2024;29:62–69. https://doi.org/10.1007/s10015-023-00913-8
11. Müller-Budack E., Pustu-Iren K., Ewerth R. Geolocation Estimation of Photos Using a Hierarchical Model and Scene Classification. In: Proceedings of the 15th European Conference, 8–14 September 2018, Munich, Germany. Cham: Springer; 2018. P. 575–592. https://doi.org/10.1007/978-3-030-01258-8_35
Ключевые слова: геолокация изображений, сверточные нейросети, resNet, анализ городских сцен, глубокая регрессия, визуализация внимания, smooth Grad‑CAM, mapillary
Для цитирования: Басханов А.Р. Определение геолокации по кадрам видеорегистратора с использованием ResNet. Моделирование, оптимизация и информационные технологии. 2026;14(7). URL: https://moitvivt.ru/ru/journal/article?id=2399 DOI: 10.26102/2310-6018/2026.58.7.016
© Басханов А.Р. Статья опубликована на условиях лицензии Creative Commons Attribution-NonCommercial 4.0 International (CC BY-NS 4.0)Поступила в редакцию 03.05.2026
Поступила после рецензирования 26.06.2026
Принята к публикации 17.07.2026