STSyn-BEV: сегментация BEV с Surround-View фишай-камер посредством пространственно-временной синхронизации

STSyn-BEV: BEV segmentation from surround-view fisheye cameras via spatio-temporal synchronization
Ping Liu, Xuan Shao, Le Huang
2026-03-09

BEV сегментациядатасет FB-SSEMPose-Sync энкодервнимание для глобального выводасверточное уточнение структурыгетерогенные путиулучшение mIoUконтрастное обучение на уровне регионовсемантическое согласующее обучениепространственно-временная синхронизациядекодер с поэтапным контролемкамеры с рыбий глаз с обзором вокруг
Семантическая сегментация в виде обзора сверху (Bird’s-Eye-View, BEV) критична для восприятия окружающей среды в системах автономного вождения. Системы с круговым обзором на фишай-камерах всё чаще применяются для расширения зоны восприятия и устранения слепых зон. Однако сильные геометрические искажения и частые собственные движения платформы затрудняют точное пространственно-временное выравнивание признаков между несколькими видами и временными метками. Такое несоответствие часто приводит к семантической непоследовательности и значительному падению точности сегментации в BEV. Более того, большинство существующих методов игнорируют эти ошибки выравнивания и применяют семантическое обучение только к финальному выходу, что приводит к неоптимальным промежуточным BEV-представлениям. Для решения этих задач мы предлагаем STSyn-BEV — архитектуру для сегментации BEV с пространственно-временной синхронизацией для surround-view фишай-камер. Она включает три ключевых компонента: энкодер Pose-Sync (синхронизированный по позе), модуль семантического согласования и декодер со ступенчатым обучением и гетерогенными путями. Во-первых, энкодер Pose-Sync явно преобразует многоракурсные фишай-признаки из предыдущих поз и временных меток в единое BEV-пространство посредством геометрического преобразования, существенно улучшая геометрическую согласованность и временную синхронизацию. Во-вторых, модуль семантического согласования применяет контрастное обучение на уровне регионов к агрегированным BEV-признакам, усиливая семантическую различимость, особенно для редких (long-tailed) категорий. В-третьих, глубоко супервайзенный декодер использует гетерогенные пути — на основе внимания для глобального семантического вывода и на основе свёрток для тонкой структурной доработки — управляемые ступенчатым обучением, что позволяет улучшить декодирование BEV-признаков без дополнительных вычислительных затрат при инференсе. Обширные эксперименты на датасете FB-SSEM показывают, что STSyn-BEV превосходит современные методы сегментации BEV на основе фишай-изображений, в частности достигая улучшения mIoU на 6.25% по сравнению с лучшей фишай-специфичной базовой моделью.
1
Глубоко контролируемый декодер с гетерогенными путями (на основе внимания для глобальной семантики и сверточный для тонкой структурной детализации) и поэтапным надзором улучшает декодирование BEV-признаков без дополнительных затрат на инференс.
2
Модуль семантического согласования использует контрастное обучение на уровне регионов для агрегированных BEV-признаков, повышая семантическую дискриминацию и особенно помогая редко встречающимся классам.
3
На датасете FB-SSEM STSyn-BEV превосходит современные методы BEV-сегментации для фишай-изображений, достигнув улучшения mIoU на 6.25% по сравнению с сильнейшей специализированной фишай-базой.
4
STSyn-BEV — это рамочная модель для BEV-сегментации со спатио-временной синхронизацией, разработанная для окружающих фишай-камер с целью решения проблем геометрических искажений и смещения из-за эго-движения.
5
Pose-Sync энкодер геометрически преобразует многовидовые фишай-признаки из предыдущих поз и временных меток в унифицированное BEV-пространство, существенно улучшая геометрическую согласованность и временную выравненность.

Система семантической сегментации в виде Bird’s-Eye-View (BEV) на основе окружающего обзора с фишай-камер для автономного вождения

Пространственно-временная синхронизация и улучшенное семантическое согласование BEV-фичей (включая позо-синхронизированный энкодер, контрастивное обучение на уровне регионов и поэтапное неоднородное декодирование) для повышения точности BEV-сегментации

Publication Details
Publication Date
2026-03-09
Journal
Publisher
ISSN
Cited by
0
Access Type
Author Information
Authors
Ping Liu
Xuan Shao
Le Huang
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%