DINOv3 встречается с YOLO26 для обнаружения сорняков в овощных культурах
DINOv3 Meets YOLO26 for Weed Detection in Vegetable Crops
2026-02-25
SCID: 54.1/a42un5hf
Discuss with AI
DINOv3YOLO26набор данных для обнаружения сорняков и культур (199 388 изображений)потеря выравнивания признаковvision transformer (ViT-small)
Figures from the paper
Abstract (AI)
Разработка надёжных моделей для точного удаления сорняков в овощных культурах в настоящее время ограничена нехваткой крупномасштабных аннотированных наборов данных «сорняк–культура». Для решения этой проблемы в этом исследовании предлагается базовая модель обнаружения культур и сорняков путем интеграции разнородных наборов данных и использования самообучения (self-supervised learning). Всего было первоначально собрано 618 642 изображения культур и сорняков, которые затем были отфильтрованы до 199 388 изображений для дообучения визуального трансформера DINOv3 (ViT-small) с помощью последовательной стратегии курирования. Дообученная DINOv3 используется в качестве бэкбона в YOLO26 как основной бэкбон или в составе архитектуры с двумя бэкбонами. В рамках схемы с двумя бэкбонами введён функционал выравнивания признаков (feature alignment loss) для улучшения слияния признаков при минимальных вычислительных затратах. Экспериментальные результаты показывают, что предложенный YOLO26-large на базе ViT-small, дообученного DINOv3, обеспечил прирост mAP50 до +5,4% на изображениях внутри домена, собранных в сезоне 2025 года. Кроме того, модель продемонстрировала сильную кроссдоменную обобщаемость с повышением mAP50 на +14,0% на наборе данных за сезоны 2021–2023 годов и на +11,9% на наборе данных за сезон 2024 года по сравнению со стандартным YOLO26-large. При этом модель DINOv3–YOLO26-large имеет на 45,6% больше параметров и увеличивает задержку вывода в 2,9 раза, но сохраняет режим реального времени примерно 28,5 кадров в секунду (fps). Курированный набор данных и программное обеспечение, разработанные в этом исследовании, будут опубликованы в открытом доступе.
Key Findings
1
В архитектуре с двумя бэкабонами введен лосс выравнивания признаков, который улучшает слияние признаков при минимальных вычислительных затратах.
2
Стратегия последовательной курирования сократила 618 642 собранных изображений сорняков и культур до 199 388 отфильтрованных изображений для дообучения DINOv3 ViT-small.
3
YOLO26-large на базе дообученного DINOv3 ViT-small достиг прироста до +5.4% mAP50 на внутридоменных изображениях сезона 2025 по сравнению со стандартным YOLO26-large.
4
Дообученный DINOv3 ViT-small интегрирован в YOLO26 (в качестве одиночного или двойного бэкабона) для создания базовой модели обнаружения сорняков в овощных культурах.
5
Модель DINOv3-YOLO26-large имеет на 45.6% больше параметров и в 2.9 раза большую задержку вывода, но при этом работает в режиме реального времени примерно на 28.5 fps.
6
Курированный набор данных и программное обеспечение этого исследования будут опубликованы.
7
Модель продемонстрировала кросс-доменную обобщаемость с приростом +14.0% mAP50 на данных 2021–2023 годов и +11.9% на данных 2024 года по сравнению с YOLO26-large.
Research Object
Поля овощных культур, содержащие культуры и сорняки, использованные для детекции (курируемый набор изображений «культура–сорняк»)
Research Subject
Эффективность и обобщающая способность модели обнаружения «культура–сорняк» с финетюнингом DINOv3 ViT-small, интегрированной в YOLO26 (как единый или двойной бэкон с loss выравнивания признаков), оцениваемые по mAP50, размеру модели и задержке инференса
Publication Details
Publication Date
2026-02-25
Journal
Publisher
ISSN
Cited by
0
Open access PDF
Access Type
Author Information
Download PDF
Subscribe to digest