DINOv3 встречается с YOLO26 для обнаружения сорняков в овощных культурах

DINOv3 Meets YOLO26 for Weed Detection in Vegetable Crops
Boyang Deng, Yuzhen Lu
2026-02-25

DINOv3YOLO26набор данных для обнаружения сорняков и культур (199 388 изображений)потеря выравнивания признаковvision transformer (ViT-small)
Разработка надёжных моделей для точного удаления сорняков в овощных культурах в настоящее время ограничена нехваткой крупномасштабных аннотированных наборов данных «сорняк–культура». Для решения этой проблемы в этом исследовании предлагается базовая модель обнаружения культур и сорняков путем интеграции разнородных наборов данных и использования самообучения (self-supervised learning). Всего было первоначально собрано 618 642 изображения культур и сорняков, которые затем были отфильтрованы до 199 388 изображений для дообучения визуального трансформера DINOv3 (ViT-small) с помощью последовательной стратегии курирования. Дообученная DINOv3 используется в качестве бэкбона в YOLO26 как основной бэкбон или в составе архитектуры с двумя бэкбонами. В рамках схемы с двумя бэкбонами введён функционал выравнивания признаков (feature alignment loss) для улучшения слияния признаков при минимальных вычислительных затратах. Экспериментальные результаты показывают, что предложенный YOLO26-large на базе ViT-small, дообученного DINOv3, обеспечил прирост mAP50 до +5,4% на изображениях внутри домена, собранных в сезоне 2025 года. Кроме того, модель продемонстрировала сильную кроссдоменную обобщаемость с повышением mAP50 на +14,0% на наборе данных за сезоны 2021–2023 годов и на +11,9% на наборе данных за сезон 2024 года по сравнению со стандартным YOLO26-large. При этом модель DINOv3–YOLO26-large имеет на 45,6% больше параметров и увеличивает задержку вывода в 2,9 раза, но сохраняет режим реального времени примерно 28,5 кадров в секунду (fps). Курированный набор данных и программное обеспечение, разработанные в этом исследовании, будут опубликованы в открытом доступе.
1
В архитектуре с двумя бэкабонами введен лосс выравнивания признаков, который улучшает слияние признаков при минимальных вычислительных затратах.
2
Стратегия последовательной курирования сократила 618 642 собранных изображений сорняков и культур до 199 388 отфильтрованных изображений для дообучения DINOv3 ViT-small.
3
YOLO26-large на базе дообученного DINOv3 ViT-small достиг прироста до +5.4% mAP50 на внутридоменных изображениях сезона 2025 по сравнению со стандартным YOLO26-large.
4
Дообученный DINOv3 ViT-small интегрирован в YOLO26 (в качестве одиночного или двойного бэкабона) для создания базовой модели обнаружения сорняков в овощных культурах.
5
Модель DINOv3-YOLO26-large имеет на 45.6% больше параметров и в 2.9 раза большую задержку вывода, но при этом работает в режиме реального времени примерно на 28.5 fps.
6
Курированный набор данных и программное обеспечение этого исследования будут опубликованы.
7
Модель продемонстрировала кросс-доменную обобщаемость с приростом +14.0% mAP50 на данных 2021–2023 годов и +11.9% на данных 2024 года по сравнению с YOLO26-large.

Поля овощных культур, содержащие культуры и сорняки, использованные для детекции (курируемый набор изображений «культура–сорняк»)

Эффективность и обобщающая способность модели обнаружения «культура–сорняк» с финетюнингом DINOv3 ViT-small, интегрированной в YOLO26 (как единый или двойной бэкон с loss выравнивания признаков), оцениваемые по mAP50, размеру модели и задержке инференса

Publication Details
Publication Date
2026-02-25
Journal
Publisher
ISSN
Cited by
0
Access Type
Author Information
Authors
Boyang Deng
Yuzhen Lu
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%