Диагностика реранкеров на базе cross-encoder в условиях «холодного старта» рекомендаций: покрытие, сигналы оценки и эффекты экспозиции
Diagnosing Cross-Encoder Rerankers in Cold-Start Recommendation: Coverage, Score Signals, and Exposure Effects
2026-02-25
SCID: 54.1/keuy9nru
Discuss with AI
переранжировщики Cross-EncoderSerendipity-2018рекомендации при холодном стартепостобработка с учётом экспозицииrecall@K
Figures from the paper
Abstract (AI)
Реранкинг с использованием cross-encoder (включая реранкеры, полученные с помощью больших языковых моделей) является популярной схемой для рекомендательных систем на основе извлечения, однако строгий холодный старт выявляет ключевое ограничение: реранкеры могут лишь переупорядочивать извлечённых кандидатов. Мы представляем эмпирическую диагностику cross-encoder реранкера в конвейере рекомендований фильмов в задаче холодного старта на наборе Serendipity-2018. В обновлённой оценке на 500 пользователей в холодном старте (3 семени) базовый подход на основе популярности значительно превосходит реранкинг (HR@10: 0.268 против 0.008; nDCG@10: 0.224 против 0.005). Диагностика показывает, что (i) истинные элементы часто находятся глубоко в пуле кандидатов (медианный ранг 6717), (ii) гибридная генерация кандидатов даёт низкий recall@K по сравнению с ANN-базами, и (iii) оценки реранкера едва коррелируют с релевантностью (критерий Спирмена r ≈ 0), тогда как экспозиция концентрируется на небольшом числе элементов. Чтобы отразить изменение алгоритма, приведшее к новым результатам, мы также включаем компактное сравнение с ранним пилотным прогоном (30 пользователей/семя), чтобы показать, как масштабирование и логика извлечения/выбора кандидатов изменяют наблюдаемое качество. В заключение предлагаем практические шаги по смягчению проблемы: в первую очередь усилить компонент извлечения, настроить размер пула кандидатов, калибровать оценки и применить постобработку с учётом экспозиции.
Key Findings
1
Эталонные релевантные элементы часто находятся очень низко в пуле кандидатов (медианный ранг эталона 6717), что ограничивает возможности перерангировщика.
2
Гибридная генерация кандидатов демонстрирует низкий recall@K по сравнению с ANN-базами, уменьшая шансы, что перерангировщик выведет релевантные элементы.
3
В холодном старте рекомендаций фильмов на Serendipity-2018 базовый популярностный метод значительно превосходит Cross-Encoder перерангировщик (HR@10: 0.268 против 0.008; nDCG@10: 0.224 против 0.005).
4
Практические меры: усилить этап поиска/извлечения, увеличить/настроить размер пула кандидатов, откалибровать оценки перерангировщика и применить постобработку с учётом экспозиции.
5
Оценки перерангировщика почти не коррелируют с релевантностью (Спирмен r ≈ 0), а экспозиция концентрируется на небольшом подмножестве элементов.
Research Object
Кросс-энкодерный ранкер в конвейере рекомендаций фильмов в условиях холодного старта (на датасете Serendipity-2018)
Research Subject
Диагностическая оценка эффективности ранкера в рекомендациях при холодном старте, включая покрытие/recall кандидатов, корреляцию оценок ранкера с релевантностью, концентрацию экспозиции и влияние на качество ранжирования в топ-K
Publication Details
Publication Date
2026-02-25
Journal
Publisher
ISSN
Cited by
0
Open access PDF
Access Type
Author Information
Download PDF
Subscribe to digest