Диагностика реранкеров на базе cross-encoder в условиях «холодного старта» рекомендаций: покрытие, сигналы оценки и эффекты экспозиции

Diagnosing Cross-Encoder Rerankers in Cold-Start Recommendation: Coverage, Score Signals, and Exposure Effects
Ekaterina Lemdiasova, Nikita Zmanovskii
2026-02-25

переранжировщики Cross-EncoderSerendipity-2018рекомендации при холодном стартепостобработка с учётом экспозицииrecall@K
Реранкинг с использованием cross-encoder (включая реранкеры, полученные с помощью больших языковых моделей) является популярной схемой для рекомендательных систем на основе извлечения, однако строгий холодный старт выявляет ключевое ограничение: реранкеры могут лишь переупорядочивать извлечённых кандидатов. Мы представляем эмпирическую диагностику cross-encoder реранкера в конвейере рекомендований фильмов в задаче холодного старта на наборе Serendipity-2018. В обновлённой оценке на 500 пользователей в холодном старте (3 семени) базовый подход на основе популярности значительно превосходит реранкинг (HR@10: 0.268 против 0.008; nDCG@10: 0.224 против 0.005). Диагностика показывает, что (i) истинные элементы часто находятся глубоко в пуле кандидатов (медианный ранг 6717), (ii) гибридная генерация кандидатов даёт низкий recall@K по сравнению с ANN-базами, и (iii) оценки реранкера едва коррелируют с релевантностью (критерий Спирмена r ≈ 0), тогда как экспозиция концентрируется на небольшом числе элементов. Чтобы отразить изменение алгоритма, приведшее к новым результатам, мы также включаем компактное сравнение с ранним пилотным прогоном (30 пользователей/семя), чтобы показать, как масштабирование и логика извлечения/выбора кандидатов изменяют наблюдаемое качество. В заключение предлагаем практические шаги по смягчению проблемы: в первую очередь усилить компонент извлечения, настроить размер пула кандидатов, калибровать оценки и применить постобработку с учётом экспозиции.
1
Эталонные релевантные элементы часто находятся очень низко в пуле кандидатов (медианный ранг эталона 6717), что ограничивает возможности перерангировщика.
2
Гибридная генерация кандидатов демонстрирует низкий recall@K по сравнению с ANN-базами, уменьшая шансы, что перерангировщик выведет релевантные элементы.
3
В холодном старте рекомендаций фильмов на Serendipity-2018 базовый популярностный метод значительно превосходит Cross-Encoder перерангировщик (HR@10: 0.268 против 0.008; nDCG@10: 0.224 против 0.005).
4
Практические меры: усилить этап поиска/извлечения, увеличить/настроить размер пула кандидатов, откалибровать оценки перерангировщика и применить постобработку с учётом экспозиции.
5
Оценки перерангировщика почти не коррелируют с релевантностью (Спирмен r ≈ 0), а экспозиция концентрируется на небольшом подмножестве элементов.

Кросс-энкодерный ранкер в конвейере рекомендаций фильмов в условиях холодного старта (на датасете Serendipity-2018)

Диагностическая оценка эффективности ранкера в рекомендациях при холодном старте, включая покрытие/recall кандидатов, корреляцию оценок ранкера с релевантностью, концентрацию экспозиции и влияние на качество ранжирования в топ-K

Publication Details
Publication Date
2026-02-25
Journal
Publisher
ISSN
Cited by
0
Access Type
Author Information
Authors
Ekaterina Lemdiasova
Nikita Zmanovskii
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%