| Выборка | Accuracy | Precision | Recall | F1 |
|---|---|---|---|---|
| Train | 0.9931 | 0.4590 | 0.9965 | 0.6285 |
| Val | 0.9940 | 0.6360 | 0.8199 | 0.7163 |
| Test | 0.9767 | 0.1116 | 0.5058 | 0.1829 |
Датасет включает 110 эпизодов различных сериалов с разметкой начала и конца заставки. При разделении данных на тренировочную (86 эпизодов), валидационную (13 эпизодов) и тестовую (11 эпизодов) выборки соблюдались следующие условия:
- Эпизоды одного сериала не попадали в одну и ту же выборку.
- Учитывалась продолжительность заставок.
- Учитывалось расстояние заставки от начала эпизода.
Из каждого видео извлекался один кадр в секунду, который подавался в предобученную модель CLIP, как описано в [2]. Полученные эмбеддинги передавались в двунаправленную LSTM (B-LSTM) [1]. Скрытые состояния LSTM затем проходили через полносвязный (FC) слой, преобразующий их в скалярное значение (score), определяющее, является ли кадр частью заставки.
Такой подход был выбран из-за:
- небольшого объема датасета,
- способности модели улавливать временные зависимости,
- простоты и эффективности вычислений.
Основная проблема при обучении модели — переобучение, предположительно вызванное малым объемом данных. Для достижения лучших результатов необходим более крупный и качественно аннотированный датасет.
[1] Hao X. et al. Intro and recap detection for movies and TV series. Proceedings of the IEEE/CVF Winter Conference on Applications of Computer Vision. 2021. pp. 167–176.
[2] Korolkov V., Yanchenko A. Automatic detection of intro and credits in video using CLIP and multihead attention. arXiv preprint arXiv:2504.09738. 2025.