Skip to content

Latest commit

 

History

1 Commit

Folders and files

NameName
Last commit message
Last commit date
 
 
 
 
 
 
 
 

Repository files navigation

Модель детекции заставок в эпизодах сериалов

Метрики на датасете из репозитория

Выборка Accuracy Precision Recall F1
Train 0.9931 0.4590 0.9965 0.6285
Val 0.9940 0.6360 0.8199 0.7163
Test 0.9767 0.1116 0.5058 0.1829

Датасет

Датасет включает 110 эпизодов различных сериалов с разметкой начала и конца заставки. При разделении данных на тренировочную (86 эпизодов), валидационную (13 эпизодов) и тестовую (11 эпизодов) выборки соблюдались следующие условия:

  • Эпизоды одного сериала не попадали в одну и ту же выборку.
  • Учитывалась продолжительность заставок.
  • Учитывалось расстояние заставки от начала эпизода.

Архитектура модели

Из каждого видео извлекался один кадр в секунду, который подавался в предобученную модель CLIP, как описано в [2]. Полученные эмбеддинги передавались в двунаправленную LSTM (B-LSTM) [1]. Скрытые состояния LSTM затем проходили через полносвязный (FC) слой, преобразующий их в скалярное значение (score), определяющее, является ли кадр частью заставки.

Такой подход был выбран из-за:

  • небольшого объема датасета,
  • способности модели улавливать временные зависимости,
  • простоты и эффективности вычислений.

Выводы и дальнейшая работа

Основная проблема при обучении модели — переобучение, предположительно вызванное малым объемом данных. Для достижения лучших результатов необходим более крупный и качественно аннотированный датасет.


Источники

[1] Hao X. et al. Intro and recap detection for movies and TV series. Proceedings of the IEEE/CVF Winter Conference on Applications of Computer Vision. 2021. pp. 167–176.
[2] Korolkov V., Yanchenko A. Automatic detection of intro and credits in video using CLIP and multihead attention. arXiv preprint arXiv:2504.09738. 2025.

About

No description, website, or topics provided.

Resources

Stars

0 stars

Watchers

0 watching

Forks

Releases

Packages

Contributors

Languages