Сверточно-темпоральная нейронная сеть с контрастивным обучением InfoNCE для аудиовизуальной синхронизации по артикуляции говорящего
(Стр. 250-258)
Подробнее об авторах
Шакирзянов Марсель Эдуардович
аспирант, кафедра компьютерных систем, .
Казанский национальный исследовательский технический университет им. А.Н. Туполева – КАИ
г. Казань, Республика Татарстан, Российская Федерация Гибадуллин Руслан Фаршатович кандидат технических наук, доцент; доцент, кафедра компьютерных систем; Казанский национальный исследовательский технический университет им. А.Н. Туполева – КАИ; г. Казань, Республика Татарстан, Российская Федерация
Казанский национальный исследовательский технический университет им. А.Н. Туполева – КАИ
г. Казань, Республика Татарстан, Российская Федерация Гибадуллин Руслан Фаршатович кандидат технических наук, доцент; доцент, кафедра компьютерных систем; Казанский национальный исследовательский технический университет им. А.Н. Туполева – КАИ; г. Казань, Республика Татарстан, Российская Федерация
Аннотация:
Предложена сверточно-темпоральная нейронная сеть сиамской организации, рассчитанная на автоматическое выравнивание во времени аудиопотока и видеопотока, на которых записан говорящий. Обучение ведется с контрастивной потерей InfoNCE в симметричной форме, причем отрицательные примеры формируются неявно – за счет перекрестных пар внутри мини-батча, что напрямую максимизирует нижнюю оценку взаимной информации между двумя модальностями. В каждой ветви сети покадровый пространственный экстрактор соединен с одномерным темпоральным процессором с резидуальными связями и с проекционным слоем, выдающим L2-нормированный вектор размерностью 256. Общее число обучаемых параметров – 2,25 млн, что в 2,5 раза меньше, чем у исходной SyncNet, и почти на порядок меньше, чем у AV-HuBERT-base. На тестовой выборке из 47 видеороликов общей длительностью 6,8 ч переход с попарной BCE-потери на InfoNCE поднял Top-1 retrieval с 87,3 до 95,1%, среднюю абсолютную ошибку определения смещения снизил с 64 до 38 мс, а количество эпох до выхода обучения на плато сократил почти вдвое. По точности определения смещения разработанная модель опережает как открытую реализацию SyncNet, так и проприетарный Sync Audio в DaVinci Resolve, оставаясь при этом существенно более компактной по числу параметров.
Образец цитирования:
ОБРАЗЕЦ ЦИТИРОВАНИЯ: Шакирзянов М.Э., Гибадуллин Р.Ф. Сверточно-темпоральная нейронная сеть с контрастивным обучением InfoNCE для аудиовизуальной синхронизации по артикуляции говорящего // Computational Nanotechnology. 2026. Т. 13. № 2. С. 250-258. DOI: 10.33693/2313-223X-2026-13-2-250-258. EDN: XYBXTU
Список литературы:
Arandjelović R., Zisserman A. Look, listen and learn. In: 2017 IEEE International Conference on Computer Vision (ICCV). 2017. Pp. 609–617. DOI: 10.1109/ICCV.2017.73.
Chung J., Zisserman A. Out of time: Automated lip sync in the wild. 2016. Pp. 251–263. DOI: 10.1007/978-3-319-54427-4_19.
Ge S., Mishra S., Kornblith S. et al. Hyperbolic contrastive learning for visual representations beyond objects. In: 2023 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR). 2023. Pp. 6840–6849. DOI: 10.1109/CVPR52729.2023.00661.
Gibadullin R., Perukhin M., Ilin A. Speech recognition and machine translation using neural networks. In: 2021 International Conference on Industrial Engineering, Applications and Manufacturing (ICIEAM). 2021. Pp. 398–403. DOI: 10.1109/ICIEAM51226.2021.9446474.
He K., Fan H., Wu Y. et al. Momentum contrast for unsupervised visual representation learning. In: 2020 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR). 2020. Pp. 9726–9735. DOI: 10.1109/CVPR42600.2020.00975.
Karpov A., Ronzhin A. A universal assistive technology with multimodal input and multimedia output interfaces. 2014. Pp. 369–378. DOI: 10.1007/978-3-319-07437-5_35.
Karpov A., Ronzhin A., Kipyatkova I. An assistive bi-modal user interface integrating multi-channel speech recognition and computer vision. 2011. Pp. 454–463. DOI: 10.1007/978-3-642-21605-3_50.
Khosla A., Khandnor P., Chand T. A comparative analysis of signal processing and classification methods for different applications based on EEG signals. Biocybernetics and Biomedical Engineering. 2020. Vol. 40. Pp. 649–690. DOI: 10.1016/j.bbe.2020.02.002.
Orak C., Turan Z. Using artificial intelligence in digital video production: A systematic review study. Journal of Educational Technology and Online Learning. 2024. DOI: 10.31681/jetol.1459434.
Peregudov A., Glasman K., Logunov A. Relative timing of sound and vision: evaluation and correction. In: Proceedings of the Ninth International Symposium on Consumer Electronics (ISCE 2005). 2005. Pp. 198–202. DOI: 10.1109/ISCE.2005.1502369.
Prajwal K., Mukhopadhyay R., Namboodiri V., Jawahar C. A lip sync expert is all you need for speech to lip generation in the wild. In: Proceedings of the 28th ACM International Conference on Multimedia. 2020. DOI: 10.1145/3394171.3413532.
Radford J., Joseph K. Theory in, theory out: The uses of social theory in machine learning for social science. Frontiers in Big Data. 2020. Vol. 3. DOI: 10.3389/fdata.2020.00018.
Schroff F., Kalenichenko D., Philbin J. FaceNet: A unified embedding for face recognition and clustering. In: 2015 IEEE Conference on Computer Vision and Pattern Recognition (CVPR). 2015. Pp. 815–823. DOI: 10.1109/CVPR.2015.7298682.
Waddell J. Audio/Video synchronization in compressed systems: A status report. 2009. DOI: 10.5594/J11397.
Wang L., Kawakami K., van den Oord A. Contrastive predictive coding of audio with an adversary. 2020. Pp. 826–830. DOI: 10.21437/Interspeech.2020-1891.
Chung J., Zisserman A. Out of time: Automated lip sync in the wild. 2016. Pp. 251–263. DOI: 10.1007/978-3-319-54427-4_19.
Ge S., Mishra S., Kornblith S. et al. Hyperbolic contrastive learning for visual representations beyond objects. In: 2023 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR). 2023. Pp. 6840–6849. DOI: 10.1109/CVPR52729.2023.00661.
Gibadullin R., Perukhin M., Ilin A. Speech recognition and machine translation using neural networks. In: 2021 International Conference on Industrial Engineering, Applications and Manufacturing (ICIEAM). 2021. Pp. 398–403. DOI: 10.1109/ICIEAM51226.2021.9446474.
He K., Fan H., Wu Y. et al. Momentum contrast for unsupervised visual representation learning. In: 2020 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR). 2020. Pp. 9726–9735. DOI: 10.1109/CVPR42600.2020.00975.
Karpov A., Ronzhin A. A universal assistive technology with multimodal input and multimedia output interfaces. 2014. Pp. 369–378. DOI: 10.1007/978-3-319-07437-5_35.
Karpov A., Ronzhin A., Kipyatkova I. An assistive bi-modal user interface integrating multi-channel speech recognition and computer vision. 2011. Pp. 454–463. DOI: 10.1007/978-3-642-21605-3_50.
Khosla A., Khandnor P., Chand T. A comparative analysis of signal processing and classification methods for different applications based on EEG signals. Biocybernetics and Biomedical Engineering. 2020. Vol. 40. Pp. 649–690. DOI: 10.1016/j.bbe.2020.02.002.
Orak C., Turan Z. Using artificial intelligence in digital video production: A systematic review study. Journal of Educational Technology and Online Learning. 2024. DOI: 10.31681/jetol.1459434.
Peregudov A., Glasman K., Logunov A. Relative timing of sound and vision: evaluation and correction. In: Proceedings of the Ninth International Symposium on Consumer Electronics (ISCE 2005). 2005. Pp. 198–202. DOI: 10.1109/ISCE.2005.1502369.
Prajwal K., Mukhopadhyay R., Namboodiri V., Jawahar C. A lip sync expert is all you need for speech to lip generation in the wild. In: Proceedings of the 28th ACM International Conference on Multimedia. 2020. DOI: 10.1145/3394171.3413532.
Radford J., Joseph K. Theory in, theory out: The uses of social theory in machine learning for social science. Frontiers in Big Data. 2020. Vol. 3. DOI: 10.3389/fdata.2020.00018.
Schroff F., Kalenichenko D., Philbin J. FaceNet: A unified embedding for face recognition and clustering. In: 2015 IEEE Conference on Computer Vision and Pattern Recognition (CVPR). 2015. Pp. 815–823. DOI: 10.1109/CVPR.2015.7298682.
Waddell J. Audio/Video synchronization in compressed systems: A status report. 2009. DOI: 10.5594/J11397.
Wang L., Kawakami K., van den Oord A. Contrastive predictive coding of audio with an adversary. 2020. Pp. 826–830. DOI: 10.21437/Interspeech.2020-1891.
Ключевые слова:
аудиовизуальная синхронизация, контрастивное обучение, InfoNCE, сиамская нейронная сеть, кросс-модальные эмбеддинги, артикуляция, глубокое обучение, мелспектрограмма, лицевые ландмарки, SyncNet.