АНАЛИЗ ВОЗМОЖНОСТИ ПРИМЕНЕНИЯ МОДЕЛЕЙ ИСКУССТВЕННОГО ИНТЕЛЛЕКТА ДЛЯ РАСПОЗНАВАНИЯ РЕЧИ ПРИ ПРОВЕДЕНИИ СОЦИОЛОГИЧЕСКИХ ОПРОСОВ
##plugins.themes.bootstrap3.article.main##
Аннотация
Представлены результаты сравнительного анализа открытых моделей искусственного интеллекта для автоматического распознавания речи в условиях полевых социологических опросов. Целью исследования было определение наиболее эффективной модели семейства Whisper для транскрибации интервью при наличии акустических помех, характерных для уличных условий проведения опросов. Методология включает экспериментальную оценку шести версий модели Whisper (Tiny, Base,
Small, Medium, Large-v3, Large-v3-turbo) с применением метрики IWER (Inflectional Word
Error Rate). Моделирование проводилось на аудиофайлах с искусственно внесёнными
шумами различной интенсивности (соотношение сигнал/шум от 9,9 до 22 LUFS), имитирующими пять типичных сценариев проведения опросов. Установлено, что модель Large-v3-turbo демонстрирует наилучшую точность распознавания: показатель метрики IWER составляет от 0,79% (условия жилого сектора) до 4,86% (непосредственно у дороги), что на 20% ниже по сравнению с базовой моделью Tiny. Новизна
исследования заключается в использовании сравнительной оценки метрики IWER для
моделей Whisper в условиях, специфичных для социологических полевых исследований.
Полученные данные позволяют обосновать выбор модели для создания специализированных информационных систем автоматизированной обработки речевых ответов респондентов.