doi: 10.17586/2226-1494-2026-26-4-826-834


УДК 004.522

Система распознавания карельской речи с переключением кода карельский-русский

Кипяткова И.С., Долгушин М.Д., Киселева К.О., Кагиров И.А.


Читать статью полностью 
Язык статьи - русский

Ссылка для цитирования:
Кипяткова И.С., Долгушин М.Д., Киселева К.О., Кагиров И.А. Система распознавания карельской речи с переключением кода карельский-русский // Научно-технический вестник информационных технологий, механики и оптики. 2026. Т. 26, № 4. С. 826–834. doi: 10.17586/2226-1494-2026-26-4-826-834


Аннотация
Введение. Представлена система автоматического распознавания устной речи для ливвиковского наречия карельского языка в условиях переключения кодов между карельским и русским языками. Выполнено исследование методов автоматического распознавания билингвальной речи. С целью повышения точности распознавания разработана методика аугментации текстовых данных, включающая в себя частичный перевод и синтез словоформ с внутрисловным переключением кода. Метод. Применено акустическое моделирование путем дообучения предобученной многоязычной модели Wav2Vec2-BERT 2.0 на материале двух предварительно собранных баз данных общим объемом 7,5 ч. Дообучение осуществлялось с использованием фреймворка Transformers. При построении языковой модели для решения проблемы нехватки текстовых данных с переключением кода был применен метод аугментации, основанный на частичном автоматическом переводе карельских текстов на русский язык с последующей генерацией словоформ с внутрисловным переключением кода по лингвистическим правилам. На основе разработанных правил сгенерирован список слов с внутрисловным переключением кода для использования при создании модели языка. В ходе экспериментов сравнивались различные конфигурации языковой модели, различающиеся количеством итераций текстовой аугментации (от 1 до 5), содержанием словаря (базовый и включающий все сгенерированные формы), а также интерполяцией с русской языковой моделью. Основные результаты. Проведенные эксперименты показали, что использование полного словаря, включающего сгенерированные гибридные словоформы, дает устойчивое улучшение результатов. Дополнительное снижение количества неправильно распознанных слов до 25,82 % на отладочной и 29 % на тестовой частях базы данных было достигнуто при линейной интерполяции карельской языковой модели с русской (коэффициент интерполяции 0,7). Обсуждение. Выполненные эксперименты подтверждают эффективность разработанной методики создания системы распознавания билингвальной речи. В частности, рекомендуется комбинировать дообучение многоязычных акустических моделей, текстовую аугментацию с морфологическими правилами и интерполяцию языковых моделей. Предложенный подход может быть применен для создания систем распознавания речи для других малоресурсных языков России в условиях несбалансированного двуязычия.

Ключевые слова: автоматическое распознавание речи, переключение кодов, карельский язык, малоресурсные языки, аугментация данных, внутрисловное переключение кода, Wav2Vec2-BERT 2.0, языковое моделирование

Благодарности. Работа выполнена при финансовой поддержке Российского научного фонда, проект № 24-21-00276, https://rscf. ru/project/24-21-00276/.

Creative Commons License

This work is licensed under a Creative Commons Attribution-NonCommercial 4.0 International License
Информация 2001-2026 ©
Научно-технический вестник информационных технологий, механики и оптики.

Яндекс.Метрика