Меню
Публикации
2026
2025
2024
2023
2022
2021
2020
2019
2018
2017
2016
2015
2014
2013
2012
2011
2010
2009
2008
2007
2006
2005
2004
2003
2002
2001
Главный редактор
НИКИФОРОВ
Владимир Олегович
д.т.н., профессор
Партнеры
doi: 10.17586/2226-1494-2026-26-4-826-834
УДК 004.522
Система распознавания карельской речи с переключением кода карельский-русский
Читать статью полностью
Язык статьи - русский
Ссылка для цитирования:
Аннотация
Ссылка для цитирования:
Кипяткова И.С., Долгушин М.Д., Киселева К.О., Кагиров И.А. Система распознавания карельской речи с переключением кода карельский-русский // Научно-технический вестник информационных технологий, механики и оптики. 2026. Т. 26, № 4. С. 826–834. doi: 10.17586/2226-1494-2026-26-4-826-834
Аннотация
Введение. Представлена система автоматического распознавания устной речи для ливвиковского наречия карельского языка в условиях переключения кодов между карельским и русским языками. Выполнено исследование методов автоматического распознавания билингвальной речи. С целью повышения точности распознавания разработана методика аугментации текстовых данных, включающая в себя частичный перевод и синтез словоформ с внутрисловным переключением кода. Метод. Применено акустическое моделирование путем дообучения предобученной многоязычной модели Wav2Vec2-BERT 2.0 на материале двух предварительно собранных баз данных общим объемом 7,5 ч. Дообучение осуществлялось с использованием фреймворка Transformers. При построении языковой модели для решения проблемы нехватки текстовых данных с переключением кода был применен метод аугментации, основанный на частичном автоматическом переводе карельских текстов на русский язык с последующей генерацией словоформ с внутрисловным переключением кода по лингвистическим правилам. На основе разработанных правил сгенерирован список слов с внутрисловным переключением кода для использования при создании модели языка. В ходе экспериментов сравнивались различные конфигурации языковой модели, различающиеся количеством итераций текстовой аугментации (от 1 до 5), содержанием словаря (базовый и включающий все сгенерированные формы), а также интерполяцией с русской языковой моделью. Основные результаты. Проведенные эксперименты показали, что использование полного словаря, включающего сгенерированные гибридные словоформы, дает устойчивое улучшение результатов. Дополнительное снижение количества неправильно распознанных слов до 25,82 % на отладочной и 29 % на тестовой частях базы данных было достигнуто при линейной интерполяции карельской языковой модели с русской (коэффициент интерполяции 0,7). Обсуждение. Выполненные эксперименты подтверждают эффективность разработанной методики создания системы распознавания билингвальной речи. В частности, рекомендуется комбинировать дообучение многоязычных акустических моделей, текстовую аугментацию с морфологическими правилами и интерполяцию языковых моделей. Предложенный подход может быть применен для создания систем распознавания речи для других малоресурсных языков России в условиях несбалансированного двуязычия.
Ключевые слова: автоматическое распознавание речи, переключение кодов, карельский язык, малоресурсные языки, аугментация данных, внутрисловное переключение кода, Wav2Vec2-BERT 2.0, языковое моделирование
Благодарности. Работа выполнена при финансовой поддержке Российского научного фонда, проект № 24-21-00276, https://rscf. ru/project/24-21-00276/.
Благодарности. Работа выполнена при финансовой поддержке Российского научного фонда, проект № 24-21-00276, https://rscf. ru/project/24-21-00276/.

