Языки народов России и нейросети: как технологии помогают их сохранять
:format(webp)/YXJ0aWNsZXMvaW1hZ2UvMjAyNi85L2xvcmktMDA0NTAyMTU0OC1iaWd3d3dfNll3MHl1ZS5qcGc.webp)
Фото - © Николай Винокуров / Фотобанк Лори
8 сентября в России отмечают День языков народов России. Дата не случайная: в стране официально насчитывается больше 150 языков, и часть из них лингвисты относят к исчезающим — на них почти не говорят молодые, их не встретишь в интернете, а значит, дети попросту не видят, что на этом языке можно писать посты, снимать видео или переписываться с друзьями. Последние пару лет ситуацию пытаются менять с помощью технологий: языки народов России добавляют в переводчики, нейросети и сервисы для перевода видео.
В материале РИАМО разбираемся, что уже сделано и как это работает.
Почему языки народов России нуждаются в цифровой поддержке
:format(webp)/YXJ0aWNsZXMvaW1hZ2UvMjAyNi85L2xvcmktMDA0MzA1NzA1MC1iaWd3d3dfdlV3U3dGbC5qcGc.webp)
Фото - © Виктория Тельминова / Фотобанк Лори
Языки исчезают не одномоментно. Обычно сценарий такой: сначала язык вытесняют из школы, работы и общественных мест, оставляя только в быту. Затем постепенно родители перестают обучать этому языку своих детей, отдавая предпочтение более «доминирующему» языку в стране. Но даже если ребенок слышит родной язык дома, но не встречает его больше нигде — ни в мультфильме, ни в игре, ни в переводчике на экране, — довольно быстро считывает: этот язык «ненастоящий», для повседневной жизни не годится.
Отсюда логика последних инициатив: если язык появляется там, где обычно живут, например, русский и английский — в переводчиках, нейросетях, видео с озвучкой, — он перестает восприниматься как музейный экспонат. Причем эффект здесь не только символический: перевод документов, голосовой поиск, субтитры и озвучка — это конкретные, повседневные сценарии использования языка, которых у многих народов России до последнего времени просто не было в цифровом виде.
Как Яндекс Переводчик учится переводить редкие языки
:format(webp)/YXJ0aWNsZXMvaW1hZ2UvMjAyNi85L2ltYWdlLTIwMjYtMDktMDgtMTEzMjU5X1Myc1l5emEuanBn.webp)
Фото - © РИАМО
Самое заметное изменение — в Яндекс Переводчике. Дом народов России, «Яндекс» и регионы совместно добавили в сервис 14 новых языков народов России: осетинский, тувинский, коми, мокшанский, эрзянский, кабардино-черкесский, карачаево-балкарский, бурятский, абазинский, ногайский, мансийский, хакасский, чеченский и адыгейский.
Важно понимать: «добавить язык в переводчик» — это не разовое включение тумблера. Машинному переводу нужен корпус — большой массив параллельных текстов на двух языках, по которому модель учится сопоставлять слова, конструкции и смыслы. Для языков с миллионами носителей и десятилетиями цифровых текстов (как английский или русский) корпуса огромны. Для многих языков народов России текстов в электронном виде исторически было мало — их приходится собирать, размечать и проверять почти вручную, вместе с носителями и лингвистами.
Именно поэтому работа шла не только «вширь» (новые языки), но и «вглубь» — над качеством уже добавленных. Для башкирского, марийского, чувашского, удмуртского и якутского в Переводчик добавили технологии синтеза и распознавания речи: сервис научился не только переводить текст, но и озвучивать его, а также понимать язык на слух. Для марийского и удмуртского отдельно улучшили качество самого перевода.
На этом развитие не остановится. До конца 2026 года в Яндекс Переводчике должны появиться еще семь языков — карельский, алтайский, татский (джуури), лезгинский, чукотский, эскимосский и ингушский, — а синтез и распознавание речи добавят для бурятского и кабардино-черкесского. Параллельно ведется подготовительная работа — сбор и разметка текстовых корпусов — по коми-пермяцкому, вепсскому, ненецкому (лесному и тундровому), хантыйскому, калмыцкому, крымскотатарскому, рутульскому, агульскому, цахурскому, кумыкскому, даргинскому, табасаранскому и аварскому языкам. Это самый долгий и незаметный этап: пока корпус не готов, ни перевод, ни распознавание речи для языка запустить нельзя.
На каких языках народов России работает GigaChat
:format(webp)/YXJ0aWNsZXMvaW1hZ2UvMjAyNi85L3JpYS04NzU1MDY2bXI5MDBfRFpxWWFJMy5qcGc.webp)
Фото - © Александр Кряжев/РИА Новости
Параллельно с переводчиками цифровизацией занялись и генеративные нейросети. В апреле 2026 года по итогам совместной работы Дома народов России, Сбербанка и регионов GigaChat научился понимать и генерировать текст на 18 языках народов России: татарском, башкирском, чувашском, удмуртском, якутском, бурятском, осетинском, чеченском, карачаево-балкарском, коми, эрзянском, марийском, крымскотатарском, кабардино-черкесском, ингушском, мокшанском, калмыцком и аварском.
Для языковой модели это задача сложнее, чем для переводчика. Переводчику достаточно сопоставить фразу с фразой. Генеративной нейросети нужно «выучить» грамматику языка настолько хорошо, чтобы самостоятельно строить связный текст, — а для языков с небольшим объемом оцифрованных текстов это одна из главных технических сложностей: модели попросту не хватает данных, чтобы уверенно обобщать закономерности языка.
Как нейросети распознают и синтезируют речь на языках народов России
:format(webp)/YXJ0aWNsZXMvaW1hZ2UvMjAyNi85L2xvcmktMDA1MDgxMTEzMS1iaWd3d3dfTEFFdWdTNC5qcGc.webp)
Фото - © Sergey Grishin / Фотобанк Лори
Оба этих термина в материалах о языках встречаются часто, но означают разные вещи.
Распознавание речи — это когда система слушает голос и превращает его в текст. Модель обучается на парах «аудиозапись — точная текстовая расшифровка»: чем больше таких пар для конкретного языка, тем точнее распознавание, особенно с учетом диалектов и акцентов.
Синтез речи — обратная задача: превратить текст в звучащую речь, причем с правильной интонацией, ударениями и естественным темпом, а не «роботизированным» монотонным голосом.
Для языков народов России обе задачи осложняются тем же, чем и машинный перевод, — нехваткой размеченных данных. Мало просто записать носителя: нужны часы качественной, транскрибированной речи, а для языков с несколькими диалектами — еще и разметка диалектных особенностей. Именно поэтому в графике Яндекс Переводчика синтез и распознавание речи для многих языков идут отдельным пунктом и часто позже, чем базовый перевод текста.
EthnoTech: как работает перевод видео на языки народов России
:format(webp)/YXJ0aWNsZXMvaW1hZ2UvMjAyNi85L2xvcmktMDAzODIxOTIxNi1iaWd3d3dfN0dNRVYwVi5qcGc.webp)
Фото - © Андрей С / Фотобанк Лори
Еще один инструмент — платформа «Этнотех» (EthnoTech), расширение для браузера, которое переводит голосовую дорожку видео на языки народов России и стран СНГ прямо во время просмотра. Дублирование выполняется с помощью технологии клонирования голоса на основе искусственного интеллекта — то есть озвучка максимально приближена к оригинальной интонации и тембру, а не заменяется на нейтральный «дикторский» голос.
Демо-версия сервиса уже работает для 12 языков: адыгейского, башкирского, водского, даргинского, кабардино-черкесского, марийского, мокшанского, осетинского, татарского, чувашского, эрзянского и якутского.
По сути, «Этнотех» — сразу и переводчик, и языковой тренажер: человек смотрит привычный контент — сериал, лекцию, ролик на YouTube, — но на родном языке, и параллельно, слыша оригинал и перевод, тренирует восприятие речи на слух. Для языков с небольшим количеством учебных материалов это может быть чуть ли не единственный способ регулярно слышать «живую», не выученную по учебнику, речь.
Какие еще технологии помогают сохранять языки народов России
:format(webp)/YXJ0aWNsZXMvaW1hZ2UvMjAyNi85L2xvcmktMDA1MzgzNjg1MS1iaWd3d3dfT29HbTlEYS5qcGc.webp)
Фото - © Борис Килин / Фотобанк Лори
Цифровизация языков не сводится к переводчикам и чат-ботам — вокруг темы есть еще несколько важных инициатив:
- Домены .рф. С 2025 года в национальной доменной зоне .РФ можно регистрировать домены с использованием символов 18 государственных языков республик России — от абазинского и башкирского до чувашского и якутского. Работу ведет АНО «Координационный центр национального домена сети Интернет».
- Шрифты PT Astra. Компания «ПараТайп» разработала многоязычную шрифтовую систему PT Astra Serif / Sans / Fact с поддержкой более 150 языков народов России и открытой пользовательской лицензией. PT Astra Serif — полноценная замена Times New Roman в документах и на сайтах, но с поддержкой национальных алфавитов и диакритики.
- «Библиография единства народов». Российская национальная библиотека собрала цифровой ресурс с описаниями более 5 000 000 изданий на языках народов России — включая книжные памятники и библиографические редкости, изданные как в России, так и за рубежом.
Каждая из этих инициатив по отдельности выглядит скромно, но вместе они решают одну и ту же задачу: чтобы человек, который хочет писать, читать или искать что-то на родном языке, мог сделать это в любой обычной цифровой ситуации — от регистрации сайта до чтения книги в библиотеке.
Можно ли сохранить язык с помощью нейросетей
:format(webp)/YXJ0aWNsZXMvaW1hZ2UvMjAyNi85L2xvcmktMDA1MTkwOTE4OS1iaWd3d3dfOEpKeFZrUi5qcGc.webp)
Фото - © Ярославский Максим / Фотобанк Лори
Кандидат филологических наук, научный сотрудник Института русского языка им. В. В. Виноградова РАН Алина Алексеева в беседе с РИАМО рассказала, что сейчас делается много всего для сохранения языкового многообразия нашей необъятной страны. «Языки народов России чрезвычайно разнообразны: они относятся к пятнадцати языковым семьям, генетическим языковым объединениям. По счастью, в последние годы языки привлекают интерес исследователей, преподавателей и студентов — так, к примеру, в Школе лингвистики НИУ ВШЭ ведутся курсы по изучению языкового разнообразия России и ближнего зарубежья. Особенно важно, на мой взгляд, уделять внимание малым языкам России, число носителей которых зачастую сокращается, — в этом случае поддержка со стороны нейросетей очень полезна».
Однако эксперт отмечает, что одними лишь нейросетями сохранить язык невозможно. «Не надо забывать, что искусственный интеллект может ошибаться и генерировать неверные правила, а также не отражает эмоции, из-за чего страдает понимание интонации. Поэтому изучение языка с носителем до сих пор остается наиболее актуальным способом передачи языка», — заключает Алексеева.