Белорусский цифровой голос больше не будет резать слух неправильными ударениями. Нейросеть наконец научили отличать «мУку» от «мукІ»
Создание естественного компьютерного голоса долгое время тормозилось из-за специфики белорусской фонетики, где смысл одинаковых по написанию слов меняется в зависимости от ударения. Чтобы научить машину понимать контекст предложения, разработчики применили инновационный подход. Это позволило избежать ошибок произношения, которые выдавали искусственное происхождение аудио.

Как сообщают создатели открытого проекта BelVoice в своем телеграм-канале,
главным препятствием для качественного преобразования текста в речь (Text-to-Speech) оставались омографы. Это слова, имеющие одинаковое написание, но разное ударение: например, «мУка» и «мукА», «вУчыць» и «вучЫць», «гАды» и «гадЫ».
Традиционные алгоритмы использовали наиболее частотный вариант из словаря полностью без учета контекста. Такой подход обеспечивал точность около 92 %. На первый взгляд цифра кажется высокой, однако для синтеза речи это критический недостаток: восьмипроцентная погрешность означает, что
практически в каждом абзаце система делала фонетическую ошибку, которая немедленно выдавала искусственность голоса и резала слух пользователю.
Для решения семантической задачи исследователи интегрировали в процесс большие языковые модели (LLM). Оптимальным решением стала архитектура цифрового анализа с распределением ролей. Сначала мощная нейросеть (например, Gemini Pro 3.1) обрабатывает данные из Грамматической базы и Толкового словаря белорусского языка. На основе этого массива создается оптимизированный промпт с четкими правилами и логическими маркерами для меньшей инференс-модели, которая уже непосредственно работает с текстом пользователя.
Все технические инструкции по построению этого алгоритма разработчики открыто разместили на платформе GitHub.
Выбор финальной модели для проекта проводился на трех специализированных датасетах: базе CommonVoice, синтетическом сбалансированном наборе 10/10 и первых пятнадцати главах книги Аркадия Чернышевича «Засценак Малінаўка» с полностью ручной разметкой ударений. Подробные результаты исследований опубликованы на платформе Hugging Face.
Лучшее соотношение скорости и качества продемонстрировала модель Gemma 4‑31B без включения функции рассуждения, которая чрезмерно замедляет работу. На выборке из 1090 сложных омографов в естественном литературном тексте система допустила всего три ошибки, достигнув точности в 99,72 %.
Для сравнения, конкурентная модель Qwen3. 8‑27B на том же объеме данных ошиблась 25 раз, а Mistral-small-4 сделала 182 ошибки с итоговой точностью около 83 процентов.
«Наша Нiва» — бастион беларущины
ПОДДЕРЖАТЬСоздается база для распознавания белорусской речи — присоединиться может каждый
Ютуб начал делать автоматические субтитры для белорусскоязычных видео
Нейросети все еще спотыкаются на белорусской речи. Белорусы хотят подарить искусственному интеллекту идеальный голос
От Baldur’s Gate 3 до Minecraft: появился сайт-каталог, где собраны 180 видеоигр на белорусском языке
Комментарии