Інстытут беларускай мовы запустил независимый «Корпус беларускіх тэкстаў», который собирает лексику, не попадающую в официальные базы из-за цензуры
-
06.08.2026Не «скарыстацца нечым», а «скарыстаць штосьці», глядзіце значэнне «скарыстацца» ў слоўніках.
Пакуль, як зразумеў, толькі 240 тэкстаў, што яшчэ мала для карыснага пастаяннага выкарыстання. Спадзяваюся, будзе развівацца.
Ідэя алічбаваць вусныя блогі слушная. Цікавы досвед, ці выкарыстоўваюць аўтаматычную транскрыпцыю youtube з беларускай - яна не ідэальная, а старыя відэа распазнаныя як на расейскай з памылкамі.
Яшчэ адна будучая важная праблема сучаснага корпусу: вялікая колькасць ШІ-слопу ў сучасных медыя і блогах, які з’явіўся праз хуткія аўтаматычныя пераклады і адсутнасць карэктуры. Дадаваць яго ў корпус нельга, бо будзе спрыяць далейшаму самаатручванню мовы. А вызначыць і размеціць, дзе аўтарскія тэксты, дзе хаўтура, складана.
Не хапае адкрытага коду праекта. Афіцыйны корпус і два лепшыя анлайн-слоўнікі выкладзены на github. Гэта ўжо добрая традыцыя сучаснай беларускай філалогіі. А таксама і абарона на будучыню: сайты і тэксты з часам знікаюць, а наяўнасць архіваў і крыніц - шанс на захаванне.
І пра бяспеку. Беларускія ініцыятывы і СМІ, калі ласка, не забывайце папярэджваць пра дакументы на Google Drive (інструкцыя ў гэтым выпадку), гісторыя адкрыцця якіх можа захоўвацца ў вашых акаўнтах, што небяспечна для беларусаў у Беларусі і тых, хто ездзіць у Беларусь. Для прыкладу, тая ж старонка на github pages і бяспечней, і пражыве больш.