Со векови, кога еден текст минувал од еден јазик на друг, некој човек одлучувал како ќе звучи. Свети Јероним, чиј празник на 30 септември стана повод за одбележување на Меѓународниот ден на преведувањето, одлучувал со кои латински зборови ќе ја пренесе Библијата. Судските преведувачи одлучуваат како ќе биде пренесен исказот на обвинетиот. Државите одлучуваат кој јазик е службен, кој се учи во училиштата и на кој се пишуваат законите.
Границата меѓу јазиците отсекогаш имала свои чувари. Во последната деценија, дел од таа работа сè повеќе ја преземаат алгоритмите. А алгоритмите имаат свои сопственици.
Интернетот зборува англиски
Големите јазични модели, на кои се темелат Чет-ГПТ, „Гугл Преведувач“ и сличните алатки, учат од огромни количини текстови. А најголемиот дел од дигиталниот свет не е јазично рамноправен. Англискиот е јазик на околу половина од веб-страниците чиј јазик може да се идентификува. Според податоците на W3Techs, во септември 2026 година тој се користи на 49,5 отсто од веб-страниците со познат јазик, а кај илјадата најпосетувани страници уделот е 58,2 отсто.
Македонскиот е на другиот крај од скалата. W3Techs го регистрира на помалку од 0,1 отсто од веб-страниците чиј јазик е познат.
За машината, тоа е суштинска разлика. Колку помалку текст има на еден јазик, толку помалку дигитален материјал има од кој моделите можат да учат. Тоа не значи автоматски дека машината „не го знае“ јазикот, но значи дека ресурсите достапни за негово моделирање се многу помали.
Токму тука се појавува разликата меѓу јазиците со многу ресурси и оние со малку ресурси, проблем што го препознава и Меѓународната федерација на преведувачи.
Компаниите одлучуваат кој јазик влегува во машината
Во светот се зборуваат илјадници јазици. „Гугл“ во 2022 година ја објави Иницијативата за 1.000 јазици, со која најави развој на модели што ќе поддржуваат илјада од најзборуваните јазици. Во јуни 2024 година компанијата додаде 110 нови јазици во „Гугл Преведувач“, најголемото проширување во историјата на услугата во тој момент. Со тоа бројот на поддржани јазици надмина 240. Компанијата објасни дека моделот ПаLM 2 ѝ помогнал на системот поефикасно да учи и сродни јазици, меѓу другото и јазици блиски до хинди и француски креолски јазици.
Добро е што повеќе јазици добиваат машински превод. Но вреди да се постави и друго прашање: кој одлучува кои јазици ќе бидат додадени, кога и со каков квалитет? Одлуките за дигиталната поддршка на јазиците во голема мера ги носат технолошките компании и нивните истражувачки и продуктни тимови. Од нив зависи кога одреден јазик ќе стане достапен во одредена услуга и какви дигитални алатки ќе бидат изградени околу него. За малите јазични заедници тоа станува прашање на дигитална видливост.
Интересен е и начинот на кој машините учат сродни, но помалку застапени јазици. „Гугл“ самиот наведува дека неговите модели можат да го забрзаат учењето на јазици што се сродни со оние за кои веќе постојат големи количини податоци. За македонскиот, кој има значително помал дигитален корпус од големите европски и светски јазици, ова не е само теоретско прашање.
Секој што користел машински превод на македонски веројатно ги препознал проблемите: српски или бугарски јазични форми, неприродни конструкции, погрешен избор на зборови и буквално пренесени идиоми. Кога моделот нема доволно примери од еден јазик, тој може да се потпре на обрасци што ги научил од други јазици. Кај сродни јазици тоа понекогаш може да помогне, но може да создаде и мешање на јазичните системи.
Така, без некој намерно да ја брише границата меѓу јазиците, таа може да стане сè понејасна во дигиталниот простор.
Машината има и свои стереотипи
Контролата врз јазикот не е само прашање на тоа кој јазик влегува во машината, туку и како машината го користи.
Истражувањата покажуваат дека системите за машински превод можат да произведуваат родово пристрасни преводи, особено кога изворниот јазик не го означува родот, а целниот јазик го бара тоа. Во такви случаи, професиите често се поврзуваат со родови стереотипи. Истражувањата покажуваат и дека машкиот род може да се појавува како своевидна подразбрана форма, додека женските форми се почесто поврзани со професии што во општеството традиционално се перципираат како „женски“.
За јазик како македонскиот, кој има граматички род, ова не е само техничка ситница.
Секој машински превод може да влијае врз начинот на кој се претставуваат луѓето, професиите и општествените улоги. Кога таа одлука ја носи модел обучен врз огромни количини текст од различни јазици и култури, во преводот можат да се појават и стереотипи присутни во тие податоци.
Кога луѓето излегуваат од процесот
Во меѓувреме, професијата што со векови ја чувала границата меѓу јазиците се соочува со сериозен притисок. Истражување на британското Друштво на автори од 2024 година покажа дека 36 отсто од преведувачите опфатени со анкетата веќе изгубиле работа поради генеративната вештачка интелигенција, додека 43 отсто рекле дека приходите од нивната работа се намалиле поради ВИ.
Во јануари 2026 година, на Светскиот економски форум во Давос, директорката на Меѓународниот монетарен фонд, Кристалина Георгиева, изјави дека бројот на преведувачи во ММФ се намалил од 200 на 50. Тоа не значи дека човечките преведувачи стануваат непотребни. Напротив, токму во правните, медицинските, литературните и институционалните текстови точноста, контекстот и одговорноста остануваат суштински.
Но секој пад на побарувачката за човечки превод значи и губење на дел од професионалното знаење за тоа како еден јазик функционира во одредена култура. А тоа е вид знаење што не може едноставно да се преземе од податоци што не постојат.
„Везилка“: македонскиот обид да влезе во машината
Македонија во 2025 година го претстави проектот „Везилка“ – Национален центар за вештачка интелигенција, чиј носител е ФИНКИ, со поддршка од Европската Унија преку програмите „Хоризонт Европа“ и „ЕвроХПК“. Според Министерството за дигитална трансформација, проектот е вреден околу 6 милиони евра.
Една од неговите цели е развој на домашни капацитети за вештачка интелигенција и јазични технологии, со што македонскиот јазик би добил подобра дигитална инфраструктура. Следниот клучен чекор е собирањето и дигитализирањето на македонскиот јазичен корпус.
Министерството најави соработка со институции што поседуваат значајни количини текстуален материјал – меѓу нив Службен весник, Собранието, Националната и универзитетска библиотека, МАНУ и институти од областа на јазикот и литературата. Во процесот треба да учествуваат и граѓаните, преку доставување дигитализирани трудови и магистерски и докторски истражувања.
Целта е јасна: ако македонскиот јазик треба да функционира рамноправно во дигиталниот свет, мора да постојат доволно квалитетни податоци врз кои можат да се обучуваат јазични модели.
Јазикот како прашање на дигитален суверенитет
Прашањето кој ја контролира границата меѓу јазиците за Македонија никогаш не било само технолошко.
Јазикот со децении е дел од политички и дипломатски спорови со соседите. Во 2022 година, претседателката на Европската комисија, Урсула фон дер Лајен, во Скопје јавно изјави дека ЕУ целосно го почитува македонскиот јазик и националниот идентитет, а во истиот контекст беше потврдено дека пристапниот процес се одвива со референца кон македонскиот јазик. Но во дигиталниот свет формалното признавање не е единственото прашање.
Во дваесеттиот век, еден јазик имал институции, граматика, речник, училишта, медиуми и книжевност. Во дваесет и првиот век, му треба и дигитална инфраструктура. Треба да има корпуси, речници во машински читлив формат, квалитетни преводи, терминолошки бази, дигитализирани книги, архиви и доволно квалитетни текстови врз кои можат да учат алгоритмите.
Инаку, ризикот не е дека македонскиот едноставно ќе исчезне. Ризикот е дека ќе стане јазик што луѓето го зборуваат, читаат и пишуваат, но машините го разбираат полошо од јазиците со кои располагаат со многу повеќе податоци. А во свет во кој сè повеќе услуги, информации и комуникација минуваат низ алгоритми, тоа е нова форма на јазична нерамноправност. Границата меѓу јазиците повеќе не ја чуваат само преведувачите. Сè повеќе ја цртаат и податоците.