Истражување откри 13.000 фрази преку кои се препознава текстот од вештачка интелигенција

Додека постарите клишеа полека исчезнуваат, новите јазични модели создаваат сопствени шаблонски изрази што ги издаваат пред луѓето.

Истражување на компанијата за маркетинг „Графајт“ откри дека водечките модели на вештачка интелигенција сè уште користат препознатливи јазични навики кога пишуваат проза. Анализата идентификуваше дури 13.000 фрази што се појавуваат барем двојно почесто во содржините генерирани од машини отколку во текстовите напишани од луѓе. Иако развивачите ги отстрануваат најочигледните знаци, секоја нова верзија на моделите развива специфични изрази преку кои лесно се препознава AI текстот.

За да го измерат присуството на шаблонски изрази, истражувачите од маркетинг-фирмата „Графајт“ создадоа база од 10.000 написи објавени пред појавата на чет-ботот ChatGPT. Овој корпус послужи како контролна група од чисто човечки текстови.

Потоа побараа од различни модели на вештачка интелигенција да ги прераскажат истите написи врз основа на кратки резимеа. Целта беше да се избегне стилското влијание на оригиналниот извор. Со директна споредба на примероците, истражувачите ја пресметаа зачестеноста на одделни зборови, фрази и реченични структури кај секој модел.

Кај моделот „Opus 5.5“ на компанијата „Антропик“, најсилен показател е зборот „сигурен“ или „доверлив“ (dependable), кој се појавува 23 пати почесто отколку во текстовите што ги пишуваат луѓе.

Овој модел има изразена навика да му порачува на читателот зошто нешто е значајно. Фразата „ова е важно“ (this matters) се среќава дури 116 пати почесто во неговите текстови, додека формулацијата „зошто X е важно“ се јавува 92 пати почесто од вообичаеното. Иако моделот престана да ја користи добро познатата структура „не е X, туку е Y“, тој сега редовно прибегнува кон варијантата дека нешто „е повеќе од X, тоа е Y“.

Моделот „Astra“ на компанијата „OpenAI“ покажува поинаков јазичен профил. Тој постојано се повикува на „уште една димензија“ од темата за која пишува и претпазливо тврди дека одредена постапка „може да овозможи“ корист.

Негов најчест манир е таканареченото корективно врамување. Тоа се реченици каде појавата се дефинира како „не едноставно X“ или се нуди алтернатива со фразата „наместо да се потпира на X“. Ваквите конструкции се појавуваат над 100 пати почесто кај „Astra“ во споредба со човечките автори.

Инженерите успеаја речиси целосно да ја сузбијат долгата цртичка, која претходно беше главен белег на компјутерскиот текст. Во примероците на „Графајт“, „Opus 5.5“ ја користи цртичката за 99 отсто помалку од својот претходник, додека моделот „Gemini 3.1 Pro“ речиси целосно ја исфрли од употреба.

Сепак, вкупниот број шаблони не се намалува. Главниот директор за вештачка интелигенција во „Графајт“, Грег Драк, посочува дека моделите на „Клод“ со текот на времето се приближуваат до природниот речник на луѓето, додека моделите на „Џи-пи-ти“ се оддалечуваат. Според него, лабораториите имаат ограничен капацитет целосно да го контролираат јазикот на системи со милијарди параметри, па со секое отстранување на старо клише автоматски се појавуваат нови стилски манири.

е-Трн да боцка во твојот инбокс