ШІ українською: чому мова моделі має значення для роботи
Різниця між «підтримує українську» і «працює українською» проявляється не в перекладі кнопок, а на відмінках, іменах і документах.
Майже кожен великий ШІ-сервіс сьогодні заявляє підтримку української. Формально це правда: він розуміє запит і відповідає українською. Різниця починається там, де від мови залежить результат роботи, а не враження від демонстрації.
Звідки береться різниця
Модель навчається на текстах. Обсяг українських текстів у відкритому інтернеті на порядки менший за обсяг англійських — і це не питання чиєїсь недбалості, а просто пропорція.
Наслідок: для багатьох моделей українська — це «вивчена через схожість» мова. Вони спираються на структурну близькість до інших слов'янських мов і на переклад. У простих задачах це не помітно. У складних — вилазить.
Ще один шар — токенізація, спосіб, у який модель ріже текст на шматки. Якщо український текст ріжеться дрібніше за англійський, кожне речення коштує більше й гірше утримується в контексті. Практично це означає: довгий український документ «поміщається» в модель гірше, ніж такий самий англійський.
Де це видно на практиці
Відмінки в структурованих відповідях. Попросіть скласти таблицю або лист із підстановкою назви організації — і побачите «направлено до ТОВ Ромашка» замість «до ТОВ «Ромашка»» або назву в називному відмінку там, де потрібен давальний. Дрібниця, але саме такі дрібниці доводиться вичитувати вручну, і виграш у часі зникає.
Імена та по батькові. Українська система з іменем, по батькові та прізвищем, зі своїми правилами відмінювання, регулярно ламається в моделях, для яких норма — «ім'я + прізвище». Кличний відмінок у звертанні — окрема історія: «Шановний Олександр» замість «Шановний Олександре» видає машинний текст миттєво.
Скорочення й формати. «грн», «ТОВ», «ФОП», «м.», «вул.», дати у форматі 19.08.2026, номери документів із дробом. Модель, для якої це не рідне, або розгортає скорочення там, де не треба, або не впізнає їх у документі.
Термінологія. Юридична, бухгалтерська й технічна лексика має усталені українські відповідники. Модель, що перекладає з англійської на льоту, дає кальку: «поставщик» замість «постачальник», «строк дії» плутається з «терміном», з'являються русизми, яких у фаховому тексті бути не повинно.
Змішані документи. Реальність українського діловодства — тексти, де поруч українська, англійські назви продуктів і подекуди російська цитата з листування. Модель має триматися мови завдання, а не перемикатися слідом за фрагментом.
Що це означає для вибору
Питання «чи підтримує модель українську» майже нічого не дає. Корисніші питання інші:
- Що вона робить із відмінками, коли підставляє назву в шаблон?
- Як звертається до людини на ім'я та по батькові?
- Чи впізнає українські скорочення й формати дат у документі?
- Чи тримає українську, коли в матеріалі трапляється англомовний або російськомовний фрагмент?
- Чи звучить її фахова лексика як українська, а не як переклад?
Перевірити це швидко: візьміть три ваші реальні документи й одну типову задачу на них. П'ятнадцять хвилин такої перевірки дають більше, ніж будь-який опис можливостей.
Чому це не лише про мову
Мова тягне за собою контекст. Модель, для якої українська основна, зазвичай знає й те, що поруч: що таке ЄДРПОУ, як влаштована Нова пошта, що означає «єдиний податок третьої групи», який вигляд має типова накладна.
Це не окрема функція — це побічний ефект того, що модель бачила багато релевантних текстів. І саме він визначає, чи доведеться пояснювати контекст у кожному запиті, чи можна одразу переходити до задачі.
Для роботи з документами, звертаннями до клієнтів і будь-яким текстом, що виходить назовні від імені організації, ця різниця й є практичною цінністю. Не в тому, що інтерфейс перекладено, а в тому, що результат не треба переписувати.
Читайте також
Приватний ШІ для бізнесу в Україні: як не винести дані назовні
Слово «приватний» у розмовах про ШІ означає щонайменше чотири різні речі. Розбираємо, які саме, скільки кожна коштує і як обрати потрібну.
Як ШІ читає документи: OCR, структуровані дані й перевірка
Між знімком накладної та готовим рядком обліку — чотири окремі етапи. Помилки на кожному виглядають однаково, а виправляються по-різному.