В Україні з’явився окремий тест для ШІ: моделі порівнюватимуть за роботою саме українською

В Україні створили Ukrainian LLM Leaderboard – національну платформу для оцінювання великих мовних моделей за якістю роботи українською мовою. Проєкт започаткували Центр компетенцій WINWIN AI при Мінцифрі, Український католицький університет та ініціатива lang-uk.

Про це йдеться в офіційному повідомленні Мінцифри.

Потреба в окремому тестуванні виникла через те, що звичайні міжнародні оцінки не завжди показують реальні можливості ШІ в українському мовному середовищі. Модель може добре виконувати завдання глобальних тестів, але водночас допускати помилки в українській, використовувати неприродні конструкції або неправильно передавати контекст.

ШІ перевірятимуть у реальних сценаріях

Новий рейтинг оцінює не лише грамотність відповідей. Моделям пропонують перекладати, переказувати та скорочувати великі тексти, працювати з документами, вирішувати логічні й математичні завдання та виконувати складні інструкції.

Також перевіряється здатність нейромереж працювати із завданнями шкільної програми на рівні ЗНО. Це дає змогу оцінити різні сторони роботи моделі та побачити її сильні й слабкі місця.

Єдина система оцінювання для держави та бізнесу

Рейтинг має стати практичним інструментом для тих, хто впроваджує штучний інтелект у свої продукти та сервіси. Замість орієнтації лише на заяви розробників можна буде порівнювати моделі за конкретними результатами роботи українською.

Методологію розробили фахівці УКУ та спільноти lang-uk. Усі результати, дані й код відкриті для громадськості, що дозволяє перевіряти підхід до оцінювання та самостійно зіставляти показники різних моделей.

Надалі платформу планують розширити. Серед майбутніх напрямів – оцінювання роботи із зображеннями, етичності моделей, вартості їх використання, а також спеціальні тести для державного сектору, зокрема робота з нормативними документами, адміністративними процедурами та персональними даними.

Поділитись

Подібні записи