Мінцифри сформувало рейтинг ШІ за знанням української мови: хто у топі

Мінцифри сформувало рейтинг ШІ за знанням української мови: хто у топі

Центр компетенцій WINWIN AI при Мінцифрі разом із науковцями запустив національний рейтинг Ukrainian LLM Leaderboard. Інструмент розроблено для об'єктивного вимірювання якості роботи великих мовних моделей українською мовою.

Про це пише РБК-Україна з посиланням на Мінцифри.

Захист від русизмів та об'єктивна оцінка

Досі світові рейтинги тестували мовні моделі переважно англійською мовою, а якість роботи з українською перевіряли через машинний переклад, а це приховувало специфічні помилки та кальки.

Завдяки новому лідерборду держава отримує базу для вибору технологічних рішень для держзастосунків, а бізнес - можливість об'єктивно оцінити рентабельність інтеграції ШІ.

Правила оцінювання розробили експерти УКУ та спільноти lang-uk Юрій Панів і Дмитро Чаплінський, які понад 10 років навчають нейромережі розуміти українську мову.

Цю ж методику вже успішно застосовували під час навчання вітчизняної моделі Lapa LLM.

Як тестують мовні моделі: бенчмарки та методологія

Платформа вимірює ефективність моделей за кількома ключовими напрямами. Розробники поєднують українські та міжнародні датасети, адаптовані під локальний контекст:

Машинний переклад: оцінка на рівнях речень і цілих абзаців (FLORES-200, LongFLORES, WMT-22).

Контекстні питання та відповіді: перевірка розуміння прочитаного тексту (Belebele, SQuAD).

Логіка, знання та міркування: тестування навчальними закладами та ЗНО (ZNO-Eval), складні логічні задачі (Winogrande, ARC Easy/Challenge, TriviaQA, MMLU).

Дотримання інструкцій: точність виконання складних запитів (IFEval).

Перші лідери рейтингу

За оновленими даними лідерборду, перші позиції в заліку посідають спеціалізовані та оптимізовані моделі. Серед лідерів за середнім рангом опинилися:

google/gemma-4-26B-A4B-it (з використанням алгоритмів reasoning) - демонструє один із найвищих показників точності у дотриманні інструкцій та вирішенні логічних завдань.

MamayLM (серія моделей Gemma-3 на 12B та 27B від інституту INSAIT) - демонструє високі результати у машинному перекладі та логічних тестах.

lapa-v0.1.2-instruct (україномовна модель від спільноти розробників) - показує один із найкращих результатів у точці перекладу (FLORES та WMT).

Усі результати, коди та датасети опубліковано у відкритому доступі на платформі Hugging Face.

У майбутньому розробники планують розширити функціонал Ukrainian LLM Leaderboard.

Платформа отримає модулі для перевірки роботи з зображеннями, оцінювання етичності відповідей та аналізу фінансової вартості використання моделей українською.

Окрему увагу приділять потребам державного сектору - оцінці опрацювання нормативних текстів, адміністративних процедур та безпеці роботи з персональними даними.

Источник: rbc.ua