17:18 24.08.2026 Пн 3 мин Разработчики открыли методику оценки нейросетей
В Украине создали первый бенчмарк для проверки языковых моделей (фото: Минцифры) Не трать время на шум! Читай только суть из РБК-Украина в Google
Центр компетенций WINWIN AI при Минцифре вместе с учеными запустил национальный рейтинг Ukrainian LLM Leaderboard. Инструмент разработан для объективного измерения качества работы больших языковых моделей на украинском языке.
Об этом пишет РБК-Украина со ссылкой на Минцифры.
Защита от русизмов и объективная оценка
До сих пор мировые рейтинги тестировали языковые модели преимущественно на английском языке, а качество работы на украинском проверяли через машинный перевод, что скрывало специфические ошибки и кальки.
Благодаря новому лидерборду государство получает базу для выбора технологических решений для госприложений, а бизнес — возможность объективно оценить рентабельность интеграции ИИ.
Правила оценки разработали эксперты УКУ и сообщества lang-uk Юрий Панов и Дмитрий Чаплинский, которые более 10 лет учат нейросети понимать украинский язык.
Эту же методику уже успешно применяли при обучении отечественной модели Lapa LLM.
Как тестируют языковые модели: бенчмарки и методология
Платформа измеряет эффективность моделей по нескольким ключевым направлениям. Разработчики объединяют украинские и международные датасеты, адаптированные под локальный контекст:
Машинный перевод: оценка на уровнях предложений и целых абзацев (FLORES-200, LongFLORES, WMT-22).
Контекстные вопросы и ответы: проверка понимания прочитанного текста (Belebele, SQuAD).
Логика, знания и рассуждения: тестирование учебными заведениями и ВНО (ZNO-Eval), сложные логические задачи (Winogrande, ARC Easy/Challenge, TriviaQA, MMLU).
Соблюдение инструкций: точность выполнения сложных запросов (IFEval).
Читайте больше: Голосовой помощник в Дие.AI: Минцифра запустила новую ИИ-функцию
Первые лидеры рейтинга
По обновленным данным лидерборда, первые позиции в зачете занимают специализированные и оптимизированные модели. Среди лидеров по среднему рангу оказались:
google/gemma-4-26B-A4B-it (с использованием алгоритмов reasoning) — демонстрирует один из самых высоких показателей точности в соблюдении инструкций и решении логических задач.
MamayLM (серия моделей Gemma-3 на 12B и 27B от института INSAIT) — демонстрирует высокие результаты в машинном переводе и логических тестах.
lapa-v0.1.2-instruct (украиноязычная модель сообщества разработчиков) — показывает один из лучших результатов в точке перевода (FLORES и WMT).
Все результаты, коды и датасеты опубликованы в открытом доступе на платформе Hugging Face.
В будущем разработчики планируют расширить функционал Ukrainian LLM Leaderboard. Платформа получит модули для проверки работы с изображениями, оценки этичности ответов и анализа финансовой стоимости использования моделей на украинском.
Отдельное внимание будет уделено потребностям государственного сектора — оценке обработки нормативных текстов, административных процедур и безопасности работы с персональными данными.
