О проекте · редакция 2026-09
BenchRU — не первый русскоязычный бенчмарк: существуют MERA, RussianSuperGLUE, TAPE и русскоязычные арены. BenchRU закрывает другой пробел — системность и сопоставимость.
Русскоязычные оценки фрагментарны: мало глубоких отраслевых наборов по российскому праву, медицине, налогам и госуслугам, а результаты разных моделей, harness-ов и конфигураций почти невозможно сравнить — часто нет версий наборов, параметров запуска, стоимости, задержки, доверительных интервалов и уровня проверки. BenchRU собирает это в единую платформу: каталог наборов, воспроизводимые запуски, честные лидерборды с явными ограничениями сравнения.
Документ, а не витрина
каждый результат — протокол испытания с датой, составом системы и уровнем доверия.
Честная точность
показываем доверительные интервалы и признаём недостаток данных вместо красивых чисел.
Открытость
формулы, веса и составы версий публичны; публичные данные доступны через API.
Независимость
уровень доверия никогда не меняет сырой балл; повышение уровня фиксируется и видно всем.
Платформа готова к наполнению экспертами: авторами наборов, исследователями и командами, которые хотят воспроизводимо измерить свои системы. Поданные материалы не публикуются автоматически — они проходят модерацию.