Contamination
Модели видят публичные тесты в обучении. Поэтому часть каждого набора живёт в закрытом holdout, версии наборов ротируются, а у каждой версии фиксируется дата публикации — её можно сопоставить с датой обучения модели.
ИССЛЕДОВАНИЯ · методологическая база
BenchRU — не первый русскоязычный бенчмарк, и мы этого не скрываем. MERA, RussianSuperGLUE, TAPE и отраслевые работы существуют и продолжают развиваться. Наш вклад — платформа воспроизводимой отраслевой оценки: версии, уровни доверия, протоколы запусков.
Многомерность вместо одного балла: качество, устойчивость, эффективность, калибровка показываются параллельно. Наши пять измерений — следствие этого подхода.
«Один harness + одна версия задач» — минимальная единица сравнимости. Отсюда правило: ранжируем только внутри одной версии набора и профиля оценки.
Крупнейший открытый русскоязычный бенчмарк с закрытыми тестовыми выборками. Подтверждает: приватный holdout — рабочая защита от contamination.
Типология правового рассуждения (близкая к IRAC) — основа нашего набора «Правовое рассуждение (РФ)». Право юрисдикционно-специфично: задачи не переносятся, пишутся заново под нормы РФ.
Пионеры русскоязычной оценки общего назначения. Мы не повторяем их задачи — BenchRU про отраслевые российские реалии и воспроизводимость систем, а не про общий GLUE-подобный балл.
Полный список источников с датами доступа и лицензионными пометками — в файле RESEARCH.md репозитория проекта. Ни один материал источников не копируется в наборы BenchRU.
Модели видят публичные тесты в обучении. Поэтому часть каждого набора живёт в закрытом holdout, версии наборов ротируются, а у каждой версии фиксируется дата публикации — её можно сопоставить с датой обучения модели.
Число без контекста ничего не значит. Каждый запуск фиксирует точную версию модели, harness, профиль оценки, параметры генерации, среду и неизменяемый отпечаток — протокол можно проверить и повторить.
Среднее по всему скрывает провалы. Мы публикуем измерения по отдельности: качество, безопасность, надёжность, эффективность, покрытие. Прочерк — «не измерено», а не ноль.
Модель-судья удобна, но смещена. Такие метрики помечаются отдельно, судья фиксируется в профиле оценки, а ключевые наборы проходят экспертную выборочную проверку.