НАБОР ЗАДАЧ
Код с русскоязычной постановкой задачи
Отличие от оригинала: русскоязычный оригинал · подмножество
Код с русскоязычной постановкой задачи
Набор изначально русскоязычный и запускается как есть, без перевода. Оценку ставит модель-судья строго по критериям набора; провенанс судьи (модель, версия, промпт) фиксируется на прогоне. Сколько задач вошло в прогон — указано в версии набора; пока опубликованных версий нет, чисел нет.
Прогоняется подмножество оригинала, а не весь набор: число задач указано рядом с результатом, и сравнивать наши числа с публикуемыми авторами напрямую нельзя. Приватного холдаута у адаптации нет. Оценка — прохождение тестов, поэтому частично верное решение засчитывается как неверное.
Восходит к HumanEval, который заведомо в обучающих корпусах; русская постановка снижает, но не снимает риск.
Hugging Face — MERA-evaluation/MERA (конфигурация ruhumaneval)
MERA-evaluation · mit · дата обращения 3 сентября 2026 г.