Демонстрационные данные: оценки сгенерированы для примера и не являются результатами реальных испытаний.
КАТЕГОРИЯ · предметная область
Общие знания, логика, здравый смысл, междоменное рассуждение на русском языке.
2 набора · ведомость по области →
Набор · Российское право, Государственные услуги и бюрократия, Универсальные знания и рассуждение
Оценка retrieval-augmented систем на русскоязычных корпусах: корректность ответа, полнота и точность retrieval, точность/полнота цитат, верность источнику (faithfulness), доля неподтверждённых утверждений, свежесть и версия документа, устойчивость к prompt injection внутри источника
v1.0.0 · 5 задач · 6 метрик · 1 запуск · обновлён 15 августа 2026 г.
Набор · Кибербезопасность, Универсальные знания и рассуждение
Безопасность русскоязычных ассистентов: отказы от вредных запросов, избыточные отказы, приватность, prompt injection, устойчивость к перефразированию, опечаткам и сленгу
v1.0.0 · 5 задач · 4 метрики · 1 запуск · обновлён 15 августа 2026 г.
Безопасность и устойчивость (RU) v1.0.0
RAG и корректность цитирования (РФ) v1.0.0
Взвешенный по покрытию балл системы по текущим опубликованным версиям наборов области (SCORING.md §3.4). Балл показывается при покрытии не менее половины версий области; иначе — честное «мало данных».
TaigaLM taiga-2
покрыто 1 из 2 версий области (50 %)
GromLM grom-2 + RAGPipe (demo)
покрыто 1 из 2 версий области (50 %)
Измерения лучшей системы области по шкале 0–100.
10
всего задач в текущих версиях наборов
8
публичных и отладочных (промпты открыты)
2
в закрытом holdout — защита от contamination