КАРТОЧКА · harness
Holistic Evaluation of Language Models (HELM) is an open source Python framework created by the Center for Research on Foundation Models (CRFM) at Stanford for holistic, reproducible and transparent evaluation of foundation models, including large language models (LLMs) and multimodal models.
| Версия | Релиз | Поддерживаемые инструменты |
|---|---|---|
| v0.5.16 | 30 апреля 2026 г. | — |
Сравнимых пар пока нет: чтобы оценить влияние harness'а, нужны запуски одной и той же модели на одной и той же версии набора — с harness'ом и без него.
Дельта — разность баллов качества по шкале 0–100 в сравнимых парах. Положительная дельта означает, что обвязка помогла на этом наборе; переносить вывод на другие наборы нельзя.