НАБОР ЗАДАЧ
Агентные диалоги с инструментами
Отличие от оригинала: перевод реплик · API инструментов оригинальный
Агентные диалоги с инструментами
Реплики пользователя и описания политик переводятся на русский; API инструментов остаётся английским. Прогон требует многошагового диалога, поэтому профиль `manual-chat` для него не подходит — используется API.
Прогоняется подмножество оригинала, а не весь набор: число задач указано рядом с результатом, и сравнивать наши числа с публикуемыми авторами напрямую нельзя. Приватного холдаута у адаптации нет. Перевод меняет условия: часть задач становится проще или сложнее, и результат отражает модель на русском, а не на языке оригинала. Роль пользователя играет другая модель, поэтому результат зависит и от неё; какая именно — фиксируется на прогоне.
Сценарии публичны, но успех требует соблюдения политики в диалоге, а не воспроизведения ответа, поэтому запоминание помогает ограниченно.
GitHub — sierra-research/tau-bench
sierra-research · MIT · дата обращения 3 сентября 2026 г.