Создан новый бенчмарк PRACT-120 для комплексной оценки ИИ-чатов
Разработчики представили PRACT-120 — новый бенчмарк, который позволяет оценить не только базовую модель, но и совокупность инструментов, окружающих ИИ-чат, включая его память, возможности поиска в интернете и контекстное понимание.
Существующие бенчмарки, такие как MMLU, GPQA и HumanEval, измеряют производительность исключительно базовых языковых моделей. Однако современные ИИ-чаты представляют собой гораздо более сложные системы, включающие интеграцию с внешними инструментами, возможности работы с контекстом диалога и доступ к актуальной информации через интернет. Эти аспекты, критически важные для реального пользовательского опыта, до сих пор оставались без должной оценки.


Комментарии (0)
Без регистрации. Комментарии проверяются автоматически перед публикацией.
Пока нет комментариев. Будьте первым!