IBM учит ИИ самостоятельно оценивать свои вопросы для бенчмарков
Компания IBM разрабатывает новую методику оценки ИИ под названием «Бенчмарки Мебиуса», которая позволяет ИИ-системам проверять корректность и непротиворечивость своих тестовых вопросов и эталонных ответов.
Обычно производительность ИИ-моделей измеряют с помощью бенчмарков, где ИИ решают стандартизированные задачи. Однако эффективность такого подхода зависит от качества самих тестовых заданий и ответов к ним. IBM обнаружила, что существующие бенчмарки часто содержат ошибки: некорректные эталонные ответы, противоречивые условия или правила оценки, которые приводят к неточной оценке возможностей ИИ.


Комментарии (0)
Без регистрации. Комментарии проверяются автоматически перед публикацией.
Пока нет комментариев. Будьте первым!