Habr: как перешли от AI-судьи до внешнего сервиса для оценки качества LLM
Команда Habr разработала и внедрила новый подход к оценке качества работы больших языковых моделей (LLM), отказавшись от внутреннего «AI-судьи» в пользу выделенного внешнего сервиса.
Первоначальная система, представлявшая собой «AI-судью», оценивала ответы LLM для поддержки пользователей по десяти метрикам, но не могла точно определить долю решённых обращений. Выяснилось, что текстовые проверки часто ошибочно принимали правдоподобные ответы за корректные, подтверждённые реальным решением проблемы. Разрыв между текстовой оценкой (18/20) и фактической эффективностью при работе с инструментами (8/20) указал на несовершенство такого подхода.


Комментарии (0)
Без регистрации. Комментарии проверяются автоматически перед публикацией.
Пока нет комментариев. Будьте первым!