Habr: как перешли от AI-судьи до внешнего сервиса для оценки качества LLM
Команда Habr разработала и внедрила новый подход к оценке качества работы больших языковых моделей (LLM), отказавшись от внутреннего «AI-судьи» в пользу выделенного внешнего сервиса.
Первоначальная система, представлявшая собой «AI-судью», оценивала ответы LLM для поддержки пользователей по десяти метрикам, но не могла точно определить долю решённых обращений. Выяснилось, что текстовые проверки часто ошибочно принимали правдоподобные ответы за корректные, подтверждённые реальным решением проблемы. Разрыв между текстовой оценкой (18/20) и фактической эффективностью при работе с инструментами (8/20) указал на несовершенство такого подхода.
Выявленные «фантомные эскалации» — ситуации, когда слова бота не соответствовали его реальным внутренним действиям — стали серьёзной проблемой. Это означало, что метрики, измерявшие согласованность формулировок, не давали полезной продуктовой оценки.
В результате команда Habr приняла решение создать отдельный сервис для оценки качества работы LLM, который использует независимые источники истины. Такой подход позволяет получить более объективную и точную картину эффективности языковых моделей, а не только их текстовой правдоподобности.
Эта инициатива подчёркивает растущую потребность в надёжных и точных методах оценки производительности AI-систем, особенно в контексте клиентской поддержки, где фактическое решение проблемы важнее, чем формально правильный ответ.
Часто задаваемые вопросы
Почему Habr изменил подход к оценке LLM?
Habr изменил подход, потому что их изначальный «AI-судья» не мог точно определить реальную долю решённых обращений и давал завышенные оценки из-за несоответствия текстовых ответов фактическим действиям LLM.
Что такое «фантомные эскалации» в контексте работы LLM?
«Фантомные эскалации» — это ситуации, когда ответы языковой модели звучат правдоподобно, но не соответствуют её реальным внутренним действиям или не ведут к фактическому решению проблемы.
Как новый сервис Habr будет оценивать качество LLM?
Новый сервис Habr будет оценивать качество работы LLM как отдельная система, используя независимые источники для верификации и получения объективной оценки производительности языковых моделей.
В чем заключается основная проблема текстовой оценки LLM?
Основная проблема текстовой оценки заключается в том, что она может считать правдоподобный ответ верным, не проверяя, было ли фактически выполнено необходимое действие или решена ли проблема, что приводит к некорректным метрикам эффективности.
Источник: Habr · Rusability ИИ


Комментарии (0)
Без регистрации. Комментарии проверяются автоматически перед публикацией.
Пока нет комментариев. Будьте первым!