Разработан собственный бенчмарк для выбора LLM в корпоративных задачах
Команда из Habr успешно разработала и применила собственный бенчмарк для сравнения крупномасштабных языковых моделей (LLM) DeepSeek, ChatGPT и Claude, чтобы выбрать наиболее подходящую для задач внутренних ИИ-ассистентов.
Обычно выбор LLM для корпоративных решений основывается на публичных рейтингах, которые не всегда отражают специфику конкретных задач и экономическую эффективность. В ответ на это, специалисты создали уникальную систему оценки, позволяющую протестировать модели на 24 вопросах, связанных с их внутренней электронной лабораторной базой данных.
Тестирование проводилось в условиях реальной работы с электронным лабораторным журналом, где ИИ-ассистент должен отвечать на вопросы, используя данные экспериментов и измерений. Этот подход обеспечил максимальную релевантность результатов для их специфических потребностей, давая более точное представление о возможностях каждой модели в сравнении с общими бенчмарками.
В качестве исследуемых моделей выступили DeepSeek, ChatGPT и Claude. Применение MCP (Multi-modal Content Processing) позволило проверить их способности к обработке и интерпретации данных из живого рабочего журнала. Результаты этого внутреннего исследования помогут оптимизировать выбор LLM для конкретных сценариев использования, сокращая затраты и повышая эффективность внутренних процессов.
Часто задаваемые вопросы
Почему обычные рейтинги LLM не подходят для выбора модели?
Публичные рейтинги не учитывают специфику конкретных корпоративных задач и не дают информации о реальной стоимости использования модели для этих задач.
Какие LLM были протестированы в рамках разработанного бенчмарка?
Были протестированы крупномасштабные языковые модели DeepSeek, ChatGPT и Claude.
Какую задачу решал ИИ-ассистент, для которого выбирали LLM?
ИИ-ассистент должен был отвечать на вопросы, используя данные из внутренней электронной лабораторной базы, содержащей результаты экспериментов и измерений.
Как проводилось тестирование моделей в рамках бенчмарка?
Модели отвечали на 24 специально разработанных вопроса, основанных на данных из живого рабочего журнала, с использованием метода MCP.
Источник: Habr · Rusability ИИ


Комментарии (0)
Без регистрации. Комментарии проверяются автоматически перед публикацией.
Пока нет комментариев. Будьте первым!