Splash ускоряет работу локальных LLM на Mac с помощью спекулятивного декодирования
Разработчики представили Splash — инструмент, который повышает скорость работы больших языковых моделей (LLM) на компьютерах Mac, используя технологию спекулятивного декодирования DFlash 2.
Splash призван оптимизировать выполнение LLM непосредственно на устройствах macOS, позволяя пользователям получать более быстрые ответы от моделей без необходимости обращения к облачным сервисам. Технология спекулятивного декодирования, лежащая в основе Splash, предполагает генерацию нескольких вариантов продолжения текста с последующей проверкой их корректности, что существенно сокращает время вывода.


Комментарии (0)
Без регистрации. Комментарии проверяются автоматически перед публикацией.
Пока нет комментариев. Будьте первым!