Liquid AI выпустила LFM2.5-VL-3B-DSpark — маленькую модель-помощника для своей зряче-языковой LFM2.5-VL-3B. Смысл простой: основная модель всё ещё отвечает, но рядом бежит черновик и заранее предлагает пачку следующих токенов. Главная модель потом проверяет каждый вариант. Не магия, скорее касса самообслуживания с охранником рядом.
Цифры приятные, но с оговорками. Сам DSpark-драфтер весит около 279,5 млн параметров, то есть добавляет примерно 8,9% к 3B-модели. За это Liquid AI намерила ускорение декодирования до 3,13 раза на устройстве и до 2,66 раза на H100. Полная задержка улучшается скромнее: до 2,62 раза на устройстве и до 2,27 раза на H100. Вот тут и подвох: ускоряется не вся дорога, а только участок, где модель печатает ответ.
Для vision-language моделей это особенно заметно. Перед ответом картинку ещё надо прогнать через vision encoder, потом смешать визуальные токены с текстом. DSpark этот кусок не чинит. Поэтому если тормозит именно разбор изображения или prefill, чудес не будет: скорость на табло вырастет, но не везде одинаково.
Доступ уже не только «почитайте блог и помечтайте». Есть Safetensors-версия и GGUF-сборка для llama.cpp; отдельно указана поддержка MLX-VLM и SGLang. Для разработчика это значит: можно прикрутить ускорение к локальному или серверному запуску LFM2.5-VL-3B, но придётся брать нужные сборки с поддержкой DSpark, а не просто поставить любую старую версию и ждать фейерверка.
Ещё важная граница: это open-weight, а не «вот вам весь open source праздник». Весы можно скачать, дообучать и деплоить, но сам релиз продаёт именно практическую штуку — дешевле ждать ответа от небольшой зрячей модели на краю сети. Если она и так была выбрана ради локального OCR, картинок, меню, дорожных знаков или быстрых VQA-задач, DSpark делает очередь короче. Если нужна тяжёлая рассуждалка по сложным чертежам, это вообще не тот прилавок.
