ЗДЕСЬ медиа
liquid.ai

Liquid AI представила зрительно-языковую модель LFM2.5-VL-3B с локальным запуском на мобильных устройствах

Команда Liquid AI выпустила LFM2.5-VL-3B — зрительно-языковую модель на 3 миллиарда параметров, оптимизированную для работы на конечных устройствах. При объеме занимаемой оперативной памяти около 3 ГБ модель способна локально обрабатывать данные на смартфонах, выдавая скорость до 20 токенов в секунду на устройствах уровня Galaxy S26 Ultra. На десктопных процессорах вроде Apple M5 Max этот показатель достигает 228 токенов в секунду, что делает архитектуру применимой для задач реального времени, где критична скорость отклика.

Ключевым фокусом новой версии стало распознавание цифровых интерфейсов и способность взаимодействовать с инструментами. В бенчмарке ScreenSpot-v2, который оценивает навигацию по мобильным, веб- и десктопным экранам, модель набирает 80,7 балла, обходя 8-миллиардную Gemma-4, чей результат составил 51,2. Одновременно с этим разработчики улучшили механизм пространственной привязки объектов к координатам, повысив точность в тестах RefCOCO почти на 30 пунктов за счет масштабирования синтетических обучающих данных.

В основе LFM2.5-VL-3B лежит базовая текстовая модель, предварительно обученная на 34 триллионах токенов, и визуальный энкодер SigLIP2. Архитектурно это система прямого ответа без скрытых цепочек рассуждений, что минимизирует вычислительную задержку до генерации первого токена. Открытые веса уже доступны на Hugging Face, а для интеграции в локальные и серверные пайплайны заявлена нативная поддержка llama.cpp, MLX, vLLM и ONNX.

Поделиться:

Telegram

Ещё из архива

Все публикации