Liquid AI представила зрительно-языковую модель LFM2.5-VL-3B с локальным запуском на мобильных устройствах

Команда Liquid AI выпустила LFM2.5-VL-3B — зрительно-языковую модель на 3 миллиарда параметров, оптимизированную для работы на конечных устройствах. При объеме занимаемой оперативной памяти около 3 ГБ модель способна локально обрабатывать данные на смартфонах, выдавая скорость до 20 токенов в секунду на устройствах уровня Galaxy S26 Ultra. На десктопных процессорах вроде Apple M5 Max этот показатель достигает 228 токенов в секунду, что делает архитектуру применимой для задач реального времени, где критична скорость отклика.
Ключевым фокусом новой версии стало распознавание цифровых интерфейсов и способность взаимодействовать с инструментами. В бенчмарке ScreenSpot-v2, который оценивает навигацию по мобильным, веб- и десктопным экранам, модель набирает 80,7 балла, обходя 8-миллиардную Gemma-4, чей результат составил 51,2. Одновременно с этим разработчики улучшили механизм пространственной привязки объектов к координатам, повысив точность в тестах RefCOCO почти на 30 пунктов за счет масштабирования синтетических обучающих данных.
В основе LFM2.5-VL-3B лежит базовая текстовая модель, предварительно обученная на 34 триллионах токенов, и визуальный энкодер SigLIP2. Архитектурно это система прямого ответа без скрытых цепочек рассуждений, что минимизирует вычислительную задержку до генерации первого токена. Открытые веса уже доступны на Hugging Face, а для интеграции в локальные и серверные пайплайны заявлена нативная поддержка llama.cpp, MLX, vLLM и ONNX.
Поделиться:
Ещё из архива
Все публикации
Интервью с Владимиром Аюевым: графический язык бигтеха, студия SASHA и дизайн-образование
1 месяц назад
Jockey от TwelveLabs: ИИ-агент для семантического поиска по видеоархивам и извлечения метаданных
1 месяц назад
Архитектура винной этикетки: баланс наборного шрифта и каллиграфии в кейсе Winecraft
1 месяц назад
Оптимизация контекста в Claude Code: как работает кэширование промптов и за что мы платим
1 месяц назад
Архитектура памяти для LLM-агентов: от базового SQLite до Graph RAG
1 месяц назад