Liquid AI выпустила мультимодальную модель LFM2.5-VL-3B для локальных устройств

Компания Liquid AI представила легковесную зрительно-языковую модель LFM2.5-VL-3B, ориентированную на локальное выполнение. Архитектура объединяет языковое ядро LFM2.5-2.6B и визуальный энкодер SigLIP2 NaFlex, формируя систему размером 3 миллиарда параметров. При потреблении менее 3.3 ГБ оперативной памяти модель генерирует 228 токенов в секунду на чипах Apple M5 Max и около 20 токенов в секунду на современных мобильных процессорах, что позволяет запускать ее непосредственно на смартфонах без обращения к облачным серверам.
Модель поддерживает 16 языков, включая русский, и работает с контекстным окном до 32 тысяч токенов. Основной упор сделан на пространственную привязку объектов, полностраничное распознавание текста (OCR) с сохранением структуры документов и возможность вызова внешних инструментов (tool use). В результате система оптимально подходит для задач, требующих высокой скорости и минимальной задержки, таких как пакетная обработка документов или распознавание окружения в автомобильных интерфейсах, однако она не рассчитана на анализ сложных чертежей или комплексный визуальный дизайн.
В официальном релизе разработчики предоставили несколько форматов весов для разных сценариев использования. Помимо стандартных контрольных точек, доступны квантованные версии GGUF для центральных процессоров, ONNX для кроссплатформенного развертывания и MLX для устройств экосистемы Apple. Интеграция с фреймворками vLLM и SGLang обеспечивает вариативность развертывания, позволяя встраивать LFM2.5-VL-3B как в высоконагруженные серверные пайплайны, так и в граничные вычисления.
Поделиться:
Ещё из архива
Все публикации
Интервью с Владимиром Аюевым: графический язык бигтеха, студия SASHA и дизайн-образование
1 месяц назад
Jockey от TwelveLabs: ИИ-агент для семантического поиска по видеоархивам и извлечения метаданных
1 месяц назад
Архитектура винной этикетки: баланс наборного шрифта и каллиграфии в кейсе Winecraft
1 месяц назад
Оптимизация контекста в Claude Code: как работает кэширование промптов и за что мы платим
1 месяц назад
Архитектура памяти для LLM-агентов: от базового SQLite до Graph RAG
1 месяц назад