Datalab выпустила модель Lift для извлечения JSON из документов

Datalab открыла исходный код Lift — модели на 9B параметров. Она извлекает структурированные данные из многостраничных PDF и изображений. Разработчик передает любую JSON-схему, а модель возвращает валидный JSON-объект. Поддерживаются вложенные объекты и массивы. Данные собираются за один проход, даже при разрыве страниц.
В бенчмарке на 225 документов точность полей достигает 90.2%. Это сопоставимо с проприетарной Gemini Flash 3.5 с её 91.3%. Специализированная открытая модель NuExtract3 выдает только 81.5%. Медианная задержка при обработке документа составляет 9.5 секунды. Декодирование с ограничением по схеме гарантирует строгую типизацию результата.
Для запуска достаточно выполнить команду pip install lift-pdf. Проект поддерживает два режима инференса: через сервер vLLM или локально. В комплекте идет утилита командной строки и приложение на Streamlit. Оно помогает быстро собирать и тестировать схемы на реальных документах. Веса распространяются по лицензии OpenRAIL-M. Она бесплатна для компаний с доходом до 5 млн долларов.
Поделиться:
Ещё из архива
Все публикации
Интервью с Владимиром Аюевым: графический язык бигтеха, студия SASHA и дизайн-образование
1 месяц назад
Jockey от TwelveLabs: ИИ-агент для семантического поиска по видеоархивам и извлечения метаданных
1 месяц назад
Архитектура винной этикетки: баланс наборного шрифта и каллиграфии в кейсе Winecraft
1 месяц назад
Оптимизация контекста в Claude Code: как работает кэширование промптов и за что мы платим
1 месяц назад
Архитектура памяти для LLM-агентов: от базового SQLite до Graph RAG
1 месяц назад