Локальная LLM Needle 2 весом 14 МБ для вызова функций и парсинга данных

Вышла Needle 2 — локальная LLM на 45M параметров для tool calling и генерации JSON. Вся модель упакована в единственный бинарный файл весом 14 МБ. Для работы сессии требуется всего 28 МБ оперативной памяти. Модель запускается на микроконтроллерах ESP32-S3, дешевых смартфонах и гарнитурах без GPU.
Движок написан на C++ без внешних зависимостей. При запуске он аппаратно анализирует процессор и выбирает оптимальное ядро. В основе лежит архитектура Simple Attention Network. Разработчики полностью отказались от пост-квантования. Модель изначально тренировалась в формате CQ2-bit. Веса не распаковываются в RAM, а вычисления идут в int8. Скорость декодирования на Raspberry Pi 5 достигает 500 токенов в секунду.
Needle 2 не предназначена для чатов или генерации текста. Ее задача — маппинг естественного языка на функции с типизированными аргументами. При извлечении данных движок компилирует грамматику из заданной схемы. Это полностью исключает появление невалидного JSON на выходе. На структурных токенах алгоритм пропускает до 98% вычислений проекции словаря. Модель можно быстро дообучить под свой набор инструментов на локальном ПК.
Поделиться:
Ещё из архива
Все публикации
Интервью с Владимиром Аюевым: графический язык бигтеха, студия SASHA и дизайн-образование
1 месяц назад
Jockey от TwelveLabs: ИИ-агент для семантического поиска по видеоархивам и извлечения метаданных
1 месяц назад
Архитектура винной этикетки: баланс наборного шрифта и каллиграфии в кейсе Winecraft
1 месяц назад
Оптимизация контекста в Claude Code: как работает кэширование промптов и за что мы платим
1 месяц назад
Архитектура памяти для LLM-агентов: от базового SQLite до Graph RAG
1 месяц назад