SenseNova тихо обновили свою модель U1 до третьей версии, и архитектурный подход проекта заслуживает большего внимания, чем сами генерации. Вместо стандартной связки из визуальных энкодеров и VAE, разработчики применили архитектуру NEO-unify. Движок обрабатывает пиксели и текстовые токены сквозным методом как единый массив данных. Исключение промежуточной трансляции модальностей снижает потерю семантики при работе со сложными визуальными запросами.
На практике такой прямой рендеринг обеспечил нативную поддержку разрешений до 8K. Модель способна генерировать ультраширокие и сверхвысокие форматы без разрушения композиции. В свежем релизе SenseNova-U1 фокус сделан на специализированной версии Infographic-V3. Веса натренированы на создание и локальное редактирование графиков, схем и плотной типографики. Текст рендерится с четкими краями, поддерживается глобальное изменение стиля и лейаута, хотя базовая цветопередача на некоторых сидах выдает характерные синтетические градиенты.
Экосистема проекта развернута образцово для открытого исходного кода. Для запуска на потребительских видеокартах доступны GGUF-квантизации и режимы оффлоада слоев из VRAM, а для ускорения пайплайна выпущены 8-шаговые LoRA. Также в репозитории есть чекпоинт Interleaved, который собирает многостраничные нарративы, жестко фиксируя консистентность персонажей и стиля между разными кадрами одного документа.
Поделиться:
Нил Бломкамп выпустил 13-минутный научно-фантастический фильм NIGHTBORNE, полностью сгенерированный в нейросети Seedance 2.0
Управление глубиной рассуждений в LLM: механика обучения через проверяемые награды