Китайская SenseNova обновила линейку генеративных моделей. Третья версия выдает нативное разрешение до 8K и поддерживает нестандартные соотношения сторон — от ультрашироких панорам до вытянутых вертикальных форматов. В архитектуру заложены функции редактирования, а для работы с плотным текстом и генерацией инфографики подготовлена отдельная версия весов.
Параллельно разработчики открыли код и веса SenseNova-Vision. Проект сводит разрозненные задачи компьютерного зрения к единому формату мультимодальной генерации. Вместо использования специфичных голов предсказания под каждую задачу, единая модель принимает естественные языковые инструкции. На выходе она генерирует либо текст с координатами, боксами и OCR-строками, либо изображения — маски сегментации, карты нормалей, карты глубины и 3D-облака точек.
В основе проекта лежит тренировочный датасет на 50 миллионов примеров, где классические визуальные аннотации переведены в формат диалога. Опубликованная 7-миллиардная модель обходит Qwen-VL и Grounding DINO в задачах понимания графических интерфейсов и локализации объектов. В репозитории лежат готовые пайплайны для обучения на собственных данных, оценки метрик и скрипты для локального инференса.
Поделиться:
Нил Бломкамп выпустил 13-минутный научно-фантастический фильм NIGHTBORNE, полностью сгенерированный в нейросети Seedance 2.0
Управление глубиной рассуждений в LLM: механика обучения через проверяемые награды