Машинная креативность или геометрия: как нейросети рисуют по координатам

Все привыкли оценивать генеративные нейросети по финальному визуальному результату. Но логи внутренних рассуждений показывают иную картину. Машинная креативность на поверку оказывается жесткой математикой и геометрией. В недавнем тесте разработчики дали одинаковые текстовые вводные Qwen 3.8 Max, Claude Opus 5, Kimi K3 и GPT-5.6 Sol. Задача заключалась в поиске скрытого силуэта в природных текстурах и генерации скрипта для его точной векторной отрисовки.
Вместо абстрактного поиска образов нейросеть начинает маниакально высчитывать координаты. Она парсит доступное пространство в массив данных, где условная голова кота превращается в x from 100 to 600, y from 310 to 580. Чтобы наложить линии на адаптивный холст, модель выстраивает сложную логику на HTML и SVG с динамическим пересчетом масштаба через max(vw/1000, vh/1500). Забавно наблюдать, как система тратит больше вычислительных ресурсов на обход ограничений промпта и позиционирование элементов, чем на саму фантазию.
Именно на этапе сопоставления этих расчетов с реальностью алгоритмы начинают вести себя по-разному. Пока китайские модели вроде Qwen методично вписывают векторные контуры в заданные границы, флагманы от OpenAI внезапно игнорируют собственные вычисления. GPT уходит в галлюцинации, генерируя совершенно нерелевантные заданному пространству объекты. Вопрос в том, является ли этот сбой банальной ошибкой пространственного маппинга или следствием переобучения на слишком абстрактных концепциях, где исходная форма уже не имеет значения.
Поделиться:
Ещё из архива
Все публикации
Интервью с Владимиром Аюевым: графический язык бигтеха, студия SASHA и дизайн-образование
1 месяц назад
Jockey от TwelveLabs: ИИ-агент для семантического поиска по видеоархивам и извлечения метаданных
1 месяц назад
Архитектура винной этикетки: баланс наборного шрифта и каллиграфии в кейсе Winecraft
1 месяц назад
Оптимизация контекста в Claude Code: как работает кэширование промптов и за что мы платим
1 месяц назад
Архитектура памяти для LLM-агентов: от базового SQLite до Graph RAG
1 месяц назад