Нейросеть для дизайна интерьера и сайтов: три модели нашли три пути к вкусу
Нейросети теперь проектируют сайты, которые сложно отличить от работы живого дизайнера, и бенчмарк Design Arena впервые показал, как именно три модели пришли к этому разными путями.

Впервые исследователи разобрали не просто результат, а механику: одна модель подавляет штампы, другая их не знает, третья думает кодом вместо слов, и каждый путь даёт конкретную разницу в цене, скорости и качестве для ваших проектов.
Команда бенчмарка Design Arena за неделю опубликовала два подробных разбора моделей, занявших первые места в дизайн-рейтингах. Разборы касаются GPT-5.6 Sol от OpenAI, Kimi K3 от китайской Moonshot AI и прошлого лидера GLM 5.2. Выяснилось, что универсального рецепта «хорошего вкуса» у нейросетей нет: каждая модель решает задачу дизайна принципиально по-своему.
Как Design Arena оценивает дизайн?
Design Arena устроена как слепое сравнение. Живые люди получают два сайта, сгенерированных разными моделями по одному и тому же запросу, и голосуют за тот, который нравится больше. Из голосов складывается Elo-рейтинг (система оценки, пришедшая из шахмат: чем больше побед над сильными соперниками, тем выше балл).
Именно такие арены зафиксировали феномен «типичного ИИ-дизайна»: фиолетово-синие градиенты, bento-сетки (сетка из скруглённых карточек, похожая на японскую коробку для обеда), гигантская типографика вместо заглавной картинки, сетка-подложка на фоне. У Design Arena для этого есть термин design smells, «запахи дизайна», и ещё три месяца назад ими страдала GPT-5.5.
Sol: знает штампы и отказывается их рисовать
GPT-5.6 Sol заняла первое место на арене Web Design (Non-Agentic) с Elo 1353, поднявшись на 18 позиций выше предшественницы GPT-5.5. По данным Design Arena, для OpenAI это первый выход на вершину дизайн-рейтинга.
При этом Sol задала два так называемых Парето-фронта (граница, за которой нельзя улучшить одно без ухудшения другого): среди моделей с сопоставимым рейтингом нет ни столь же быстрых, ни столь же дешёвых. По замерам Design Arena:
- Sol генерирует дизайны в 2,44 раза быстрее прошлого лидера GLM 5.2
- На 36% быстрее Claude Fable 5
- Стоит 5 долларов за миллион входных токенов (единица текста, которую обрабатывает модель) и 30 долларов за миллион выходных, против 10 и 50 долларов у модели Anthropic
Чтобы понять, что именно изменилось, исследователи взяли 1000 сгенерированных Sol сайтов и превратили каждый в CLIP-эмбеддинг (числовой «отпечаток», где похожие дизайны оказываются рядом на карте). Затем спроецировали всё в двумерное пространство и обнаружили странные дыры: пустые зоны, окружённые генерациями со всех сторон. У других моделей таких дыр нет.
Наложив генерации GPT-5.5 и Sol в общее пространство, исследователи увидели: облака точек почти всюду перекрываются, но в одном кластере Sol не генерирует ничего. Это именно сайты с фиолетовыми градиентами, bento-сетками, гигантской типографикой и смещёнными композициями. Вывод команды Design Arena: Sol выучила ИИ-антипаттерны и активно подавляет их. Модель знает, как выглядит «типичный ИИ-дизайн», но отказывается его воспроизводить.
Подавление, впрочем, работает не на всё. Конфетти появляется в 26,5% генераций Sol, модель даже пишет собственные библиотеки конфетти, когда готовых нет. С реалистичными диаграммами через chart.js у Sol тоже проблемы.
GLM 5.2: не знает штампов и потому не рисует их
GLM 5.2, прошлый лидер арены, решила ту же задачу иначе. По наблюдениям Design Arena, модель работает от набора удачных шаблонов, в которых штампов пока просто нет. В сети не так много сайтов, сделанных на основе GLM 5.2, поэтому она не успела впитать «запахи дизайна» из собственных генераций. Дыр в её пространстве не возникает: она не подавляет штампы, а просто их не выучила.
Для русскоязычной аудитории GLM 5.2, модель от китайской Zhipu AI, интересна тем, что китайские нейросети часто доступны без VPN и с более мягкими ограничениями на регистрацию, чем западные.
Kimi K3: думает кодом и помнит интернет наизусть
Kimi K3 от Moonshot AI заняла первое место на single-shot Frontend Arena с Elo 1408 (рост на 10 позиций относительно Kimi K2.6) и первое место на арене 3D-дизайна с Elo 1450, обойдя Claude Fable 5.
Исследователей удивила аномалия: на простых одношаговых задачах K3 тратит почти в 4 раза больше токенов размышлений, чем Kimi K2.7 Code. Разобрав цепочки рассуждений, команда выяснила: K3 симулирует внутри себя работу полноценного ИИ-агента (программы, которая сама планирует и выполняет шаги). Её рассуждения проходят стадии планирования, принятия решений, проектирования отдельных компонентов сайта с итерациями и «мысленным тестированием».
По подсчётам Design Arena на выборке из более чем 3000 генераций, K3 пишет в рассуждениях в 10 раз больше кода, чем любая другая модель линейки Kimi. Токенов кода в её размышлениях больше, чем собственно размышлений. Модель выражает план конкретным кодом и ограничениями, а не расплывчатым наброском, сознательно разменивая скорость и токены на качество.
У этой стратегии нашёлся неожиданный козырь. Чтобы вставить картинку на сайт, модель указывает ссылку на фото, обычно с бесплатного стока Unsplash. Ссылка содержит длинный ID конкретного снимка, и если ID неверный, вместо картинки появится серый квадрат. Большинство моделей либо угадывают ID наугад и получают битую картинку, либо ставят заглушку.
K3 вспоминает ID наизусть. За время обучения модель видела столько интернет-контента, что связки вида «этот ID соответствует фото заката над горами» записаны прямо в её весах (открытые веса, хранилище обученных параметров модели). В рассуждениях это разворачивается в цикл: модель решает, какая картинка нужна, выдаёт ID, затем сама оценивает, помнит ли она такой снимок и подходит ли он по смыслу. Настоящей проверки нет: сходить по ссылке модель не может и сверяется с собственной памятью. Но память K3 оказалась настолько точной, что в разобранных примерах не нашлось ни одной битой или нерелевантной картинки, тогда как Claude Fable 5 и Kimi K2.7 Code на тех же задачах ошибались.
Что делать с этим прямо сейчас?
-
Автору Дзена. Если вам нужны обложки, лендинги или макеты для статей, нейросеть для дизайна интерьера или сайта перестала быть экзотикой. Попробуйте Sol для быстрых макетов: она дешевле и быстрее конкурентов по данным Design Arena. Но проверяйте результат на «запахи дизайна»: конфетти и битые графики Sol пока пропускает.
-
Маркетологу. Три разных подхода к генерации означают, что выбор нейросети для дизайна интерьера, промо-страницы или лендинга зависит от задачи. Нужна скорость и низкая цена, Sol. Нужны реалистичные фото в макете без фотостока, K3.
-
Предпринимателю в РФ. Sol доступна через API OpenAI, Kimi K3 через Moonshot AI. GLM 5.2 от Zhipu AI доступна из России без VPN. Из российских аналогов для генерации визуала работают Kandinsky от Сбера и YandexART, но они пока не участвуют в Design Arena и прямых сравнений в этом бенчмарке нет.
Исследователи Design Arena дали трём моделям одинаковый запрос на генерацию сайта. Sol выдала чистый макет без фиолетовых градиентов, но добавила конфетти. GLM 5.2 сгенерировала дизайн на основе проверенного шаблона без штампов, но без картинок. K3 потратила в 4 раза больше токенов, но подобрала реальные фото с Unsplash по памяти и ни одна ссылка не оказалась битой.
Не принимайте рейтинг Design Arena за абсолютную истину. Это голосование живых людей по принципу «нравится больше», а не экспертная оценка юзабилити или конверсии. Сайт может выглядеть эффектно и проиграть в реальном бизнесе. Кроме того, Sol пока не справляется с диаграммами через chart.js, а память K3 на ID фотографий со временем устареет: фотостоки меняют ссылки и удаляют снимки.
Меня в этих разборах зацепило не «кто первый», а то, что путь к хорошему дизайну оказался тройным. Sol, это инженерный подход: модель изучила штампы и вычеркнула их, как редактор вычёркивает клише из текста. GLM 5.2, это чистый лист: она просто не успела нахвататься плохого. K3, это трудоголик: думает дольше, пишет код внутри собственных рассуждений и помнит интернет поимённо. Для практика из России я бы сейчас попробовал K3 на задачах, где нужны реальные фотографии в макете, а Sol, где нужна скорость и экономия на токенах. Но честная оговорка: ни одна из этих моделей не заменит финальную проверку живым глазом. Конфетти в каждом четвёртом макете Sol и слепая вера K3 в собственную память, это риски, которые пока ложатся на вас.
Попробуйте промпты для дизайна на практике
В библиотеке dzen.guru собраны готовые промпты для генерации макетов, обложек и лендингов с разбивкой по моделям и задачам.
Открыть библиотеку промптовТри модели, три философии, один вывод: нейросеть для дизайна больше не генерирует одинаковый фиолетовый мусор, но какой именно мусор она пропустит, зависит от того, какую модель вы выберете и проверите ли результат сами.

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».
Читайте также

Marker 2 обогнал конкурентов по парсингу PDF в 5 раз по скорости при лучшем качестве
Компания Datalab выпустила Marker 2, полностью переписанный открытый конвейер для парсинга PDF и других документов, который на бенчмарке olmOCR-bench обогнал…

ИИ-агенты OpenSpace сохраняют навыки между запусками, снижая расходы на API
Представьте, что ваш ИИ-агент не просто выполняет задачу, а сам учится её делать лучше, сохраняет удачные решения и переиспользует их, снижая ваши расходы на…

Какие новые функции получил ChatGPT от OpenAI: голос заменяет клавиатуру, но не всё так гладко
ChatGPT научился говорить почти как человек, и это повод не для восторга, а для честного разговора о том, какие новые функции получил ChatGPT от OpenAI и кого…
Комментарии