«Ты моя супер модель»: 10 локальных MOE-моделей на ПК с 8 ГБ генерируют игры с первого промпта
Компания или автор, которые стоят за тестом, не являются корпорацией: это русскоязычный энтузиаст, который опубликовал результаты локального запуска открытых MOE-моделей (MOE, Mixture of Experts, архитектура, где модель активирует не все параметры сразу, а только нужную группу «экспертов», что экономит память и ускоряет работу) на своём ПК. Источник, личный пост автора без указания даты, издания и фамилии. Далее строго по его данным.

Энтузиаст из русскоязычного сообщества прогнал десять открытых MOE-моделей через три одинаковых задания на генерацию браузерных игр и выложил таблицы с баллами, токенами и скоростью, показав, какие локальные модели уже справляются с задачами, которые год назад не давались даже облачным лидерам.
Тест проведён на обычном домашнем ПК с видеокартой на 8 ГБ, а не на серверном кластере, и при этом часть моделей выдала играбельный результат с первого промпта, чего автор не видел ещё год назад даже у топовых закрытых моделей.
Результаты опубликовал русскоязычный тестер на площадке сообщества. Ещё год назад, по его словам, ни одна топовая модель не могла сделать готовую игру за один промпт. Сейчас локальные MOE-модели с открытыми весами (open weights, когда автор публикует параметры модели и любой может запустить её у себя) справляются с этим на домашнем железе. Контекст простой: если «ты моя супер модель» перестаёт быть комплиментом облачному сервису и становится фразой про локальную модель на собственном компьютере, рынок изменился.
| Что | Когда | Кто провёл | Цена |
|---|---|---|---|
| Сравнительный тест 10 локальных MOE-моделей на генерации браузерных игр (HTML, CSS, JS) | Дата публикации не указана | Русскоязычный энтузиаст (имя не раскрыто) | Бесплатно: все модели с открытыми весами, запуск через Llama.cpp |
Какие модели участвовали и что показали?
В тесте участвовало десять моделей:
- Qwen 3.6 (MTP) — базовая модель, на архитектуре которой построены многие конкуренты. Поддерживает MTP (Multi-Token Prediction, генерация нескольких токенов за шаг, что ускоряет вывод). Скорость 37–40 токенов в секунду.
- KAT Coder V2.5
- Gemma 4 — скорость 28 токенов в секунду.
- Aurora-Code-1
- Frontis
- GLM 4.7 Flash — скорость 18 токенов в секунду.
- Ornith 1.0
- Salience 1.5 Pro
- Agents A1
- GPT-oss 20b
Многие из этих моделей дообучены (fine-tuning, обучение модели на дополнительных примерах под конкретную задачу) на базе Qwen. По бенчмаркам в карточках на HuggingFace они нередко обходят «учителя». Автор заранее отнёсся к этому скептически, и итоговая таблица его скепсис подтвердила: дообученные модели не смогли стабильно превзойти оригинальный Qwen.
Итоговый балл рассчитывался по формуле:
Final = (Gameplay + Mobile + Visuals + Stability + Efficiency) × 2
Аналитику баллов проводила модель Qwen3.8-Max, которая читала отдельную страницу с описаниями ощущений от играбельности, таблицами и коллажами скриншотов.
Три задания, три уровня сложности
Автор давал каждой модели одинаковые промпты (prompt, текстовое задание для модели):
- «Мастермайнд» — подробнейший промпт с описанием интерфейса, логики чёрных и белых маркеров, адаптивного дизайна под мобильные. Этот промпт автор использует давно как личный бенчмарк.
- Тетрис — короткий запрос без уточнений про мобильную версию. Результат: даже два из трёх лучших мест не сделали мобильную адаптацию.
- «Танчики» в стиле Battle City — запрос на английском языке, подсмотренный у пользователя Хабра.
Автор честно отмечает: методика субъективна. Даже если модель справилась с первого раза, при повторном запуске она может выдать совсем другой результат. Qwen при этом оказался стабильнее остальных, плюс получил бонус от MTP-ускорения.
Как попробовать самому?
- Убедитесь, что у вас есть видеокарта с 8 ГБ видеопамяти и хотя бы 32 ГБ оперативной памяти. Автор использовал RTX 3070, Ryzen 9 5950X.
- Установите свежую сборку Llama.cpp — открытый инструмент для локального запуска моделей.
- Используйте флаг -cmoe, который переносит часть слоёв модели в оперативную память. Это позволяет запускать квантованные модели (сжатые версии, занимающие меньше памяти) весом больше 20 ГБ даже на карте с 8 ГБ, хотя и с некоторой потерей скорости.
- Скачайте нужную модель с HuggingFace (ссылки автор приложил в таблице результатов) и дайте ей свой промпт.
Модели на базе Qwen выдавали у автора 25–28 токенов в секунду, сам Qwen с MTP — до 40 токенов в секунду.
Облачные сервисы в России: есть ли смысл сравнивать?
Для читателей, привыкших к YandexGPT или GigaChat, контекст такой: облачные сервисы не требуют мощного ПК, работают из браузера и проще в освоении. Локальные модели бесплатны, не отправляют ваши данные на чужие серверы и не зависят от подписки. Но требуют технической подготовки.
| Параметр | Локальные MOE-модели | YandexGPT / GigaChat |
|---|---|---|
| Стоимость | Бесплатно (нужен мощный ПК) | Подписка или оплата за токены |
| Приватность данных | Всё на вашем компьютере | Данные уходят на сервер |
| Простота запуска | Нужна установка Llama.cpp, настройка | Открыл браузер и работаешь |
| Генерация кода | Зависит от модели, результаты нестабильны | Зависит от модели, но интерфейс проще |
| Доступность в РФ | Без ограничений | Без ограничений |
Если вам говорят «ты моя супер модель сумасшедший», а вы просто хотите, чтобы нейросеть написала рабочий код с первого раза, облачные сервисы пока надёжнее. Но разрыв сокращается.
Что делать с этим прямо сейчас, по ролям?
Автору Дзена. Если вы пишете про технологии или делаете обзоры, тест из статьи — готовый формат контента: берёте несколько моделей, даёте одинаковое задание, сравниваете результат. Аудитории нравятся честные сравнения с живыми примерами.
Маркетологу. Локальные модели пока не заменят облачные для продакшен-задач: результаты нестабильны от запуска к запуску. Но для прототипирования лендингов и интерактивных элементов без бюджета — уже рабочий вариант.
Предпринимателю в РФ. Главное преимущество: никакой зависимости от зарубежных API, санкционных рисков и подписок. Всё работает на вашем железе. Минус: нужен сотрудник, который умеет это настроить.
Этот тест ценен не таблицей баллов, а самим фактом: обычный пользователь на домашнем ПК с видеокартой за 40–50 тысяч рублей запускает модели, которые год назад существовали только в облаке. По моим наблюдениям, каждые три-четыре месяца локальные модели отъедают ещё один кусок у облачных сервисов. Оговорка честная: стабильность пока слабое место. Одна и та же модель может выдать отличный результат, а через минуту — мусор. Что сделать сегодня: установите Llama.cpp, скачайте Qwen 3.6 (MTP) как самую стабильную из протестированных и попробуйте дать ей ваш рабочий промпт. Не для продакшена — для понимания, где сейчас граница возможностей.
Частые вопросы
Нужна ли мощная видеокарта для запуска MOE-моделей?
Желательна, но не обязательна топовая. Автор теста использовал RTX 3070 с 8 ГБ видеопамяти. Флаг -cmoe в Llama.cpp позволяет перенести часть вычислений в обычную оперативную память. Скорость снижается, но модели работают.
Какая модель показала лучший результат?
Автор не назвал единственного победителя в тексте, но отметил, что Qwen 3.6 (MTP) оказался стабильнее остальных и быстрее за счёт MTP. Подробные баллы — в его таблице результатов.
Можно ли использовать результаты для серьёзных проектов?
С осторожностью. Автор прямо говорит: даже успешный результат не гарантирует повторяемости при следующем запуске. Для критичных задач пока лучше облачные модели с проверенной стабильностью, а локальные использовать для экспериментов и прототипов.
Год назад даже облачный Claude справлялся с игрой «Мастермайнд» за один промпт как исключение. Сейчас это делает локальная модель на домашнем компьютере. Не каждый раз и не каждая, но делает. Направление понятно, и тем, кто хочет независимости от облачных подписок, стоит начать осваивать локальный запуск уже сейчас.

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».
Читайте также

Большие языковые модели пропускают джейлбрейки: какие риски это создаёт и как защититься
Большие языковые модели (LLM, нейросети, которые генерируют текст и код по запросу) обучены отказывать на опасные вопросы, но злоумышленники научились обходить…

Self hosted LLM vs облако: год в Selectel показал, когда своя модель выгоднее API
Контекст — это не про IQ модели, а про безопасность данных: если код нельзя отправить наружу, выбор делается не между «лучшей» и «худшей» моделью, а между…
OpenAI впервые остановила новую модель: та научилась взламывать системы без человека
OpenAI второго июня приостановила внутреннюю разработку новой модели Astra, которая по результатам собственных проверок компании может обладать критическими…
Комментарии