Что такое LLM в нейросетях: эмулятор ZX Spectrum показал, где модели заменяют джуна, а где бессильны
Спор вокруг LLM в нейросетях выходит за рамки теории: практик с Хабра переписал эмулятор ZX Spectrum силами сразу нескольких больших языковых моделей и выяснил, где они уже заменяют разработчика, а где бессильны даже вчетвером.

Реальный проект на C++ и Go с конкретными провалами и победами показывает границу возможностей LLM точнее любого бенчмарка: модели уверенно пишут обвязку и рефакторят архитектуру, но ломаются на задачах, требующих инженерного опыта, которого нет в обучающих данных.
Автор Хабра около года вёл серию статей о разработке эмулятора ZX Spectrum. Сначала писал на Go, потом переписал на C++, а в третьем заходе решил проверить, справятся ли LLM (Large Language Model, большая языковая модель, то есть нейросеть, обученная на огромных массивах текста и кода для генерации связных ответов) с полным циклом разработки. В его распоряжении оказались Qwen, GLM, Sol, DeepSeek, а также Claude и GPT. Результат оказался неоднозначным, и именно эта неоднозначность ценнее любого рекламного ролика.
Как выглядел процесс на практике?
Автор начал с архитектуры. Qwen получил исходники нескольких эмуляторов и написал файл ARCHITECTURE.md. Документ тут же отправился на ревью в GPT, который «обругал за плохие методики» и поправил формулировки. Затем архитектуру рецензировали Sol и DeepSeek. Только после четырёх раундов автор прочитал результат сам и, по его словам, «особых претензий высказать не смог».
Реализацию начал DeepSeek: перенёс процессор Z80, сделал обвязку по шине, портам и памяти. Sol подключился с кодом видеоконтроллера ULA и клавиатуры. За пару часов появился эмулятор, способный выводить на экран знаменитую надпись «© 1982 Sinclair Research Ltd».
Дальше автор столкнулся с микролагами, которые уже однажды убили предыдущую версию. Все модели получили жёсткий промпт (промпт, текстовая инструкция для нейросети): «Разобраться, отчего лаги, и предложить решение». Ответ оказался точным: графическая библиотека Fyne буферизирует данные многократно, нужно переходить на SDL3. Совет сработал, и разработка пошла быстрее.
Аргументы за: LLM уже на уровне джуна
- Скорость архитектурного ревью. Четыре модели за несколько часов выдали и отрецензировали архитектуру, на которую у одного разработчика ушли бы дни.
- Диагностика инфраструктурных проблем. Модели точно определили причину микролагов и предложили конкретную замену библиотеки.
- Самоорганизация через MCP. Автор попросил DeepSeek написать MCP-сервер (Model Context Protocol, протокол, через который модель подключается к внешним инструментам). Модели сами компилировали код, сравнивали результаты, притащили дизассемблер и простую OCR (оптическое распознавание символов) и «допинали эмулятор до состояния, когда он умеет читать образы кассет и играть музыку».
- Широта знаний. Автор прямо пишет: ни один живой разработчик не обладает такой широтой. Модели одновременно работали с ассемблером Z80, Go, C++, SDL3 и спецификациями железа 1980-х.
Где LLM провалились полностью?
Дисковый контроллер WD1793 (в советской маркировке КР1818ВГ93) стал стеной. Автор дал моделям даташиты, карту портов и команду «твори». Результат: «полный ноль по всем фронтам, обсыпанный горами токенов».
Ни одна модель не смогла ни написать рабочую реализацию контроллера, ни найти ошибки в попытках другой. Даже после того, как автор добавил в контекст код работающих эмуляторов, модели выдавали «красивое, проходящее все ими же написанные тесты, но не работающее» решение.
Ключевая проблема: модели не различали обычный ввод с клавиатуры и токенизированный (токен в этом контексте, минимальная единица текста, которую модель обрабатывает). Разницу между режимами 48K и 128K Spectrum приходилось «буквально забивать приказом».
Галлюцинации (галлюцинация, когда нейросеть уверенно выдаёт несуществующий факт) тоже проявились в полную силу: модели генерировали тесты, которые подтверждали их же неверный код.
Сегодня я смело могу утверждать, что по своему уровню они достигли джунов. Настоящий кожаный мешок не обладает такой широтой знаний. Но зато умеет творить. : Автор проекта, Хабр
Что с этого вам прямо сейчас?
Автору Дзена. Понимание того, что такое LLM в нейросетях, перестаёт быть академическим вопросом. Если вы пишете о технологиях, вот конкретный кейс, который показывает и силу, и границы. Используйте его как основу для собственного разбора: читатели ценят реальные примеры выше абстрактных объяснений.
Маркетологу. Модели уже справляются с типовыми задачами: написать обвязку, отрецензировать структуру, найти инфраструктурную ошибку. Но продавать LLM как «замену команды» опасно: клиент столкнётся с дисковым контроллером, то есть с нетиповой задачей, и разочаруется.
Разработчику и предпринимателю в РФ. Qwen, GLM, DeepSeek доступны без VPN. Автор использовал именно их как основных исполнителей, Claude и GPT шли параллельно. Из российских аналогов для код-ревью и генерации можно пробовать YandexGPT и GigaChat, хотя для низкоуровневого кода на C++ их возможности пока скромнее.
Этот проект, пожалуй, самая честная демонстрация того, что такое LLM в нейросетях на практике. Не бенчмарк, не рекламный ролик, а месяцы работы с конкретными моделями на конкретной задаче.
Я вижу здесь два вывода. Первый: мультимодельный конвейер (архитектуру пишет одна модель, ревьюит другая, код генерирует третья) работает. Это не теория, автор получил рабочий эмулятор за часы. Второй: граница проходит ровно там, где заканчиваются обучающие данные. WD1793 слишком нишевая тема, и никакой промпт-инжиниринг (промпт-инжиниринг, искусство формулировать запросы так, чтобы модель давала нужный результат) это не компенсирует.
Что делать автору сегодня: используйте LLM как джуна. Давайте чёткие задачи, проверяйте каждый результат, не доверяйте тестам, которые модель написала сама для своего же кода. И держите рядом второй инструмент для перекрёстной проверки.
Через год модели, вероятно, справятся и с дисковым контроллером: обучающие данные растут, а инструменты вроде MCP-серверов позволяют моделям самим дотягиваться до нужной информации. Но пока разработчик, который умеет запустить чужой эмулятор, посмотреть глазами на результат и понять, чего именно не хватает нейросети, остаётся незаменимым звеном. Не потому что LLM глупы, а потому что «творить», по выражению автора, они пока не научились.

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».
Читайте также

Управление требованиями: это нужно 80% аналитиков, но реально работает лишь у 4%
Управление требованиями в ИИ-проектах выглядит полезным для 80% аналитиков, но реально применяется лишь в 4% команд, и эта статья разбирает, почему так вышло и…

Сравнение нейросетей Claude на рутине: младшая модель решает 4 из 5 задач, но стоит в 9 раз дешевле
Почему это важно Практик выложил 40 прогонов четырёх моделей одного семейства на одинаковых задачах и показал: на рутине младшая модель решает всё не хуже…

Домашний сервер LLM на списанных V100: 128 ГБ видеопамяти дешевле одной RTX 5070
Домашний сервер для работы с большими языковыми моделями (LLM, Large Language Model) можно собрать на списанных серверных ускорителях NVIDIA Tesla V100,…
Комментарии