Робот на Raspberry Pi с голосом своими руками
Прежде чем писать, проверяю источник на предмет «funding». В оригинале нет ни раунда, ни инвестиций, ни суммы сделки. Это личный DIY-проект отца для дочери. Архетип «funding» не подтверждается ни одним фактом из источника. Таблицу «Сделка в цифрах» заполнить нечем — данных нет. Строю текст по фактам, честно указываю отсутствие финансовых данных, и перестраиваю структуру на то, что реально есть: практический проект с конкретными метриками.
Разработчик из России собрал для дочери автономного робота-собеседника на Raspberry Pi 5 с 8 ГБ памяти, локальными языковыми моделями и анимированным лицом, протестировав больше двадцати моделей и выбрав оптимальную по скорости и качеству ответов.
Проект показывает рабочую сборку голосового ИИ-помощника целиком на локальном железе, без облака и подписок: конкретные модели, реальные замеры скорости и список компонентов, которые можно заказать на маркетплейсе.
Публикация описывает не коммерческий продукт и не стартап с раундом инвестиций, а подробный личный проект. Автор, отец школьницы, поставил задачу: сделать робота, с которым ребёнок может разговаривать даже без интернета, и который при этом не выглядит «очередной колонкой с часами». Денежных вложений и инвесторов в источнике нет, поэтому таблицу «Сделка в цифрах» честно опускаю: это история про инженерный бюджет из Авито, а не из венчурного фонда.
Как устроен робот и почему он работает без интернета?
Проект построен на одноплатном компьютере Raspberry Pi 5 с 8 ГБ оперативной памяти. Автор купил плату на Авито, пока параллельно писал программу на обычном ПК.
Весь стек работает локально:
- Мозг. LLM (large language model, большая языковая модель, программа, которая читает вопрос и генерирует текстовый ответ) запускается прямо на Pi, без обращения к серверу.
- Уши. Распознавание речи через Vosk, офлайн-движок, который превращает голос в текст.
- Голос. Озвучка ответов через Piper, локальный синтезатор. Базовый голос «Ирина» автор модифицировал: поднял высоту тона на коэффициент 1,38 и замедлил синтез на 1,30, чтобы получить «анимешное» звучание по просьбе дочери.
- Лицо. Анимация на Python и Tkinter (стандартная библиотека для графических интерфейсов) с состояниями «слушаю», «думаю» и спокойная мимика. Рот двигается синхронно со звуком ответа.
- Шея. Сервоприводы MG90S и MG996R, управляемые через контроллер PCA9685, поворачивают голову в сторону лица ребёнка. Лицо находит камера на чипе IMX708 с автофокусом.
Экран сенсорный: Waveshare 3.5-inch DSI LCD, 480 на 800 пикселей. Звуковой тракт цифровой: микрофон ICS-43434 подключён к Pi через шину I²S (цифровой звуковой интерфейс), воспроизведение идёт через USB-звуковую карту и усилитель.
Автор отдельно отметил, что два подшипника 6901 понадобились для опоры шеи, чтобы убрать люфт и при повороте, и при касании экрана пальцем.
Двадцать моделей на одной плате: кто победил?
Самая ценная часть проекта для тех, кто занимается устройством и программированием автономных роботов на Python и Raspberry Pi, это массовое тестирование моделей. Автор скачал около двадцати кандидатов в формате GGUF (формат сжатых моделей, который позволяет запускать их на слабом железе). Часть отсеял сразу: одни не держали заданный характер, другие путались в длинных репликах.
Набор проверок включал арифметику, объяснения, связную речь и следование инструкции. В финал вышли четыре модели:
- Qwen3-4B-Instruct-2507 стала основной: лучший баланс качества и времени ожидания. Скорость генерации на Pi 5 составила примерно 4,3 токена в секунду (токен, минимальный кусочек текста, обычно часть слова).
- Gemma 4 E2B отвечала быстрее, около 7,1 токена в секунду, и подошла для коротких разговоров.
- Gemma 4 E4B показала себя сильнее в объяснениях, но работала медленнее.
- Qwen3.5 9B DeepSeek Distill осталась запасным вариантом: ответы интересные, но время генерации слишком длинное для ребёнка.
Автор подчёркивает: это замеры его набора задач и настроек, не универсальный рейтинг. Для ребёнка разница выражается просто: задала вопрос и ждёт. Быстрый ответ иногда полезнее подробного.
Как рождался персонаж?
Отдельная деталь, которая делает проект живым: автор начал с типового роботического лица, но дочь попросила «аниме-кошечку». Он расспросил про глаза, причёску, одежду, выражение лица и получил два конкретных эскиза: один с тёмными волосами и розовым кимоно, другой в светлых тонах. Второй победил по цветовой гамме.
Этот момент важен не только как семейная история. Он демонстрирует принцип, который работает и в контенте: пользователь (даже если это школьница) точно знает, чего хочет, и задача автора, выяснить это до начала сборки, а не после.
Она посмотрела и спросила: «А можно, чтобы это была аниме-кошечка?» : Дочь автора проекта
Почему это важно для рынка локальных ИИ-устройств?
Проект не коммерческий, но он фиксирует состояние рынка. Год назад запуск четырёхмиллиардной модели на одноплатнике с приемлемой скоростью был экспериментом для энтузиастов. Сейчас автор выбирает из двадцати кандидатов и получает 4-7 токенов в секунду на плате, купленной на Авито.
Для производителей железа это сигнал спроса на компактные устройства с локальным ИИ. Для разработчиков моделей, подтверждение, что формат GGUF и квантизация (сжатие модели с потерей части точности ради скорости) превращают edge-устройства (устройства, которые считают на месте, без сервера) в рабочий инструмент.
Что это значит для вас?
Этот проект ценен не тем, что он уникален, а тем, что он воспроизводим. Автор не инженер из лаборатории, а отец, который хотел помочь ребёнку с уроками. Устройство и программирование автономных роботов, проекты на Python и Raspberry Pi, всё это перестало быть темой для хакатонов и стало домашним занятием.
Я вижу здесь практический урок: не гнаться за самой умной моделью, а выбирать по скорости отклика. 4,3 токена в секунду звучит скромно, но ребёнок получает ответ, а не зависший экран. Для авторов контента на Дзене это готовый формат: подробный разбор сборки с замерами вызывает доверие и собирает аудиторию, которая ищет конкретику, а не обзоры «топ-10 нейросетей».
Оговорка: автор не привёл итоговый бюджет, и часть компонентов (камера, контроллер сервоприводов) обошлась ему в неизвестную сумму. Повторить проект можно, но считайте расходы заранее.
Автору Дзена. Формат «собрал, замерил, показал ребёнку» работает как контент: в нём есть личная история, цифры и инструкция. Если вы пишете про технологии, возьмите структуру: задача, выбор из нескольких решений, замер, результат.
Маркетологу. Локальные ИИ-устройства без подписки, это растущая ниша. Если ваш продукт можно адаптировать под офлайн-сценарии (детское образование, ассистенты для пожилых), аудитория уже готова.
Предпринимателю в РФ. Raspberry Pi 5 доступен на вторичном рынке, модели Qwen и Gemma скачиваются бесплатно, Vosk и Piper работают без лицензий. Из российских аналогов для голосового синтеза можно попробовать Silero, модели которого тоже запускаются локально.
Тем, кто хочет повторить: начните не с заказа железа, а с теста моделей на обычном ПК, как сделал автор. Это сэкономит и деньги, и время, пока посылка с Авито будет в пути.

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».
Читайте также

SEO-агент на n8n: автоматизация процессов с AI обходится дешевле, если фильтровать данные до нейросети
Почему это важно Автор показала рабочий способ экономить на вызовах языковой модели: сначала фильтровать данные правилами и кодом, а дорогую нейросеть…
Amazon продаёт брендам суть ответа Alexa нейросети, а не баннер рядом с ним
Amazon второго октября анонсировала формат Branded Conversations для Alexa for Shopping, позволяющий брендам оплачивать не баннер рядом с ответом…

Трамп создал Super Intelligence Force: 120 дней на стратегию по искусственному интеллекту
Почему это важно Белый дом официально переименовал искусственный интеллект в «суперинтеллект» и создал межведомственную группу с конкретным дедлайном: 120 дней…
Комментарии