«Эвотор» встроила нейросети в платежный терминал: заказ голосом даже в шумной кофейне
Компания «Эвотор» встроила нейросеть прямо в платёжный терминал EvoPoint, чтобы он распознавал голосовые заказы в шумной кофейне, и проверила систему на фестивале Gastreet 2026.

Терминал берёт на себя приём заказа голосом, и кассир освобождается для подготовки напитка ещё до пробития чека, а это сокращает очередь в часы пик.
«Эвотор», российский производитель кассового оборудования, описал архитектуру голосового интерфейса EvoPoint на Хабре. Задача, которую решала команда, не из простых: распознать речь покупателя не в тихой лаборатории, а в реальном кафе, где одновременно работают кофемашина, вытяжка, играет музыка и разговаривают люди. До сих пор голосовые функции в торговом оборудовании упирались именно в фоновый шум.
Что понадобится
- Платёжный терминал (пинпад) EvoPoint от «Эвотора» с поддержкой голосового сценария
- POS-касса, совместимая с EvoPoint, связь между ними идёт по UART (последовательный проводной канал передачи данных между устройствами)
- Меню заведения, загруженное в кассовую систему (терминал сопоставляет распознанную речь с позициями из этого списка)
- Стабильное подключение для передачи логов (терминал отправляет их пакетно через WorkManager)
- Время на настройку и тестирование: первый запуск можно провести за рабочую смену, но калибровка под конкретное меню и уровень шума займёт несколько дней
Как устроен голосовой сценарий шаг за шагом?
-
Клиент подходит к терминалу и произносит заказ. Например: «Большой латте с корицей без сахара». Терминал активно слушает первую фразу.
-
Локальная STT-модель (Speech-to-Text, преобразование речи в текст) на самом пинпаде переводит звуковую волну в текстовую гипотезу. Нейросети в платежах здесь решают ключевую задачу: модель работает прямо на устройстве, а не на удалённом сервере, что критично для скорости отклика.
-
Сервис Voice Recognition разбирает текст на сущности и интенты (намерения). Система выделяет три компонента:
- действие: добавить, заменить, удалить, вернуть
- объект: «латте», «круассан шоколадный»
-
модификатор: «большой», «с корицей», «без сахара»
-
Оркестратор передаёт результат между приложениями. Оркестратор (orchestrator) в этой архитектуре не распознаёт речь и не проводит оплату. Это служба-посредник на Android, которая связывает локальные приложения на пинпаде с кассой. Локальные приложения подключаются через AIDL (интерфейс межпроцессного взаимодействия в Android), обмен с кассой идёт по UART.
-
Экран подтверждения (customer screen) показывает клиенту, что система поняла. Если в меню три вида латте, терминал не гадает, а выводит экран уточнения: «Вы имели в виду классический, безлактозный или ванильный?»
-
Если терминал не расслышал, запускается сценарий повторного слушания. Сначала переспрашивает и снова слушает. Если и вторая попытка не дала результата, показывает экран «Я вас не расслышал» и возвращается на стартовый экран.
-
После формирования заказа оркестратор запускает переход к оплате. Клиент выбирает способ: NFC (бесконтактная оплата картой или телефоном), QR через СБП (Систему быстрых платежей) или классический чип. Команда «Эвотора» также работает над интеграцией сервиса «Вжух», оплаты по биометрии ладони.
На фестивале Gastreet 2026 терминал EvoPoint работал в баре Docs in Box. Клиент подходил к пинпаду и говорил, например: «Капучино большой без сахара». Нейросети в платежах обрабатывали запрос прямо на устройстве, на экране появлялся распознанный заказ. Бариста видел заказ на кассе и начинал готовить напиток ещё до того, как клиент приложил карту. Фестивальный шум с музыкой, толпой и кофемашинами стал для системы проверкой на устойчивость к помехам.
- Ожидать от терминала понимания произвольной речи. EvoPoint разбирает заказ по меню, загруженному в кассу. Если позиция не внесена в систему, терминал её не распознает, даже если клиент произнесёт название чётко.
- Игнорировать калибровку под конкретное место. Уровень шума в тихой пекарне и на фудкорте отличается кратно. Без тестирования в реальных условиях заведения система будет чаще переспрашивать или ошибаться.
- Полагать, что голосовой ввод заменяет кассира полностью. Подтверждение и выбор остаются за клиентом и сотрудником. Терминал автоматизирует формирование заказа, но не принимает решения за человека.
- Путать локальную STT-модель с облачными сервисами. Модель работает на пинпаде, а не через интернет. Это быстрее, но возможности модели ограничены мощностью устройства.
Что это даёт вам прямо сейчас, по ролям?
Владельцу кофейни или точки общепита. EvoPoint позволяет сократить время обслуживания: бариста начинает готовить напиток, пока клиент ещё не оплатил. Для небольшого заведения с одним сотрудником это способ обслужить больше людей в час пик без найма второго человека.
Автору Дзена, который пишет про технологии или бизнес. Кейс «Эвотора» показывает, как объяснять сложную архитектуру простыми словами: оркестратор, STT, интент. Это готовая структура для разбора любого технического продукта в контенте.
Маркетологу в ритейле или HoReCa. Голосовой интерфейс на терминале меняет точку контакта с покупателем. Вместо очереди к кассиру клиент сам формирует заказ, а значит, можно перераспределить персонал и перестроить воронку обслуживания.
Предпринимателю из регионов. Оборудование «Эвотора» доступно в России, интеграция с СБП работает, «Вжух» по биометрии ладони находится в разработке. Следить за появлением EvoPoint с голосовым сценарием стоит в каталоге «Эвотора».
Кейс «Эвотора» интересен не столько самим голосовым управлением, сколько тем, что STT-модель работает локально, на самом пинпаде. Для заведений это снимает зависимость от стабильного интернета, а для всей индустрии показывает направление: нейросеть не в облаке, а в устройстве на прилавке. Честная оговорка: система проверена пока на фестивальных стендах. Как она поведёт себя после месяцев ежедневной работы в конкретной кофейне с конкретным меню из 80 позиций, пока не известно. Я бы следил за отзывами первых коммерческих точек, прежде чем перестраивать под это весь процесс.
Хотите писать о технологиях так, чтобы читали до конца?
В dzen.guru мы разбираем, как объяснять сложные темы простым языком и получать трафик на Дзене.
Попробовать dzen.guruТот факт, что российская команда запустила локальную STT-модель на платёжном терминале и проверила её в реальном шуме фестиваля, говорит о практическом уровне, который уже можно тестировать в своём заведении, а не только читать о нём в пресс-релизах.

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».
Читайте также

Языковые модели путаются в 90 инструментах: как роутер на RTX 3090 поднял точность выбора
Языковые модели с набором из девяноста инструментов теряют точность выбора нужного на локальном железе, и эта инструкция показывает, как сузить список…

Нейросеть для генерации контента сломала 312 ссылок за секунду: чек-лист скрытых ошибок
Сайты, собранные нейросетью, выглядят готовыми, но поисковый трафик часто не приходит, и причина не в контенте, а в скрытых технических поломках, которые ИИ…

Улучшения Android 15 для пользователей Samsung
Приложение «Гига Писарь», которое раньше работало только на компьютерах Mac и Windows, в июне 2025 года вышло на Android и позволяет диктовать текст прямо в…
Комментарии