Какие новые функции получил ChatGPT от OpenAI: голос заменяет клавиатуру, но не всё так гладко
ChatGPT научился говорить почти как человек, и это повод не для восторга, а для честного разговора о том, какие новые функции получил ChatGPT от OpenAI и кого они затронут уже сейчас.

OpenAI параллельно развивает два направления: голосовой режим в ChatGPT и совместное с Джонни Айвом устройство, где голос заменяет клавиатуру. Если оба выстрелят, изменится не отдельный продукт, а сам способ взаимодействия человека с компьютером.
Источник этой дискуссии не пресс-релиз корпорации, а практический опыт. Автор оригинального материала протестировал Voice Mode (голосовой режим) ChatGPT в двух сценариях: как репетитор иностранного языка и как переводчик. Репетиторский тест провалился: модель говорила слишком быстро и насыщенно для учебного формата. Зато перевод в реальном времени сработал настолько гладко, что автор прямо написал: переводчикам пора готовить запасные аэродромы. Одновременно стало известно, что Сэм Альтман и Джонни Айв (бывший главный дизайнер Apple) разрабатывают устройство, похожее на умную колонку, но с акцентом именно на голосовое взаимодействие.
Что именно умеет Voice Mode?
Обычная диктовка работает пошагово: говоришь фразу, ждёшь распознавания, исправляешь ошибки, отправляешь. Voice Mode устроен иначе.
- Ассистент слушает непрерывно и реагирует почти мгновенно, без пауз.
- Поддерживает естественный темп разговора, может говорить одновременно с пользователем.
- Через несколько фраз возникает ощущение диалога с живым собеседником, а не с программой.
По сути, это уже не голосовой ввод, а голосовой интерфейс (способ управления компьютером через речь, а не через набор текста). И здесь начинается спор.
Аргументы за: голос как следующий интерфейс
Автор оригинала выстраивает историческую цепочку устройств ввода: перфокарты, клавиатура, мышь, сенсорный экран. Каждый шаг упрощал взаимодействие. Голос, по этой логике, следующее звено.
- Пользователю не нужно учиться. Впервые за всю историю вычислительной техники учиться придётся машине: распознавать голос, удерживать контекст, понимать смысл. Человек уже умеет говорить.
- Голос как первый шаг к мультимодальности. Мультимодальность (способность модели работать сразу с несколькими каналами: текст, голос, изображение) предполагает, что к голосу добавятся камера, жесты, взгляд, понимание обстановки. Компьютер будет воспринимать ситуацию так же, как человек.
- Перевод в реальном времени уже работает. Практический тест показал, что Voice Mode справляется с ролью переводчика, значит, какие новые функции получил ChatGPT от OpenAI, уже измеряется не лабораторными бенчмарками, а бытовой пользой.
- Проект Альтмана и Айва имеет логику. Умная колонка нового типа, это не конкурент Amazon Echo или Яндекс Алисе, а полноценный компьютер без клавиатуры и мыши.
Аргументы против: почему скептики правы в своих сомнениях?
Скепсис не менее обоснован, и важно не строить из него соломенное чучело.
- Рынок умных колонок существует давно, и ни одна не стала основным компьютером. Amazon Echo, Apple HomePod, Яндекс Станция с Алисой: все они управляются голосом, но остаются нишевыми устройствами для таймеров и музыки. Голос не вытеснил экран ни в одном из этих случаев.
- Siri показала пределы подхода ещё в 2011 году. Автор оригинала сам признаёт, что над Siri «принято посмеиваться». Siri первой продемонстрировала голосовое управление миллионам людей, но за 14 лет не стала основным способом взаимодействия с iPhone. Большие языковые модели (LLM, модели, обученные на огромных массивах текста для понимания и генерации языка) ушли далеко вперёд, но гарантий, что результат будет другим, никто не предоставил.
- Репетиторский тест провалился. Если Voice Mode не справляется с простой учебной задачей, где нужен медленный и контролируемый диалог, это сигнал: модель оптимизирована под беглый разговор, а не под точность. Для многих профессиональных задач точность важнее скорости.
- Переводчики не исчезли после Google Translate. Каждое поколение машинного перевода объявлялось убийцей профессии. Профессия трансформировалась, но не исчезла. Устный перевод на переговорах, юридический перевод, литературный перевод по-прежнему требуют человека.
Переводчикам, похоже, пора готовить запасные аэродромы. : Автор оригинального материала
Я протестировал Voice Mode и согласен: ощущение разговора действительно впечатляет. Но «впечатляет» и «заменяет профессионала» это два разных утверждения. По моему опыту, Voice Mode отлично справляется с бытовым переводом: спросить дорогу, заказать еду, обсудить погоду. Сложный контекст, двусмысленности, культурные отсылки он теряет.
Что касается колонки Альтмана и Айва: идея красивая, но пока это именно идея. Конкретных характеристик, цены, даты выхода никто не называл.
Для авторов Дзена вывод практический: попробуйте Voice Mode как инструмент для создания черновиков. Наговорить структуру статьи голосом, а потом отредактировать, это реально быстрее, чем печатать с нуля. Но полагаться на голосовой режим для финального текста я бы не стал.
Для тех, кто работает в России: Яндекс Алиса пока не предлагает аналогичного режима непрерывного диалога с удержанием контекста на уровне Voice Mode. Разрыв заметен. Но и ChatGPT в голосовом режиме доступен в РФ с ограничениями, так что прямого инструмента «из коробки» для российского пользователя пока нет.
Честная оговорка: мы обсуждаем впечатления от раннего продукта и прогнозы одного автора, а не независимое исследование. Выводы о «смерти профессии» стоит делить на десять.
Что делать с этим прямо сейчас, по ролям?
Автору Дзена. Попробуйте Voice Mode для генерации черновиков и структуры. Наговорите план статьи, получите расшифровку, отредактируйте. Это экономит время на этапе «чистого листа».
Переводчику и копирайтеру. Не паникуйте, но начните осваивать ИИ как рабочий инструмент. Конкурентное преимущество теперь не в скорости перевода, а в экспертизе, которую машина пока не даёт: контекст, стиль, ответственность за результат.
Маркетологу. Голосовые интерфейсы меняют точку входа пользователя в поиск. Если через два года значительная часть запросов будет голосовой, SEO-стратегии нужно адаптировать уже сейчас: длинные разговорные запросы вместо коротких ключевых слов.
Предпринимателю в РФ. Голосовые стартапы, по мнению автора оригинала, станут самым перспективным направлением. В России ниша открыта шире, чем на Западе: качественного голосового ИИ-ассистента на русском языке с удержанием контекста пока нет.
Прогноз на ближайший год реалистичен ровно настолько, насколько OpenAI сможет превратить демо в массовый продукт. Voice Mode уже работает, колонка с Айвом пока только слухи. Если устройство выйдет и действительно предложит полноценный компьютер без экрана, клавиатура станет инструментом специалиста, как сегодня командная строка. Если нет, мы получим ещё одну умную колонку на полке рядом с пылящимся HomePod. Ставка OpenAI понятна, результат нет, и именно поэтому стоит пробовать голосовой режим прямо сейчас, пока он бесплатен и пока у вас есть время адаптироваться до того, как рынок решит за вас.

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».
Читайте также

Сбер выпустил RUMBA: первый бенчмарк нейросетей на русском для проверки долгосрочной памяти
Группа российских исследователей из Сбера 4 июня 2025 года представила RUMBA (Russian User Memory Benchmark), первый публичный бенчмарк нейросетей на русском…
Claude 3 5 Opus вышел после проверки властями США: цена не выросла, защита усилена
Anthropic второго июля выпустила Claude Opus 5, свою новую рассуждающую модель, которую впервые перед публичным запуском тестировали совместно с правительством…

Marker 2 обогнал конкурентов по парсингу PDF в 5 раз по скорости при лучшем качестве
Компания Datalab выпустила Marker 2, полностью переписанный открытый конвейер для парсинга PDF и других документов, который на бенчмарке olmOCR-bench обогнал…
Комментарии