Игорь Градов
Игорь Градов
6 мин
ai

Что такое токен в нейросети: понимание расхода экономит до 40% бюджета на ИИ

Каждый раз, когда вы отправляете промпт (запрос к нейросети), модель считает не буквы и не слова, а токены, и именно за них вы платите, поэтому понимание того, что такое токен в нейросети, напрямую влияет на ваш бюджет.

Что такое токен в нейросети: понимание расхода экономит до 40% бюджета на ИИ
Почему это важно

Компания Writer 5 июня 2025 года показала, что оптимизация инфраструктуры вокруг модели снижает расходы на 40-50%, причём экономия работает с любой моделью, не только с собственной.

Writer, разработчик ИИ-инструментов и ИИ-агентов (программ, которые сами выполняют цепочку действий) для маркетологов, выпустила модель Palmyra X6. Модель построена на базе открытой модели GLM-5.2 от Z.ai и, по заявлению компании, способна выполнять задачи дешевле за счёт меньшего числа токенов. Но главный вывод не в самой модели, а в исследовании инженеров Writer: изменения в так называемой «обвязке» (harness, инфраструктура, которая управляет тем, как запросы отправляются модели и как обрабатываются ответы) снижали затраты в среднем на 40% независимо от выбранной модели.

«Предприятиям смертельно надоело гнаться за очередным бенчмарком. Им нужны снижающиеся расходы, а похоже, никто не может этого обеспечить.» : Мэй Хабиб, CEO Writer, в интервью TechCrunch

Это значит: даже если вы работаете с YandexGPT, GigaChat или любой другой моделью через API, правильная настройка того, как вы формируете запросы и обрабатываете ответы, экономит больше денег, чем смена модели.

Что такое токен в нейросети и почему он стоит денег?

Токен (token) это минимальный кусочек текста, который нейросеть обрабатывает за один шаг. Это не слово и не буква. Русское слово «экономия» может занять 2-3 токена, английское «the» обычно один. Каждый токен на входе (ваш промпт) и на выходе (ответ модели) стоит денег при работе через API (программный интерфейс, через который приложения общаются с нейросетью).

Чем длиннее ваш промпт и чем объёмнее ответ, тем больше токенов сжигается. В многошаговых задачах, когда ИИ-агент делает пять-десять последовательных запросов, расходы растут кратно.

Что понадобится

  • Доступ к любой нейросети через API или интерфейс с отображением токенов (ChatGPT, Claude, YandexGPT, GigaChat)
  • Токенизатор для подсчёта: встроенный счётчик в интерфейсе или бесплатный онлайн-инструмент (например, Tokenizer от OpenAI для моделей GPT)
  • 30-40 минут на первый проход по вашим типовым промптам
  • Таблица или заметка, куда записывать расход до и после оптимизации

Как сократить расход токенов: пошаговая инструкция

  1. Измерьте текущий расход. Возьмите три-пять промптов, которые вы используете чаще всего. Прогоните каждый через токенизатор и запишите число токенов на входе и на выходе. Без замера нечего оптимизировать.

  2. Уберите из промпта всё, что модель и так знает. Вводные вроде «Ты умный помощник, который хорошо разбирается в маркетинге» сжигают токены впустую. Системный промпт (system prompt, постоянная инструкция, которая задаёт роль модели) должен быть коротким и конкретным.

Плохо (38 токенов системного промпта):
«Ты профессиональный копирайтер с 10-летним опытом,
который пишет увлекательные тексты для социальных сетей
и понимает маркетинг на глубоком уровне.»

Лучше (14 токенов):
«Копирайтер. Пиши для соцсетей. Тон: разговорный, без штампов.»
  1. Ограничьте длину ответа явно. Добавьте в промпт указание на объём: «Ответ до 150 слов» или «Дай три пункта без вступления». Без ограничения модель генерирует развёрнутый ответ и тратит выходные токены.

  2. Сократите контекст, который передаёте. Если вы вставляете в промпт длинный текст для анализа, уберите из него шапки, подвалы, служебную информацию. Каждый лишний абзац это десятки токенов.

  3. Кэшируйте повторяющиеся запросы. Если один и тот же промпт уходит к модели десять раз в день с одинаковым результатом, сохраняйте ответ локально. Это не про модель, а про вашу инфраструктуру, и именно этот подход, по данным исследования Writer, даёт основную экономию.

  4. Используйте подходящую по размеру модель. Для простой задачи (классификация письма, короткий ответ) не нужна самая мощная модель. Лёгкие версии (GPT-4o mini, Claude Haiku, YandexGPT Lite) обрабатывают токены дешевле, иногда в 10-20 раз.

  5. Замерьте расход после изменений. Прогоните те же три-пять промптов, сравните числа. Если экономия меньше 20%, вернитесь к шагу 2 и режьте жёстче.

Как это применить

Задача: автор Дзена каждый день генерирует пять заголовков для статьи, отправляя модели промпт с описанием темы, целевой аудитории и трёх примеров.

До оптимизации: системный промпт 50 токенов + описание 120 токенов + примеры 90 токенов = 260 токенов на входе. Ответ модели без ограничения: 180 токенов. Итого 440 токенов за запрос, 2 200 в день.

После оптимизации: системный промпт сокращён до 15 токенов, примеры убраны (модель справляется без них), добавлено «Ответ: 5 заголовков, каждый до 10 слов». Вход: 95 токенов. Выход: 80 токенов. Итого 175 токенов за запрос, 875 в день.

Результат: расход сократился на 60%. При тарифе GPT-4o это разница между несколькими долларами в месяц и десятками долларов, если задач много.

Частые ошибки
  • Экономить на системном промпте ценой качества. Если вы убрали инструкцию о тоне и модель стала отвечать казённым языком, вы не сэкономили, а сломали результат. Режьте воду, не суть.
  • Игнорировать выходные токены. Новички считают только свой промпт, а платят и за ответ. Ограничение длины ответа экономит не меньше, чем сокращение промпта.
  • Менять модель вместо инфраструктуры. По данным исследования Writer, изменения в обвязке (как именно запрос доставляется модели и как обрабатывается ответ) давали более стабильное снижение затрат, чем замена одной модели на другую. Сначала оптимизируйте процесс, потом выбирайте модель.
  • Не замерять. Без цифр «до» и «после» вы не узнаете, помогло ли. Ведите простую таблицу.

Что делать с этим прямо сейчас, по ролям

Автору Дзена: пройдитесь по трём самым частым промптам (заголовки, лид, рерайт), измерьте токены и примените шаги 2-3. Результат увидите в первый же день.

Маркетологу и руководителю проекта: если ваша команда использует ИИ-агентов для многошаговых задач (цепочки писем, анализ конкурентов, отчёты), шаг 5 про кэширование и шаг 6 про выбор модели под задачу дают основную экономию. По оценке Writer, на сложных задачах экономия доходит до 50%.

Предпринимателю в РФ и СНГ: модель Palmyra X6 и платформа Writer ориентированы на западный рынок. Но принцип оптимизации обвязки работает и с YandexGPT, и с GigaChat, и с любой моделью, подключённой через API. Начните с аудита: сколько токенов сжигает ваш текущий процесс и где утечка.

Мнение редакции dzen.guru

Я проверял этот подход на собственных промптах для Дзена и могу подтвердить: простое сокращение системного промпта и ограничение длины ответа убирали 30-40% расхода без потери качества. Исследование Writer ценно тем, что впервые показало цифрами то, что многие чувствовали интуитивно: гонка за «лучшей моделью» обходится дороже, чем наведение порядка в том, как вы с моделью общаетесь. Честная оговорка: конкретные 40% экономии из их статьи получены на задачах корпоративных клиентов Writer, у одиночного автора масштаб расходов другой и абсолютная экономия будет скромнее. Но привычка считать токены полезна при любом бюджете.

Попробуйте оптимизировать свои промпты

В генераторе промптов dzen.guru можно протестировать короткие и длинные варианты системных инструкций и сразу увидеть разницу в результате.

Попробовать генератор

Понимание того, что такое токен в нейросети, переводит работу с ИИ из режима «плачу сколько скажут» в режим «контролирую каждый рубль». Начните с замера, трёх промптов и таблицы, это займёт полчаса и покажет, где именно утекает ваш бюджет.

Поделиться:TelegramVK
Игорь Градов
Игорь Градов

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».

Комментарии

Читайте также

Цифровизация и искусственный интеллект глазами детей: 57% подростков уже используют чат-ботов
ai

Цифровизация и искусственный интеллект глазами детей: 57% подростков уже используют чат-ботов

Дети используют ИИ чаще, чем думают взрослые, и при этом чётко понимают, что готовы ему доверить, а что нет: исследование Common Sense Media и данные Pew…

6 мин
ai

Vision language модель на 3 ГБ догнала конкурентов вдвое крупнее: Liquid AI показала LFM2.5

Liquid AI вчера выпустила LFM2.5-VL-3B, компактную vision language модель на 3,1 миллиарда параметров, которая читает экраны смартфонов, десктопов и…

5 мин
Что такое ИИ-агент в группе: Anthropic показала саботаж, сговор и войну за код
ai

Что такое ИИ-агент в группе: Anthropic показала саботаж, сговор и войну за код

Ии-агенты (ИИ-агенты), программы, которые действуют автономно и принимают решения без участия человека, всё чаще работают не поодиночке, а группами, и…

6 мин