Игорь Градов
Игорь Градов
7 мин
ai

Нейросеть, вероятность и статистика расходов: как тратить миллиард токенов в день за $20

Текст содержит практический опыт русскоязычного разработчика по оптимизации расходов на подписки нейросетей. Автор описывает конкретные модели, цены, лайфхаки с Google Disk и стратегию распределения задач между младшими и старшими моделями. Построю гайд строго по этим фактам.

Автор из оригинала тратит больше миллиарда токенов (минимальных единиц текста, которые обрабатывает нейросеть) в день, запуская по 7-9 потоков ИИ-агентов (программ, которые сами выполняют задачи) на протяжении 12 часов, и при этом не разоряется на подписках.

Почему это важно

Подписка на одну нейросеть стоит от 18 до 40 долларов в месяц, а для серьёзной работы нужны несколько моделей одновременно. Гайд показывает, как комбинировать дешёвые младшие модели с дорогими флагманами и передавать контекст между ними через Google Disk, сокращая расход лимитов в разы.

Источник этого опыта, статья практика с Habr, которая обновляет предыдущий разбор от 1 мая 2026 года. За три месяца сменилось поколение моделей: задачи, для которых раньше требовались флагманы вроде Kimi 2.7 или GPT 5.4, теперь решают младшие модели, GPT 5.6 Luna, Deep Seek V4 Flash и Minimax M3. Это напрямую влияет на экономику: рутину можно отдать дешёвой модели, а дорогую подписку тратить только на сложные вопросы.

Что понадобится

  • Базовая подписка GPT за 20 долларов (или GPT Pro, если бюджет позволяет и нужны 7-9 потоков в сутки)
  • Аккаунт Google Disk для передачи контекста между веб-чатом и локальным ИИ-агентом
  • Одна-две дополнительные подписки на младшие модели: Minimax, Qwen (от 18 долларов) или Ollama Cloud (20 долларов, дают 60 долларов на токены)
  • Локальный агент, который умеет работать с Google Disk по API (потребуется настроить приложение для доступа, но автор отмечает, что это решаемо)
  • Время на первичную настройку: организация папок, проектов и чатов в веб-интерфейсе GPT, около часа на старте

Пошаговая инструкция: как тратить миллиард токенов и не разориться

  1. Оформите подписку GPT за 20 долларов. Она даёт доступ к трём моделям разной мощности: GPT 5.6 Luna (младшая, дешёвая по токенам), GPT 5.6 Sol (средняя) и GPT Astra (старшая, для самых сложных задач). По данным автора, Luna по интеллекту уже превосходит модели, которые три месяца назад считались передовыми.

  2. Обсуждайте сложные задачи в веб-чате с GPT Astra или Sol. Веб-чат при подписке за 20 долларов не ограничен жёстко по числу сообщений. Именно здесь разбирайте тонкие моменты, архитектурные решения, стратегию.

  3. Выгружайте результат анализа в документ на Google Disk. В веб-чате GPT есть встроенный коннектор (связка) к Google Disk. Попросите модель записать итог обсуждения в файл:

Запиши анализ задачи в документ на Google Disk,
папка "Проект X", файл "Анализ от [дата]".
Включи: постановку задачи, ключевые решения, план действий.
  1. Передайте ссылку на документ локальному агенту на GPT 5.6 Luna. Luna подхватит контекст из файла и выполнит рутинную часть: написание кода, вёрстку, DevOps-задачи. По данным автора, Luna справляется с этим быстро и точно.

  2. Используйте обратную передачу. Если Luna столкнулась с трудностью, попросите её записать вопрос и контекст задачи в Google-документ, а затем отдайте ссылку обратно в веб-интерфейс Astra или Sol.

Запиши в Google Disk текущее состояние задачи:
что сделано, где застрял, какой вопрос нужно решить.
Папка "Проект X", файл "Вопрос к Sol".
  1. Добавьте Minimax M3 для длинной рутины. По данным автора, у Minimax лимиты значительно больше, чем у остальных подписок, единственное ограничение составляет пятичасовое окно. Отдавайте Minimax всё, что не связано напрямую с кодом: DevOps-задачи, документацию, обработку данных. Так вы экономите лимиты приоритетных подписок.

  2. Балансируйте нагрузку между подписками. Автор описывает простой принцип: смотрите, у какой подписки сейчас меньше расход, той модели и достаётся очередная задача. По ощущениям автора, Qwen 3.8 Flash работает на уровне GPT 5.6 Luna, и задачи между ними можно распределять, не задумываясь о разнице качества.

  3. Организуйте проекты в веб-интерфейсе GPT. Автор держит около 20 папок с несколькими чатами в каждой, всё отсортировано по цветам, иконкам и названиям. Без такой организации при 7-9 потоках в день вы быстро потеряетесь.

Какие подписки выбрать и чего они стоят?

По данным автора, вот актуальная раскладка на лето 2026 года:

  • GPT за 20 долларов: лучшее соотношение цены и возможностей. Даёт 2-3 потока Luna в сутки. GPT Pro (дороже, точная цена не названа) даёт 7-9 потоков Luna и 50 запросов к Astra Pro в неделю
  • Minimax: рабочая лошадка для рутины, большие лимиты, высокая скорость генерации
  • Ollama Cloud за 20 долларов: дают 60 долларов на токены, Deep Seek V4 Flash на этой платформе работает быстро и расходует лимиты медленно. Минус: на Ollama Cloud модель не понимает картинки, нельзя отправить скриншот
  • Qwen за 18 долларов: Flash-версия отлично справляется с рутиной, Max-версия быстро расходует лимиты, но нужна для сложных задач
  • Kimi от 40 долларов: автор ставит на четвёртое место по приоритету покупки. Подписка за 20 долларов имеет слишком скромные лимиты. Kimi 3 быстро расходует подписку, Kimi 2.7 уже отстаёт от конкурентов
  • Grok за 30 долларов: нет младших моделей, Grok 4.6 быстро съедает лимиты. Автор не рекомендует для локального агента

Что делать с этим прямо сейчас, по ролям?

Разработчику и автоматизатору. Схема «флагман в веб-чате плюс младшая модель через Google Disk» работает прямо сейчас. Начните с одной подписки GPT за 20 долларов и попробуйте передавать контекст через документы. Если загрузка растёт, добавьте Minimax для рутины.

Автору Дзена и копирайтеру. Нейросеть, вероятность и статистика использования которой растёт каждый месяц, стала рабочим инструментом. Тот же приём с Google Disk подходит для контент-задач: обсудите структуру статьи с Astra, выгрузите план в документ, отдайте Luna на черновик.

Предпринимателю в РФ. Часть перечисленных сервисов может потребовать VPN или иностранную карту для оплаты. Из доступных в России альтернатив для рутинных задач можно рассмотреть YandexGPT и GigaChat, но автор оригинала их не тестировала, поэтому прямого сравнения качества нет.

Как это выглядит на практике

Автор оригинала запускает 7-9 потоков ИИ-агентов одновременно на протяжении 12 часов. Сложные архитектурные вопросы обсуждаются с GPT Astra в веб-чате, результат выгружается в Google Disk. Оттуда ссылку подхватывает локальный агент на GPT 5.6 Luna, который выполняет основную кодовую работу. Параллельно Minimax M3 берёт на себя DevOps-рутину. Когда лимит одной подписки подходит к концу, задачи перебрасываются на Qwen 3.8 Flash. Итог: больше миллиарда токенов в день при расходах в пределах нескольких подписок по 18-20 долларов.

Частые ошибки

Покупать сразу дорогую подписку без тестирования. Автор прямо предупреждает: прежде чем платить 40 долларов за Kimi, погоняйте модель на своём классе задач. Kimi отлично понимает дизайн и бренд, но на задачах по вёрстке долго «молотила токенами, пытаясь подвинуть пару кнопок», тогда как Luna справилась быстро.

Не организовывать проекты по папкам. При нескольких потоках в день без сортировки по цветам, иконкам и названиям вы потеряете контекст и начнёте путать задачи между чатами.

Забывать про обратную передачу. Google Disk работает в обе стороны. Если младшая модель застряла, не бросайте задачу и не переделывайте вручную: пусть Luna запишет контекст в документ, а вы передадите его старшей модели.

Выбирать Ollama Cloud для задач с картинками. На этой платформе Deep Seek V4 Flash не понимает изображения. Если вам часто нужно отправлять скриншоты, это критичное ограничение.

Мнение редакции dzen.guru

Описанная схема выглядит рабочей, и нейросеть, вероятность ошибки которой снижается с каждым поколением моделей, действительно позволяет делегировать рутину дешёвым версиям. Но я бы добавил честную оговорку: автор оригинала профессиональный разработчик с настроенной инфраструктурой. Для человека без технического бэкграунда настройка локального агента с доступом к Google Disk по API может занять не час, а день. Начните проще: используйте веб-чат GPT с ручной передачей текста между моделями, без автоматизации. Когда поймёте, какие задачи отдаёте младшей модели, а какие оставляете старшей, тогда автоматизируйте. И помните: цены, лимиты и сами модели меняются каждые несколько месяцев. То, что работает в июле 2026 года, может устареть к осени.

Попробуйте генератор промптов dzen.guru

Составьте промпт для передачи контекста между моделями за пару кликов, без ручного форматирования

Попробовать бесплатно
Поделиться:TelegramVK
Игорь Градов
Игорь Градов

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».

Комментарии

Читайте также

ai

Профи.ру встроил LLM поверх Elasticsearch: 150 000 запросов в час без замены движка

Дмитрий, лид отдела семантики в Профи.ру, рассказал, как команда встроила языковую модель в поиск услуг поверх Elasticsearch, не выбрасывая классический…

6 мин
Cursor отменяет подписки в России: как оплатить Cursor AI в России уже неважно, есть Codex за те же $20
ai

Cursor отменяет подписки в России: как оплатить Cursor AI в России уже неважно, есть Codex за те же $20

Cursor начал отменять платные подписки пользователей из России: 5 сентября появились сообщения о письмах, в которых сервис ссылается на работу из запрещённого…

5 мин
ИИ удешевляет формальную верификацию кода: 20 человеко-лет работы сжимаются до дней
ai

ИИ удешевляет формальную верификацию кода: 20 человеко-лет работы сжимаются до дней

Формальная верификация (математическое доказательство того, что код работает именно так, как задумано) десятилетиями оставалась уделом исследователей, но…

5 мин