Нейросеть, вероятность и статистика расходов: как тратить миллиард токенов в день за $20
Текст содержит практический опыт русскоязычного разработчика по оптимизации расходов на подписки нейросетей. Автор описывает конкретные модели, цены, лайфхаки с Google Disk и стратегию распределения задач между младшими и старшими моделями. Построю гайд строго по этим фактам.
Автор из оригинала тратит больше миллиарда токенов (минимальных единиц текста, которые обрабатывает нейросеть) в день, запуская по 7-9 потоков ИИ-агентов (программ, которые сами выполняют задачи) на протяжении 12 часов, и при этом не разоряется на подписках.
Подписка на одну нейросеть стоит от 18 до 40 долларов в месяц, а для серьёзной работы нужны несколько моделей одновременно. Гайд показывает, как комбинировать дешёвые младшие модели с дорогими флагманами и передавать контекст между ними через Google Disk, сокращая расход лимитов в разы.
Источник этого опыта, статья практика с Habr, которая обновляет предыдущий разбор от 1 мая 2026 года. За три месяца сменилось поколение моделей: задачи, для которых раньше требовались флагманы вроде Kimi 2.7 или GPT 5.4, теперь решают младшие модели, GPT 5.6 Luna, Deep Seek V4 Flash и Minimax M3. Это напрямую влияет на экономику: рутину можно отдать дешёвой модели, а дорогую подписку тратить только на сложные вопросы.
Что понадобится
- Базовая подписка GPT за 20 долларов (или GPT Pro, если бюджет позволяет и нужны 7-9 потоков в сутки)
- Аккаунт Google Disk для передачи контекста между веб-чатом и локальным ИИ-агентом
- Одна-две дополнительные подписки на младшие модели: Minimax, Qwen (от 18 долларов) или Ollama Cloud (20 долларов, дают 60 долларов на токены)
- Локальный агент, который умеет работать с Google Disk по API (потребуется настроить приложение для доступа, но автор отмечает, что это решаемо)
- Время на первичную настройку: организация папок, проектов и чатов в веб-интерфейсе GPT, около часа на старте
Пошаговая инструкция: как тратить миллиард токенов и не разориться
-
Оформите подписку GPT за 20 долларов. Она даёт доступ к трём моделям разной мощности: GPT 5.6 Luna (младшая, дешёвая по токенам), GPT 5.6 Sol (средняя) и GPT Astra (старшая, для самых сложных задач). По данным автора, Luna по интеллекту уже превосходит модели, которые три месяца назад считались передовыми.
-
Обсуждайте сложные задачи в веб-чате с GPT Astra или Sol. Веб-чат при подписке за 20 долларов не ограничен жёстко по числу сообщений. Именно здесь разбирайте тонкие моменты, архитектурные решения, стратегию.
-
Выгружайте результат анализа в документ на Google Disk. В веб-чате GPT есть встроенный коннектор (связка) к Google Disk. Попросите модель записать итог обсуждения в файл:
Запиши анализ задачи в документ на Google Disk,
папка "Проект X", файл "Анализ от [дата]".
Включи: постановку задачи, ключевые решения, план действий.
-
Передайте ссылку на документ локальному агенту на GPT 5.6 Luna. Luna подхватит контекст из файла и выполнит рутинную часть: написание кода, вёрстку, DevOps-задачи. По данным автора, Luna справляется с этим быстро и точно.
-
Используйте обратную передачу. Если Luna столкнулась с трудностью, попросите её записать вопрос и контекст задачи в Google-документ, а затем отдайте ссылку обратно в веб-интерфейс Astra или Sol.
Запиши в Google Disk текущее состояние задачи:
что сделано, где застрял, какой вопрос нужно решить.
Папка "Проект X", файл "Вопрос к Sol".
-
Добавьте Minimax M3 для длинной рутины. По данным автора, у Minimax лимиты значительно больше, чем у остальных подписок, единственное ограничение составляет пятичасовое окно. Отдавайте Minimax всё, что не связано напрямую с кодом: DevOps-задачи, документацию, обработку данных. Так вы экономите лимиты приоритетных подписок.
-
Балансируйте нагрузку между подписками. Автор описывает простой принцип: смотрите, у какой подписки сейчас меньше расход, той модели и достаётся очередная задача. По ощущениям автора, Qwen 3.8 Flash работает на уровне GPT 5.6 Luna, и задачи между ними можно распределять, не задумываясь о разнице качества.
-
Организуйте проекты в веб-интерфейсе GPT. Автор держит около 20 папок с несколькими чатами в каждой, всё отсортировано по цветам, иконкам и названиям. Без такой организации при 7-9 потоках в день вы быстро потеряетесь.
Какие подписки выбрать и чего они стоят?
По данным автора, вот актуальная раскладка на лето 2026 года:
- GPT за 20 долларов: лучшее соотношение цены и возможностей. Даёт 2-3 потока Luna в сутки. GPT Pro (дороже, точная цена не названа) даёт 7-9 потоков Luna и 50 запросов к Astra Pro в неделю
- Minimax: рабочая лошадка для рутины, большие лимиты, высокая скорость генерации
- Ollama Cloud за 20 долларов: дают 60 долларов на токены, Deep Seek V4 Flash на этой платформе работает быстро и расходует лимиты медленно. Минус: на Ollama Cloud модель не понимает картинки, нельзя отправить скриншот
- Qwen за 18 долларов: Flash-версия отлично справляется с рутиной, Max-версия быстро расходует лимиты, но нужна для сложных задач
- Kimi от 40 долларов: автор ставит на четвёртое место по приоритету покупки. Подписка за 20 долларов имеет слишком скромные лимиты. Kimi 3 быстро расходует подписку, Kimi 2.7 уже отстаёт от конкурентов
- Grok за 30 долларов: нет младших моделей, Grok 4.6 быстро съедает лимиты. Автор не рекомендует для локального агента
Что делать с этим прямо сейчас, по ролям?
Разработчику и автоматизатору. Схема «флагман в веб-чате плюс младшая модель через Google Disk» работает прямо сейчас. Начните с одной подписки GPT за 20 долларов и попробуйте передавать контекст через документы. Если загрузка растёт, добавьте Minimax для рутины.
Автору Дзена и копирайтеру. Нейросеть, вероятность и статистика использования которой растёт каждый месяц, стала рабочим инструментом. Тот же приём с Google Disk подходит для контент-задач: обсудите структуру статьи с Astra, выгрузите план в документ, отдайте Luna на черновик.
Предпринимателю в РФ. Часть перечисленных сервисов может потребовать VPN или иностранную карту для оплаты. Из доступных в России альтернатив для рутинных задач можно рассмотреть YandexGPT и GigaChat, но автор оригинала их не тестировала, поэтому прямого сравнения качества нет.
Автор оригинала запускает 7-9 потоков ИИ-агентов одновременно на протяжении 12 часов. Сложные архитектурные вопросы обсуждаются с GPT Astra в веб-чате, результат выгружается в Google Disk. Оттуда ссылку подхватывает локальный агент на GPT 5.6 Luna, который выполняет основную кодовую работу. Параллельно Minimax M3 берёт на себя DevOps-рутину. Когда лимит одной подписки подходит к концу, задачи перебрасываются на Qwen 3.8 Flash. Итог: больше миллиарда токенов в день при расходах в пределах нескольких подписок по 18-20 долларов.
Покупать сразу дорогую подписку без тестирования. Автор прямо предупреждает: прежде чем платить 40 долларов за Kimi, погоняйте модель на своём классе задач. Kimi отлично понимает дизайн и бренд, но на задачах по вёрстке долго «молотила токенами, пытаясь подвинуть пару кнопок», тогда как Luna справилась быстро.
Не организовывать проекты по папкам. При нескольких потоках в день без сортировки по цветам, иконкам и названиям вы потеряете контекст и начнёте путать задачи между чатами.
Забывать про обратную передачу. Google Disk работает в обе стороны. Если младшая модель застряла, не бросайте задачу и не переделывайте вручную: пусть Luna запишет контекст в документ, а вы передадите его старшей модели.
Выбирать Ollama Cloud для задач с картинками. На этой платформе Deep Seek V4 Flash не понимает изображения. Если вам часто нужно отправлять скриншоты, это критичное ограничение.
Описанная схема выглядит рабочей, и нейросеть, вероятность ошибки которой снижается с каждым поколением моделей, действительно позволяет делегировать рутину дешёвым версиям. Но я бы добавил честную оговорку: автор оригинала профессиональный разработчик с настроенной инфраструктурой. Для человека без технического бэкграунда настройка локального агента с доступом к Google Disk по API может занять не час, а день. Начните проще: используйте веб-чат GPT с ручной передачей текста между моделями, без автоматизации. Когда поймёте, какие задачи отдаёте младшей модели, а какие оставляете старшей, тогда автоматизируйте. И помните: цены, лимиты и сами модели меняются каждые несколько месяцев. То, что работает в июле 2026 года, может устареть к осени.
Попробуйте генератор промптов dzen.guru
Составьте промпт для передачи контекста между моделями за пару кликов, без ручного форматирования
Попробовать бесплатно
Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».
Читайте также
Профи.ру встроил LLM поверх Elasticsearch: 150 000 запросов в час без замены движка
Дмитрий, лид отдела семантики в Профи.ру, рассказал, как команда встроила языковую модель в поиск услуг поверх Elasticsearch, не выбрасывая классический…

Cursor отменяет подписки в России: как оплатить Cursor AI в России уже неважно, есть Codex за те же $20
Cursor начал отменять платные подписки пользователей из России: 5 сентября появились сообщения о письмах, в которых сервис ссылается на работу из запрещённого…

ИИ удешевляет формальную верификацию кода: 20 человеко-лет работы сжимаются до дней
Формальная верификация (математическое доказательство того, что код работает именно так, как задумано) десятилетиями оставалась уделом исследователей, но…
Комментарии