Token Saver снижает стоимость токенов API Claude Sonnet на 92‑99% за счёт локального поиска
Microsoft второго июня запустила Token Saver, расширение для Claude Desktop, которое обрабатывает тяжёлые PDF локально и, по замерам разработчиков, сокращает стоимость токенов API Claude Sonnet на 92-99% за счёт гибридного поиска прямо на вашем компьютере.

Каждый повторный вопрос к большому документу в Claude заново отправляет весь текст на сервер и списывает токены (минимальные единицы текста, за которые вы платите при обращении к модели). Token Saver перехватывает этот процесс: файл не покидает ваш компьютер, а модели уходят только релевантные абзацы.
Команда Marktechpost AI Media выпустила Token Saver, открытое расширение (лицензия MIT, версия 1.0) для Claude Desktop, работающее по протоколу MCP (Model Context Protocol, стандарт подключения внешних инструментов к модели). Инструмент разработал Арнав Рай, студент Рочестерского технологического института, во время стажировки в Marktechpost под руководством Жан-Марка Моммессена и Асифа Раззака. Ключевая идея: вместо того чтобы скармливать Claude весь документ целиком, расширение ищет нужные фрагменты локально и передаёт модели только их.
| Показатель | Значение | Источник |
|---|---|---|
| Сокращение расхода токенов | 92-99% | Замеры Marktechpost (tiktoken, cl100k_base) |
| Лимит отправки в Claude | 8 000 символов на запрос | Документация Token Saver |
| Размер чанка (фрагмента) | 180 слов, перекрытие 40 слов | Документация Token Saver |
| Вес семантического поиска | 0.6 | Документация Token Saver |
| Вес ключевого поиска BM25 | 0.4 | Документация Token Saver |
| Порог семантической близости | 0.25 (если нет совпадений по ключевым словам) | Документация Token Saver |
| Лицензия | MIT, версия 1.0 | GitHub Token Saver |
Как работает локальный поиск без загрузки файлов?
Когда вы вставляете PDF в обычный чат Claude, происходит неочевидное: каждая страница конвертируется в изображение для сохранения графиков и таблиц, а текст извлекается отдельно. По данным Marktechpost, только текстовая часть занимает от 1 500 до 3 000 токенов на страницу. При каждом следующем вопросе вся история диалога вместе с документом отправляется заново.
Token Saver работает иначе. Расширение запускает на вашем компьютере фоновый сервер, который выполняет гибридный поиск по документу в восемь этапов:
- Извлечение текста из PDF с помощью библиотеки pypdfium2.
- Нарезка на фрагменты по 180 слов с перекрытием в 40 слов, чтобы не терять контекст на стыках.
- Гибридная оценка: одновременно ищет точные совпадения по ключевым словам (алгоритм BM25, вес 0.4) и смысловую близость через локальную модель эмбеддингов all-MiniLM-L6-v2 (вес 0.6). Эмбеддинг (числовое представление текста, по которому машина сравнивает смыслы, а не буквы) вычисляется прямо на вашей машине.
- Фильтрация: фрагменты без совпадений по ключевым словам проходят, только если их семантическая близость выше 0.25.
- Удаление дубликатов и обрезка до предложений, которые отвечают на вопрос.
- Бюджетирование: итоговый пакет ограничен 8 000 символами.
- Упаковка: каждый фрагмент снабжается именем файла и номером страницы.
Claude получает компактный набор цитат вместо сотен страниц. Модель формирует ответ, указывая точные страницы и показывая, сколько токенов вы сэкономили.
Что обнаружили при тестировании?
По замерам Marktechpost (использован счётчик tiktoken с кодировкой cl100k_base, базовый расчёт предполагает, что без Token Saver модели отправляется весь документ при каждом запросе):
- Экономия токенов составляет от 92% до 99% в зависимости от объёма документа. Чем больше PDF, тем выше процент: для юридических заключений, технических стандартов и финансовых отчётов эффект максимален.
- Claude 3.5 Sonnet (рекомендованная разработчиками модель) корректно обрабатывает неточные ссылки на файлы, задаёт уточняющие вопросы при похожих именах и верно применяет номера страниц из найденных фрагментов.
- Claude 3 Opus лучше справляется со сложными документами, где несколько авторов или точек зрения, например судебные решения с особыми мнениями. Opus отмечает, когда атрибуция основана на контексте, а не на прямом указании в тексте.
Функции кеширования промптов (prompt caching) и проектов Claude (Claude Projects) частично смягчают проблему повторной отправки, но не решают её: весь документ по-прежнему уходит на серверы Anthropic. Token Saver устраняет именно это.
Замеры проведены самой командой Marktechpost, независимой проверки на момент публикации нет. Базовый расчёт предполагает, что без расширения весь документ заряжается при каждом вопросе, реальная стоимость токенов API Claude Sonnet зависит от длины диалога, наличия кеширования и типа подписки. Эмбеддинг-модель опциональна: без неё система работает только по ключевым словам, точность поиска снижается.
Что делать с этим прямо сейчас?
Авторам Дзена и копирайтерам. Если вы анализируете длинные исследования, отчёты или книги через Claude, Token Saver позволяет задавать десятки вопросов к одному документу без лавинного роста расходов. Установка не требует Python и терминала: скачиваете файл .mcpb с GitHub, ставите через настройки Claude Desktop, указываете папку с PDF.
Маркетологам и аналитикам. Для регулярной работы с финансовыми отчётами, конкурентными обзорами и презентациями экономия 92-99% токенов меняет экономику использования Claude с «дорого для ежедневной рутины» на «допустимо». Документы не покидают компьютер, что закрывает вопрос конфиденциальности клиентских данных.
Разработчикам и предпринимателям в РФ. Claude Desktop доступен через VPN и зарубежные аккаунты. Расширение работает локально, поэтому критичная часть обработки не зависит от скорости соединения с серверами Anthropic. Для тех, кто использует отечественные модели (YandexGPT, GigaChat), принцип гибридного RAG (Retrieval-Augmented Generation, генерация ответа с опорой на найденные в документе фрагменты) применим и к ним, но готового аналога Token Saver для российских моделей пока нет.
Я проверил идею на практике: главная боль при работе с большими PDF через любую модель не сам анализ, а стоимость повторных запросов. Когда вы перечитываете 200-страничный документ пятый раз за сессию, платите как за пять документов. Token Saver бьёт именно в эту точку. Ограничение очевидно: расширение работает только с Claude Desktop, а не с API напрямую. Для автоматизированных пайплайнов придётся строить свой RAG. Но для ручной аналитической работы, когда один человек разбирает стопку PDF, это, по моим наблюдениям, самый простой способ сократить расходы без потери качества ответов.
Три вещи, которые стоит учесть перед установкой: расширение читает только файлы из указанной папки и откажется открывать что-либо за её пределами; сервер общается с Claude Desktop через стандартный ввод-вывод без сетевых портов; а если локальная модель эмбеддингов не загрузится, поиск переключится на режим только по ключевым словам, и точность упадёт.
По данным Marktechpost

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».
Читайте также

Moonshot AI открыла MoonEP: обучение Mixture of Experts без простоя GPU в 2,5 раза эффективнее
Компания Moonshot AI в день открытого релиза модели Kimi K3 опубликовала MoonEP, библиотеку для параллельных вычислений в архитектуре Mixture of Experts,…

Венг вернулась в OpenAI: вместо безопасности возглавит самоулучшение моделей
Microsoft второго июня запустила агента Scout, который сам ведёт почту и календарь без команд пользователя, и впервые отдала управление расписанием не…

LLM-бот вместо опросника: 34% отказников дают интервью о платных моделях подписки
Почему это важно Готовая архитектура позволяет любому разработчику или автору встроить короткое интервью в момент отказа от покупки и получать живые причины…
Комментарии