Игорь Градов
Игорь Градов
5 мин
ai

Цифровой двойник автора за два дня: 3,4 млн символов в одном файле вместо RAG

Цифровой двойник, собранный руками: автор упаковал 3,4 млн символов своих текстов в один файл, чтобы нейросеть отвечала его словами, и этот подход может повторить каждый.

Цифровой двойник автора за два дня: 3,4 млн символов в одном файле вместо RAG
Почему это важно

RAG-системы (когда нейросеть ищет ответ по внешним источникам) часто теряют контекст, путают авторов и «галлюцинируют» (уверенно выдумывают факты). Один markdown-файл со всеми вашими текстами решает проблему радикально: модель видит только ваши знания и отвечает строго в их границе.

Идея родилась из бытовой задачи. Автор вёл книжный блог и хотел, чтобы читателям не приходилось листать длинное оглавление ради одной подборки. Он попробовал заставить нейросеть искать информацию конкретного автора по открытым источникам и отвечать только в контексте его знаний. Не получилось: публикации были разбросаны по разным площадкам, и модель путала факты.

Тогда он за два дня собрал всё, что написал за десять лет про автоматизацию, управление, карьеру и книги, в единый markdown-файл. На момент публикации в нём 3,4 млн символов, это примерно восемь книг (если считать по 400 тысяч символов на книгу). Художественную литературу автор не включал: из неё, по его словам, «смысл и пользу слишком сложно выковыривать». Файл выложен на GitHub и открывается прямо в браузере.

Почему именно markdown, а не PDF или Word?

Структуру файла автор проектировал с помощью DeepSeek. Модель предложила формат markdown и объяснила, что нейросети лучше «понимают» его разметку: заголовки, списки и блоки кода считываются точнее, чем вёрстка PDF.

Позже автор проверил структуру через Qwen, и та предложила всё переделать. Он пока оставил первый вариант, но сам факт показателен: разные модели по-разному оценивают удобство разметки, и перед загрузкой имеет смысл спросить у выбранной нейросети, всё ли ей понятно.

Что понадобится

  • Все ваши тексты по теме (статьи, посты, заметки, конспекты) за любой период.
  • Текстовый редактор с поддержкой markdown (подойдут бесплатные Obsidian, Typora, VS Code или даже «Блокнот»).
  • Бесплатный чат нейросети с большим контекстным окном (автор рекомендует DeepSeek, Qwen, ИИ-ассистент Google).
  • От одного до трёх дней на сборку, зависит от объёма.

Пошаговая инструкция

  1. Соберите тексты в одну папку. Скопируйте всё, что писали по рабочей теме: посты из блога, статьи, черновики, конспекты книг. Художественные и развлекательные тексты лучше не включать, они засоряют контекст.

  2. Попросите нейросеть предложить структуру файла. Откройте DeepSeek или Qwen и напишите промпт (запрос к нейросети):

Я хочу собрать все свои тексты по теме [ваша тема] в один
markdown-файл, чтобы потом загружать его в нейросеть и
получать ответы строго в контексте моих знаний.
Предложи структуру файла: какие разделы, какие заголовки,
как разметить блоки. Объём текстов — примерно [ваш объём].
  1. Перенесите тексты в markdown-файл по предложенной структуре. Используйте заголовки второго и третьего уровня (##, ###), маркированные списки, разделители между блоками. Каждый текст или конспект начинайте с заголовка и краткой аннотации.

  2. Проверьте файл другой моделью. Загрузите готовый файл в другую нейросеть и спросите:

Посмотри на структуру этого файла. Всё ли тебе понятно?
Что стоит изменить, чтобы ты лучше находила нужную
информацию по запросу пользователя?
  1. Выложите файл в открытый доступ или храните локально. Автор оригинала выбрал GitHub: файл открывается в браузере, скачивается без учётной записи. Для личного пользования достаточно хранить на диске.

  2. Загрузите файл в чат нейросети и задайте вопрос. Откройте бесплатный чат (DeepSeek, Qwen, ИИ-ассистент Google), прикрепите файл и спросите то, на что обычно отвечаете читателям сами.

Как это применить

Автор загрузил свой файл (3,4 млн символов) в бесплатный чат DeepSeek и попросил: «Составь подборку книг по управлению проектами для начинающего руководителя». Нейросеть нашла нужные конспекты внутри файла и собрала подборку, опираясь только на тексты автора, без «отсебятины» из обучающих данных модели. Результат: читатель книжного блога получает персональную рекомендацию за минуту вместо получаса прокрутки оглавления.

Что делать с этим по ролям?

Автору Дзена. Соберите лучшие статьи в один файл и предложите подписчикам «поговорить с вашим цифровым двойником». Это необычный формат вовлечения: читатель задаёт вопрос, нейросеть отвечает вашими словами. Фактически вы создаёте бесплатного консультанта из собственного контента.

Маркетологу. Цифровой двойник эксперта на базе его текстов может заменить раздел FAQ, базу знаний для отдела продаж или бот для первичной консультации. Себестоимость: ноль рублей, если использовать бесплатные модели.

Предпринимателю в РФ. Всё работает локально и бесплатно. DeepSeek, Qwen и ИИ-ассистент Google доступны из России без VPN. Токены (единицы текста, которые модель обрабатывает за один запрос) при загрузке большого файла сгорают быстро, поэтому автор прямо предупреждает: не загружайте в платные нейросети, «будете проклинать за горение токенов».

Частые ошибки

Загрузка в платную модель без оценки объёма. 3,4 млн символов это сотни тысяч токенов. В ChatGPT Plus или Claude Pro один такой запрос может съесть заметную часть дневного лимита. Начинайте с бесплатных чатов.

Включение всего подряд. Художественные тексты, шутки, посты не по теме размывают контекст. Модель начнёт путать ваш экспертный тон с развлекательным.

Отказ от проверки структуры. Автор проверил файл через Qwen и получил рекомендацию «всё переделать». Если вы не проверите, модель может плохо ориентироваться в разделах и давать неточные ответы.

Слепое доверие ответам. Даже с вашим файлом нейросеть может неточно пересказать ваши мысли. Перепроверяйте ключевые рекомендации, особенно если цифровой двойник будет общаться с клиентами.

Мнение редакции dzen.guru

Подход элементарный, но я пока не встречал, чтобы кто-то в русскоязычном пространстве описал его так прямо. RAG-системы, когда нейросеть подтягивает данные из внешних баз, требуют настройки, серверов и денег. Один markdown-файл решает ту же задачу за два выходных.

Для авторов Дзена это ещё и формат контента: предложите читателям «поговорить с вами» через нейросеть. Кто-то скажет «цифровой двойник недр кубы», имея в виду что-то из геологии, но здесь речь проще: ваш цифровой двойник это ваши тексты, упакованные так, чтобы ИИ мог по ним ответить.

Честная оговорка: это не полноценный двойник. Модель не знает ваш тон голоса, не помнит контекст прошлых диалогов и не обновляется сама. Каждый новый текст нужно добавлять вручную. Но как первый шаг к тому, чтобы ваша экспертиза работала без вас, это самый дешёвый и рабочий вариант.

Подход требует двух дней ручной работы и ноль рублей. Если у вас за плечами хотя бы полсотни статей по одной теме, попробуйте собрать файл в эти выходные и загрузить в DeepSeek: результат покажет, стоит ли развивать идею дальше.

Попробуйте промпт-инжиниринг для своего контента

В dzen.guru мы собираем работающие промпты для авторов Дзена, которые хотят делать контент быстрее и точнее.

Посмотреть инструменты
Поделиться:TelegramVK
Игорь Градов
Игорь Градов

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».

Комментарии

Читайте также

Трамп потребовал переименовать искусственный интеллект в «суперинтеллект»: почему термин не приживётся
ai

Трамп потребовал переименовать искусственный интеллект в «суперинтеллект»: почему термин не приживётся

Двадцатого июня Дональд Трамп выступил на Генеральной Ассамблее ООН и среди прочего объявил, что США «официально» переименовывают искусственный интеллект в…

4 мин
ai

Уязвимости ИИ-агентов на практике: Muse от Meta превращался в шпиона за часы до патча

Meta выпустила экстренное обновление приложения Muse для macOS после того, как исследователь безопасности Патрик Уордл обнаружил уязвимость нулевого дня,…

4 мин
ИИ-компания Nscale идёт на IPO за $35 млрд, но 85% выручки зависят от двух клиентов
ai

ИИ-компания Nscale идёт на IPO за $35 млрд, но 85% выручки зависят от двух клиентов

Британская компания Nscale, которая строит дата-центры и продаёт вычислительные мощности для работы нейросетей, подала заявку на IPO (первичное размещение…

5 мин