Игорь Градов
Игорь Градов
7 мин
ai

RAG нейросети ломается на корпоративных документах: как починить нарезку текста

Корпоративные документы полны таблиц, вложенных пунктов и перекрёстных ссылок, и стандартный RAG (технология, при которой нейросеть ищет ответ по загруженным документам, Retrieval-Augmented Generation) ломается на них чаще, чем кажется на старте.

RAG нейросети ломается на корпоративных документах: как починить нарезку текста
Почему это важно

Главная ловушка RAG на корпоративных документах не в слабой модели, а в неправильной нарезке текста: шапка таблицы попадает в один фрагмент, строки со сроками в другой, и нейросеть выдаёт уверенный, но неверный ответ. Ниже разбираем, как этого избежать на практике.

Команда российских разработчиков описала опыт создания внутреннего «Помощника для сотрудника», сервиса, который отвечает на вопросы по более чем тремстам внутренним регламентам: от тендеров и договорной работы до командировок и информационной безопасности. Первый прототип RAG «по учебнику» заработал за несколько дней, но при проверке реальными вопросами начал путать этапы процессов, терять условия и называть не те роли. Проблема оказалась не в модели, а в подготовке документов.

Почему обычная нарезка текста убивает смысл?

Корпоративный регламент устроен иначе, чем статья из интернета. Смысл в нём часто существует только вместе со структурой:

  • Пункты вида 5.3.1.2 с вложенными подпунктами
  • Таблицы с объединёнными ячейками и матрицами ответственности
  • Примечания, ссылки на другие разделы, десятки внутренних сокращений
  • Условия и исключения, которые разнесены по разным частям документа

Стандартный чанкер (инструмент, который режет документ на фрагменты фиксированной длины для загрузки в векторную базу) не понимает этой семантики. Если ему задано нарезать по тысяче символов, он режет ровно по тысяче. В результате условие попадает в один фрагмент, действие в другой, исключение в третий. Каждый фрагмент может быть похож на вопрос пользователя, но ни в одном нет полного правила.

Разработчики описали показательный случай. На вопрос о сроках подготовки коммерческого предложения система уверенно назвала четыре рабочих дня. Число действительно было в регламенте, но относилось к другому этапу процесса. Шапка таблицы попала в один чанк, строки со сроками в другой. Модель получила число, но потеряла его связь с колонкой. Формально она ничего не выдумала, фактически ответ был неверным.

Именно на этом примере команда зафиксировала ключевой вывод: проблема начинается раньше поиска по векторам. Документ сначала надо правильно прочитать. Увеличивать количество возвращаемых фрагментов или менять параметры модели здесь бесполезно.

Что понадобится

  • Модель для генерации ответов: в описанном проекте использовали gpt-oss-120b на выделенном сервере с NVIDIA RTX PRO 6000 Blackwell (96 ГБ видеопамяти). Для экспериментов подойдёт любая сильная модель с большим контекстным окном
  • Модель для эмбеддингов (векторных представлений текста, по которым ищутся похожие фрагменты): команда после тестов на русскоязычных документах выбрала GigaEmbeddings-instruct от Cloud.ru
  • Реранкер (модель, которая пересортировывает найденные фрагменты по релевантности): bge-reranker-v2-m3
  • Мультимодальная модель (модель, работающая и с текстом, и с изображениями) для обработки схем и визуального контента: Qwen3.6-35B-A3B
  • Векторная база данных: Qdrant
  • Оркестратор (инструмент, который связывает все шаги в цепочку): n8n
  • Время: первый прототип собирается за несколько дней, но доводка RAG на корпоративных документах до рабочего качества занимает значительно больше

Пошаговая инструкция

  1. Разделите pipeline на два контура: индексацию и поиск. Не пытайтесь решить всё одной моделью. Индексация это подготовка документов до того, как пользователь задаст вопрос. Поиск это то, что происходит в момент запроса.

  2. На этапе индексации извлеките содержимое из всех форматов. DOCX, PDF, страницы Confluence, вложения. Текстовое содержимое обрабатывайте отдельно от визуального: схемы, изображения и сложные PDF-страницы пропускайте через мультимодальную модель, чтобы превратить их в текстовое описание.

  3. Откажитесь от нарезки по фиксированной длине. Это главный шаг. Нарезайте документ с учётом его структуры: заголовок раздела, шапка таблицы и строки данных должны оставаться вместе. Каждый чанк должен содержать полное правило, а не его часть.

  4. Сохраняйте в каждом чанке метаданные: название документа, номер раздела, заголовки верхних уровней. Без этого модель не сможет сослаться на конкретный пункт регламента.

  5. Постройте эмбеддинги специализированной моделью для русского языка. Общие англоязычные модели хуже работают с канцелярскими конструкциями и корпоративными сокращениями.

  6. Используйте гибридный поиск: совмещайте векторный поиск (по смыслу) с полнотекстовым (по ключевым словам). Корпоративные сокращения и номера пунктов часто не ловятся одним только семантическим поиском.

  7. Добавьте реранкер после первичного поиска. Он пересортирует найденные фрагменты и отсеет те, которые семантически похожи, но относятся к другому процессу.

  8. В промпте для генерации ответа явно укажите: отвечать строго по переданным фрагментам, ссылаться на конкретный документ и пункт, при нехватке информации говорить «недостаточно данных».

Системный промпт (пример):
Ты помощник сотрудника. Отвечай ТОЛЬКО на основании предоставленных фрагментов документов.
В ответе обязательно укажи: название документа, номер пункта, прямую цитату.
Если в предоставленных фрагментах нет информации для ответа — скажи:
«Я не нашёл ответа в загруженных регламентах».
Не дополняй ответ собственными знаниями.
  1. Тестируйте не на абстрактных запросах, а на реальных вопросах сотрудников. Именно на них вскрываются ошибки чанкирования. Заведите таблицу: вопрос, ожидаемый ответ, фактический ответ, какие чанки получила модель.
Как это применить

Вопрос сотрудника: «За сколько дней нужно оформить командировку?»

При нарезке по фиксированной длине модель получила фрагмент со сроком «4 рабочих дня», но без шапки таблицы. Ответ звучал уверенно, но число относилось к другому этапу. После перехода на структурную нарезку, где шапка таблицы склеивается со строками данных и заголовком раздела, модель получила полный контекст и ответила корректно, с точной ссылкой на пункт регламента и указанием условий (например, «при сумме более 100 000 рублей срок увеличивается»).

Частые ошибки

Доверие к «красивому» ответу. Модель формулирует гладкий текст даже когда в её контексте нет правильной информации. Галлюцинация (ситуация, когда нейросеть уверенно выдумывает то, чего не было) в корпоративном RAG опаснее, чем в чат-боте для общих вопросов: сотрудник может принять неверный срок или не ту роль за руководство к действию.

Нарезка таблиц построчно. Строка таблицы без шапки это набор чисел без смысла. Чанкер должен склеивать заголовок колонки со строкой данных.

Попытка компенсировать плохую подготовку документов более мощной моделью или более сложными промптами. Как сформулировал архитектор описанного проекта: не надо компенсировать плохую подготовку документов всё более мощными LLM и всё более сложными промптами.

Использование одной модели для всех задач. В описанном проекте вместо схемы «векторная база плюс одна модель» получилась система из четырёх специализированных моделей, каждая для своей задачи: эмбеддинги, реранкинг, обработка визуального контента, генерация ответа.

Что делать с этим прямо сейчас?

Авторам Дзена и копирайтерам. Если вы работаете с заказчиками из корпоративного сектора, понимание ловушек RAG на корпоративных документах даёт конкретное преимущество: вы можете предложить не просто «загрузить базу знаний в нейросеть», а грамотно подготовить документы для неё. Это отдельная и востребованная задача.

Маркетологам. RAG на внутренних документах уже используется в крупных компаниях для ответов на вопросы сотрудников. Следующий шаг: такие же системы для клиентских баз знаний. Если ваша компания думает о внедрении, начните с аудита того, как устроены ваши документы, и сразу закладывайте бюджет на их структурную подготовку, а не только на «подключение ИИ».

Предпринимателям из РФ и СНГ. Все упомянутые инструменты доступны в России: Qdrant и n8n разворачиваются на собственных серверах, GigaEmbeddings от Cloud.ru работает с русским языком, серверы с нужными видеокартами можно арендовать у российских провайдеров. Из российских аналогов для генерации ответов можно рассмотреть YandexGPT и GigaChat, хотя для задач с большим контекстным окном стоит тестировать каждую модель на ваших документах отдельно.

Мнение редакции dzen.guru

По моим наблюдениям, большинство неудачных внедрений RAG на корпоративных документах ломаются именно на этапе чанкирования, а не на выборе модели. Команды тратят недели на подбор «лучшей LLM», хотя корень проблемы в том, что модель получает на вход обрезанные таблицы и пункты без контекста. Описанный опыт подтверждает то, что я вижу и в других проектах: вложение времени в структурную подготовку документов окупается быстрее, чем покупка более дорогого железа. Честная оговорка: даже при правильной архитектуре RAG на нейросетях не даёт стопроцентной точности на корпоративных регламентах. Критически важные ответы, суммы, сроки, роли, всё равно стоит перепроверять по первоисточнику. Но разница между «система врёт красиво» и «система отвечает верно в девяти случаях из десяти и честно говорит, когда не знает» определяется именно качеством подготовки данных.

Научитесь работать с нейросетями на практике

В dzen.guru мы разбираем реальные сценарии применения ИИ для авторов и предпринимателей, от промптов до архитектуры RAG

Попробовать инструменты dzen.guru

Главный урок этого кейса укладывается в одну фразу: RAG на корпоративных документах начинается не с векторной базы, а с того, как вы нарезали документ. Если шапка таблицы оторвана от данных, никакая модель не соберёт из обрывков правильный ответ. Начните с десяти самых частых вопросов сотрудников, проверьте, какие фрагменты получает модель, и вы увидите, где именно ломается ваш pipeline.

Поделиться:TelegramVK
Игорь Градов
Игорь Градов

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».

Комментарии

Читайте также

Cloud.ru за полгода собрала ai-first команду из 300 инженеров: доля новичков упала втрое
ai

Cloud.ru за полгода собрала ai-first команду из 300 инженеров: доля новичков упала втрое

Cloud.ru поделилась пошаговым планом: как за полгода превратить 300 инженеров в ai-first команду, где нейросети используют не энтузиасты, а каждый сотрудник, и…

6 мин
Reducto заменила конвейер на парсинг документов нейросетью за один проход: цена упала втрое
ai

Reducto заменила конвейер на парсинг документов нейросетью за один проход: цена упала втрое

Компания Reducto на прошлой неделе представила r-1, модель для парсинга документов нейросетью за один проход, которая заменяет прежний многоступенчатый…

5 мин
Нейросети убивают авторский голос: разработчик с 17-летним опытом фиксирует грабли
ai

Нейросети убивают авторский голос: разработчик с 17-летним опытом фиксирует грабли

Русский разработчик, 17 лет писавший экспертные статьи вручную, решил автоматизировать производство контента через нейросети и столкнулся с главной проблемой:…

5 мин