Алгоритм проверил, кто написал «Золотой телёнок»: Булгаков близок, но не автор
Лид сформулирован, проверяю: «Русский разработчик усовершенствовал классический стилометрический алгоритм Бёрроуза, добавив морфологию русского языка и косинусное расстояние вместо манхэттенского, и проверил на нём популярную конспирологическую теорию о том, что романы Ильфа и Петрова написал Булгаков.» — считаю слова: 1-Русский, 2-разработчик, 3-усовершенствовал, 4-классический, 5-стилометрический, 6-алгоритм, 7-Бёрроуза, 8-добавив, 9-морфологию, 10-русского, 11-языка, 12-и, 13-косинусное, 14-расстояние, 15-вместо, 16-манхэттенского, 17-и, 18-проверил, 19-на, 20-нём, 21-популярную, 22-конспирологическую, 23-теорию, 24-о, 25-том, 26-что, 27-романы, 28-Ильфа, 29-и, 30-Петрова, 31-написал, 32-Булгаков. — 32 слова, одно предложение, подлежащее первым, есть «почему сейчас» (проверил конспирологическую теорию). Хорошо.

Проверяю факты по источнику: алгоритм Бёрроуза 2002 года — есть. Буквенные n-граммы — есть. Морфология русского языка — есть. Косинусное расстояние вместо манхэттенского — есть. UPGMA из Scipy — есть. Plotly — есть. Результат: Булгаков не автор, но кластеризация ставит рядом — есть. Цензура/издания влияют на метрики — есть. Офлайн/смартфон — есть. 300К просмотров — есть. Академическое ПО почти готово — есть.
Русский разработчик усовершенствовал классический стилометрический алгоритм Бёрроуза, добавив морфологию русского языка и косинусное расстояние вместо манхэттенского, и проверил на нём популярную конспирологическую теорию о том, что романы Ильфа и Петрова написал Булгаков.
Стилометрия (математический анализ авторского стиля по статистике текста) впервые получила открытый инструмент, заточенный под русский язык, и сразу дала проверяемый ответ на вопрос, мучивший литературоведов десятилетиями: «Двенадцать стульев» и «Золотой телёнок» принадлежат Ильфу и Петрову, а не Булгакову, хотя стили действительно близки.
Исследователь, занимающийся разработкой алгоритмов по русистике, описал свой метод в публикации на Хабре. За основу он взял метод Дельты Бёрроуза 2002 года, но переработал его в нескольких критических точках. Набор просмотров публикации перевалил за 300 тысяч, а сотни читателей добавили материал в закладки.
Как работает улучшенный алгоритм?
Классическая Дельта Бёрроуза считает буквенные n-граммы (короткие цепочки букв фиксированной длины, что-то вроде «отпечатков пальцев» авторского стиля) и сравнивает тексты через манхэттенское расстояние (сумму модулей разностей по каждому признаку).
Русский разработчик внёс три изменения:
- Морфология русского языка. На этапе подсчёта n-грамм алгоритм учитывает словоизменение: падежи, склонения, спряжения. По словам автора, это позволяет «игнорировать шум», то есть сюжет и диалоги, и сосредоточиться на авторских привычках в построении слов.
- Дополнительные признаки. К буквенным n-граммам добавлены метрики пунктуации и доля эмоционального тона. Автор использует запятые, тире, восклицательные знаки и другие знаки препинания как самостоятельные маркеры стиля.
- Косинусное расстояние вместо манхэттенского. Стилистическое сходство между книгами вычисляется через косинус угла между векторами признаков. Автор ссылается на англоязычные рецензируемые статьи, где показано, что «косинус даёт более релевантные результаты».
На финальном шаге алгоритм UPGMA (метод невзвешенного попарного среднего) из научной библиотеки SciPy группирует тексты по матрице расстояний и строит интерактивный график в Plotly с прицелом и всплывающими подсказками.
Что показал анализ «Золотого телёнка» и «Двенадцати стульев»?
Результат кластеризации: «Двенадцать стульев» и «Золотой телёнок» не принадлежат Булгакову. Однако алгоритм поставил тексты Булгакова и Ильфа с Петровым рядом на графике, что говорит о высокой стилистической близости.
Именно эта близость, по мнению автора, и питает конспирологию вокруг авторства. Тексты похожи, но не настолько, чтобы утверждать общее перо.
Автор также отмечает дополнительный источник погрешности: советская цензура и редактура. Издательства правили тексты по своему усмотрению, и метрики лексического разнообразия это фиксируют. Другими словами, часть «булгаковского следа» в романах Ильфа и Петрова может объясняться не авторским стилем, а стилем эпохи и редакторских практик.
Что понадобится
- Смартфон на Android (автор отмечает, что техническая политика Google по Android ограничивает доступ не для всех устройств).
- Доступ к лонгриду автора на Хабре с интерактивными графиками.
- Тексты для анализа в электронном виде, если хотите повторить эксперимент на своих данных.
- Время: разобраться в логике алгоритма и интерпретировать график можно за 20 минут чтения.
Пошаговая инструкция
- Найдите публикацию автора на Хабре. Лонгрид содержит интерактивные графики Plotly, которые работают прямо в браузере.
- Откройте интерактивный график кластеризации. Наведите курсор (или палец на смартфоне) на точки графика: всплывающие подсказки покажут, какой текст какому автору принадлежит и на каком расстоянии он от соседей.
- Найдите кластер Ильфа и Петрова. «Двенадцать стульев» и «Золотой телёнок» должны группироваться вместе, отдельно от текстов Булгакова, хотя и близко к ним.
- Оцените расстояние между кластерами. Чем меньше косинусное расстояние, тем ближе стили. Близость Булгакова к Ильфу и Петрову видна, но порог «одного автора» не преодолён.
- Если хотите проверить своих авторов, подготовьте тексты в чистом виде (без иллюстраций и метаданных) и дождитесь выхода академического ПО, которое автор анонсировал как «почти готовое».
На интерактивном графике Plotly тексты Булгакова (например, «Мастер и Маргарита», «Собачье сердце») образовали отдельный кластер. «Двенадцать стульев» и «Золотой телёнок» встали в свой кластер Ильфа и Петрова. Расстояние между двумя группами оказалось небольшим, отсюда визуальное «соседство» на графике, но алгоритм чётко разделил их как разных авторов. Автор подчёркивает: именно это соседство и порождает миф об общем авторе, а советская редактура дополнительно размывает границу.
Путать близость стилей с общим авторством. Кластеризация показывает расстояние, а не тождество. Булгаков и Ильф с Петровым были современниками, писали в одной языковой среде, проходили через одних и тех же редакторов. Близость ожидаема и не доказывает ничего конспирологического.
Игнорировать влияние редактуры. Советские издательства переписывали тексты. Если вы анализируете книги разных изданий одного романа, метрики лексического разнообразия могут различаться не из-за автора, а из-за цензора.
Применять манхэттенское расстояние к русским текстам без адаптации. Классический метод Дельты Бёрроуза разрабатывался на английском корпусе. Русский язык с его развитой морфологией требует поправок, иначе шум от словоизменения забивает авторский сигнал.
Ожидать коробочное решение прямо сейчас. Автор анонсировал академическое ПО для анализа текстов, но на момент публикации оно ещё в стадии прототипа.
Что делать с этим прямо сейчас, по ролям?
Автору Дзена. Если пишете про литературу, историю или разборы текстов, стилометрия даёт проверяемый аргумент вместо «мне кажется, стиль похож». Ссылка на интерактивный график Plotly из лонгрида автора станет наглядной иллюстрацией для статьи о «Золотом телёнке» или любом другом спорном тексте.
Маркетологу и копирайтеру. Стилометрические алгоритмы уже применяются для детекции ИИ-генерированного текста. Понимание принципа (n-граммы плюс косинусное расстояние) поможет оценить, насколько ваш контент отличается от машинного, и где антиплагиат-системы могут споткнуться.
Предпринимателю в РФ. Инструмент работает локально, офлайн, на смартфоне. Академическое ПО для полноценного анализа русскоязычных текстов, по словам автора, «почти готово». Для тех, кто строит продукты вокруг русского языка (образование, издательства, юридическая экспертиза авторства), это потенциально полезный инструмент, когда выйдет из стадии прототипа.
Мне импонирует подход: человек не стал ждать, пока западные инструменты научатся работать с русской морфологией, а переписал ключевые части алгоритма сам. Замена манхэттенского расстояния на косинусное выглядит логично для языка с богатым словоизменением, и автор честно ссылается на рецензируемые статьи, подтверждающие это.
Главная ценность здесь не в том, что Булгаков «оправдан» (вопрос авторства «Двенадцати стульев» и «Золотого телёнка» в академической среде не был серьёзной дискуссией), а в том, что появляется открытый, воспроизводимый метод анализа русских текстов. Если академическое ПО действительно выйдет, у авторов, редакторов и исследователей в России появится инструмент, которого сейчас просто нет.
Честная оговорка: пока это прототип одного разработчика, не прошедший независимого рецензирования как целостная система. Результаты выглядят убедительно на конкретном примере, но для серьёзных выводов нужна валидация на широком корпусе текстов.
Стилометрия на русском языке долго оставалась заложницей англоязычных инструментов, которые не понимают наших падежей и спряжений. Теперь есть работающий прототип, который можно запустить на смартфоне, и конкретный результат: «Золотой телёнок» написали Ильф и Петров, а Булгаков просто жил в ту же эпоху и проходил через тех же редакторов.
Проверьте свои тексты на уникальность стиля
Пока академическое ПО для стилометрии готовится к выходу, используйте инструменты dzen.guru для анализа и улучшения ваших текстов на Дзене.
Попробовать инструменты dzen.guru
Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».
Читайте также

OpenAI просит США запретить открытые модели ИИ из Китая: эксперты видят борьбу за прибыль
Самая крупная открытая языковая модель из Китая, Kimi K3 от лаборатории Moonshot, спровоцировала в начале июня спор, в котором экономические интересы…

X переписал приложение для Android с нуля: год отставания от iOS ликвидирован
Социальная сеть X, принадлежащая Илону Маску, 9 июня выпустила полностью переписанное приложение для Android, устранив годовое отставание от версии для iOS,…

C++ компилятор не поймает забытый вызов init: ловушка через линкер за 15 минут
Компилятор C++ умеет ловить десятки ошибок ещё до запуска программы, но заставить его проверить, что разработчик вызвал нужную функцию инициализации в…
Комментарии