Игорь Градов
Игорь Градов
7 мин
ai

Обучение LLM стоит от $20 до $1 млрд: формула, которая объясняет разброс

Компания Epoch AI и ряд исследовательских команд опубликовали данные, которые позволяют посчитать реальную стоимость обучения языковых моделей с нуля, и разброс оказался от 20 долларов до миллиарда.

Обучение LLM стоит от $20 до $1 млрд: формула, которая объясняет разброс
Почему это важно

Впервые за одну формулу (C ≈ 6·N·D) и набор публичных техотчётов можно самостоятельно оценить бюджет любого проекта по обучению LLM (большой языковой модели), не полагаясь на заголовки про «миллиарды».

Тема «обучение LLM» (LLM, large language model, большая языковая модель) окружена туманом. В октябре 2025 года Андрей Карпатый, один из основателей OpenAI, выложил nanochat и назвал его «лучшим ChatGPT, который можно купить за 100 долларов». В декабре 2024 года DeepSeek опубликовал техотчёт модели V3, где указана стоимость обучения 5,576 млн долларов. А в конце января 2025 года заголовки «китайцы сделали GPT-4 за шесть миллионов» несколько дней подряд сотрясали и прессу, и биржу. Все цифры честные, но за словами «обучить LLM» прячется лестница в семь порядков. Источником фактов и расчётов ниже служит подробный разбор CTO ML-команды, опубликованный на Хабре с первоисточниками на каждую цифру.

Что Когда Кто выпустил / описал Ориентир по затратам
nanochat (полный пайплайн от токенизатора до веб-чата) Октябрь 2025 Андрей Карпатый ~100 $
DeepSeek V3 (обучение с нуля) Декабрь 2024 DeepSeek 5,576 млн $
habrGPT 0.5B (претрейн на статьях Хабра, одна RTX 5090) Июнь 2025 Сообщество Хабра ~6 часов на одной видеокарте
GPT-2 124M (воспроизведение через llm.c) Эталонный тест Андрей Карпатый (llm.c) ~20 $ за 90 минут

Обучение с нуля и дообучение: в чём разница на три порядка цены?

Прежде чем считать деньги, нужно развести два понятия, которые постоянно путают.

  • Обучение с нуля (pretraining): веса модели заполняются случайным шумом, и она с чистого листа прогоняется через триллионы токенов (токен, это минимальный кусочек текста, который модель обрабатывает за один шаг, примерно три четверти слова). Это дорого.
  • Дообучение (fine-tuning): берут готовые открытые веса (open weights, параметры уже обученной модели, которые автор выложил в открытый доступ) и доучивают на своих данных. Это дешевле на два-три порядка.

Половина статей «как я обучил GPT дома», по замечанию автора исходного разбора, на самом деле описывают дообучение. Если задача звучит как «чтобы модель знала наши документы», почти наверняка нужен дообучение или RAG (retrieval-augmented generation, когда модель ищет ответ в вашей базе документов, а не запоминает их).

Формула на салфетке: C ≈ 6·N·D

Вся экономика обучения LLM с нуля сводится к одной формуле из работы Kaplan et al. 2020 (раздел 2.1):

C ≈ 6 · N · D

  • C — количество операций с плавающей точкой (FLOP), которые нужно выполнить.
  • N — число параметров модели.
  • D — число токенов, на которых модель учится.

Множитель 6 складывается так: примерно 2 FLOP на параметр на токен при прямом проходе и ещё вдвое больше при обратном. Для MoE-моделей (mixture of experts, архитектура, где на каждом токене работает только часть весов, а остальные «спят») N берётся по активным параметрам. По данным Epoch AI, эмпирически множитель колеблется от 5 до 8, но для прикидки на салфетке шестёрки хватает.

Дальше два действия:

  1. Делим C на реальную скорость железа и получаем секунды.
  2. Умножаем секунды на цену аренды и получаем деньги.

Реальная скорость, это пиковые терафлопы видеокарты, умноженные на MFU (model FLOPs utilization, доля пиковой мощности, которая идёт именно в вычисления модели, а не тратится на обмен данными между серверами, ожидание и прочие накладные расходы).

Ориентиры MFU из публичных источников:

  • GPT-3, 2020 год: 21,3%
  • PaLM, 2022 год (по данным из статьи PaLM): 46,2%
  • MegaScale от ByteDance: 55,2% на 12 288 GPU
  • llm.c на одной ноде без сетевых потерь: около 60%

Автор исходного разбора рекомендует закладывать 40 до 50% и не сильно ошибётесь.

Проверка формулы: GPT-2 за 20 долларов

GPT-2 124M на 10 млрд токенов: 6 × 124 000 000 × 10 000 000 000 ≈ 7,4 × 10¹⁸ FLOP. Нода из 8 карт A100 при 60% MFU выдаёт примерно 1,5 × 10¹⁵ FLOP в секунду. Результат: около 83 минут. Фактический результат проекта llm.c Андрея Карпатого: 90 минут и примерно 20 долларов.

Формула работает. Именно этот приём, «шесть-эн-дэ, нарисованное маркером прямо при заказчике», по словам автора, отрезвляет быстрее любого слайда про риски.

Сколько токенов нужно и почему данные решают всё?

Второй столп экономики обучения LLM, объём данных. Исследование Chinchilla (DeepMind, 2022) вывело оптимальную пропорцию: примерно 20 токенов на параметр. Но с тех пор пропорция сдвинулась на порядки. Llama 3 8B, по данным Meta, обучена на более чем 15 трлн токенов, это примерно 1 875 токенов на параметр, в 90 раз больше рекомендации Chinchilla. И качество при этом продолжало расти.

Логика: обучение оплачивается один раз, а инференс (инференс, это когда модель обрабатывает запросы пользователей, то есть работает «в бою») происходит миллиарды раз. Поэтому выгоднее взять модель поменьше и «залить» в неё данных сильно больше оптимума.

Цену модели, выходит, задаёт в основном D, а данные сейчас меряют триллионами.

Голая модель после обучения: дорогой Т9

После обучения с нуля получается не чат-бот, а, по выражению из исходного разбора, «очень дорогой, очень начитанный Т9». Базовая модель умеет ровно одно: продолжать текст так, как он статистически продолжался бы в обучающем корпусе. Напишете ей «Привет», и вместо ответа получите «сказала Маша и закрыла дверь», потому что в интернет-текстах после реплики обычно идёт ремарка из художественной прозы или продолжение форумного треда.

Андрей Карпатый формулирует: «Base models are not assistants, they just want to complete internet documents» («Базовые модели не ассистенты, они просто хотят дописать интернет-документ»).

Чтобы модель стала отвечать на вопросы, нужен отдельный этап, выравнивание (alignment) и обучение на инструкциях. Это ещё одна статья расходов поверх обучения LLM с нуля.

Как попробовать формулу самому?

  1. Возьмите параметры любой открытой модели (например, Llama 3 8B: N = 8 млрд параметров, D = 15 трлн токенов).
  2. Подставьте в формулу: C ≈ 6 × 8 × 10⁹ × 15 × 10¹² = 7,2 × 10²³ FLOP.
  3. Разделите на скорость доступного вам железа (пиковые TFLOPS × MFU 0,4 до 0,5), получите время в секундах.
  4. Умножьте на цену аренды GPU-часа (у облачных провайдеров, доступных в РФ, стоимость одного часа A100 начинается примерно от 2 до 3 долларов), получите бюджет.

Что с этим делать прямо сейчас, по ролям?

Автору Дзена: формула C ≈ 6·N·D позволяет за минуту проверить любой заголовок вроде «обучили GPT за копейки». Если числа не сходятся, скорее всего, речь о дообучении, а не об обучении с нуля. Это отличает грамотный контент от пересказа хайпа.

Маркетологу и предпринимателю: когда подрядчик предлагает «обучить свою LLM», первый вопрос: с нуля или дообучение? Разница, три порядка бюджета. Для задачи «чтобы модель знала наши документы» почти всегда хватает дообучения или RAG.

Практику в РФ и СНГ: из доступных в России инструментов для дообучения можно использовать YandexGPT (через Yandex Cloud) и GigaChat (через API «Сбера»). Оба сервиса предлагают дообучение на своих данных без необходимости арендовать GPU-кластер. Для обучения LLM с нуля на русском языке потребуется аренда мощностей, например, у российских облачных провайдеров с GPU (Selectel, Cloud.ru).

Мнение редакции dzen.guru

Формула C ≈ 6·N·D, пожалуй, самый полезный инструмент, который можно вынести из всей дискуссии об обучении LLM. Я проверил её на нескольких публичных кейсах, расхождение с реальными цифрами укладывается в 10 до 20%. Для прикидки «стоит ли вообще думать про своё обучение LLM» этого достаточно. На мой взгляд, для 95% задач в российском контент-маркетинге, авторстве и малом бизнесе обучение с нуля не нужно вовсе. Дообучение или RAG закрывают задачу за сотни, а не миллионы долларов. Но если кто-то предлагает вам «свою LLM за миллион рублей», теперь вы можете за минуту проверить, что именно вам продают.

Частые вопросы

Можно ли обучить LLM на домашнем компьютере?

Обучение с нуля, только маленькую модель. Проект habrGPT (0,5 млрд параметров) обучили на одной RTX 5090 за примерно 6 часов. GPT-2 (124 млн параметров) воспроизводится за 90 минут и 20 долларов на ноде из 8 карт A100. Но модели масштаба GPT-4 требуют тысяч GPU и месяцев работы. Дообучение готовой модели на своих данных, это реально даже на одной видеокарте.

Чем обучение LLM отличается от дообучения?

Обучение с нуля (pretraining) начинается со случайного шума и требует триллионов токенов текста. Дообучение (fine-tuning) берёт уже готовые веса и адаптирует их под конкретную задачу. Разница в стоимости, два-три порядка: если обучение с нуля стоит миллионы долларов, дообучение той же модели может обойтись в тысячи или даже сотни.

Формула C ≈ 6·N·D точная?

Нет, приблизительная. По данным из работы Kaplan et al. 2020, она не учитывает embedding-слои и ряд attention-компонентов. Для MoE-моделей множитель может гулять от 5 до 8. Но для оценки порядка затрат на салфетке, а именно это нужно при принятии бизнес-решений, точности хватает.

Формула на салфетке не заменит полную смету, но она за минуту покажет, говорит ли собеседник про тысячи или про миллионы, и это уже достаточно, чтобы задать правильный следующий вопрос.

Поделиться:TelegramVK
Игорь Градов
Игорь Градов

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».

Комментарии

Читайте также

Т-Банк показал персонализацию нейросети Perseus: +10% к точности без истории покупок
ai

Т-Банк показал персонализацию нейросети Perseus: +10% к точности без истории покупок

Почему это важно Т-Банк открыто описал, как единая последовательность действий клиента из десятков сервисов поднимает точность рекомендаций на 3-17% даже там,…

6 мин
Три директора за полгода: центр ИИ при Трампе теряет руководителей быстрее, чем выпускает стандарты
ai

Три директора за полгода: центр ИИ при Трампе теряет руководителей быстрее, чем выпускает стандарты

Третий за год глава Центра стандартов ИИ при Белом доме ушёл с поста, и на этот раз причину даже не назвали: CAISI (Center for AI Standards and Innovation),…

5 мин
ИИ-агенты ломаются на пути в продакшен: четыре барьера, которые не видны на пилоте
ai

ИИ-агенты ломаются на пути в продакшен: четыре барьера, которые не видны на пилоте

Обнаружил, что оригинал обрывается на полуслове («Общая ви»). Пишу строго по тем фактам, которые есть в переданном тексте. ИИ-агенты (программы, которые сами…

6 мин