Игорь Градов
Игорь Градов
6 мин
ai

Визуально-языковые модели за $200: разработчик собрал VLM на 628 млн параметров на одной GPU

Разработчик из сообщества открытых моделей собрал визуально-языковую модель на базе французской Baguettotron и визуального энкодера InternViT за 200 долларов на одной арендованной видеокарте, пройдя полный цикл от архитектуры до работающего прототипа.

Почему это важно

Визуально-языковые модели (VLM) до недавнего времени казались территорией крупных лабораторий с бюджетами в миллионы. Этот эксперимент показывает: собрать работающую VLM на 628 миллионов параметров может один человек с ноутбуком и двумястами долларами на аренду GPU.

Автор эксперимента опирался на открытые наработки Hugging Face, библиотеку nanoVLM и модель LFM2.5-VL-450M как ориентир. Результат: модель, которая описывает изображения и отвечает на простые вопросы по ним, а весь код и веса выложены на GitHub и Hugging Face. Это не коммерческий запуск, а подробный практический разбор, который можно повторить самостоятельно.

Что Когда Кто выпустил Цена
Визуально-языковая модель на 628 млн параметров (схема ViT-MLP-LLM) Дата точного релиза в источнике не указана Независимый разработчик, базовая модель Baguettotron от Pleias Около $200 на аренду одной GPU в RunPod

Что собрали и почему это работает?

Визуально-языковые модели (VLM, от visual language model) умеют одновременно «видеть» картинку и «говорить» о ней текстом. Обычная языковая модель работает только с текстом, а VLM добавляет к ней визуальный «глаз», зрительный энкодер, который превращает изображение в набор чисел, понятных языковой части.

Вот из чего собрана эта конкретная модель:

  • Языковая основа: Baguettotron (321 млн параметров). Это небольшая текстовая модель с открытыми весами (open weights, когда внутренние параметры модели доступны для скачивания и изучения) от французской команды Pleias. Необычна глубиной: 80 слоёв при скрытой размерности 576. Обучена на 200 миллиардов токенов (токен, минимальная единица текста для модели, примерно три четверти слова) из полностью синтетического датасета SYNTH, построенного на основе 50 000 статей Википедии. Ни одной страницы из веб-скрейпинга.
  • Визуальный энкодер: InternViT-300M-448px-V2.5. Превращает изображение размером 448 на 448 пикселей в 1024 «патч-токена» (фрагмента картинки, переведённого в числа). Авторы энкодера прямо указали, что их модель лучше подходит для построения мультимодальных (работающих сразу с несколькими типами данных) языковых моделей, чем для классических задач компьютерного зрения.
  • Проектор (MLP): мост между глазами и языком. 1024 визуальных токена сжимаются до 256 через операцию pixel unshuffle (перегруппировка пикселей без потери информации), затем двухслойная нейросеть приводит размерность к формату Baguettotron. Без этого сжатия обработка каждого изображения стоила бы слишком дорого для бюджета в 200 долларов.

Три этапа обучения и честные ошибки

Автор описал три стадии обучения и прямо указал, где модель начала ошибаться:

  • Модель с 628 млн параметров научилась описывать изображения и отвечать на простые вопросы по ним.
  • Попытка добавить рассуждения через дополнительное дообучение (fine-tuning, обучение модели на специальных примерах под конкретную задачу) ухудшила качество ответов. Автор зафиксировал это как важный урок.
  • Итоговая модель выдаёт ответ на ноутбуке примерно за секунду. Пример реального диалога: на вопрос «Опиши изображение» модель ответила «На изображении два кота сидят на диване. Один кот опустил голову, лапы подняты». Два объекта, место и поза верно определены.

Автор честно оговаривает: массово генерировать альтернативные тексты для картинок модель не сможет. Но она действительно смотрит на изображение, и весь путь можно проследить.

Как попробовать самостоятельно?

  1. Изучите репозиторий проекта на GitHub и веса на Hugging Face. Автор выложил код, веса и историю решений в открытый доступ (ссылки указаны в оригинальной статье).
  2. Арендуйте одну GPU на RunPod или аналогичном сервисе. Весь эксперимент уместился в бюджет около 200 долларов.
  3. Используйте библиотеку nanoVLM как каркас: она намеренно минималистична и объясняет архитектурные решения прозрачно. Вы выбираете компоненты (энкодер, проектор, языковую модель), остальное берёт на себя фреймворк.
  4. Будьте готовы к тому, что дообучение на рассуждения может ухудшить базовое качество. Автор столкнулся с этим на практике.

Есть ли подобное в России?

Для аудитории в РФ и СНГ полезно понимать, где сейчас находятся отечественные аналоги.

Параметр Эксперимент с Baguettotron YandexGPT GigaChat
Тип модели Визуально-языковая, открытые веса Закрытая мультимодальная модель Закрытая мультимодальная модель
Работа с изображениями Описание и ответы на вопросы по картинке Понимание изображений доступно Понимание изображений доступно
Доступ к весам и коду Полностью открыт Нет Нет
Возможность повторить Да, бюджет около $200 Нет, только через API Нет, только через API

YandexGPT и GigaChat умеют работать с изображениями, но это закрытые модели (closed-source, когда внутреннее устройство и веса недоступны). Повторить их архитектуру или обучить свою версию нельзя. Ценность описанного эксперимента именно в полной воспроизводимости: автор показал каждый шаг, каждую ошибку, каждое решение.

Что это даёт вам прямо сейчас, по ролям?

Автору на Дзене. Визуально-языковые модели такого размера пока не заменят ручное описание иллюстраций. Но если вы хотите понять, как работает распознавание картинок «под капотом» у любого ИИ-сервиса, этот разбор объясняет механику на реальном примере за 200 долларов. Полезно для тех, кто пишет о технологиях и хочет говорить предметно.

Маркетологу. Модели с открытыми весами на 628 млн параметров запускаются на ноутбуке. Это означает: обработка изображений без отправки данных на чужой сервер. Для задач, где конфиденциальность важна (внутренние презентации, карточки товаров), направление перспективное, хотя конкретно эта модель пока слишком проста для продакшена.

Предпринимателю в РФ. Все компоненты эксперимента доступны без ограничений: открытые веса, открытый код, аренда GPU через RunPod. Санкционных ограничений на скачивание моделей с Hugging Face на момент публикации нет. Если в команде есть ML-инженер, эксперимент можно воспроизвести.

Мнение редакции dzen.guru

Этот эксперимент ценен не результатом (модель на 628 млн параметров не конкурент GPT-4o или Claude), а прозрачностью процесса. Автор показал полный цикл: от выбора энкодера до момента, когда дообучение на рассуждения сломало то, что уже работало. Такие разборы учат больше, чем десять обзоров закрытых API.

По моим наблюдениям, главный барьер для авторов и маркетологов не стоимость GPU, а непонимание, из каких частей состоит «ИИ, который видит картинки». Этот материал этот барьер снижает. Если вы автор и пишете про нейросети, разберите архитектуру ViT-MLP-LLM из этого проекта: будете объяснять читателям мультимодальность не общими словами, а со знанием устройства.

Оговорка: модель обучена на синтетических данных из Википедии, а не на реальных фотографиях из интернета. Это делает её прозрачной, но ограничивает применимость к сложным сценам и нестандартным изображениям.

Частые вопросы

Можно ли использовать эту модель для работы с русскоязычным текстом?

Baguettotron обучена преимущественно на данных из англоязычной и франкоязычной Википедии. Автор эксперимента не упоминает поддержку русского языка. Для задач на русском стоит рассматривать отечественные мультимодальные модели через API (YandexGPT, GigaChat) или ждать появления открытых VLM с русскоязычными обучающими данными.

200 долларов за обучение, это реально мало?

Для визуально-языковой модели на 628 млн параметров это действительно скромный бюджет. Крупные VLM (от нескольких миллиардов параметров) обходятся в десятки и сотни тысяч долларов на вычисления. Но и результат соответствующий: модель описывает простые сцены, а не анализирует сложные изображения.

Зачем разбираться в архитектуре, если можно просто использовать готовые API?

Понимание устройства VLM помогает точнее формулировать промпты (запросы к модели), предсказывать ошибки и выбирать подходящий инструмент. Когда вы знаете, что визуальный энкодер разбивает картинку на 256 фрагментов и переводит их в числа, вы понимаете, почему модель может не заметить мелкую деталь на фото. Это практическое знание, а не академическое упражнение.

Полный цикл от идеи до работающей визуально-языковой модели за 200 долларов, с честным списком ошибок и открытым кодом: если вы давно хотели понять, как устроено «зрение» нейросетей, лучшей точки входа пока не появлялось.

Поделиться:TelegramVK
Игорь Градов
Игорь Градов

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».

Комментарии

Читайте также

Google подключила 70 языков к живому ИИ-переводу: искусственный интеллект заговорил офлайн
ai

Google подключила 70 языков к живому ИИ-переводу: искусственный интеллект заговорил офлайн

Компания Google представила обновлённую стратегию мультиязычного искусственного интеллекта, объединив в одном анонсе живой перевод на 70 языков, офлайн-модель…

6 мин
Как искусственный интеллект помогает обнаруживать лесные пожары
ai

Как искусственный интеллект помогает обнаруживать лесные пожары

Лесные пожары ежегодно уничтожают миллионы гектаров, и традиционные спутники обнаруживают возгорания, когда тушить уже поздно: данные устаревают на 11 и более…

5 мин
Как отключить Gemini на телефоне как голосовой помощник и настроить его для быта
ai

Как отключить Gemini на телефоне как голосовой помощник и настроить его для быта

Google Gemini уже умеет помогать не только на работе, а и в быту: от диагностики сломанного крана до списка продуктов по содержимому холодильника, и 4 июня…

6 мин