Игорь Градов
Игорь Градов
5 мин
ai

Языковые модели Rust получили бенчмарк из 100 реальных задач: модель на 0,5B обходит втрое крупнее

Языковые модели Rust получили специализированный бенчмарк, который проверяет не алгоритмические задачки из Python, а реальный повседневный код: трейты, структуры с методами, обработку ошибок через Result и работу с популярными крейтами (библиотеками).

Почему это важно

Разработчик дообучил (обучил на своих примерах под узкую задачу) модель всего в 0,5 миллиарда параметров и показал, что она обходит модели втрое крупнее на задачах, написанных специально для Rust, а не переведённых с Python.

До сих пор крошечные языковые модели Rust оценивались на наборах MultiPL-E, которые просто переводят алгоритмические задачи HumanEval и MBPP с Python. В реальном коде на Rust почти не встречаются голые функции над числами и списками, зато постоянно используются структуры с методами, перечисления, итераторы и внешние библиотеки. Автор модели Temper 0.5B, независимый разработчик, собрал собственный бенчмарк из 100 задач трёх уровней и опубликовал результаты сравнения с несколькими открытыми моделями того же класса.

Что Когда Кто выпустил Цена
Temper 0.5B и бенчмарк из 100 Rust-задач дату автор не назвал независимый разработчик, база Qwen2.5-Coder-0.5B-Instruct бесплатно, открытая модель

Что умеет Temper 0.5B и чем отличается от базы?

  • Узкая специализация на Rust. Модель дообучена на 10 000 примеров, сгенерированных DeepSeek-V4-Flash. Около 60% сгенерированных примеров прошли компиляцию и тесты, остальные отсеяны.
  • Дообучение с подкреплением (RL). После основного обучения модель писала по несколько решений каждой задачи и получала награду за те, что проходили тесты.
  • Рост на классических бенчмарках. На humaneval-rs доля задач, решённых с первой попытки, выросла на 7,6 пункта по сравнению с первой версией, на mbpp-rs на 7,9 пункта.
  • Собственный бенчмарк из 100 задач. Три уровня: 50 тривиальных (короткая функция над числами, строками, Option и Result), 30 простых (структура с методами, HashMap, итераторы, оператор ?) и 20 средних (крейты axum, serde, tokio, clap, regex, thiserror, потоки и времена жизни).
  • Первая версия уже удваивала результат. На простых задачах внутреннего набора первая версия Temper решала 34,3% задач с первой попытки против 15,0% у базовой Qwen2.5-Coder-0.5B.

Бенчмарк проверяет то, из чего состоит реальный Rust-код

Автор прямо объясняет, почему существующие бенчмарки не подходят: MultiPL-E переводит на Rust задачи, исходно написанные для Python. Структуры с методами, трейты (аналог интерфейсов), обработка ошибок через Result и работа с крейтами (внешними библиотеками) в них почти не встречаются.

В новом бенчмарке каждая задача состоит из просьбы обычным текстом, публичного интерфейса и скрытых тестов. Модель возвращает полный код, он компилируется вместе с тестами, и задача засчитывается, только если проходят все. Тесты, которые модель напишет сама, на результат не влияют.

Среди сравниваемых моделей, кроме линейки Qwen (от 0.5B до 3B в версиях Instruct), были две открытые модели, дообученные на Rust другими авторами: ThoxEdge-RustCoder-0.5B от THOX.ai (та же база, обучена на открытом датасете Strandset-Rust-v1) и rust-mentor-0.6b (из Qwen3-0.6B через QLoRA, задумана как помощник для изучения Rust). Обе проверялись без системного промпта (начальной инструкции для модели) и без режима рассуждений.

Как попробовать?

  1. Скачайте модель Temper 0.5B из открытого репозитория автора (конкретную ссылку автор в материале не указал, ищите по названию Temper 0.5B).
  2. Запустите локально: модель в 0,5 миллиарда параметров работает на обычном ноутбуке без мощной видеокарты.
  3. Протестируйте на своих задачах: попросите модель написать структуру с методами или обработку ошибок, именно на таких задачах она показывает лучший результат по сравнению с базой.

Есть ли российские аналоги для работы с кодом?

Для русскоязычных разработчиков на Rust доступных специализированных моделей пока нет. YandexGPT и GigaChat умеют генерировать код, но не специализируются на Rust и не проходили подобных бенчмарков. Temper 0.5B, как открытая модель, запускается локально без ограничений по региону, это её главное преимущество для разработчиков из РФ и СНГ.

Параметр Temper 0.5B YandexGPT / GigaChat
Специализация на Rust да, дообучена на 10 000 Rust-примеров нет, универсальные модели
Размер 0,5 млрд параметров, запуск на ноутбуке облачные, через API
Бенчмарк на реальном Rust-коде проверена на собственном наборе из 100 задач данных о проверке на Rust нет
Доступ из РФ без ограничений, открытые веса полный доступ

Что это даёт лично вам?

Разработчику на Rust. Впервые есть бенчмарк, который проверяет не алгоритмические задачки, а то, что вы пишете каждый день: структуры, трейты, обработку ошибок. Если вы выбираете модель-помощника для Rust, теперь можно сравнивать по делу.

Автору на Дзене, пишущему про код и технологии. Кейс Temper показывает: маленькая дообученная модель бьёт модели втрое крупнее на узкой задаче. Это готовый сюжет для поста про эффективность дообучения.

Предпринимателю, который думает об ИИ в разработке. Модель бесплатная и работает локально. Если команда пишет на Rust, это способ дать разработчикам ИИ-помощника без подписок и без отправки кода на чужие серверы.

Мнение редакции dzen.guru

Проект Temper 0.5B ценен не столько самой моделью, сколько подходом. Автор показал, что дообучение крошечной модели на 10 000 качественных примерах с подкреплением даёт результат, сопоставимый с моделями в три раза крупнее. Для русскоязычного сообщества Rust это пока единственный бенчмарк, где проверяются структуры, трейты и крейты, а не переведённые с Python задачки на сортировку.

Оговорка: автор не опубликовал полные таблицы результатов в том фрагменте, который мы получили (текст обрывается на разделе «Ограничения и планы»). Что модель пока не умеет, мы не знаем. Относитесь к цифрам как к результатам на конкретных наборах, а не как к гарантии качества на вашем проекте.

Что сделать сегодня: скачайте Temper 0.5B и прогоните на трёх-четырёх своих типичных задачах. Если результат устроит, вы получите бесплатного локального помощника без зависимости от API и облака.

Частые вопросы

Нужна ли мощная видеокарта для запуска Temper 0.5B?

Нет. Модель содержит 0,5 миллиарда параметров, это один из самых компактных размеров. Она запускается на обычном ноутбуке, мощная видеокарта не обязательна.

Чем этот бенчмарк отличается от MultiPL-E?

MultiPL-E переводит на Rust задачи, написанные для Python: алгоритмические функции над числами и списками. Бенчмарк автора Temper содержит 100 задач, построенных вокруг реального Rust-кода: структуры с методами, трейты, обработка ошибок, работа с крейтами axum, serde, tokio и другими.

Подходит ли Temper 0.5B для других языков программирования?

Модель дообучена именно на Rust. Для других языков базовая Qwen2.5-Coder-0.5B-Instruct, на которой построена Temper, может подойти лучше. Специализация, это одновременно сильная сторона и ограничение: модель хороша в том, на чём училась, и слабее за пределами этой области.

Поделиться:TelegramVK
Игорь Градов
Игорь Градов

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».

Комментарии

Читайте также

ai

Отношение людей к искусственному интеллекту: 1 млрд пользователей ChatGPT и рекордный негатив одновременно

Третьего июня 2025 года MIT Technology Review зафиксировал парадокс, который определяет отношение людей к искусственному интеллекту прямо сейчас: большинство…

5 мин
OpenBPM 2.0 на Spring Boot 4: бесплатная замена Camunda 7 с совместимостью по данным и API
ai

OpenBPM 2.0 на Spring Boot 4: бесплатная замена Camunda 7 с совместимостью по данным и API

Почему это важно Российский BPM-движок OpenBPM Engine обновился до версии 2.0 на базе Spring Boot 4, который вышел только в ноябре 2025 года, и это первый…

5 мин
Художник встроил Gemini в виртуальный мир и скульптуру: ИИ как соавтор, а не кнопка
ai

Художник встроил Gemini в виртуальный мир и скульптуру: ИИ как соавтор, а не кнопка

Почему это важно Греческий художник показал, как Gemini от Google работает не в роли «кнопки для картинки», а как полноценный участник мультидисциплинарной…

4 мин