Microsoft открыла TauGrid: пять инструментов для Kubernetes GPU в одном Helm-чарте
Microsoft 28 августа 2026 года выложила в открытый доступ TauGrid, платформу, которая заменяет пять отдельных инструментов для запуска ИИ-задач на Kubernetes с GPU одной командой установки.
Команды, которые запускают обучение нейросетей на GPU-кластерах через Kubernetes, обычно склеивают очередь задач, среду выполнения, мониторинг видеокарт, дашборды и скрипты вручную. TauGrid сводит всё это в один Helm-чарт (пакет для установки в Kubernetes) и не требует подписки на Azure.
До сих пор инженерная команда Azure Kubernetes Service (AKS, управляемый Kubernetes от Microsoft) развивала инструменты для GPU-нагрузок внутри облака. Теперь код опубликован на GitHub под лицензией MIT, то есть его можно ставить на любой Kubernetes-кластер версии 1.30 и выше, включая локальные серверы. Источник новости, блог AKS Engineering и репозиторий Azure/taugrid.
| Что | Когда | Кто выпустил | Цена |
|---|---|---|---|
| TauGrid, платформа для запуска ИИ-задач на Kubernetes GPU | 28 августа 2026 | Инженерная команда AKS (Microsoft) | Бесплатно, лицензия MIT |
Что входит в один пакет?
- CLI-утилита tau. Исследователь описывает задачу в файле tau.yaml, указывает число GPU, объём памяти и Docker-образ. Kubernetes напрямую настраивать не нужно.
- Очередь задач через Kueue. Когда несколько команд делят кластер, задачи попадают в общую очередь. Kueue (система приоритетов и квот для Kubernetes GPU) решает, кого пустить первым и на какие свободные видеокарты.
- Оркестрация через KubeRay. Распределённые задачи на фреймворке Ray запускаются автоматически, без ручной настройки кластера Ray.
- Мониторинг здоровья GPU на уровне узла. Платформа проверяет состояние видеокарт до того, как задача на них попадёт.
- Записи Evidence. Каждый запуск сохраняет конфигурацию, логи, метрики, чекпойнты (контрольные точки для возобновления) и историю выполнения. Это делает эксперимент воспроизводимым: через месяц можно поднять точно те же условия и получить тот же результат.
- Восстановление при сбое. Платформа умеет повторять задачу, возобновлять с чекпойнта и диагностировать причину падения.
Зачем это нужно вне Azure?
Два технических факта, которые определяют, стоит ли пробовать TauGrid в локальном ЦОДе.
Первый: TauGrid по умолчанию не отправляет телеметрию в Microsoft. Экспорт данных наружу остаётся выключенным, пока администратор сам не укажет адрес назначения.
Второй: часть интеграций пока привязана к Azure. В первую очередь это наблюдаемость (observability) через Azure Data Explorer. Разработчики заявляют, что цель проекта, поддержка и облачных, и локальных Kubernetes-кластеров без зависимости от Azure. Код открыт, и Microsoft принимает сторонние доработки.
Как попробовать?
- Убедитесь, что у вас Kubernetes 1.30 или новее с GPU-узлами, установлены kubectl и Helm версии 3.0+.
-
Установите TauGrid одной командой Helm:
helm install taugrid oci://mcr.microsoft.com/aks/ai-runtime/helm/taugrid --version 0.4.2 --namespace tau-system --create-namespace -
Скачайте CLI tau из GitHub Releases (Linux, macOS; для Windows есть PowerShell-установщик, который проверяет контрольную сумму).
- Создайте файл tau.yaml с описанием задачи и запустите
tau run. Пример Microsoft использует PyTorch на одной видеокарте A100.
Microsoft рекомендует указывать конкретные версии образов (или неизменяемые дайджесты), а не тег latest. Образы лежат в публичном Microsoft Container Registry.
Прямого аналога в России пока нет
Ни «Яндекс», ни SberCloud на момент публикации не предлагают открытого инструмента, который объединял бы очередь GPU-задач, оркестрацию Ray и мониторинг здоровья видеокарт в одном Helm-чарте. Российские облачные Kubernetes-сервисы (Yandex Managed Service for Kubernetes, SberCloud Kubernetes) позволяют запускать GPU-контейнеры, но оркестрацию и очереди приходится настраивать отдельно. TauGrid можно поставить на любой кластер, в том числе развёрнутый в российском ЦОДе, привязки к Azure нет, но блок наблюдаемости через Azure Data Explorer пока придётся заменять самостоятельно.
Что делать с этим по ролям?
Инженеру, который администрирует Kubernetes GPU. Попробуйте развернуть TauGrid в тестовом кластере. Одна команда Helm заменяет ручную сборку из Kueue, KubeRay, скриптов мониторинга и дашбордов. Если у вас локальный ЦОД, обратите внимание: наблюдаемость без Azure Data Explorer потребует доработки.
Исследователю и ML-инженеру. Вы описываете задачу в tau.yaml и не трогаете Kubernetes напрямую. Записи Evidence позволяют вернуться к любому запуску через месяцы и воспроизвести условия.
Предпринимателю. Если ваша команда тратит недели на склейку инфраструктуры для обучения моделей, TauGrid может сократить этот этап. Лицензия MIT, платить не нужно. Привязки к подписке Azure нет, что снижает риск зависимости от зарубежного облака.
Открытие TauGrid выглядит как продуманный ход: Microsoft отдаёт инфраструктурный слой бесплатно, чтобы сообщество привыкало к экосистеме AKS. Привязка наблюдаемости к Azure Data Explorer, мягкий замок, который может со временем стать жёстче, если сообщество не допишет альтернативу. По моему опыту, главная боль команд, работающих с Kubernetes GPU в России, не установка, а отладка при сбоях видеокарт и воспроизводимость экспериментов. Записи Evidence закрывают вторую задачу. Первую, мониторинг здоровья GPU, стоит проверить на реальном железе: документация обещает, но насколько хорошо это работает вне A100, пока неясно. Рекомендую сегодня развернуть TauGrid в тестовом кластере и прогнать простой PyTorch-пример из репозитория, чтобы оценить, заменяет ли он вашу текущую связку.
Частые вопросы
TauGrid работает только в облаке Azure?
Нет. Платформа ставится на любой Kubernetes-кластер версии 1.30+ с GPU-узлами. Привязки к Azure нет, кроме блока наблюдаемости через Azure Data Explorer, который можно не подключать или заменить.
Нужно ли платить за использование?
TauGrid распространяется бесплатно под лицензией MIT. Образы контейнеров и Helm-чарты лежат в публичном Microsoft Container Registry.
Какие видеокарты поддерживаются?
Опубликованный пример Microsoft использует A100. Документация заявляет поддержку Kubernetes GPU-узлов в целом, но конкретный список совместимых видеокарт на момент публикации не приводится. Перед установкой стоит проверить совместимость именно вашего железа в репозитории Azure/taugrid на GitHub.

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».
Читайте также

FAA запускает искусственный интеллект в авиации: ИИ будет вести трафик 29 млн кв. миль
FAA, Федеральное управление гражданской авиации США, запускает систему SMART, которая использует модели искусственного интеллекта для прогнозирования…

Серверные процессоры, SSD на 30 ГБ/с и память с вычислениями: главное с Hot Chips 2026
Компания Kioxia представила серию GP1 — накопители формата SLC, рассчитанные на работу в связке с GPU-ускорителями. Почему это важно Август 2026 года принёс…

Профсоюзы Голливуда закрепили риски искусственного интеллекта в контрактах, студии промолчали
Компания The Verge опросила крупнейшие голливудские студии и профсоюзы о рисках искусственного интеллекта после волны предупреждений от исследователей, и…
Комментарии