Игорь Градов
Игорь Градов
5 мин
ai

Яндекс взял Best Paper на ICML 2026: что arxiv препринты не расскажут о конференции

Мне предоставлен обрезанный оригинал — текст обрывается на середине предложения. Работаю строго по тому, что есть.

Яндекс взял Best Paper на ICML 2026: что arxiv препринты не расскажут о конференции

Карина Романова, разработчик Яндекса и участник команды LLM-агентов (программ, которые сами выполняют цепочки действий) в Алисе, в июле 2026 года побывала на конференции ICML 2026 в Сеуле и рассказала, чем живёт мировое ML-сообщество и какие работы Яндекса вызвали наибольший отклик.

Почему это важно

Яндекс представил на ICML 2026 шестнадцать исследований, одно из которых получило Best Paper Award на воркшопе по графовым моделям, а другое удостоено статуса Spotlight, и это редкий случай, когда русскоязычный автор делится деталями конференции, которых нет в arxiv препринтах.

ICML (International Conference on Machine Learning) считается одной из крупнейших площадок в области машинного обучения. Конференция прошла с 6 по 11 июля 2026 года в выставочном центре COEX в Сеуле. По данным Карины Романовой, в этом году было подано 23 918 заявок в основной трек, из которых приняли 6 352 работы. Публикация на arXiv и открытый код на GitHub не заменяют живого общения: как отмечает автор, пятиминутный разговор у постера иногда даёт больше, чем часовой доклад.

Что Когда Кто выпустил Цена
ICML 2026, конференция по машинному обучению 6–11 июля 2026, Сеул Сообщество ML, организаторы ICML Не указана в источнике
16 исследований Яндекса (8 в основном треке, 8 на воркшопах) Июль 2026 Yandex Research, ШАД, команда Алисы Доступны как arxiv препринты

Какие работы Яндекса заметили на конференции?

  • Ускорение графовых нейросетей (GNN). Статья On Efficient Scaling of GNNs via IO-Aware Layers Implementations от ШАД и Yandex Research получила статус Spotlight. Авторы обнаружили, что GNN (графовые нейросети, модели для данных в виде связей и узлов, например социальных графов) чаще упираются не в вычисления, а в память GPU и скорость передачи данных. Кастомные GPU-ядра ускорили модель GATv2 до 8,5 раза по сравнению с библиотекой DGL, а пиковое потребление памяти снизилось до 76 раз.

  • GraphPFN: универсальная модель для графов. Статья GraphPFN: A Prior-Data Fitted Graph Foundation Model вошла в основной трек и получила Best Paper Award на воркшопе Graph Foundation Models. Модель предобучают на миллионах синтетических графов, после чего она работает с реальными данными сразу, без долгого дообучения (fine-tuning, обучение модели на ваших примерах под узкую задачу), в режиме in-context learning (когда модель учится прямо из примеров в промпте, без изменения своих весов).

  • Геометрия весов при обучении рассуждениям. Совместная работа с Владимиром Платоновым (Head of Alice AI) и Keenable.ai сравнила шесть методов офлайн-обучения рассуждающих моделей не по итоговой точности, а по тому, как каждый метод меняет саму структуру модели. Выяснилось, что метод DPO (Direct Preference Optimization, способ обучения модели предпочтениям человека) занимает почти отдельное подпространство и показал лучшую точность в протоколе эксперимента.

Зачем это знать, если arxiv препринты и так доступны?

Романова прямо отвечает на этот вопрос: arxiv препринты дают текст, но не дают контекст. Детали, которых нет в опубликованных статьях, всплывают в разговорах у постеров и на панельных дискуссиях. Например, Людмила Прохоренкова из Yandex Research участвовала в панели о будущем графовых foundation-моделей вместе с исследователями из RWTH Aachen, Georgia Tech и Arizona State University, и содержание таких бесед в публикации не попадает.

Ещё одно наблюдение из источника: заметная часть разговоров на конференции вращалась вокруг ИИ-агентов (agent, программа, которая сама планирует и выполняет шаги для решения задачи). Это совпадает с тем, чем занимается команда Романовой в Алисе.

Как попробовать разобраться самому?

  1. Найдите arxiv препринты трёх описанных работ по названиям: On Efficient Scaling of GNNs via IO-Aware Layers Implementations, GraphPFN: A Prior-Data Fitted Graph Foundation Model, Weight-Space Geometry of Offline Reasoning Training. Все три доступны бесплатно на arXiv.
  2. Посмотрите код на GitHub, если авторы его опубликовали, ссылки обычно указаны в самих препринтах.
  3. Для понимания контекста графовых нейросетей начните с объяснения FlashAttention, на идеи которого опирается первая работа: это подход, когда вычисления перестраивают так, чтобы данные реже «ездили» между быстрой и медленной памятью GPU.

Есть ли что-то похожее в России?

Яндекс сам и есть российский участник: все три выделенные работы подготовлены Yandex Research, ШАД и командой Алисы. Для тех, кто работает с российскими языковыми моделями, полезно знать, что методы оптимизации GPU из первой статьи применимы не только к графовым сетям, а принципы из третьей работы касаются дообучения любых моделей, включая YandexGPT.

GigaChat (Сбер) и YandexGPT пока не публиковали сопоставимых исследований на ICML 2026, по крайней мере, в источнике об этом ничего не сказано.

Что с этого прямо сейчас, по ролям?

Автору Дзена. Тема ИИ-агентов снова в фокусе мирового ML-сообщества. Если пишете про нейросети, материал Романовой даёт конкретные названия работ и терминов, которые можно разобрать для читателей.

Маркетологу. Ускорение графовых нейросетей напрямую влияет на рекомендательные системы и персонализацию. Когда GNN работает в 8,5 раза быстрее при меньшем расходе памяти, рекомендации дешевеют и ускоряются.

Предпринимателю в РФ. Яндекс публикует результаты открыто, значит, выводы из этих работ можно учитывать при выборе стека. GraphPFN работает «из коробки» без долгого дообучения, и это снижает порог входа для компаний, работающих с графовыми данными (логистика, соцсети, финтех).

Мнение редакции dzen.guru

Статья Романовой ценна не столько пересказом arxiv препринтов, сколько живым взглядом изнутри. По моим наблюдениям, такие отчёты от русскоязычных участников крупных конференций появляются редко, и каждый из них экономит часы самостоятельного разбора. Результат по GNN (ускорение до 8,5 раза) выглядит убедительно, но важно помнить: это лабораторные замеры на конкретных графах, в продакшене числа будут другими. Что сделать сегодня: откройте arxiv препринт первой статьи, прочитайте раздел с экспериментами и прикиньте, применимы ли IO-aware-оптимизации к вашим задачам. Если работаете с рекомендациями или графами, это может сэкономить GPU-часы уже в ближайшем квартале.

Частые вопросы

Нужно ли платить за доступ к этим исследованиям?

Нет. Все описанные работы доступны как arxiv препринты бесплатно. Код, если авторы его выложили, тоже открыт на GitHub.

Можно ли применить результаты, не будучи ML-инженером?

Напрямую воспроизвести эксперименты без технической подготовки не получится. Но понимание выводов полезно: если вы заказываете разработку рекомендательной системы или работаете с подрядчиками, знание того, что GNN можно ускорить в разы за счёт оптимизации памяти, а не наращивания GPU, помогает задавать правильные вопросы исполнителям.

Будут ли эти методы встроены в продукты Яндекса?

В источнике об этом прямо не сказано. Однако авторы работают в Yandex Research и команде Алисы, что делает внедрение вероятным. Конкретных сроков и планов компания не называла.

Поделиться:TelegramVK
Игорь Градов
Игорь Градов

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».

Комментарии

Читайте также

DLSS Nvidia удваивает FPS без новой видеокарты: как включить и настроить
ai

DLSS Nvidia удваивает FPS без новой видеокарты: как включить и настроить

Технология DLSS от Nvidia появилась в 2018 году и за несколько лет изменила подход к производительности в играх и рабочих приложениях, а сейчас, когда…

7 мин
Машинное обучение в финансах: как устроен пайплайн на данных Мосбиржи, который можно повторить
ai

Машинное обучение в финансах: как устроен пайплайн на данных Мосбиржи, который можно повторить

Машинное обучение на данных Мосбиржи: как один эксперимент устроен изнутри, от сбора данных до модели, и что из этого можно повторить самому. Почему это важно…

7 мин
LLM и база данных на 253 таблицы: схема целиком в промпте обошлась в 110 рублей и победила
ai

LLM и база данных на 253 таблицы: схема целиком в промпте обошлась в 110 рублей и победила

Текст оригинала обрывается на полуслове, поэтому я работаю строго с тем, что передано. Ни одного факта за пределами источника не добавляю. Крупная финтех-база…

6 мин