Поиск по изображениям решает, кого покажет ИИ: как проверить, что видит алгоритм
Поиск по изображениям перестал быть функцией для людей: ИИ-поисковики разбирают фотографии на математические токены (числовые коды, в которые модель превращает картинку), и от того, что машина «увидит» на снимке, зависит, попадёт ли ваш товар в ответ.

Google Lens обрабатывает около 20 млрд визуальных запросов в месяц (данные Google). Pinterest сообщает, что 30% всех поисков на платформе идут через камеру, и конверсия таких запросов на 62% выше текстовых. Фото на вашем сайте теперь работает не только на покупателя, но и на алгоритм, который решает, чей товар показать в ответе.
Визуальный поиск по изображениям давно вышел за рамки «найти похожую картинку». В Китае сервис Alibaba пропускает больше 10 млн визуальных запросов в день, превращая камеру телефона в кассу. Google в патенте, поданном в 2023 году и опубликованном в апреле 2026-го, описал механизм, при котором источник для ответа выбирается сначала по совпадению изображения, и лишь потом подтягивается окружающий текст. Энди Чедвик, обнаруживший патент, оговаривается: это заявка, а не подтверждённое поведение поисковика, Google подаёт тысячи подобных патентов, и многие не доходят до продакшена. Но направление очевидно: картинка становится входной точкой в ответ, а не иллюстрацией к тексту.
Для российских компаний это прямой сигнал. Если ваши фотографии товаров и услуг «молчат» для машины, поиск по изображениям обойдёт вас стороной, даже если снимки выглядят идеально для человека.
Что понадобится
- Google Cloud Vision API (есть бесплатный уровень до 1 000 запросов в месяц). Сервис доступен из РФ через VPN или прокси, но проще использовать его через облачный аккаунт с биллингом на зарубежную карту. Альтернатива для быстрой проверки: Яндекс.Облако Vision или бесплатный сервис Google Lens через браузер.
- Набор фотографий вашего продукта: главное фото карточки товара, лайфстайл-фото с сайта, стоковые изображения, которые вы используете.
- Текст страницы, на которой размещено фото: заголовок, описание, alt-тег картинки.
- Время: первый аудит одной страницы занимает 15 минут, дальше быстрее.
Как проверить, что ИИ видит на вашем фото?
Аудит строится вокруг двух вопросов, и оба критичны для поиска по изображениям.
Первый вопрос: что фактически изображено на снимке?
Это буквальный слой. На фото стоит кофеварка из нержавеющей стали с термокувшином. Видит ли это машина? Совпадает ли описание на странице с тем, что распознал алгоритм? Большинство сайтов проваливают уже здесь: текст писали «под настроение», а фото подбирали «под атмосферу», и между ними нет смысловой связи.
Второй вопрос: что фото подразумевает?
«Профессиональное рабочее пространство для команды» нельзя показать пальцем на снимке. Это смысл, который композиция несёт или не несёт. Человек считывает его интуитивно, машина раскладывает изображение на семантический остаток (набор значений, которые остаются после «разборки» картинки на объекты и связи между ними). Если задуманный вами посыл не совпадает с тем, что детектирует алгоритм, ответ ИИ-поисковика уйдёт к конкуренту.
Пример из источника: на фото были браслет, часы и кольцо. Алгоритм распознал браслет и часы, но кольцо пропустил. Если вы продаёте кольца, ваш товар для машины не существует.
Пошаговая инструкция: аудит изображений для ИИ-поиска
- Загрузите фото в Google Cloud Vision API (раздел Web Detection). Сервис вернёт четыре типа результатов:
fullMatchingImages(полные совпадения: кто ещё использует это же фото)partialMatchingImages(частичные совпадения: обрезанные версии)visuallySimilarImages(визуально похожие изображения)-
pagesWithMatchingImages(страницы с этим фото) -
Оцените уникальность. Если ваше «фирменное» фото нашлось на десятках чужих сайтов, это стоковый дубликат. ИИ-поисковику незачем выбирать именно вашу страницу. Замените на собственный снимок.
-
Запустите распознавание объектов (
OBJECT_LOCALIZATION). API вернёт список обнаруженных предметов с координатами и уровнем уверенности. Сравните этот список с тем, что вы продаёте. Товар отсутствует в списке? Машина его не видит. -
Проверьте «соседей» в кадре. Какие объекты оказались рядом с вашим продуктом? Если вы продаёте детскую мебель, а рядом стоит бутылка вина, алгоритм считает контекст, который вы не планировали.
-
Запустите анализ эмоций (
FACE_DETECTION, полеfaceAnnotations). Если в лайфстайл-фото есть люди, проверьте, какую эмоцию считывает модель. «Радость» в карточке стоматологии и «грусть» в карточке свадебного фотографа создают конфликт с задуманным посылом. -
Сопоставьте результат с текстом страницы. Alt-тег, заголовок и описание должны называть ровно то, что машина нашла на фото. Если API видит «thermal carafe», а alt-тег говорит «стильный аксессуар для кухни», связь разорвана.
Интернет-магазин посуды загрузил главное фото карточки товара «Чайник из нержавеющей стали, 1,5 л» в Google Cloud Vision API. Результат Web Detection: fullMatchingImages показал 47 страниц с тем же снимком, это оказался стоковый кадр с Shutterstock. Результат OBJECT_LOCALIZATION: API распознал «kettle» (уверенность 0,92) и «kitchen counter» (0,78), но не нашёл ни одного указания на материал или объём. Alt-тег на сайте: «красивый чайник купить». Ни «нержавеющая сталь», ни «1,5 литра» алгоритм не мог связать с картинкой. После замены на собственное фото с чётко видимой маркировкой и переписанным alt-тегом «чайник из нержавеющей стали 1,5 л на индукционной плите» API стал возвращать fullMatchingImages: 0 и корректный набор объектов.
Стоковые фото вместо своих. Если один и тот же снимок стоит на 50 сайтах, ИИ-поисковик не выделит ваш. Уникальное фото, первый и самый дешёвый шаг.
Alt-тег «для красоты». «Лучший подарок на Новый год» в alt-теге не сообщает машине ничего о предмете. Называйте объект, материал, назначение.
Лишние объекты в кадре. Фон, реквизит, случайные предметы попадают в распознавание и размывают смысл. ИИ не отличает декорацию от товара, он видит всё.
Текст страницы не совпадает с фото. Вы написали «офисное кресло для руководителя», а на фото, табуретка из коворкинга. Машина фиксирует разрыв и доверяет странице меньше.
Игнорирование эмоционального слоя. Лица на лайфстайл-фото несут эмоцию. Если модель считывает «удивление» там, где вы хотели «спокойствие», посыл искажён.
Что делать прямо сейчас, по ролям
Автору на Дзене. Проверьте обложки своих статей через Google Lens или Яндекс.Картинки обратным поиском. Если обложка стоковая и встречается на десятках страниц, замените на свою. Для ИИ-выдачи уникальность изображения начинает весить не меньше, чем уникальность текста.
Маркетологу. Внесите в бриф для фотографа и дизайнера новый пункт: «что должен распознать алгоритм». Не «настроение бренда», а конкретный список объектов, которые обязаны попасть в кадр и совпасть с текстом карточки. Один прогон через Vision API покажет, видит ли машина ваш продукт.
Предпринимателю в РФ. Google Cloud Vision API работает, но требует обходных путей для оплаты. Для быстрого старта: Яндекс Vision (входит в Яндекс.Облако, оплата в рублях) умеет распознавать объекты и текст на изображениях. Полноценного аналога Web Detection (кто ещё использует ваше фото) в российских сервисах пока нет, здесь выручает обратный поиск по картинкам в Яндексе.
Патент Google, о котором идёт речь, пока не стал рабочей функцией поисковика, и Чедвик прямо об этом предупреждает. Но 20 млрд визуальных запросов в месяц через Google Lens (данные Google) и 30% камерных поисков на Pinterest (данные Pinterest) уже факт. По моим наблюдениям, большинство российских интернет-магазинов до сих пор ставят стоковые фото, которые одновременно стоят у пяти конкурентов. Это было неважно, пока поиск по изображениям оставался нишевым. Сейчас он массовый, и машина выбирает источник по картинке. Не нужно ждать, пока патент станет продакшеном: просто замените стоки на свои снимки и убедитесь, что текст вокруг фото описывает то, что на нём изображено. Это бесплатно и работает уже сегодня.
Честная оговорка: Vision API не покажет, как именно ранжирует Google или Яндекс. Он покажет, что видит машина. Между «увидел» и «поставил первым в выдачу» лежит чёрный ящик, на который вы повлиять не можете. Но на входной сигнал, саму картинку и её контекст, повлиять можно прямо сейчас.
Визуальный поиск по изображениям забрал у текста монополию на попадание в ответ ИИ. Сделайте одно действие сегодня: возьмите главное фото своего продукта, загрузите в Google Lens или Яндекс.Картинки и посмотрите, что вернётся. Если машина не узнала ваш товар, покупатель его тоже не увидит.

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».
Читайте также

ИИ для удаления водяных знаков с видео не спасёт: Google штрафует за пустоту, а не за инструмент
Споры о водяных знаках в ИИ-контенте вспыхнули после того, как Anthropic объявила о машиночитаемой маркировке текстов, созданных Claude, и теперь авторам важно…

ChatGPT сам выбирает сабреддит и цитирует посты: 68% ссылок ведут на Reddit
ChatGPT на этой неделе сам выбрал конкретное сообщество Reddit по названию, запросил из него десять лет обсуждений и вернул 48 тредов из 71 результата, отдав…

ChatGPT получил WebMCP: теперь web-сайт сам решает, что ИИ-агент может делать
ChatGPT второго июля получил поддержку WebMCP (протокола, через который сайт сам сообщает ИИ-агенту, какие действия на нём разрешены) в настольном приложении,…
Комментарии