Парсинг сайта на Python за 30 минут: нейросеть пишет код, непрограммист запускает
Автор Хабра, переводчик и штангист-любитель, показал на практике, как написать парсер интернет-магазина спортпита на Python с помощью нейросети Qwen и за пару минут собрать данные, на ручной сбор которых уходили часы.

Парсинг сайта на Python перестал требовать глубоких навыков программирования: нейросеть помогает написать рабочий скрипт даже непрограммисту, а результат можно скормить другой нейросети для анализа.
История началась с книги о силовых тренировках «The Barbell Prescription» Энди Бейкера и Джонатона Салливана. Автор узнал, что годами покупал неправильный протеин: гидролизат коллагена вместо сывороточного белка. Чтобы выбрать подходящий вариант на сайте badrazves.ru, он решил не листать три страницы каталога вручную, а спарсить все 45 товаров и отдать список нейросети для анализа по составу, цене и проценту белка. Подход описан в публикации на Хабре.
Зачем парсить, если можно просто смотреть глазами?
Ручное сравнение 45 карточек товаров на медленном сайте занимает часы. Парсинг сайта на Python позволяет за пару минут собрать название, цену и описание каждой позиции в структурированный файл (CSV или JSON), а затем передать его нейросети с конкретным запросом: «выбери сывороточный изолят до определённой цены с максимальным процентом белка».
Автор не программист, он переводчик. Код писался совместно с нейросетью Qwen. Это снижает порог входа до уровня «умею поставить Python и запустить скрипт из терминала».
Что понадобится
- Python 3 (любая актуальная версия)
- Библиотеки requests и BeautifulSoup4 (bs4) для загрузки и разбора HTML-страниц
- Доступ к нейросети для написания кода (автор использовал Qwen, подойдёт любая: ChatGPT, GigaChat, YandexGPT)
- Терминал или командная строка
- 30 минут на настройку и первый запуск
Пошаговая инструкция
-
Разберитесь в структуре целевого сайта. Откройте нужную категорию в браузере. Проверьте, как работает пагинация (переключение страниц): если в адресной строке появляется параметр
?page=2,?page=3, значит, скрипту не придётся имитировать клики. Убедитесь, что текст товаров находится в HTML как текст, а не как картинки. На сайте badrazves.ru названия товаров лежат внутри обычных ссылок<a href="...">Название</a>. -
Проверьте файл robots.txt. Откройте
адрес-сайта/robots.txtи убедитесь, что парсинг публичных страниц не запрещён. Между запросами к серверу ставьте паузу (автор использовал 0,5 секунды), чтобы не создавать лишнюю нагрузку. -
Установите библиотеки. В терминале выполните:
pip install requests beautifulsoup4
- Создайте файл парсера. Сохраните скрипт, например, как
protein_parser.py. Основная логика: - Создать сессию с настройками повторных попыток (retry) и пользовательским заголовком User-Agent
- Пройти по каждой странице категории, собирая ссылки на товары
- Для каждого товара загрузить страницу, извлечь название, цену и описание
- Сохранить результат в CSV и JSON
import requests
from bs4 import BeautifulSoup
import time
import csv
base_url = "https://badrazves.ru/sport/protein/"
products = []
for page in range(1, 4): # три страницы каталога
url = f"{base_url}?page={page}"
response = requests.get(url)
soup = BeautifulSoup(response.text, "html.parser")
for link in soup.select("a[href]"):
# логика фильтрации ссылок на товары
pass
time.sleep(0.5) # пауза между запросами
-
Попросите нейросеть доработать скрипт под ваш сайт. Скопируйте HTML-код одной карточки товара и отправьте нейросети с промптом (промпт, текстовая инструкция для нейросети): «Напиши функцию, которая из этого HTML извлекает название, цену и описание товара». Автор статьи именно так работал с Qwen.
-
Запустите парсер и проверьте результат:
python protein_parser.py
python protein_parser.py --details --format json
Скрипт создаст файлы proteins.csv и proteins.json со всеми товарами.
- Передайте собранные данные нейросети для анализа. Загрузите CSV или JSON в чат и задайте конкретный вопрос: «Выбери сывороточный концентрат или изолят с содержанием белка выше 80%, отсортируй по цене за грамм белка».
Автор спарсил 45 товаров из категории «Белки» на badrazves.ru. Скрипт прошёл три страницы каталога, собрал названия, цены и описания, записал всё в CSV. Затем передал файл нейросети с просьбой отобрать сывороточные варианты с лучшим соотношением цены и содержания белка. Вместо нескольких часов ручного сравнения весь процесс занял пару минут.
Ключевое наблюдение автора: гидролизат коллагена, который он покупал годами, оказался неполноценным белком с низким содержанием лейцина (аминокислота, запускающая синтез мышечного белка). Сывороточный концентрат или изолят (очищенная форма с содержанием белка до 90%) дешевле и работают лучше. Без парсинга и анализа нейросетью он бы продолжал ошибаться.
- Игнорирование robots.txt и этикета. Не ставите паузу между запросами и сервер блокирует ваш IP. Автор использовал задержку 0,5 секунды и обращался только к публичным страницам.
- Парсинг картинок вместо текста. На некоторых сайтах названия товаров зашиты в изображения. Проверяйте структуру HTML до написания кода, иначе скрипт вернёт пустые строки.
- Хрупкие селекторы. Если сайт обновит верстку, скрипт сломается. Не полагайтесь на один CSS-класс: проверяйте результат после каждого запуска.
- Одна нейросеть на всё. Для написания кода автор использовал Qwen, но для анализа данных может подойти другая модель. В РФ доступны YandexGPT и GigaChat, они справятся с задачей «выбери лучший товар из таблицы».
Что делать с этим прямо сейчас?
Авторам Дзена. Парсинг сайта на Python открывает формат, который хорошо заходит: «я непрограммист, но решил задачу кодом с помощью нейросети». Покажите свой реальный кейс с конкретным результатом, как это сделал автор исходной статьи.
Маркетологам. Можно собирать цены конкурентов, ассортимент, наличие товаров на отечественных площадках. Скрипт из статьи адаптируется под любой сайт на OpenCart (один из популярных бесплатных движков для интернет-магазинов) с минимальными правками.
Предпринимателям. Подход работает с российскими e-commerce сайтами без ограничений. Нужен только Python и доступ к нейросети. Если нет своего разработчика, весь код пишет нейросеть по вашему описанию задачи.
Этот кейс ценен не кодом, а подходом. Человек без навыков программирования решил бытовую задачу (выбор протеина) через цепочку: нейросеть пишет код, код собирает данные, другая нейросеть анализирует результат. По моим наблюдениям, 80% «ручной» работы с каталогами и прайсами решается именно так. Честная оговорка: скрипт привязан к конкретной верстке сайта. Если badrazves.ru обновит дизайн, парсер перестанет работать и потребует правок. Универсального решения «один раз написал, работает вечно» не существует.
Попробуйте AI-инструменты dzen.guru
Подборка нейросетей и промптов для авторов, которые хотят автоматизировать рутину без навыков программирования
Перейти к инструментамПарсинг сайта на Python с нейросетью в роли соавтора кода стирает границу между «умею программировать» и «не умею». Если у вас есть задача, которую лень делать руками, попробуйте описать её нейросети и попросить написать скрипт. Результат, скорее всего, вас удивит.

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».
Читайте также

Большие языковые модели пропускают джейлбрейки: какие риски это создаёт и как защититься
Большие языковые модели (LLM, нейросети, которые генерируют текст и код по запросу) обучены отказывать на опасные вопросы, но злоумышленники научились обходить…

Self hosted LLM vs облако: год в Selectel показал, когда своя модель выгоднее API
Контекст — это не про IQ модели, а про безопасность данных: если код нельзя отправить наружу, выбор делается не между «лучшей» и «худшей» моделью, а между…
OpenAI впервые остановила новую модель: та научилась взламывать системы без человека
OpenAI второго июня приостановила внутреннюю разработку новой модели Astra, которая по результатам собственных проверок компании может обладать критическими…
Комментарии