Парсер сайтов: как устроен, сколько стоит и что законно
← Все материалы
Разбор

Парсер сайтов: как он работает, что стоит и где граница закона

Парсер сайтов — программа, которая открывает страницы вместо человека, достаёт нужные поля (цены, остатки, характеристики) и складывает результат в таблицу, базу или сразу в вашу систему. Ниже — как он устроен, чем облачный сервис отличается от своего кода, что можно собирать по закону и когда парсер заказывать не стоит.

3–10 днейот задачи до парсера, работающего по расписанию
от 25 000 ₽парсер одного источника с выгрузкой в таблицу
1–2 запр/свежливая скорость, которую сайт не замечает

Как работает парсер сайтов

Любой парсер делает три вещи: обходит страницы, извлекает поля и доставляет результат туда, где с ним работают люди. Остальное — обвязка вокруг этих шагов.

Список адресовЗагрузка страницРазбор HTMLПроверка полейВыгрузка втаблицу
Путь одной страницы — от адреса до строки в вашей выгрузке

Простая часть — найти блок с ценой и забрать текст. Сложности начинаются там, где сайт живой. Что ломает парсеры чаще всего:

Из чего состоит парсер, который живёт дольше месяца

Скрипт «на один раз» пишется за час. Разница с рабочим парсером — в слоях, отвечающих за повторяемость: чтобы завтра он запустился сам, а если сломался — вы об этом узнали.

Расписание: когда и какие источники обходимТранспорт: запросы, прокси, повторы, ограничение скоростиРазбор: правила извлечения отдельно от кода загрузкиПроверка: схема полей, пустые значения, аномалии ценХранение: сырые страницы плюс чистая таблицаДоставка: Excel, Google Sheets, база, API, CRM
Уберите любой слой — через месяц парсер молча отдаёт мусор

Две ключевые детали. Правила разбора хранятся отдельно от кода — при смене вёрстки правится строка конфига, а не программа. И сырые страницы сохраняются: если через неделю понадобится ещё и артикул производителя, его достанут из скачанного, а не пойдут обходить сайт заново.

Слой, который редко просят, а потом благодарят: проверка на аномалии. Собралось 40 товаров вместо вчерашних 3000 или средняя цена упала вдесятеро — парсер не перезаписывает данные, а пишет вам.

«Парсер, официальный сайт»: коробка, облако или свой код

Запрос «парсер официальный сайт» обычно значит одно: человек нашёл название продукта и хочет скачать его у разработчика, а не с файлопомойки. Инстинкт правильный. Но сначала стоит понять, к какому из четырёх классов относится продукт.

ВариантЧто получаетеГде упирается
Десктопная программаВизуальный настройщик, разовая покупка лицензииЛогика в рамках шаблонов вендора, компьютер должен быть включён
Облачный сервисПарсинг без своего сервера, готовые шаблоны источниковВаш источник может не поддерживаться, данные идут через чужую систему
Расширение браузераБыстро выдернуть таблицу с одной страницыРучной запуск, сотни строк, не про расписание
Свой парсерЛюбая логика и выгрузка, код остаётся у васНужно написать и поддерживать

Инструменты, на которых пишут свои парсеры, известны и бесплатны: Scrapy — когда нужно обойти десятки тысяч страниц без JavaScript, Playwright — когда без настоящего браузера контент не получить, BeautifulSoup и lxml — для разбора уже скачанного HTML. Демоверсия коробки, красиво собирающая пример с сайта вендора, ничего не говорит о том, справится ли она с вашим каталогом на 40 000 позиций — проверяйте на своём источнике до оплаты.

Облачный парсер: официальный сайт сервиса и выгрузка товаров

Самая массовая история — облачные парсеры под e-commerce. У поставщика есть сайт с товарами, но нет нормального прайса. Сервис обходит его каталог и отдаёт файл, готовый к импорту в магазин, на маркетплейс или в альбом группы. Так работает, например, российский сервис «Облачный парсер» (cloudparser.ru): шаблоны под известных поставщиков, наценка и округление цен на выгрузке, готовые форматы импорта.

ОБЛАЧНЫЙ СЕРВИССВОЙ ПАРСЕРГотов сразу, свой сервер не нуженШаблоны под известных поставщиковПодписка или оплата за объёмРедкую вёрстку часто не берётДанные идут через чужой сервисПишется 3–10 дней под ваш источникЛюбая логика: фильтры, сверка, наценкаРазовая оплата, дальше только серверРаботает с любой вёрсткой и с APIДанные не покидают ваш контур
Выбор зависит не от бюджета, а от наличия готового шаблона под ваш источник

Честное правило: поставщик есть в шаблонах сервиса, а выгрузка товаров нужна раз в неделю — берите сервис, это дешевле любой разработки. Свой парсер выигрывает, когда источников больше пяти, нужна сверка между ними (у кого дешевле, где реально есть остаток) или результат должен попадать не в файл, а сразу в систему учёта.

Пока читаете — можно сразу проверить свою задачу. Опишите процесс, и я скажу, решается ли он и во сколько обойдётся.

ИИ-парсер сайтов: где нейросеть помогает, а где мешает

«ИИ парсер сайтов» сейчас означает две разные вещи. Первая — модель вместо селекторов: скормили страницу, попросили вернуть JSON с названием и ценой. Вторая — модель как помощник, который один раз смотрит на страницу и сам пишет правила разбора, а дальше работает обычный быстрый код.

Рабочая схема — гибрид: правила разбирают основной поток страниц, модель подключается там, где правила вернули пустоту. Устойчивость ИИ при скорости обычного парсера.

Законно ли парсить сайты: robots.txt, нагрузка, персональные данные

Отдельного «закона о парсинге» в России нет, и автоматический сбор открытых данных сам по себе не запрещён. Но он попадает под общие нормы: право изготовителя базы данных, законодательство о персональных данных и статьи о неправомерном доступе.

Чужая база данных

Статья 1334 ГК РФ даёт изготовителю базы исключительное право на извлечение материалов — то есть на перенос всего содержания или существенной части на другой носитель. При отсутствии доказательств иного базой, создание которой потребовало существенных затрат, признаётся база не менее чем из десяти тысяч самостоятельных информационных элементов. Вывод простой: выгрузить сотню карточек для сравнения цен и выкачать каталог целиком, чтобы поднять на нём свой сервис, — юридически разные истории.

Показательный спор — «ВКонтакте» против компании «Дабл» (дело № А40-18827/2017) об автоматической выгрузке открытых профилей для скоринга. Тянулся с 2017 года и завершился в 2023-м мировым соглашением: ответчик согласился не использовать данные соцсети без разрешения. Аргумент «данные были открыты всем» сам по себе не сработал.

Персональные данные

ФИО, телефон, почта, профиль физлица — персональные данные, и открытая публикация не равна согласию на их сбор. С 30 мая 2025 года (ФЗ № 420-ФЗ) ответственность резко выросла: штрафы увеличены кратно, за повторную утечку введены оборотные, а статья 272.1 УК РФ предусматривает личную уголовную ответственность за незаконный оборот персональных данных. Это не повод бояться парсинга — повод не собирать контакты физлиц «на всякий случай».

Вежливый парсинг

Обход авторизации, подбор паролей, эксплуатация уязвимостей — это уже неправомерный доступ, а не парсинг. Набор правил, который я применяю по умолчанию:

  1. Читать robots.txt. Не закон, а техническая просьба владельца, но игнорирование закрытых разделов — прямой аргумент против вас в споре.
  2. Держать 1–2 запроса в секунду. Такая нагрузка на порядки меньше обычного дневного трафика магазина и просто не заметна.
  3. Представляться. В User-Agent — название и контакт. Тогда админ напишет письмо, а не забанит подсеть.
  4. Уважать ответы сервера. Пришёл код 429 или Retry-After — притормаживаем, а не долбим повторами.
  5. Ходить ночью и кэшировать. Повторный запрос страницы — только если она могла измениться.
  6. Брать только нужное. Нужны цены — забираем цены, а не выкачиваем каталог целиком, включая карточки продавцов-физлиц.

Самое дешёвое действие: перед разработкой проверьте условия использования сайта и наличие официального API или прайс-фида. Иногда хватает письма поставщику — доступ к выгрузке дают бесплатно, потому что им выгодно, чтобы ваш магазин показывал их актуальные цены.

Сколько стоит парсер и когда его заказывать не нужно

Цену определяет не количество страниц, а три вещи: насколько сложно достать данные, насколько строго их проверять и должен ли парсер работать сам по расписанию.

ЗадачаЧто входитСрок и цена
Разовая выгрузкаОдин сайт, стабильная вёрстка, результат в Excel или Google Sheets1–3 дня, от 25 000 ₽
Парсер на расписанииJS-рендеринг, пагинация, проверки, график, уведомления о сбоях1–2 недели, 60 000–150 000 ₽
Мониторинг рынка10–50 источников, история цен, сверка позиций, дашбордот 200 000 ₽
ПоддержкаПочинка после смены вёрстки, новые источникиот 10 000 ₽ в месяц
Руками, копипастом≈ 5 ч на 300 по…Облачный сервис≈ 45 мин с наст…Свой парсер≈ 5 мин по граф…
Человеческое время на один и тот же прайс из 300 позиций

Теперь честная часть, из-за которой я иногда отговариваю от проекта. Парсер не нужен, если:

Если же данные нужны регулярно, источников несколько и результат должен приезжать в вашу систему — парсер окупается за первый-второй месяц. Дальше собранное сводят в отчёты: как это устроено, разобрано в статье про автоматизацию учёта и отчётности.

Частые вопросы

Законно ли парсить сайты?

Сбор открытых данных сам по себе не запрещён — отдельного закона о парсинге в России нет. Нарушением становятся извлечение существенной части чужой базы данных (ст. 1334 ГК РФ), сбор персональных данных без правового основания и обход защиты или нагрузка, мешающая работе сайта.

Сколько стоит парсер сайтов?

Разовая выгрузка с одного сайта в таблицу — от 25 000 ₽ и 1–3 дня. Парсер по расписанию с JavaScript-страницами и уведомлениями о сбоях — 60 000–150 000 ₽. Мониторинг десятков источников с историей цен и дашбордом — от 200 000 ₽.

Чем облачный парсер отличается от своего?

Облачный работает сразу и не требует сервера, но ограничен готовыми шаблонами источников, а данные проходят через стороннюю систему. Свой пишется под конкретный источник и выгружает прямо в вашу CRM или базу. Есть шаблон под вашего поставщика — берите сервис.

Нужен ли ИИ в парсере?

Для одного сайта со стабильной вёрсткой — нет: обычные правила быстрее, дешевле и предсказуемее. Модель оправдана, когда источников десятки или нужно вытащить характеристики из сплошного текста. Оптимально — гибрид: правила на основном потоке, модель как запасной вариант.

Что будет, если сайт поменяет вёрстку?

Парсер перестанет находить поля, поэтому в нём должна быть проверка результата: при падении числа записей он не перезаписывает данные, а присылает уведомление. Починка занимает от получаса до нескольких часов, потому что правила разбора вынесены в конфиг.

Как часто можно запускать парсер?

Цены конкурентов — обычно раз в сутки ночью, остатки — несколько раз в день, справочники — раз в неделю. Важнее частоты скорость обхода: 1–2 запроса в секунду не создают заметной нагрузки при любом расписании.

парсер сайтовпарсер официальный сайтоблачный парсерии парсер сайтоввыгрузка товаров с сайта

Читайте дальше

Нужны данные с сайтов?

Опишите источник и что нужно забирать — скажу, хватит ли готового сервиса или API, а если нет, назову срок и цену своего парсера.

Обсудить задачу