Перейти к содержимому

9 мин чтения

Как работает парсинг сайтов и законно ли это

Парсинг окружён двумя мифами: что это «взлом» и что это «просто скопировать чужой сайт». На самом деле ни то, ни другое. Рассказываю простыми словами, как он работает, где проходит граница закона и что из этого действительно нужно бизнесу.

Парсер — это программа, которая открывает страницу так же, как ваш браузер, и забирает с неё нужные данные: название товара, цену, наличие, контакт из открытого справочника. Разница лишь в том, что человек делает это глазами и руками, а программа — автоматически и тысячу раз подряд.

Никакого «взлома» здесь нет: парсер видит ровно то же, что видит любой посетитель сайта. Если страница не видна без пароля — её не видит и парсер. Именно поэтому вопрос законности почти никогда не про технологию. Он про то, КАКИЕ данные вы берёте и ЧТО с ними потом делаете.

Как это работает по шагам

  • Программа заходит на страницу по адресу — так же, как это делает браузер.
  • Находит в коде страницы нужные места: блок с ценой, заголовок товара, телефон в карточке.
  • Записывает найденное в таблицу или базу — уже структурированно, аккуратными колонками.
  • Повторяет для следующих страниц: категорий, карточек товаров, страниц пагинации.
  • По расписанию проходит всё заново — ежедневно, ежечасно, как договорились — и показывает, что именно изменилось с прошлого раза.

Законно ли это

Короткий ответ: сам по себе сбор публичных данных не запрещён, но законность зависит от трёх вещей — какие именно это данные, откуда они и как вы их используете. Одна и та же технология может быть полностью легальной и полностью незаконной в зависимости от ответов на эти вопросы.

Сразу оговорюсь: я разработчик, а не юрист, и эта статья — объяснение практики, а не юридическая консультация. Если проект большой или задача попадает в серую зону, это вопрос к юристу — и я первый об этом скажу, а не возьму деньги и промолчу.

Три зоны: где спокойно, где осторожно, а где нет

Публичные данные для собственного анализа

Зелёная зона

Цены, наличие, характеристики товаров, открытые каталоги — то, что видит любой посетитель без пароля. Вы собираете это, чтобы принимать решения внутри компании: сравнить цены, поймать дефицит, собрать аналитику рынка. Самый распространённый и самый спокойный сценарий.

Персональные данные и чужие правила

Жёлтая зона

Имена, телефоны, email — это персональные данные, и на них распространяется отдельное законодательство: нужно законное основание для обработки, а не просто техническая возможность собрать. Сюда же — условия пользования сайта-источника, которые могут прямо запрещать автоматический сбор. Каждый такой случай рассматривается отдельно.

Обход защиты и перепубликация

Красная зона

Подбор паролей, обход капчи, доступ в закрытые разделы, а также копирование чужого контента, чтобы выложить его у себя как свой. Это уже не парсинг, а нарушение — от авторского права до несанкционированного доступа. Такие задачи я не беру.

Правила, по которым я делаю парсеры

  • Только то, что доступно без авторизации. Никаких чужих паролей и обхода защиты.
  • Аккуратная скорость. Парсер работает так, чтобы не создавать нагрузку на сайт-источник: запросы с паузами, а не лавина обращений.
  • robots.txt читается. Это не закон, а просьба владельца сайта — и её стоит уважать. Если раздел прямо закрыт, туда не идём.
  • Данные идут вам, а не «в открытый доступ». Мы собираем для вашей аналитики, а не чтобы сделать копию чужого сайта.
  • Если задача вызывает сомнение — я говорю об этом до начала работ, а не после оплаты.

Сколько стоит парсер

Парсер одного источника

от $400 · 1–2 недели

Один сайт, нужные поля, выгрузка в таблицу или Telegram. Подходит, чтобы следить за ценами конкретного конкурента или собрать каталог с одной площадки.

Подробнее об услуге

Несколько источников с отчётами

от $650

Три-пять сайтов, сведённых в один формат, плюс регулярный отчёт: что изменилось, где цена упала, что пропало из наличия. Самый частый запрос в рознице.

Подробнее об услуге

Поддержка и обновления

$100 в месяц

Пункт, о котором обычно не предупреждают: сайты-источники меняют вёрстку, и любой парсер рано или поздно ломается. Подписка — это то, благодаря чему он продолжает работать, а не тихо умирает через месяц.

Что спросить себя перед стартом

Три вопроса снимают большую часть сомнений. Первый: видны ли эти данные обычному посетителю без пароля? Второй: есть ли среди них персональные — имена, телефоны, email? Третий: что вы будете делать с результатом — анализировать у себя или публиковать наружу?

Если ответы «да, нет, анализировать» — это та самая зелёная зона, и задача совершенно обычная. «Да» на второй или «публиковать» на третий не означает «нельзя», означает «нужно разобраться отдельно». Опишите задачу, и я честно скажу, что с ней делать.

Частые вопросы о парсинге

Технически владелец сайта видит обращения так же, как видит любого посетителя. Именно поэтому парсер должен работать спокойно: умеренная скорость, паузы, разумный объём. Агрессивный сбор создаёт нагрузку, и блокировка на неё — справедливая реакция. Ещё одна причина не гнаться за скоростью.

Это вопрос не «если», а «когда»: вёрстку меняют все. В рамках поддержки я чиню такие поломки — собственно, поэтому она и вынесена отдельной строкой. Без поддержки парсер тоже будет работать, но однажды тихо перестанет, и заметят это не сразу.

Технически да, юридически — это персональные данные, и сам факт, что они где-то опубликованы, не даёт автоматического права на рассылку. Поэтому за такие задачи я берусь только когда понятно законное основание, и честно говорю, когда его не вижу.

Публичные страницы товаров технически доступны, но крупные площадки обычно прямо запрещают автоматический сбор в своих условиях и серьёзно защищаются технически. Часто разумнее пойти официальным путём — у многих есть API для партнёров. Это надёжнее и дешевле в поддержке.

Нужны данные, которых нет в удобном виде?

Опишите, с каких сайтов и что именно нужно собирать, — скажу, реально ли это технически, спокойно ли с точки зрения правил и сколько будет стоить.