9 мин чтения
Как работает парсинг сайтов и законно ли это
Парсинг окружён двумя мифами: что это «взлом» и что это «просто скопировать чужой сайт». На самом деле ни то, ни другое. Рассказываю простыми словами, как он работает, где проходит граница закона и что из этого действительно нужно бизнесу.
Парсер — это программа, которая открывает страницу так же, как ваш браузер, и забирает с неё нужные данные: название товара, цену, наличие, контакт из открытого справочника. Разница лишь в том, что человек делает это глазами и руками, а программа — автоматически и тысячу раз подряд.
Никакого «взлома» здесь нет: парсер видит ровно то же, что видит любой посетитель сайта. Если страница не видна без пароля — её не видит и парсер. Именно поэтому вопрос законности почти никогда не про технологию. Он про то, КАКИЕ данные вы берёте и ЧТО с ними потом делаете.
Как это работает по шагам
- Программа заходит на страницу по адресу — так же, как это делает браузер.
- Находит в коде страницы нужные места: блок с ценой, заголовок товара, телефон в карточке.
- Записывает найденное в таблицу или базу — уже структурированно, аккуратными колонками.
- Повторяет для следующих страниц: категорий, карточек товаров, страниц пагинации.
- По расписанию проходит всё заново — ежедневно, ежечасно, как договорились — и показывает, что именно изменилось с прошлого раза.
Законно ли это
Короткий ответ: сам по себе сбор публичных данных не запрещён, но законность зависит от трёх вещей — какие именно это данные, откуда они и как вы их используете. Одна и та же технология может быть полностью легальной и полностью незаконной в зависимости от ответов на эти вопросы.
Сразу оговорюсь: я разработчик, а не юрист, и эта статья — объяснение практики, а не юридическая консультация. Если проект большой или задача попадает в серую зону, это вопрос к юристу — и я первый об этом скажу, а не возьму деньги и промолчу.
Три зоны: где спокойно, где осторожно, а где нет
Публичные данные для собственного анализа
Зелёная зонаЦены, наличие, характеристики товаров, открытые каталоги — то, что видит любой посетитель без пароля. Вы собираете это, чтобы принимать решения внутри компании: сравнить цены, поймать дефицит, собрать аналитику рынка. Самый распространённый и самый спокойный сценарий.
Персональные данные и чужие правила
Жёлтая зонаИмена, телефоны, email — это персональные данные, и на них распространяется отдельное законодательство: нужно законное основание для обработки, а не просто техническая возможность собрать. Сюда же — условия пользования сайта-источника, которые могут прямо запрещать автоматический сбор. Каждый такой случай рассматривается отдельно.
Обход защиты и перепубликация
Красная зонаПодбор паролей, обход капчи, доступ в закрытые разделы, а также копирование чужого контента, чтобы выложить его у себя как свой. Это уже не парсинг, а нарушение — от авторского права до несанкционированного доступа. Такие задачи я не беру.
Правила, по которым я делаю парсеры
- Только то, что доступно без авторизации. Никаких чужих паролей и обхода защиты.
- Аккуратная скорость. Парсер работает так, чтобы не создавать нагрузку на сайт-источник: запросы с паузами, а не лавина обращений.
- robots.txt читается. Это не закон, а просьба владельца сайта — и её стоит уважать. Если раздел прямо закрыт, туда не идём.
- Данные идут вам, а не «в открытый доступ». Мы собираем для вашей аналитики, а не чтобы сделать копию чужого сайта.
- Если задача вызывает сомнение — я говорю об этом до начала работ, а не после оплаты.
Сколько стоит парсер
Парсер одного источника
от $400 · 1–2 неделиОдин сайт, нужные поля, выгрузка в таблицу или Telegram. Подходит, чтобы следить за ценами конкретного конкурента или собрать каталог с одной площадки.
Подробнее об услугеНесколько источников с отчётами
от $650Три-пять сайтов, сведённых в один формат, плюс регулярный отчёт: что изменилось, где цена упала, что пропало из наличия. Самый частый запрос в рознице.
Подробнее об услугеПоддержка и обновления
$100 в месяцПункт, о котором обычно не предупреждают: сайты-источники меняют вёрстку, и любой парсер рано или поздно ломается. Подписка — это то, благодаря чему он продолжает работать, а не тихо умирает через месяц.
Что спросить себя перед стартом
Три вопроса снимают большую часть сомнений. Первый: видны ли эти данные обычному посетителю без пароля? Второй: есть ли среди них персональные — имена, телефоны, email? Третий: что вы будете делать с результатом — анализировать у себя или публиковать наружу?
Если ответы «да, нет, анализировать» — это та самая зелёная зона, и задача совершенно обычная. «Да» на второй или «публиковать» на третий не означает «нельзя», означает «нужно разобраться отдельно». Опишите задачу, и я честно скажу, что с ней делать.
Частые вопросы о парсинге
Технически владелец сайта видит обращения так же, как видит любого посетителя. Именно поэтому парсер должен работать спокойно: умеренная скорость, паузы, разумный объём. Агрессивный сбор создаёт нагрузку, и блокировка на неё — справедливая реакция. Ещё одна причина не гнаться за скоростью.
Это вопрос не «если», а «когда»: вёрстку меняют все. В рамках поддержки я чиню такие поломки — собственно, поэтому она и вынесена отдельной строкой. Без поддержки парсер тоже будет работать, но однажды тихо перестанет, и заметят это не сразу.
Технически да, юридически — это персональные данные, и сам факт, что они где-то опубликованы, не даёт автоматического права на рассылку. Поэтому за такие задачи я берусь только когда понятно законное основание, и честно говорю, когда его не вижу.
Публичные страницы товаров технически доступны, но крупные площадки обычно прямо запрещают автоматический сбор в своих условиях и серьёзно защищаются технически. Часто разумнее пойти официальным путём — у многих есть API для партнёров. Это надёжнее и дешевле в поддержке.
Нужны данные, которых нет в удобном виде?
Опишите, с каких сайтов и что именно нужно собирать, — скажу, реально ли это технически, спокойно ли с точки зрения правил и сколько будет стоить.