Защита от парсинга: как защитить сайт от кражи контента
Защита от парсинга — это набор технических, контентных и юридических мер, которые не дают конкурентам и копипастерам массово выкачивать с сайта цены, каталог, тексты и фото. Стопроцентной защиты не бывает: всё, что видит посетитель в браузере, может получить и программа. Задача — сделать сбор данных дорогим, медленным и заметным, а если копия всё же появилась — быстро доказать своё право и убрать её.
Материал для владельцев интернет-магазинов, дистрибьюторов и контентных проектов. Как устроен парсинг и где граница закона для того, кто парсит, мы разобрали в статье «Что такое парсинг сайтов простыми словами». Здесь — взгляд с другой стороны: как защитить сайт от парсинга, не уронив SEO и не потеряв клиентов.
Зачем парсят именно ваш сайт
От ботов мониторинга цен и от дорвейщиков, ворующих тексты, помогают разные меры, поэтому защита начинается с понимания мотива.
| Что забирают | Кто и зачем | Чем это грозит вам |
|---|---|---|
| Цены и наличие | Конкуренты и сервисы мониторинга цен — чтобы автоматически ставить цену чуть ниже | Демпинг по вашему ассортименту, нагрузка на сервер от ежедневных обходов |
| Каталог целиком: названия, характеристики, структура | Новые магазины и дропшипперы, которым лень заводить базу | Годы работы контент-менеджеров достаются другому за вечер |
| Тексты: описания, статьи, обзоры | Дорвеи, сайты-сателлиты, копипаст-магазины | Дубли в выдаче, риск, что первоисточником поисковик сочтёт не вас |
| Фотографии товаров и работ | Магазины-перекупщики, доски объявлений, клоны | Покупатель видит ваш товар на чужом сайте, растёт недоверие |
| Контакты, профили, отзывы с именами | Сборщики баз для спама и обзвона | Жалобы пользователей, вопросы по 152-ФЗ к вам как к оператору |
| Сайт целиком | Мошенники: клон с подменой телефонов и реквизитов | Украденные заказы и деньги клиентов, удар по бренду |
Отдельная категория — ИИ-краулеры (GPTBot, ClaudeBot, CCBot, PerplexityBot и другие): крупные соблюдают robots.txt, мелкие маскируются под обычный браузер.
Как понять, что сайт парсят
Парсер редко выдаёт себя явно, сигналы складываются из нескольких источников. В логах сервера:
- один IP или подсеть последовательно проходит каталог: пагинация подряд, карточки по возрастанию ID, тысячи URL за час;
- запрашивается только HTML — без CSS, JS, картинок и счётчиков;
- адреса принадлежат дата-центрам и хостингам, ритм ровный днём и ночью;
- идут прямые обращения к внутреннему API каталога или поиска в обход страниц.
Косвенные признаки: растёт нагрузка на сервер, а посещаемость в Метрике стоит на месте; цены у конкурента меняются через несколько часов после ваших и всегда чуть ниже; по вашим фразам в выдаче появляются незнакомые сайты. Команды для разбора access-лога и признаки ботов в Метрике собраны в статье «Защита сайта от ботов».
Как найти копии текстов и фото
Возьмите характерное предложение из описания товара или статьи и поищите его в Яндексе и Google в кавычках. Для регулярного контроля подойдут сервисы проверки уникальности, часть из них умеет мониторить страницы и присылать уведомления о копиях. Фото проверяются поиском по изображению в Яндекс Картинках и Google Lens.
Технические меры защиты от парсинга
Лимиты запросов на «дорогие» разделы
Ограничение частоты запросов (rate limit) отсекает примитивные скрипты: человек открывает несколько страниц в минуту, парсер — десятки в секунду. Для защиты каталога лимит ставят не на весь сайт, а на каталог, поиск, фильтры и API:
# в блоке http
limit_req_zone $binary_remote_addr zone=catalog:10m rate=2r/s;
# в блоке server
location /catalog/ {
limit_req zone=catalog burst=20 nodelay;
limit_req_status 429;
proxy_pass http://app;
}
Против пулов прокси добавляют жёсткие лимиты или проверку для подсетей дата-центров. Парсеры на requests и curl не исполняют JavaScript и отсеиваются JS-проверкой, а против headless-браузеров нужен поведенческий анализ облачного антибота (Servicepipe, Curator, DDoS-Guard и другие). Общие лимиты, работу за CDN и антибот-сервисы мы подробно разбирали в статье о защите от ботов. Пороги и исключения задаются при настройке nginx.
Закрытые API и данные за авторизацией
Самая частая дыра — не страницы, а API, из которого фронтенд подгружает каталог. Парсер забирает чистый JSON со всеми полями, иногда с закупочными ценами и остатками, которых на странице нет. Что проверить:
- API отдаёт только поля, которые реально выводятся на странице, — без себестоимости, поставщиков, внутренних кодов;
- одним запросом нельзя забрать весь каталог: есть предел размера выдачи и лимит запросов;
- запросы подписаны короткоживущим токеном сессии;
- ID товаров не идут подряд, и их нельзя перебрать циклом.
Для B2B радикальное решение — показывать оптовые цены только авторизованным клиентам. Тогда лимиты считаются по аккаунту, а «утёкший» аккаунт видно по аномальному числу просмотров.
Защита изображений
- Запрет хотлинкинга — директива
valid_referersв nginx не даёт чужим сайтам вставлять ваши фото по прямой ссылке за ваш трафик. - Водяной знак — аккуратный логотип в углу не мешает покупателю, а скопированное фото превращается в рекламу вашего магазина. Массовый копировщик удалять его вручную не станет.
- Исходники и метаданные — RAW-файлы и полноразмерные оригиналы у вас, у копировщика только уменьшенная копия; поля EXIF/IPTC с автором помогают в споре, хотя многие движки их срезают.
Как не заблокировать поисковых роботов
Парсеры часто представляются YandexBot или Googlebot, поэтому белый список строят не по User-Agent, а по IP с проверкой обратным и прямым DNS-запросом — методика описана в статье о защите от ботов. Партнёрам и агрегаторам лучше отдавать отдельный фид или API с ключом, чем разрешать обход сайта.
Контентная защита: данные, которые бессмысленно копировать
Лучшая защита текстов — сделать так, чтобы копия проигрывала оригиналу. Скопировать можно описание, но не экспертизу и не живые данные.
- Собственные данные. Фото и видео реальных объектов, замеры, результаты тестов, реальные отзывы с ответами — всё, чего нет на сайтах поставщиков.
- Ловушки для доказательств. Уникальные формулировки, редкие обозначения, фиктивная позиция в прайсе. Если они появились у конкурента, это весомый аргумент, что данные извлечены из вашей базы, а не собраны независимо.
Что не работает: популярные советы из прошлого
- Запрет правого клика и выделения текста. Парсер читает HTML, а не кликает мышкой. Зато человек, которому нужно скопировать артикул или адрес, раздражается и уходит.
- Подмена кириллицы латиницей и «шум» в тексте. Страдают ранжирование и доступность для экранных дикторов, а парсер чистит такие вставки одной регуляркой.
- Текст картинкой или сложная обфускация JS. Текст выпадает из индекса, страница тяжелеет, а headless-браузер всё равно получает итоговый DOM.
- Запрет в robots.txt и блокировка по User-Agent. robots.txt соблюдают поисковики и крупные ИИ-краулеры, но не парсер конкурента, а строка «python-requests» меняется на «Chrome» одной строкой кода.
Юридическая защита: какие права у владельца сайта
Технические меры замедляют парсинг, закон помогает убрать результат. У владельца сайта есть несколько независимых оснований.
Авторское право на тексты и фото
Статьи, обзоры, развёрнутые описания и фотографии — объекты авторского права (ст. 1259 ГК РФ), их воспроизведение и доведение до всеобщего сведения без согласия правообладателя нарушает исключительное право (ст. 1270 ГК РФ). Регистрировать тексты не нужно — право возникает в момент создания. Но короткие технические характеристики («сталь, М8, 40 мм») суды творческим трудом обычно не признают.
Право изготовителя базы данных
Каталог товаров, база объявлений или прайс защищаются как база данных, даже если отдельные записи не творческие. Без разрешения изготовителя нельзя извлекать и использовать всё её содержимое или существенную часть (ст. 1334 ГК РФ). Неоднократное извлечение несущественных частей тоже запрещено, если оно противоречит нормальному использованию базы и необоснованно ущемляет интересы изготовителя (п. 3 ст. 1335.1). База от 10 000 самостоятельных элементов считается созданной с существенными затратами, пока не доказано иное (п. 1 ст. 1334), — для большого каталога это серьёзный аргумент.
Недобросовестная конкуренция
Если конкурент сделал клон с вашим названием, дизайном и узнаваемыми элементами, возможен довод о смешении по ст. 14.6 закона «О защите конкуренции» (135-ФЗ) с жалобой в ФАС. Путь сложный и небыстрый: нужно доказать конкуренцию на одном рынке и риск введения покупателей в заблуждение.
Персональные данные
Открытые профили, отзывы с именами, контакты сотрудников или клиентов — зона вашей ответственности как оператора: закон требует мер против неправомерного доступа к персональным данным (ст. 19 152-ФЗ), а для публичного размещения нужно отдельное согласие на распространение. Подробнее — в материале о требованиях 152-ФЗ к сайту.
Что делать, если контент уже скопировали
- Зафиксируйте нарушение. Скриншоты с датой и адресом — минимум, для суда надёжнее нотариальный протокол осмотра сайта. Соберите и свои доказательства: исходники, даты публикации, договоры с авторами.
- Напишите владельцу сайта. Контакты ищите на самом сайте и в WHOIS. Статья 15.7 закона «Об информации» (149-ФЗ) с 2015 года предусматривает внесудебный порядок: получив заявление правообладателя, владелец сайта должен удалить материал в течение 24 часов.
- Напишите хостинг-провайдеру. Хостер — информационный посредник: чтобы не отвечать за нарушение, он должен своевременно принять меры после письменного заявления правообладателя со ссылками на страницы (ст. 1253.1 ГК РФ). На практике это часто самый быстрый путь.
- Учтите роль поисковиков. Яндекс не удаляет чужие страницы по жалобам на копии текстов: он направляет к администратору сайта или хостингу, а после удаления контента ссылка выпадает из выдачи сама. В Google можно подать жалобу через форму удаления контента по авторскому праву, но срок и результат рассмотрения не гарантированы.
- Направьте претензию. Если обе стороны — юрлица или ИП и спор идёт в арбитражный суд, претензия перед иском о компенсации обязательна (п. 5.1 ст. 1252 ГК РФ). Иск можно подать при отказе или без ответа в течение 30 дней, если договором не установлен иной срок.
- Идите в суд. Компенсация за нарушение авторского права или права на базу данных — от 10 000 до 10 000 000 ₽ по усмотрению суда (ст. 1301 и 1311 ГК РФ в редакции, действующей с 2026 года) либо в двукратном размере стоимости права использования. Для блокировки пиратского ресурса есть механизм через Московский городской суд и Роскомнадзор (ст. 15.2 149-ФЗ), но на фотографии он не распространяется.
Уровни защиты: что выбрать под задачу
| Мера | От кого защищает | Риск для SEO и пользователей | Сложность |
|---|---|---|---|
| Rate limit на каталог, поиск и API | Простые скрипты | Низкий при правильных порогах | Низкая |
| Лимиты для подсетей дата-центров | Парсеры на арендованных серверах | Низкий, если в белом списке поисковики | Средняя |
| JS-проверка, облачный антибот | Парсеры без браузера, часть headless | Средний, нужны исключения | Средняя, абонентская плата |
| Закрытый API, цены после авторизации | Массовая выгрузка цен и остатков | Для B2B — нет, в рознице цены должны быть видны | Средняя–высокая |
| Водяные знаки, запрет хотлинкинга | Копирование фото | Низкий | Низкая |
| Ловушки в данных, фиксация авторства | Не защищает, но даёт доказательства | Нет | Низкая |
| Претензии, жалобы хостеру, суд | Уже опубликованные копии | Нет | Зависит от нарушителя |
Для типового интернет-магазина разумный минимум — лимиты на каталог и поиск, проверка поисковых роботов, закрытое API и водяные знаки; облачный антибот — когда нагрузка от парсинга уже влияет на скорость сайта. Открытые API, лишние поля в ответах и перебираемые ID удобно искать в рамках аудита безопасности сайта: те же дыры используют не только парсеры, но и злоумышленники.
Типичные ошибки при защите от парсинга
- Капча для всех посетителей. Конверсия падает сильнее, чем от любого парсинга; проверка должна включаться только при аномальном поведении.
- Бан по одному IP вручную. Парсер меняет адрес за секунды, нужны автоматические правила.
- Нет доказательств авторства. Копия найдена, но договоров с авторами нет, исходники потеряны — претензия превращается в спор слово против слова.
Чек-лист: как защитить сайт от парсинга
- Определили, что ценно на сайте: цены, каталог, тексты, фото, контакты.
- Проверили логи на признаки массового обхода и нашли источники запросов.
- Настроили лимиты на каталог, поиск, фильтры и API.
- Добавили в белый список поисковых роботов с проверкой по DNS.
- Убедились, что API не отдаёт лишних полей и не выгружает каталог целиком.
- Включили защиту от хотлинкинга и водяные знаки на фото.
- Оформили права на тексты и фото, храним исходники и даты публикации.
- Прописали запрет автоматического сбора в пользовательском соглашении.
- Раз в месяц ищем копии текстов по фразе и фото — по изображению.
- После каждого изменения защиты проверяем ошибки сканирования в Вебмастере и Search Console.
Вывод
Защитить сайт от парсинга полностью нельзя, но можно сделать сбор данных невыгодным: технические меры отсекают массовые скрипты, контент делает копию слабее оригинала, оформленные права позволяют убирать копии. Главное — не перестараться: защита, которая мешает покупателям и поисковым роботам, обходится дороже любого парсера.
