Написать нам в Telegram

Защита от парсинга: как защитить сайт от кражи контента

Безопасность
19 сентября 2026 г.
Фото Максим Козлов
Максим КозловРуководитель отдела разработки

Защита от парсинга — это набор технических, контентных и юридических мер, которые не дают конкурентам и копипастерам массово выкачивать с сайта цены, каталог, тексты и фото. Стопроцентной защиты не бывает: всё, что видит посетитель в браузере, может получить и программа. Задача — сделать сбор данных дорогим, медленным и заметным, а если копия всё же появилась — быстро доказать своё право и убрать её.

Материал для владельцев интернет-магазинов, дистрибьюторов и контентных проектов. Как устроен парсинг и где граница закона для того, кто парсит, мы разобрали в статье «Что такое парсинг сайтов простыми словами». Здесь — взгляд с другой стороны: как защитить сайт от парсинга, не уронив SEO и не потеряв клиентов.

Зачем парсят именно ваш сайт

От ботов мониторинга цен и от дорвейщиков, ворующих тексты, помогают разные меры, поэтому защита начинается с понимания мотива.

Что забираютКто и зачемЧем это грозит вам
Цены и наличиеКонкуренты и сервисы мониторинга цен — чтобы автоматически ставить цену чуть нижеДемпинг по вашему ассортименту, нагрузка на сервер от ежедневных обходов
Каталог целиком: названия, характеристики, структураНовые магазины и дропшипперы, которым лень заводить базуГоды работы контент-менеджеров достаются другому за вечер
Тексты: описания, статьи, обзорыДорвеи, сайты-сателлиты, копипаст-магазиныДубли в выдаче, риск, что первоисточником поисковик сочтёт не вас
Фотографии товаров и работМагазины-перекупщики, доски объявлений, клоныПокупатель видит ваш товар на чужом сайте, растёт недоверие
Контакты, профили, отзывы с именамиСборщики баз для спама и обзвонаЖалобы пользователей, вопросы по 152-ФЗ к вам как к оператору
Сайт целикомМошенники: клон с подменой телефонов и реквизитовУкраденные заказы и деньги клиентов, удар по бренду

Отдельная категория — ИИ-краулеры (GPTBot, ClaudeBot, CCBot, PerplexityBot и другие): крупные соблюдают robots.txt, мелкие маскируются под обычный браузер.

Как понять, что сайт парсят

Парсер редко выдаёт себя явно, сигналы складываются из нескольких источников. В логах сервера:

  • один IP или подсеть последовательно проходит каталог: пагинация подряд, карточки по возрастанию ID, тысячи URL за час;
  • запрашивается только HTML — без CSS, JS, картинок и счётчиков;
  • адреса принадлежат дата-центрам и хостингам, ритм ровный днём и ночью;
  • идут прямые обращения к внутреннему API каталога или поиска в обход страниц.

Косвенные признаки: растёт нагрузка на сервер, а посещаемость в Метрике стоит на месте; цены у конкурента меняются через несколько часов после ваших и всегда чуть ниже; по вашим фразам в выдаче появляются незнакомые сайты. Команды для разбора access-лога и признаки ботов в Метрике собраны в статье «Защита сайта от ботов».

Как найти копии текстов и фото

Возьмите характерное предложение из описания товара или статьи и поищите его в Яндексе и Google в кавычках. Для регулярного контроля подойдут сервисы проверки уникальности, часть из них умеет мониторить страницы и присылать уведомления о копиях. Фото проверяются поиском по изображению в Яндекс Картинках и Google Lens.

Инструмент «Оригинальные тексты» в Яндекс Вебмастере отключён 15 сентября 2020 года, советы «добавьте текст в Вебмастер перед публикацией» устарели. Ускорить индексацию новых страниц, чтобы ваша версия попала в индекс раньше копии, можно через «Переобход страниц» и обход по счётчику Метрики.

Технические меры защиты от парсинга

Лимиты запросов на «дорогие» разделы

Ограничение частоты запросов (rate limit) отсекает примитивные скрипты: человек открывает несколько страниц в минуту, парсер — десятки в секунду. Для защиты каталога лимит ставят не на весь сайт, а на каталог, поиск, фильтры и API:

# в блоке http
limit_req_zone $binary_remote_addr zone=catalog:10m rate=2r/s;

# в блоке server
location /catalog/ {
	limit_req zone=catalog burst=20 nodelay;
	limit_req_status 429;
	proxy_pass http://app;
}

Против пулов прокси добавляют жёсткие лимиты или проверку для подсетей дата-центров. Парсеры на requests и curl не исполняют JavaScript и отсеиваются JS-проверкой, а против headless-браузеров нужен поведенческий анализ облачного антибота (Servicepipe, Curator, DDoS-Guard и другие). Общие лимиты, работу за CDN и антибот-сервисы мы подробно разбирали в статье о защите от ботов. Пороги и исключения задаются при настройке nginx.

Закрытые API и данные за авторизацией

Самая частая дыра — не страницы, а API, из которого фронтенд подгружает каталог. Парсер забирает чистый JSON со всеми полями, иногда с закупочными ценами и остатками, которых на странице нет. Что проверить:

  • API отдаёт только поля, которые реально выводятся на странице, — без себестоимости, поставщиков, внутренних кодов;
  • одним запросом нельзя забрать весь каталог: есть предел размера выдачи и лимит запросов;
  • запросы подписаны короткоживущим токеном сессии;
  • ID товаров не идут подряд, и их нельзя перебрать циклом.

Для B2B радикальное решение — показывать оптовые цены только авторизованным клиентам. Тогда лимиты считаются по аккаунту, а «утёкший» аккаунт видно по аномальному числу просмотров.

Защита изображений

  • Запрет хотлинкинга — директива valid_referers в nginx не даёт чужим сайтам вставлять ваши фото по прямой ссылке за ваш трафик.
  • Водяной знак — аккуратный логотип в углу не мешает покупателю, а скопированное фото превращается в рекламу вашего магазина. Массовый копировщик удалять его вручную не станет.
  • Исходники и метаданные — RAW-файлы и полноразмерные оригиналы у вас, у копировщика только уменьшенная копия; поля EXIF/IPTC с автором помогают в споре, хотя многие движки их срезают.

Как не заблокировать поисковых роботов

Парсеры часто представляются YandexBot или Googlebot, поэтому белый список строят не по User-Agent, а по IP с проверкой обратным и прямым DNS-запросом — методика описана в статье о защите от ботов. Партнёрам и агрегаторам лучше отдавать отдельный фид или API с ключом, чем разрешать обход сайта.

После включения любой защиты проверьте в Яндекс Вебмастере и Google Search Console отчёты об ошибках сканирования. Всплеск ответов 403 и 429 роботам поисковиков означает, что защита режет индексацию, и вскоре это отразится на позициях.

Контентная защита: данные, которые бессмысленно копировать

Лучшая защита текстов — сделать так, чтобы копия проигрывала оригиналу. Скопировать можно описание, но не экспертизу и не живые данные.

  • Собственные данные. Фото и видео реальных объектов, замеры, результаты тестов, реальные отзывы с ответами — всё, чего нет на сайтах поставщиков.
  • Ловушки для доказательств. Уникальные формулировки, редкие обозначения, фиктивная позиция в прайсе. Если они появились у конкурента, это весомый аргумент, что данные извлечены из вашей базы, а не собраны независимо.
Фиксируйте авторство заранее: договоры с копирайтерами и фотографами об отчуждении исключительного права, исходники фото, даты публикаций. Если тексты писал фрилансер без договора, права на них остались у него — и претензию к копировщику подавать сложнее.

Что не работает: популярные советы из прошлого

  • Запрет правого клика и выделения текста. Парсер читает HTML, а не кликает мышкой. Зато человек, которому нужно скопировать артикул или адрес, раздражается и уходит.
  • Подмена кириллицы латиницей и «шум» в тексте. Страдают ранжирование и доступность для экранных дикторов, а парсер чистит такие вставки одной регуляркой.
  • Текст картинкой или сложная обфускация JS. Текст выпадает из индекса, страница тяжелеет, а headless-браузер всё равно получает итоговый DOM.
  • Запрет в robots.txt и блокировка по User-Agent. robots.txt соблюдают поисковики и крупные ИИ-краулеры, но не парсер конкурента, а строка «python-requests» меняется на «Chrome» одной строкой кода.

Юридическая защита: какие права у владельца сайта

Технические меры замедляют парсинг, закон помогает убрать результат. У владельца сайта есть несколько независимых оснований.

Авторское право на тексты и фото

Статьи, обзоры, развёрнутые описания и фотографии — объекты авторского права (ст. 1259 ГК РФ), их воспроизведение и доведение до всеобщего сведения без согласия правообладателя нарушает исключительное право (ст. 1270 ГК РФ). Регистрировать тексты не нужно — право возникает в момент создания. Но короткие технические характеристики («сталь, М8, 40 мм») суды творческим трудом обычно не признают.

Право изготовителя базы данных

Каталог товаров, база объявлений или прайс защищаются как база данных, даже если отдельные записи не творческие. Без разрешения изготовителя нельзя извлекать и использовать всё её содержимое или существенную часть (ст. 1334 ГК РФ). Неоднократное извлечение несущественных частей тоже запрещено, если оно противоречит нормальному использованию базы и необоснованно ущемляет интересы изготовителя (п. 3 ст. 1335.1). База от 10 000 самостоятельных элементов считается созданной с существенными затратами, пока не доказано иное (п. 1 ст. 1334), — для большого каталога это серьёзный аргумент.

Недобросовестная конкуренция

Если конкурент сделал клон с вашим названием, дизайном и узнаваемыми элементами, возможен довод о смешении по ст. 14.6 закона «О защите конкуренции» (135-ФЗ) с жалобой в ФАС. Путь сложный и небыстрый: нужно доказать конкуренцию на одном рынке и риск введения покупателей в заблуждение.

Персональные данные

Открытые профили, отзывы с именами, контакты сотрудников или клиентов — зона вашей ответственности как оператора: закон требует мер против неправомерного доступа к персональным данным (ст. 19 152-ФЗ), а для публичного размещения нужно отдельное согласие на распространение. Подробнее — в материале о требованиях 152-ФЗ к сайту.

Что делать, если контент уже скопировали

  1. Зафиксируйте нарушение. Скриншоты с датой и адресом — минимум, для суда надёжнее нотариальный протокол осмотра сайта. Соберите и свои доказательства: исходники, даты публикации, договоры с авторами.
  2. Напишите владельцу сайта. Контакты ищите на самом сайте и в WHOIS. Статья 15.7 закона «Об информации» (149-ФЗ) с 2015 года предусматривает внесудебный порядок: получив заявление правообладателя, владелец сайта должен удалить материал в течение 24 часов.
  3. Напишите хостинг-провайдеру. Хостер — информационный посредник: чтобы не отвечать за нарушение, он должен своевременно принять меры после письменного заявления правообладателя со ссылками на страницы (ст. 1253.1 ГК РФ). На практике это часто самый быстрый путь.
  4. Учтите роль поисковиков. Яндекс не удаляет чужие страницы по жалобам на копии текстов: он направляет к администратору сайта или хостингу, а после удаления контента ссылка выпадает из выдачи сама. В Google можно подать жалобу через форму удаления контента по авторскому праву, но срок и результат рассмотрения не гарантированы.
  5. Направьте претензию. Если обе стороны — юрлица или ИП и спор идёт в арбитражный суд, претензия перед иском о компенсации обязательна (п. 5.1 ст. 1252 ГК РФ). Иск можно подать при отказе или без ответа в течение 30 дней, если договором не установлен иной срок.
  6. Идите в суд. Компенсация за нарушение авторского права или права на базу данных — от 10 000 до 10 000 000 ₽ по усмотрению суда (ст. 1301 и 1311 ГК РФ в редакции, действующей с 2026 года) либо в двукратном размере стоимости права использования. Для блокировки пиратского ресурса есть механизм через Московский городской суд и Роскомнадзор (ст. 15.2 149-ФЗ), но на фотографии он не распространяется.
Юридическая защита работает тем лучше, чем раньше вы о ней подумали: пропишите запрет автоматического сбора данных в пользовательском соглашении, оформляйте права на тексты и фото, храните исходники.

Уровни защиты: что выбрать под задачу

МераОт кого защищаетРиск для SEO и пользователейСложность
Rate limit на каталог, поиск и APIПростые скриптыНизкий при правильных порогахНизкая
Лимиты для подсетей дата-центровПарсеры на арендованных серверахНизкий, если в белом списке поисковикиСредняя
JS-проверка, облачный антиботПарсеры без браузера, часть headlessСредний, нужны исключенияСредняя, абонентская плата
Закрытый API, цены после авторизацииМассовая выгрузка цен и остатковДля B2B — нет, в рознице цены должны быть видныСредняя–высокая
Водяные знаки, запрет хотлинкингаКопирование фотоНизкийНизкая
Ловушки в данных, фиксация авторстваНе защищает, но даёт доказательстваНетНизкая
Претензии, жалобы хостеру, судУже опубликованные копииНетЗависит от нарушителя

Для типового интернет-магазина разумный минимум — лимиты на каталог и поиск, проверка поисковых роботов, закрытое API и водяные знаки; облачный антибот — когда нагрузка от парсинга уже влияет на скорость сайта. Открытые API, лишние поля в ответах и перебираемые ID удобно искать в рамках аудита безопасности сайта: те же дыры используют не только парсеры, но и злоумышленники.

Типичные ошибки при защите от парсинга

  • Капча для всех посетителей. Конверсия падает сильнее, чем от любого парсинга; проверка должна включаться только при аномальном поведении.
  • Бан по одному IP вручную. Парсер меняет адрес за секунды, нужны автоматические правила.
  • Нет доказательств авторства. Копия найдена, но договоров с авторами нет, исходники потеряны — претензия превращается в спор слово против слова.

Чек-лист: как защитить сайт от парсинга

  • Определили, что ценно на сайте: цены, каталог, тексты, фото, контакты.
  • Проверили логи на признаки массового обхода и нашли источники запросов.
  • Настроили лимиты на каталог, поиск, фильтры и API.
  • Добавили в белый список поисковых роботов с проверкой по DNS.
  • Убедились, что API не отдаёт лишних полей и не выгружает каталог целиком.
  • Включили защиту от хотлинкинга и водяные знаки на фото.
  • Оформили права на тексты и фото, храним исходники и даты публикации.
  • Прописали запрет автоматического сбора в пользовательском соглашении.
  • Раз в месяц ищем копии текстов по фразе и фото — по изображению.
  • После каждого изменения защиты проверяем ошибки сканирования в Вебмастере и Search Console.

Вывод

Защитить сайт от парсинга полностью нельзя, но можно сделать сбор данных невыгодным: технические меры отсекают массовые скрипты, контент делает копию слабее оригинала, оформленные права позволяют убирать копии. Главное — не перестараться: защита, которая мешает покупателям и поисковым роботам, обходится дороже любого парсера.

Частые вопросы
Нет. Если данные видит посетитель в браузере, их может получить и программа — через headless-браузер, прокси или ручной сбор. Реальная цель защиты — сделать массовый сбор медленным, дорогим и заметным, а для уже скопированного контента иметь доказательства и юридические инструменты.
Против парсеров — нет: они читают HTML-код страницы, а не выделяют текст мышкой. Запрет выделения и правого клика мешает только обычным посетителям, которым нужно скопировать артикул, адрес или телефон, и ухудшает поведенческие факторы.
Ограничьте частоту запросов к каталогу и поиску, закройте API от выгрузки без токена сессии и уберите из ответов лишние поля. Для оптовых цен надёжнее всего показывать их только после авторизации в личном кабинете: тогда лимиты считаются по аккаунту, а утечку видно по аномальной активности.
Так называют защиту от сервисов, которые собирают телефоны посетителей чужих сайтов через данные операторов связи и рекламных платформ. Сбор идёт на стороне оператора, а не на вашем сервере, поэтому техническими настройками сайта он почти не контролируется. Снизить риск помогает минимум сторонних скриптов и счётчиков неизвестного происхождения на сайте, а законность такого сбора без согласия абонентов спорна с точки зрения 152-ФЗ.
Это деловое решение. Запрет в robots.txt для GPTBot, ClaudeBot, CCBot и токена Google-Extended убирает ваши тексты из обучения моделей и снижает нагрузку, но может уменьшить упоминания сайта в ответах нейросетей. Мелкие ИИ-парсеры robots.txt игнорируют, от них помогают только серверные лимиты и антибот.
Может, особенно если копию разместил более старый и посещаемый сайт или она проиндексировалась раньше. Поэтому важно быстро отправлять новые страницы на переобход в Яндекс Вебмастере, ставить внутренние ссылки в тексты и добиваться удаления копий через владельца сайта или хостинг.
Аудит безопасности сайта
Поможем с этой задачей под ключ — от идеи до результата. Рассчитаем стоимость и сроки под вашу задачу.
Читать подробнее
Услуги по теме
Проводим превентивный аудит безопасности сайта до того, как вас взломали: ищем уязвимости по методологии OWASP — SQL-инъекции, XSS, дыры в правах и доступах, разбираем устаревшую CMS, плагины и настройки хостинга, делаем пентест-лайт «чёрным» и «белым» ящиком. На выходе — понятный отчёт с уязвимостями, оценкой риска и приоритизированным планом устранения. Работаем на фикс-смете.
Настраиваем Nginx на Ubuntu и Debian: reverse proxy, бесплатный SSL по Let's Encrypt, кэширование, gzip и brotli, балансировку и тюнинг под высокую нагрузку — чтобы сайт открывался мгновенно и держал пики. Конфигурации ваши.
Берём ваш сайт на абонентское обслуживание: мониторинг доступности, бэкапы, обновления и безопасность, доработки по часам и реакция на инциденты по SLA. Студия с 2008 года — поддерживаем сайты на любой CMS и самописном коде.
Проверяем, как сайт собирает и передаёт персональные данные: формы и отдельные согласия по 156-ФЗ, политику обработки ПДн, cookie и Метрику, локализацию базы и иностранные сервисы, уведомления в Роскомнадзор. Аудит сайта на 152-ФЗ проводят разработчики, поэтому найденные нарушения мы сами исправляем в коде, а документы готовим по шаблонам; для сложных случаев рекомендуем привлечь вашего юриста — работаем с ним в связке.