Коротко. Парсить можно не любой сайт: у части источников есть защита от автоматического сбора. Это видно на старте, до оплаты, — пришлите адрес, я проверю и скажу честно.
Что парсится без проблем
Открытые каталоги, витрины, списки с пагинацией — то, что сайт и так показывает всем посетителям. Парсер ходит по страницам, забирает цены, названия, ссылки и складывает в таблицу. Демо-магазин, на котором можно посмотреть это вживую, собран именно как такая витрина: 100 позиций за 4 секунды, замер на живом прогоне.
Какие защиты встречаются
Ограничение частоты запросов. Сайт отвечает нормально, пока не запрашиваешь слишком быстро. Лечится темпом обхода и расписанием — сбор идёт медленнее, но идёт.
Капча. Если сайт начинает показывать проверку «я не робот», простой обход заканчивается. Тут цена вопроса растёт, и иногда честный ответ — «этот источник парсить не надо».
Данные за логином. Личные кабинеты и закрытые разделы — не паршу. Это уже не публичные данные, и задача превращается в другую.
Что происходит на старте
Вы присылаете адрес источника и список нужных полей. Я проверяю, как сайт отвечает скрипту, и называю цену и срок — или говорю, что не возьмусь. От 2 000 ₽, обычно 1–3 дня. Если источник защищён, вы узнаете это до оплаты, а не после.
Про устройство сбора подробнее — в глоссарии: что такое парсер. Услуга — «Парсер с выгрузкой в Excel».
Частые вопросы
Это законно? Сбор публичных данных (цены, каталоги, открытые списки) — обычная практика. Данные за логином и персональные данные — другая история, туда не лезу.
Сбор разовый или регулярный? Как нужно: разово в Excel или по расписанию в вашу базу. Расписание чуть дороже на старте, дальше работает само.
А если структура сайта изменится? Парсер перестанет находить поля — это видно по результату сразу. На такой случай есть помесячная поддержка или разовая правка.
Отдельная история — когда сайт не отвечает не из-за защиты, а из-за фильтрации на стороне сети: разбор такого случая.