# Парсинг данных из открытых источников

> Собираем данные с сайтов, площадок объявлений, маркетплейсов и каталогов: нормализация, дедупликация, повторный сбор по расписанию.

Данные, которые нужны для решения, обычно уже опубликованы — на сайтах конкурентов, площадках объявлений, маркетплейсах, в реестрах и каталогах. Проблема не в том, что их нет, а в том, что они разбросаны по тысячам страниц и меняются каждый день. Собираем их в таблицу или в вашу базу — и держим актуальными.

[Обсудить задачу](https://it-zarya.ru/contacts/)

## Когда нас зовут

- Нужно понимать цены конкурентов, а руками это неделя работы каждый месяц
- Собираете базу объявлений или объектов, но она устаревает быстрее, чем заполняется
- Аналитик тратит половину времени на копирование данных вместо анализа
- У источника нет API — только сайт, где всё видно глазами
- Готовый сервис парсинга отдаёт не те поля или не работает с вашим источником

## Что входит в работу

- Разбор источника: где лежат данные, как устроена пагинация, что меняется со временем
- Сбор с сайтов, площадок объявлений, маркетплейсов, каталогов, реестров и открытых API
- Обход постраничной выдачи и фильтров — включая источники, где данные подгружаются скриптами
- Нормализация: приведение цен, единиц, адресов и названий к единому виду
- Дедупликация — одно объявление, размещённое трижды, не превращается в три записи
- Инкрементальный сбор: повторный запуск забирает только новое и изменившееся
- Доставка результата туда, где им будут пользоваться: Excel, CSV, база данных, ваш API, Google Таблицы
- Расписание и мониторинг: если источник поменял вёрстку, вы узнаете об этом от нас, а не из пустого отчёта

## Как идёт работа

1. **Смотрим источник.** Проверяем на живых страницах, какие поля реально доступны и в каком объёме. Это единственный способ обещать что-то предметно.
2. **Пробный сбор.** Небольшая выборка на реальных данных: вы видите, что получится, до того как оплачен весь объём.
3. **Сбор и нормализация.** Полный прогон, приведение к единому виду, проверка на дубли и пропуски.
4. **Передача и расписание.** Отдаём данные в нужном формате и, если нужно, ставим на повтор.

## Сколько это стоит

**от 60 000 ₽**

Цена зависит не от объёма данных, а от сопротивления источника: открытый каталог с постраничной выдачей — одна работа, площадка с динамической подгрузкой и защитой от роботов — совсем другая. После разбора источника называем стоимость и говорим прямо, если данные дешевле купить готовыми.

## Смежные услуги

- [Backend на Go](https://it-zarya.ru/services/golang/) — если объём и скорость сбора важнее простоты
- [Серверы и инфраструктура](https://it-zarya.ru/services/servers/) — расписание, повторные запуски и мониторинг сбора
- [Сквозная аналитика и BI](https://it-zarya.ru/services/analytics/) — собранные данные обычно нужны в отчёте, а не в файле

## Как это выглядело на практике

Селлер на маркетплейсе · схема FBS

### Данные оттуда, где документации нет

Разбирали закрытый антиботом API маркетплейса, у которого официальная документация машинно не читается: схемы восстанавливали по клиентским библиотекам и сверяли живыми вызовами. Так вскрылись отключённые методы и поля, которых нет в ответе, хотя они есть в фильтре запроса. Это обычная ситуация: работать приходится с тем, что источник отдаёт на самом деле, а не с тем, что обещает.

[Разбор целиком](https://it-zarya.ru/cases/ozon-labels/) · [Другие кейсы](https://it-zarya.ru/cases/)

## Вопросы, которые задают чаще всего

### Из какого источника вы можете собрать данные

Из любого, где данные видны человеку без авторизации: сайт, площадка объявлений, маркетплейс, каталог, реестр, открытый API. Если данные доступны только после входа в личный кабинет — это делается отдельно и по вашим доступам.

### Это законно

Мы работаем с общедоступной информацией и не собираем персональные данные. Если источник прямо запрещает автоматический сбор в своих правилах, мы говорим об этом до начала работ — решение остаётся за вами, а обходить запрет молча мы не станем.

### Что будет, когда сайт-источник поменяет вёрстку

Сборщик сломается — это вопрос времени для любого парсера. Поэтому мы ставим проверку: если данные перестали приходить или их стало подозрительно мало, приходит уведомление. Молчаливо пустой отчёт хуже явной ошибки.

### Чем это отличается от готовых сервисов парсинга

Готовый сервис умеет то, что в него заложили: типовые площадки и типовой набор полей. Мы делаем под конкретную задачу — с вашими полями, вашей логикой дедупликации и выгрузкой туда, где вы работаете. Если готовый сервис вашу задачу закрывает, честнее сказать об этом и не брать деньги.

### Сколько данных вы можете собрать

Ограничение обычно не в объёме, а в скорости, с которой источник готов их отдавать. Миллион записей собирается, вопрос лишь в том, за сколько дней и с какой нагрузкой на источник — её мы держим щадящей, чтобы не мешать чужому сайту работать.

## Что дальше

Напишите, что происходит у вас сейчас. Вернёмся с оценкой в часах и планом работ — до того, как вы что-то оплатите.

[Обсудить задачу](https://it-zarya.ru/contacts/) [itzarya@mail.ru](mailto:itzarya@mail.ru)

---

Источник: https://it-zarya.ru/services/parsing/ · IT-агентство «Заря» · itzarya@mail.ru
Markdown-версия любой страницы сайта — тот же адрес с `.md` на конце. Индекс для ассистентов: https://it-zarya.ru/llms.txt
