Автоматизована платформа для збору даних про B2B-постачальників з антидетект-функціями та ротацією IP
Команді із закупівель потрібно було створити комплексну базу даних постачальників у понад 19 категоріях товарів та у понад 50 країнах шляхом збору структурованих бізнес-даних з B2B-маркетплейсів — у великих обсягах, надійно та без блокування.
Обговоріть Ваш Проєкт
Виклик
Створення великомасштабної бази даних постачальників з B2B-платформ становило численні технічні перешкоди:
- Виявлення ботів — Цільові платформи використовували складні методи виявлення ботів, зокрема фінгерпринтинг браузера, поведінковий аналіз, CAPTCHA-виклики та обмеження частоти запитів (rate limiting)
- Непослідовність форматів — Макети профілів постачальників суттєво відрізнялися в різних категоріях та регіонах, ламаючи жорсткі шаблони скрапінгу
- Блокування IP — Великий обсяг запитів з однієї IP-адреси викликав постійні блокування протягом кількох хвилин
- Обсяг даних — Потрібно було понад 50 000 профілів постачальників у десятках категорій з понад 80 полями на кожен запис
- Якість даних — Витягнуті дані містили дублікати, неповні записи та непослідовні формати, що вимагало валідації
- Управління сесіями — Довготривалі сесії скрапінгу погіршувалися з часом, оскільки платформи виявляли автоматизовані патерни
Наше Рішення
Ми створили автоматизовану платформу для збору B2B-даних з багаторівневими антидетект-функціями, ротацією IP на основі VPN, симуляцією людської поведінки та експортом структурованих даних — здатну надійно збирати десятки тисяч записів про постачальників.
Архітектура
- Скрапінг-рушій: Selenium з undetected ChromeDriver для автоматизації браузера з уникненням виявлення
- Антидетект-рівень: Рандомізація фінгерпринтів браузера, симуляція людської поведінки та виявлення CAPTCHA
- Ротація IP: VPN-менеджер з програмним перемиканням серверів у понад 12 глобальних локаціях
- Обробка даних: Моделі Pydantic для валідації, pandas для трансформації, експорт у кількох форматах
- Конфігурація: Налаштування на основі YAML для категорій, країн, обмежень частоти запитів (rate limits) та параметрів антивиявлення
- Логування та моніторинг: Структуроване логування з відстеженням показників успіху/невдач для кожної сесії
Архітектура антивиявлення
Уникнення фінгерпринтів браузера
Платформа генерує рандомізовані фінгерпринти браузера для кожної сесії, що охоплюють:
- Роздільна здатність екрана, глибина кольору та щільність пікселів пристрою (device pixel ratio)
- Властивості Navigator (platform, language, hardware concurrency)
- Інформація про постачальника та рендерер WebGL
- Інжекція шуму у фінгерпринти Canvas та аудіо
- Реалістичні списки плагінів та шрифтів, що відповідають імітованій платформі
- Послідовність часового поясу для всіх властивостей фінгерпринту
Симуляція людської поведінки
Для імітації природних патернів перегляду система реалізує:
- Рух миші — Траєкторії на основі кривих Безьє (Bézier curve) з реалістичним прискоренням та уповільненням
- Симуляція набору тексту — Змінна швидкість набору тексту з випадковими реалістичними помилками
- Патерни прокручування — Кілька поведінкових режимів (уважне читання, швидке сканування, неуважний перегляд)
- Вагання перед кліком — Природні затримки перед взаємодіями
- Втома сесії — Зміни поведінки протягом тривалих сесій для імітації людської втоми
- Симуляція перерв — Випадкові паузи для розширених сесій
Виявлення та відновлення CAPTCHA
- Виявлення багатьох типів (reCAPTCHA, hCaptcha, Cloudflare challenges, slider CAPTCHAs)
- Оцінка достовірності для кожного виявлення
- Стратегії відновлення, що включають ротацію IP, скидання сесії та подовжені затримки
- Збір доказів (скріншоти та HTML) для налагодження
Система ротації IP
Управління VPN
- Програмне управління VPN-з'єднаннями у понад 12 глобальних локаціях серверів
- Автоматична перевірка справності з'єднання через IP-перевірки
- Внесення несправних серверів до чорного списку для уникнення проблемних локацій
- Інтервали ротації, що конфігуруються (наприклад, кожні N запитів)
- Підрахунок запитів для автоматичного запуску ротації
- Безперебійна ротація без переривання активних сесій скрапінгу
Витягування та обробка даних
Витягнуті поля даних (80+)
Платформа витягує комплексну інформацію про постачальників у кількох категоріях:
- Основна інформація — Назва компанії, місцезнаходження (країна, провінція, місто), категорія
- Контактні дані — Email, телефон, WhatsApp, вебсайт, ідентифікатори месенджерів
- Бізнес-показники — Тип бізнесу, роки роботи, річний дохід, кількість співробітників, розмір фабрики, статус верифікації, швидкість відповіді
- Інформація про продукт — Основні продукти, категорії, MOQ, цінові діапазони, терміни виконання замовлення (lead times), умови оплати, опції кастомізації
- Сертифікації — Галузеві сертифікації (ISO, якість, сталість, безпека)
- Торгова інформація — Відсоток експорту, цільові ринки, торгові умови, виробнича потужність
Валідація та якість даних
- Моделі Pydantic забезпечують дотримання типів полів, форматів та обмежень
- Валідація форматів Email та телефонних номерів
- Нормалізація та верифікація URL
- Виявлення дублікатів за Email, телефоном та назвою компанії
- Мінімальний поріг повноти даних (вимагається охоплення 60%+ полів)
- Класифікація та нормалізація типів бізнесу
Експорт та організація
Дані експортуються у кількох форматах (CSV, Excel з форматуванням, JSON) та організовуються за:
- Категорія — Окремі набори даних для кожної категорії продукту
- Країна — Окремі набори даних для кожної країни постачальника
- Головні списки — Комбіновані набори даних з дедуплікацією за різними категоріями
- Зведені звіти — Статистика щодо швидкості витягування, охоплення та якості даних
Система конфігурації
Вся поведінка контролюється через конфігурацію YAML, що охоплює:
- Визначення категорій з підкатегоріями та пошуковими термінами
- Цільові країни та пріоритетні регіони
- Обмеження частоти запитів (requests per minute, hour, and day)
- Налаштування антивиявлення (інтервали ротації, очищення файлів cookie, поведінкові прапорці)
- Вимоги до полів витягування (обов'язкові проти необов'язкових)
- Налаштування експорту (дедуплікація, валідація, пороги повноти)
Основні функції
- Багаторівневе антивиявлення — Уникнення фінгерпринтів, симуляція поведінки та управління сесіями
- Ротація IP на основі VPN — Понад 12 глобальних локацій з автоматичною ротацією та перевірками справності
- 80+ полів даних — Комплексні профілі постачальників з валідованими, структурованими даними
- Симуляція людської поведінки — Траєкторії миші Безьє, змінний набір тексту, реалістичні патерни прокручування
- Виявлення та відновлення CAPTCHA — Виявлення багатьох типів з автоматизованими стратегіями відновлення
- Експорт у кількох форматах — CSV, Excel та JSON з організацією за категоріями/країнами
- Валідація даних — Схеми, що забезпечуються Pydantic, з виявленням дублікатів та оцінкою повноти
- Кампанії, що конфігуруються — Конфігурація категорій, країн та обмежень частоти запитів (rate limit) на основі YAML
- Управління сесіями — Симуляція втоми, ротація файлів cookie та планування перерв
- Продакшн-скрипти оболонки — Попередньо налаштовані запускачі для різних профілів скрапінгу
Результати
Технологічний Стек
caseStudyDetail.more Кейси
Ознайомтесь з іншими нашими технічними впровадженнями
Платформа для скрапінгу та генерації контенту блогів на базі AI
Медіакомпанії була потрібна інтелектуальна контент-платформа, яка могла б автоматизувати створення контенту для блогів шляхом скрапінгу наявного веб-контенту, його аналізу за допомогою AI та генерації оригінальних, SEO-оптимізованих дописів у блогах з видобутих даних.
Платформа Catant для управління персоналом та робочою силою
Catant — це модульна платформа для управління персоналом та робочою силою, яка допомагає підприємствам керувати співробітниками, заробітною платою, відвідуваністю та відповідністю нормативним вимогам з однієї панелі керування.
Часті запитання
MicrocosmWorks впровадила багатошарову систему обходу, що включає ротацію резидентних проксі у понад 50 країнах, рандомізацію цифрових відбитків браузера, використовуючи Playwright зі stealth-плагінами, та людиноподібний темп запитів з рандомізованими затримками. Система підтримує рівень виявлення нижче 2% на цільових сайтах, імітуючи природні шаблони перегляду та ротуючи user agent strings.
MicrocosmWorks налаштувала інтелектуальний рівень керування проксі, який розподіляє запити між пулами житлових, датацентрових та мобільних проксі на основі чутливості виявлення кожного цільового сайту. Система відстежує кількість запитів на кожну IP-адресу та автоматично виводить з обігу IP-адреси, що наближаються до обмежень частоти запитів, з пулом понад 10 000 ротованих IP-адрес, що забезпечує безперервну здатність до збору даних.
MicrocosmWorks розробила конвеєр валідації, який перевіряє доставлюваність електронної пошти, формат номера телефону та визначення оператора зв'язку, доступність вебсайту та геокодування адреси для кожного зібраного запису постачальника. Виявлення дублікатів використовує нечітке зіставлення за полями назви компанії та адреси для запобігання дублюванню записів, а показники повноти позначають записи, яким бракує критично важливих полів, для повторного збору.
MicrocosmWorks впровадила автоматизовану систему моніторингу структури, яка порівнює структури DOM сторінок зі збереженими еталонними значеннями під час кожного циклу сканування. Коли виявляються структурні зміни, які порушують роботу понад 10% селекторів, система призупиняє збір даних для цього джерела, сповіщає команду експлуатації та в багатьох випадках автоматично відновлює селектори, використовуючи модуль регенерації селекторів на основі LLM.
MicrocosmWorks надає платформи для веб-скрейпінгу за ставками $20-$40/год, при цьому повна система збору даних про постачальників, включаючи заходи проти виявлення, ротацію IP, конвеєр валідації та адмін-панель, зазвичай потребує 400-600 годин розробки. Поточні витрати на проксі для масштабних операцій зазвичай становлять $500-$2,000/місяць залежно від обсягу збору даних.
Готові Трансформувати Свій Бізнес?
Давайте обговоримо, як ми можемо застосувати подібні рішення для ваших завдань.