Автоматизована платформа для збору даних про B2B-постачальників з анти-детектором та ротацією IP
Команді закупівель потрібно було створити комплексну базу даних постачальників для понад 19 категорій товарів та понад 50 країн шляхом збору структурованих бізнес-даних з B2B marketplace платформ — у великому масштабі, надійно та без блокувань.
Обговоріть Ваш Проєкт
Виклик
Створення великомасштабної бази даних постачальників з B2B платформ супроводжувалося численними технічними перешкодами:
- Виявлення ботів — Цільові платформи використовували складні методи bot detection, включаючи browser fingerprinting, behavioral analysis, CAPTCHA challenges та rate limiting
- Неузгодженість форматів — Макети профілів постачальників значно відрізнялися між категоріями та регіонами, що ламало жорсткі scraping templates
- Блокування IP — Великі обсяги запитів з одного IP-адреси призводили до постійних блокувань протягом декількох хвилин
- Обсяг даних — Потрібно було понад 50 000 профілів постачальників для десятків категорій з понад 80 полями на запис
- Якість даних — Витягнуті дані містили дублікати, неповні записи та неузгоджені формати, що вимагало валідації
- Керування сесіями — Довготривалі scraping sessions з часом погіршувалися, оскільки платформи виявляли автоматизовані шаблони
Наше Рішення
Ми створили автоматизовану B2B data collection platform з багатошаровим anti-detection, VPN-based IP rotation, human behavior simulation та structured data export — здатну надійно збирати десятки тисяч записів про постачальників.
Архітектура
- Scraping Engine: Selenium з undetected ChromeDriver для browser automation з ухиленням
- Anti-Detection Layer: Browser fingerprint randomization, human behavior simulation та CAPTCHA detection
- IP Rotation: VPN manager з програмним перемиканням серверів у понад 12 глобальних локаціях
- Обробка даних: Pydantic моделі для validation, pandas для transformation, multi-format export
- Конфігурація: YAML-based settings для категорій, країн, rate limits та anti-detection параметрів
- Логування та моніторинг: Structured logging з success/failure rate tracking per session
Архітектура анти-виявлення
Ухилення від фінгерпринтів браузера
Платформа генерує рандомізовані browser fingerprints для кожної сесії, що охоплюють:
- Screen resolution, color depth та device pixel ratio
- Navigator properties (platform, language, hardware concurrency)
- WebGL vendor та renderer information
- Canvas та audio fingerprint noise injection
- Реалістичні plugin та font lists, що відповідають імітованій платформі
- Timezone consistency для всіх fingerprint properties
Симуляція поведінки людини
Для імітації природних browsing patterns система реалізує:
- Рух миші — Bézier curve-based paths з реалістичним прискоренням та уповільненням
- Симуляція введення тексту — Variable typing speeds з випадковими реалістичними помилками
- Шаблони прокрутки — Кілька behavioral modes (уважне читання, швидке сканування, неуважний перегляд)
- Затримка кліку — Natural delays перед взаємодією
- Втома сесії — Behavior changes over long sessions для імітації людської втоми
- Симуляція перерв — Random pauses для розширених сесій
Виявлення та відновлення CAPTCHA
- Multi-type detection (reCAPTCHA, hCaptcha, Cloudflare challenges, slider CAPTCHAs)
- Confidence scoring для кожного виявлення
- Recovery strategies, включаючи IP rotation, session reset та extended delays
- Evidence collection (screenshots та HTML) для debugging
Система ротації IP
Керування VPN
- Програмне VPN connection management у понад 12 глобальних server locations
- Automatic connection health verification за допомогою IP checks
- Failed server blacklisting, щоб уникнути problematic locations
- Configurable rotation intervals (наприклад, every N requests)
- Request counting для automatic rotation triggers
- Seamless rotation без переривання active scraping sessions
Витяг та обробка даних
Поля витягнутих даних (80+)
Платформа витягує комплексну інформацію про постачальників за кількома категоріями:
- Основна інформація — Company name, location (country, province, city), category
- Контактні дані — Email, phone, WhatsApp, website, messaging handles
- Бізнес-метрики — Business type, years in operation, annual revenue, employee count, factory size, verification status, response rate
- Інформація про продукт — Main products, categories, MOQ, price ranges, lead times, payment terms, customization options
- Сертифікації — Industry certifications (ISO, quality, sustainability, safety)
- Торгова інформація — Export percentage, target markets, trade terms, production capacity
Валідація та якість даних
- Pydantic моделі забезпечують дотримання field types, formats та constraints
- Email та phone number format validation
- URL normalization та verification
- Duplicate detection за Email, phone та company name
- Minimum data completeness threshold (вимагається field coverage 60%+)
- Business type classification та normalization
Експорт та організація
Дані експортуються в декількох форматах (CSV, Excel з форматуванням, JSON) та організовуються за:
- Категорія — Окремі datasets per product category
- Країна — Окремі datasets per supplier country
- Основні списки — Combined datasets з cross-category deduplication
- Підсумкові звіти — Statistics on extraction rates, coverage та data quality
Система конфігурації
Вся поведінка контролюється через YAML configuration, що охоплює:
- Category definitions з subcategories та search terms
- Target countries та priority regions
- Rate limiting (requests per minute, hour та day)
- Anti-detection settings (rotation intervals, cookie clearing, behavioral flags)
- Extraction field requirements (required vs. optional)
- Export settings (deduplication, validation, completeness thresholds)
Ключові особливості
- Багатошарове Anti-Detection — Fingerprint evasion, behavior simulation та session management
- Ротація IP на основі VPN — Понад 12 глобальних локацій з automatic rotation та health checks
- Понад 80 полів даних — Комплексні supplier profiles з validated, structured data
- Симуляція поведінки людини — Bézier mouse paths, variable typing, realistic scrolling patterns
- Виявлення та відновлення CAPTCHA — Multi-type detection з automated recovery strategies
- Багатоформатний експорт — CSV, Excel та JSON з category/country organization
- Валідація даних — Pydantic-enforced schemas з duplicate detection та completeness scoring
- Конфігуровані кампанії — YAML-driven category, country та rate limit configuration
- Керування сесіями — Fatigue simulation, cookie rotation та break scheduling
- Production Shell Scripts — Pre-configured runners для різних scraping profiles
Результати
Технологічний Стек
caseStudyDetail.more Кейси
Ознайомтесь з іншими нашими технічними впровадженнями
Платформа для парсингу та генерації контенту блогів на базі AI
Медіакомпанії потрібна була інтелектуальна контент-платформа, здатна автоматизувати створення контенту для блогів шляхом парсингу наявного вебконтенту, аналізуючи його за допомогою AI та генеруючи оригінальні, SEO-оптимізовані дописи в блогах з вилучених даних.
Платформа Catant для управління персоналом та робочою силою
Catant — це модульна платформа для управління персоналом та робочою силою, яка допомагає підприємствам керувати співробітниками, заробітною платою, відвідуваністю та відповідністю нормативним вимогам з однієї панелі керування.
Часті запитання
MicrocosmWorks впровадила багатошарову систему обходу, що включає ротацію резидентних проксі у понад 50 країнах, рандомізацію цифрових відбитків браузера, використовуючи Playwright зі stealth-плагінами, та людиноподібний темп запитів з рандомізованими затримками. Система підтримує рівень виявлення нижче 2% на цільових сайтах, імітуючи природні шаблони перегляду та ротуючи user agent strings.
MicrocosmWorks налаштувала інтелектуальний рівень керування проксі, який розподіляє запити між пулами житлових, датацентрових та мобільних проксі на основі чутливості виявлення кожного цільового сайту. Система відстежує кількість запитів на кожну IP-адресу та автоматично виводить з обігу IP-адреси, що наближаються до обмежень частоти запитів, з пулом понад 10 000 ротованих IP-адрес, що забезпечує безперервну здатність до збору даних.
MicrocosmWorks розробила конвеєр валідації, який перевіряє доставлюваність електронної пошти, формат номера телефону та визначення оператора зв'язку, доступність вебсайту та геокодування адреси для кожного зібраного запису постачальника. Виявлення дублікатів використовує нечітке зіставлення за полями назви компанії та адреси для запобігання дублюванню записів, а показники повноти позначають записи, яким бракує критично важливих полів, для повторного збору.
MicrocosmWorks впровадила автоматизовану систему моніторингу структури, яка порівнює структури DOM сторінок зі збереженими еталонними значеннями під час кожного циклу сканування. Коли виявляються структурні зміни, які порушують роботу понад 10% селекторів, система призупиняє збір даних для цього джерела, сповіщає команду експлуатації та в багатьох випадках автоматично відновлює селектори, використовуючи модуль регенерації селекторів на основі LLM.
MicrocosmWorks надає платформи для веб-скрейпінгу за ставками $20-$40/год, при цьому повна система збору даних про постачальників, включаючи заходи проти виявлення, ротацію IP, конвеєр валідації та адмін-панель, зазвичай потребує 400-600 годин розробки. Поточні витрати на проксі для масштабних операцій зазвичай становлять $500-$2,000/місяць залежно від обсягу збору даних.
Готові Трансформувати Свій Бізнес?
Давайте обговоримо, як ми можемо застосувати подібні рішення для ваших завдань.