감지 방지 및 IP 로테이션 기능을 갖춘 자동화된 B2B 공급업체 데이터 수집 플랫폼
소싱 팀은 B2B 마켓플레이스 플랫폼에서 구조화된 비즈니스 데이터를 대규모로, 안정적으로, 차단되지 않고 수집하여 19개 이상의 제품 카테고리와 50개 이상의 국가에 걸쳐 포괄적인 공급업체 데이터베이스를 구축해야 했습니다.
프로젝트 상담하기
과제
B2B 플랫폼에서 대규모 공급업체 데이터베이스를 구축하는 데는 여러 기술적 장애물이 있었습니다:
- 봇 감지 방지 — 대상 플랫폼은 브라우저 핑거프린팅, 행동 분석, CAPTCHA 챌린지 및 속도 제한을 포함한 정교한 봇 감지 기능을 사용했습니다.
- 형식 비일관성 — 공급업체 프로필 레이아웃이 카테고리 및 지역에 따라 크게 달라져, 고정된 스크래핑 템플릿이 무용지물이 되었습니다.
- IP 차단 — 단일 IP에서 발생하는 대량 요청이 몇 분 내에 영구 차단을 유발했습니다.
- 데이터 볼륨 — 수십 개의 카테고리에 걸쳐 레코드당 80개 이상의 필드를 가진 50,000개 이상의 공급업체 프로필이 필요했습니다.
- 데이터 품질 — 추출된 데이터에는 중복된 레코드, 불완전한 레코드, 일관성 없는 형식이 포함되어 유효성 검사가 필요했습니다.
- 세션 관리 — 장기 스크래핑 세션은 플랫폼이 자동화된 패턴을 감지함에 따라 시간이 지남에 따라 성능이 저하되었습니다.
우리의 솔루션
저희는 다층적인 감지 방지, VPN 기반 IP 로테이션, 인간 행동 시뮬레이션, 구조화된 데이터 내보내기 기능을 갖춘 자동화된 B2B 데이터 수집 플랫폼을 구축하여 수만 개의 공급업체 기록을 안정적으로 수집할 수 있었습니다.
아키텍처
- 스크래핑 엔진: 회피 기능을 갖춘 브라우저 자동화를 위해 undetected ChromeDriver와 함께 Selenium 사용
- 감지 방지 계층: 브라우저 핑거프린트 무작위화, 인간 행동 시뮬레이션 및 CAPTCHA 감지
- IP 로테이션: 12개 이상의 전 세계 위치에서 프로그래밍 방식 서버 전환을 지원하는 VPN 관리자
- 데이터 처리: 유효성 검사를 위한 Pydantic 모델, 변환을 위한 pandas, 다중 형식 내보내기
- 구성: 카테고리, 국가, 속도 제한 및 감지 방지 매개변수를 위한 YAML 기반 설정
- 로깅 및 모니터링: 세션별 성공/실패율 추적을 포함하는 구조화된 로깅
감지 방지 아키텍처
브라우저 핑거프린트 회피
플랫폼은 각 세션에 대해 다음을 포함하는 무작위 브라우저 핑거프린트를 생성합니다:
- 화면 해상도, 색상 깊이 및 장치 픽셀 비율
- 네비게이터 속성 (platform, language, hardware concurrency)
- WebGL 공급업체 및 렌더러 정보
- 캔버스 및 오디오 핑거프린트 노이즈 주입
- 스푸핑된 플랫폼과 일치하는 실제와 같은 플러그인 및 글꼴 목록
- 모든 핑거프린트 속성에서 시간대 일관성
인간 행동 시뮬레이션
자연스러운 브라우징 패턴을 모방하기 위해 시스템은 다음을 구현합니다:
- 마우스 움직임 — 현실적인 가속 및 감속을 포함하는 Bézier 곡선 기반 경로
- 타이핑 시뮬레이션 — 가변적인 타이핑 속도와 가끔 발생하는 실제와 같은 오류
- 스크롤 패턴 — 다양한 행동 모드 (주의 깊은 읽기, 빠른 스캔, 산만한 브라우징)
- 클릭 주저 — 상호 작용 전 자연스러운 지연
- 세션 피로 — 인간의 피로를 모방하기 위한 장기 세션 동안의 행동 변화
- 휴식 시뮬레이션 — 장기 세션을 위한 무작위 일시 중지
CAPTCHA 감지 및 복구
- 다중 유형 감지 (reCAPTCHA, hCaptcha, Cloudflare 챌린지, 슬라이더 CAPTCHA)
- 각 감지에 대한 신뢰도 점수
- IP 로테이션, 세션 재설정, 연장된 지연을 포함한 복구 전략
- 디버깅을 위한 증거 수집 (스크린샷 및 HTML)
IP 로테이션 시스템
VPN 관리
- 12개 이상의 전 세계 서버 위치에 걸친 프로그래밍 방식 VPN 연결 관리
- IP 확인을 통한 자동 연결 상태 확인
- 문제 있는 위치를 피하기 위한 실패 서버 블랙리스트화
- 구성 가능한 로테이션 간격 (예: N개 요청마다)
- 자동 로테이션 트리거를 위한 요청 카운팅
- 활성 스크래핑 세션을 중단하지 않는 원활한 로테이션
데이터 추출 및 처리
추출된 데이터 필드 (80개 이상)
플랫폼은 여러 카테고리에 걸쳐 포괄적인 공급업체 정보를 추출합니다:
- 기본 정보 — 회사명, 위치 (국가, 주, 도시), 카테고리
- 연락처 — 이메일, 전화, WhatsApp, 웹사이트, 메시징 핸들
- 비즈니스 지표 — 사업 유형, 운영 연수, 연간 수익, 직원 수, 공장 규모, 인증 상태, 응답률
- 제품 정보 — 주요 제품, 카테고리, MOQ, 가격 범위, 리드 타임, 지불 조건, 맞춤화 옵션
- 인증 — 산업 인증 (ISO, 품질, 지속 가능성, 안전)
- 거래 정보 — 수출 비율, 대상 시장, 거래 조건, 생산 능력
데이터 유효성 검사 및 품질
- Pydantic 모델은 필드 유형, 형식 및 제약 조건을 적용합니다.
- 이메일 및 전화번호 형식 유효성 검사
- URL 정규화 및 확인
- 이메일, 전화, 회사명 전반에 걸친 중복 감지
- 최소 데이터 완전성 임계값 (60% 이상의 필드 커버리지 필요)
- 사업 유형 분류 및 정규화
내보내기 및 구성
데이터는 여러 형식 (CSV, 서식 있는 Excel, JSON)으로 내보내지며 다음 기준에 따라 구성됩니다:
- 카테고리 — 제품 카테고리별 개별 데이터셋
- 국가 — 공급업체 국가별 개별 데이터셋
- 마스터 목록 — 교차 카테고리 중복 제거가 포함된 결합 데이터셋
- 요약 보고서 — 추출율, 커버리지 및 데이터 품질에 대한 통계
구성 시스템
모든 동작은 다음을 포함하는 YAML 구성을 통해 제어됩니다:
- 하위 카테고리 및 검색어를 포함한 카테고리 정의
- 대상 국가 및 우선 지역
- 속도 제한 (분, 시간, 일별 요청 수)
- 감지 방지 설정 (로테이션 간격, 쿠키 지우기, 행동 플래그)
- 추출 필드 요구 사항 (필수 vs. 선택)
- 내보내기 설정 (중복 제거, 유효성 검사, 완전성 임계값)
주요 특징
- 다층 감지 방지 — 핑거프린트 회피, 행동 시뮬레이션 및 세션 관리
- VPN 기반 IP 로테이션 — 자동 로테이션 및 상태 확인 기능을 갖춘 12개 이상의 전 세계 위치
- 80개 이상의 데이터 필드 — 유효성 검사된 구조화된 데이터를 포함하는 포괄적인 공급업체 프로필
- 인간 행동 시뮬레이션 — Bézier 마우스 경로, 가변 타이핑, 실제와 같은 스크롤 패턴
- CAPTCHA 감지 및 복구 — 자동화된 복구 전략을 갖춘 다중 유형 감지
- 다중 형식 내보내기 — 카테고리/국가별 구성이 가능한 CSV, Excel, JSON
- 데이터 유효성 검사 — 중복 감지 및 완전성 점수 매기기를 포함하는 Pydantic 적용 스키마
- 구성 가능한 캠페인 — YAML 기반의 카테고리, 국가 및 속도 제한 구성
- 세션 관리 — 피로 시뮬레이션, 쿠키 로테이션 및 휴식 스케줄링
- 운영 쉘 스크립트 — 다양한 스크래핑 프로필을 위한 사전 구성된 러너
결과
기술 스택
caseStudyDetail.more 사례 연구
더 많은 기술 구현 사례를 살펴보세요
자주 묻는 질문
MicrocosmWorks는 50개 이상의 국가에 걸친 주거용 프록시 로테이션, Playwright와 스텔스 플러그인을 사용한 브라우저 지문 무작위화, 그리고 무작위 지연을 통한 사람과 유사한 요청 페이싱을 포함하는 다계층 회피 시스템을 구현했습니다. 이 시스템은 자연스러운 브라우징 패턴을 모방하고 사용자 에이전트 문자열을 교체함으로써 대상 사이트 전반에 걸쳐 2% 미만의 감지율을 유지합니다.
MicrocosmWorks는 각 대상 사이트의 감지 민감도에 따라 주거용, 데이터센터, 모바일 프록시 풀에 요청을 분산하는 지능형 프록시 관리 계층을 구성했습니다. 이 시스템은 IP당 요청 수를 추적하고 속도 제한에 근접하는 IP를 자동으로 회수하며, 10,000개 이상의 로테이션 IP 풀을 통해 지속적인 수집 용량을 보장합니다.
MicrocosmWorks는 수집된 모든 공급업체 기록에 대해 이메일 전송 가능성, 전화번호 형식 및 통신사 조회, 웹사이트 가용성, 주소 지오코딩을 검증하는 유효성 검사 파이프라인을 구축했습니다. 중복 감지는 회사 이름과 주소 필드에 대해 퍼지 매칭을 사용하여 중복 항목을 방지하며, 완전성 점수는 중요 필드가 누락된 기록에 플래그를 지정하여 재스크랩을 위해 표시합니다.
MicrocosmWorks는 모든 크롤링 주기마다 페이지 DOM 구조를 저장된 기준선과 비교하는 자동화된 구조 모니터링 시스템을 구현했습니다. 10% 이상의 셀렉터를 손상시키는 구조 변경이 감지되면, 시스템은 해당 소스의 데이터 수집을 일시 중지하고, 운영팀에 알리며, 많은 경우 LLM 기반 셀렉터 재생성 모듈을 사용하여 셀렉터를 자동 복구합니다.
MicrocosmWorks는 시간당 $20-$40의 요금으로 웹 스크래핑 플랫폼을 제공하며, 안티-탐지 조치, IP 로테이션, 유효성 검사 파이프라인, 관리자 대시보드를 포함하는 전체 공급업체 데이터 수집 시스템은 일반적으로 400-600 개발 시간이 소요됩니다. 대규모 운영을 위한 지속적인 프록시 비용은 수집량에 따라 일반적으로 월 $500-$2,000 정도입니다.