検出回避およびIPローテーション機能を備えた自動化されたB2Bサプライヤーデータ収集プラットフォーム
ソーシングチームは、B2Bマーケットプレイスプラットフォームから構造化されたビジネスデータを大規模に、信頼性高く、ブロックされることなく収集することで、19以上の製品カテゴリーと50以上の国々にわたる網羅的なサプライヤーデータベースを構築する必要がありました。
プロジェクトを相談する
課題
B2Bプラットフォームから大規模なサプライヤーデータベースを構築するにあたり、複数の技術的な課題がありました。
- ボット検出回避 — ターゲットとなるプラットフォームは、ブラウザフィンガープリンティング、行動分析、CAPTCHA認証、レート制限など、高度なボット検出技術を採用していました。
- フォーマットの不整合 — サプライヤープロファイルのレイアウトは、カテゴリーや地域によって大きく異なり、厳格なスクレイピングテンプレートでは対応できませんでした。
- IPブロッキング — 単一のIPからの大量のリクエストは、数分以内に永続的なブロックを引き起こしました。
- データ量 — 数十のカテゴリーにわたる50,000件以上のサプライヤープロファイルが必要であり、1レコードあたり80以上のフィールドがありました。
- データ品質 — 抽出されたデータには、重複、不完全なレコード、一貫性のないフォーマットが含まれており、検証が必要でした。
- セッション管理 — 長時間実行されるスクレイピングセッションは、プラットフォームが自動化されたパターンを検出するにつれて、時間とともに性能が低下しました。
私たちのソリューション
当社は、多層的な検出回避、VPNベースのIPローテーション、人間行動シミュレーション、構造化データのエクスポート機能を備えた自動化されたB2Bデータ収集プラットフォームを構築しました。これにより、数万件のサプライヤーレコードを確実に収集することが可能になりました。
アーキテクチャ
- スクレイピングエンジン: 検出回避機能を備えたブラウザ自動化のためのSeleniumとundetected ChromeDriver
- 検出回避レイヤー: ブラウザフィンガープリントのランダム化、人間行動シミュレーション、CAPTCHA検出
- IPローテーション: 12以上のグローバルロケーション間でプログラムによるサーバー切り替えを行うVPNマネージャー
- データ処理: 検証のためのPydanticモデル、変換のためのpandas、マルチフォーマットエクスポート
- 設定: カテゴリー、国、レート制限、検出回避パラメーターのためのYAMLベースの設定
- ロギングとモニタリング: セッションごとの成功/失敗率追跡を伴う構造化ロギング
検出回避アーキテクチャ
ブラウザフィンガープリント回避
プラットフォームは、各セッションにおいて以下の項目を含むランダム化されたブラウザフィンガープリントを生成します。
- 画面解像度、色深度、デバイスピクセル比
- Navigatorプロパティ (プラットフォーム、言語、ハードウェア同時実行数)
- WebGLベンダーおよびレンダラー情報
- Canvasおよびオーディオフィンガープリントノイズ注入
- 偽装されたプラットフォームに一致する現実的なプラグインおよびフォントリスト
- すべてのフィンガープリントプロパティ間でのタイムゾーンの一貫性
人間行動シミュレーション
自然なブラウジングパターンを模倣するために、システムは以下を実装しています。
- マウス移動 — 現実的な加速と減速を伴うベジェ曲線ベースのパス
- タイピングシミュレーション — 時折現実的なエラーを伴う可変タイピング速度
- スクロールパターン — 複数の行動モード (慎重な読書、高速スキャン、気まぐれなブラウジング)
- クリックの躊躇 — 操作前の自然な遅延
- セッション疲労 — 人間の疲労を模倣するための長時間のセッションにおける行動変化
- 休憩シミュレーション — 長時間セッションのためのランダムな一時停止
CAPTCHA検出と回復
- 複数タイプの検出 (reCAPTCHA, hCaptcha, Cloudflareチャレンジ, スライダーCAPTCHA)
- 各検出の信頼度スコアリング
- IPローテーション、セッションリセット、長時間の遅延を含む回復戦略
- デバッグのための証拠収集 (スクリーンショットとHTML)
IPローテーションシステム
VPN管理
- 12以上のグローバルサーバーロケーションにわたるプログラムによるVPN接続管理
- IPチェックによる自動接続ヘルス検証
- 問題のあるロケーションを避けるための失敗したサーバーのブラックリスト化
- 設定可能なローテーション間隔 (例: Nリクエストごと)
- 自動ローテーションをトリガーするためのリクエストカウント
- アクティブなスクレイピングセッションを中断することなくシームレスなローテーション
データ抽出と処理
抽出されるデータフィールド (80以上)
プラットフォームは、いくつかのカテゴリーにわたる包括的なサプライヤー情報を抽出します。
- 基本情報 — 会社名、所在地 (国、州、市)、カテゴリー
- 連絡先詳細 — メール、電話、WhatsApp、ウェブサイト、メッセージングハンドル
- ビジネス指標 — 事業形態、創業年数、年間収益、従業員数、工場規模、認証状況、応答率
- 製品情報 — 主要製品、カテゴリー、MOQ、価格帯、リードタイム、支払い条件、カスタマイズオプション
- 認証 — 業界認証 (ISO、品質、持続可能性、安全性)
- 貿易情報 — 輸出比率、ターゲット市場、貿易条件、生産能力
データ検証と品質
- Pydanticモデルはフィールドの型、フォーマット、制約を強制します
- メールアドレスと電話番号のフォーマット検証
- URLの正規化と検証
- メール、電話、会社名にわたる重複検出
- 最低データ完全性しきい値 (60%以上のフィールド網羅率が必要)
- 事業形態の分類と正規化
エクスポートと整理
データは複数のフォーマット (CSV, フォーマット付きExcel, JSON) でエクスポートされ、以下によって整理されます。
- カテゴリー — 製品カテゴリーごとの個別データセット
- 国 — サプライヤー国ごとの個別データセット
- マスターリスト — カテゴリー横断的な重複排除を伴う結合データセット
- サマリーレポート — 抽出率、カバレッジ、データ品質に関する統計
設定システム
すべての動作は、以下の項目を含むYAML設定によって制御されます。
- サブカテゴリーと検索語を含むカテゴリー定義
- ターゲット国と優先地域
- レート制限 (1分、1時間、1日あたりのリクエスト数)
- 検出回避設定 (ローテーション間隔、Cookieクリアリング、行動フラグ)
- 抽出フィールド要件 (必須 vs. オプション)
- エクスポート設定 (重複排除、検証、完全性しきい値)
主要機能
- 多層的な検出回避 — フィンガープリント回避、行動シミュレーション、セッション管理
- VPNベースのIPローテーション — 12以上のグローバルロケーションでの自動ローテーションとヘルスチェック
- 80以上のデータフィールド — 検証済みの構造化データを備えた包括的なサプライヤープロファイル
- 人間行動シミュレーション — ベジェ曲線マウスパス、可変タイピング、現実的なスクロールパターン
- CAPTCHA検出と回復 — 自動回復戦略を伴う複数タイプ検出
- マルチフォーマットエクスポート — カテゴリー/国別整理されたCSV, Excel, JSON
- データ検証 — 重複検出と完全性スコアリングを伴うPydantic強制スキーマ
- 設定可能なキャンペーン — YAML駆動のカテゴリー、国、レート制限設定
- セッション管理 — 疲労シミュレーション、Cookieローテーション、休憩スケジューリング
- 本番用シェルスクリプト — 異なるスクレイピングプロファイル用の事前設定済みランナー
成果
技術スタック
caseStudyDetail.more ケーススタディ
その他の技術実装事例をご覧ください
AIを活用したブログコンテンツのスクレイピング&生成プラットフォーム
メディア企業は、既存のウェブコンテンツをスクレイピングし、AIを使用して分析し、抽出したデータからオリジナルのSEO最適化されたブログ記事を生成することで、ブログコンテンツ作成を自動化できるインテリジェントなコンテンツプラットフォームを必要としていました。
Catant HR & ワークフォース管理プラットフォーム
Catantは、企業が従業員、給与計算、勤怠、およびコンプライアンスを単一のダッシュボードから管理できるよう支援する、モジュラー型のHRおよびワークフォース管理プラットフォームです。
よくある質問
MicrocosmWorksは、50以上の国にわたるレジデンシャルプロキシのローテーション、Playwrightとステルスプラグインを使用したブラウザフィンガープリントのランダム化、およびランダムな遅延を伴う人間のようなリクエストペース調整を含む多層回避システムを実装しています。このシステムは、自然なブラウジングパターンを模倣し、ユーザーエージェント文字列をローテーションさせることにより、ターゲットサイト全体で検出率を2%未満に維持しています。
MicrocosmWorksは、各ターゲットサイトの検出感度に基づいて、レジデンシャル、データセンター、モバイルの各プロキシプールにリクエストを分散させるインテリジェントなプロキシ管理レイヤーを構成しました。このシステムはIPごとのリクエスト数を追跡し、レートリミットに近づいているIPを自動的に停止させます。10,000を超えるローテーションIPのプールにより、継続的な収集能力が確保されています。
MicrocosmWorksは、収集された各サプライヤーレコードに対して、メール配信可能性、電話番号のフォーマットとキャリア検索、ウェブサイトの利用可能性、および住所のジオコーディングを検証するバリデーションパイプラインを構築しました。重複検出は、会社名と住所フィールドに対するファジーマッチングを用いて重複エントリーを防ぎます。また、完全性スコアは、重要なフィールドが欠落しているレコードを再スクレイピングのためにフラグ付けします。
MicrocosmWorksは、すべてのクロールサイクルでページのDOM構造を保存されたベースラインと比較する自動構造監視システムを実装しました。セレクターの10%以上を壊すような構造変更が検出された場合、システムはそのソースの収集を一時停止し、運用チームに警告を発し、多くの場合、LLMベースのセレクター再生成モジュールを使用してセレクターを自動修復します。
MicrocosmWorksでは、ウェブスクレイピングプラットフォームを1時間あたり20ドルから40ドルの料金で提供しています。検出対策、IPローテーション、検証パイプライン、および管理ダッシュボードを含む完全なサプライヤーデータ収集システムは、通常400〜600の開発時間を必要とします。大規模な運用における継続的なプロキシ費用は、収集量に応じて通常月額500ドルから2,000ドルかかります。