A-Parser無限の可能性

すべての利点を1ページにまとめました。各機能の詳細はドキュメントで確認できます。

Windows
Linux
macOS (Docker)
背景にあるパーサーロゴ

タスクエディタ

1つのタスクで複数のスクレイパーを使用

1つのタスクで最大20個のスクレイパーを使用し、スレッドを均等に分配することでプロキシBANを減らし、解析速度を向上させます。

スクレイパープリセット

各スクレイパーの多数の設定を個別のプリセットに保存し、さまざまなタスクで再利用できます。

クエリビルダー

入力データを分割することで、クエリ形式を変更し、関連データを結果に追加できます。

クエリ整形

1つのタスク内でスクレイパーごとに別のクエリ形式を指定でき、整形実行順も制御できます。

クエリ重複排除

入力データに不安がある場合でも、A-Parserが無駄な作業を行わないようにします。

置換マクロ

クエリの自動拡張、ファイルからのサブクエリ置換、英数字の組み合わせやリストを順に展開できます。

結果整形

強力なTemplate Toolkitを使って、結果や出力データに追加ロジックを適用し、JSON、SQL、CSVなどさまざまな形式で出力できます。

結果重複排除

高度な重複排除機能により、取得する文字列、リンク、ドメインの一意性が保証されます。

結果フィルタリング

部分一致、数値比較、正規表現など、条件に合うデータだけを保存できます。

異なるファイルへの同時保存

異なるファイルに異なる形式を使い、追加条件やフィルタも適用できます。1つのタスク内で完結するため、解析リソースを節約できます。

タスクログ

各スレッドと各クエリの詳細ログにより、タスクのデバッグを素早く便利に行えます。

タスクチェーン

1つのタスクの結果を次のタスクのクエリとして渡し、異なるタスクを自動的に順番実行することでA-Parserのロジックを拡張できます。

重複排除DBの保存

複数タスクからデータベースを構築する場合、重複排除DBを保存することで常に新しい結果だけを取得できます。

スレッド数制御

各タスクで指定したスレッド数を使うことで、A-Parserがプロキシプランやサーバー資源を超えないようにできます。

タスクデバッガー

作成中のタスクをデバッガーで素早く確認できます。高速実行と見やすいログ表示が特徴です。

タスクキューとスケジューラ

複数タスクの追加

タスクキューにより、1つのタスクの完了を待つ必要がなくなります。独立したタスクを無制限に追加できます。

同時タスク実行

同時実行タスク数を制御し、結果取得までの総時間を大幅に短縮できます。

タスク管理

タスクの開始、一時停止、編集、削除が可能です。途中から再開すると、A-Parserが収集を継続します。

タスク優先度

大きなタスクキューでは、どのタスクを先に開始するかを制御することが重要です。

動的スレッド上限

全タスクに対するグローバルなスレッド上限を設定でき、A-Parserがアクティブなタスク間で自動分配します。

タスク履歴

完了済みタスクの完全な履歴にアクセスし、統計を確認し、再実行用にタスクを追加できます。

タスクスケジューラ

繰り返し実行の間隔を柔軟に設定して、タスクスケジューラで定期タスクを実行できます。

プロキシチェッカーとプロキシ管理

HTTP(S)とSOCKS4/5プロキシ対応

A-Parserはすべてのプロキシプロトコルに対応しており、プロキシチェッカーはすべての種類を同時にテストできます。

無制限のプロキシチェッカー

異なるプロキシソースごとに個別のプロキシチェッカーを追加でき、それぞれに独自の検証設定を持たせられます。

マルチスレッドのプロキシチェックとダウンロード

各プロキシチェッカーごとに、チェック用とダウンロード用のスレッド数を別々に管理できます。

認証付きプロキシ対応

プロキシチェッカーの設定や、個別の認証データを持つプロキシリストでアクセス資格情報を指定できます。

さまざまなチェックタイプ

A-Parserは、POSTメソッド対応、匿名性、応答時間などの各種パラメータでプロキシをチェックします。

プロキシチェックを無効にするオプション

プロキシが正常に動作していると確信している場合は、チェックを無効にしてリソースを節約できます。

タスクごとのプロキシチェッカー選択

各タスクで特定のプロキシソースを選択でき、柔軟なリソース配分が可能です。

スクレイパーごとのプロキシチェッカー選択

さらに柔軟に、1つのタスク内で異なるプロキシを使用できます。たとえば、GoogleスクレイパーとYandexスクレイパーで別のプロキシを使えます。

プロキシBAN

サービスがプロキシをBANした場合、A-Parserは指定時間そのプロキシの使用を停止し、失敗リクエストを減らします。

プロキシごとのスレッド制限

資源の使い過ぎを避けるため、プロキシごとの最大スレッド数を制限できます。

試行間でのプロキシ再利用

デフォルトでは、A-Parserは各データダウンロード試行ごとに一意のプロキシを使いますが、この挙動は変更できます。

プロキシの予約

一般利用から特定のプロキシを除外し、特定のタスクにのみ割り当てることができます。

柔軟な設定

すべての設定をプリセットに整理

設定のグループを別々のプリセットに保存し、さまざまなタスクで再利用できます。

各スクレイパーの詳細設定

たとえばGoogleスクレイパーでは、ページ数、1ページあたりの結果数、言語設定、ジオロケーションなどを指定できます。

インポートとエクスポート

設定やスクレイパーをエクスポートして共有したり、カタログの既製タスクをインポートしたりできます。

マルチスレッドとパフォーマンス

非同期アーキテクチャ

A-Parserは完全な非同期アーキテクチャ上に構築されており、最大3,000の同時非同期スレッドを実行できます。

多数の最適化

A-Parserは性能向上のために多くの最適化を行っており、コードのプロファイルと改善も継続しています。

数百万・数十億件のクエリと結果

クエリ数、クエリファイルのサイズ、結果数に制限はありません。

低いリソース消費

ほとんどのタスクは、標準的なオフィス用または家庭用コンピュータ、さらにエントリーレベルのVDSでも快適に動作します。

コアへの負荷分散

現在、A-Parserは最大4コアを効率的に使用できます。無制限コア対応ライセンスも近日提供予定です。

CAPTCHA認識

XEvilとCapMonsterとの統合

最も人気のあるCAPTCHA認識ソフトウェアが、reCAPTCHA v2を含む多くのCAPTCHAタイプに対応しています。

オンライン認識サービスとの統合

Anti-Captcha、RuCaptcha、CapMonster.cloud、2Captchaなど、多数のサービスとの統合に対応しています。

スクレイパー内認識サポート

CAPTCHA認識サポートは、すべての主要スクレイパーに組み込まれています。独自のJavaScriptスクレイパーからも利用できます。

正規表現ベースのプリセット開発

任意サイトからのデータ収集

Net::HTTPスクレイパーやHTML::LinkExtractorスパイダーから取得したデータに対して正規表現を適用できます。

変数と配列の操作

単一のデータ点を変数に、繰り返しブロック(リスト、表)を配列にまとめられます。テンプレートエンジンを使って便利な形式で出力できます。

標準スクレイパー機能の拡張

内蔵スクレイパーの元データに追加処理を適用できます(例: Google検索結果)。

ページネーションの処理

次ページへのリンクを正規表現で見つけ、A-Parserが全ページを自動で巡回します。

データ検証

正規表現を使って内容を検証したり、プロキシBANを確認したり、captchaを検出できます。失敗時はA-Parserが別のプロキシで自動再試行します。

追加結果処理

結果コンストラクタを使って、任意のスクレイピング結果に対し、正規表現による検索置換処理を行えます。

JavaScriptでスクレイパーを開発

シンプルで簡潔なJavaScriptコード

async/awaitを使った直線的で同期的な書き方のコードを、A-Parserがマルチスレッド環境で実行します。

プロキシとリトライの処理

データ抽出と変換のロジックに集中でき、プロキシ管理とリトライはA-Parserが自動で処理します。

TypeScriptサポート

最新のJavaScript(ES2020+)で書くことも、強力な型付けとシンタックスハイライトのためにTypeScriptを使うこともできます。

NodeJSモジュールの利用

巨大なNPMJSモジュールカタログを使って、A-Parserのデータ抽出・処理能力を無制限に拡張できます。

PuppeteerによるChrome制御とプロキシ対応

A-Parserは人気のPuppeteerライブラリにプロキシ対応を追加し、タブごとに異なるプロキシを自動利用できます。

内蔵・その他のJavaScriptスクレイパー呼び出し

内蔵またはその他のJavaScriptスクレイパーへリクエストを送信でき、任意に複雑なロジックを構築できます。

自動化とAPI

HTTP/JSON APIによる完全制御

自分のプログラムやスクリプトからHTTPリクエストを送信するか、NodeJS、Python、PHP、Perl向けの既製ライブラリを使えます。

タスク作成

プリセット名でタスクを追加することも、詳細設定を含む完全なJSON構造を渡すこともできます。

キュー管理

タスクキューを完全に制御し、タスク状態を追跡し、結果をダウンロードできます。

ブロッキングモードの単発・一括リクエスト

HTTPリクエストを送信し、データ収集が完了した時点で即座に結果を受け取れます。

Redis API

高負荷プロジェクト向けのソリューションです。無制限数のA-Parserインスタンスを接続し、Redisキューで最小レイテンシでAPIリクエストを処理できます。

API経由でA-Parserを更新

完全自動化のために、API呼び出しでA-Parserをリモート更新できます。

継続的な改善とサポート

2011年以降に140以上のA-Parserバージョンをリリース

A-Parserは常に進化しており、ユーザーに年々新しい機能を提供しています。

内蔵スクレイパーの定期更新

すべての内蔵スクレイパーを毎日自動テストしており、レイアウトや結果の変更に迅速に対応したアップデートを出せます。

テクニカルサポート

すべてのユーザーに無料のテクニカルサポートを提供しており、同種製品の中でも最良と広く評価されています。

教育資料

教育資料、サンプルプリセットやスクレイパー、YouTubeチャンネルでのチュートリアル動画を定期的に公開しています。

フォーラムでのフィードバックを重視

新機能やスクレイパーの多くは、ユーザーからの要望に基づいて開発されています。

有償サービス

当社プラットフォーム上でのカスタムスクレイパー開発や、業務ロジック・データベースとの連携を通じて、お客様の時間を節約できます。

最適なライセンスを選択

生涯ライセンス。アップデートは別売です

A-Parser Lite

GoogleとYandexの基本スクレイパー

$ 179
  • GoogleとYandexのスクレイパーが含まれます
  • 3か月分のアップデート
  • ボーナスプロキシ: 2週間20スレッド
  • サポート
人気

A-Parser Pro

すべてのスクレイパーにアクセス

$ 299
  • 110以上のスクレイパー一式
  • 独自のJavaScriptスクレイパーを作成できます
  • 6か月分のアップデート
  • ボーナスプロキシ: 1か月50スレッド
  • Liteプランの全機能を含みます

A-Parser Enterprise

すべてのスクレイパーとAPIにアクセス

$ 479
  • API制御
  • マルチコアタスク処理
  • Redis連携
  • Proプランの全機能を含みます

アップデート: 3か月$49、1年$149、生涯$399

有償サービス

カスタムスクレイパー開発

あらゆるデータはスクレイピングできると考えています。

あらゆるウェブサイトから、必要なデータを抽出するカスタムソリューションを提供します。

ご要望に合わせて、必要な形式で結果を出力するスクレイパーを作成します。