A-Parser 的无限可能
我们把所有优势汇总在一页;每项功能的详细信息都可以在文档中查看。

任务编辑器
在单个任务中最多使用 20 个爬虫工具,均匀分配线程以减少代理封禁并提高抓取速度。
每个爬虫工具的众多设置都可以保存为独立预设,并在不同任务之间重复使用。
通过拆分输入数据,您可以更改查询格式,并将额外的相关数据写入结果。
在一个任务中为每个爬虫工具使用不同的查询格式,并可控制格式化执行顺序。
如果您对输入数据不够确定,A-Parser 会确保不会做重复工作。
自动扩展查询、从文件中替换子查询,以及遍历字母数字组合和列表。
强大的 Template Toolkit 允许您为结果和输出数据添加额外逻辑,并以 JSON、SQL 和 CSV 等多种格式输出。
高级去重能力可确保您收到的字符串、链接和域名具有唯一性。
只保存符合条件的数据:子串匹配、数值比较或正则表达式。
在单个任务中为不同文件使用不同格式,并应用额外条件和过滤器,从而节省抓取资源。
每个线程和每个查询的详细日志,方便快速而高效地调试任务。
通过自动按顺序运行不同任务并将一个任务的结果作为下一个任务的查询,扩展 A-Parser 的逻辑。
需要从多个任务构建数据库吗?保存去重数据库可确保您始终只获得新结果。
通过为每个任务指定线程数,您可以确保 A-Parser 不会超出您的代理套餐或服务器资源。
使用调试器可以在任务创建期间快速验证其运行情况,执行速度快且日志显示清晰。
任务队列与调度器
任务队列让您无需等待一个任务完成即可继续。可添加不限数量的独立任务。
控制同时运行的任务数量,显著缩短获取结果的总时间。
启动、暂停、编辑或删除任务。可以从上次中断的位置继续;A-Parser 会继续采集信息。
当任务队列很长时,控制哪些任务先启动就非常重要。
为所有任务设置全局线程上限后,A-Parser 会自动在活跃任务之间分配线程。
可以访问已完成任务的完整历史、查看统计信息,并将任务再次加入运行。
使用任务调度器按灵活的重复间隔来运行周期性任务。
代理检查器与代理管理
A-Parser 支持所有代理协议,代理检查器可以同时测试所有类型。
可以为不同代理来源添加独立的代理检查器,每个检查器都有自己的验证设置。
可以为每个代理检查器分别管理检查和下载线程数量。
可在代理检查器设置中或带有独立认证数据的代理列表中指定代理访问凭据。
A-Parser 会检查代理是否支持 POST 方法、匿名性、响应时间以及其他参数。
如果您确认代理可以正常工作,可以关闭检查以节省资源。
对于每个任务,您可以选择特定的代理来源,从而更灵活地分配资源。
为了更高的灵活性,可以在单个任务中为不同爬虫工具使用不同代理,例如为 Google 和 Yandex 爬虫工具分别指定代理。
如果某项服务封禁了某个代理,A-Parser 会在指定时间内停止使用它,从而减少失败请求。
您可以限制每个代理的最大线程数,以避免过度使用其资源。
默认情况下,A-Parser 会为每次数据下载尝试使用唯一代理,但此行为可以更改。
此功能允许您将某些代理排除在通用使用之外,并仅分配给特定任务。
灵活设置
将设置分组保存为不同预设,并在各种任务中重复使用。
例如,Google 爬虫工具允许指定页数、每页结果数、语言设置、地理位置等更多参数。
导出您的设置和爬虫工具与他人共享,或者从我们的目录中导入现成任务。
多线程与性能
A-Parser 基于完全异步的架构构建,能够运行多达 3,000 个并发异步线程。
A-Parser 采用了许多性能优化,我们也在持续进行性能分析和代码改进。
查询数量、查询文件大小和结果数量都没有限制。
大多数任务都能在任何普通办公电脑、家用电脑以及入门级 VDS 上顺利运行。
目前,A-Parser 可以高效使用最多 4 个处理器核心。支持无限核心的许可证即将推出。
验证码识别
最流行的验证码识别软件支持多种 CAPTCHA,包括 reCAPTCHA v2。
我们支持与绝大多数服务集成,包括 Anti-Captcha、RuCaptcha、CapMonster.cloud、2Captcha 等。
所有热门爬虫工具都内置了验证码识别支持。您也可以在自己编写的 JavaScript 爬虫工具中使用它。
基于正则表达式开发预设
对从 Net::HTTP 爬虫工具或 HTML::LinkExtractor 爬虫工具获得的数据应用正则表达式。
将单个数据点收集到变量中,或将重复块(列表、表格)收集到数组中。使用模板引擎以便捷格式输出数据。
您可以对所有内置爬虫工具的源数据执行额外处理(例如 Google 搜索结果)。
使用正则表达式查找下一页分页链接,A-Parser 会自动浏览所有页面。
使用正则表达式验证内容、检查代理封禁或检测验证码。失败时,A-Parser 会自动使用其他代理重试。
借助结果构造器,您可以对任何抓取结果执行基于正则表达式的搜索与替换操作。
使用 JavaScript 开发爬虫工具
使用 async/await 编写线性、同步风格的代码,A-Parser 会在多线程环境中执行它。
A-Parser 让您专注于编写数据提取和转换逻辑,而代理管理和重试全部自动处理。
可使用现代 JavaScript(ES2020+)编写,也可以使用 TypeScript 获得更强的类型支持和语法高亮。
庞大的 NPMJS 模块目录让您可以无限扩展 A-Parser 的数据提取和处理能力。
A-Parser 为流行的 Puppeteer 库添加了代理支持,允许为不同标签页自动使用不同代理。
您可以向任何内置或其他 JavaScript 爬虫工具发送请求,从而创建任意复杂的逻辑。
自动化与 API
可从您自己的程序和脚本中发送 HTTP 请求,或使用我们为 NodeJS、Python、PHP 和 Perl 提供的现成库。
可通过预设名称添加任务,也可以通过提供带详细设置的完整 JSON 结构添加任务。
完整控制任务队列、跟踪任务状态并下载结果。
发送 HTTP 请求后,在数据采集完成时立即接收结果。
这是我们面向高负载项目的解决方案。可以将不限数量的 A-Parser 实例连接到 Redis 队列中,以最小延迟处理 API 请求。
为了实现完全自动化,可通过 API 调用远程更新 A-Parser。
持续改进与支持
A-Parser 的持续演进为用户带来年复一年的新能力。
我们会每天自动测试所有内置爬虫工具,并在布局或结果发生变化时及时发布更新。
所有用户都可获得免费技术支持,用户普遍认为它是同类产品中最好的。
我们会定期发布教育资料、示例预设和爬虫工具,以及 YouTube 频道上的教程视频。
大多数新功能和爬虫工具都是根据用户请求开发的。
我们可以通过平台上的定制爬虫工具开发,以及与您的业务逻辑和数据库集成,为您节省时间。
选择合适的许可证
终身许可证,更新需单独购买
更新:3 个月 $49,1 年 $149,或终身 $399
