Khả năng không giới hạn trong A-Parser

Chúng tôi đã gom tất cả lợi ích vào một trang; thông tin chi tiết về từng tính năng có thể xem trong tài liệu.

Windows
Linux
macOS (Docker)
Các logo parser ở nền

Trình chỉnh sửa tác vụ

Nhiều parser trong một tác vụ

Dùng tối đa 20 parser trong một tác vụ duy nhất, phân bổ luồng đều để giảm chặn proxy và tăng tốc độ cào dữ liệu.

Preset parser

Nhiều cài đặt cho từng parser có thể được lưu vào các preset riêng và tái sử dụng trong nhiều tác vụ khác nhau.

Trình tạo truy vấn

Tách dữ liệu đầu vào cho phép bạn thay đổi định dạng truy vấn và ghi thêm dữ liệu liên quan vào kết quả.

Định dạng truy vấn

Một định dạng truy vấn riêng cho từng parser trong một tác vụ, với quyền kiểm soát thứ tự thực thi định dạng.

Khử trùng lặp truy vấn

Nếu bạn không chắc về dữ liệu đầu vào, A-Parser sẽ đảm bảo không có công việc thừa nào được thực hiện.

Macro thay thế

Mở rộng truy vấn tự động, thay thế subquery từ file và lặp qua các tổ hợp chữ-số và danh sách.

Định dạng kết quả

Template Toolkit mạnh mẽ cho phép bạn áp dụng logic bổ sung vào kết quả và xuất dữ liệu ở nhiều định dạng khác nhau, bao gồm JSON, SQL và CSV.

Loại bỏ trùng lặp kết quả

Khả năng loại bỏ trùng lặp nâng cao đảm bảo tính duy nhất của chuỗi, liên kết và domain bạn nhận được.

Lọc kết quả

Chỉ lưu dữ liệu phù hợp tiêu chí của bạn: khớp chuỗi con, so sánh số hoặc biểu thức chính quy.

Lưu đồng thời ra nhiều file

Dùng các định dạng khác nhau cho các file khác nhau và áp dụng điều kiện/lọc bổ sung, tất cả trong một tác vụ để tiết kiệm tài nguyên phân tích cú pháp.

Ghi log tác vụ

Log chi tiết cho từng luồng và từng truy vấn giúp debug tác vụ nhanh chóng và thuận tiện.

Chuỗi tác vụ

Mở rộng logic của A-Parser bằng cách tự động chạy nhiều tác vụ theo chuỗi, lấy kết quả của tác vụ trước làm truy vấn cho tác vụ tiếp theo.

Lưu cơ sở dữ liệu khử trùng lặp

Bạn đang xây dựng cơ sở dữ liệu từ nhiều tác vụ? Việc lưu các cơ sở dữ liệu khử trùng lặp đảm bảo bạn luôn chỉ nhận được kết quả mới.

Kiểm soát số lượng luồng

Bằng cách chạy mỗi tác vụ với số luồng được chỉ định, bạn có thể đảm bảo A-Parser không vượt quá gói proxy hoặc tài nguyên máy chủ của bạn.

Debugger tác vụ

Dùng debugger để nhanh chóng kiểm tra hoạt động của tác vụ ngay trong quá trình tạo, với tốc độ thực thi nhanh và hiển thị log rõ ràng.

Hàng đợi và bộ lập lịch tác vụ

Thêm nhiều tác vụ

Hàng đợi tác vụ giúp bạn không phải chờ một tác vụ hoàn thành. Thêm số lượng không giới hạn các tác vụ độc lập.

Thực thi tác vụ đồng thời

Kiểm soát số tác vụ chạy đồng thời, giảm đáng kể tổng thời gian để nhận kết quả.

Quản lý tác vụ

Khởi động, tạm dừng, chỉnh sửa hoặc xóa tác vụ. Tiếp tục tác vụ từ đúng nơi đã dừng; A-Parser sẽ tiếp tục thu thập thông tin.

Ưu tiên tác vụ

Với một hàng đợi lớn, việc kiểm soát tác vụ nào được chạy sớm hơn là rất quan trọng.

Giới hạn luồng động

Đặt một giới hạn luồng toàn cục cho tất cả tác vụ, và A-Parser sẽ tự động phân bổ luồng cho các tác vụ đang hoạt động.

Lịch sử tác vụ

Truy cập toàn bộ lịch sử các tác vụ đã hoàn thành, xem thống kê và thêm lại tác vụ để chạy lần nữa.

Bộ lập lịch tác vụ

Chạy các tác vụ lặp lại bằng bộ lập lịch với cài đặt linh hoạt cho khoảng thời gian lặp lại.

Proxy checker và quản lý proxy

Hỗ trợ proxy HTTP(S) và SOCKS4/5

A-Parser làm việc với tất cả giao thức proxy, và proxy checker có thể kiểm tra tất cả loại cùng lúc.

Proxy checker không giới hạn

Thêm các proxy checker riêng cho các nguồn proxy khác nhau, mỗi cái có cài đặt xác minh riêng.

Kiểm tra và tải proxy đa luồng

Quản lý số luồng kiểm tra và tải xuống riêng cho từng proxy checker.

Hỗ trợ proxy có xác thực

Chỉ định thông tin truy cập proxy trong cài đặt proxy checker hoặc trong danh sách proxy với dữ liệu xác thực riêng.

Nhiều kiểu kiểm tra khác nhau

A-Parser kiểm tra proxy về hỗ trợ phương thức POST, ẩn danh, thời gian phản hồi và các tham số khác.

Tùy chọn tắt kiểm tra proxy

Nếu bạn chắc chắn proxy của mình hoạt động, bạn có thể tắt kiểm tra để tiết kiệm tài nguyên.

Chọn proxy checker theo tác vụ

Với mỗi tác vụ, bạn có thể chọn các nguồn proxy cụ thể, cho phép phân bổ tài nguyên linh hoạt.

Chọn proxy checker theo parser

Để linh hoạt hơn nữa, hãy dùng các proxy khác nhau trong cùng một tác vụ, chẳng hạn proxy riêng cho parser Google và Yandex.

Chặn proxy

Nếu một dịch vụ chặn proxy, A-Parser sẽ ngừng sử dụng nó trong một khoảng thời gian xác định, giảm số request thất bại.

Giới hạn luồng theo proxy

Bạn có thể giới hạn số luồng tối đa cho mỗi proxy để tránh dùng quá mức tài nguyên của nó.

Tái sử dụng proxy giữa các lần thử

Theo mặc định, A-Parser dùng một proxy duy nhất cho mỗi lần tải dữ liệu, nhưng hành vi này có thể thay đổi.

Đặt trước proxy

Tính năng này cho phép bạn loại trừ một số proxy khỏi việc sử dụng chung và chỉ gán chúng cho những tác vụ cụ thể.

Cài đặt linh hoạt

Tất cả cài đặt được tổ chức theo preset

Lưu các nhóm cài đặt vào nhiều preset khác nhau và tái sử dụng trong các tác vụ khác nhau.

Cài đặt chi tiết cho từng parser

Ví dụ, parser Google cho phép chỉ định số trang, số kết quả mỗi trang, cài đặt ngôn ngữ, geolocation và nhiều hơn nữa.

Nhập và xuất

Xuất cài đặt và parser của bạn để chia sẻ với người khác, hoặc nhập các tác vụ có sẵn từ catalog của chúng tôi.

Đa luồng và hiệu năng

Kiến trúc bất đồng bộ

A-Parser được xây dựng trên kiến trúc hoàn toàn bất đồng bộ, có thể chạy tới 3.000 luồng bất đồng bộ đồng thời.

Nhiều tối ưu hóa

A-Parser áp dụng nhiều tối ưu hóa để có hiệu năng tốt hơn, và chúng tôi liên tục profiling và cải thiện mã nguồn.

Hàng triệu và hàng tỷ truy vấn/kết quả

Không có giới hạn về số lượng truy vấn, kích thước file truy vấn hay số lượng kết quả.

Tiêu thụ tài nguyên thấp

Hầu hết tác vụ chạy mượt trên mọi máy tính văn phòng hoặc gia đình tiêu chuẩn, cũng như mọi VDS cấp thấp.

Phân bổ tải giữa các lõi

Hiện tại, A-Parser có thể sử dụng hiệu quả tới 4 lõi xử lý. Sắp ra mắt bản quyền hỗ trợ không giới hạn lõi.

Nhận diện CAPTCHA

Tích hợp với XEvil và CapMonster

Phần mềm nhận diện CAPTCHA phổ biến nhất hỗ trợ nhiều loại CAPTCHA, bao gồm reCAPTCHA v2.

Tích hợp với các dịch vụ nhận diện trực tuyến

Chúng tôi hỗ trợ tích hợp với phần lớn các dịch vụ, bao gồm Anti-Captcha, RuCaptcha, CapMonster.cloud, 2Captcha và các dịch vụ khác.

Hỗ trợ nhận diện ngay trong công cụ cào dữ liệu

Hỗ trợ nhận diện CAPTCHA được tích hợp trong tất cả các công cụ cào dữ liệu phổ biến. Bạn cũng có thể dùng nó từ các công cụ cào dữ liệu JavaScript tùy chỉnh của riêng mình.

Phát triển preset dựa trên biểu thức chính quy

Thu thập dữ liệu từ các website bất kỳ

Áp dụng biểu thức chính quy cho dữ liệu lấy từ công cụ cào dữ liệu Net::HTTP hoặc spider HTML::LinkExtractor.

Làm việc với biến và mảng

Thu thập các điểm dữ liệu đơn lẻ vào biến hoặc các khối lặp lại (danh sách, bảng) vào mảng. Xuất dữ liệu ở định dạng thuận tiện bằng công cụ template.

Mở rộng khả năng của công cụ cào dữ liệu chuẩn

Bạn có thể áp dụng xử lý bổ sung cho dữ liệu nguồn của tất cả công cụ cào dữ liệu tích hợp (ví dụ: kết quả tìm kiếm Google).

Điều hướng phân trang

Dùng biểu thức chính quy để tìm liên kết tới trang tiếp theo của phân trang, và A-Parser sẽ tự động đi qua tất cả các trang.

Xác thực dữ liệu

Dùng biểu thức chính quy để xác thực nội dung, kiểm tra chặn proxy hoặc phát hiện CAPTCHA. A-Parser sẽ tự động thử lại với proxy khác khi thất bại.

Xử lý kết quả bổ sung

Với result constructor, bạn có thể thực hiện các thao tác tìm và thay thế bằng biểu thức chính quy trên bất kỳ kết quả cào nào.

Phát triển công cụ cào dữ liệu bằng JavaScript

Mã JavaScript đơn giản và gọn gàng

Mã nguồn tuyến tính, kiểu đồng bộ, dùng async/await, và A-Parser sẽ thực thi nó trong môi trường đa luồng.

Xử lý proxy và retry

A-Parser cho phép bạn tập trung vào việc viết mã trích xuất và chuyển đổi dữ liệu, đồng thời tự động xử lý toàn bộ việc quản lý proxy và retry.

Hỗ trợ TypeScript

Viết bằng JavaScript hiện đại (ES2020+) hoặc dùng TypeScript để có kiểu dữ liệu mạnh và tô sáng cú pháp.

Dùng các module NodeJS

Danh mục module NPMJS khổng lồ cho phép bạn mở rộng khả năng trích xuất và xử lý dữ liệu của A-Parser không giới hạn.

Điều khiển Chrome qua Puppeteer có hỗ trợ proxy

A-Parser bổ sung hỗ trợ proxy cho thư viện Puppeteer phổ biến, cho phép dùng tự động các proxy khác nhau cho từng tab.

Gọi công cụ cào dữ liệu JavaScript tích hợp và công cụ cào dữ liệu khác

Bạn có thể gửi request tới bất kỳ công cụ cào dữ liệu tích hợp nào hoặc công cụ cào dữ liệu JavaScript khác, cho phép tạo logic phức tạp tùy ý.

Tự động hóa và API

Kiểm soát hoàn toàn qua HTTP/JSON API

Gửi HTTP request từ các chương trình và script của riêng bạn, hoặc dùng các thư viện có sẵn của chúng tôi cho NodeJS, Python, PHP và Perl.

Tạo tác vụ

Thêm tác vụ bằng tên preset hoặc bằng cách cung cấp một cấu trúc JSON đầy đủ với các cài đặt chi tiết.

Quản lý hàng đợi

Giành quyền kiểm soát hoàn toàn hàng đợi tác vụ, theo dõi trạng thái tác vụ và tải kết quả xuống.

Request đơn và hàng loạt ở chế độ blocking

Gửi một HTTP request và nhận kết quả ngay khi việc thu thập dữ liệu hoàn tất.

Redis API

Giải pháp của chúng tôi cho các dự án tải cao. Kết nối vô số instance A-Parser để xử lý request API trong hàng đợi Redis với độ trễ tối thiểu.

Cập nhật A-Parser qua API

Để tự động hóa hoàn toàn, có thể cập nhật A-Parser từ xa thông qua một API call.

Cải tiến và hỗ trợ liên tục

140+ phiên bản A-Parser được phát hành từ năm 2011

Sự phát triển không ngừng của A-Parser mang đến cho người dùng chúng tôi những khả năng mới qua từng năm.

Cập nhật thường xuyên cho công cụ tích hợp

Chúng tôi kiểm tra tự động tất cả công cụ tích hợp mỗi ngày, nhờ đó có thể phát hành cập nhật kịp thời khi có bất kỳ thay đổi nào về layout hay kết quả.

Hỗ trợ kỹ thuật

Hỗ trợ kỹ thuật miễn phí có sẵn cho tất cả người dùng và được người dùng đánh giá là tốt nhất trong số các sản phẩm tương tự.

Tài liệu hướng dẫn

Chúng tôi thường xuyên phát hành tài liệu hướng dẫn, preset mẫu và công cụ mẫu, cũng như video hướng dẫn trên kênh YouTube của mình.

Chúng tôi lắng nghe phản hồi của bạn trên diễn đàn

Hầu hết các tính năng mới và công cụ mới đều được phát triển dựa trên yêu cầu của người dùng.

Dịch vụ trả phí

Chúng tôi có thể tiết kiệm thời gian cho bạn bằng cách cung cấp phát triển công cụ cào dữ liệu tùy chỉnh trên nền tảng của mình, cũng như tích hợp với logic kinh doanh và cơ sở dữ liệu của bạn.

Chọn bản quyền phù hợp

Bản quyền trọn đời, cập nhật được mua riêng

A-Parser Lite

Các công cụ cào dữ liệu Google và Yandex cơ bản

$ 179
  • Bao gồm công cụ cào dữ liệu Google & Yandex
  • 3 tháng cập nhật
  • Proxy thưởng: 20 luồng trong 2 tuần
  • Hỗ trợ
Phổ biến

A-Parser Pro

Truy cập toàn bộ công cụ cào dữ liệu

$ 299
  • Bộ công cụ cào dữ liệu 110+
  • Tự tạo công cụ cào dữ liệu JavaScript
  • 6 tháng cập nhật
  • Proxy thưởng: 50 luồng trong 1 tháng
  • Bao gồm tất cả tính năng của gói Lite

A-Parser Enterprise

Truy cập tất cả công cụ cào dữ liệu và API

$ 479
  • Điều khiển qua API
  • Xử lý tác vụ đa lõi
  • Tích hợp Redis
  • Bao gồm tất cả tính năng của gói Pro

Cập nhật: $49 cho 3 tháng, $149 cho 1 năm hoặc $399 trọn đời

Giải pháp trả phí

Phát triển công cụ cào dữ liệu tùy chỉnh

Chúng tôi tin rằng mọi dữ liệu đều có thể được cào.

Chúng tôi cung cấp giải pháp tùy chỉnh để lấy bất kỳ dữ liệu nào từ bất kỳ website nào.

Chúng tôi sẽ tạo một công cụ cào dữ liệu xuất kết quả theo định dạng bạn cần, dựa trên yêu cầu của bạn.