SE::DuckDuckGo - Scraper wyników wyszukiwania DuckDuckGo

Przegląd scrapera
Scraper wyników wyszukiwania DuckDuckGo. Dzięki scraperowi DuckDuckGo będziesz mógł uzyskiwać duże bazy linków, gotowych do dalszego wykorzystania. Możesz używać zapytań w takiej samej formie, w jakiej wpisujesz je w pasek wyszukiwania DuckDuckGo, włączając w to operatory wyszukiwania (intitle, inurl, site itp.). Więcej szczegółów na oficjalnej stronie DuckDuckGo Search Syntax.
Funkcjonalność A-Parser pozwala zapisywać ustawienia scrapowania scrapera DuckDuckGo do dalszego wykorzystania (presety), ustawiać harmonogram scrapowania i wiele więcej. Możesz korzystać z automatycznego mnożenia zapytań, podstawiania podzapytań z plików, generowania kombinacji alfanumerycznych i list w celu uzyskania maksymalnej możliwej liczby wyników.
Zapisywanie wyników jest możliwe w dowolnej formie i strukturze, której potrzebujesz, dzięki wbudowanemu potężnemu silnikowi szablonów Template Toolkit, który pozwala stosować dodatkową logikę do wyników i wyprowadzać dane w różnych formatach, w tym JSON, SQL i CSV.
Zbierane dane
- Linki, anchory i snippety z wyników wyszukiwania (
$serp.$i.link,$serp.$i.anchor,$serp.$i.snippet) - Linki, widoczne linki, anchory, snippety, domena i pozycja reklamy z wyników reklamowych (
$ads.$i.domain,$ads.$i.link,$ads.$i.visiblelink,$ads.$i.anchor,$ads.$i.snippet,$ads.$i.position,$ads.$i.page) - Lista powiązanych słów kluczowych (
$related.$i.key)

Możliwości
- Wsparcie dla wszystkich operatorów wyszukiwania DuckDuckGo (intitle:, inurl:, site: itp.). Więcej o operatorach wyszukiwania na oficjalnej stronie DuckDuckGo Search Syntax
- Określenie liczby stron (od 1 do 10)
- Oprócz wyników organicznych zbierane są bloki reklamowe oraz powiązane słowa kluczowe
- Możliwość scrapowania według wybranego regionu (opcja Region) i określenia języka wyników (opcja Language)
- Możliwość włączenia bezpiecznego wyszukiwania (opcja Safe search) i ograniczenia wyników czasowo (opcja Serp time)
- Osobne włączanie HTTP/2 dla strony wyszukiwania oraz dla zapytania o dane wyników
- Automatyczne przełączanie na wbudowaną przeglądarkę, jeśli DuckDuckGo nie zwraca danych wyników przez HTTP
Warianty użycia
- Zbieranie baz linków - dla A-Poster, XRumer, AllSubmitter itp.
- Sprawdzanie indeksacji stron
- Wyszukiwanie backlinków (wspomnień) o stronach
- Wszelkie inne warianty zakładające scrapowanie DuckDuckGo w tej czy innej formie
Zapytania
Jako zapytania należy podawać frazy wyszukiwania, na przykład:
Football
test
site:a-parser.com
scraper site:a-parser.com
test -site:tests.com
IoT filetype:pdf
Podstawianie zapytań
Możesz użyć wbudowanych makr do mnożenia zapytań, na przykład chcemy uzyskać bardzo dużą bazę forów, podajmy kilka głównych zapytań w różnych językach:
forum
forum
foro
论坛
W formacie zapytań wskażemy generowanie znaków od a do zzzz, ta metoda pozwala maksymalnie rotować wyniki wyszukiwania i uzyskiwać mnóstwo nowych unikalnych wyników:
$query {az:a:zzzz}
To makro utworzy 475254 dodatkowych zapytań dla każdego wyjściowego zapytania, co w sumie da 4 x 475254 = 1901016 zapytań, liczba imponująca, ale to żaden problem dla A-Parser. Przy prędkości 2000 zapytań na minutę takie zadanie zostanie przetworzone w zaledwie 16 godzin.
Użycie operatorów
Możesz używać operatorów wyszukiwania w formacie zapytania, dzięki czemu zostaną one automatycznie dodane do każdego zapytania z Twojej listy:
site:$query
Warianty wyprowadzania wyników
A-Parser obsługuje elastyczne formatowanie wyników dzięki wbudowanemu silnikowi szablonów Template Toolkit, co pozwala mu wyprowadzać wyniki w dowolnej formie, a także w ustrukturyzowanej, np. CSV lub JSON
Eksport listy linków
Analogicznie jak w SE::Google.
Linki + kotwice + snippety z wyprowadzeniem pozycji
Analogicznie jak w SE::Google.
Wyprowadzanie linków, kotwic i snippetów do tabeli CSV
Analogicznie jak w SE::Google.
Zapisywanie powiązanych słów kluczowych
Analogicznie jak w SE::Google.
Wyświetlanie bloków reklamowych
Analogicznie jak w SE::Google.
Zapisywanie w formacie SQL
Analogicznie jak w SE::Google.
Zrzut wyników do JSON
Analogicznie jak w SE::Google.
Obróbka wyników
A-Parser pozwala przetwarzać wyniki bezpośrednio podczas scrapowania, w tej sekcji przedstawiliśmy najpopularniejsze przypadki dla scrapera DuckDuckGo
Usuwanie duplikatów linków
Analogicznie jak w SE::Google.
Usuwanie duplikatów linków według domeny
Analogicznie jak w SE::Google.
Wyodrębnianie domen
Analogicznie jak w SE::Google.
Usuwanie tagów z kotwic i snippetów
Analogicznie jak w SE::Google.
Filtrowanie linków według występowania
Analogicznie jak w SE::Google.
Możliwe ustawienia
| Nazwa parametru | Wartość domyślna | Opis |
|---|---|---|
| Pages count | 5 | Liczba stron do scrapowania (od 1 do 10), scrapowanie może zakończyć się wcześniej, jeśli wyniki nie mają następnej strony |
| Region | US (English) | Wybór regionu wyników |
| Language | English (United States) | Wybór języka wyników |
| Safe search | Moderate | Bezpieczne wyszukiwanie: Strict, Moderate lub Off |
| Serp time | Any time | Okres wyszukiwania: ostatnie 24 godziny, tydzień, miesiąc, rok lub cały czas |
| Use HTTP/2 | ☐ | Określa, czy używać HTTP/2 zamiast HTTP/1.1 przy żądaniu strony wyszukiwania |
| Use HTTP/2 for links | ☐ | To samo dla żądania danych wyników |
| User agent | Chrome 150, Windows | Nagłówek User-Agent przy żądaniu stron, używany również w przeglądarce. Jeśli pozostanie pusty, zostanie podstawiony User-Agent aktualnej wersji Firefox |
| Get first link with browser pages count | 5 | Ile stron wbudowanej przeglądarki można używać jednocześnie. Przeglądarka jest potrzebna tylko do pobrania strony wyszukiwania: jeśli DuckDuckGo nie zwrócił danych wyników przez HTTP, kolejna próba jest wykonywana przez przeglądarkę |