Passer au contenu principal

SE::DuckDuckGo - Scraper de résultats de recherche DuckDuckGo

DuckDuckGo

Présentation du scraper

Scraper des résultats de recherche DuckDuckGo. Grâce au scraper DuckDuckGo, vous pourrez obtenir de vastes bases de liens prêts à l'emploi. Vous pouvez utiliser les requêtes telles que vous les saisissez dans la barre de recherche DuckDuckGo, y compris les opérateurs de recherche (intitle, inurl, site, etc.). Plus de détails sur la page officielle DuckDuckGo Search Syntax.

Les fonctionnalités d'A-Parser permettent de sauvegarder les paramètres du scraper DuckDuckGo pour une utilisation ultérieure (présélections), de définir un calendrier de collecte de données et bien plus encore. Vous pouvez utiliser la multiplication automatique des requêtes, la substitution de sous-requêtes à partir de fichiers, l'itération de combinaisons alphanumériques et de listes pour obtenir le maximum de résultats possible.

La sauvegarde des résultats est possible dans le format et la structure dont vous avez besoin, grâce au puissant moteur de gabarits intégré Template Toolkit qui permet d'appliquer une logique supplémentaire aux résultats et d'exporter les données dans divers formats, notamment JSON, SQL et CSV.

Données collectées

  • Liens, ancres et extraits des résultats ($serp.$i.link, $serp.$i.anchor, $serp.$i.snippet)
  • Liens, liens visibles, ancres, extraits, domaine et position publicitaire des blocs d'annonces ($ads.$i.domain, $ads.$i.link, $ads.$i.visiblelink, $ads.$i.anchor, $ads.$i.snippet, $ads.$i.position, $ads.$i.page)
  • Liste des mots-clés associés ($related.$i.key)
Données collectées

Possibilités

  • Prise en charge de tous les opérateurs de recherche DuckDuckGo (intitle:, inurl:, site:, etc.). Plus de détails sur les opérateurs de recherche sur la page officielle DuckDuckGo Search Syntax
  • Spécification du nombre de pages (de 1 à 10)
  • En plus des résultats organiques, collecte des blocs publicitaires et des mots-clés associés
  • Possibilité de scraper par région sélectionnée (option Region) et de spécifier la langue des résultats (option Language)
  • Possibilité d'activer la recherche sécurisée (option Safe search) et de limiter les résultats par période (option Serp time)
  • Activation séparée de HTTP/2 pour la page de recherche et pour la requête de données des résultats
  • Passage automatique au navigateur intégré si DuckDuckGo ne renvoie pas les données de résultats via HTTP

Cas d'utilisation

  • Collecte de bases de liens - pour A-Poster, XRumer, AllSubmitter, etc.
  • Vérification de l'indexation des sites
  • Recherche de backlinks (mentions) de sites
  • Toute autre variante impliquant la collecte de données DuckDuckGo sous une forme ou une autre

Requêtes

Comme requêtes, il est nécessaire d'indiquer des expressions de recherche, par exemple :

Football  
test
site:a-parser.com
scraper site:a-parser.com
test -site:tests.com
IoT filetype:pdf

Substitutions de requêtes

Vous pouvez utiliser les macros intégrées pour multiplier les requêtes, par exemple si nous voulons obtenir une très grande base de forums, indiquons quelques requêtes de base dans différentes langues :

forum
forum
foro
论坛

Dans le format de requête, indiquons une itération de caractères de a à zzzz, cette méthode permet de faire pivoter au maximum les résultats de recherche et d'obtenir de nombreux nouveaux résultats uniques :

$query {az:a:zzzz}

Cette macro créera 475254 requêtes supplémentaires pour chaque requête de recherche initiale, ce qui donnera au total 4 x 475254 = 1901016 requêtes de recherche, un chiffre impressionnant, mais ce n'est pas du tout un problème pour A-Parser. À une vitesse de 2000 requêtes par minute, une telle tâche sera traitée en seulement 16 heures.

Utilisation des opérateurs

Vous pouvez utiliser des opérateurs de recherche dans le format de la requête, ainsi ils seront automatiquement ajoutés à chaque requête de votre liste :

site:$query

Variantes d'affichage des résultats

A-Parser prend en charge un formatage flexible des résultats grâce au moteur de gabarits intégré Template Toolkit, ce qui lui permet d'afficher les résultats sous une forme arbitraire, ainsi que structurée, par exemple CSV ou JSON

Export d'une liste de liens

Identique à SE::Google.

Identique à SE::Google.

Identique à SE::Google.

Identique à SE::Google.

Sortie des blocs publicitaires

De la même manière que dans SE::Google.

Sauvegarde au format SQL

Identique à SE::Google.

Dump des résultats en JSON

Identique à SE::Google.

Traitement des résultats

A-Parser permet de traiter les résultats directement pendant la collecte de données, dans cette section nous avons listé les cas les plus populaires pour le scraper DuckDuckGo

Identique à SE::Google.

Identique à SE::Google.

Extraction de domaines

Identique à SE::Google.

Suppression des balises des ancres et snippets

Identique à SE::Google.

Identique à SE::Google.

Paramètres possibles

Nom du paramètreValeur par défautDescription
Pages count5Nombre de pages à collecter (de 1 à 10), la collecte de données peut se terminer plus tôt si les résultats n'ont pas de page suivante
RegionUS (English)Choix de la région des résultats
LanguageEnglish (United States)Choix de la langue des résultats
Safe searchModerateRecherche sécurisée : Strict, Moderate ou Off
Serp timeAny timePériode de recherche : par jour, semaine, mois, an ou pour toute la durée
Use HTTP/2Détermine s'il faut utiliser HTTP/2 au lieu de HTTP/1.1 lors de la requête de la page de recherche
Use HTTP/2 for linksIdem pour la requête des données des résultats
User agentChrome 150, WindowsEn-tête User-Agent lors de la requête des pages, également utilisé dans le navigateur. Si laissé vide, le User-Agent d'une version actuelle de Firefox sera utilisé
Get first link with browser pages count5Nombre de pages du navigateur intégré pouvant être utilisées simultanément. Le navigateur n'est nécessaire que pour obtenir la page de recherche : si DuckDuckGo n'a pas fourni les données des résultats via HTTP, la tentative suivante est effectuée via le navigateur