SE::Rambler - scraper de résultats de recherche Rambler

Présentation du scraper
Scraper de résultats de recherche Rambler. Grâce au scraper Rambler, vous pourrez obtenir de grandes bases de liens prêtes pour une utilisation ultérieure. Vous pouvez utiliser les requêtes sous la même forme que celle que vous saisissez dans la barre de recherche Rambler, y compris les opérateurs de recherche (site, etc.).
La fonctionnalité d'A-Parser permet de sauvegarder les paramètres de collecte de données du scraper Rambler pour une utilisation future (présélections), de définir un calendrier de collecte et bien plus encore. Vous pouvez utiliser la multiplication automatique des requêtes, la substitution de sous-requêtes à partir de fichiers, l'itération de combinaisons alphanumériques et de listes pour obtenir le maximum de résultats possible.
La sauvegarde des résultats est possible dans la forme et la structure dont vous avez besoin, grâce au puissant moteur de gabarits intégré Template Toolkit qui permet d'appliquer une logique supplémentaire aux résultats et d'afficher les données dans divers formats, y compris JSON, SQL et CSV.
Données collectées
$totalcount— nombre de résultats dans la recherche. Uniquement depuis la première page ; si le nombre est absent — vide$serp.$i.link,$serp.$i.anchor,$serp.$i.snippet— lien, ancre, extrait (snippet)$hints.$i.hint— mots-clés associés. Uniquement depuis la première page ; si aucune suggestion — vide

Fonctionnalités
- Support des opérateurs de recherche Rambler (url:, site:, inurl:, host:, rhost:, domain:)
- Jusqu'à 25 pages, pas plus de ~250 résultats
- Mots-clés associés (
$hints.$i.hint) - Type de résultats : bureau, mobile Android ou mobile iOS
Cas d'utilisation
- Collecte de bases de liens
- Évaluation de la concurrence pour les mots-clés
- Recherche de backlinks (mentions) de sites
- Tous les cas où il est nécessaire de scraper les résultats de recherche de Rambler
Requêtes
Indiquez les requêtes de la même manière que dans la recherche Rambler. Supposons que vous n'ayez besoin que des liens d'un seul site. Saisissez dans le champ des requêtes :
"acheter des portes" site:http://kp.ru
Substitutions de requêtes
Vous pouvez utiliser les macros intégrées pour multiplier les requêtes, par exemple si nous voulons obtenir une très grande base de forums, nous indiquerons plusieurs requêtes de base dans différentes langues :
forum
forum
foro
论坛
Dans le format des requêtes, nous indiquerons une itération de caractères de a à zzzz, cette méthode permet de faire pivoter au maximum les résultats de recherche et d'obtenir de nombreux nouveaux résultats uniques :
$query {az:a:zzzz}
Cette macro créera 475254 requêtes supplémentaires pour chaque requête de recherche initiale, ce qui donnera au total 4 x 475254 = 1901016 requêtes de recherche, un chiffre impressionnant, mais ce n'est pas du tout un problème pour A-Parser. À une vitesse de 2000 requêtes par minute, une telle tâche sera traitée en seulement 16 heures.
Utilisation des opérateurs
Vous pouvez utiliser des opérateurs de recherche dans le format de la requête, ainsi il sera automatiquement ajouté à chaque requête de votre liste :
site:$query
Variantes d'affichage des résultats
A-Parser prend en charge un formatage flexible des résultats grâce au moteur de gabarits intégré Template Toolkit, ce qui lui permet d'afficher les résultats sous une forme libre, ainsi que structurée, par exemple CSV ou JSON
Exportation d'une liste de liens
Liens + ancres + snippets avec affichage de la position
Affichage des liens, ancres et snippets dans un tableau CSV
Sauvegarde des mots-clés associés
Format du résultat :
$hints.format('$hint\n')
Exemple de résultat :
habrahabr
habr
habrahabr ru
xabra
livebusiness
eureka
comptable électronique
île d'elbe
elbe comptable électronique
habrahabr
...
Sauvegarde au format SQL
Dump des résultats en JSON
Traitement des résultats
A-Parser permet de traiter les résultats directement pendant la collecte de données, dans cette section nous avons listé les cas les plus populaires pour le scraper Rambler
Déduplication des liens
Déduplication des liens par domaine
Extraction de domaines
Suppression des balises des ancres et des snippets
Filtrage des liens par inclusion
Paramètres possibles
| Nom du paramètre | Valeur par défaut | Description |
|---|---|---|
| Device | Desktop | Appareil de rendu : desktop, mobile Android ou mobile iOS |
| Wait for soft captcha, sec (0 = ban) | 25 | Combien de secondes attendre pour la résolution du soft-captcha. 0 — bannir immédiatement le proxy |
| Page load timeout, sec | 20 | Délai d'attente pour le chargement de la page |
| Pages count | 5 | Nombre de pages à parser, 1–25. Rambler ne renvoie pas plus de ~250 résultats, donc le maximum de pages dépend de Links per page : 10 résultats → 25 p., 15 → 17 p., 30 → 8 p., 50 → 5 p. |
| Links per page | 10 | Résultats par page : 10 / 15 / 30 / 50 |
| Rambler region ID | ID de la région. IP hors CEI — Moscou. IP de la CEI — résultats par IP ou par cet ID s'il est défini. Comment trouver l'ID — ici | |
| Sort | Sites by relevance | Tri : Pages by relevance, Pages by date, Sites by relevance, Sites by date |
| Results filtering | Moderate | Filtre : Unrestricted, Moderate, Family search |
| Results language | Any language | Langue des résultats : n'importe laquelle ou Belarusian, English, German, French, Kazakh, Russian, Tatar, Turkish, Ukrainian |
| Serp time | Anytime | Période : Anytime, Past 24 hours, Past week, Past month |
| Results type | Any format | Type de documents : n'importe lequel ou pdf, doc, rtf, xls, ppt, swf, odt, ods, odp, odg |
| Exact match | ☐ | Correspondance exacte à la requête |
| Disable autocorrect | ☐ | Désactive l'autocorrection, collecte les données selon la requête spécifiée |
| Max concurrent browser pages | 10 | Nombre d'onglets de navigateur que le scraper maintient simultanément. Avec un grand nombre de threads, augmentez avec prudence — la charge sur la mémoire et le CPU augmente |
| Use sessions | ☑ | Conserve les bonnes sessions, moins d'erreurs, collecte de données plus rapide |
| Headless browser | ☑ | Navigateur sans fenêtre. Pour le débogage, décochez la case |