Ga naar de hoofdinhoud

SE::Rambler - scraper voor de zoekresultaten van Rambler

img

Overzicht van de scraper

Scraper voor Rambler zoekresultaten. Dankzij de Rambler scraper kunt u grote databases met links verzamelen die klaar zijn voor verder gebruik. U kunt zoekopdrachten gebruiken in dezelfde vorm als u ze in de Rambler zoekbalk invoert, inclusief zoekoperatoren (site, enz.).

De functionaliteit van A-Parser maakt het mogelijk om instellingen voor gegevensextractie van de Rambler-scraper op te slaan voor toekomstig gebruik (presets), schema's voor gegevensextractie in te stellen en nog veel meer. U kunt automatische query-vermenigvuldiging gebruiken, subquery's uit bestanden invoegen, alfanumerieke combinaties en lijsten doorlopen om het maximaal mogelijke aantal resultaten te verkrijgen.

Het opslaan van resultaten is mogelijk in de vorm en structuur die u nodig heeft, dankzij de ingebouwde krachtige sjabloon-engine Template Toolkit waarmee u extra logica op de resultaten kunt toepassen en gegevens in verschillende formaten kunt uitvoeren, waaronder JSON, SQL en CSV.

Verzamelde gegevens

  • $totalcount — aantal resultaten in de zoekresultaten. Alleen van de eerste pagina; als er geen getal is — leeg
  • $serp.$i.link, $serp.$i.anchor, $serp.$i.snippet — link, anker, snippet
  • $hints.$i.hint — gerelateerde zoekwoorden. Alleen van de eerste pagina; als er geen suggesties zijn — leeg

welke gegevens verzamelt de scraper SE::Rambler

Mogelijkheden

  • Ondersteuning voor Rambler zoekoperatoren (url:, site:, inurl:, host:, rhost:, domain:)
  • Tot 25 pagina's, niet meer dan ~250 resultaten
  • Gerelateerde zoekwoorden ($hints.$i.hint)
  • Type weergave: desktop, mobiel Android of mobiel iOS

Varianten voor gebruik

  • Verzamelen van linkdatabases
  • Beoordeling van concurrentie voor trefwoorden
  • Zoeken naar backlinks (vermeldingen) van websites
  • Alle gevallen waarin u de zoekresultaten van Rambler moet scrapen

Zoekopdrachten

Geef zoekopdrachten op dezelfde manier op als in de zoekmachine van Rambler. Stel dat u alleen links van één website nodig heeft. Voer in het veld voor zoekopdrachten in:

"deuren kopen" site:http://kp.ru

Query-substituties

U kunt ingebouwde macro's gebruiken voor het vermenigvuldigen van zoekopdrachten, bijvoorbeeld als we een zeer grote database met forums willen verkrijgen, geven we enkele basiszoekopdrachten in verschillende talen op:

forum
forum
foro
论坛

In het query-formaat geven we een bereik van tekens op van a tot zzzz, deze methode maakt het mogelijk om de zoekresultaten maximaal te roteren en veel nieuwe unieke resultaten te verkrijgen:

$query {az:a:zzzz}

Deze macro zal 475254 extra zoekopdrachten maken voor elke oorspronkelijke zoekopdracht, wat in totaal 4 x 475254 = 1901016 zoekopdrachten oplevert, een indrukwekkend getal, maar dit is absoluut geen probleem voor A-Parser. Met een snelheid van 2000 verzoeken per minuut wordt een dergelijke taak in slechts 16 uur verwerkt.

Gebruik van operators

U kunt zoekoperators in het query-formaat gebruiken, zodat deze automatisch aan elke zoekopdracht uit uw lijst worden toegevoegd:

site:$query

Varianten voor resultaatuitvoer

A-Parser ondersteunt flexibele formattering van resultaten dankzij de ingebouwde sjabloon-engine Template Toolkit, waardoor resultaten in een willekeurige vorm kunnen worden uitgevoerd, evenals in gestructureerde formaten zoals CSV of JSON.

Export van een lijst met links

Hetzelfde als in SE::Google.

Hetzelfde als in SE::Google.

Hetzelfde als in SE::Google.

Resultaatformaat:

$hints.format('$hint\n')

Voorbeeldresultaat:

habrahabr
habr
habrahabr ru
xabra
livebusiness
eureka
elektronische boekhouder
eiland elba
elba elektronische boekhouder
habrahabr
...

Opslaan in SQL-formaat

Hetzelfde als in SE::Google.

Resultatendump in JSON

Hetzelfde als in SE::Google.

Verwerking van resultaten

A-Parser maakt het mogelijk om resultaten direct tijdens de gegevensextractie te verwerken, in deze sectie hebben we de meest populaire cases voor de Rambler-scraper opgenomen.

Hetzelfde als in SE::Google.

Hetzelfde als in SE::Google.

Domeinen extraheren

Hetzelfde als in SE::Google.

Tags verwijderen uit ankers en snippets

Hetzelfde als in SE::Google.

Hetzelfde als in SE::Google.

Mogelijke instellingen

Naam parameterStandaardwaardeBeschrijving
DeviceDesktopApparaat voor weergave: desktop, mobiel Android of mobiel iOS
Wait for soft captcha, sec (0 = ban)25Hoeveel seconden wachten op het oplossen van een soft-captcha. 0 — proxy direct bannen
Page load timeout, sec20Time-out voor het laden van de pagina
Pages count5Aantal te scrapen pagina's, 1–25. Rambler geeft niet meer dan ~250 resultaten, dus het maximum aantal pagina's hangt af van Links per page: 10 resultaten → 25 pag., 15 → 17 pag., 30 → 8 pag., 50 → 5 pag.
Links per page10Resultaten per pagina: 10 / 15 / 30 / 50
Rambler region IDRegio-ID. IP buiten het GOS — Moskou. IP binnen het GOS — resultaten op basis van IP of dit ID, indien opgegeven. Hoe u het ID kunt vinden — hier
SortSites by relevanceSortering: Pages by relevance, Pages by date, Sites by relevance, Sites by date
Results filteringModerateFilter: Unrestricted, Moderate, Family search
Results languageAny languageTaal van de resultaten: elke taal of Belarusian, English, German, French, Kazakh, Russian, Tatar, Turkish, Ukrainian
Serp timeAnytimePeriode: Anytime, Past 24 hours, Past week, Past month
Results typeAny formatDocumenttype: elk type of pdf, doc, rtf, xls, ppt, swf, odt, ods, odp, odg
Exact matchExacte overeenkomst met de zoekopdracht
Disable autocorrectSchakelt autocorrectie uit, scrapet resultaten voor de opgegeven zoekopdracht
Max concurrent browser pages10Hoeveel browsertabbladen de scraper tegelijkertijd openhoudt. Verhoog dit voorzichtig bij een groot aantal threads — de belasting op geheugen en CPU neemt toe
Use sessionsSlaat goede sessies op, minder fouten, snellere gegevensextractie
Headless browserBrowser zonder venster. Vink dit uit voor debugging