SE::Rambler - Scraper dei risultati di ricerca Rambler

Panoramica dello scraper
Scraper della SERP di Rambler. Grazie allo scraper Rambler potrete ottenere ampi database di link pronti per un ulteriore utilizzo. È possibile utilizzare le query nello stesso formato in cui vengono inserite nella barra di ricerca di Rambler, inclusi gli operatori di ricerca (site, ecc.).
La funzionalità di A-Parser consente di salvare le impostazioni di scraping dello scraper Rambler per un uso futuro (preset), impostare pianificazioni di scraping e molto altro. Puoi utilizzare la generazione automatica delle query, la sostituzione di sotto-query da file, l'iterazione di combinazioni alfanumeriche e liste per ottenere il massimo numero possibile di risultati.
Il salvataggio dei risultati è possibile nel formato e nella struttura necessari, grazie al potente motore di template integrato Template Toolkit che permette di applicare logica aggiuntiva ai risultati e di esportare i dati in vari formati, tra cui JSON, SQL e CSV.
Dati raccolti
$totalcount— numero totale di risultati nella SERP. Solo dalla prima pagina; se il numero non è presente — vuoto$serp.$i.link,$serp.$i.anchor,$serp.$i.snippet— link, anchor, snippet$hints.$i.hint— parole chiave correlate. Solo dalla prima pagina; se non ci sono suggerimenti — vuoto

Funzionalità
- Supporto per gli operatori di ricerca di Rambler (url:, site:, inurl:, host:, rhost:, domain:)
- Fino a 25 pagine, non più di ~250 risultati
- Parole chiave correlate (
$hints.$i.hint) - Tipo di SERP: desktop, mobile Android o mobile iOS
Casi d'uso
- Raccolta di database di link
- Valutazione della concorrenza per parole chiave
- Ricerca di backlink (menzioni) di siti
- Tutti i casi in cui è necessario sottoporre a scraping la SERP di Rambler
Query
Inserisci le query come faresti nella ricerca di Rambler. Supponiamo di aver bisogno solo dei link di un sito. Inseriamo nel campo delle query:
"acquistare porte" site:http://kp.ru
Sostituzioni nelle query
Puoi utilizzare i macro integrati per moltiplicare le query, ad esempio se vogliamo ottenere un database molto grande di forum, indichiamo alcune query principali in diverse lingue:
forum
forum
foro
论坛
Nel formato della query indichiamo l'iterazione dei caratteri da a a zzzz, questo metodo permette di ruotare al massimo la SERP e ottenere molti nuovi risultati unici:
$query {az:a:zzzz}
Questo macro creerà 475254 query aggiuntive per ogni query di ricerca iniziale, il che darà un totale di 4 x 475254 = 1901016 query di ricerca, una cifra impressionante, ma non è affatto un problema per A-Parser. Con una velocità di 2000 query al minuto, tale attività verrà elaborata in sole 16 ore.
Utilizzo degli operatori
Puoi utilizzare gli operatori di ricerca nel formato della query, in questo modo verranno aggiunti automaticamente a ogni query della tua lista:
site:$query
Opzioni di output dei risultati
A-Parser supporta una formattazione flessibile dei risultati grazie al motore di template integrato Template Toolkit, che gli consente di produrre risultati in forma libera o strutturata, come CSV o JSON
Esportazione dell'elenco dei link
Link + anchor + snippet con posizione
Output di link, anchor e snippet in una tabella CSV
Salvataggio delle parole chiave correlate
Formato del risultato:
$hints.format('$hint\n')
Esempio di risultato:
habrahabr
habr
habrahabr ru
xabra
livebusiness
eureka
contabile elettronico
isola d'elba
elba contabile elettronico
habrahabr
...
Salvataggio in formato SQL
Dump dei risultati in JSON
Elaborazione dei risultati
A-Parser consente di elaborare i risultati direttamente durante lo scraping, in questa sezione abbiamo riportato i casi d'uso più popolari per lo scraper Rambler
Deduplicazione dei link
Deduplicazione dei link per dominio
Estrazione dei domini
Rimozione dei tag da anchor e snippet
Filtrazione dei link per inclusione
Impostazioni possibili
| Nome parametro | Valore predefinito | Descrizione |
|---|---|---|
| Device | Desktop | Dispositivo di output: desktop, mobile Android o mobile iOS |
| Wait for soft captcha, sec (0 = ban) | 25 | Quanti secondi attendere per il superamento del soft-captcha. 0 — banna immediatamente il proxy |
| Page load timeout, sec | 20 | Timeout di caricamento della pagina |
| Pages count | 5 | Quante pagine sottoporre a scraping, 1–25. Rambler restituisce non più di ~250 risultati, quindi il numero massimo di pagine dipende da Links per page: 10 risultati → 25 pag., 15 → 17 pag., 30 → 8 pag., 50 → 5 pag. |
| Links per page | 10 | Risultati per pagina: 10 / 15 / 30 / 50 |
| Rambler region ID | ID della regione. IP non CSI — Mosca. IP CSI — risultati in base all'IP o a questo ID, se impostato. Come scoprire l'ID — qui | |
| Sort | Sites by relevance | Ordinamento: Pages by relevance, Pages by date, Sites by relevance, Sites by date |
| Results filtering | Moderate | Filtro: Unrestricted, Moderate, Family search |
| Results language | Any language | Lingua dei risultati: qualsiasi o Belarusian, English, German, French, Kazakh, Russian, Tatar, Turkish, Ukrainian |
| Serp time | Anytime | Periodo: Anytime, Past 24 hours, Past week, Past month |
| Results type | Any format | Tipo di documenti: qualsiasi o pdf, doc, rtf, xls, ppt, swf, odt, ods, odp, odg |
| Exact match | ☐ | Corrispondenza esatta alla query |
| Disable autocorrect | ☐ | Disabilita la correzione automatica, esegue lo scraping dei risultati per la query specificata |
| Max concurrent browser pages | 10 | Quante schede del browser lo scraper mantiene aperte contemporaneamente. Con un numero elevato di thread, aumentare con cautela: aumenta il carico su memoria e CPU |
| Use sessions | ☑ | Salva le sessioni valide, meno errori, scraping più veloce |
| Headless browser | ☑ | Browser senza finestra. Per il debug, deselezionare la casella |