SE::DuckDuckGo - Scraper dei risultati di ricerca DuckDuckGo

Panoramica dello scraper
Scraper dei risultati di ricerca DuckDuckGo. Grazie allo scraper DuckDuckGo potrete ottenere ampi database di link, pronti per un ulteriore utilizzo. È possibile utilizzare le query nello stesso formato in cui vengono inserite nella barra di ricerca di DuckDuckGo, inclusi gli operatori di ricerca (intitle, inurl, site, ecc.). Maggiori dettagli sulla pagina ufficiale DuckDuckGo Search Syntax.
Le funzionalità di A-Parser consentono di salvare le impostazioni di scraping dello scraper DuckDuckGo per un uso futuro (preset), impostare pianificazioni di scraping e molto altro. Puoi utilizzare la moltiplicazione automatica delle query, la sostituzione di sotto-query da file, l'iterazione di combinazioni alfanumeriche e liste per ottenere il massimo numero possibile di risultati.
Il salvataggio dei risultati è possibile nel formato e nella struttura necessari, grazie al potente motore di modelli integrato Template Toolkit che consente di applicare logica aggiuntiva ai risultati e di esportare i dati in vari formati, tra cui JSON, SQL e CSV.
Dati raccolti
- Link, anchor e snippet dai risultati (
$serp.$i.link,$serp.$i.anchor,$serp.$i.snippet) - Link, link visibili, anchor, snippet, dominio e posizione degli annunci dai risultati pubblicitari (
$ads.$i.domain,$ads.$i.link,$ads.$i.visiblelink,$ads.$i.anchor,$ads.$i.snippet,$ads.$i.position,$ads.$i.page) - Elenco di parole chiave correlate (
$related.$i.key)

Funzionalità
- Supporto per tutti gli operatori di ricerca DuckDuckGo (intitle:, inurl:, site:, ecc.). Maggiori dettagli sugli operatori di ricerca sulla pagina ufficiale DuckDuckGo Search Syntax
- Specifica del numero di pagine (da 1 a 10)
- Oltre ai risultati organici, vengono raccolti i blocchi pubblicitari e le parole chiave correlate
- Possibilità di eseguire lo scraping per una regione selezionata (opzione Region) e specificare la lingua dei risultati (opzione Language)
- Possibilità di attivare la ricerca sicura (opzione Safe search) e limitare i risultati per periodo temporale (opzione Serp time)
- Attivazione separata di HTTP/2 per la pagina di ricerca e per la richiesta dei dati dei risultati
- Passaggio automatico al browser integrato se DuckDuckGo non restituisce i dati dei risultati tramite HTTP
Casi d'uso
- Raccolta di database di link - per A-Poster, XRumer, AllSubmitter, ecc.
- Verifica dell'indicizzazione dei siti
- Ricerca di backlink (menzioni) di siti
- Qualsiasi altro scenario che comporti lo scraping di DuckDuckGo in una forma o nell'altra
Query
Come query è necessario specificare frasi di ricerca, ad esempio:
Football
test
site:a-parser.com
scraper site:a-parser.com
test -site:tests.com
IoT filetype:pdf
Sostituzioni nelle query
Puoi utilizzare i macro integrati per moltiplicare le query, ad esempio se vogliamo ottenere un database molto grande di forum, indichiamo alcune query di base in diverse lingue:
forum
forum
foro
论坛
Nel formato della query indichiamo l'iterazione dei caratteri da a a zzzz, questo metodo consente di ruotare al massimo i risultati di ricerca e ottenere molti nuovi risultati unici:
$query {az:a:zzzz}
Questo macro creerà 475254 query aggiuntive per ogni query di ricerca iniziale, il che darà un totale di 4 x 475254 = 1901016 query di ricerca, una cifra impressionante, ma non è affatto un problema per A-Parser. Alla velocità di 2000 query al minuto, tale attività verrà elaborata in sole 16 ore.
Utilizzo degli operatori
Puoi utilizzare gli operatori di ricerca nel formato della query, in questo modo verranno aggiunti automaticamente a ogni query della tua lista:
site:$query
Opzioni di output dei risultati
A-Parser supporta la formattazione flessibile dei risultati grazie al motore di modelli integrato Template Toolkit, che gli consente di produrre risultati in forma libera o strutturata, come CSV o JSON.
Esportazione della lista di link
Link + anchor + snippet con output della posizione
Output di link, anchor e snippet in una tabella CSV
Salvataggio delle parole chiave correlate
Output dei blocchi pubblicitari
Salvataggio in formato SQL
Dump dei risultati in JSON
Elaborazione dei risultati
A-Parser consente di elaborare i risultati direttamente durante lo scraping, in questa sezione abbiamo riportato i casi più popolari per lo scraper DuckDuckGo.
Deduplicazione dei link
Deduplicazione dei link per dominio
Estrazione dei domini
Rimozione dei tag da anchor e snippet
Filtro dei link per inclusione
Impostazioni possibili
| Nome parametro | Valore predefinito | Descrizione |
|---|---|---|
| Pages count | 5 | Numero di pagine per lo scraping (da 1 a 10), lo scraping può terminare prima se i risultati non hanno una pagina successiva |
| Region | US (English) | Selezione della regione dei risultati |
| Language | English (United States) | Selezione della lingua dei risultati |
| Safe search | Moderate | Ricerca sicura: Strict, Moderate o Off |
| Serp time | Any time | Periodo di ricerca: ultime 24 ore, settimana, mese, anno o tutto il tempo |
| Use HTTP/2 | ☐ | Determina se utilizzare HTTP/2 invece di HTTP/1.1 quando si richiede la pagina di ricerca |
| Use HTTP/2 for links | ☐ | Lo stesso per la richiesta dei dati dei risultati |
| User agent | Chrome 150, Windows | Intestazione User-Agent per la richiesta delle pagine, utilizzata anche nel browser. Se lasciato vuoto, verrà inserito lo User-Agent della versione attuale di Firefox |
| Get first link with browser pages count | 5 | Quante pagine del browser integrato possono essere utilizzate contemporaneamente. Il browser è necessario solo per ottenere la pagina di ricerca: se DuckDuckGo non ha fornito i dati dei risultati tramite HTTP, il tentativo successivo viene eseguito tramite browser |