SE::DuckDuckGo - Scraper de resultados de busca do DuckDuckGo

Visão geral do scraper
Scraper de resultados de busca do DuckDuckGo. Graças ao scraper DuckDuckGo, você poderá obter grandes bases de links prontos para uso posterior. Você pode usar as consultas da mesma forma que as digita na barra de pesquisa do DuckDuckGo, incluindo operadores de pesquisa (intitle, inurl, site, etc.). Mais detalhes na página oficial DuckDuckGo Search Syntax.
A funcionalidade do A-Parser permite salvar as configurações de extração de dados do scraper DuckDuckGo para uso futuro (presets), definir agendamentos de extração de dados e muito mais. Você pode usar a multiplicação automática de consultas, substituição de subconsultas a partir de arquivos, combinação de caracteres alfanuméricos e listas para obter o máximo possível de resultados.
A preservação dos resultados é possível no formato e estrutura que você necessita, graças ao poderoso motor de modelos integrado Template Toolkit, que permite aplicar lógica adicional aos resultados e exibir dados em vários formatos, incluindo JSON, SQL e CSV.
Dados coletados
- Links, âncoras e snippets dos resultados orgânicos (
$serp.$i.link,$serp.$i.anchor,$serp.$i.snippet) - Links, links visíveis, âncoras, snippets, domínio e posição de anúncios dos blocos publicitários (
$ads.$i.domain,$ads.$i.link,$ads.$i.visiblelink,$ads.$i.anchor,$ads.$i.snippet,$ads.$i.position,$ads.$i.page) - Lista de palavras-chave relacionadas (
$related.$i.key)

Recursos
- Suporte para todos os operadores de pesquisa do DuckDuckGo (intitle:, inurl:, site:, etc.). Mais detalhes sobre os operadores de pesquisa na página oficial DuckDuckGo Search Syntax
- Definição do número de páginas (de 1 a 10)
- Além dos resultados orgânicos, são coletados blocos de anúncios e palavras-chave relacionadas
- Possibilidade de extrair dados por uma região selecionada (opção Region) e especificar o idioma dos resultados (opção Language)
- Possibilidade de ativar a busca segura (opção Safe search) e limitar os resultados por tempo (opção Serp time)
- Ativação separada de HTTP/2 para a página de busca e para a requisição de dados dos resultados
- Alternância automática para o navegador integrado caso o DuckDuckGo não forneça os dados via HTTP
Casos de uso
- Coleta de bases de links - para A-Poster, XRumer, AllSubmitter, etc.
- Verificação de indexação de sites
- Busca de backlinks (menções) de sites
- Quaisquer outras variantes que envolvam a extração de dados do DuckDuckGo de uma forma ou de outra
Consultas
Como consultas, é necessário indicar frases de pesquisa, por exemplo:
Football
teste
site:a-parser.com
scraper site:a-parser.com
test -site:tests.com
IoT filetype:pdf
Substituições de consultas
Você pode usar macros integradas para multiplicar as consultas, por exemplo, se quisermos obter uma base muito grande de fóruns, indicaremos algumas consultas principais em diferentes idiomas:
forum
fórum
foro
论坛
No formato de consultas, indicaremos a alternância de caracteres de a até zzzz, este método permite rotacionar ao máximo os resultados de busca e obter muitos novos resultados únicos:
$query {az:a:zzzz}
Esta macro criará 475254 consultas adicionais para cada consulta de pesquisa inicial, o que resultará em um total de 4 x 475254 = 1901016 consultas de pesquisa, um número impressionante, mas que não é problema para o A-Parser. Com uma velocidade de 2000 consultas por minuto, tal tarefa será processada em apenas 16 horas.
Uso de operadores
Você pode usar operadores de pesquisa no formato da consulta, assim ele será automaticamente adicionado a cada consulta da sua lista:
site:$query
Opções de exibição de resultados
O A-Parser suporta formatação flexível de resultados graças ao motor de modelos integrado Template Toolkit, o que permite exibir resultados em forma livre, bem como estruturada, como CSV ou JSON
Exportação de lista de links
Links + âncoras + snippets com exibição de posição
Exibição de links, âncoras e snippets em tabela CSV
Salvamento de palavras-chave relacionadas
Exibição de blocos de anúncios
Da mesma forma que no SE::Google.
Salvamento em formato SQL
Dump de resultados em JSON
Processamento de resultados
O A-Parser permite processar os resultados diretamente durante a extração de dados; nesta seção, apresentamos os casos mais populares para o scraper DuckDuckGo
Desduplicação de links
Desduplicação de links por domínio
Extração de domínios
Remoção de tags de âncoras e snippets
Filtragem de links por ocorrência
Configurações possíveis
| Nome do parâmetro | Valor padrão | Descrição |
|---|---|---|
| Pages count | 5 | Número de páginas para extração de dados (de 1 a 10), a extração pode terminar antes se os resultados não tiverem uma próxima página |
| Region | US (English) | Seleção da região dos resultados |
| Language | English (United States) | Seleção do idioma dos resultados |
| Safe search | Moderate | Pesquisa segura: Strict, Moderate ou Off |
| Serp time | Any time | Período de pesquisa: nas últimas 24 horas, semana, mês, ano ou todo o período |
| Use HTTP/2 | ☐ | Define se deve usar HTTP/2 em vez de HTTP/1.1 ao solicitar a página de pesquisa |
| Use HTTP/2 for links | ☐ | O mesmo para a solicitação de dados dos resultados |
| User agent | Chrome 150, Windows | Cabeçalho User-Agent ao solicitar páginas, também usado no navegador. Se deixado vazio, será inserido o User-Agent da versão atual do Firefox |
| Get first link with browser pages count | 5 | Quantas páginas do navegador integrado podem ser usadas simultaneamente. O navegador é necessário apenas para obter a página de pesquisa: se o DuckDuckGo não retornar os dados dos resultados via HTTP, a próxima tentativa será feita através do navegador |