Pular para o conteúdo principal

SE::Rambler - scraper de resultados de busca do Rambler

img

Visão geral do scraper

Scraper de resultados de busca do Rambler. Graças ao scraper Rambler, você poderá obter grandes bases de links prontos para uso posterior. Você pode usar consultas da mesma forma que as digita na barra de pesquisa do Rambler, incluindo operadores de busca (site, etc.).

A funcionalidade do A-Parser permite salvar as configurações de extração de dados do scraper Rambler para uso futuro (presetes), definir agendamentos de extração de dados e muito mais. Você pode usar a multiplicação automática de consultas, substituição de subconsultas a partir de arquivos, combinação de caracteres alfanuméricos e listas para obter o máximo possível de resultados.

O salvamento dos resultados é possível no formato e estrutura que você necessita, graças ao poderoso motor de modelos integrado Template Toolkit que permite aplicar lógica adicional aos resultados e exibir dados em vários formatos, incluindo JSON, SQL e CSV.

Dados coletados

  • $totalcount — número de resultados na busca. Apenas da primeira página; se não houver número — vazio
  • $serp.$i.link, $serp.$i.anchor, $serp.$i.snippet — link, âncora, snippet
  • $hints.$i.hint — palavras-chave relacionadas. Apenas da primeira página; se não houver sugestões — vazio

quais dados o scraper SE::Rambler coleta

Recursos

  • Suporte a operadores de busca do Rambler (url:, site:, inurl:, host:, rhost:, domain:)
  • Até 25 páginas, não mais que ~250 resultados
  • Palavras-chave relacionadas ($hints.$i.hint)
  • Dispositivo de exibição: desktop, mobile Android ou mobile iOS

Casos de uso

  • Coleta de bases de links
  • Avaliação de concorrência para palavras-chave
  • Busca de backlinks (menções) de sites
  • Todos os casos onde é necessário extrair dados dos resultados de busca do Rambler

Consultas

Indique as consultas da mesma forma que na busca do Rambler. Por exemplo, se precisar apenas de links de um site. Digite no campo de consultas:

"comprar portas" site:http://kp.ru

Substituições de consultas

Você pode usar macros integrados para multiplicar consultas, por exemplo, se quisermos obter uma base muito grande de fóruns, indicaremos algumas consultas principais em diferentes idiomas:

forum
fórum
foro
论坛

No formato de consultas, indicaremos a permutação de caracteres de a até zzzz, este método permite rotacionar ao máximo os resultados de busca e obter muitos novos resultados únicos:

$query {az:a:zzzz}

Este macro criará 475254 consultas adicionais para cada consulta de pesquisa inicial, o que totalizará 4 x 475254 = 1901016 consultas de pesquisa, um número impressionante, mas que não é problema para o A-Parser. Com uma velocidade de 2000 consultas por minuto, tal tarefa será processada em apenas 16 horas.

Uso de operadores

Você pode usar operadores de pesquisa no formato da consulta, desta forma ele será automaticamente adicionado a cada consulta da sua lista:

site:$query

Opções de exibição de resultados

O A-Parser suporta formatação flexível de resultados graças ao motor de modelos integrado Template Toolkit, o que permite exibir resultados em forma livre, bem como estruturada, como CSV ou JSON

Exportação de lista de links

Semelhante ao SE::Google.

Semelhante ao SE::Google.

Semelhante ao SE::Google.

Formato do resultado:

$hints.format('$hint\n')

Exemplo de resultado:

habrahabr
habr
habrahabr ru
xabra
livebusiness
eureka
contador eletrônico
ilha elba
elba contador eletrônico
habrahabr
...

Salvamento em formato SQL

Semelhante ao SE::Google.

Dump de resultados em JSON

Semelhante ao SE::Google.

Processamento de resultados

O A-Parser permite processar resultados diretamente durante a extração de dados, nesta seção apresentamos os casos mais populares para o scraper Rambler

Semelhante ao SE::Google.

Semelhante ao SE::Google.

Extração de domínios

Semelhante ao SE::Google.

Remoção de tags de âncoras e snippets

Semelhante ao SE::Google.

Semelhante ao SE::Google.

Configurações possíveis

Nome do parâmetroValor padrãoDescrição
DeviceDesktopDispositivo de exibição: desktop, Android móvel ou iOS móvel
Wait for soft captcha, sec (0 = ban)25Quantos segundos esperar pela conclusão do soft-captcha. 0 — banir o proxy imediatamente
Page load timeout, sec20Tempo limite de carregamento da página
Pages count5Quantas páginas extrair, 1–25. O Rambler fornece no máximo ~250 resultados, portanto o máximo de páginas depende de Links per page: 10 resultados → 25 pág., 15 → 17 pág., 30 → 8 pág., 50 → 5 pág.
Links per page10Resultados por página: 10 / 15 / 30 / 50
Rambler region IDID da região. IP fora da CEI — Moscou. IP da CEI — resultados por IP ou por este ID, se definido. Como descobrir o ID — aqui
SortSites by relevanceOrdenação: Pages by relevance, Pages by date, Sites by relevance, Sites by date
Results filteringModerateFiltro: Unrestricted, Moderate, Family search
Results languageAny languageIdioma dos resultados: qualquer ou Belarusian, English, German, French, Kazakh, Russian, Tatar, Turkish, Ukrainian
Serp timeAnytimePeríodo: Anytime, Past 24 hours, Past week, Past month
Results typeAny formatTipo de documentos: qualquer ou pdf, doc, rtf, xls, ppt, swf, odt, ods, odp, odg
Exact matchCorrespondência exata à consulta
Disable autocorrectDesativa a autocorreção, extrai os resultados para a consulta especificada
Max concurrent browser pages10Quantas abas do navegador o scraper mantém simultaneamente. Com um grande número de threads, aumente com cautela — a carga na memória e CPU aumenta
Use sessionsSalva sessões boas, menos erros, extração de dados mais rápida
Headless browserNavegador sem janela. Para depuração, desmarque a caixa