SE::Rambler - Rambler 搜索引擎结果爬虫工具

爬虫工具概览
Rambler 搜索结果爬虫工具。通过 Rambler 爬虫工具,您可以获取海量的链接库以供后续使用。您可以直接使用在 Rambler 搜索框中输入的查询格式,包括搜索运算符(site 等)。
A-Parser 的功能允许您保存 Rambler 爬虫工具的数据抓取设置以便后续使用(预设),设置数据抓取计划等等。您可以使用自动查询扩展、从文件中替换子查询、遍历数字字母组合和列表,以获取尽可能多的结果。
由于内置了强大的 Template Toolkit 模板引擎,结果可以按您需要的形式和结构进行保存,这允许对结果应用额外的逻辑并以各种格式输出数据,包括 JSON, SQL 和 CSV。
采集的数据
$totalcount— 搜索结果总数。仅限第一页;如果没有数字则为空$serp.$i.link,$serp.$i.anchor,$serp.$i.snippet— 链接、锚文本、摘要$hints.$i.hint— 相关关键词。仅限第一页;如果没有建议则为空

功能
- 支持 Rambler 搜索运算符 (url:, site:, inurl:, host:, rhost:, domain:)
- 最多 25 页,不超过约 250 个结果
- 相关关键词 (
$hints.$i.hint) - 搜索结果设备类型:桌面端、安卓移动端或 iOS 移动端
应用场景
- 收集链接库
- 评估关键词竞争程度
- 查找网站反向链接(提及)
- 所有需要抓取 Rambler 搜索结果的场景
查询
像在 Rambler 搜索中一样输入查询。假设只需要来自一个网站的链接。在查询框中输入:
"购买门" site:http://kp.ru
查询替换
您可以使用 内置宏 来扩展查询,例如我们想获取一个非常大的论坛数据库,指定几个不同语言的基础查询:
forum
论坛
foro
论坛
在查询格式中指定从 a 到 zzzz 的字符遍历,此方法可以最大程度地轮换搜索结果并获得许多新的唯一结果:
$query {az:a:zzzz}
该宏将为每个原始搜索查询创建 475254 个额外查询,总计将产生 4 x 475254 = 1901016 个搜索查询,这个数字令人印象深刻,但对于 A-Parser 来说完全不是问题。在每分钟 2000 个查询的速度下,此类任务仅需 16 小时即可处理完毕。
使用运算符
您可以在查询格式中使用搜索运算符,这样它将自动添加到列表中的每个查询:
site:$query
结果输出选项
得益于内置的模板引擎 Template Toolkit,A-Parser 支持灵活的结果格式化,允许以任意形式以及结构化形式(如 CSV 或 JSON)输出结果。
导出链接列表
链接 + 锚点 + 摘要并输出位置
将链接、锚点和摘要输出到 CSV 表格
保存相关关键词
结果格式:
$hints.format('$hint\n')
结果示例:
habrahabr
habr
habrahabr ru
xabra
livebusiness
eureka
电子会计
厄尔巴岛
厄尔巴电子会计
habrahabr
...
以 SQL 格式保存
将结果转储为 JSON
结果处理
A-Parser 允许在数据抓取过程中直接处理结果,在本节中,我们列出了 Rambler 爬虫工具最受欢迎的案例。
链接去重
按域名进行链接去重
提取域名
从锚点和摘要中删除标签
按包含关系过滤链接
可能的设置
| 参数名称 | 默认值 | 描述 |
|---|---|---|
| Device | Desktop | 设备类型:桌面端、安卓移动端或 iOS 移动端 |
| Wait for soft captcha, sec (0 = ban) | 25 | 等待软验证码通过的秒数。0 — 立即封禁代理 |
| Page load timeout, sec | 20 | 页面加载超时时间 |
| Pages count | 5 | 抓取页数,1–25。Rambler 最多返回约 250 条结果,因此最大页数取决于 Links per page:10 条结果 → 25 页,15 条 → 17 页,30 条 → 8 页,50 条 → 5 页。 |
| Links per page | 10 | 每页结果数:10 / 15 / 30 / 50 |
| Rambler region ID | 地区 ID。非独联体 IP — 莫斯科。独联体 IP — 根据 IP 或此 ID(如果已设置)显示结果。如何获取 ID — 点击这里 | |
| Sort | Sites by relevance | 排序方式:Pages by relevance, Pages by date, Sites by relevance, Sites by date |
| Results filtering | Moderate | 过滤:Unrestricted, Moderate, Family search |
| Results language | Any language | 结果语言:任意或 Belarusian, English, German, French, Kazakh, Russian, Tatar, Turkish, Ukrainian |
| Serp time | Anytime | 时间范围:Anytime, Past 24 hours, Past week, Past month |
| Results type | Any format | 文档类型:任意或 pdf, doc, rtf, xls, ppt, swf, odt, ods, odp, odg |
| Exact match | ☐ | 完全匹配查询词 |
| Disable autocorrect | ☐ | 禁用自动纠错,按指定查询词抓取结果 |
| Max concurrent browser pages | 10 | 爬虫工具同时保持的浏览器标签页数量。在高线程数下请谨慎增加 — 会增加内存和 CPU 负载 |
| Use sessions | ☑ | 保存有效会话,减少错误,加快数据抓取速度 |
| Headless browser | ☑ | 无头浏览器模式。如需调试请取消勾选 |