Maps::Google::Reviews - Google 地图评论爬虫工具
爬虫工具概览
Google 地图评论爬虫工具。Google 地图评论爬虫工具提供快速且自动化的 Google 地图评论获取功能。借助 Maps::Google::Reviews 爬虫工具,您可以自动采集 Google 地图中的评论库。使用 Maps::Google::Reviews 爬虫工具可以轻松快速地从 Google maps 抓取评论。
A-Parser 的功能允许保存 Maps::Google::Reviews 爬虫工具的数据抓取设置以便后续使用(预设),设置数据抓取计划等。
由于内置了强大的 Template Toolkit 模板引擎,结果保存可以采用您需要的任何形式和结构,该引擎允许对结果应用额外的逻辑,并以各种格式输出数据,包括 JSON、SQL 和 CSV。
采集的数据
$totalcount— 地点的评论总数$avgrating— 平均评分- 数组
$list(评论)$list.$i.rating— 评分$list.$i.text— 文本$list.$i.name— 作者姓名$list.$i.date— 日期$list.$i.url— 链接
功能
- 支持按查询指定采集评论的数量 (Max reviews count)
- 采集引擎:HTTP 或 Browser (Engine)
使用场景
- 采集评论
- 获取评论数量和平均评分
查询
在查询中需要指定带有 cid 的地点链接,例如:
https://maps.google.com/?cid=12262488876297357724
结果输出选项
得益于内置的模板引擎 Template Toolkit,A-Parser 支持灵活的结果格式化,这使其能够以任意形式以及结构化形式(如 CSV 或 JSON)输出结果。
默认结果格式:
$list.format('$name,$date,$url,$rating,$text\n')
可用设置
| 参数名称 | 默认值 | 描述 |
|---|---|---|
| Max reviews count | 20 | 放入 $list 的评论数量 |
| Engine | HTTP | HTTP — 不使用浏览器。Browser — 通过浏览器 |
| Max concurrent browser pages | 10 | 爬虫工具可以同时打开的 Chrome 页面数量。在线程数较多时请谨慎增加 — 这会增加内存和 CPU 的负载 |
| Browser tries on same proxy | 4 | 如果 Google 要求登录或没有 Reviews 标签页,在同一个代理上打开多少个新的浏览器页面。然后更换代理。0 — 仅第一页,不在同一个代理上重复 |
| Browser headless | ☑ | 无窗口启动浏览器 |