# 网页数据采集

> 可视化选取网页列表项或框选区域，自动翻页批量采集结构化数据；区域截图支持本地文字识别，采集结果保存为 Excel 或 JSON，快印店抄价格表、抄素材清单不再手抄。

- 分类：浏览器
- 关键词：网页数据采集、数据爬取、自动翻页、区域截图、文字识别、OCR、导出Excel、价格表采集
- 在线原文：https://www.xyltools.com/docs/browser-data-collection

---

## 功能概述

逛素材站、耗材商城、同行门店网站时，经常需要把整页的价格表、商品清单抄进自己的表格里。浏览器内置网页数据采集工具，不用懂技术也能批量抓：打开采集面板，用鼠标直接在网页上框选想要的数据，工具自动识别列表结构，逐页采集并汇总成表，最后一键导出 Excel。

| 采集方式 | 适用场景 |
| --- | --- |
| 列表采集 | 网页上有重复结构的列表（商品列表、报价表、素材列表）：点选一条样本，自动识别全部字段 |
| 区域截图 | 页面没有规整列表、或内容以图片呈现：框选一块区域逐页截图存档 |
| 区域截图 + 文字识别 | 框选区域逐页截图后，用本机内置文字识别把图中文字提取为表格行（需本机已安装本地 OCR 模型，未安装时仅存截图） |
| 自动翻页 | 配合上面任一方式，自动点击「下一页」连续采集多页 |

## 列表采集操作步骤

1. **打开采集面板**：在网页空白处右键，选择「采集本页数据」，右侧滑出采集面板。
2. **选取列表项**：点「选取列表项」后鼠标移到网页上，重复的数据项会自动描边高亮，点击选中一条。
3. **确认字段**：面板内列出自动识别出的字段（文本、链接、图片地址等），可逐条改字段名或删除不需要的字段。
4. **（可选）自动翻页**：需要连采多页时，点「选取翻页按钮」后点页面上的「下一页」链接，并设置最大页数（默认 10 页）。
5. **开始采集**：点「开始采集」，状态栏实时显示已采条数与页数；采完自动保存，也可随时点「停止」。
6. **保存与导出**：面板预览表确认无误后，改个任务名点「保存」落盘 JSON，点「导出 CSV」得到带 BOM 的 CSV 文件，Excel 双击直接打开中文不乱码。

## 区域截图与文字识别

- 点「框选区域」后在网页上拖出一个矩形，面板立即显示一张截取预览，确认框选位置没错。
- 设置最大页数后点「开始采集」：浏览器自动翻到下一页、对同一位置逐页截图，截图按页编号存入采集目录。
- 本机已安装本地 OCR 模型时，每页截图会同时做文字识别，识别出的文字作为一行表格数据，可随采集结果一起导出。
- 未安装 OCR 模型时自动降级为纯截图采集，不影响截图本身。

## 采集结果与存放位置

- 采集结果保存在系统「下载」文件夹下的 scrape-results 子目录，每次任务一个文件夹，内含 JSON 明细与截图文件。
- 导出的 CSV 带 UTF-8 BOM，Excel / WPS 直接双击打开不乱码。
- 面板预览表按内容自动去重，同一行数据翻页重复出现时不会重复收录。

> **使用边界**：采集与翻页依赖网页自身的翻页链接，部分网站翻页采用异步加载时可能采不全，请通过预览表核对。请尊重目标网站的 robots 协议与内容版权，勿用于高频抓取。银行、支付、政务等敏感网站上采集功能自动停用。

---

## 相关文章

- [浏览器概览](https://www.xyltools.com/docs/browser-overview)
- [侧栏 AI 与账号免登](https://www.xyltools.com/docs/browser-sidebar-ai)
- [下载、书签、历史与设置](https://www.xyltools.com/docs/browser-data-settings)
