CLI 工作流

用 CLI 安全抓取网站

先限定少量 URL,再选择内容提取或浏览器自动化,并为每份结果保留来源。

HTTP 与 Webhook本地写入

开始前准备好工具、认证与证据

先安装推荐工具,确认最小权限,再区分兼容性和真实执行记录。

firecrawldocs-verified
把网页抓取或爬取为 Markdown 与 JSON,供 Agent 后续分析。

推荐安装

$ shell
npx firecrawl --help
认证
API key
已测试 Agent
暂无 Agent 级执行记录
证据状态
docs-verified · 文档检查 2026-07-10
CLI 独立执行
未记录独立执行版本
playwrightdocs-verified
运行浏览器测试、捕获截图与 Trace,并自动化可留存证据的 UI 工作流。

推荐安装

$ shell
npm install --save-dev @playwright/test
认证
基础操作无需认证
已测试 Agent
暂无 Agent 级执行记录
证据状态
docs-verified · 文档检查 2026-07-10
CLI 独立执行
未记录独立执行版本

复制或下载本工作流 Skill

Skill 包含输入输出合同、推荐工具、审批点、回滚和证据边界;保存前仍应按当前环境审查。

scrape-website-SKILL.md
---
name: scrape-website-workflow
description: "先限定少量 URL,再选择内容提取或浏览器自动化,并为每份结果保留来源。"
---

# 提取网站内容

## 适用目标

采集任务所需的公开内容,不进行失控爬取或隐藏交互。

## 证据边界

- 工具状态分别标注 `docs-verified` 与真实独立执行;二者不能互换。
- 当前注册表没有记录某次工具执行具体由哪个 Agent 完成,因此不能把“兼容 Agent”称为“已测试 Agent”。
- 执行前重新核对目标账户、环境、版本与官方文档。
- 不自动执行 R2、R3 或任何标记为需要确认的步骤;必须在执行前获得明确批准。

## 推荐工具、安装与认证

- **Firecrawl CLI**(证据:`docs-verified`,文档检查:`2026-07-10`,未记录独立执行版本)
  - 安装:`npx firecrawl --help`
  - 认证:API key
  - 最小权限:使用带配额限制的专用密钥,并且只抓取获授权目标。
- **Playwright**(证据:`docs-verified`,文档检查:`2026-07-10`,未记录独立执行版本)
  - 安装:`npm install --save-dev @playwright/test`
  - 认证:基础操作无需认证
  - 最小权限:无需服务凭据;仍应把文件系统和网络访问限制在任务范围内。

## 输入合同

- 允许访问的 URL
- 需要的字段或页面状态
- 页面数与频率限制
- 站点访问限制

## 输出合同

- 提取文本或结构化字段
- 来源 URL 清单
- 失败页面
- 必要时的截图或 trace

## 安全工作流

1. **限定范围** — 列出允许的 host 和 URL、排除区域、最大页数和预期输出。
   - 输入: 研究问题和站点范围
   - 输出: 有限采集计划
   - 风险: `read-only`
2. **选择接口** — 可读内容优先提取;只有需要渲染或交互时才用 Playwright。
   - 输入: 页面行为和输出需求
   - 输出: 工具与采集命令
   - 风险: `read-only`
3. **采集并保留来源** — 控制请求频率,保存来源 URL 和时间,并报告被阻止或不完整页面。
   - 输入: 已批准计划
   - 输出: 带来源的内容包
   - 风险: `local-write`

## 必须先确认

- 登录、接受条款、提交表单或改变远程状态
- 超出约定 host 或页面数
- 采集个人、受限或付费内容

## 回滚

- 范围变化时立即停止
- 删除不应采集的本地内容
- 不要用更多自动化尝试抵消远程副作用

## 官方来源

- [Firecrawl documentation](https://docs.firecrawl.dev/) — 用于核对当前命令、认证、输出和操作边界。
- [Playwright documentation](https://playwright.dev/docs/intro) — 用于核对当前命令、认证、输出和操作边界。

目标、输入与输出

在 Agent 选择命令前,先明确要交付的结果和证据。

目标

采集任务所需的公开内容,不进行失控爬取或隐藏交互。

所需输入

  • 允许访问的 URL
  • 需要的字段或页面状态
  • 页面数与频率限制
  • 站点访问限制

预期输出

  • 提取文本或结构化字段
  • 来源 URL 清单
  • 失败页面
  • 必要时的截图或 trace

用 CLI 安全抓取网站:安全执行步骤

每一步都要在已声明的边界内执行,验证输出后再继续。

步骤 1只读

限定范围

列出允许的 host 和 URL、排除区域、最大页数和预期输出。
输入
研究问题和站点范围
输出
有限采集计划
步骤 2只读

选择接口

可读内容优先提取;只有需要渲染或交互时才用 Playwright。
输入
页面行为和输出需求
输出
工具与采集命令
步骤 3本地写入

采集并保留来源

控制请求频率,保存来源 URL 和时间,并报告被阻止或不完整页面。
输入
已批准计划
输出
带来源的内容包

审批点与回滚

在列出的决策点停下,并让恢复方法始终紧跟操作。

这些操作需要先确认

  • 登录、接受条款、提交表单或改变远程状态
  • 超出约定 host 或页面数
  • 采集个人、受限或付费内容

恢复计划

  • 范围变化时立即停止
  • 删除不应采集的本地内容
  • 不要用更多自动化尝试抵消远程副作用

选 CLI、MCP 还是 API?

根据执行位置、身份、输出合同与权限边界选接口。

CLI

适合本地或 CI 中的可重复提取任务和 Playwright 测试流程。

MCP

适合在受限工具面中进行有人监督的交互浏览。

API

大规模托管提取且需要明确限制和计费时适用。

建议方案

内容任务优先提取;只有动态行为确实必要时才自动化浏览器。

官方证据与参考

执行前使用这些官方或上游来源确认当前命令行为。

Firecrawl documentation

用于核对本页涉及的当前命令、认证、输出格式与操作边界。

Playwright documentation

用于核对本页涉及的当前命令、认证、输出格式与操作边界。

执行前的常见问题

公开页面都能安全抓取吗?

不能。应遵守访问控制、站点条款、适用的 robots 指引、隐私、版权和用户授权范围。

什么时候必须用 Playwright?

需要渲染、UI 状态、截图或纯提取无法完成的可重复交互时使用。

相关工具与指南

浏览同类指南,选择与你当前任务最接近的下一页。

继续查看与当前任务相关的工具证据、工作流或决策指南。

继续查看与当前任务相关的工具证据、工作流或决策指南。

继续查看与当前任务相关的工具证据、工作流或决策指南。