CLI 工作流
用 CLI 安全抓取网站
先限定少量 URL,再选择内容提取或浏览器自动化,并为每份结果保留来源。
HTTP 与 Webhook本地写入
开始前准备好工具、认证与证据
先安装推荐工具,确认最小权限,再区分兼容性和真实执行记录。
复制或下载本工作流 Skill
Skill 包含输入输出合同、推荐工具、审批点、回滚和证据边界;保存前仍应按当前环境审查。
scrape-website-SKILL.md
---
name: scrape-website-workflow
description: "先限定少量 URL,再选择内容提取或浏览器自动化,并为每份结果保留来源。"
---
# 提取网站内容
## 适用目标
采集任务所需的公开内容,不进行失控爬取或隐藏交互。
## 证据边界
- 工具状态分别标注 `docs-verified` 与真实独立执行;二者不能互换。
- 当前注册表没有记录某次工具执行具体由哪个 Agent 完成,因此不能把“兼容 Agent”称为“已测试 Agent”。
- 执行前重新核对目标账户、环境、版本与官方文档。
- 不自动执行 R2、R3 或任何标记为需要确认的步骤;必须在执行前获得明确批准。
## 推荐工具、安装与认证
- **Firecrawl CLI**(证据:`docs-verified`,文档检查:`2026-07-10`,未记录独立执行版本)
- 安装:`npx firecrawl --help`
- 认证:API key
- 最小权限:使用带配额限制的专用密钥,并且只抓取获授权目标。
- **Playwright**(证据:`docs-verified`,文档检查:`2026-07-10`,未记录独立执行版本)
- 安装:`npm install --save-dev @playwright/test`
- 认证:基础操作无需认证
- 最小权限:无需服务凭据;仍应把文件系统和网络访问限制在任务范围内。
## 输入合同
- 允许访问的 URL
- 需要的字段或页面状态
- 页面数与频率限制
- 站点访问限制
## 输出合同
- 提取文本或结构化字段
- 来源 URL 清单
- 失败页面
- 必要时的截图或 trace
## 安全工作流
1. **限定范围** — 列出允许的 host 和 URL、排除区域、最大页数和预期输出。
- 输入: 研究问题和站点范围
- 输出: 有限采集计划
- 风险: `read-only`
2. **选择接口** — 可读内容优先提取;只有需要渲染或交互时才用 Playwright。
- 输入: 页面行为和输出需求
- 输出: 工具与采集命令
- 风险: `read-only`
3. **采集并保留来源** — 控制请求频率,保存来源 URL 和时间,并报告被阻止或不完整页面。
- 输入: 已批准计划
- 输出: 带来源的内容包
- 风险: `local-write`
## 必须先确认
- 登录、接受条款、提交表单或改变远程状态
- 超出约定 host 或页面数
- 采集个人、受限或付费内容
## 回滚
- 范围变化时立即停止
- 删除不应采集的本地内容
- 不要用更多自动化尝试抵消远程副作用
## 官方来源
- [Firecrawl documentation](https://docs.firecrawl.dev/) — 用于核对当前命令、认证、输出和操作边界。
- [Playwright documentation](https://playwright.dev/docs/intro) — 用于核对当前命令、认证、输出和操作边界。
目标、输入与输出
在 Agent 选择命令前,先明确要交付的结果和证据。
用 CLI 安全抓取网站:安全执行步骤
每一步都要在已声明的边界内执行,验证输出后再继续。
审批点与回滚
在列出的决策点停下,并让恢复方法始终紧跟操作。
选 CLI、MCP 还是 API?
根据执行位置、身份、输出合同与权限边界选接口。
建议方案
内容任务优先提取;只有动态行为确实必要时才自动化浏览器。
官方证据与参考
执行前使用这些官方或上游来源确认当前命令行为。