智能网页爬虫

作者:鹿Sir开发工具v1

基于 crawl4ai 的智能网页爬取工具,支持 DuckDuckGo 搜索、单页抓取、全站爬取与 JavaScript 动态页面抓取,输出为 LLM 友好的 Markdown 并可节省约 80% Token。当用户需要爬取网页、抓取网站内容、爬文档站、搜索资料并抓取结果、采集动态渲染页面时触发。触发词:爬虫、爬取、网页抓取、全站爬取、spider、scrape、文档站爬取、搜索并抓取。

下载量
359
点赞
86
价格
免费

技能文档

---
name: crawl4ai-skill
title: 智能网页爬虫
description: 基于 crawl4ai 的智能网页爬取工具,支持 DuckDuckGo 搜索、单页抓取、全站爬取与 JavaScript 动态页面抓取,输出为 LLM 友好的 Markdown 并可节省约 80% Token。当用户需要爬取网页、抓取网站内容、爬文档站、搜索资料并抓取结果、采集动态渲染页面时触发。触发词:爬虫、爬取、网页抓取、全站爬取、spider、scrape、文档站爬取、搜索并抓取。
category: 开发工具
---

# 智能网页爬虫(crawl4ai-skill)

免费开源的网页搜索与爬取 CLI,无需 API Key,输出为 LLM 优化的 Markdown。

核心能力:
- **网页搜索**:基于 DuckDuckGo,免 API Key
- **单页抓取**:智能去噪,提取正文
- **全站爬取**:识别 sitemap,递归爬取整站
- **动态页面**:支持 JavaScript 渲染页面(雪球、知乎等)
- **Token 优化**:fit_markdown 输出可节省约 80% Token

## 技能工作流

### 步骤1:安装工具

```bash
pip install crawl4ai-skill
```

### 步骤2:选择模式并执行

按任务类型选择命令:

| 命令 | 说明 |
|------|------|
| `search <query>` | 网页搜索 |
| `crawl <url>` | 单页抓取 |
| `crawl-site <url>` | 全站爬取 |
| `search-and-crawl <query>` | 搜索并抓取头部结果 |

搜索:

```bash
crawl4ai-skill search "python web scraping"
```

单页抓取:

```bash
crawl4ai-skill crawl https://example.com
```

全站爬取:

```bash
crawl4ai-skill crawl-site https://docs.python.org --max-pages 50
```

搜索并抓取前 3 条结果:

```bash
crawl4ai-skill search-and-crawl "Vue 3 best practices" --crawl-top 3
```

### 步骤3:处理动态页面

对 JavaScript 渲染的页面(如雪球、知乎),追加等待策略:

```bash
crawl4ai-skill crawl https://xueqiu.com/S/BIDU --wait-until networkidle --delay 2
```

### 步骤4:选择输出格式并落盘

- `fit_markdown`(推荐):智能提取正文,去除导航、广告等噪声,节省约 80% Token:

```bash
crawl4ai-skill crawl https://example.com --format fit_markdown
```

- `raw_markdown`:保留完整页面结构:

```bash
crawl4ai-skill crawl https://example.com --format raw_markdown
```

保存到文件:`--output result.md`。

## 常用参数参考

```bash
# 搜索
--num-results 10            # 结果数量

# 单页抓取
--format fit_markdown       # 输出格式
--output result.md          # 输出文件
--wait-until networkidle    # 动态页面等待策略
--delay 2                   # 额外等待秒数
--wait-for ".selector"      # 等待指定元素出现

# 全站爬取
--max-pages 100             # 最大爬取页数
--max-depth 3               # 最大爬取深度
```

## 典型场景

**文档站爬取**:`crawl-site https://docs.fastapi.com --max-pages 100`,自动移除导航栏、侧边栏、广告,保留标题、正文、代码块(示例页面 Token 从 50,000 降至 10,000)。

**动态页面采集**:对重 JS 页面使用 `--wait-until networkidle --delay 2`。

使用说明

# 智能网页爬虫(crawl4ai-skill)

免费网页搜索与爬取命令行工具,基于 crawl4ai。无需 API Key,支持搜索、单页抓取、全站爬取和 JavaScript 动态页面,输出 LLM 友好的 Markdown。

## 安装

```bash
pip install crawl4ai-skill
```

## 快速上手

```bash
# 搜索
crawl4ai-skill search "python web scraping"

# 抓取单个页面
crawl4ai-skill crawl https://example.com

# 爬取整个文档站
crawl4ai-skill crawl-site https://docs.python.org --max-pages 50

# 搜索并抓取前 3 条结果
crawl4ai-skill search-and-crawl "Vue 3 best practices" --crawl-top 3
```

## 说明

- 推荐使用 `--format fit_markdown` 输出,自动去噪并节省约 80% Token。
- 动态渲染页面(雪球、知乎等)加 `--wait-until networkidle --delay 2`。

如何安装此技能?

访问技能市场,点击「安装」按钮,按提示将技能包放入 AI 编程助手的 skills 目录即可。

浏览技能市场

支持平台:Qoder · QoderWork · Claude · Codex 等 AI 编程助手