智
智能网页爬虫
作者:鹿Sir开发工具v1
基于 crawl4ai 的智能网页爬取工具,支持 DuckDuckGo 搜索、单页抓取、全站爬取与 JavaScript 动态页面抓取,输出为 LLM 友好的 Markdown 并可节省约 80% Token。当用户需要爬取网页、抓取网站内容、爬文档站、搜索资料并抓取结果、采集动态渲染页面时触发。触发词:爬虫、爬取、网页抓取、全站爬取、spider、scrape、文档站爬取、搜索并抓取。
下载量
359
点赞
86
价格
免费
技能文档
--- name: crawl4ai-skill title: 智能网页爬虫 description: 基于 crawl4ai 的智能网页爬取工具,支持 DuckDuckGo 搜索、单页抓取、全站爬取与 JavaScript 动态页面抓取,输出为 LLM 友好的 Markdown 并可节省约 80% Token。当用户需要爬取网页、抓取网站内容、爬文档站、搜索资料并抓取结果、采集动态渲染页面时触发。触发词:爬虫、爬取、网页抓取、全站爬取、spider、scrape、文档站爬取、搜索并抓取。 category: 开发工具 --- # 智能网页爬虫(crawl4ai-skill) 免费开源的网页搜索与爬取 CLI,无需 API Key,输出为 LLM 优化的 Markdown。 核心能力: - **网页搜索**:基于 DuckDuckGo,免 API Key - **单页抓取**:智能去噪,提取正文 - **全站爬取**:识别 sitemap,递归爬取整站 - **动态页面**:支持 JavaScript 渲染页面(雪球、知乎等) - **Token 优化**:fit_markdown 输出可节省约 80% Token ## 技能工作流 ### 步骤1:安装工具 ```bash pip install crawl4ai-skill ``` ### 步骤2:选择模式并执行 按任务类型选择命令: | 命令 | 说明 | |------|------| | `search <query>` | 网页搜索 | | `crawl <url>` | 单页抓取 | | `crawl-site <url>` | 全站爬取 | | `search-and-crawl <query>` | 搜索并抓取头部结果 | 搜索: ```bash crawl4ai-skill search "python web scraping" ``` 单页抓取: ```bash crawl4ai-skill crawl https://example.com ``` 全站爬取: ```bash crawl4ai-skill crawl-site https://docs.python.org --max-pages 50 ``` 搜索并抓取前 3 条结果: ```bash crawl4ai-skill search-and-crawl "Vue 3 best practices" --crawl-top 3 ``` ### 步骤3:处理动态页面 对 JavaScript 渲染的页面(如雪球、知乎),追加等待策略: ```bash crawl4ai-skill crawl https://xueqiu.com/S/BIDU --wait-until networkidle --delay 2 ``` ### 步骤4:选择输出格式并落盘 - `fit_markdown`(推荐):智能提取正文,去除导航、广告等噪声,节省约 80% Token: ```bash crawl4ai-skill crawl https://example.com --format fit_markdown ``` - `raw_markdown`:保留完整页面结构: ```bash crawl4ai-skill crawl https://example.com --format raw_markdown ``` 保存到文件:`--output result.md`。 ## 常用参数参考 ```bash # 搜索 --num-results 10 # 结果数量 # 单页抓取 --format fit_markdown # 输出格式 --output result.md # 输出文件 --wait-until networkidle # 动态页面等待策略 --delay 2 # 额外等待秒数 --wait-for ".selector" # 等待指定元素出现 # 全站爬取 --max-pages 100 # 最大爬取页数 --max-depth 3 # 最大爬取深度 ``` ## 典型场景 **文档站爬取**:`crawl-site https://docs.fastapi.com --max-pages 100`,自动移除导航栏、侧边栏、广告,保留标题、正文、代码块(示例页面 Token 从 50,000 降至 10,000)。 **动态页面采集**:对重 JS 页面使用 `--wait-until networkidle --delay 2`。
使用说明
# 智能网页爬虫(crawl4ai-skill) 免费网页搜索与爬取命令行工具,基于 crawl4ai。无需 API Key,支持搜索、单页抓取、全站爬取和 JavaScript 动态页面,输出 LLM 友好的 Markdown。 ## 安装 ```bash pip install crawl4ai-skill ``` ## 快速上手 ```bash # 搜索 crawl4ai-skill search "python web scraping" # 抓取单个页面 crawl4ai-skill crawl https://example.com # 爬取整个文档站 crawl4ai-skill crawl-site https://docs.python.org --max-pages 50 # 搜索并抓取前 3 条结果 crawl4ai-skill search-and-crawl "Vue 3 best practices" --crawl-top 3 ``` ## 说明 - 推荐使用 `--format fit_markdown` 输出,自动去噪并节省约 80% Token。 - 动态渲染页面(雪球、知乎等)加 `--wait-until networkidle --delay 2`。
支持平台:Qoder · QoderWork · Claude · Codex 等 AI 编程助手