3 行代码把网页变成 LLM 语料,RAG 喂数据再不用手写爬虫
- 2026-09-26 02:14:35
3 行代码把网页变成 LLM 语料,RAG 喂数据再不用手写爬虫做 RAG 知识库或 Agent 的人,大概率都被「网页怎么变成干净文本」这件事卡过:BeautifulSoup 解析一堆标签噪声、动态页面得自己套 Playwright、还要写正则清洗。今天挖到的这个小众但硬核的项目Crawl4AI,目标就一句话——把 Web 直接变成 LLM 友好的 Markdown。它在 GitHub 上已收获 5 万+ Star,是当下最热门的开源爬虫之一。 
01 项目简介 
Crawl4AI 是一个用 Python 写的开源 Web 爬虫与抓取框架。作者 unclecode 在 2023 年受够了一家要账号、要 token、还要 16 美元却交付拉胯的「开源」转 Markdown 工具,一气之下几天撸出了它。它的核心定位很清晰:输出不是 HTML,而是给 AI 用的结构化文本——干净 Markdown、带编号的引用列表、可直接进向量库的 JSON。零密钥、可本地、可 Docker,生产环境也能跑。 
02 功能解析 
它强在三处,正好补齐传统爬虫的短板: 智能 Markdown 自动保留标题、表格、代码块层级,并用BM25 算法过滤掉导航栏、广告等噪声,产出「Fit Markdown」——只留正文核心。 结构化提取 支持JsonCss/JsonXPath基于选择器的零 LLM 抽取,写个 schema 就能把列表页解析成 JSON;也支持接任意 LLM 做语义抽取。 浏览器级控制 基于 Playwright 的异步浏览器池,原生支持登录态 Session、代理、cookie、执行自定义 JS、反爬规避。 下面这段是它最经典的「三行核心」——把任意网页变成 Markdown: 除了 Python API,它还带一个crwl命令行,一行就能跑深度爬取: arun返回的CrawlResult不止markdown一个字段:还有fit_markdown(BM25 去噪版,喂模型更省 token)、extracted_content(结构化 JSON 字符串)、links、success等,按需取用即可。想精细控制爬取行为,还能传css_selector只抓某个区块、传js_code先点「加载更多」再读内容。 
03 部署步骤 
方式一:Python 本地(适合开发调试) 若浏览器报依赖问题,手动补一句:python -m playwright install --with-deps chromium。 方式二:Docker(适合生产 / 服务化) 起来后自带 REST API 与/playground调试界面,直接 POST 任务就能拿到 Markdown 或结构化结果,轻松嵌进你自己的数据管道。 
04 适用场景 

05 推荐理由 
无论你是攒 RAG 语料、做竞品监控,还是给 Agent 接实时网页,Crawl4AI 都值得进你的工具箱。




import asyncio
from crawl4ai import *
asyncdefmain():
asyncwith AsyncWebCrawler() as crawler:
result = await crawler.arun(url="https://example.com")
print(result.markdown)
asyncio.run(main())crwl https://docs.example.com --deep-crawl bfs --max-pages 10

pip install -U crawl4ai
crawl4ai-setup # 自动装好浏览器环境
crawl4ai-doctor # 自检安装是否到位docker pull unclecode/crawl4ai:latest
docker run -d -p 11235:11235 --name crawl4ai --shm-size=1g unclecode/crawl4ai:latest

RAG 语料建设:把公司文档站、帮助中心批量转成干净 Markdown,直接切块进向量库,召回质量比 HTML 清洗高一个档次。
竞品 / 行业监控:定时 deep crawl 对手更新页,再配合 LLM 抽取自动生成简报。
论文与法规采集:学术站、政府公开页往往表格密布,Crawl4AI 能原样保留表格结构,后续分析省力。


AI 原生:对比 Scrapy / Selenium 只产出原始 HTML,它直接产出 Markdown / JSON,省掉你 80% 的清洗代码。
异步高并发:浏览器池 + 缓存,批量抓取快且稳。
零门槛可私有化:不依赖任何外部付费 API,数据完全自己掌控,契合极客「own your data」的信条。
本文来自网友投稿或网络内容,如有侵犯您的权益请联系我们删除,联系邮箱:wyl860211@qq.com 。