Firecrawl:162K Star 的 AI 爬虫神器,连 API Key 都不用填了

搭 AI Agent 的时候,让它上网查资料听起来很简单:给个搜索工具,调个 API,返回几条链接——但真做起来才知道噩梦在哪。搜回来的 HTML 里,导航栏、Cookie 弹窗、页脚、广告脚本挤在一块,模型根本看不懂。把网页「洗干净」变成 AI 能理解的干净内容,才是最耗人的活。Firecrawl 就是专门解决这件事的工具,GitHub 上已有 162K Stars。

Firecrawl 的用法简单到极致:输入一个 URL,它返回干净的 Markdown。底层跑的是自研的 Fire-Engine 引擎,自己处理浏览器渲染、JS 执行、智能等待,官方称网页覆盖率 96%,比 Puppeteer 的 79% 和 curl 的 75% 高出一截。反爬最头疼的代理轮换、指纹管理、验证码,也全部替你兜了。同样的页面,原始 HTML 可能要 8 万 token,Firecrawl 输出只要 5600 token——省钱是小事,关键是 Agent 终于「看懂」页面了。

它不只做抓取。/scrape 抓页面、/search 搜索、/interact 填网页表单、/parse 结构化提取,四个核心端点覆盖了 Agent 上网的全部需求。今年 7 月上线的 Web-Scale /monitor 更狠:不是监控某个 URL 变了没,而是全网持续搜索你关心的主题,新内容上线自动通知 Agent。同月还发布了 Research Index——300 万+ arXiv 论文加 GitHub 代码的专用搜索引擎。Claude Code、Cursor、Replit、n8n 都在用它。

最打动开发者的是 6 月上线的「Keyless 免密钥」:不需要注册账号、不需要生成 API Key、不用把 key 贴进 .env 文件,打开终端直接调用,每人每月 1000 次免费调用。对 Agent 开发者来说,这意味着不用「先帮 Agent 注册一个账号」——把 MCP Server 接上,Agent 自己就能搜网、爬页面。这不是临时促销而是产品设计:让你先做出东西,再为用量付费。

实际用起来是什么感觉? 比如你想让 Agent 分析一个 SaaS 产品的定价页:以前用 BeautifulSoup 写,怎么也得三十行代码——请求、解析、去广告、删导航、格式化;现在一行调用,吐出来就是干净的 Markdown,直接喂给模型。再比如做 RAG 知识库,要定期把几十个行业网站的更新抓下来入库,Firecrawl 的定时抓取加结构化提取,一条流水线就能搞定,不用自己维护爬虫集群。v2.11 还加入了不跑 LLM 的确定性 JSON 提取(省钱)和自动 PII 脱敏,企业场景的数据合规也考虑到了。

Firecrawl 出身也很有意思:三个创始人做 YC 孵化项目 Mendable(AI 文档搜索)时被网页数据质量折磨到崩溃,顺手写的内部爬虫反而成了主业,Mendable 慢慢退场。2025 年 8 月完成 1450 万美元 A 轮融资,Shopify CEO Tobias Lütke 天使跟投。定价按页计费、不收人头费:免费档 1000 credits/月,付费从 $16/月起步到 $599/月(100 万页)。开源版是 AGPL-3.0,也可以自托管。

一句话:在 AI 创业公司普遍烧钱的时代,Firecrawl 已经盈利,靠的是「让开发者试过一次就回不去」的零摩擦体验。做 RAG、AI 搜索、Agent 应用的人,值得从免费档开始试试。

项目 详情
:star: Stars 162K+
:hammer_and_wrench: 语言 TypeScript
:scroll: 许可 AGPL-3.0
:desktop_computer: 平台 API 服务 / 自托管

官网

源码