搜索#网页爬取#结构化抽取

Firecrawl MCP:抓网页、爬整站、按结构抽数据

Firecrawl 官方 MCP。智能体能把网页转成 Markdown 或按 JSON 结构抽取,能爬整站、列出站点地图,还能先点击再读取,可接云端或自建实例。

项目与安装文档

查看项目

https://github.com/firecrawl/firecrawl-mcp-server

普通的网页抓取工具碰到要跑 JavaScript 的页面、需要翻几十页的文档站,或者想要表格里的结构化字段,就力不从心了。Firecrawl MCP 是 Firecrawl 官方的服务,把抓单页、爬整站、列链接、按结构抽取这些活交给 Firecrawl 的后端处理,智能体只拿结果。截至 2026-10-06 约 7,600 star。

能做什么

  • 抓单页:firecrawl_scrape 把已知网址转成 Markdown,或按你给的 JSON Schema 抽取字段。
  • 爬站和列地图:firecrawl_map 只列出站点里的网址,firecrawl_crawl 按 limit、includePaths 等限制批量抓取多页,firecrawl_check_crawl_status 查进度。
  • 搜索加抓取:firecrawl_search 从查询出发返回排序结果,可在同一次调用里抓正文。
  • 交互与监控:firecrawl_interact 先点击、输入再读取页面;firecrawl_monitor_* 定期检查页面变化并给出差异;firecrawl_agent 做自主调研。

适合谁

  • 要把整个文档站、博客或产品目录喂给智能体做 RAG 或分析的开发者。
  • 需要从网页里批量抽取价格、职位等结构化字段的数据和增长团队。

接入方式

需要 Firecrawl API 密钥(或自建实例的 FIRECRAWL_API_URL)。Claude Desktop 配置:

{
  "mcpServers": {
    "mcp-server-firecrawl": {
      "command": "npx",
      "args": ["-y", "firecrawl-mcp"],
      "env": {
        "FIRECRAWL_API_KEY": "YOUR_API_KEY_HERE"
      }
    }
  }
}

也可以直接连托管地址 https://mcp.firecrawl.dev/v2/mcp,免密钥档能用抓取、搜索和解析,有频率限制。

编辑点评

只读几个页面,用官方的 Fetch 服务就够了;Firecrawl 的价值在规模和结构:渲染 JavaScript、整站爬取、按 Schema 抽字段、定期监控,这些单靠一个 fetch 工具做不到。代价是它主要按云端额度计费,crawl、map、agent 都需要密钥,大站爬取消耗额度很快,firecrawl_credit_usage 可以随时查余量。自建版能省掉费用但要维护 Firecrawl 本体。大规模抓取别人的网站前,先看清对方的服务条款和 robots 规则。许可证为 MIT。