Maxun:开源无代码网页抓取、爬取、搜索与 AI 数据提取平台
Maxun 是一个开源无代码网页数据平台,可将任意网站变成结构化 API。它提供 Extract(录制模式与 AI 模式)、Scrape、Crawl、Search、文档与图像解析五类机器人,并配套 SDK、CLI、定时运行、MCP 支持与自托管能力,项目采用 AGPLv3 许可证。
社区作者 · zZz
它解决什么问题
Maxun 是一个开源的无代码网页数据平台,目标是把网页变成结构化、可靠的数据,口号是「Turn Any Website Into A Structured API」。它同时支持 extraction(提取)、crawling(爬取)、scraping(抓取)和 search(搜索),可从简单场景扩展到复杂的自动化工作流。
【生态与能力】
- Extract:模拟真实用户行为,从任意网站采集结构化数据,包含两种方式——Recorder Mode(录制你的浏览操作,Maxun 将其转成可复用的提取机器人)与 AI Mode(用自然语言描述需求,由 LLM 驱动的提取完成其余工作)。
- Scrape:把整张网页转换成干净的 Markdown 或 HTML,并可截取截图,适合 AI 工作流、Agent 与文档处理。
- Crawl:爬取整站,从每个相关页面提取内容,并可控制抓取范围与发现策略。
- Search:运行自动化网页搜索以发现或抓取结果,支持基于时间的过滤。
- SDK:面向开发者的完整工具包,用于抓取、提取、调度和端到端数据自动化。
- CLI:在终端中创建机器人、触发运行并获取提取到的数据。
- Document Extraction & Parsing:从 PDF、DOCX、XLSX、CSV 文档中用原生解析器提取结构化数据;对扫描版 PDF、JPG、PNG 图像使用 OCR;也可转换成干净的 Markdown、HTML、链接列表或摘要。
【五类机器人】 Extract(录制模式 / AI 模式)、Scrape、Crawl、Search、Document Extraction & Parsing。官方演示示例包括:用录制模式从 Airbnb 提取 10 条房源信息;用 AI 模式从 IMDb 提取 Top 50 电影的片名、评分与时长;以及文档与图像解析场景。页面中嵌入了两个演示视频文件(Maxun_Airbnb.mp4、maxun_ai_mode_extraction.mp4),但正文未给出任何视频生成提示词。
【特性清单】 无代码点击式界面提取数据;LLM 驱动的提取(自然语言描述需求);开发者 SDK(程序化提取、调度与机器人管理);自动处理分页与滚动;按计划定时运行机器人;把网站变成 REST API;把网站数据导出到 Google Sheets 与 Airtable;适应网站布局变化并自动恢复;支持登录后内容提取;从文档与图像提取(OCR 扫描版 PDF/JPG/PNG,解析 DOCX/XLSX/CSV);集成常用工具;支持 MCP(Model Context Protocol);产出 LLM 就绪的干净 Markdown;可自托管;开源且社区驱动。
【使用场景】 官方列出线索生成(lead generation)、市场调研、内容聚合等方向,另有使用案例页面 https://www.maxun.dev/usecases。文档解析方面可用于:数字化扫描票据与发票、从纸质表单照片中提取字段、把表格截图转换为结构化数据、把扫描文档转换为干净 Markdown 供 AI 工作流使用。
【适用对象】 不想写代码但需要采集网页数据的业务人员、做线索与市场调研的运营与销售团队、需要为 AI/Agent 准备干净数据的开发者、需要定时抓取与 API 化数据的工程团队,以及希望自托管、完全掌控基础设施的组织。
【赞助商信息(正文内容)】 Webshare:提供 8000 万+ 代理 IP 池、覆盖 195+ 国家,支持轮换住宅、静态 ISP、数据中心代理与完整 API,100+ Gbps 骨干网,可按国家/城市/州/ZIP/ASN 定位,无需信用卡即可开始;免费档 10 个代理 + 1GB/月,折扣码 MAXUN20(首购 20% off)。Mango Proxy:提供 200+ 国家的住宅、ISP、数据中心与移动代理,支持 HTTP(S)/SOCKS5,折扣码 MAXUN(静态 ISP 代理 8% off)。
Nodemaven:面向网页抓取与自动化的代理,支持 ZIP 定位、99.9% 在线率、所有代理欺诈分 <97%、无需 KYC,并提供代理带宽检测、Meta Tag 检查、IP 查询等工具,折扣码 MAXUN35(移动与住宅 35% off)、MAXUN40(静态 ISP 40% off)。TestMu AI:原生 AI-agentic 云平台,面向质量工程,主打更智能的测试与更快交付。相关赞助商标识见配图 2 至配图 5,项目标识见配图 1,贡献者头像墙见配图 6。
— 本文由 AI 根据公开来源辅助整理,命令、版本与许可证请在使用前到原始页面复核。
安装 / 开始使用
【最快上手方式】使用官方托管版本:https://app.maxun.dev 。其余入口:文档(Documentation)、官网(Website)、Discord 社区、教程视频(Watch Tutorials)均可从仓库页顶部的链接进入。
【本地安装概览】 正文说明 Maxun 可以在本地运行,分为“带 Docker”和“不带 Docker”两种方式。仓库 README 只列出了章节入口,未在本页给出逐条命令,因此具体命令与依赖版本需以官方文档为准(待核验)。可确认的章节顺序为:
- 环境准备与安装入口:Installation —— 下设“Setup with Docker Compose”“Setup without Docker”“Environment Variables”“SDK”四个部分。
- 首次运行:完成上述任一安装方式后启动服务,再访问本地实例使用。具体启动命令、端口与首次登录方式:待核验。
- 升级与自托管:Upgrading & Self Hosting —— 下设“Self Host Maxun With Docker”“Upgrade Maxun With Docker Compose Setup”“Upgrade Maxun Without Docker Compose Setup”。
【分步说明(按正文结构整理)】
- 准备环境:选择 Docker Compose 方式时需准备 Docker 与 Docker Compose 环境;选择非 Docker 方式时按文档准备本地运行环境。具体运行时版本要求:待核验。
- 配置环境变量:安装流程中包含独立的环境变量章节,需在启动前完成配置。变量名称、取值与必填项:待核验。
- 安装并启动:按所选方式完成部署后启动 Maxun。
- 首次运行:进入应用后,可按五类机器人创建任务——Extract(Recorder Mode 录屏式录制操作,或 AI Mode 用自然语言描述需求)、Scrape(网页转 Markdown/HTML 并截图)、Crawl(整站爬取)、Search(自动化搜索并支持时间过滤)、Document Extraction & Parsing(上传 PDF/DOCX/XLSX/CSV/JPG/PNG,OCR 或解析后转 Markdown/HTML/链接/摘要或提取指定字段)。
- 定时与集成:可设置机器人按计划运行,并将数据导出到 Google Sheets、Airtable 或通过 REST 接口使用。
- 开发者接入:使用 SDK 进行程序化提取、调度与机器人管理;使用 CLI 在终端创建机器人、触发运行并取回数据。
- 升级/自托管:按“Self Host Maxun With Docker”“Upgrade Maxun With Docker Compose Setup”“Upgrade Maxun Without Docker Compose Setup”三个章节执行对应流程。
【常见问题(正文可对应部分)】
其余未在本页说明的命令、配置与故障排查细节:待核验。
- 网站改版导致抓取失效:Maxun 宣称可适应网站布局变化并自动恢复。
- 需要登录才能看到的内容:支持处理认证,可提取登录后的数据。
- 页面有分页或需要滚动:由系统自动处理分页与滚动。
- 想给 AI/Agent 喂数据:Scrape 可输出干净 Markdown,属于 LLM-ready 数据。
- 需要与外部工具打通:支持 MCP(Model Context Protocol)与常用工具集成。
- 想完全掌控基础设施:可自托管。