多媒体#OCR

ImageSorcery MCP:让智能体在本地识别和编辑图片

本地运行的图片处理 MCP:裁剪、缩放、旋转、打码、加水印,还能用目标检测找物体、用 OCR 提取文字,图片不上传任何服务器,适合批量处理截图和照片。

项目与安装文档

查看项目

https://github.com/sunriseapps/imagesorcery-mcp

让智能体处理图片,很多工具会把图传到云端模型去“看”,涉及截图、证件、内部文档时总让人不放心。ImageSorcery MCP 走本地路线:用 OpenCV 做裁剪、缩放、画框、打码,用 Ultralytics 模型做目标检测,用 EasyOCR 识别文字,全部在你的电脑上跑。截至 2026-10-06 约 330 star。

能做什么

  • 基础编辑:crop、resize、rotate、change_color(比如转成黑白或复古色),overlay 叠加 Logo 或水印。
  • 标注和打码:draw_rectangles、draw_arrows、draw_texts 在图上标注,blur 对指定区域打码,fill 填色或把区域变透明。
  • 识别:detect 用预训练模型检测物体,可返回分割蒙版;find 按文字描述找物体(比如“照片里的狗”);ocr 提取图中文字。
  • 组合任务:模型会把多个工具串起来,比如先 find 出猫的位置,再 crop 让它居中;内置的 remove-background 提示词会引导完成抠图流程。

适合谁

  • 写文档、做教程的人,想让智能体批量给截图加箭头、框选和打码。
  • 整理照片的人,想按内容(比如“有宠物的照片”)自动分拣到不同文件夹。
  • 处理扫描件和表单的人,想先 OCR 出文字或识别表单字段,再整理成文本。

接入方式

需要 Python 3.10+ 和 pipx。安装后一定要运行一次 post-install,它会下载检测模型:

pipx install imagesorcery-mcp
imagesorcery-mcp --post-install

然后在客户端配置里加上 "imagesorcery-mcp": {"command": "imagesorcery-mcp", "timeout": 100}。

编辑点评

图片类 MCP 多半是“调用生成模型出图”,ImageSorcery 做的是更日常的活:改图、标注、识别,而且不联网,这是它被选中的原因。要注意几点:默认不限制文件路径,智能体能读写你电脑上任意位置的图片,建议用 IMAGESORCERY_AVAILABLE_PATHS 限定到指定目录;首次安装要下载模型,体积不小;OpenCV 在精简的 Linux 或 Docker 环境里可能缺系统库。匿名统计默认关闭,但 README 给 Cline 的一键安装提示里会让智能体征得同意后开启,留意一下。最近一次提交在 2026 年 5 月,更新节奏不算快。许可证为 MIT。