办公#文本转语音#语音转文字

joinly:让智能体参加 Zoom、Teams 和 Google Meet 会议

自托管的会议中间件,智能体通过 MCP 加入浏览器里的视频会议,读实时转录、用语音或聊天发言,模型和语音服务可自选。

项目与安装文档

查看项目

https://github.com/joinly-ai/joinly

会议纪要类工具大多只做一件事:会后给你一份转录。joinly 想让智能体真正“在场”:它通过 MCP 提供入会、听、说、看共享屏幕的能力,智能体可以在会议进行中回答问题,顺手调用其他 MCP 工具去建 GitHub issue 或改 Notion 页面。整套服务打包在一个 Docker 镜像里,自托管运行。

能做什么

  • 会议控制:join_meeting 用会议链接、显示名和可选密码入会,leave_meeting 离开,mute_yourself、unmute_yourself 控制麦克风。
  • 听和看:get_transcript 按分钟取转录,transcript://live 资源可订阅实时更新并带说话人信息;get_participants、get_chat_history 查与会者和聊天记录,get_video_snapshot 截取当前画面,比如共享的屏幕。
  • 发言:speak_text 用 TTS 说话,send_chat_message 在会议聊天里发消息,内置处理打断和多人对话的逻辑。
  • 可替换组件:语音识别可选 Whisper 或 Deepgram,语音合成可选 Kokoro、ElevenLabs、Deepgram,模型支持各家 API 和本地 Ollama。

适合谁

  • 想做会议助理原型、让智能体在会上实时查资料或记录待办的开发者。
  • 需要会议转录但不愿把音频交给第三方 SaaS 的团队。

接入方式

需要 Docker 和一个模型 API key(写在 .env 里)。镜像约 2.3 GB,内含浏览器和模型。作为 MCP 服务器启动,只绑定本机端口:

docker pull ghcr.io/joinly-ai/joinly:latest
docker run -p 127.0.0.1:8000:8000 ghcr.io/joinly-ai/joinly:latest

再用 uvx joinly-client --env-file .env <MeetingUrl> 或自己的 MCP 客户端连接。

编辑点评

截至 2026-10-06 约 570 star,会议场景的 MCP 里它的工具设计最完整:既能读实时转录,又能开口说话,还能把其他 MCP 工具带进会议。和托管的会议机器人服务相比,它的卖点是全部自托管、模型自选。代价也很实在:镜像体积大,本地跑语音识别需要不错的硬件,最近一次推送是 2026 年 9 月初。安全上,README 明确警告 MCP 服务器没有身份验证、接受客户端传入的配置,只能绑定 localhost 给单个可信客户端用。另外,让机器人进会录音转写前,务必告知并征得与会者同意。许可证为 MIT。