MCP Speak

给 AI Agent 装上语音的 MCP 服务器

AI音频 部分免费

项目简介 MCP Speak 是一个基于 Model Context Protocol(MCP)的 macOS 专用服务器,它将 AI 代理的文本输出实时合成为语音,让 Agent 不再只是沉默地返回文字,而是能够开口说话。项目名称中的「Speak」正是这个核心能力的体现:AI 代理可以主动播报状态更新、提出澄清性问题、在配对会话中给出语音反馈——这一切都由 macOS 原生的 OmniVoice 系统完成,无需额外语音合成 API。

核心功能 实时语音输出:AI 代理的每条回复同步转换为语音,无需等待完整对话结束。

macOS 原生语音:调用系统级 OmniVoice 语音合成引擎,无需第三方 TTS API。

MCP 标准协议:严格遵循 MCP 规范,可与 Claude Code、Cody 等主流 AI 编码助手配合使用。

灵活播报控制:支持选择播报时机(全部/仅重要/仅摘要),避免语音过于嘈杂。

技术原理 项目基于 MCP 服务器架构,监听 AI 代理的文本输出事件,通过 macOS AVSpeechSynthesizer 将文字转换为语音。OmniVoice 是苹果在 macOS Sequoia 中引入的系统级语音系统,音质远优于传统 AVSpeechSynthesizer,且无需申请任何 API Key。

适用场景 需要边写代码边听 AI 播报进度的开发者;希望 AI 在执行长时间任务时主动语音通知;打造更自然的人机语音交互体验。

团队信息

由 AI 猎手自动发现

评论与建议

0 条评论