Multi-Modal Researcher:LangGraph + Gemini 2.5 的多模态研究播客一条龙
说个让我眼前一亮的项目——Multi-Modal Researcher,来自 LangChain 官方仓库。它把 Gemini 2.5 的三件套原生能力:视频理解、Google Search、TTS,串成了一条”搜索→看视频→写报告→录播客”的完整工作流。
简单说:你扔一个 topic,可以附带一条 YouTube 链接,它给你出一份带引用来源的 Markdown 报告,外加一段双角色播客音频。四个节点串起来,LangGraph 写的,逻辑非常干净。
技术视角的高光时刻
首先是多模态输入→多通道产出。你扔一个 topic 或者 topic + YouTube 链接,它自动搜索、自动解析视频、自动合并洞察、自动生成结构化报告,最后还能把报告转成双角色播客脚本并配音成 WAV。输入输出全是不同模态,这种工程化的端到端设计值得细品。
其次是Gemini 原生能力榨取得很彻底。搜索、视频解析、TTS 全是 Gemini 2.5 自带的原生工具,不造轮子,靠 LangGraph 串起来。整个架构非常轻,部署成本基本就是一张 API Key,零负担。
第三,LangGraph 的流程编排本身就是教材。四个节点:search → analyze_video → create_report → create_podcast,每个都能独立配置模型、温度、声音参数。可以停在 Markdown 阶段跳过视频处理,也可以全链路跑。拿它当模版改自己的 Agent Flow,属于”看得见的工程爽感”。
第四,播客脚本默认是”专家访谈”形式。Mike 问、Dr.Sarah 答,配上 Kore、Puck 这种中性化英文 voice,听感比想象中自然很多,不像机械念稿。
局限性也得说清楚
强依赖 Gemini 私有 API 是事实——搜索、视频、TTS 全绑定 Google 平台,换模型功能就断。当然可以接 Tavily / Serper / Ollama,TTS 换 Piper 或 XTTS,YouTube loader 用 LlamaIndex,但那是二次开发的事了。
RAG 深度不够——现在是一跳搜索加合并摘要,没有 Map-Reduce,也没有反思循环。但 LangGraph 本身加这些模块非常容易,生态里开源组件一堆。
最值得警惕的是内容直接播、幻觉风险被放大这件事。播客内容是自动生成并直接朗读的,没做任何审核。一旦出幻觉,错误信息会被直接念出来。建议在 create_report → create_podcast 之间加一个 moderation 节点。
用得巧是信息流中枢,用得懒就是幻觉扩音器
Multi-Modal Researcher 本质上是一台小型内容自动化引擎:你抛问题,它给一份能读、能听、能讲出来的完整知识包。配合笔记工具使用——Markdown 笔记直出播客,再发小红书,内容闭环很顺。
部署也简单,Python 3.11 + uv,一行命令起服务,Smith.langchain.com 有可视化界面。
👉 GitHub:https://github.com/langchain-ai/multi-modal-researcher
GitHub: https://github.com/langchain-ai/multi-modal-researcher
评论区
登录后可评论。