LLM 抽信息不敢信?这个 Google 开源工具让每个字段都能溯源回原文
你有没有过这种崩溃瞬间:手里攥着一份 200 页的法律合同、一堆放射科报告、或者几百万字的社媒评论,让 Claude 帮你”提取所有关键信息”——结果它给你吐回来一段看似工整、其实幻觉满天飞的 JSON,你根本不敢用。
今天扒到一个直接戳中这个痛点的开源神器——Google 的 LangExtract,GitHub 已经 23k+ stars,干的事就一句话:用 LLM 抽结构化信息,但每一个字段都能溯源回原文的具体字符位置,附赠一个交互式 HTML 报告,点哪个字段直接跳转到原文高亮处。
它解决的最大问题:LLM 抽取的”幻觉溯源”难题
普通 prompt 让模型”提取人名、地名、事件”,模型吐出来的字段你完全没法验证——它是不是瞎编的?对应原文哪里?有没有张冠李戴?传统做法只能人工逐条核对,几百条还行,几千条直接劝退。
LangExtract 的核心解法是 Source Grounding(源接地):抽取结果里每一条都带字符偏移量,HTML 报告里点一下”苹果公司”就自动滚到原文里”苹果公司”出现的位置并高亮。这意味着审计、复核、纠错全部从”重读全文”变成”点几下鼠标”。
上手只要 3 行
安装一行:
pip install langextract
核心调用示例(Gemini 抽取《罗密欧与朱丽叶》人物关系):
- 写 prompt_description 声明抽取规则
- 给几个 ExampleData 当 few-shot 例子
- 丢文本进去,
lx.extract(...)直接出 JSONL + HTML 报告
支持 Gemini、OpenAI、以及本地 Ollama 跑 Gemma2——隐私敏感场景也能用。
4 个最戳打工人的实战场景
- 医疗放射报告结构化:官方给了个 RadExtract demo,能从自由文本报告里抽”肺部结节尺寸=1.2cm”这种关键字段,直接喂给下游病历系统
- 法律合同条款抽取:把 200 页合同丢进去,让它按 few-shot 模板抽”责任方、违约金、生效日期”,输出能直接进 CRM
- 竞品监控 + 商业情报:批量抓新闻,抽”公司A收购公司B、金额=5亿美元”这种事件,构建结构化情报库
- 文学/学术研究:分析《罗密欧与朱丽叶》全文抽人物情感变化轨迹,或者给社科学者抽论文里的”研究方法、样本量、结论”
为什么我把它放在”拾遗精选”序列
市面上的 LLM 信息抽取工具不少,但大多数要么闭源(要钱)、要么不溯源(不敢用)、要么不支持长文档(百万字直接 OOM)。LangExtract 是少有的 开源 + 精确溯源 + 长文档并行 + 多模型 + 可视化 全占齐的方案,而且 Google 团队在持续更新(v1.6.0,2026 年发布),Apache 2.0 协议商用也没坑。
如果你受够了让 AI 抽数据但又不敢信的尴尬,这一个直接戳中。
🔗 GitHub: https://github.com/google/langextract
评论区
登录后可评论。