产品推荐 2026-07-22

langextract:免费的非结构化文本信息提取工具

LangExtract 是一个 Python 库,利用大语言模型从非结构化文本(如临床笔记、报告)中提取结构化信息。

开源软件跨平台工具

产品简介

LangExtract 是一个 Python 库,利用大语言模型从非结构化文本(如临床笔记、报告)中提取结构化信息。它解决手动提取效率低、准确性差的问题,支持精确源定位和交互式可视化,适合医疗、研究、数据分析等领域的专业人士和开发者。

langextract 主界面

核心功能

  • 精确源定位,映射提取到源文本位置
  • 可靠结构化输出,强制一致的输出模式
  • 优化长文档处理,使用分块和并行处理提高召回率
  • 交互式可视化,生成 HTML 文件查看提取结果
  • 灵活 LLM 支持,兼容云模型和本地模型

快速开始

  1. 导入 langextract 库并定义提取任务,包括 prompt 和 examples
  2. 调用 lx.extract 函数运行提取,指定输入文本和模型
  3. 使用 lx.io.save_annotated_documents 保存结果并生成交互式可视化 HTML

界面预览

与其他方案对比

对比项langextract同类方案
提取精度与验证精确源定位和交互式可视化,便于追踪和验证提取结果传统工具可能缺乏上下文追踪,验证困难
模型支持灵活性支持多种 LLMs,包括云模型(如 Gemini)和本地模型(通过 Ollama)同类工具可能仅支持特定模型或需额外定制
长文档处理能力优化策略如文本分块和并行处理,提高大文档提取召回率可能受模型上下文限制,处理长文档时提取不全

适合谁用

  • 处理临床笔记的医疗研究人员
  • 分析文本报告的数据分析师
  • 开发自然语言处理应用的开发者

下载与版本

当前最新版本为 v1.6.0,发布于 2026-07-02。支持 Windows、macOS、Linux。点击页面「下载软件」按钮即可下载打包好的版本,根据你的电脑/手机系统来选择对应的软件。

注意事项

  • 本工具仅供学习和研究使用,请遵守相关法律法规。
  • 请尊重内容创作者版权,勿将下载内容用于商业或非法传播。
  • 项目源码地址:https://github.com/google/langextract