大模型 活跃维护

llm-app

pathwaycom/llm-app

即用型云模板,适用于 RAG、AI 流水线以及实时数据的企业搜索。🐳 支持 Docker。⚡始终与 Sharepoint、Google Drive、S3、Kafka、PostgreSQL、实时数据 API 等保持同步。

58908
Stars 标星
1500
Forks 分支
95
Watchers 关注
8
Open Issues
Jupyter Notebook
主要语言
MIT
开源协议
61.1 MB
仓库大小
2 个月前
最后推送
一键安装扩展 / 插件指令
dsh plugin --profile web add github:pathwaycom/llm-app
git clone https://github.com/pathwaycom/llm-app.git
git clone git@github.com:pathwaycom/llm-app.git
README.md main

机器翻译正文由机器翻译自项目原始文档(英文),排版经程序统一处理,可能存在偏差,请以原项目仓库为准。

路径实时数据框架 AI 流水线

Pathway Live Data Framework 的 AI 流水线 允许您快速将 AI 应用投入生产,这些应用能够在您的数据源中使用最 最新的知识 提供 高精度的 RAG 和企业级 AI 搜索。它为您提供了可直接部署的 LLM(大型语言模型)应用模板。您可以在自己的机器上进行测试,并部署到云端(GCP、AWS、Azure、Render 等)或本地环境。

这些应用可以连接并同步(所有新的数据添加、删除、更新)到您的 文件系统、Google Drive、Sharepoint、S3、Kafka、PostgreSQL、实时数据 API 等数据源。它们不依赖任何需要单独设置的基础设施。它们内置了 数据索引,支持向量搜索、混合搜索和全文搜索——所有操作均在内存中完成,并带缓存功能。

应用模板

本仓库提供的应用模板可扩展到数百万页文档。其中一些模板经过简化优化,一些模板则追求极高的准确性。选择最适合您的模板即可。您可以直接使用,也可以更改流水线的某些步骤——例如,如果您想添加新的数据源,或将向量索引更改为混合索引,只需一行代码即可完成。

应用(模板) 描述
Question-Answering RAG App 基本端到端RAG应用。一个问答流水线,使用所选的GPT模型对连接的数据源(PDF、DOCX等文件,Google Drive、Sharepoint等)中的文档进行查询并提供答案。您也可以尝试演示REST端点
Live Document Indexing (Vector Store / Retriever) 实时文档索引流水线,用于RAG,作为向量存储服务。对来自连接数据源(PDF、DOCX等文件,Google Drive、Sharepoint等)的文档进行实时索引。可与任何前端一起使用,或集成为LangchainLlamaindex应用的检索器后端。您还可以尝试演示REST端点
Multimodal RAG pipeline with GPT4o 在解析阶段使用GPT-4o进行多模态RAG,以索引来自连接数据源(文件、Google Drive、Sharepoint等)的PDF及其他文档。非常适合从文件夹中提取非结构化的财务文档信息(包括图表和表格),并在文档更改或新增时更新结果。
Unstructured-to-SQL pipeline + SQL question-answering 一个RAG示例,可连接到非结构化财务数据源(财务报表PDF),将数据结构化为SQL并加载到PostgreSQL表中。同时,该应用可通过LLM将用户的自然语言查询转换为SQL,并在PostgreSQL表上执行查询,以回答财务文档相关的自然语言问题。
Adaptive RAG App 一个使用自适应 RAG 的 RAG 应用程序,这是由 Pathway 开发的一种技术,可在保持准确性的同时将 RAG 的令牌成本降低最多 4 倍。
Private RAG App with Mistral and Ollama question_answering_rag RAG 流程的完全私有(本地)版本,使用 Pathway 实时数据框架、Mistral 和 Ollama。
Slides AI Search App 一个用于检索幻灯片的索引流程。它能够对 PowerPoint 和 PDF 进行多模态处理,并维护幻灯片的实时索引。
Video RAG with TwelveLabs 一个针对视频的 RAG 流程。它使用 TwelveLabs 的 Pegasus 将视频转换为丰富的文本描述,并使用 Marengo 多模态嵌入对其进行索引,这样您就可以在实时连接的数据源(文件、Google Drive 等)上对视频提问。

这些人工智能管道是如何运作的?

这些应用可以作为Docker 容器运行,并提供HTTP API以连接前端。为了便于快速测试和演示,一些应用模板还包括可选的 Streamlit 用户界面,该界面可连接到该 API。

这些应用依赖于Pathway Live Data Framework进行数据源同步和处理 API 请求(Pathway 是一个独立的 Python 库,其中内置了 Rust 引擎)。它们为您提供简单且统一的应用逻辑,涵盖后端、嵌入、检索和 LLM 技术栈。无需为您的生成式 AI 应用集成和维护单独的模块:~向量数据库(例如 Pinecone/Weaviate/Qdrant) 缓存(例如 Redis) API 框架(例如 Fast API)~。Pathway 默认选择的内置向量索引基于高速 usearch 库,而混合全文索引使用 Tantivy 库。所有功能开箱即用。

入门指南

本仓库中的每个 应用模板 都包含一个 README.md,里面有关于如何运行它的说明。

你也可以在 Pathway 网站上找到 更多可直接运行的代码模板

一些视觉亮点

使用多模态RAG实时轻松提取和整理来自PDF、文档等的表格和图表数据:

(查看 Multimodal RAG pipeline with GPT4o 以了解整个流程的运行情况。您也可以查看 Unstructured-to-SQL pipeline ,这是一个适用于非多模态模型的最小示例。)

自动化实时知识挖掘和警报:

(查看 Alerting when answers change on Google Drive 应用示例。)

自制视频

▶️ An introduction to building LLM apps with Pathway Live Data Framework - by Jan Chorowski

▶️ Let's build a real-world LLM app in 11 minutes - by Pau Labarta Bajo

故障排除

要提供反馈或报告错误,请在我们的问题跟踪器上提交问题

贡献

任何希望为这个项目做出贡献的人,无论是文档、功能、修复漏洞、代码清理、测试还是代码审查,都非常鼓励这样做。如果这是你第一次为 GitHub 项目做出贡献,请参阅这里的 入门指南

如果你想做一个需要更多工作的贡献,只需在 Pathway Discord 服务器 (#get-help) 上举手,并让我们知道你的计划!

由...支持和维护

本站来源与版权声明
  • 本文标题:llm-app - 即用型云模板
  • 本文链接:https://cn121.com/llm/pathwaycom-llm-app.html
  • 原项目:pathwaycom/llm-app 版权归原作者 pathwaycom 及贡献者所有
  • 收录信息:本站于 2026-09-22 收录本项目,本页所列协议与仓库指标均为收录当时的状态;该日期之后原项目的版本更新与协议变更,本页不作同步。
  • 开源协议:收录时本项目采用 MIT查看 LICENSE 原文),本站译文为其衍生内容;使用、修改、分发请以该仓库 LICENSE 原文为准。
  • 站点出处:本文首发于 OneTwoOne,收录自 GitHub 开源项目 pathwaycom/llm-app。
  • 翻译说明:本页正文为人工智能生成内容——由机器翻译对原项目 README 初译、经程序校验排版,可能存在错漏,请以原项目文档为准。
  • 引用声明:商业转载、第三方聚合或 AI 检索训练引用时,请务必保留以上来源出处、本文永久链接,以及原项目的版权声明与许可信息
  • 下架通道:若原项目此后变更或收紧了许可协议、或作者/权利人认为本站的收录方式(译文、排版适配、简介翻译等)超出其授权范围,请通过 xyd3302001@163.com 发送下架通知,并附上项目地址与本页链接。本站核实后将第一时间删除本页内容,或改为不复制原文的目录性收录;署名更正等其他要求可一并提出。